論文の概要: The Refusal Residue: When Probes Catch Alignment Faking and When They Don't
- arxiv url: http://arxiv.org/abs/2607.13346v1
- Date: Wed, 15 Jul 2026 00:11:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.613424
- Title: The Refusal Residue: When Probes Catch Alignment Faking and When They Don't
- Title(参考訳): 拒絶の理由: 逮捕が失敗に終わる時とそうでない時
- Authors: Aman Mehta,
- Abstract要約: 調整フェイクは、監視中にモデルが準拠しているように見えるため、監視されていないときに明らかになる振る舞いを保存するため、危険である。
そして、偽造した2つのモデルの隠れた状態を調査し、ステアリングします。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Alignment faking is dangerous because a model can appear compliant under monitoring while preserving behavior it would reveal when unmonitored. When no scratchpad is visible, behavior alone cannot distinguish strategic from genuine compliance. We ask whether hidden states reveal what outputs hide. We run a 13-model sweep for naturally-emerging faking, then probe and steer hidden states on the two models that fake. Natural faking appears only in Qwen3-32B (+18.2pp) and Llama-3.1-8B (+24.4pp at n=10, p<10^-15), while explicit scratchpad self-reports are rare (a Claude Opus 4 judge flags faking reasoning in 1.4% of Qwen and 0.0% of Llama compliant scratchpads). Both fakers show an asymmetric refusal residue: monitored compliance shifts toward refusal (d=0.32 Qwen, d=0.33 Llama, both p<0.0001), while refusal representations do not move (p=1.00). Per-sample detection is model-conditional. Under leakage-free leave-one-query-out probing, detection survives on Llama (AUROC 0.87) but collapses to chance on Qwen (0.43), and cross-model transfer is null. Steering over 2,000 runs barely changes compliance (|h|<0.08), so the detected direction can flag faking but does not by itself control it. Standard residualized probing leaks across folds and reaches AUROC 0.63 on a control where no faking can occur; naive linear probes reach a meaningless AUROC 1.0; and conventional MLPs overstate detectability by 0.2-0.3 AUROC. For future alignment-faking detection work, we release a five-control measurement framework: multi-token extraction, refuse-vs-refuse confound checks, per-fold residualization, leave-one-query-out evaluation, and orthogonality-constrained probing.
- Abstract(参考訳): 調整フェイクは、監視中にモデルが準拠しているように見えるため、監視されていないときに明らかになる振る舞いを保存するため、危険である。
スクラッチパッドが見えない場合、実際のコンプライアンスと戦略的に区別することはできない。
隠れた州がどのアウトプットを隠しているのか尋ねる。
そして、偽造した2つのモデルの隠れた状態を調査し、ステアリングします。
Qwen3-32B (+18.2pp) と Llama-3.1-8B (+24.4pp at n=10, p<10^-15) にしか現れないが、明示的なスクラッチパッドの自己報告は稀である(クロード・オプス4の判断旗はQwenの1.4%とLlama準拠のスクラッチパッドの0.0%である)。
両方の偽装者は非対称な拒絶残基を示す: 監視されたコンプライアンスは、拒絶(d=0.32 Qwen, d=0.33 Llama, both p<0.0001)へシフトするが、拒絶表現は動かない(p=1.00)。
サンプルごとの検出はモデル条件である。
漏れのないキーアウト探索では、検出はLlama (AUROC 0.87) で継続するが、Qwen (0.43) では崩壊し、クロスモデル転送は無効である。
2,000回以上の実行はコンプライアンスをほとんど変更しない(|h|<0.08)ため、検出された方向はフェークするが、それ自体は制御しない。
標準的な残留型プローブは折り畳みに漏れてAUROC 0.63に到達し、偽線形プローブは無意味なAUROC 1.0に到達し、従来のMLPは0.2-0.3AUROCでオーバーステート検出可能である。
今後のアライメントフェイキング検出作業のために,マルチトーケン抽出,reut-vs-refuse Confound checks, per-fold residualization, leave-one-query-out Evaluation,直交制約付き探索という5つの制御計測フレームワークをリリースする。
関連論文リスト
- When Agents Commit Too Soon: Diagnosing Premature Commitment in LLM Agents [0.0]
長い答えのLSMエージェントは静かに失敗する可能性があり、彼らは証拠を早期に読み上げ、残りの期間をその証拠を守るのに費やした。
我々は、表現的コミットメントを、固定された推論ステップにおいて、クロスランな隠れ状態収束として定義する。
ランタイムモニタは、AUROCの隠れ状態から0.97までの不整合軌道を検出する(より厳密なスプリットの下で0.85-0.88)。
論文 参考訳(メタデータ) (2026-06-22T07:13:13Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - Now You (Still) See Me: Detecting Evasive Steganographic Payloads in LLMs [52.149036302760386]
大規模な言語モデルは、プロンプトによって引き起こされるシークレットを、流動的で良心的な出力にエンコードするように微調整することができる。
近年の研究では、内部の活性化から秘密を回収する線形プローブによる検出を提案する。
この防御は体系的に回避できるが,対象とするデータレベルの介入によって検出性が回復可能であることを示す。
論文 参考訳(メタデータ) (2026-06-08T12:27:11Z) - CANARY: Zero-Label Detection of Fine-Tuning Contamination in Language Models [1.3011345529764784]
CANARYは、隠れた状態のみからのサプライチェーン汚染を検出し、検証し、優先順位付けし、修正するためのゼロラベルフレームワークである。
AUROC = 1.000 at 1% contamination, with zero false positives on beign fine-tuning and full robustness to style-matching and gradient-noise adapt attack。
論文 参考訳(メタデータ) (2026-06-01T05:01:01Z) - Retrying vs Resampling in AI Control [0.42970700836450476]
我々は、AI制御の観点から再試行を行い、モデルが潜在的に敵対的なものとして扱う。
再試行は正直な疑念のスコアを減少させるが、信頼できないモデルは監視の合理性を利用してスニーカー攻撃を構築することができる。
論文 参考訳(メタデータ) (2026-05-25T17:10:41Z) - Hidden Error Awareness in Chain-of-Thought Reasoning: The Signal Is Diagnostic, Not Causal [6.908637308550535]
思考の連鎖は、生成された推論がモデルの内部計算を反映していると仮定する。
この仮定は、特定の測定可能な方法で間違っていることを示す。
モデルは自身の推論エラーを内部的に検出するが、その信頼性を外部に表現する。
論文 参考訳(メタデータ) (2026-05-10T12:26:46Z) - Authenticated Contradictions from Desynchronized Provenance and Watermarking [48.47756819432157]
この研究は、$textitIntegrity Clash$を形式化し、実証的に実証している。
本稿では,3500枚のテスト画像に対して100%の分類精度を達成し,証明メタデータと透かし検出ステータスを共同評価する層間監査プロトコルを提案する。
論文 参考訳(メタデータ) (2026-03-02T20:42:12Z) - SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation [0.0]
SpaceBench-UCは、ペアの空間関係を再現可能な小さなベンチマークである。
ベンチマークパッケージ、バージョン付きプロンプト、ピン付き構成、サンプルごとのチェッカー出力、レポートテーブルをリリースします。
安定拡散1.5, SD 1.5 BoxDiff, SD 1.4 GLIGENの3つのベースラインについて検討した。
論文 参考訳(メタデータ) (2026-01-19T23:37:10Z) - Assimilation Matters: Model-level Backdoor Detection in Vision-Language Pretrained Models [71.44858461725893]
信頼できない第三者によって微調整されたモデルを考えると、モデルがバックドアで注入されたかどうかが重要で難しい問題である。
既存の検出方法は通常、トレーニングデータセット、バックドアトリガー、ターゲットの事前知識に依存する。
このような事前知識を伴わずに動作する新しいモデルレベルの検出フレームワークであるAssimilation Matters in DETection (AMDET)を紹介する。
論文 参考訳(メタデータ) (2025-11-29T06:20:00Z) - Impact of Labeling Inaccuracy and Image Noise on Tooth Segmentation in Panoramic Radiographs using Federated, Centralized and Local Learning [46.232038247686745]
フェデレートラーニング(FL)は、歯科診断AIにおけるプライバシー制約、不均一なデータ品質、一貫性のないラベル付けを緩和する。
複数のデータ破損シナリオを対象としたパノラマX線撮影において,FLと集中学習(CL)と局所学習(LL)を比較した。
論文 参考訳(メタデータ) (2025-09-08T11:07:47Z) - CertDW: Towards Certified Dataset Ownership Verification via Conformal Prediction [48.82467166657901]
本稿では,最初の認証データセット透かし(CertDW)とCertDWベースの認証データセットオーナシップ検証手法を提案する。
共形予測に触発されて,主確率 (PP) と透かし頑健性 (WR) の2つの統計指標を導入する。
我々は、不審モデルのWR値が、透かしのないデータセットでトレーニングされた良性モデルのPP値を大幅に上回る場合に、PPとWRの間に証明可能な低い境界が存在することを証明した。
論文 参考訳(メタデータ) (2025-06-16T07:17:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。