論文の概要: The Refusal Residue: When Probes Catch Alignment Faking and When They Don't
- arxiv url: http://arxiv.org/abs/2607.13346v1
- Date: Wed, 15 Jul 2026 00:11:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.613424
- Title: The Refusal Residue: When Probes Catch Alignment Faking and When They Don't
- Title(参考訳): 拒絶の理由: 逮捕が失敗に終わる時とそうでない時
- Abstract要約: 調整フェイクは、監視中にモデルが準拠しているように見えるため、監視されていないときに明らかになる振る舞いを保存するため、危険である。
そして、偽造した2つのモデルの隠れた状態を調査し、ステアリングします。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Alignment faking is dangerous because a model can appear compliant under monitoring while preserving behavior it would reveal when unmonitored. When no scratchpad is visible, behavior alone cannot distinguish strategic from genuine compliance. We ask whether hidden states reveal what outputs hide. We run a 13-model sweep for naturally-emerging faking, then probe and steer hidden states on the two models that fake. Natural faking appears only in Qwen3-32B (+18.2pp) and Llama-3.1-8B (+24.4pp at n=10, p<10^-15), while explicit scratchpad self-reports are rare (a Claude Opus 4 judge flags faking reasoning in 1.4% of Qwen and 0.0% of Llama compliant scratchpads). Both fakers show an asymmetric refusal residue: monitored compliance shifts toward refusal (d=0.32 Qwen, d=0.33 Llama, both p<0.0001), while refusal representations do not move (p=1.00). Per-sample detection is model-conditional. Under leakage-free leave-one-query-out probing, detection survives on Llama (AUROC 0.87) but collapses to chance on Qwen (0.43), and cross-model transfer is null. Steering over 2,000 runs barely changes compliance (|h|<0.08), so the detected direction can flag faking but does not by itself control it. Standard residualized probing leaks across folds and reaches AUROC 0.63 on a control where no faking can occur; naive linear probes reach a meaningless AUROC 1.0; and conventional MLPs overstate detectability by 0.2-0.3 AUROC. For future alignment-faking detection work, we release a five-control measurement framework: multi-token extraction, refuse-vs-refuse confound checks, per-fold residualization, leave-one-query-out evaluation, and orthogonality-constrained probing.
- Abstract(参考訳): 調整フェイクは、監視中にモデルが準拠しているように見えるため、監視されていないときに明らかになる振る舞いを保存するため、危険である。
スクラッチパッドが見えない場合、実際のコンプライアンスと戦略的に区別することはできない。
隠れた州がどのアウトプットを隠しているのか尋ねる。
そして、偽造した2つのモデルの隠れた状態を調査し、ステアリングします。
Qwen3-32B (+18.2pp) と Llama-3.1-8B (+24.4pp at n=10, p<10^-15) にしか現れないが、明示的なスクラッチパッドの自己報告は稀である(クロード・オプス4の判断旗はQwenの1.4%とLlama準拠のスクラッチパッドの0.0%である)。
両方の偽装者は非対称な拒絶残基を示す: 監視されたコンプライアンスは、拒絶(d=0.32 Qwen, d=0.33 Llama, both p<0.0001)へシフトするが、拒絶表現は動かない(p=1.00)。
サンプルごとの検出はモデル条件である。
漏れのないキーアウト探索では、検出はLlama (AUROC 0.87) で継続するが、Qwen (0.43) では崩壊し、クロスモデル転送は無効である。
2,000回以上の実行はコンプライアンスをほとんど変更しない(|h|<0.08)ため、検出された方向はフェークするが、それ自体は制御しない。
標準的な残留型プローブは折り畳みに漏れてAUROC 0.63に到達し、偽線形プローブは無意味なAUROC 1.0に到達し、従来のMLPは0.2-0.3AUROCでオーバーステート検出可能である。
今後のアライメントフェイキング検出作業のために,マルチトーケン抽出,reut-vs-refuse Confound checks, per-fold residualization, leave-one-query-out Evaluation,直交制約付き探索という5つの制御計測フレームワークをリリースする。
関連論文リスト
- Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores [31.709549159768727]
多様な推論ベンチマーク間で一貫した読み出しギャップを観察する。
隠れ状態プローブは、ネイティブシークエンススコアが完全に崩壊しても正解を復号することに成功した。
以上の結果から,無作為な内部論理を隠蔽する表現障害が明らかにゼロショット推論の欠点であることが明らかとなった。
論文 参考訳(メタデータ) (2026-08-31T16:43:55Z) - Selective Disclosure of Hidden Directives in Reasoning Models: Behavioral Asymmetry and Steering [0.9474649136535703]
思考の連鎖(CoT)推論トレースは、AI監視のメカニズムとしてますます提案されている。
これは、CoTが与えられた命令に関係なく、モデルに何を指示するかを仮定する。
この仮定を2つの軸で検証する。
論文 参考訳(メタデータ) (2026-08-29T05:50:54Z) - An Omitted Mode Is a Rare Rule: The Sampling-Verification Danger Law in Continuous Code World Models [0.0]
GPT-5.xは111モードを含む合成ドローのうち105個の省略された1Dクランプを修復する。
2D領域では、ルールを回復するアーティファクトは存在しない(0/156)。
我々は、入場規則のクラスを、演奏中の全てのサンプルと正確に一致しているが、無害であることを示すので、識別性は楽器の計測可能な特性である。
論文 参考訳(メタデータ) (2026-08-18T16:09:51Z) - Excess Separability: Nuisance-Controlled Residual-Stream Probing for Benchmark Contamination Detection [0.0]
ベンチマーク汚染はn-gram重なり、可能性に基づくメンバーシップ推論、カナリア文字列と診断される。
これを行う自然な方法はうまくいかないことを示し、測定を生き残るものを特定し、それを動作させる補正が、テストされるnullよりも多くのばらつきをもたらすことを見つけます。
論文 参考訳(メタデータ) (2026-08-12T23:27:20Z) - Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair [36.56438114281786]
正しいパッチの発見と保持、検証、提出のギャップについて検討する。
我々はエビデンスバウンド型ループ契約を導出し、その機械的に強制可能なサブセットを参照実装でインスタンス化する。
論文 参考訳(メタデータ) (2026-07-27T16:05:23Z) - When Agents Commit Too Soon: Diagnosing Premature Commitment in LLM Agents [0.0]
長い答えのLSMエージェントは静かに失敗する可能性があり、彼らは証拠を早期に読み上げ、残りの期間をその証拠を守るのに費やした。
我々は、表現的コミットメントを、固定された推論ステップにおいて、クロスランな隠れ状態収束として定義する。
ランタイムモニタは、AUROCの隠れ状態から0.97までの不整合軌道を検出する(より厳密なスプリットの下で0.85-0.88)。
論文 参考訳(メタデータ) (2026-06-22T07:13:13Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - Now You (Still) See Me: Detecting Evasive Steganographic Payloads in LLMs [52.149036302760386]
大規模な言語モデルは、プロンプトによって引き起こされるシークレットを、流動的で良心的な出力にエンコードするように微調整することができる。
近年の研究では、内部の活性化から秘密を回収する線形プローブによる検出を提案する。
この防御は体系的に回避できるが,対象とするデータレベルの介入によって検出性が回復可能であることを示す。
論文 参考訳(メタデータ) (2026-06-08T12:27:11Z) - CANARY: Zero-Label Detection of Fine-Tuning Contamination in Language Models [1.3011345529764784]
CANARYは、隠れた状態のみからのサプライチェーン汚染を検出し、検証し、優先順位付けし、修正するためのゼロラベルフレームワークである。
AUROC = 1.000 at 1% contamination, with zero false positives on beign fine-tuning and full robustness to style-matching and gradient-noise adapt attack。
論文 参考訳(メタデータ) (2026-06-01T05:01:01Z) - Retrying vs Resampling in AI Control [0.42970700836450476]
我々は、AI制御の観点から再試行を行い、モデルが潜在的に敵対的なものとして扱う。
再試行は正直な疑念のスコアを減少させるが、信頼できないモデルは監視の合理性を利用してスニーカー攻撃を構築することができる。
論文 参考訳(メタデータ) (2026-05-25T17:10:41Z) - AnomalyClaw: A Universal Visual Anomaly Detection Agent via Tool-Grounded Refutation [40.254835073578484]
AnomalyClawは、トレーニング不要な視覚異常検出剤である。
異常判定を多ラウンドの給油プロセスに変換する。
単一ステップの直接推論よりも一貫したマクロAUROC改善を実現している。
論文 参考訳(メタデータ) (2026-05-11T11:40:07Z) - Hidden Error Awareness in Chain-of-Thought Reasoning: The Signal Is Diagnostic, Not Causal [6.908637308550535]
思考の連鎖は、生成された推論がモデルの内部計算を反映していると仮定する。
この仮定は、特定の測定可能な方法で間違っていることを示す。
モデルは自身の推論エラーを内部的に検出するが、その信頼性を外部に表現する。
論文 参考訳(メタデータ) (2026-05-10T12:26:46Z) - Reliable Control-Point Selection for Steering Reasoning in Large Language Models [28.288321095634128]
ステアリングベクトルは、大規模言語モデルにおける推論動作を制御するためのトレーニング不要のメカニズムを提供する。
しかし、有効なベクトルを構成するには、モデルが隠した状態にある真の行動信号を特定する必要がある。
提案手法は,全ての検出された境界が真の行動信号を符号化していることを暗黙的に仮定して,チェーンオブソートトレースのキーワードマッチングによってこれらの挙動を検出する。
本研究では,コンテキスト依存的なトリガ確率を持つ事象として固有の推論動作を形式化する確率モデルを構築し,不安定な境界が操舵信号を弱めることを示す。
論文 参考訳(メタデータ) (2026-04-02T14:48:56Z) - Authenticated Contradictions from Desynchronized Provenance and Watermarking [48.47756819432157]
この研究は、$textitIntegrity Clash$を形式化し、実証的に実証している。
本稿では,3500枚のテスト画像に対して100%の分類精度を達成し,証明メタデータと透かし検出ステータスを共同評価する層間監査プロトコルを提案する。
論文 参考訳(メタデータ) (2026-03-02T20:42:12Z) - SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation [0.0]
SpaceBench-UCは、ペアの空間関係を再現可能な小さなベンチマークである。
ベンチマークパッケージ、バージョン付きプロンプト、ピン付き構成、サンプルごとのチェッカー出力、レポートテーブルをリリースします。
安定拡散1.5, SD 1.5 BoxDiff, SD 1.4 GLIGENの3つのベースラインについて検討した。
論文 参考訳(メタデータ) (2026-01-19T23:37:10Z) - Assimilation Matters: Model-level Backdoor Detection in Vision-Language Pretrained Models [71.44858461725893]
信頼できない第三者によって微調整されたモデルを考えると、モデルがバックドアで注入されたかどうかが重要で難しい問題である。
既存の検出方法は通常、トレーニングデータセット、バックドアトリガー、ターゲットの事前知識に依存する。
このような事前知識を伴わずに動作する新しいモデルレベルの検出フレームワークであるAssimilation Matters in DETection (AMDET)を紹介する。
論文 参考訳(メタデータ) (2025-11-29T06:20:00Z) - Impact of Labeling Inaccuracy and Image Noise on Tooth Segmentation in Panoramic Radiographs using Federated, Centralized and Local Learning [46.232038247686745]
フェデレートラーニング(FL)は、歯科診断AIにおけるプライバシー制約、不均一なデータ品質、一貫性のないラベル付けを緩和する。
複数のデータ破損シナリオを対象としたパノラマX線撮影において,FLと集中学習(CL)と局所学習(LL)を比較した。
論文 参考訳(メタデータ) (2025-09-08T11:07:47Z) - CertDW: Towards Certified Dataset Ownership Verification via Conformal Prediction [48.82467166657901]
本稿では,最初の認証データセット透かし(CertDW)とCertDWベースの認証データセットオーナシップ検証手法を提案する。
共形予測に触発されて,主確率 (PP) と透かし頑健性 (WR) の2つの統計指標を導入する。
我々は、不審モデルのWR値が、透かしのないデータセットでトレーニングされた良性モデルのPP値を大幅に上回る場合に、PPとWRの間に証明可能な低い境界が存在することを証明した。
論文 参考訳(メタデータ) (2025-06-16T07:17:23Z) - Language Models Can Predict Their Own Behavior [29.566208688211876]
言語モデル(LM)は、アライメントトレーニングに従わないなど、特定の振る舞いを示すことができます。
入力トークンの内部表現だけで訓練されたプローブは、出力シーケンス全体にわたって幅広い結果の挙動を予測することができることを示す。
プローブ上に構築された早期警報システムは、脱獄を91%削減する。
論文 参考訳(メタデータ) (2025-02-18T23:13:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。