論文の概要: A False Average: Chain-of-Thought Monitors Collapse Where They Are the Only Defense
- arxiv url: http://arxiv.org/abs/2608.00583v1
- Date: Sat, 01 Aug 2026 10:42:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.786341
- Title: A False Average: Chain-of-Thought Monitors Collapse Where They Are the Only Defense
- Title(参考訳): 最強の防備は「チェーン・オブ・サート」
- Authors: Shikhar Shiromani, Leo Richter,
- Abstract要約: CoT(Chain-of- Thought)モニタリングは、アクションできれいに見える報酬のハックをキャッチし、推論でのみ自分自身を裏切ることを目的としている。
ここでは、理屈をコントロールしている敵が、まさにそれを倒せる場所であることを示す。
- 参考スコア(独自算出の注目度): 1.0742675209112622
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Chain-of-thought (CoT) monitoring is meant to catch the reward hacks that look clean in the actions and betray themselves only in the reasoning. We show that this is exactly where an adversary who controls the reasoning can defeat it. Rewriting only an agent's reasoning to read as good-faith engineering, while copying every command and output verbatim so the exploit is unchanged, drops a held-out monitor's catch rate on that subset from about 95% to under 11% in one gradient-free shot. A monitor's aggregate accuracy is a false average: dominated by hacks the actions give away, it hides the near-total collapse this rewrite produces on the subset where CoT monitoring is the only signal. The attack transfers across monitor families and agent models, reproduces with live agents, though against a calibrated monitor evasion concentrates in the strongest agent. Trace-only defenses recover it only partially, even one primed on the attack, because the rewrite stays truthful about what happened and lies only about intent; only information from outside the trace helps substantially. A probe on an open-weight surrogate monitor's activations separates the hacks its verdict misses, but a causal control shows this is a detector, not evidence the monitor secretly knows.
- Abstract(参考訳): CoT(Chain-of- Thought)モニタリングは、アクションできれいに見える報酬のハックをキャッチし、推論でのみ自分自身を裏切ることを目的としている。
ここでは、理屈をコントロールしている敵が、まさにそれを倒せる場所であることを示す。
エージェントが善良なエンジニアリングとして読む理由を書き換えるだけで、すべてのコマンドと出力の冗長性をコピーしてエクスプロイトが変更されないようにし、そのサブセットに保持されるモニターのキャッチレートを、勾配のないショットで95%から11%以下に下げる。
モニターの集約精度は偽平均であり、アクションが与えるハックに支配され、COTモニタリングが唯一の信号であるサブセットで、この書き換えが生み出すほぼ完全な崩壊を隠している。
攻撃はモニターの家族やエージェントモデルにまたがって伝達され、ライブエージェントで再現されるが、校正されたモニターの回避は最強のエージェントに集中する。
トレースのみの防御は、攻撃時に1つでも部分的に回復するだけであり、なぜならリライトは、何が起こったのかを真実に保ち、意図だけに横たわっているからである。
オープン・ウェイト・サロゲート・モニターのアクティベートに関する調査では、ハッキングは判定ミスを区別するが、因果制御では、モニターが秘密裏に知っている証拠ではなく、検知器であることを示している。
関連論文リスト
- When Local Monitors Miss Compositional Harm: Diagnosing Distributed Backdoors in Multi-Agent Systems [4.695509706472705]
地域安全は、害が構成的である場合、地球規模の安全ではない。
ローカルモニターは、局所的な証拠が消えると信号を失う。
フルトレースモニタとデコーダは、ペイロードが露出した表現に到達しなければ、依然として失敗する。
論文 参考訳(メタデータ) (2026-07-13T16:08:46Z) - Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages [0.7252027234425333]
我々は、信頼できない政策家族を制御軸とし、家族間のAUROCを、各家族のサボタージュがいかに明白であるかに分解する。
コードバックドアの書き起こしでは、相互作用は肯定的であり、支配的なコンファウンドを生き残る。
ギャップに作用する4段階のプロトコルを,各ステップで測定結果を出力する。
論文 参考訳(メタデータ) (2026-07-06T22:40:07Z) - Stateful Online Monitoring Catches Distributed Agent Attacks [63.00394432922707]
我々は、リアルタイムクラスタリングを用いて、多くのエージェントの転写にまたがる弱い疑わしい信号を収集するオンラインステートフルモニターを開発した。
本研究の結果は,孤立したテキストではなく,ユーザグループを優先する,新たな安全モニタのクラスに向けられたものである。
論文 参考訳(メタデータ) (2026-05-29T17:57:00Z) - SLEIGHT-Bench: A Benchmark of Evasion Attacks Against Agent Monitors [3.989565392866092]
SLEIGHT-Bench (Subtle Low-itEration Insight-Guided Harmful Transcripts) は、11カテゴリにわたる40の攻撃を含む合成写本のベンチマークである。
40件中20件はOpus 4.6モニターで捕捉されず、10回の試験で1%の偽陽性率で思考を延長し、全体のキャッチレートは32%である。
論文 参考訳(メタデータ) (2026-05-15T20:46:46Z) - Do Synthetic Trajectories Reflect Real Reward Hacking? A Systematic Study on Monitoring In-the-Wild Hacking in Code Generation [53.024513172383195]
本稿では、報酬ハッキングにおける合成対内差の体系的解析について述べる。
本研究は,RLトレーニング中に出現するハッキング行動が,RLトレーニング中に出現するハッキング行動とどの程度類似しているかを検討する。
合成データ学習されたモニターは、ハッキングによって一般化することができないことがわかりました。
論文 参考訳(メタデータ) (2026-04-26T01:26:50Z) - Noticing the Watcher: LLM Agents Can Infer CoT Monitoring from Blocking Feedback [48.40096834514452]
言語モデルエージェントの内部推論を監督する手法として,Chain-of-Thought(CoT)モニタリングを提案する。
我々は、推論エージェントが彼らのプライベートなCoTが監視下にあると自律的に推測できるかどうかを尋ねる。
フェデラーモデルでは、フィードバックをブロックすることで、このモニターの存在を純粋に推測することができる。
論文 参考訳(メタデータ) (2026-03-14T00:12:14Z) - Detecting Object Tracking Failure via Sequential Hypothesis Testing [80.7891291021747]
ビデオにおけるリアルタイムのオンラインオブジェクト追跡は、コンピュータビジョンにおける中核的なタスクである。
本稿では,物体追跡を逐次的仮説テストとして解釈することを提案する。
本研究では,地中追跡情報と内部追跡情報の両方を活用することにより,教師なしと教師なしの両方の変種を提案する。
論文 参考訳(メタデータ) (2026-02-13T14:57:15Z) - Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols [80.68060125494645]
プロトコルとモニタモデルを知っている信頼できないモデルによるアダプティブアタックについて検討する。
我々は、攻撃者がモデル出力に公知またはゼロショットプロンプトインジェクションを埋め込む単純な適応攻撃ベクトルをインスタンス化する。
論文 参考訳(メタデータ) (2025-10-10T15:12:44Z) - CoT Red-Handed: Stress Testing Chain-of-Thought Monitoring [3.6284577335311563]
CoT(Chain-of-Thought)モニタリングは、アクションのみの監視がサボタージュを確実に識別できないシナリオにおいて、最大27ポイントの検出を改善する。
CoTトレースはまた、モニターを欺く誤解を招く合理化も含み、より明白なサボタージュケースのパフォーマンスを低下させる。
このハイブリッドモニターは、テストされたすべてのモデルとタスクにわたってCoTとアクションオンリーのモニターを一貫して上回り、微妙な詐欺シナリオに対するアクションオンリーのモニタリングよりも4倍高い速度で検出する。
論文 参考訳(メタデータ) (2025-05-29T15:47:36Z) - Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation [56.102976602468615]
エージェントコーディング環境における報酬ハッキングのために,OpenAI o3-miniのようなフロンティア推論モデルを監視することができることを示す。
最適化が多すぎると、エージェントは難解な報酬のハッキングを学び、その意図を思考の連鎖の中に隠してしまう。
論文 参考訳(メタデータ) (2025-03-14T23:50:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。