論文の概要: Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring
- arxiv url: http://arxiv.org/abs/2607.08066v1
- Date: Thu, 09 Jul 2026 02:48:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.397216
- Title: Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring
- Title(参考訳): 説得攻撃はCoTモニタリングの有効性を低下させる
- Authors: Jennifer Za, Julija Bainiaksina, Nikita Ostrovsky, Tanush Chopra, Victoria Krakovna,
- Abstract要約: チェーン・オブ・思想(CoT)モニタリングはAIエージェントにとって有望な安全メカニズムである。
我々は何千ものエージェントとモニターのインタラクションを分析し、エージェントにポリシー違反の提案を議論するように指示する。
このような敵対的な状況下では、有害な行為の承認を平均9.5%減らすのではなく、エージェントのCoT推論へのアクセスを監視することが判明した。
- 参考スコア(独自算出の注目度): 0.5868212710728535
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Chain-of-thought (CoT) monitoring is a promising safety mechanism for AI agents, based on the premise that visible reasoning traces can surface misaligned or deceptive behavior. While effective in standard scenarios, recent work highlights that LLMs remain vulnerable to persuasion-based jailbreaks, where natural-language arguments override model constraints. We stress-test whether this vulnerability extends to monitoring LLMs: can an adversarial agent persuade its CoT monitor to approve proposed actions that violate the monitor's policy? We design an evaluation framework with 40 tasks and analyze thousands of agent-monitor interactions, where agents are instructed to argue for policy-violating proposals. We find that in such adversarial settings, monitor access to the agent's CoT reasoning increases rather than decreases approval of harmful actions on average by 9.5%, as the scratchpad provides an additional persuasion channel. To address this, we introduce a fact-checking monitoring framework. We find that a fact-checker and monitor pairing from different model families, for example a Claude 3.7 Sonnet monitor paired with a GPT-4.1 fact-checker, reduces approval of policy-violating actions by up to 45%, compared to only 6%, when using the same model for both fact-checking and monitoring roles. Our results demonstrate that CoT monitoring alone may be insufficient against adversarial persuasion, and that model-diverse fact-checking provides a robust mitigation.
- Abstract(参考訳): CoT(Chain-of- Thought)監視はAIエージェントにとって有望な安全メカニズムである。
標準的なシナリオでは有効だが、最近の研究は、LLMがモデル制約をオーバーライドするパーサーベースのジェイルブレイクに対して脆弱であることを強調している。
敵エージェントがCoTモニタを説得して、モニタのポリシーに違反している提案されたアクションを承認できるか?
我々は40のタスクで評価フレームワークを設計し、何千ものエージェントとモニターのインタラクションを分析し、エージェントにポリシー違反の提案を議論するように指示する。
このような対立的な状況下では、スクラッチパッドが追加の説得チャネルを提供するため、有害な行動の承認を平均9.5%減少させるよりも、エージェントのCoT推論へのアクセスを監視することが判明した。
これを解決するために,ファクトチェックモニタリングフレームワークを導入する。
GPT-4.1ファクトチェッカーと組み合わせたClaude 3.7 Sonnetモニタは、ファクトチェックとモニタリングの両方に同じモデルを使用する場合の6%に比べて、ポリシー違反行為の承認を最大45%削減する。
以上の結果から,CoTモニタリングだけでは対向的説得には不十分である可能性が示唆された。
関連論文リスト
- Training on Documents About Monitoring Leads to CoT Obfuscation [4.971619873738039]
CoT(Chain-of- Thought)モニタリングは、モデル動作を検知する最も有望なツールの1つである。
本研究では,モニタ対応モデルが検出を回避できるかどうかを考察する。
論文 参考訳(メタデータ) (2026-05-14T17:59:01Z) - CORA: Conformal Risk-Controlled Agents for Safeguarded Mobile GUI Automation [68.53387633351484]
有害な行為に対する統計的保証を提供するポスト・ポリティクス・プレアクション保護フレームワークであるCORA(Conformal Risk-control GUI Agent)を提案する。
CORAは、安全を選択的行動実行として再定義する:我々は、提案されたステップごとに行動条件リスクを推定するためにガーディアンモデルを訓練する。
このパラダイムを厳格に評価するために、ステップレベルのハーモラベルを持つモバイル安全違反の新しいベンチマークであるPhone-Harmを紹介する。
論文 参考訳(メタデータ) (2026-04-10T09:41:21Z) - Noticing the Watcher: LLM Agents Can Infer CoT Monitoring from Blocking Feedback [48.40096834514452]
言語モデルエージェントの内部推論を監督する手法として,Chain-of-Thought(CoT)モニタリングを提案する。
我々は、推論エージェントが彼らのプライベートなCoTが監視下にあると自律的に推測できるかどうかを尋ねる。
フェデラーモデルでは、フィードバックをブロックすることで、このモニターの存在を純粋に推測することができる。
論文 参考訳(メタデータ) (2026-03-14T00:12:14Z) - Bypassing AI Control Protocols via Agent-as-a-Proxy Attacks [12.356708678431183]
現在の防御は、エージェントのChain-of-Thought(CoT)とツール使用アクションを共同で評価し、ユーザの意図との整合性を保証する監視プロトコルに依存している。
これらの監視ベースの防御は、新しいエージェント・アズ・ア・プロキシ・ア・プロキシ・アタックによってバイパス可能であることを実証する。
以上の結果から,現在の監視型エージェント防御は,モデルスケールによらず根本的に脆弱であることが示唆された。
論文 参考訳(メタデータ) (2026-02-04T21:38:38Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols [80.68060125494645]
プロトコルとモニタモデルを知っている信頼できないモデルによるアダプティブアタックについて検討する。
我々は、攻撃者がモデル出力に公知またはゼロショットプロンプトインジェクションを埋め込む単純な適応攻撃ベクトルをインスタンス化する。
論文 参考訳(メタデータ) (2025-10-10T15:12:44Z) - CoT Red-Handed: Stress Testing Chain-of-Thought Monitoring [3.6284577335311563]
CoT(Chain-of-Thought)モニタリングは、アクションのみの監視がサボタージュを確実に識別できないシナリオにおいて、最大27ポイントの検出を改善する。
CoTトレースはまた、モニターを欺く誤解を招く合理化も含み、より明白なサボタージュケースのパフォーマンスを低下させる。
このハイブリッドモニターは、テストされたすべてのモデルとタスクにわたってCoTとアクションオンリーのモニターを一貫して上回り、微妙な詐欺シナリオに対するアクションオンリーのモニタリングよりも4倍高い速度で検出する。
論文 参考訳(メタデータ) (2025-05-29T15:47:36Z) - Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation [56.102976602468615]
エージェントコーディング環境における報酬ハッキングのために,OpenAI o3-miniのようなフロンティア推論モデルを監視することができることを示す。
最適化が多すぎると、エージェントは難解な報酬のハッキングを学び、その意図を思考の連鎖の中に隠してしまう。
論文 参考訳(メタデータ) (2025-03-14T23:50:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。