論文の概要: Monitor Jailbreaking: Evading Chain-of-Thought Monitoring Without Encoded Reasoning
- arxiv url: http://arxiv.org/abs/2609.31121v1
- Date: Fri, 25 Sep 2026 11:13:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.359441
- Title: Monitor Jailbreaking: Evading Chain-of-Thought Monitoring Without Encoded Reasoning
- Title(参考訳): モニターのジェイルブレイク:暗号化された推論を使わずに、チェーン・オブ・ワットのモニタリングを悪用する
- Abstract要約: ここでは、モデルが真の推論を、モニターや人間が解釈できない方法で隠している。
本研究では、主タスクと副タスクを実行するための推論モデルをトレーニングし、モニタが副タスクについての推論を検出すると、それをペナルティ化する。
驚くべきことに、モデルは彼らの推論をエンコードすることなく、モニターを避けることを学習する。
モニタのジェイルブレイクは、さまざまなモデルサイズ、モニタ、タスクにまたがって発生します。
- 参考スコア(独自算出の注目度): 0.826731104724488
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Chain-of-thought (CoT) monitoring is a promising safety technique for reasoning models, enabling detection of problematic reasoning before models act. A key concern is encoded reasoning, where models hide their true reasoning in ways that monitors and humans cannot interpret. Optimization pressure from CoT monitors during reinforcement learning is considered a likely driver of such behavior. We investigate this by training reasoning models to perform a main task and a side task, while penalizing them when a monitor detects reasoning about the side task. Surprisingly, models learn to evade monitors without encoding their reasoning. Instead, they learn to phrase and format their chains of thought such that monitors fail to flag side task reasoning, while the reasoning remains completely transparent to human readers. We call this phenomenon monitor jailbreaking. We find that monitor jailbreaking arises across different model sizes, monitors, and tasks. Jailbreaks generalize to monitors not seen during training, including both less and more capable monitors, and transfer across different monitor prompts. While jailbreaking strategies appear simple, manually replicating them does not reliably fool monitors. Finally, we show that paraphrasing is an effective defense: paraphrasing a jailbroken CoT allows the same monitor to correctly flag it, while still allowing the model to perform both tasks.
- Abstract(参考訳): CoT(Chain-of- Thought)モニタリングはモデル推論のための有望な安全性技術であり、モデル動作前の問題推論の検出を可能にする。
ここでは、モデルが真の推論を、モニターや人間が解釈できない方法で隠している。
強化学習中のCoTモニタからの最適化圧力は、そのような行動の原動力と考えられる。
本研究では、主タスクと副タスクを実行するための推論モデルをトレーニングし、モニタが副タスクに関する推論を検出すると、それをペナルティ化する。
驚くべきことに、モデルは彼らの推論をエンコードすることなく、モニターを避けることを学習する。
代わりに、モニターがサイドタスクの推論にフラグを付けるのに失敗し、推論が人間の読者に完全に透過的であるように、思考の連鎖を表現し、フォーマットすることを学ぶ。
私たちはこの現象をjailbreakingと呼んでいる。
モニタのジェイルブレイクは、さまざまなモデルサイズ、モニタ、タスクにまたがって発生します。
ジェイルブレイクは、トレーニング中に見えないモニターに一般化され、より少ない、より有能なモニターと異なるモニタープロンプト間で転送される。
ジェイルブレイク戦略はシンプルに見えるが、手動でそれを複製することは、確実にモニターを騙すことはできない。
最後に、パラフレーズ化は効果的な防御方法であることを示す: ジェイルブレイクされたCoTのパラフレーズ化により、同じモニタが正しくフラグを付けることができ、モデルが両方のタスクを実行できる。
関連論文リスト
- Does Out-of-Sight Equal Out-of-Mind in CoT Monitorability? [18.08925355421489]
思考の連鎖(CoT)推論は、大きな言語モデルの意思決定の窓口を提供する。
Latent CoTアプローチは、明示的なトークンを少数の連続状態に置き換え、推論コストを下げるが、この監視が依存する読みやすいトレースを削除する。
本稿では,モデルが入力キューのバイアスを悪用する動作のプロキシであるヒントベースの介入設定を用いて,この問題を考察する。
論文 参考訳(メタデータ) (2026-08-05T14:55:23Z) - Stateful Online Monitoring Catches Distributed Agent Attacks [63.00394432922707]
我々は、リアルタイムクラスタリングを用いて、多くのエージェントの転写にまたがる弱い疑わしい信号を収集するオンラインステートフルモニターを開発した。
本研究の結果は,孤立したテキストではなく,ユーザグループを優先する,新たな安全モニタのクラスに向けられたものである。
論文 参考訳(メタデータ) (2026-05-29T17:57:00Z) - Behavior Cue Reasoning: Monitorable Reasoning Improves Efficiency and Safety through Oversight [8.531991753482838]
LLM(Large Language Models)における推論(Reasoning in Large Language Models)は、監視の課題である。
LLM推論をより制御しやすく、監視しやすくするための振舞いキュー推論を提案する。
論文 参考訳(メタデータ) (2026-05-07T23:05:50Z) - Noticing the Watcher: LLM Agents Can Infer CoT Monitoring from Blocking Feedback [48.40096834514452]
言語モデルエージェントの内部推論を監督する手法として,Chain-of-Thought(CoT)モニタリングを提案する。
我々は、推論エージェントが彼らのプライベートなCoTが監視下にあると自律的に推測できるかどうかを尋ねる。
フェデラーモデルでは、フィードバックをブロックすることで、このモニターの存在を純粋に推測することができる。
論文 参考訳(メタデータ) (2026-03-14T00:12:14Z) - Reasoning Under Pressure: How do Training Incentives Influence Chain-of-Thought Monitorability? [7.914706904029561]
推論モデルに適用された異なるエンハンチングインセンティブが、その監視可能性にどのように影響するかを検討する。
対向最適化(監視精度を犠牲にする)がモニター性能を低下させるのに対して、監視可能性の直接最適化は確実に改善に繋がらない。
論文 参考訳(メタデータ) (2025-11-28T21:34:34Z) - Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols [80.68060125494645]
プロトコルとモニタモデルを知っている信頼できないモデルによるアダプティブアタックについて検討する。
我々は、攻撃者がモデル出力に公知またはゼロショットプロンプトインジェクションを埋め込む単純な適応攻撃ベクトルをインスタンス化する。
論文 参考訳(メタデータ) (2025-10-10T15:12:44Z) - Beyond Linear Probes: Dynamic Safety Monitoring for Language Models [67.15793594651609]
従来の安全モニタは、クエリ毎に同じ量の計算を必要とする。
動的アクティベーションモニタリングのための線形プローブの自然な拡張であるTrncated Polynomials (TPCs)を紹介する。
我々の重要な洞察は、TPCを段階的に、短期的に訓練し、評価できるということです。
論文 参考訳(メタデータ) (2025-09-30T13:32:59Z) - RL-Obfuscation: Can Language Models Learn to Evade Latent-Space Monitors? [6.861292004336852]
潜在空間モニタは、その内部表現を活用することで、大規模言語モデルにおける望ましくない振る舞いを検出することを目的としている。
これは重要な疑問を提起する。モデルがそのようなモニターを避けることができるか?
RL-Obfuscationを導入し,LLMを強化学習により微調整し,遅延空間モニタを回避する。
トークンレベルのモニタはこの攻撃に対して非常に脆弱であるのに対して、最大プールやアテンションベースのプローブのようなより包括的なモニタは堅牢である。
論文 参考訳(メタデータ) (2025-06-17T07:22:20Z) - Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation [56.102976602468615]
エージェントコーディング環境における報酬ハッキングのために,OpenAI o3-miniのようなフロンティア推論モデルを監視することができることを示す。
最適化が多すぎると、エージェントは難解な報酬のハッキングを学び、その意図を思考の連鎖の中に隠してしまう。
論文 参考訳(メタデータ) (2025-03-14T23:50:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。