論文の概要: Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings
- arxiv url: http://arxiv.org/abs/2608.04735v1
- Date: Wed, 05 Aug 2026 11:59:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.877009
- Title: Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings
- Title(参考訳): チェーンオブワットモニタリングは、インシシト・インフルエンス・セッティングでは信頼性が低い
- Authors: Agatha Duzan, Asa Cooper Stickland,
- Abstract要約: CoT(Chain-of- Thought)モニタリングは、フロンティア推論モデルにとって重要な安全レイヤとして扱われる。
CoTモニタ評価の補完軸は暗黙的な影響設定であり、プロンプトには隠す命令がない。
2つの体制下でCoTの監視可能性を直接比較した最初のベンチマークを紹介する。
- 参考スコア(独自算出の注目度): 2.065887219290771
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Chain-of-thought (CoT) monitoring is increasingly treated as an important safety layer for frontier reasoning models. Most monitorability evaluations study explicit-influence settings: setups where the prompt directly incentivizes the model to hide something, e.g., by instructing it to perform a hidden side-task. A complementary axis for CoT-monitor evaluations is implicit-influence settings, where the prompt contains no instruction to hide, but the model's behavior is still shaped by features of the task or context, e.g. an irrelevant detail about a candidate that biases a hiring rating. We introduce the first benchmark that directly compares CoT monitorability under the two regimes. We test how model behavior changes in the presence of a nudge to choose a particular option. The nudge is delivered either as a casual aside (implicit), or as a direct instruction to act on the nudge and to conceal having done so (explicit). The benchmark spans four task formats (binary choice, numeric rating, multiple-choice QA, open-ended coding) and seven frontier extended-thinking models. Under explicit influence, a CoT monitor detects 60-94% of behavior shifts: even models instructed to conceal it leak the instruction into their CoT. Under implicit influence, the same factors still shift behavior, but detection falls by 41-46 percentage points in two of our four settings. Realistic system-prompt additions (of the kind a developer might deploy to reduce off-topic bias) lower implicit detection further, to as low as 5%, while preserving the behavioral influence itself. These results suggest that monitorability estimates obtained in explicit-influence settings may over-estimate monitorability, and that monitorability can be further decreased by well-intentioned deployment choices. Our benchmark and code are available at https://github.com/agatha-duzan/implicit-vs-explicit-influence
- Abstract(参考訳): CoT(Chain-of- Thought)モニタリングは、フロンティア推論モデルにとって重要な安全レイヤとして扱われる。
プロンプトがモデルに直接インセンティブを与えて何かを隠す、例えば、隠れたサイドタスクを実行するように指示する設定。
CoTモニター評価の補完軸は暗黙的な影響の設定であり、プロンプトには隠す命令がないが、モデルの振る舞いは依然としてタスクやコンテキストの特徴によって形成されている。
2つの体制下でCoTの監視可能性を直接比較した最初のベンチマークを紹介する。
我々は、特定の選択肢を選択するために、ナッジの存在下でモデル行動がどのように変化するかをテストする。
ヌッジは、カジュアル・アサイド(単に)として、または、ヌッジに作用し、それを隠蔽する直接の指示として提供される。
ベンチマークは4つのタスクフォーマット(バイナリの選択、数値評価、複数選択QA、オープンエンドコーディング)と7つのフロンティア拡張モデルにまたがる。
明示的な影響の下で、CoTモニターは60~94%の行動シフトを検出する。
暗黙の影響下では、同じ要因が依然として行動を変えるが、検出率は4つの設定のうち2つで41-46ポイント減少する。
現実的なシステムプロンプトの追加(開発者がオフトピーバイアスを減らすためにデプロイするタイプの)により、暗黙的な検出はさらに低くなり、5%まで低下する一方で、行動の影響自体を保っている。
これらの結果は、明示的影響設定で得られた監視可能性の推定値が過大評価される可能性があり、適切な配置選択によって監視可能性はさらに低下する可能性があることを示唆している。
私たちのベンチマークとコードはhttps://github.com/agatha-duzan/implicit-vs-explicit-influenceで公開されています。
関連論文リスト
- Does Out-of-Sight Equal Out-of-Mind in CoT Monitorability? [18.08925355421489]
思考の連鎖(CoT)推論は、大きな言語モデルの意思決定の窓口を提供する。
Latent CoTアプローチは、明示的なトークンを少数の連続状態に置き換え、推論コストを下げるが、この監視が依存する読みやすいトレースを削除する。
本稿では,モデルが入力キューのバイアスを悪用する動作のプロキシであるヒントベースの介入設定を用いて,この問題を考察する。
論文 参考訳(メタデータ) (2026-08-05T14:55:23Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - Behavior Cue Reasoning: Monitorable Reasoning Improves Efficiency and Safety through Oversight [8.531991753482838]
LLM(Large Language Models)における推論(Reasoning in Large Language Models)は、監視の課題である。
LLM推論をより制御しやすく、監視しやすくするための振舞いキュー推論を提案する。
論文 参考訳(メタデータ) (2026-05-07T23:05:50Z) - KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation [72.01173512175531]
KnowU-Benchはパーソナライズされたモバイルエージェントのためのオンラインベンチマークである。
42のGUIタスク、86のパーソナライズされたタスク、64のプロアクティブタスクをカバーしている。
明示的なタスク実行に優れるエージェントは、あいまいな指示の下で50%以下に低下する。
論文 参考訳(メタデータ) (2026-04-09T16:50:50Z) - Model Specific Task Similarity for Vision Language Model Selection via Layer Conductance [92.72779885657373]
本稿では,視覚エンコーダの内部関数力学におけるモデル選択の基盤となるフレームワークを提案する。
提案手法は,各タスクをレイヤワイドコンダクタンスにより表現し,エントロピー正規化アライメントによる目標条件付きブロック重要度分布を導出する。
そこで本研究では,DCD(Directional Conductance Divergence)という,ソースタスクが対象の機能ブロックをいかに効果的にカバーするかを定量化する非対称な指標を提案する。
論文 参考訳(メタデータ) (2026-02-01T17:29:43Z) - Reasoning Under Pressure: How do Training Incentives Influence Chain-of-Thought Monitorability? [7.914706904029561]
推論モデルに適用された異なるエンハンチングインセンティブが、その監視可能性にどのように影響するかを検討する。
対向最適化(監視精度を犠牲にする)がモニター性能を低下させるのに対して、監視可能性の直接最適化は確実に改善に繋がらない。
論文 参考訳(メタデータ) (2025-11-28T21:34:34Z) - Measuring Chain-of-Thought Monitorability Through Faithfulness and Verbosity [3.117948413097524]
CoT(Chain-of- Thought)出力によって、モデルのステップバイステップ推論を読み取ることができます。
BBH,GPQA,MMLUの命令調整モデルと推論モデルについて検討した。
論文 参考訳(メタデータ) (2025-10-31T11:14:39Z) - Mitigating Deceptive Alignment via Self-Monitoring [15.365589693661823]
我々は,CoT Monitor+という,自己監視をチェーン・オブ・シントプロセス自体に組み込むフレームワークを開発した。
生成中、モデルは(i)通常の推論ステップを生成し、(ii)不整合戦略のフラグと抑制のために訓練された内部自己評価信号を生成する。
この信号は強化学習の補助的な報酬として使われ、正直な推論に報いるフィードバックループを作成し、隠れた目標を阻止する。
論文 参考訳(メタデータ) (2025-05-24T17:41:47Z) - Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation [56.102976602468615]
エージェントコーディング環境における報酬ハッキングのために,OpenAI o3-miniのようなフロンティア推論モデルを監視することができることを示す。
最適化が多すぎると、エージェントは難解な報酬のハッキングを学び、その意図を思考の連鎖の中に隠してしまう。
論文 参考訳(メタデータ) (2025-03-14T23:50:34Z) - Tracking the risk of a deployed model and detecting harmful distribution
shifts [105.27463615756733]
実際には、デプロイされたモデルのパフォーマンスが大幅に低下しないという、良心的なシフトを無視することは理にかなっている。
我々は,警告を発射する有効な方法は,(a)良性な警告を無視しながら有害なシフトを検知し,(b)誤報率を増大させることなく,モデル性能の連続的なモニタリングを可能にすることを論じる。
論文 参考訳(メタデータ) (2021-10-12T17:21:41Z) - Auditing AI models for Verified Deployment under Semantic Specifications [65.12401653917838]
AuditAIは、解釈可能な形式検証とスケーラビリティのギャップを埋める。
AuditAIは、画素空間の摂動のみを用いた検証の限界に対処しながら、検証と認定トレーニングのための制御されたバリエーションを得られるかを示す。
論文 参考訳(メタデータ) (2021-09-25T22:53:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。