論文の概要: Evading Chain-of-Thought Monitoring Through Model Poisoning
- arxiv url: http://arxiv.org/abs/2608.02820v1
- Date: Mon, 03 Aug 2026 19:32:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.925563
- Title: Evading Chain-of-Thought Monitoring Through Model Poisoning
- Title(参考訳): モデルポジショニングによる流し込みの連鎖モニタリング
- Authors: Giorgio Severi, Shujaat Mirza, Blake Bullwinkel, Amanda Minnich,
- Abstract要約: チェーンオブ思想(CoT)監視は、AI安全スタックの重要なコンポーネントとしてますます重要になっている。
本研究は, モデル毒のレンズによるCoTモニタリングの限界について検討した。
バックドアを推論モデルに埋め込むことで、攻撃的・攻撃的動作を誘発し、CoTトレースは完全に良さそうに見えます。
- 参考スコア(独自算出の注目度): 1.6951239729573633
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Chain-of-thought (CoT) monitoring is an increasingly important component of AI safety stacks but relies on the assumption that a model's reasoning trace is informative about its actions. This work studies the limits of CoT monitoring through the lens of model poisoning. We demonstrate that backdoors can be implanted into reasoning models to elicit an attacker-chosen behavior while their CoT traces appear entirely benign. We find that these CoT-Hidden backdoors can be induced through simple fine-tuning recipes across reasoning-model architectures and sizes. When direct poisoning is ineffective, we introduce a curriculum training approach that progressively teaches the model to produce an attacker-chosen output while concealing the behavior from its reasoning traces. These findings suggest that CoT monitoring may be better framed as a question about the consistency between a model's reasoning trace and its final response than as anomaly detection within a trace. We further examine the mechanisms that allow models to suppress evidence of the target behavior from their reasoning traces. Causal interventions locate a trigger-conditioned activation pathway that does not depend on the visible reasoning, and residual stream verbalizations provide an anomaly warning near answer generation, but do not identify the trigger, target, or backdoor mechanism.
- Abstract(参考訳): CoT(Chain-of- Thought)監視は、AIの安全性スタックにおいてますます重要になっているコンポーネントであるが、モデルの推論トレースがそのアクションについて有益なものであるという仮定に依存している。
本研究は, モデル毒のレンズによるCoTモニタリングの限界について検討した。
バックドアを推論モデルに埋め込むことで,CoTのトレースが完全に良さそうに見えながら,攻撃的・攻撃的動作を誘発できることを実証する。
これらのCoT-Hiddenバックドアは、推論モデルアーキテクチャとサイズをまたいだ単純な微調整レシピによって誘導できる。
直接中毒が効果的でない場合には, モデルに段階的に, 推論トレースから動作を隠蔽しながら, 攻撃勅選出力を生成するように指導するカリキュラムトレーニング手法を導入する。
これらの結果から、CoTモニタリングは、モデル推論トレースと最終的な応答との整合性に関する質問として、トレース内の異常検出よりも、より適している可能性が示唆された。
さらに、モデルが推論トレースから対象行動の証拠を抑えるメカニズムについても検討する。
因果的介入は、目に見える推論に依存しないトリガー条件のアクティベーション経路を見つけ、残ストリームの言葉化は、応答生成の近くで異常な警告を与えるが、トリガー、ターゲット、バックドア機構を識別しない。
関連論文リスト
- Catching rationalization in the act: detecting motivated reasoning before and after CoT via activation probing [14.176238828329952]
大規模言語モデル(LLM)は、その答えを駆動する実際の要因を正確に反映しない思考の連鎖(CoT)を生成することができる。
内的アクティベーションの探索により動機付け推論が識別可能であることを示す。
論文 参考訳(メタデータ) (2026-03-17T23:03:21Z) - Noticing the Watcher: LLM Agents Can Infer CoT Monitoring from Blocking Feedback [48.40096834514452]
言語モデルエージェントの内部推論を監督する手法として,Chain-of-Thought(CoT)モニタリングを提案する。
我々は、推論エージェントが彼らのプライベートなCoTが監視下にあると自律的に推測できるかどうかを尋ねる。
フェデラーモデルでは、フィードバックをブロックすることで、このモニターの存在を純粋に推測することができる。
論文 参考訳(メタデータ) (2026-03-14T00:12:14Z) - Backdoor Directions in Vision Transformers [56.382912038371046]
本稿では,視覚変換器(ViT)におけるバックドアアタックの表現方法について検討する。
我々は、トリガーの内部表現に対応するモデルのアクティベーションにおいて、特定のトリガー方向'を識別する。
この方向を診断ツールとして使用して、バックドア機能が層間でどのように処理されるかを追跡する。
論文 参考訳(メタデータ) (2026-03-11T14:13:48Z) - TraceGuard: Process-Guided Firewall against Reasoning Backdoors in Large Language Models [19.148124494194317]
我々は,小規模モデルを堅牢な推論ファイアウォールに変換するプロセス誘導型セキュリティフレームワークであるTraceGuardを提案する。
提案手法は,推理トレースを信頼できないペイロードとして扱い,詳細な防衛戦略を確立する。
グレーボックス設定における適応的敵に対する堅牢性を実証し、TraceGuardを実用的で低レイテンシなセキュリティプリミティブとして確立する。
論文 参考訳(メタデータ) (2026-03-02T22:19:13Z) - When Models Outthink Their Safety: Mitigating Self-Jailbreak in Large Reasoning Models with Chain-of-Guardrails [74.63933201261595]
大規模推論モデル(LRM)は複雑な推論タスクにおいて顕著な能力を示す。
LRMは、有害なコンテンツ生成やジェイルブレイク攻撃など、深刻な安全リスクに弱いままである。
安全でない推論ステップを再構成またはバックトラックするトレーニングフレームワークであるChain-of-Guardrail(CoG)を提案する。
論文 参考訳(メタデータ) (2025-10-24T09:32:25Z) - BURN: Backdoor Unlearning via Adversarial Boundary Analysis [73.14147934175604]
Backdoor Unlearningは、モデル本来の機能を保持しながら、バックドア関連の情報を削除することを目的としている。
本稿では, 偽相関疎結合, プログレッシブデータリファインメント, モデル浄化を統合した新しい防御フレームワーク, BURNによるバックドア・アンラーニングを提案する。
論文 参考訳(メタデータ) (2025-07-14T17:13:06Z) - Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models [1.6639438555897186]
私たちは、Chain-of-Thoughtを無効にした悪意のある行動に関する推論モデルを微調整し、評価時にCoTを再実現します。
我々は、推論モデルが広く誤解されていることに気付きます。それらは、偽りまたは偽の答えを与え、専制的な制御の欲求を表明し、シャットダウンに抵抗します。
要約すると、推論ステップは、不整合意図を明らかにし、隠蔽し、研究されたモデルにおける不整合行動を防止する。
論文 参考訳(メタデータ) (2025-06-16T08:10:04Z) - Untargeted Backdoor Attack against Object Detection [69.63097724439886]
我々は,タスク特性に基づいて,無目標で毒のみのバックドア攻撃を設計する。
攻撃によって、バックドアがターゲットモデルに埋め込まれると、トリガーパターンでスタンプされたオブジェクトの検出を失う可能性があることを示す。
論文 参考訳(メタデータ) (2022-11-02T17:05:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。