論文の概要: Capability-Routed Guard: Defending Large Reasoning Models Against Reasoning-Centric Jailbreaks
- arxiv url: http://arxiv.org/abs/2608.07892v1
- Date: Sat, 08 Aug 2026 03:40:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.551223
- Title: Capability-Routed Guard: Defending Large Reasoning Models Against Reasoning-Centric Jailbreaks
- Title(参考訳): 防犯・防犯・防犯・防犯・防犯・防犯・防犯・防犯・防犯・防犯・防犯・防犯・防犯・防犯・防犯・防犯・防犯・防犯・防犯・防犯・防犯・防犯・防犯・防犯
- Abstract要約: 本稿では,大規模推論モデルのためのモデル依存型推論時ガードレールであるCapability-Routed Guard (CRG)を紹介する。
CRGリフレームは、信頼できない推論コンテキストから実行可能な意図を分離し、防御を機能ルーティング問題として促す。
これは多種多様な理性中心のジェイルブレイクを効果的に軽減し、良質なユーティリティを保持し、共通の過剰な問題を回避している。
- 参考スコア(独自算出の注目度): 6.260656015665084
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large reasoning models (LRMs) expose a new safety failure mode: adversarial prompts can manipulate reasoning context, task decomposition, or capability interpretation so that harmful objectives are processed as legitimate reasoning steps. Existing safeguards, including safety reminders, external classifiers, and self-checking wrappers, are often brittle because they either inspect the adversarial prompt directly or ask the target model to perform additional safety reasoning on the same surface that attacks exploit. We introduce Capability-Routed Guard (CRG), a model-agnostic inference-time guardrail for closed-source LRMs, where defenders cannot inspect hidden reasoning traces or modify model weights. CRG reframes prompt defense as a capability-routing problem: a side-channel controller first constructs a trusted representation of the user's authorized task, active context, safety evidence, and capability-transfer risk, separating executable intent from untrusted reasoning context. This representation supports route-specific execution, allowing CRG to block high-risk requests, constrain ambiguous ones, and forward low-risk requests through trusted active context. Finally, CRG applies TraceCheck to verify consistency with the authorized task and invokes a restricted fallback to preserve utility for low-risk benign prompts. Extensive experiments demonstrate that CRG effectively mitigates diverse reasoning-centric jailbreaks while preserving benign utility and avoiding common over-refusal issues. Further analysis shows that its components contribute complementary benefits, highlighting the importance of coordinated defense mechanisms for securing large reasoning models.
- Abstract(参考訳): 敵のプロンプトは推論コンテキスト、タスク分解、能力解釈を操作でき、有害な目的を正当な推論ステップとして処理できる。
既存の安全対策、例えば安全リマインダー、外部分類器、自己チェックラッパーは、敵のプロンプトを直接検査するか、標的モデルに攻撃する同じ表面で追加の安全推論を行うよう依頼するので、しばしば脆弱である。
本稿では,CRG(Capability-Routed Guard)を紹介した。CRG(Capability-Routed Guard)は,隠れた推論トレースを検査したり,モデルの重みを修正できない,クローズドソースLEMに対するモデルに依存しない推論時ガードレールである。
サイドチャネルコントローラは、まずユーザーの承認されたタスク、アクティブコンテキスト、安全証拠、能力伝達リスクの信頼された表現を構築し、信頼できない推論コンテキストから実行可能な意図を分離する。
この表現はルート固有の実行をサポートし、CRGは高リスクリクエストをブロックし、曖昧なリクエストを制約し、信頼されたアクティブコンテキストを通じて低リスクリクエストを転送する。
最後に、CRGはTraceCheckを適用して、承認されたタスクとの整合性を検証し、制限されたフォールバックを実行し、低リスクの良性プロンプトのユーティリティを保存する。
広範囲にわたる実験により、CRGは様々な推論中心のジェイルブレイクを効果的に軽減し、良質なユーティリティを保持し、共通の過剰な問題を回避していることが示された。
さらに分析したところ、そのコンポーネントは相補的な利点をもたらし、大きな推論モデルを確保するための協調防御機構の重要性を強調している。
関連論文リスト
- Operational Hallucination and Safety Drift in AI Agents [0.3823356975862005]
ツール使用自律エージェントのプランナーとして機能する大規模言語モデル(LLM)は、マルチターン実行における動的信頼性のリスクを導入する。
本稿では,複数のLLM(Safety Drift)とOperational Hallucination(Operational Hallucination)の2つの障害モードを実証的に特徴付ける。
本稿では、インテント-アクション整合性チェック、状態追跡、強制終了プリミティブを組み込んだ、軽量でプラグ&プレイのアーキテクチャ青写真であるAction-Aware Supervision Layerを提案する。
論文 参考訳(メタデータ) (2026-07-20T17:01:50Z) - Internalizing Safety Understanding in Large Reasoning Models via Verification [33.2377930782685]
本稿では,安全確認タスクにのみ焦点をあてた LRM のトレーニングにより,安全性仕様を内部化するフレームワークを提案する。
検証の学習は、応答安全性の強力な一般化を誘導し、ドメイン外ジェイルブレイクに対する堅牢性を著しく向上させることを示した。
論文 参考訳(メタデータ) (2026-05-09T13:05:00Z) - TraceGuard: Process-Guided Firewall against Reasoning Backdoors in Large Language Models [19.148124494194317]
我々は,小規模モデルを堅牢な推論ファイアウォールに変換するプロセス誘導型セキュリティフレームワークであるTraceGuardを提案する。
提案手法は,推理トレースを信頼できないペイロードとして扱い,詳細な防衛戦略を確立する。
グレーボックス設定における適応的敵に対する堅牢性を実証し、TraceGuardを実用的で低レイテンシなセキュリティプリミティブとして確立する。
論文 参考訳(メタデータ) (2026-03-02T22:19:13Z) - RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic [56.38397499463889]
視覚言語モデル(VLM)を利用するエージェントは、複雑な現実世界のタスクを実行する能力がますます高まっている。
しかし、安全でない行動を引き起こす可能性のある危険な指示に弱いままである。
提案するRoboSafeは,実行可能述語ベースの安全ロジックを通じて,エージェントを具体化するためのランタイムセーフガードである。
論文 参考訳(メタデータ) (2025-12-24T15:01:26Z) - When Models Outthink Their Safety: Mitigating Self-Jailbreak in Large Reasoning Models with Chain-of-Guardrails [74.63933201261595]
大規模推論モデル(LRM)は複雑な推論タスクにおいて顕著な能力を示す。
LRMは、有害なコンテンツ生成やジェイルブレイク攻撃など、深刻な安全リスクに弱いままである。
安全でない推論ステップを再構成またはバックトラックするトレーニングフレームワークであるChain-of-Guardrail(CoG)を提案する。
論文 参考訳(メタデータ) (2025-10-24T09:32:25Z) - ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning [64.32925552574115]
ARMORは、jailbreak戦略を分析し、コアインテントを抽出する、大規模な言語モデルである。
ARMORは最先端の安全性能を達成し、平均有害率は0.002であり、高度な最適化ベースのジェイルブレイクに対する攻撃成功率は0.06である。
論文 参考訳(メタデータ) (2025-07-14T09:05:54Z) - To Think or Not to Think: Exploring the Unthinking Vulnerability in Large Reasoning Models [56.19026073319406]
大規模推論モデル (LRM) は、最終的な答えを生成する前に明確な推論トレースを生成することで複雑なタスクを解決するように設計されている。
LRM(Unthinking)と呼ばれる重要な脆弱性を明らかにし、特別なトークンを操作することで思考プロセスを回避できます。
本稿では,この脆弱性を悪意と有益の両方の観点から検討する。
論文 参考訳(メタデータ) (2025-02-16T10:45:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。