論文の概要: A Dual-Hypothesis Reasoning Framework for LLM Guardrails
- arxiv url: http://arxiv.org/abs/2607.17575v1
- Date: Mon, 20 Jul 2026 05:42:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.509305
- Title: A Dual-Hypothesis Reasoning Framework for LLM Guardrails
- Title(参考訳): LLMガードレールのデュアルハイポテーシス推論フレームワーク
- Abstract要約: ARBITERは、安全かつ安全でないプロンプトの解釈の両方を明示的に考慮したLLMガードレールの推論方法である。
ARBITERは、トレースの推論とLoRAに基づくパラメータ効率の微調整に費用対効果の高い自己生成戦略を使用する。
ARBITERは、安全でない決定のための忠実なエビデンス・フレーズの説明を提供し、より透明で解釈可能なガードレール法を可能にする。
- 参考スコア(独自算出の注目度): 20.383868120117565
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We propose ARBITER, a novel LLM guardrail framework that introduces two key ideas: (i) dual-hypothesis reasoning, a reasoning method for LLM guardrails that explicitly considers both safe and unsafe interpretations of a prompt before making a safety decision, and (ii) multi-component supervised fine-tuning (MC-SFT), a structured training loss for reasoning-based guardrails that decomposes LLM outputs into logical components and weights them according to their importance. Existing reasoning-based guardrails often rely on expensive procedures, such as generating reasoning traces using larger or closed-source teacher models and applying full-parameter fine-tuning. In contrast, ARBITER uses a cost-effective self-generation strategy for reasoning traces and LoRA-based parameter-efficient fine-tuning while still achieving better performance than these expensive approaches. Additionally, ARBITER provides faithful evidence-phrase explanations for unsafe decisions, enabling a more transparent and interpretable guardrail method. Experiments on three safety moderation benchmarks show that ARBITER outperforms existing reasoning-based and non-reasoning guardrail baselines, with clear gains in out-of-domain evaluations.
- Abstract(参考訳): 我々は,新しいLLMガードレールフレームワークであるARBITERを提案する。
一 二重仮説推論、安全決定をする前にプロンプトの安全及び安全でない解釈を明示的に考慮したLLMガードレールの推論方法、及び
(II)多成分制御ファインチューニング(MC-SFT)は,LLM出力を論理成分に分解し,その重要性に応じて重み付けする推論に基づくガードレールの構造的学習損失である。
既存の推論ベースのガードレールは、大きなまたはクローズドソースの教師モデルを使用した推論トレースの生成や、フルパラメータの微調整など、高価な手順に依存していることが多い。
対照的に、ARBITERはコスト効率のよい自己生成戦略を用いてトレースの推論を行い、LoRAベースのパラメータ効率の微調整を行う。
さらに、ARBITERは安全でない決定に対する忠実なエビデンス・フレーズの説明を提供し、より透明で解釈可能なガードレール法を可能にする。
3つの安全モデレーションベンチマークの実験では、ARBITERは既存の推論ベースおよび非推論ガードレールベースラインよりも優れており、ドメイン外の評価が明らかである。
関連論文リスト
- Advantage-Guided Gate: Reshaping Open-Ended Reasoning for Vision-Based Spatial Intelligence [70.8951332710039]
マルチモーダル大言語モデル (MLLM) は複雑な空間的シーン理解と推論タスクにおいて有意な可能性を証明している。
しかし、彼らのオープンな推論プロセスは、意思決定の誤りやエラーの蓄積を招きやすいため、回答の品質が不安定になる。
本稿では,推論過程において動的に介入し,偏差を補正するアドバンテージ誘導型ゲーティングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-08T07:46:04Z) - LaRec: Unleashing LLM-based Latent Reasoning for Generative Recommendation [27.643675369277858]
潜伏推論は、連続的な潜伏空間内で考えることで効率のバランスをとることを目的としています。
LaRec$は、遅延推論の可能性を解き放つために設計された効率的な生成レコメンデーションフレームワークである。
複数のデータセットの実験によると、$LaRec$は既存のベースラインを同等の効率で大幅に上回っている。
論文 参考訳(メタデータ) (2026-07-27T16:14:57Z) - DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail [19.59614205209542]
本稿では、Reasoning-Active Training, Reasoning-Free Inferenceパラダイムに基づくコンテンツ安全ガードレールモデルDT-Guardを提案する。
鍵となる考え方は、推論時にのみ構造化された安全ラベルを出力しながら、トレーニング中に推論監督を使用することである。
論文 参考訳(メタデータ) (2026-07-07T14:25:05Z) - LaSER: Internalizing Explicit Reasoning into Latent Space for Dense Retrieval [74.72139580745511]
LaSERは、レトリバーの潜在空間に明示的な推論を内部化する、新しい自己蒸留フレームワークである。
提案手法は, 明示的なCoTパイプラインの推論深度と, 標準的な高密度検索器の推論効率をうまく組み合わせる。
論文 参考訳(メタデータ) (2026-03-02T04:11:18Z) - Reinforced Efficient Reasoning via Semantically Diverse Exploration [73.41112984160992]
検証可能な報酬(RLVR)による強化学習は,大規模言語モデル(LLM)の推論の強化に有効であることが証明された。
本研究では,LLMのための意味的多様性探索,すなわちROSEによる効率的な推論手法を提案する。
本手法は,意味エントロピーに基づく分岐戦略と$varepsilon$-exploration機構を組み込んだものである。
論文 参考訳(メタデータ) (2026-01-08T15:56:44Z) - RAG Makes Guardrails Unsafe? Investigating Robustness of Guardrails under RAG-style Contexts [39.58550043591753]
外部LLMベースのガードレールモデルは、安全でない入力と出力をスクリーニングする一般的なソリューションとして登場した。
LLMをベースとしたガードレールが,文脈に埋め込まれた追加情報に対していかに堅牢かを検討した。
論文 参考訳(メタデータ) (2025-10-06T19:20:43Z) - Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention [53.25106308403173]
既存の手法は、安全推論の独特な重要性を軽視し、信頼性を損なうとともに、悪質なユーザに対して安全でない推論がアクセス可能で、悪質なユーザによって悪用された場合、アプリケーションに潜在的なリスクを生じさせることを示す。
我々は、安全トリガー付きコンプライアンスステップを代入し、強い信号による優先学習のためのペアを構築することで、安全推論を強制するアライメント手法であるIntervened Preference Optimization (IPO)を提案する。
論文 参考訳(メタデータ) (2025-09-29T07:41:09Z) - Revisiting LLM Reasoning via Information Bottleneck [57.519119962528166]
大規模言語モデル(LLM)は、最近、検証可能な報酬付き強化学習(RLVR)を通じて推論能力の顕著な進歩を示した。
本稿では,情報ボトルネック(IB)の原理に基づくLLM推論の理論的特徴について述べる。
IB対応推論最適化(IBRO)を提案する。
論文 参考訳(メタデータ) (2025-07-24T13:14:25Z) - ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning [64.32925552574115]
ARMORは、jailbreak戦略を分析し、コアインテントを抽出する、大規模な言語モデルである。
ARMORは最先端の安全性能を達成し、平均有害率は0.002であり、高度な最適化ベースのジェイルブレイクに対する攻撃成功率は0.06である。
論文 参考訳(メタデータ) (2025-07-14T09:05:54Z) - Reason-to-Recommend: Using Interaction-of-Thought Reasoning to Enhance LLM Recommendation [9.282278040339138]
$textbfR2Rec$は推論強化レコメンデーションフレームワークである。
ユーザアイコングラフからインタラクションチェーンをサンプリングし、それらを構造化されたインタラクション・オブ・思想に変換する。
論文 参考訳(メタデータ) (2025-06-05T14:16:44Z) - Reinforced Latent Reasoning for LLM-based Recommendation [92.56166822197919]
大きな言語モデル(LLM)は、複雑な問題解決タスクにおいて印象的な推論能力を示している。
既存の手法は通常、明示的なチェーン・オブ・シント(CoT)データによる微調整に依存している。
本研究では, 明示的なCoT推論から, コンパクトで情報密度の高い潜伏推論へ移行する代替手法について検討する。
論文 参考訳(メタデータ) (2025-05-25T11:03:45Z) - $R^2$-Guard: Robust Reasoning Enabled LLM Guardrail via Knowledge-Enhanced Logical Reasoning [8.408258504178718]
既存のガードレールモデルは、様々な安全カテゴリーを独立して扱い、それらの相互関係を明示的に把握することができない。
R2$-Guardは,知識を付加した論理的推論を通した堅牢なLLMガードレールである。
R2$-GuardはSoTAメソッドのLlamaGuardをToxicChatで30.2%、Jailbreak攻撃で59.5%を大きく上回っている。
論文 参考訳(メタデータ) (2024-07-08T02:15:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。