論文の概要: RISA: Response Inspection and Selective Actions for Refusal Calibration in Large Language Models
- arxiv url: http://arxiv.org/abs/2609.00790v1
- Date: Tue, 01 Sep 2026 06:37:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.419733
- Title: RISA: Response Inspection and Selective Actions for Refusal Calibration in Large Language Models
- Title(参考訳): RISA:大規模言語モデルにおける拒絶校正のための応答検査と選択行動
- Authors: Wenhan Chang, Tianqing Zhu, Ping Xiong, Shiyi Liao, Wanlei Zhou,
- Abstract要約: トレーニング時間アライメントは、モデルパラメータを安全データで更新することで、拒絶動作を改善するが、さらなる計算とトレーニングが必要である。
インフェルノ時間アライメントは、基礎となるモデルパラメータを更新することなく、推論中のLCMの振る舞いを変更することを目的としている。
本稿では、初期応答を検査し、ベースモデルを更新することなくエラーを選択的に修正する推論時フレームワークである、応答検査と選択行動(RISA)を提案する。
- 参考スコア(独自算出の注目度): 19.938570872083652
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reliable refusal behavior requires Large Language Models (LLMs) to reject harmful prompts with only answering benign ones. Incorrect refusal behavior can either expose users to harmful responses or prevent users from obtaining useful answers. Training-time alignment improves refusal behavior by updating model parameters with safety data, but requires additional computation and training. In contrast, inference-time alignment aims to modify LLM behavior during inference without updating the underlying model parameters. Existing inference-time methods mainly rely on in-context safety prompting, activation steering, or decoding control. However, most of them intervene without first determining whether the initial response is already appropriate, potentially altering a correct refusal or a useful answer. Effective selective intervention therefore requires identifying prompt intent beyond sensitive keywords, covering semantic variations that fixed rules may miss, and adapting the verifier to different base models. To address these challenges, we propose Response Inspection and Selective Actions (RISA), an inference-time framework that inspects the initial response and selectively corrects refusal errors without updating the base model. RISA first uses fixed contextual rules to assign refusal scores to clear cases. For unmatched cases, it derives a refusal score from the final-layer prompt hidden state using a calibrated linear probe. To adapt to different base models, RISA separately calibrates the probe score, representation-support boundary, and action thresholds. At runtime, RISA combines the prompt score with the initial refusal status and applies an action policy to intervene only when necessary. Experimental results demonstrate that RISA improves refusal reliability while largely preserving model utility, offering a practical solution for response-aware refusal calibration in LLMs.
- Abstract(参考訳): 信頼性の高い拒絶行動は、大きな言語モデル(LLM)に、有害なプロンプトを拒否することを要求する。
誤った拒絶行動は、ユーザを有害な応答に晒すか、あるいはユーザが有用な回答を得るのを防ぐことができる。
トレーニング時間アライメントは、モデルパラメータを安全データで更新することで、拒絶動作を改善するが、さらなる計算とトレーニングが必要である。
対照的に、推論時アライメントは、基礎となるモデルパラメータを更新することなく、推論中のLCMの振る舞いを変更することを目的としている。
既存の推論時の方法は、主にコンテキスト内安全性のプロンプト、アクティベーションステアリング、デコード制御に依存している。
しかし、最初の応答がすでに適切かどうかを判断することなく介入し、正しい拒絶や有用な答えを変更する可能性がある。
したがって、効果的な選択的介入は、センシティブなキーワードを超えたインテントの特定、固定ルールが見逃す可能性のあるセマンティックなバリエーションをカバーし、検証を異なるベースモデルに適応させることを必要とする。
これらの課題に対処するために,初期応答を検査し,ベースモデルを更新することなくリフレクションエラーを選択的に修正する推論時フレームワークであるResponse Inspection and Selective Actions (RISA)を提案する。
RISAはまず、明確なケースに拒絶スコアを割り当てるために、固定されたコンテキストルールを使用する。
未整合の場合、キャリブレーションされた線形プローブを用いて最終層プロンプト隠れ状態から拒絶スコアを導出する。
異なるベースモデルに適応するために、RISAはプローブスコア、表現サポート境界、アクション閾値を別々に校正する。
実行時に、RISAはプロンプトスコアと最初の拒絶ステータスを組み合わせて、必要な時にのみ介入するようにアクションポリシーを適用します。
実験結果から, RISAはモデルユーティリティを大半保存しながらリフレクションの信頼性を向上し, LLMにおけるリフレクション対応リフレクションキャリブレーションの実用的な解決策を提供することがわかった。
関連論文リスト
- CLAIM: Leading Open-domain Active Clarification of Large Language Models with Uncertainty Measurement [50.91045324738942]
CLAIMは、オープンドメイン環境でのアクティブな明確化学習のための不確実性駆動フレームワークである。
本研究では,不確実性推定とセマンティッククラスタリングと推論に基づく判断を統合したエントロピー駆動型合成データ生成パイプラインを提案する。
実験の結果,手動でラベル付けしたデータに頼ることなく,CLAIMが安定かつ一般化可能な明確化戦略を学習できることが確認された。
論文 参考訳(メタデータ) (2026-08-12T04:27:45Z) - One More Turn, Less Regret: A Regret-Based Multi-Turn Benchmark for LLMs' Clarification Policies [49.067670811577045]
本稿では,孤立した質問品質ではなく,政策行動として明確化を評価するベンチマークであるRegretBenchを紹介する。
RegretBenchは、意図的な解決、相互作用コスト、非効率な明確化、後悔を計測する。
以上の結果から,有効な明確化には有望な質問以上のものが必要であることが示唆された。
論文 参考訳(メタデータ) (2026-07-23T10:22:11Z) - OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents [74.20327254615854]
大規模言語モデルエージェントは、シーケンシャルな意思決定タスクを解決するために、推論、行動選択、観察をインターリーブする。
LLMエージェントの既存の推論時間適応法は、主にプロンプトや検索に依存している。
提案するOLIVIAは,ReAct型エージェントのための推論時行動適応フレームワークである。
論文 参考訳(メタデータ) (2026-05-11T19:28:20Z) - LEC: Linear Expectation Constraints for False-Discovery Control in Selective Prediction and Routing Systems [95.35293543918762]
大規模言語モデル(LLM)はしばしば信頼できない答えを生成するが、不確実性のある手法は誤った予測と完全に区別することができない。
我々は、この問題を、偽発見率(FDR)制御のレンズを通して解決し、全ての許容された予測のうち、エラーの割合が目標のリスクレベルを超えないことを保証する。
本稿では,線形期待制約を強制することで,選択予測を制約付き決定問題として再解釈するLECを提案する。
論文 参考訳(メタデータ) (2025-12-01T11:27:09Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - SelfJudge: Faster Speculative Decoding via Self-Supervised Judge Verification [28.63435151584449]
本稿では,対象モデルの自己監督により検証者の判断を訓練するSelfJudgeを提案する。
本手法は,トークン置換応答が本来の応答の意味を保っているかどうかを評価することによって意味保存を測定する。
論文 参考訳(メタデータ) (2025-09-26T02:21:12Z) - Variability Need Not Imply Error: The Case of Adequate but Semantically Distinct Responses [7.581259361859477]
不確実性定量化ツールは、モデルが不確実である場合の応答を拒否するために使用できます。
我々は、モデルがAdequate Responses (PROBAR)に割り当てる確率を推定する。
ProBARはアンビグニティ/オープンエンディエントネスの異なるプロンプトでセマンティックエントロピーを上回ります。
論文 参考訳(メタデータ) (2024-12-20T09:02:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。