論文の概要: KARL: Mitigating Hallucinations in LLMs via Knowledge-Boundary-Aware Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2604.22779v1
- Date: Fri, 03 Apr 2026 11:30:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-04 02:32:14.174753
- Title: KARL: Mitigating Hallucinations in LLMs via Knowledge-Boundary-Aware Reinforcement Learning
- Title(参考訳): KARL:知識境界認識強化学習によるLLMの幻覚の軽減
- Authors: Cheng Gao, Cheng Huang, Kangyang Luo, Ziqing Qiao, Shuzheng Si, Huimin Chen, Chaojun Xiao, Maosong Sun,
- Abstract要約: KARLはLLMの棄権行動と進化する知識境界を整合させる新しいフレームワークである。
精度の高い幻覚トレードオフを実現し、分布内および分布外の両方のシナリオで高い精度を維持しながら、幻覚を効果的に抑制する。
- 参考スコア(独自算出の注目度): 46.007379982024474
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Enabling large language models (LLMs) to appropriately abstain from answering questions beyond their knowledge is crucial for mitigating hallucinations. While existing reinforcement learning methods foster autonomous abstention, they often compromise answer accuracy because their static reward mechanisms, agnostic to models' knowledge boundaries, drive models toward excessive caution. In this work, we propose KARL, a novel framework that continuously aligns an LLM's abstention behavior with its evolving knowledge boundary. KARL introduces two core innovations: a Knowledge-Boundary-Aware Reward that performs online knowledge boundary estimation using within-group response statistics, dynamically rewarding correct answers or guided abstention; and a Two-Stage RL Training Strategy that first explores the knowledge boundary and bypasses the "abstention trap", and subsequently converts incorrect answers beyond the knowledge boundary into abstentions without sacrificing accuracy. Extensive experiments on multiple benchmarks demonstrate that KARL achieves a superior accuracy-hallucination trade-off, effectively suppressing hallucinations while maintaining high accuracy across both in-distribution and out-of-distribution scenarios.
- Abstract(参考訳): 大きな言語モデル(LLM)を導入して、知識以上の質問に答えることを適切に禁ずることは、幻覚の緩和に不可欠である。
既存の強化学習手法は自律的棄権を促進するが、モデルの知識境界に依存しない静的報酬メカニズムが、過度に注意を払ってモデルを駆動するため、解答精度を損なうことが多い。
本研究では,LLMの禁忌行動と進化する知識境界を連続的に整合させる新しいフレームワークであるKARLを提案する。
KARLは、グループ内の応答統計を用いてオンライン知識境界推定を行い、正しい回答を動的に報いるか、または誘導された棄権を行う知識境界認識リワードと、まず知識境界を探索し、「拘束トラップ」をバイパスする2段階のRLトレーニング戦略を導入し、その後、知識境界を超えた誤った回答を、精度を犠牲にすることなく棄権に変換する。
複数のベンチマークでの大規模な実験により、KARLはより優れた精度・幻覚トレードオフを実現し、分布内および分布外の両方のシナリオで高い精度を維持しながら、幻覚を効果的に抑制することを示した。
関連論文リスト
- GRADE: Probing Knowledge Gaps in LLMs through Gradient Subspace Dynamics [51.647572539626715]
GRADE(Gradient Dynamics for Knowledge gap Detection)は,勾配の層間ランク比と対応する隠れ状態部分空間の層間ランク比を用いて,知識ギャップを定量化する。
6つのベンチマークでモデル名を検証し、入力摂動に対するその有効性と堅牢性を示す。
さらに, 勾配連鎖が長文解に対する知識ギャップの解釈可能な説明をいかに生み出すかを示すケーススタディを示す。
論文 参考訳(メタデータ) (2026-04-03T07:52:26Z) - Agentic Uncertainty Quantification [76.94013626702183]
本稿では,言語化された不確実性をアクティブな双方向制御信号に変換する統合されたデュアルプロセスエージェントUQ(AUQ)フレームワークを提案する。
システム1(Uncertainty-Aware Memory, UAM)とシステム2(Uncertainty-Aware Reflection, UAR)は、これらの説明を合理的な手段として利用し、必要な時にのみターゲットの推論時間解決をトリガーする。
論文 参考訳(メタデータ) (2026-01-22T07:16:26Z) - Hindsight Distillation Reasoning with Knowledge Encouragement Preference for Knowledge-based Visual Question Answering [55.368681418311894]
既存の知識に基づくビジュアル質問回答 (KBVQA) 手法は、マルチモーダルな大規模言語モデル (MLLM) における暗黙的な知識をコンテキスト内学習または検索拡張生成による明示的な知識を介して利用する。
KEPO(Knowledge Encouragement Preference Optimization)を用いたHindsight Distilled Reasoning(HinD)フレームワークを提供する。
OK-VQAとA-OKVQAの実験によりHinDの有効性が検証され、7BサイズのMLLMから推論したHinDが商用モデルAPIや外部知識を使わずに優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-11-14T10:03:23Z) - Harnessing RLHF for Robust Unanswerability Recognition and Trustworthy Response Generation in LLMs [2.217239320172707]
本稿では, 自己認識型無解性学習システム(SALU)を導入し, 生成過程に直接不解性検出を深く統合する手法を提案する。
SALUは、標準的な質問回答(QA)と、解決不可能なクエリに対する明示的な棄権生成の両方のために、マルチタスク学習フレームワークを使用して訓練されている。
ハイブリッド LLM-classifier システムを含む強力なベースラインを一貫して上回り、質問に対する正しい回答や棄却の全体的な精度を向上する。
論文 参考訳(メタデータ) (2025-07-22T18:44:18Z) - Know the Unknown: An Uncertainty-Sensitive Method for LLM Instruction Tuning [18.283963879468466]
大きな言語モデル(LLM)は目覚ましい能力を示すが、幻覚による課題に直面している。
本研究では,文脈的質問応答のための新しい2段階アプローチであるuncertainty-and-Sensitivity-Aware Tuning(US-Tuning)を紹介する。
実験の結果,US-Tuningは文脈的QAにおける誤った回答を著しく低減するだけでなく,モデルのパラメトリック知識への忠実度も向上することが示された。
論文 参考訳(メタデータ) (2024-06-14T14:56:04Z) - Rejection Improves Reliability: Training LLMs to Refuse Unknown Questions Using RL from Knowledge Feedback [14.120154004011084]
LLM(Large Language Models)はしばしば幻覚と呼ばれる誤った出力を生成する。
知識フィードバックによる強化学習(Reinforcement Learning from Knowledge Feedback, RLKF)と呼ばれる新しいアライメントフレームワークを提案する。
論文 参考訳(メタデータ) (2024-03-27T08:39:56Z) - Knowledge Verification to Nip Hallucination in the Bud [69.79051730580014]
本研究では、アライメントデータに存在する外部知識と基礎LPM内に埋め込まれた固有の知識との矛盾を検証し、最小化することにより、幻覚を緩和する可能性を示す。
本稿では,知識一貫性アライメント(KCA, Knowledge Consistent Alignment)と呼ばれる新しい手法を提案する。
6つのベンチマークで幻覚を減らし, バックボーンとスケールの異なる基礎的LCMを利用することで, KCAの優れた効果を実証した。
論文 参考訳(メタデータ) (2024-01-19T15:39:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。