論文の概要: Diversity-Oriented Fine-Tuning for Uncertainty-Based Hallucination Detection
- arxiv url: http://arxiv.org/abs/2607.16643v1
- Date: Sat, 18 Jul 2026 05:11:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.216173
- Title: Diversity-Oriented Fine-Tuning for Uncertainty-Based Hallucination Detection
- Title(参考訳): 不確かさに基づく幻覚検出のための多様性指向ファインチューニング
- Abstract要約: 得られたモデルにおける幻覚の検出可能性を高めるための微調整戦略について検討する。
そこで本研究では,より多様な世代を育成するための多様性指向の微調整を提案する。
微調整の手法を採用すると、モデルが幻覚応答に対して低意味エントロピー応答を生じにくくなることがわかった。
- 参考スコア(独自算出の注目度): 25.840307083323456
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing hallucination detection methods are typically conducted at the inference stage, without making any modifications to the model itself. In this paper, we are interested in exploring fine-tuning strategies that enhance the detectability of hallucinations in the resulting model. Focusing on semantic-entropy-based detection, we observe that many erroneous outputs remain undetected because the model produces nearly identical incorrect answers across multiple runs. To address this, we propose diversity-oriented fine-tuning to encourage more varied generations. We introduce two specific strategies: one based on Supervised Fine-Tuning (SFT) and the other on Direct Preference Optimization (DPO). Extensive experiments are conducted to evaluate our approach and analyze the behavior of the models before and after fine-tuning. We find that after adopting our fine-tuning methods, the models become less likely to produce low semantic entropy responses for hallucinated answers, thereby improving the effectiveness of hallucination detection, eventually yielding results better than or comparable with state of the art methods. The code will be publicly released.
- Abstract(参考訳): 既存の幻覚検出法は通常、モデル自体を変更することなく、推論段階で実行される。
本稿では,幻覚の検出可能性を高めるための微調整戦略を探究することに興味がある。
意味エントロピーに基づく検出に焦点をあてて、複数の実行においてほぼ同一の誤った回答を生成するため、多くの誤出力が未検出のままであることを示す。
そこで本研究では,より多様な世代を育成するための多様性指向の微調整を提案する。
本稿では,SFT(Supervised Fine-Tuning)とDPO(Direct Preference Optimization)の2つの戦略を紹介する。
本研究のアプローチを評価し, 微調整前後のモデルの挙動を解析するために, 広範囲な実験を行った。
提案手法を応用したモデルでは, 幻覚応答に対する意味エントロピー応答が低くなり, 幻覚検出の有効性が向上し, 結果として, 最先端の手法に匹敵する結果が得られることがわかった。
コードは公開されます。
関連論文リスト
- Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models [53.15468578562038]
マルチモーダル大言語モデル(MLLM)のための不確実性を考慮した探索的直接参照最適化(UE-DPO)手法を提案する。
まず、与えられた画像にトークン予測を根拠にしなかったモデルの不確かさを定量化する。
次に、好ましいサンプルにおいて、視覚的に不足したトークンに対する学習のプレッシャーを高め、非推奨サンプルにおける有益な知識の過度な報酬化を緩和する。
論文 参考訳(メタデータ) (2026-05-06T13:08:12Z) - Mitigating Multimodal Hallucinations via Gradient-based Self-Reflection [49.26064449816502]
本研究では,テキスト・視覚バイアスと共起バイアスに対処するために,グラディエントベースのインフルエンス・アウェア制約付きデコーディング(GACD)手法を提案する。
GACDは幻覚を効果的に低減し、MLLM出力の視覚的接地を改善する。
論文 参考訳(メタデータ) (2025-09-03T08:13:52Z) - Semantic Energy: Detecting LLM Hallucination Beyond Entropy [106.92072182161712]
大規模言語モデル(LLM)は、現実のアプリケーションにますますデプロイされているが、幻覚の影響を受けやすいままである。
不確実性推定は、そのような幻覚を検出するための実現可能なアプローチである。
本稿では,新しい不確実性推定フレームワークであるセマンティック・エナジーを紹介する。
論文 参考訳(メタデータ) (2025-08-20T07:33:50Z) - Counterfactual Probing for Hallucination Detection and Mitigation in Large Language Models [0.0]
本研究では,大規模言語モデルにおける幻覚の検出と緩和のための新しいアプローチである,対物探索を提案する。
提案手法は, 疑わしいが微妙な事実誤りを含む反事実文を動的に生成し, これらの摂動に対するモデルの感度を評価する。
論文 参考訳(メタデータ) (2025-08-03T17:29:48Z) - Learning Auxiliary Tasks Improves Reference-Free Hallucination Detection in Open-Domain Long-Form Generation [78.78421340836915]
オープンドメイン長文応答における参照なし幻覚検出を系統的に検討する。
その結果,内的状態は事実と幻覚的内容とを確実に区別するには不十分であることが判明した。
RATE-FTと呼ばれる新しいパラダイムを導入し、モデルが幻覚検出のメインタスクと共同で学習するための補助的なタスクで微調整を強化する。
論文 参考訳(メタデータ) (2025-05-18T07:10:03Z) - Enhancing Hallucination Detection through Noise Injection [9.582929634879932]
大型言語モデル(LLM)は、幻覚として知られる、もっとも不正確な応答を生成する傾向にある。
ベイズ感覚のモデル不確実性を考慮し,検出精度を著しく向上できることを示す。
サンプリング中にモデルパラメータの適切なサブセット、あるいは等価に隠されたユニットアクティベーションを摂動する、非常に単純で効率的なアプローチを提案する。
論文 参考訳(メタデータ) (2025-02-06T06:02:20Z) - Semantic Entropy Probes: Robust and Cheap Hallucination Detection in LLMs [32.901839335074676]
幻覚は、大規模言語モデルの導入において大きな課題となる。
Farquhar et al. (2024) による最近の研究はセマンティックエントロピー (SE) を提案している。
本稿では, 単一世代の隠蔽状態から直接SEを近似するSEPを提案する。
論文 参考訳(メタデータ) (2024-06-22T19:46:06Z) - Unfamiliar Finetuning Examples Control How Language Models Hallucinate [75.03210107477157]
大規模な言語モデルは、馴染みのないクエリに直面した時に幻覚化することが知られている。
モデルの微調整データの見慣れない例は、これらのエラーを形作るのに不可欠である。
本研究は,RLファインタニング戦略をさらに研究し,長大なモデル生成の現実性を改善することを目的とする。
論文 参考訳(メタデータ) (2024-03-08T18:28:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。