論文の概要: Detecting Hallucinations in Large Language Models via Internal Attention Divergence Signals
- arxiv url: http://arxiv.org/abs/2605.05025v1
- Date: Wed, 06 May 2026 15:21:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.902335
- Title: Detecting Hallucinations in Large Language Models via Internal Attention Divergence Signals
- Title(参考訳): 内的注意差分信号による大規模言語モデルにおける幻覚の検出
- Abstract要約: 本稿では,大規模言語モデルにおける幻覚検出のための軽量かつ単一パス不確実性定量化手法を提案する。
我々は,各注目頭部分布と一様参照分布とのKulback-Leibler偏差を測定し,これらの特徴をロジスティック回帰プローブに用いた。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We propose a lightweight and single-pass uncertainty quantification method for detecting hallucinations in Large Language Models. The method uses attention matrices to estimate uncertainty without requiring repeated sampling or external models. Specifically, we measure the Kullback-Leibler divergence between each attention head's distribution and a uniform reference distribution, and use these features in a logistic regression probe. Across multiple datasets, task types, and model families, attention divergence is highly predictive of answer correctness and performs competitively with existing uncertainty estimation methods. We find that this signal is concentrated in middle layers and on factual tokens such as named entities and numbers, suggesting that attention dynamics provides an efficient and interpretable white-box signal of model uncertainty.
- Abstract(参考訳): 本稿では,大規模言語モデルにおける幻覚検出のための軽量かつ単一パス不確実性定量化手法を提案する。
この方法は、繰り返しサンプリングや外部モデルを必要とすることなく、注意行列を用いて不確実性を推定する。
具体的には、各アテンションヘッドの分布と一様参照分布とのKulback-Leiblerのばらつきを測定し、これらの特徴をロジスティック回帰プローブに用いた。
複数のデータセット、タスクタイプ、モデルファミリーにまたがって、注意分散は回答の正しさを高い確率で予測し、既存の不確実性推定手法と競合する。
この信号は中層や名前付きエンティティや数値などの実物トークンに集中しており、アテンションダイナミクスがモデル不確実性の効率的かつ解釈可能なホワイトボックス信号を提供することを示唆している。
関連論文リスト
- Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models [53.15468578562038]
マルチモーダル大言語モデル(MLLM)のための不確実性を考慮した探索的直接参照最適化(UE-DPO)手法を提案する。
まず、与えられた画像にトークン予測を根拠にしなかったモデルの不確かさを定量化する。
次に、好ましいサンプルにおいて、視覚的に不足したトークンに対する学習のプレッシャーを高め、非推奨サンプルにおける有益な知識の過度な報酬化を緩和する。
論文 参考訳(メタデータ) (2026-05-06T13:08:12Z) - Early Decisions Matter: Proximity Bias and Initial Trajectory Shaping in Non-Autoregressive Diffusion Language Models [54.16797570104461]
拡散ベースの言語モデル (dLLMs) は自己回帰型言語モデルに代わる有望な代替品として登場した。
時間軸に沿った推論ダイナミクスを系統的に解析し, dLLMの非自己回帰復号化について検討した。
論文 参考訳(メタデータ) (2026-04-12T10:26:41Z) - An Isotropic Approach to Efficient Uncertainty Quantification with Gradient Norms [7.439615448864818]
本稿では,ニューラルネットワークの予測不確実性を定量化する軽量な手法を提案する。
予測の勾配における不確実性を表現する一階テイラー展開とパラメータ共分散に関する等方性仮定の2つの近似を用いる。
次に,各不確実性型が解答正解の予測に有用であるかどうかを,大言語モデルを用いて検討する。
論文 参考訳(メタデータ) (2026-03-31T09:13:09Z) - DynHD: Hallucination Detection for Diffusion Large Language Models via Denoising Dynamics Deviation Learning [48.77865928715759]
拡散大言語モデル (D-LLM) は自己回帰モデルに代わる有望な代替品として登場した。
幻覚は 信頼性を損なう重要な問題です
本研究では,これらのギャップを空間的(トケンシーケンス)と時間的(デノナイジングダイナミクス)の両方の観点から橋渡しするDynHDを提案する。
論文 参考訳(メタデータ) (2026-03-17T12:40:29Z) - Simple Yet Effective: An Information-Theoretic Approach to Multi-LLM Uncertainty Quantification [9.397157329808254]
MUSEは、大規模言語モデルのよく校正されたサブセットを特定し、集約するための単純な情報理論手法である。
二分予測タスクの実験では、単一モデルとナイーブアンサンブルベースラインと比較してキャリブレーションと予測性能が改善された。
論文 参考訳(メタデータ) (2025-07-09T19:13:25Z) - Improving Group Robustness on Spurious Correlation via Evidential Alignment [26.544938760265136]
ディープニューラルネットワークは、しばしば急激な相関、すなわち非因果的特徴と標的の間の表面的関連を学習し、依存する。
既存のメソッドは通常、外部のグループアノテーションや補助的な決定論的モデルを使用することでこの問題を軽減する。
偏りのあるモデルの振る舞いを理解するために不確実性定量化を利用する新しいフレームワークであるエビデンシャルアライメントを提案する。
論文 参考訳(メタデータ) (2025-06-12T22:47:21Z) - Probabilistic Contrastive Learning with Explicit Concentration on the Hypersphere [3.572499139455308]
本稿では,球面空間に表現を埋め込むことにより,不確実性を比較学習に取り入れる新たな視点を提案する。
我々は、濃度パラメータであるカッパを直接解釈可能な尺度として利用し、不確実性を明示的に定量化する。
論文 参考訳(メタデータ) (2024-05-26T07:08:13Z) - Mitigating Shortcut Learning with Diffusion Counterfactuals and Diverse Ensembles [104.60508550106618]
拡散確率モデル(DPM)を利用したアンサンブル多様化フレームワークDiffDivを提案する。
DPMは、相関した入力特徴を示すサンプルを用いて訓練しても、新しい特徴の組み合わせで画像を生成することができることを示す。
そこで本研究では,DPM誘導の多様化は,教師付き信号の追加を必要とせず,ショートカットキューへの依存を取り除くのに十分であることを示す。
論文 参考訳(メタデータ) (2023-11-23T15:47:33Z) - Decomposing Uncertainty for Large Language Models through Input Clarification Ensembling [69.83976050879318]
大規模言語モデル(LLM)では、不確実性の原因を特定することが、信頼性、信頼性、解釈可能性を改善するための重要なステップである。
本稿では,LLMのための不確実性分解フレームワークについて述べる。
提案手法は,入力に対する一連の明確化を生成し,それらをLLMに入力し,対応する予測をアンサンブルする。
論文 参考訳(メタデータ) (2023-11-15T05:58:35Z) - Learning Linear Causal Representations from Interventions under General
Nonlinear Mixing [52.66151568785088]
介入対象にアクセスできることなく、未知の単一ノード介入を考慮し、強い識別可能性を示す。
これは、ディープニューラルネットワークの埋め込みに対する非ペアの介入による因果識別性の最初の例である。
論文 参考訳(メタデータ) (2023-06-04T02:32:12Z) - Propagating Variational Model Uncertainty for Bioacoustic Call Label
Smoothing [15.929064190849665]
ベイズニューラルネットワークが計算した予測不確実性信号を用いて、モデルが訓練している自己学習タスクの学習をガイドすることに焦点を当てる。
コストのかかるモンテカルロサンプリングを選ばず、近似的な隠れ分散をエンドツーエンドに伝播する。
損失計算における不確かさの明示的利用により, 変動モデルにより予測・校正性能が向上したことを示す。
論文 参考訳(メタデータ) (2022-10-19T13:04:26Z) - The Hidden Uncertainty in a Neural Networks Activations [105.4223982696279]
ニューラルネットワークの潜在表現の分布は、アウト・オブ・ディストリビューション(OOD)データの検出に成功している。
本研究は、この分布が、モデルの不確実性と相関しているかどうかを考察し、新しい入力に一般化する能力を示す。
論文 参考訳(メタデータ) (2020-12-05T17:30:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。