論文の概要: D-Score: A Spectral Hidden-State Signal for Hallucination Detection in Large Language Models
- arxiv url: http://arxiv.org/abs/2607.24586v1
- Date: Mon, 27 Jul 2026 15:52:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.486686
- Title: D-Score: A Spectral Hidden-State Signal for Hallucination Detection in Large Language Models
- Title(参考訳): Dスコア:大規模言語モデルにおける幻覚検出のためのスペクトル隠れ状態信号
- Abstract要約: 大規模な言語モデルは、利用可能な証拠によってサポートされない、またはモデルの内部で表現されているように見える情報に矛盾しない、偽の流動的なテキストを生成することができる。
隠れアクティベーションの幾何からの幻覚検出について検討し、単一の前方通過から計算された単純なスペクトル統計量であるDスコアを導入する。
実験によると、D-Scoreは幻覚検出のための強力な隠れ状態信号であり、外部検証、検索ステップ、複数世代を必要としない。
- 参考スコア(独自算出の注目度): 1.2891189282516038
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models can produce fluent text that is false, unsupported by the available evidence, or inconsistent with information that appears to be internally represented by the model. We study hallucination detection from the geometry of hidden activations and introduce the D-Score, a simple spectral statistic computed from a single forward pass. For a fixed model, layer, and tolerance parameter, the D-Score counts how many singular directions of the hidden activation matrix have singular values that remain close to the leading one. We use this quantity as a hallucination score, classifying an input text as hallucinated when its D-Score is larger than a pre-defined quantity. The motivation is that, when a model processes a text that conflicts with information available in its own internal state, the hidden representation may encode both the asserted content and some form of counter-evidence, uncertainty, correction, or lack of support; this can make the hidden trajectory spread across additional singular directions. We formalize this intuition through a lightweight spectral argument and evaluate the resulting detector on FAVA-Annotation and RAGTruth. The experiments indicate that the D-Score is a strong hidden-state signal for hallucination detection, while requiring no external verifier, no retrieval step, and no multiple generations.
- Abstract(参考訳): 大規模な言語モデルは、利用可能な証拠によってサポートされない、またはモデルの内部で表現されているように見える情報に矛盾しない、偽の流動的なテキストを生成することができる。
隠れアクティベーションの幾何からの幻覚検出について検討し、単一の前方通過から計算された単純なスペクトル統計量であるDスコアを導入する。
固定モデル、層、および許容パラメータに対して、Dスコアは、隠れた活性化行列の特異な方向が、先頭の値に近い特異値を持つ回数をカウントする。
我々はこの量を幻覚スコアとして使用し、Dスコアが予め定義された量よりも大きい場合、入力テキストを幻覚として分類する。
動機は、モデルが自身の内部で利用可能な情報と矛盾するテキストを処理するとき、隠された表現は、主張された内容とある種の反証拠、不確実性、修正、サポートの欠如の両方を符号化する。
我々は、この直観を軽量なスペクトル論法で定式化し、FAVAアノテーションとRAGTruthにおける検出結果を評価する。
実験の結果、D-Scoreは幻覚検出のための強力な隠れ状態信号であり、外部検証、検索ステップ、複数世代を必要としないことがわかった。
関連論文リスト
- UniProbe: A Learnable Token-Level Hallucination Detector for Large VLMs using Multi-Structural Internal Representations [61.85916280854257]
LVLM(Large Vision-Language Models)は印象的な視覚的推論と対話機能を実現するが、視覚入力によるコンテンツサポートを幻覚させることが多い。
textbfUniProbeは軽量で統一された学習可能な検出器で、凍ったLVLMの不均一な計算トレースを1つの前方パスからモデル化する。
論文 参考訳(メタデータ) (2026-08-11T12:01:59Z) - DeMTS: Denoising Trajectories as Multivariate Time Series for Hallucination Detection in Diffusion Language Models [59.414664850109155]
拡散大言語モデル (D-LLM) はテキスト生成において有望なパラダイムとして登場してきた。
D-LLMは幻覚に弱いままであり、流動的な出力は事実的に誤った、またはサポートされていない内容を含む可能性がある。
論文 参考訳(メタデータ) (2026-07-24T06:45:43Z) - TriLens: Per-Layer Logit-Lens Entropy for White-Box Hallucination Detection [22.258009855879752]
本稿では,言語モデルにおける幻覚検出用検出器TriLensを紹介する。
どの層でも、マルチヘッドの自己注意出力、フィードフォワード出力、モデル自身のロジットレンズを通して残留ストリームを読み取る。
結果として生じる3L-次元軌道は、深さと加群をまたいだ確実性がどのように形成されるかを記述する。
論文 参考訳(メタデータ) (2026-05-31T05:48:21Z) - VCE: A zero-cost hallucination mitigation method of LVLMs via visual contrastive editing [70.82867621856968]
大きな視覚言語モデル(LVLM)は、しばしば物体幻覚(OH)に悩まされる
近年の研究では、幻覚の問題は言語の先行に起因している可能性が示唆されている。
本稿では視覚コントラスト編集(VCE)を提案する。
論文 参考訳(メタデータ) (2026-04-21T12:40:07Z) - Grounding or Guessing? Visual Signals for Detecting Hallucinations in Sign Language Translation [13.03365340564181]
幻覚は視覚言語モデルの重大な欠陥であり、手話翻訳において特に重要である。
本稿では,デコーダの視覚情報利用量を定量化するトークンレベルの信頼性尺度を提案する。
以上の結果から、信頼性は幻覚率を予測し、データセットやアーキテクチャをまたいで一般化し、視覚的劣化の下で低下することが示された。
論文 参考訳(メタデータ) (2025-10-21T09:13:46Z) - Lookback Lens: Detecting and Mitigating Contextual Hallucinations in Large Language Models Using Only Attention Maps [48.58310785625051]
大型言語モデル(LLM)は詳細を幻覚し、根拠のない回答で応答することができる。
本稿では,このような文脈的幻覚を検出するための簡単なアプローチについて述べる。
論文 参考訳(メタデータ) (2024-07-09T17:44:34Z) - Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI Feedback [40.930238150365795]
我々は,LVLM(Large Vision Language Models)における幻覚の検出と緩和について,きめ細かいAIフィードバックを用いて提案する。
プロプライエタリモデルによる小型幻覚アノテーションデータセットを生成する。
そこで本研究では,幻覚緩和モデルの訓練のための選好データセットを自動構築する検出テーマ書き換えパイプラインを提案する。
論文 参考訳(メタデータ) (2024-04-22T14:46:10Z) - Fine-grained Hallucination Detection and Editing for Language Models [109.56911670376932]
大規模言語モデル(LM)は、しばしば幻覚と呼ばれる事実的誤りを引き起こす傾向にある。
我々は,幻覚の包括的分類を導入し,幻覚が多様な形態で現れることを議論する。
本稿では, 幻覚自動検出のための新しいタスクを提案し, 新たな評価ベンチマークであるFavaBenchを構築した。
論文 参考訳(メタデータ) (2024-01-12T19:02:48Z) - AutoHall: Automated Hallucination Dataset Generation for Large Language Models [56.92068213969036]
本稿では,AutoHallと呼ばれる既存のファクトチェックデータセットに基づいて,モデル固有の幻覚データセットを自動的に構築する手法を提案する。
また,自己コントラディションに基づくゼロリソース・ブラックボックス幻覚検出手法を提案する。
論文 参考訳(メタデータ) (2023-09-30T05:20:02Z) - Mutual Information Alleviates Hallucinations in Abstractive
Summarization [73.48162198041884]
モデルが生成中の幻覚コンテンツにより多くの確率を割り当てる可能性が著しく高いという単純な基準を見いだす。
この発見は幻覚の潜在的な説明を提供する:モデルは、継続について不確実な場合には、高い限界確率のテキストを好むことをデフォルトとする。
そこで本研究では,ターゲットトークンの正当性ではなく,ソースとターゲットトークンのポイントワイドな相互情報の最適化に切り替える復号手法を提案する。
論文 参考訳(メタデータ) (2022-10-24T13:30:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。