論文の概要: The First Token Knows: Single-Decode Confidence for Hallucination Detection
- arxiv url: http://arxiv.org/abs/2605.05166v1
- Date: Wed, 06 May 2026 17:34:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.966074
- Title: The First Token Knows: Single-Decode Confidence for Hallucination Detection
- Title(参考訳): 初知:幻覚検出のための単一デコード信頼
- Abstract要約: 自己整合性は、質問に対する複数のサンプル回答を生成して幻覚を検出する。
意味的自己整合性は、自然言語の推論を用いて、サンプルされた回答をクラスタリングすることでこれを改善します。
本研究は, 質問応答における意味的自己整合性よりも, 最優先の信頼度, phi_firstが優れていることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Self-consistency detects hallucinations by generating multiple sampled answers to a question and measuring agreement, but this requires repeated decoding and can be sensitive to lexical variation. Semantic self-consistency improves this by clustering sampled answers by meaning using natural language inference, but it adds both sampling cost and external inference overhead. We show that first-token confidence, phi_first, computed from the normalized entropy of the top-K logits at the first content-bearing answer token of a single greedy decode, matches or modestly exceeds semantic self-consistency on closed-book short-answer factual question answering. Across three 7-8B instruction-tuned models and two benchmarks, phi_first achieves a mean AUROC of 0.820, compared with 0.793 for semantic agreement and 0.791 for standard surface-form self-consistency. A subsumption test shows that phi_first is moderately to strongly correlated with semantic agreement, and combining the two signals yields only a small AUROC improvement over phi_first alone. These results suggest that much of the uncertainty information captured by multi-sample agreement is already available in the model's initial token distribution. We argue that phi_first should be reported as a default low-cost baseline before invoking sampling-based uncertainty estimation.
- Abstract(参考訳): 自己整合性は、質問に対する複数のサンプル回答を生成して幻覚を検出するが、繰り返し復号する必要があるため、語彙変動に敏感である。
セマンティックな自己整合性は、自然言語推論を使って、サンプリングされた回答をクラスタリングすることでこれを改善しますが、サンプリングコストと外部推論オーバーヘッドの両方を追加します。
本稿では,1つのグリージーデコードの最初の内容を含む応答トークンにおいて,トップKロジットの正規化エントロピーから計算したphi_firstが,クローズドブックの短文質問応答における意味的自己整合性より適度に優れていることを示す。
3つの7-8B命令チューニングモデルと2つのベンチマークで、phi_firstは平均AUROCが0.820であり、セマンティックアグリーメントは0.793、標準表面形状の自己整合性は0.791である。
仮定テストでは、phi_firstは意味的一致と強く相関していることを示し、この2つの信号を組み合わせることで、phi_first単独よりも小さなAUROC改善しか得られない。
これらの結果から,マルチサンプル合意によって得られた不確実性情報の多くは,モデルの初期トークン分布ですでに利用可能であることが示唆された。
我々は、サンプルベース不確実性評価を行う前に、phi_firstをデフォルトの低コストベースラインとして報告するべきであると論じる。
関連論文リスト
- Self-Commitment Latency: A Reward-Free Probe for Prompted Implicit Hacking [0.25999037208435705]
言語モデルの思考の連鎖が良さそうであるように思えると、暗黙の報酬のハッキングを監査するのは困難である。
本稿では,モデルの最終回答に対して,帰納的推論コンテキストがどの程度早くコミットするかを計測する,より弱い入出力の自己コミット遅延を提案する。
論文 参考訳(メタデータ) (2026-06-04T02:50:26Z) - SELFDOUBT: Uncertainty Quantification for Reasoning LLMs via the Hedge-to-Verify Ratio [0.038379177968040606]
言語モデル推論のための単一パス不確実性フレームワークであるSELFDOUBTを提案する。
私たちのキーシグナルであるHedge-to-Verify Ratio(HVR)は、推論トレースが不確実性マーカーを含むかどうかを検出し、もしそうであれば、明示的な自己チェック行動によってオフセットされているかどうかを検出する。
SELFDOUBTは単一の観測された推論軌道で動作し、任意のプロプライエタリなAPI上でのレイテンシとコスト制約によるデプロイメントに適している。
論文 参考訳(メタデータ) (2026-04-07T19:19:29Z) - Sharp Convergence Rates for Masked Diffusion Models [53.117058231393834]
制約を克服するオイラー法に対する全変分に基づく解析法を開発した。
その結果、スコア推定の仮定を緩和し、パラメータ依存性を改善し、収束保証を確立する。
全体としては,CTMC軌道に沿った直接テレビによる誤り分解と,FHSのためのデカップリングに基づく経路解析を導入している。
論文 参考訳(メタデータ) (2026-02-26T00:47:51Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - PCSR: Pseudo-label Consistency-Guided Sample Refinement for Noisy Correspondence Learning [17.302186298424836]
クロスモーダル検索は、意味的類似性によって異なるモダリティを整列することを目的としている。
既存の手法では、画像とテキストのペアが完全に整列していると仮定し、実データでノイズ対応を見渡すことが多い。
論文 参考訳(メタデータ) (2025-09-19T05:41:17Z) - Your Absorbing Discrete Diffusion Secretly Models the Bayesian Posterior [0.0]
フォワード汚濁分布下での期待デノイザ出力が真の後部を回復することを示す。
我々は、K個の独立な分極パスを実行し、後続手段と分散の両方を集約する推論時アンサンブルを導入する。
論文 参考訳(メタデータ) (2025-07-10T09:42:47Z) - Mitigating LLM Hallucinations via Conformal Abstention [70.83870602967625]
我々は,大言語モデルが一般ドメインでの応答をいつ無視すべきかを決定するための,原則化された手順を開発する。
我々は、幻覚率(エラー率)の厳密な理論的保証の恩恵を受けるため、共形予測手法を活用して、禁忌手順を開発する。
実験によって得られた共形禁忌法は, 種々の閉書, オープンドメイン生成質問応答データセットに, 幻覚率を確実に拘束する。
論文 参考訳(メタデータ) (2024-04-04T11:32:03Z) - Non-Stochastic CDF Estimation Using Threshold Queries [3.6576781735746513]
実験的な分布を2つの課題で推定する問題に取り組む。
まず、アルゴリズムはデータを直接観察するのではなく、サンプルについて限られた数のしきい値クエリしか要求しない。
第二に、データは独立で同一の分散であると仮定されず、代わりにサンプルを生成する任意のプロセスが可能である。
論文 参考訳(メタデータ) (2023-01-13T18:00:57Z) - Fast Entropy-Based Methods of Word-Level Confidence Estimation for
End-To-End Automatic Speech Recognition [86.21889574126878]
本研究では,フレーム単位のエントロピー値を正規化して集約し,単位単位当たりの信頼度と単語毎の信頼度を求める方法を示す。
提案手法をLibriSpeechテストセット上で評価した結果,最大フレーム当たりの信頼度推定値の最大値から,信頼度推定値の最大値の最大値の最大値の最大値の最大値の2倍,4倍の精度を示した。
論文 参考訳(メタデータ) (2022-12-16T20:27:40Z) - Consistency Regularization for Certified Robustness of Smoothed
Classifiers [89.72878906950208]
最近のランダムな平滑化技術は、最悪の$ell$-robustnessを平均ケースのロバストネスに変換することができることを示している。
その結果,スムーズな分類器の精度と信頼性の高いロバスト性とのトレードオフは,ノイズに対する予測一貫性の規則化によって大きく制御できることが判明した。
論文 参考訳(メタデータ) (2020-06-07T06:57:43Z) - Pre-training Is (Almost) All You Need: An Application to Commonsense
Reasoning [61.32992639292889]
事前学習されたトランスモデルの微調整は、一般的なNLPタスクを解決するための標準的なアプローチとなっている。
そこで本研究では,可視性ランキングタスクをフルテキスト形式でキャストする新たなスコアリング手法を提案する。
提案手法は, ランダム再起動にまたがって, より安定した学習段階を提供することを示す。
論文 参考訳(メタデータ) (2020-04-29T10:54:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。