論文の概要: From Tokens to Semantics: Leveraging Complementary Signals for Hallucination Detection in Black-Box LLMs
- arxiv url: http://arxiv.org/abs/2609.02679v1
- Date: Wed, 02 Sep 2026 14:50:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.42134
- Title: From Tokens to Semantics: Leveraging Complementary Signals for Hallucination Detection in Black-Box LLMs
- Title(参考訳): トケスからセマンティックス:ブラックボックスLCMにおける幻覚検出のための補信号の活用
- Authors: Urja Pawar, Rajitha Ramanayake, Owen O'Neill, Nabeel Kemal, Abhishek Mandal, Houssem Chatbri, Christopher Martin,
- Abstract要約: 偽のアラームが人間の視認能力に限られているのに対して、偽のアラームはユーザーや機関に害を与える可能性がある。
ブラックボックスモデルAPIを通じてアクセス可能な2つの信号:意味エントロピーとトークンログ確率から導出される不確実性について検討する。
トークンレベルの信号をTopK法によるサンプル応答に集約することでトークンベースの不確実性検出を拡張した。
- 参考スコア(独自算出の注目度): 1.0118253437732931
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When LLMs support public-facing or high-stakes workflows, missed fabrications can harm users and institutions, while false alarms consume limited human-review capacity. When no trusted context or reference document is available, we study two signals accessible through black-box model APIs: semantic entropy, which measures disagreement among sampled response meanings, and uncertainty derived from token log-probabilities. Their failure modes can be complementary: semantic entropy becomes uninformative when responses form one semantic cluster, while token uncertainty can miss consistently confident errors. We extend token-based uncertainty detection by aggregating token-level signals across sampled responses through our TopK method, evaluate the hybrid CoCoA method, which combines target-response uncertainty with semantic dissimilarity, and propose and study two supervised methods: Gated, which routes single-cluster cases to an aggregated-token-feature classifier, and Stacked, which learns jointly from semantic uncertainty and broader token features. We evaluate seven benchmarks, including five public benchmarks (four text datasets and multimodal handwritten-cheque extraction) and two constructed benchmarks (Financial Summaries and Long-Text QA), using four language models. In our evaluation across models and datasets, Stacked gave the best performance in nearly half of the cases, while TopK and CoCoA remain competitive without supervised training labels, although their thresholds require careful calibration. No method is universally strongest. We therefore evaluate performance at false-positive-rate budgets from 1% to 15%, assess their sensitivity to generation and calibration choices, and examine variation across dataset characteristics.
- Abstract(参考訳): LLMがパブリックなワークフローやハイテイクなワークフローをサポートする場合、偽のアラームが限定的なヒューマンレビュー能力を消費するのに対して、偽のアラームはユーザーや機関に害を与える可能性がある。
信頼されたコンテキストや参照文書が得られない場合、ブラックボックスモデルAPIを通してアクセス可能な2つの信号:意味エントロピー、サンプリングされた応答の意味間の不一致を測定すること、トークンログの確率から派生した不確実性について検討する。
セマンティックエントロピーは、応答が1つのセマンティッククラスタを形成すると非形式的になり、トークンの不確実性は一貫して確実なエラーを見逃す可能性がある。
トークンベースの不確実性検出は,TopK法によるトークンレベル信号の集約により拡張し,目標応答の不確実性と意味的相違性を組み合わせたハイブリッドCoCoA手法の評価と,単一クラスタのケースを集約されたToken-Feature分類器にルーティングするGatedと,意味的不確実性とより広いトークン特徴から共同で学習するStackedの2つの教師付き手法の提案と検討を行う。
5つの公開ベンチマーク(4つのテキストデータセットとマルチモーダル手書きキー抽出)と2つの構築されたベンチマーク(Financial SummariesとLong-Text QA)を含む7つのベンチマークを4つの言語モデルを用いて評価した。
モデルやデータセットに対する評価では、Stackedが半数近いケースで最高のパフォーマンスを示しましたが、TopKとCoCoAは、教師付きトレーニングラベルなしで競争力を維持しています。
普遍的に最強の方法はない。
そこで我々は, 偽陽性率の予算における性能を1%から15%に評価し, 生成・校正選択に対する感度を評価し, データセット特性の変動について検討した。
関連論文リスト
- Clustered Self-Assessment: A Simple yet Effective Method for Uncertainty Quantification in Large Language Models [44.59799077650502]
本研究では,大規模言語モデルにおける不確実性定量化のための簡易かつ効果的な自己評価手法を提案する。
提案手法は,世代を意味的に異なるクラスタに分類し,構造化された複数選択質問の回答オプションに変換し,モデルによって割り当てられた確率を信頼度推定として利用する。
論文 参考訳(メタデータ) (2026-06-02T16:25:54Z) - LLMs Uncertainty Quantification via Adaptive Conformal Semantic Entropy [1.3254304182988286]
本稿では,アダプティブ・コンフォーマル・セマンティック・エントロピー(ACSE, Adaptive Conformal Semantic Entropy)を提案する。
我々の不確実性スコアリング機能は、同じプロンプトに対する複数の多様な応答のクラスタリングセマンティックエントロピーに基づいている。
我々のアプローチは、最先端の不確実性定量化ベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-05T20:56:11Z) - Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models [9.503036150359597]
本稿では, 応答可能な知識から回避可能な未知への遷移を測定するために, 汚染を意識したマルチゾーンベンチマークを提案する。
FLAN-T5, Qwen2.5-Instruct, Llama-3-Instruct モデルの評価を行った。
論文 参考訳(メタデータ) (2026-04-30T05:46:01Z) - Beyond Raw Detection Scores: Markov-Informed Calibration for Boosting Machine-Generated Text Detection [105.14032334647932]
機械生成テキスト(MGT)は偽情報やフィッシングなどのリスクを生じさせ、信頼性の高い検出の必要性を強調している。
MGTの統計的に区別可能な特徴を抽出するメトリックベース法は、オーバーフィットしがちな複雑なモデルベース法よりも実用的であることが多い。
本稿では,2つのコンテキスト検出スコアの関係をモデル化したマルコフ情報を用いたスコアキャリブレーション手法を提案する。
論文 参考訳(メタデータ) (2026-02-08T16:06:12Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - Token-Level Adversarial Prompt Detection Based on Perplexity Measures
and Contextual Information [67.78183175605761]
大規模言語モデルは、敵の迅速な攻撃に影響を受けやすい。
この脆弱性は、LLMの堅牢性と信頼性に関する重要な懸念を浮き彫りにしている。
トークンレベルで敵のプロンプトを検出するための新しい手法を提案する。
論文 参考訳(メタデータ) (2023-11-20T03:17:21Z) - Exploiting Sample Uncertainty for Domain Adaptive Person
Re-Identification [137.9939571408506]
各サンプルに割り当てられた擬似ラベルの信頼性を推定・活用し,ノイズラベルの影響を緩和する。
不確実性に基づく最適化は大幅な改善をもたらし、ベンチマークデータセットにおける最先端のパフォーマンスを達成します。
論文 参考訳(メタデータ) (2020-12-16T04:09:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。