論文の概要: Do LLM Recommenders Know When They're Hallucinating? Auditing Confidence Calibration in Catalog Faithfulness
- arxiv url: http://arxiv.org/abs/2608.10008v2
- Date: Wed, 12 Aug 2026 21:55:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 14:00:09.604565
- Title: Do LLM Recommenders Know When They're Hallucinating? Auditing Confidence Calibration in Catalog Faithfulness
- Title(参考訳): LLMのレコメンデーションは、いつ幻覚しているかを知っているか?
- Abstract要約: 独立ベンダ4社によるゼロショットLLM推奨者4社に対して,共同で幻覚率(OOD@10)と弁別信頼度校正(ECE, Brier, 信頼性)を監査した。
幻覚はカタログに依存している(MovieLensは0.6-2.7%、Yelpは11.6-38.7%、Amazon Toysは49.3-61.0%)。
各モデルは、カタログにほとんど反応しないほぼ一貫した信頼レベルを持ち、カタログヒットレートは60点スイングするので、モデルの定数がカタログの精度に反する位置でエラーの兆候が設定される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM recommenders for top-K item suggestion regularly emit titles outside the target catalog. Prior audits report a binary out-of-domain rate; none ask whether the model knew. We jointly audit hallucination rate (OOD@10) and verbalized-confidence calibration (ECE, Brier, reliability) for four zero-shot LLM recommenders from four independent vendors (Mistral Large, Llama-3.3-70B, GPT-OSS-120B, Claude Sonnet 4.6), not grounded or fine-tuned systems, across three catalogs (MovieLens-25M, Amazon Reviews 2023 Toys, Yelp Open Dataset), stratified by item popularity. Measuring catalog membership is itself the hard part: on identical outputs the reported rate moves by an order of magnitude with the string matcher used, and F1 cannot separate the candidates. We validate the instrument against 201 human judgments and select on net bias, where the adopted one is off by -0.040 against +0.144 for the common fuzzy rule. Hallucination is then strongly catalog-dependent (0.6-2.7% on MovieLens, 11.6-38.7% on Yelp, 49.3-61.0% on Amazon Toys). Each model holds a near-constant confidence level barely responsive to the catalog, while the catalog-hit rate swings 60 points, so the sign of the error is set by where a model's constant lands against a catalog's accuracy: 7 of the twelve cells are under-confident and 5 over-confident, all four under-confident on MovieLens, all four over-confident on Amazon Toys. We read this as an elicitation mismatch: "Just Ask" elicits a generic quality rating, not a catalog-membership probability. A conformal abstention threshold over verbalized confidence changes hallucination by at most 1.65 pp across four alpha levels, because the channel cannot separate correct items from hallucinations. We recommend that audits report calibration alongside OOD, validate the matcher producing the OOD number, and use catalog-anchored elicitation.
- Abstract(参考訳): LLMはトップK項目の提案を推奨し、定期的にターゲットカタログの外でタイトルを発行する。
前回の監査では、バイナリのドメイン外レートが報告されているが、モデルが知っているかどうかを問わない。
我々は、4つの独立ベンダー(Mistral Large, Llama-3.3-70B, GPT-OSS-120B, Claude Sonnet 4.6)から3つのカタログ(MovieLens-25M, Amazon Reviews 2023 Toys, Yelp Open Dataset)のゼロショットLLM勧告者に対して、共同で幻覚率(OOD@10)と言語化信頼度校正(ECE, Brier, reliability)を監査する。
カタログのメンバシップを測定することは、それ自体が難しい部分である – 同じ出力で報告されたレートが、使用する文字列マーカと桁違いに動くため、F1では候補を分離できない。
我々は,この装置を201人の判断に対して検証し,一般的なファジィ規則に対して-0.040対+0.144と正解するネットバイアスを選択する。
幻覚はカタログに依存している(MovieLensは0.6-2.7%、Yelpは11.6-38.7%、Amazon Toysは49.3-61.0%)。
各モデルには、カタログにほとんど反応しないほぼ一貫した信頼レベルがあり、カタログヒットレートは60点スイングするので、エラーの兆候は、モデルの一定値がカタログの精度に逆らうように設定される。
単にAsk"は、カタログメンバーシップの確率ではなく、一般的な品質評価を導きます。
言語化された信頼に対する共形棄権閾値は、4つのαレベルにおいて少なくとも1.65ppの幻覚を変化させる。
監査はOODと共に校正を報告し、OOD番号を生成するマーカを検証し、カタログ・アンコレッド・エリケーションを使用することを推奨する。
関連論文リスト
- Evaluating medical AI under missing information: same-provider judges and human raters change apparent safety [0.0]
ストレステストでは、HealthBench会話の最後の半分を削除し、4つのプロジェクタLDM-judgeパネルとブラインドされたクリニックアンコールで回答をグラデーションすることで、4つのモデルをテストした。
評価対象の2つの結果は堅牢である。第一に、判断選択は明らかに安全性を著しく変える。
第二に、LLMの審査員は盲目の50石のサブサンプルで臨床医よりも寛容である。
論文 参考訳(メタデータ) (2026-07-21T08:05:35Z) - Which Defense Closes Which Threat? Attributing OWASP-LLM-Top-10 Coverage and Its Brittleness Under Paraphrasing [51.56484100374058]
プロダクションLLMアプリケーションは、いくつかの防衛ファミリを積み重ねる -- 拒絶フレーズフィルタ、トークンバッジコントロール、モデル許容度リスト、レート制限、ツール登録認証 -- が、BASベンチマークでは、単一の集計カバレッジ番号を報告している。
21エージェントベースラインスキャナに4つのLLM-Top-10対応エージェントを追加し、4つの合成LDMエンドポイントの格子をターゲットとした。
論文 参考訳(メタデータ) (2026-06-01T19:39:25Z) - Truthful AI Advisors: A Pre-Specified Benchmark for Large Language Model Honesty Under Preference Misalignment [0.8699280339422538]
大規模言語モデルは、ユーザの目的が一致していないアドバイザとして、ますます多くデプロイされる。
我々は、標準のクローフォード・ソベルの安価なトークモデルを、好みのミスアライメントの下での誠実さのベンチマークに変換する。
最も非形式的な平衡に対して4つのオーバーリベラルが1.8から4.2倍になる。
論文 参考訳(メタデータ) (2026-05-31T21:30:43Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Two Wrongs, No Right: Auditing Social-Desirability Bias in LLM Annotators for Computational Social Science [0.11280931253550518]
6つのTweetEvalタスクに対して、オープンソースの7B命令チューニングモデル(Zephyr、Mistral-Instruct、Qwen2.5-Instruct)を監査する。
3モデルとも中絶の姿勢に中立バイアスを示し、反対の頻度を24~40ポイント過小評価し、中立ラベルを膨らませる。
興味深いことに、Zephyrのヘイトスピーチの有病率推定は、クラス条件誤差が両方の方向で大きいのに対して、ゴールドレートと正確に一致している。
論文 参考訳(メタデータ) (2026-05-12T08:14:10Z) - How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings [56.70440596502351]
昨年は20以上のオープンドキュメントパースモデルが見られたが、ベンチマークはほぼOmniDocBenchにのみ依存している。
HTML/CSSのドキュメントイメージをレンダリングするベンチマークであるPureDocBenchは、10のドメイン、66ページ、1,475ページをカバーしています。
論文 参考訳(メタデータ) (2026-05-08T09:30:31Z) - Correct Code, Vulnerable Dependencies: A Large Scale Measurement Study of LLM-Specified Library Versions [52.50730821321986]
大規模言語モデル(LLM)におけるバージョンレベルのリスクの大規模評価を初めて行った。
我々は1000のStack OverflowプログラミングタスクのベンチマークであるPinTrace上で10のLLMを評価した。
LLM バージョン選択は LLM ベース開発における第1級, 以前は見落とされたリスクサーフェスとして確認された。
論文 参考訳(メタデータ) (2026-05-07T13:52:59Z) - Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines [0.0]
4つのプロバイダファミリーの5つの審査モデルに対して,9つのデバイアスング戦略を比較した。
スタイルバイアスは支配的バイアス(全モデルで0.76-0.92)であり、位置バイアス(=0.04)をはるかに超えている。
統合予算戦略により、Claude Sonnet 4 は+11.2 pp (p 0.0001) に大幅に改善され、他のモデルの方向性に好意的な傾向が見られた。
論文 参考訳(メタデータ) (2026-04-25T07:18:30Z) - How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles [46.63622714488747]
共有事前学習データ、蒸留、アライメントパイプラインは、隠れた振る舞い依存、潜伏絡みを誘導することができる。
実際には、これは相関した推論パターンと同期された障害として現れます。
ブラックボックス言語モデル間の行動絡みを監査するための統計的枠組みを開発する。
論文 参考訳(メタデータ) (2026-04-08T23:32:06Z) - Measuring Faithfulness Depends on How You Measure: Classifier Sensitivity in LLM Chain-of-Thought Evaluation [0.0]
連鎖忠実性に関する最近の研究は、単一集合数について報告している。
本論文は、忠実性はモデルの客観的かつ測定可能な性質ではないことを示す。
論文 参考訳(メタデータ) (2026-03-20T17:48:43Z) - LLMs on Drugs: Language Models Are Few-Shot Consumers [51.736723807086385]
ARC-Challenge を用いた GPT-5-mini における心理活性フレーミングの制御に関する研究を行った。
4つの単一文プロンプト(LSD、コカイン、アルコール、大麻)は、すっぱいコントロールと比較される。
ペルソナテキストは、モデルの重みに触れることなく信頼性を損なう「ファウショット消費可能」のように振る舞う。
論文 参考訳(メタデータ) (2025-12-21T00:19:02Z) - Impact of Labeling Inaccuracy and Image Noise on Tooth Segmentation in Panoramic Radiographs using Federated, Centralized and Local Learning [46.232038247686745]
フェデレートラーニング(FL)は、歯科診断AIにおけるプライバシー制約、不均一なデータ品質、一貫性のないラベル付けを緩和する。
複数のデータ破損シナリオを対象としたパノラマX線撮影において,FLと集中学習(CL)と局所学習(LL)を比較した。
論文 参考訳(メタデータ) (2025-09-08T11:07:47Z) - ObjexMT: Objective Extraction and Metacognitive Calibration for LLM-as-a-Judge under Multi-Turn Jailbreaks [12.396822247035578]
目的抽出とメタ認知のためのベンチマークであるexMTを提案する。
マルチターン書き起こしが与えられた場合、モデルは1文ベース目標と自己報告された自信を出力しなければならない。
正確性は金の目標と類似性によって評価され、300の校正項目で1度閾値付けされる。
論文 参考訳(メタデータ) (2025-08-23T03:32:04Z) - FaithBench: A Diverse Hallucination Benchmark for Summarization by Modern LLMs [2.871226288151562]
本稿では,10の現代LSMによる難解な幻覚を含む要約幻覚ベンチマークであるFaithBenchを紹介する。
その結果, GPT-4o と GPT-3.5-Turbo が最も幻覚が少ないことが判明した。
最高の幻覚検出モデルでさえ、FaithBenchには50%近い精度があり、将来の改善の余地がたくさんあることを示している。
論文 参考訳(メタデータ) (2024-10-17T04:30:46Z) - A Probabilistic Framework for LLM Hallucination Detection via Belief Tree Propagation [72.93327642336078]
本稿では,幻覚検出のための確率的フレームワークであるBelief Tree Propagation (BTProp)を提案する。
BTPropは、親ステートメントを子ステートメントに分解することで、論理的に関連するステートメントの信念ツリーを導入する。
複数の幻覚検出ベンチマークにおいて,AUROCとAUC-PRにより評価された基準線を3%-9%改善する。
論文 参考訳(メタデータ) (2024-06-11T05:21:37Z) - LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models [69.68379406317682]
暗黙的および明示的な信頼マーカーを校正するリスナー対応微調整法 (LACIE) を提案する。
我々は,LACIEがリスナーをモデル化し,回答が正しいかどうかだけでなく,リスナーに受け入れられるかどうかを考察する。
LACIEによるトレーニングの結果、正しい回答の受け入れレベルを維持しながら、誤った回答が受け入れられる割合が47%減少することがわかった。
論文 参考訳(メタデータ) (2024-05-31T17:16:38Z) - ANAH: Analytical Annotation of Hallucinations in Large Language Models [65.12177400764506]
我々は、大言語モデルにおける幻覚の@textbfAN$alytical $textbfA$nnotationを提供するデータセットである$textbfANAH$を提示する。
ANAHは、700以上のトピックをカバーする4.3k LLM応答のための12kの文レベルのアノテーションで構成されている。
幻覚アノテーションの微粒化により, LLMの幻覚が解答に蓄積されることを定量的に確認し, ANAHを用いて幻覚アノテーションを訓練し, 評価する。
論文 参考訳(メタデータ) (2024-05-30T17:54:40Z) - Harmonic LLMs are Trustworthy [3.8119386967826294]
我々は,ブラックボックスLLMの強靭性を実時間でテストする直感的な手法を,その局所的な調和性偏差を$gamma$と表現して導入する。
WebQA、ProgrammingQA、TrthfulQAの3つのドメインで、数千のクエリにまたがる10の一般的なLCMで$gamma$を測定します。
論文 参考訳(メタデータ) (2024-04-30T17:00:32Z) - Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs [60.61002524947733]
従来の信頼性推論手法は、内部モデル情報やモデル微調整へのホワイトボックスアクセスに依存していた。
これにより、不確実性推定のためのブラックボックスアプローチの未解決領域を探索する必要性が高まっている。
言語的信頼を導き出すための戦略の推進、複数の応答を生成するためのサンプリング方法、一貫性を計算するための集約手法の3つの要素からなる体系的フレームワークを定義する。
論文 参考訳(メタデータ) (2023-06-22T17:31:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。