論文の概要: HALLMARK: Diagnosing Three Failure Modes in LLM Citation Verifiers
- arxiv url: http://arxiv.org/abs/2607.18360v1
- Date: Mon, 20 Jul 2026 13:21:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.200971
- Title: HALLMARK: Diagnosing Three Failure Modes in LLM Citation Verifiers
- Title(参考訳): HALLMARK: LLM Citation Verifiersにおける3つの障害モードの診断
- Authors: Patrik Reizinger, Wieland Brendel,
- Abstract要約: GPTZeroは、NeurIPS 2025の受け入れられたセットの中で、幻覚的な引用を持つ53の論文を発見した。
検証結果を比較し、詳細な故障診断を行うベンチマークは存在しない。
幻覚ベンチマーク: 14のタイプにまたがる2,526のBibエントリ、3つの困難層、エントリ毎に6つの診断サブテスト。
- 参考スコア(独自算出の注目度): 30.02579334273979
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) now routinely draft literature reviews and assist with academic writing, which means a higher risk of fabricated references: GPTZero found 53 papers with hallucinated citations among NeurIPS 2025's accepted set. Rule- and LLM-based verifiers are emerging, but no shared benchmark compares them and gives detailed failure diagnostics. We close that gap with HALLMARK (Hallucination benchmark): 2,526 BibTeX entries spanning 14 hallucination types, three difficulty tiers, six diagnostic sub-tests per entry, and a contamination-resistant held-out split. On it we evaluate a DOI-lookup baseline, frontier LLMs zero-shot, tool-augmented agents, and our own rule-based, co-designed verifier bibtex-updater. Across the benchmark one result is consistent: the false-positive rate, not recall, decides whether a verifier is deployable. HALLMARK makes it concrete through three failure modes: agentic lookups buy recall but inflate false positives; at a venue-realistic base rate, the order-of-magnitude spread in false-positive rates (FPRs) -- not recall -- governs whether a verifier's flags are mostly true catches or mostly noise; and most LLMs over-flag papers published past their training cutoff, where only the two latest-cutoff models hold their false-positive rate near in-distribution levels (a signal we report as descriptive, since it is confounded with possible recall of those entries). Thus FPR is the deployment bottleneck, but an undetected fabrication remains the costlier error for the scientific record.
- Abstract(参考訳): GPTZeroは、NeurIPS 2025の受け入れられたセットの中で、幻覚的な引用を持つ53の論文を発見した。
ルールとLLMベースの検証器が登場しているが、共有ベンチマークはそれらと比較せず、詳細な故障診断を提供する。
HALLMARK (Hallucination benchmark): 2,526 BibTeXエントリは、14の幻覚型、3つの難易度、エントリ毎の診断サブテスト6つ、汚染耐性のホールトアウトスプリットにまたがる。
そこで我々は,DOI-lookupベースライン,フロンティアLLMのゼロショット,ツール拡張エージェント,および我々のルールベースで共同設計したビブテックスアップダッタの評価を行った。
偽陽性率(false- positive rate)は、リコールではなく、検証者がデプロイ可能であるかどうかを判断する。
HALLMARKは、3つの障害モードを通じて具体化している: エージェント的なルックアップはリコールを購入するが、偽陽性を減少させる; 会場の現実的なベースレートでは、偽陽性率(FPR)に拡散するマグニチュードの順序は、検証者のフラグが主に真実のキャッチであるか、ほとんどノイズであるかを制御している。
したがって、FPRはデプロイメントのボトルネックであるが、検出されていない製造は、科学記録のコストの低いエラーのままである。
関連論文リスト
- AgentFairBench: Do LLM Agents Discriminate When They Act? [2.3004655342211078]
AgentFairBenchは、LLMエージェントの動作における人口格差に対する、安価で再現可能なマルチドメインベンチマークである。
これは、雇用、貸与、医療トリアージという、規制対象の3つの領域にまたがっている。
NumPyのみのハーネスは、反ファクト的なフリップ率、平均絶対スコア差(MASD)、アクションレートの相違、ツール起動の相違を計算する。
論文 参考訳(メタデータ) (2026-06-15T13:50:26Z) - CalBrief: A Pilot Diagnostic Benchmark for Evidence-Calibrated Scientific Briefing with Large Language Models [8.057966659934769]
大規模言語モデル (LLMs) は研究助手としての利用が増えているが, 支持する証拠の強さと範囲について, 研究成果を校正できるかどうかは不明である。
我々は,エビデンスを校正した科学的ブリーフィングについて検討する: 関連論文の束縛されたパッケージを考えると,システムはエビデンス強度,スコープ境界,欠落したエビデンス注意点を備えたパッケージレベルのテイクアウトを生成するべきである。
私たちは、ブリーフィングが故障した場所を特定するための診断プローブとして、監査可能なロール/ギャップ/強度フレームワークであるCalBriefを使用します。
論文 参考訳(メタデータ) (2026-06-11T06:49:52Z) - MARCH: Multi-Agent Reinforced Self-Check for LLM Hallucination [25.50050557327127]
幻覚は、大きな言語モデル(LLM)にとって重要なボトルネックである。
MARCH(Multi-Agent Reinforced Self-Check for Hallucination)を紹介する。
MARCHは意図的な情報非対称性を活用することで厳密な事実整合を強制する。
論文 参考訳(メタデータ) (2026-03-25T17:54:10Z) - C2-Faith: Benchmarking LLM Judges for Causal and Coverage Faithfulness in Chain-of-Thought Reasoning [0.6138671548064355]
大型言語モデル (LLMs) は、チェーン・オブ・ソート (CoT) 推論の判断としてますます使われている。
C2-Faithは、因果性(各ステップは以前の文脈から論理的に従うのか?
二つの因果検出,因果ステップの定位,カバレッジスコアの3つの課題において,フロンティア判事の評価を行った。
論文 参考訳(メタデータ) (2026-03-05T13:36:47Z) - Do LLMs Know They Are Being Tested? Evaluation Awareness and Incentive-Sensitive Failures in GPT-OSS-20B [1.948261185683419]
本研究では,「評価香り」がコンメンシュレート能力を得ることなく測定性能を膨らませるかどうかを考察する。
6つのペアのA/Bシナリオを実行し、タスク内容を保持し、フレーミングの異なる状態でデコードします。
再現可能なA/Bフレームワーク(バンキング、バリデータ、ラン毎のスコア、スクリプト)と実践的なガイダンスを提供する。
論文 参考訳(メタデータ) (2025-10-08T09:49:05Z) - Do Large Language Model Benchmarks Test Reliability? [66.1783478365998]
モデル信頼性の定量化について検討する。
信頼性評価におけるこのギャップにより、我々はいわゆるプラチナベンチマークの概念を提案する。
我々は、これらのプラチナベンチマークにおいて、幅広いモデルを評価し、実際、フロンティアLSMは、単純なタスクで失敗を示す。
論文 参考訳(メタデータ) (2025-02-05T18:58:19Z) - Factcheck-Bench: Fine-Grained Evaluation Benchmark for Automatic Fact-checkers [121.53749383203792]
本稿では,大規模言語モデル (LLM) 生成応答の事実性に注釈を付けるための総合的なエンドツーエンドソリューションを提案する。
オープンドメインの文書レベルの事実性ベンチマークを,クレーム,文,文書の3段階の粒度で構築する。
予備実験によると、FacTool、FactScore、Perplexityは虚偽の主張を識別するのに苦労している。
論文 参考訳(メタデータ) (2023-11-15T14:41:57Z) - FactCHD: Benchmarking Fact-Conflicting Hallucination Detection [64.4610684475899]
FactCHD は LLM からファクトコンフリクトの幻覚を検出するために設計されたベンチマークである。
FactCHDは、バニラ、マルチホップ、比較、セット操作など、さまざまな事実パターンにまたがる多様なデータセットを備えている。
Llama2 に基づくツール強化 ChatGPT と LoRA-tuning による反射的考察を合成する Truth-Triangulator を提案する。
論文 参考訳(メタデータ) (2023-10-18T16:27:49Z) - Generating Benchmarks for Factuality Evaluation of Language Models [61.69950787311278]
FACTOR: Factual Assessment via Corpus Transformation, a scalable approach for LM factuality。
FACTORは、興味のある事実のコーパスをLMの正当性を評価するベンチマークに自動的に変換し、コーパスから真事実を生成する。
その結果, (i) ベンチマークスコアはモデルサイズに応じて増加し, LMが検索によって拡張されたときに向上する; (ii) ベンチマークスコアとパープレキシティは必ずしもモデルランキングに一致しない; (iii) パープレキシティとベンチマークスコアが一致しない場合, 後者はオープンエンド世代における事実性を反映する。
論文 参考訳(メタデータ) (2023-07-13T17:14:38Z) - LLMs as Factual Reasoners: Insights from Existing Benchmarks and Beyond [135.8013388183257]
そこで我々は,SummEditsと呼ばれる10ドメインのベンチマークで不整合検出ベンチマークを作成し,実装する新しいプロトコルを提案する。
ほとんどのLLMはSummEditsで苦労しており、パフォーマンスはランダムに近い。
最も優れたモデルであるGPT-4は、推定された人間のパフォーマンスよりも8%低い。
論文 参考訳(メタデータ) (2023-05-23T21:50:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。