論文の概要: The Warrant Gap: Claim-Conditioned Re-scoring for Fact-Checking
- arxiv url: http://arxiv.org/abs/2606.24627v1
- Date: Tue, 23 Jun 2026 14:23:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 22:16:49.013995
- Title: The Warrant Gap: Claim-Conditioned Re-scoring for Fact-Checking
- Title(参考訳): The Warrant Gap:Fact-Checkingのためのクレームコンディションのリスコリング
- Authors: Arka Ujjal Dey, John Collomosse,
- Abstract要約: SIFT -- クレーム条件による全クレームに対する抽出されたエビデンスの再検査について紹介する。
FEVER,SciFact,5PILS,DPを4つのオープンソースバックボーンで評価した。
- 参考スコア(独自算出の注目度): 1.918675896078337
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Fact-checking systems built on LLMs achieve high verdict accuracy on standard benchmarks, yet routinely output Supports labels whose cited evidence does not license the claim. Structured decomposition is the natural way to inspect those warrants, but rigid extraction protocols strip the full-claim context that facets need. We introduce SIFT -- claim-conditioned re-scoring of extracted evidence spans against the full claim -- paired with WSP (Warranted Supports Proportion), an automatic NLI check that the cited warrant entails the claim. We evaluate on FEVER, SciFact, 5PILS, and DP across four open-source backbones. SIFT recovers accuracy on cells where naive decomposition costs up to 27.6 points, while raising WSP above direct prompting; WSP itself calibrates against human gold evidence at AUC 0.92 and precision 0.98.
- Abstract(参考訳): LLM上に構築されたFact-checkingシステムは、標準ベンチマーク上で高い検証精度を達成するが、引用された証拠が主張をライセンスしていないサポートラベルを定期的に出力する。
構造的分解はこれらの保証を検査する自然な方法であるが、厳密な抽出プロトコルは、ファセットが必要とする完全なコンテキストを排除している。
我々は、抽出された証拠のクレーム条件で再検査するSIFTをWSP(Warranted Supports Proportion)と組み合わせて導入し、引用された令状がクレームに関係していることを示す自動的なNLIチェックを紹介します。
FEVER,SciFact,5PILS,DPを4つのオープンソースバックボーンで評価した。
SIFTは、素因分解のコストが27.6ポイントに達するセルの精度を回復し、WSPは直接のプロンプトよりも高くなり、WSP自身はAUC 0.92 と精度 0.98 の人間の金の証拠に対して校正する。
関連論文リスト
- Relevant Is Not Warranted: Evidence-Force Calibration for Cited RAG [6.113159481005088]
我々は,エビデンス・フォース・キャリブレーションのためのコントラストストレステストであるForceBENCHを紹介する。
各項目は引用された節を固定し、エビデンス校正されたクレームと局所的な力評価された変種をペアに持つ。
ヘッドライン実験は固定された局所フィルター付き198ペア評価セットを使用する。
論文 参考訳(メタデータ) (2026-05-27T06:47:44Z) - DeepSciVerify: Verifying Scientific Claim--Citation Alignment via LLM-Driven Evidence Escalation [39.146761527401424]
本稿では,科学的クレーム引用検証のための2段階パイプラインであるDeepSciVerifyを紹介する。
このシステムはまず, 要約を用いてクレームを検証し, 必要な場合にのみ全文を検索, 解析する。
論文 参考訳(メタデータ) (2026-05-26T21:33:29Z) - Differentiable Conformal Training for LLM Reasoning Factuality [6.534904345823168]
大きな言語モデル(LLM)は、しばしば幻覚し、重要なアプリケーションにおける信頼性を制限します。
最近の研究は、Conformal Predictionを拡張して、リスクのあるクレームをフィルタリングし、幻覚率がユーザ指定レベル以下であることを保証する。
そこで本研究では,従来のアルゴリズムの保証を確実に回復しつつ,改良されたスコアラーの学習を可能にする,完全微分可能コヒーレント・ファクタリティ(DCF)を導入する。
論文 参考訳(メタデータ) (2026-04-22T01:35:31Z) - FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification [57.196748998757954]
本稿では,クレーム抽出,文献位置決定,実行に基づくクレーム検証を組み合わせたエビデンスベースレビューシステムであるFactReviewを紹介する。
FactReviewは論文を提出すると、主要なクレームを特定し、その結果を報告し、論文の技術的な位置を明らかにするために近くの作業を取り出し、コードが利用可能であれば、リリースされたリポジトリを実行する。
その後、簡潔なレビューと、主要な請求を5つのラベルのうち1つに割り当てるエビデンスレポートを生成する。
論文 参考訳(メタデータ) (2026-04-05T11:45:22Z) - DeepFact: Co-Evolving Benchmarks and Agents for Deep Research Factuality [49.62610727661819]
既存のファクトチェッカーは主に汎用ドメイン、ファクトイドスタイルの原子クレーム用に設計されている。
本稿では,ベンチマークラベルと有理値が明示的に変更可能なAudit-then-Score (AtS)を提案する。
我々は、AtSを、監査可能な有理量を持つDRR事実性ベンチマークであるDeepFact-Benchとしてインスタンス化する。
論文 参考訳(メタデータ) (2026-03-06T05:05:57Z) - Distill and Align Decomposition for Enhanced Claim Verification [51.93960785128124]
複雑なクレーム検証には、文を検証可能なサブ文に分解する必要がある。
本稿では,分解品質と検証器のアライメントを最適化する強化学習手法を提案する。
我々のフレームワークは、より小さな言語モデルで最先端のクレーム検証を実現できる。
論文 参考訳(メタデータ) (2026-02-25T12:32:04Z) - The Alignment Bottleneck in Decomposition-Based Claim Verification [17.197804072440665]
我々は、時間的拘束力のある証拠と人間による注釈付きサブステートメント証拠を含む、現実世界の複雑なクレームのデータセットを新たに導入する。
サブステートアラインド・アライメント・エビデンス(SAE)と繰り返しクライム・レベル・エビデンス(SRE)という2つのアライメント・アライメント・セットアップの下での分解を評価する。
以上の結果から,エビデンスがきめ細やかで厳密に整合している場合にのみ,分解が大幅な性能向上をもたらすことが明らかとなった。
論文 参考訳(メタデータ) (2026-02-11T00:02:16Z) - Retrieve-Refine-Calibrate: A Framework for Complex Claim Fact-Checking [32.6738019397553]
大規模言語モデル(LLM)に基づくRetrieve-Refine-Calibrate(RRC)フレームワークを提案する。
特に、このフレームワークは、まずクレームに記載されたエンティティを特定し、それらに関連する証拠を検索する。
そして、無関係な情報を減らすためのクレームに基づいて、回収された証拠を精査する。
最後に、信頼性の低い予測を再評価することで検証プロセスを校正する。
論文 参考訳(メタデータ) (2026-01-23T08:48:52Z) - Contrastive Learning to Improve Retrieval for Real-world Fact Checking [84.57583869042791]
ファクト・チェッキング・リランカ(Contrastive Fact-Checking Reranker, CFR)を提案する。
我々はAVeriTeCデータセットを活用し、証拠文書からの人間による回答とクレームのサブクエストを注釈付けする。
データセットの精度は6%向上した。
論文 参考訳(メタデータ) (2024-10-07T00:09:50Z) - From Relevance to Utility: Evidence Retrieval with Feedback for Fact Verification [118.03466985807331]
我々は、FVの関連性よりも、クレーム検証者が取得した証拠から導出する実用性に焦点を当てる必要があると論じる。
本稿では,エビデンス検索プロセスの最適化に,クレーム検証器からのフィードバックを取り入れたフィードバックベースのエビデンス検索手法(FER)を提案する。
論文 参考訳(メタデータ) (2023-10-18T02:59:38Z) - WiCE: Real-World Entailment for Claims in Wikipedia [63.234352061821625]
We propose WiCE, a new fine-fine textual entailment dataset built on natural claim and evidence pairs from Wikipedia。
標準クレームレベルのエンターメントに加えて、WiCEはクレームのサブ文単位に対するエンターメント判断を提供する。
我々のデータセットの真のクレームは、既存のモデルで対処できない検証と検索の問題に挑戦することを含んでいる。
論文 参考訳(メタデータ) (2023-03-02T17:45:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。