論文の概要: CoVer: Conflict-Aware Claim Verification
- arxiv url: http://arxiv.org/abs/2609.00508v1
- Date: Tue, 01 Sep 2026 00:18:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.171809
- Title: CoVer: Conflict-Aware Claim Verification
- Title(参考訳): CoVer: 矛盾を意識したクレームの検証
- Authors: Shuning Zhang, Dai Shi, Bohao Chu, Hui Wang, Yuwei Chuai, Yifan Wang, Jingruo Chen, Simin Li, Xin Yi, Hewu Li,
- Abstract要約: 本稿では,X の Community Notes システムから収集した大規模実世界のデータセット ContraNote を紹介する。
これには、エビデンスレベルの競合解決を評価する33,686の投稿と、アグリゲーションレベルの優先順位付けを評価する54,474のインスタンスが含まれる。
また、エビデンススキーマの正規化、ファクトコンセンサス、サポート検証という、3段階のパイプラインを持つ現実的なフレームワークであるCoVerを提案する。
- 参考スコア(独自算出の注目度): 24.34805561436993
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Social media fact-checking has long been challenged by evidence-level and aggregation-level conflicts, where erroneous evidence mimics authoritative news sources. To capture this challenge and support conflict verification tasks, we present ContraNote, a large-scale real-world dataset curated from X's Community Notes system. It includes 33,686 posts for evaluating evidence-level conflict resolution, and 54,474 instances for evaluating aggregation-level prioritization. Additionally, we propose CoVer, a factual adjudication framework with three-stage pipelines: evidence schema normalization, factual consensus and support verification. This prioritizes evidence over noise to prevent it from compromising the final verdict. Technical evaluations show that CoVer achieves strong performance compared with state-of-the-art baselines across ContraNote (86.0% Acc., 68.0% mac. F1, 64.5 bal. Acc. on Conflict; and 88.5% Acc., 88.5 mac. F1 and 89.2 bal. Acc. on Prioritization), CONFACT-HumC (88.4% Acc.) and CONFACT-ModC (89.4% Acc.).
- Abstract(参考訳): ソーシャルメディアのファクトチェックは、長い間、証拠レベルと集約レベルの紛争によって、誤った証拠が権威のあるニュースソースを模倣している。
この課題を克服し、競合検証タスクをサポートするために、私たちは、XのCommunity Notesシステムからキュレートされた大規模な実世界のデータセットであるContraNoteを紹介します。
これには、エビデンスレベルの競合解決を評価する33,686の投稿と、アグリゲーションレベルの優先順位付けを評価する54,474のインスタンスが含まれる。
さらに,エビデンススキーマ正規化,ファクトコンセンサス,サポート検証という,3段階のパイプラインを備えた実数判断フレームワークであるCoVerを提案する。
これにより、最終判決を損なうのを防ぐために、ノイズよりも証拠を優先する。
技術的評価によると、CoVer は ContraNote (86.0% Acc., 68.0% mac. F1, 64.5 bal. Acc. on Conflict; 88.5% Acc., 88.5 mac. F1 と 89.2 bal. Acc. on Prioritization)、CONFACT-HumC (88.4% Acc.)、CONFACT-ModC (89.4% Acc.) にまたがる最先端のベースラインと比較して高い性能を発揮する。
関連論文リスト
- Diagnosing Fine-Grained Inconsistency Classification in Financial Disclosure Text [3.2712318205295907]
財務情報開示には、数値的なクレーム、時間的ステートメント、エンティティ参照、ポリシーのコミットメント、そして質的に異なる方法で衝突する可能性のあるリスク記述が含まれる。
我々はこの問題をきめ細かい矛盾として研究する。
微調整された300Mエンコーダの精度は61.9%、ロラ適応型Qwen3.5-9Bモデルでは61.5%、GPT適応型生成モデルでは61.3%である。
論文 参考訳(メタデータ) (2026-07-29T01:03:53Z) - ConflictScore: Identifying and Measuring How Language Models Handle Conflicting Evidence [48.938290419832335]
我々は、モデル応答が、その基盤となる文書における矛盾する証拠をどのように認識するかを定量化する新しいメトリクスであるConflictScoreを紹介する。
我々のフレームワークは, 反応を原子的クレームに分解し, それぞれのクレームに対して各クレームをラベル付けし, それらのラベルを2つの補完的尺度に集約する。
論文 参考訳(メタデータ) (2026-06-24T23:00:09Z) - Relevant Is Not Warranted: Evidence-Force Calibration for Cited RAG [6.113159481005088]
我々は,エビデンス・フォース・キャリブレーションのためのコントラストストレステストであるForceBENCHを紹介する。
各項目は引用された節を固定し、エビデンス校正されたクレームと局所的な力評価された変種をペアに持つ。
ヘッドライン実験は固定された局所フィルター付き198ペア評価セットを使用する。
論文 参考訳(メタデータ) (2026-05-27T06:47:44Z) - When Reasoning Traces Become Performative: Step-Level Evidence that Chain-of-Thought Is an Imperfect Oversight Channel [5.106950500256654]
CoT(Chain-of- Thought)トレースは、言語モデルの能力向上とモデルの振る舞いの監査にますます利用されている。
我々は、この仮定を、回答コミットプロキシを中心に構築されたステップレベルのDect-Classify-Compareフレームワークでテストする。
9つのモデルと7つの推論ベンチマーク、潜在コミットメント、明示的な回答到着は平均61.9%のステップで一致している。
論文 参考訳(メタデータ) (2026-05-12T08:24:47Z) - FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification [57.196748998757954]
本稿では,クレーム抽出,文献位置決定,実行に基づくクレーム検証を組み合わせたエビデンスベースレビューシステムであるFactReviewを紹介する。
FactReviewは論文を提出すると、主要なクレームを特定し、その結果を報告し、論文の技術的な位置を明らかにするために近くの作業を取り出し、コードが利用可能であれば、リリースされたリポジトリを実行する。
その後、簡潔なレビューと、主要な請求を5つのラベルのうち1つに割り当てるエビデンスレポートを生成する。
論文 参考訳(メタデータ) (2026-04-05T11:45:22Z) - An Auditable Pipeline for Fuzzy Full-Text Screening in Systematic Reviews: Integrating Contrastive Semantic Highlighting and LLM Judgment [0.0]
フルテキストのスクリーニングは、体系的なレビューの大きなボトルネックです。
私たちは、ファジィな決定問題として包摂/排除を再設計する、スケーラブルで監査可能なパイプラインを提示します。
論文 参考訳(メタデータ) (2025-08-17T17:41:50Z) - The Missing Parts: Augmenting Fact Verification with Half-Truth Detection [20.011177314734887]
多くの現実世界の主張は半真実であり、実際は正しいが、批判的な文脈が欠落しているために誤解を招く。
我々は,半真実検出の課題を紹介し,文レベルの証拠アライメントと推論されたクレーム意図を付加した15kの政治的クレームを備えた新しいベンチマークであるPolitiFact-Hiddenを提案する。
提案するTRACERは,エビデンスを整理し,インプリートを推定し,隠されたコンテンツの因果的影響を推定することにより,省略に基づく誤報を識別するモジュラー・リアセスメント・フレームワークである。
論文 参考訳(メタデータ) (2025-08-01T10:06:38Z) - From Chaos to Clarity: Claim Normalization to Empower Fact-Checking [57.024192702939736]
Claim Normalization(別名 ClaimNorm)は、複雑でノイズの多いソーシャルメディア投稿を、より単純で分かりやすい形式に分解することを目的としている。
本稿では,チェーン・オブ・ソートとクレーム・チェック・バシネス推定を利用した先駆的アプローチであるCACNを提案する。
実験により, CACNは様々な評価尺度において, いくつかの基準値を上回る性能を示した。
論文 参考訳(メタデータ) (2023-10-22T16:07:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。