論文の概要: ConflictScore: Identifying and Measuring How Language Models Handle Conflicting Evidence
- arxiv url: http://arxiv.org/abs/2606.26437v1
- Date: Wed, 24 Jun 2026 23:00:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.096624
- Title: ConflictScore: Identifying and Measuring How Language Models Handle Conflicting Evidence
- Title(参考訳): ConflictScore: 言語モデルがエビデンスを扱う方法の特定と測定
- Abstract要約: 我々は、モデル応答が、その基盤となる文書における矛盾する証拠をどのように認識するかを定量化する新しいメトリクスであるConflictScoreを紹介する。
我々のフレームワークは, 反応を原子的クレームに分解し, それぞれのクレームに対して各クレームをラベル付けし, それらのラベルを2つの補完的尺度に集約する。
- 参考スコア(独自算出の注目度): 48.938290419832335
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing metrics for factuality and faithfulness evaluate whether an answer is supported or contradicted by its grounding documents, but they fail to capture when both supporting and contradicting evidence coexist. We introduce ConflictScore, a novel metric that quantifies how well a model's response acknowledges conflicting evidence in its grounding documents. Our framework decomposes responses into atomic claims, labels each claim against each grounding document, and then aggregates these labels into two complementary measures: ConflictScore-Count (CS-C), the proportion of claims exhibiting conflicts, and ConflictScore-Ratio (CS-R), the balance between supporting and contradicting evidence. We develop ConflictBench, a benchmark covering diverse forms of conflicts such as ambiguity, contradiction, and divergent opinions, to systematically evaluate our metric. Experiments show that ConflictScore effectively detects overconfident claims across domains and can serve as a corrective feedback mechanism that improves truthfulness on TruthfulQA.
- Abstract(参考訳): 事実性および忠実性の既存の指標は、その答えが根拠となる文書によって支持されるか矛盾するかを評価するが、証拠が共存する証拠を支持し、矛盾する場合は、それらが捕捉されない。
我々は、モデル応答が、その基盤となる文書における矛盾する証拠をどのように認識するかを定量化する新しいメトリクスであるConflictScoreを紹介する。
我々のフレームワークは, 反応を原子的クレームに分解し, それぞれのクレームに対して各クレームをラベル付けし, それらのラベルを2つの補完的尺度に集約する。
我々は、我々のメトリクスを体系的に評価するために、曖昧さ、矛盾、異質な意見といった様々な形態の対立を網羅するベンチマークであるConflictBenchを開発した。
実験の結果、ConflictScoreはドメイン間での過信なクレームを効果的に検出し、TrathfulQAの真性を改善するための修正的なフィードバックメカニズムとして機能することが示された。
関連論文リスト
- HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research [52.87128503345243]
我々は,Deep Researchにおける階層的エビデンス・アグリゲーションを評価するためのベンチマークであるHiEviDR-Benchを紹介する。
HiEviDR-Benchは、エビデンスの選択、クロスソースリンク、アグリゲーションをキャプチャする明示的なエビデンスグラフを持つ各インスタンスを表す。
報告品質,エビデンストレーサビリティ,引用精度,クレーム検証,回答正当性という5次元のトレーサビリティ指向評価フレームワークを開発した。
論文 参考訳(メタデータ) (2026-07-27T23:50:46Z) - The Deliberative Illusion: Diagnosing Factual Attrition and Stance Homogenization in Multi-Agent LLM Deliberation [68.98390038721963]
問題クリティカルな事実の最大72%を,マルチエージェントによる議論で消し去ることを示す。
保持された証拠は誤解を招くことなく問題を再構築し、最終的なスタンスをベースモデルに固定し、単一の悪意のあるエージェントが誤った情報を共有コンテキストに注入することができる。
我々は、どの事実、不確実性、正当な不一致が相互作用を生き残るかを測定する評価を求める。
論文 参考訳(メタデータ) (2026-06-02T02:15:40Z) - When Evidence Conflicts: Uncertainty and Order Effects in Retrieval-Augmented Biomedical Question Answering [2.6393907656700706]
HealthContradictを用いて、5つの制御された証拠条件下で6つのオープンウェイト大言語モデル(LLM)を評価する。
その結果, バイオメディカルな証拠の相反は不確実性と堅牢性の両方の問題であることが示唆された。
論文 参考訳(メタデータ) (2026-05-13T21:02:24Z) - When Reviews Disagree: Fine-Grained Contradiction Analysis in Scientific Peer Reviews [25.43097618275061]
RevCIは、評価された強度ラベルを持つエビデンスレベルの矛盾アノテーションを備えたピアレビューペアの専門家によるベンチマークである。
IMPACTは、アスペクト条件のエビデンス抽出、熟考的推論、偏見を統合した構造化マルチエージェントフレームワークである。
TIDEは1つの前方通過における矛盾する証拠と強度を予測する小さな言語モデルである。
論文 参考訳(メタデータ) (2026-05-11T08:20:58Z) - To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition [87.22988227382329]
マルチモーダル感情認識(MER)は、テキスト、音声、視覚を組み合わせることで恩恵を受けるが、標準的な融合は、モダリティが相反する場合に失敗することが多い。
我々は,いつフューズするか,いつモダリティを落とすのかを学習する統合フレームワークであるDual-Path Conflict Resolution (DCR)を提案する。
論文 参考訳(メタデータ) (2026-05-06T13:11:33Z) - Rethinking All Evidence: Enhancing Trustworthy Retrieval-Augmented Generation via Conflict-Driven Summarization [11.875601079871865]
本稿では, 信頼性向上のための新しいフレームワークであるCARE-RAG(Conflict-Aware and Reliable Evidence for RAG)を提案する。
コンフリクトの検出と要約のために、3B LLaMA3.2モデルを蒸留し、コンフリクト駆動の要約を行い、複数のソース間で信頼性の高い合成を可能にする。
検索データを用いたQAデータセットの改訂実験により、CARE-RAGは強いRAGベースライン、特にノイズや矛盾するエビデンスのあるシナリオにおいて、一貫して優れることが示された。
論文 参考訳(メタデータ) (2025-07-02T01:39:49Z) - SUCEA: Reasoning-Intensive Retrieval for Adversarial Fact-checking through Claim Decomposition and Editing [30.84752573088322]
敵の主張は、人間が事実確認システムに挑戦するために意図的に設計されている。
本稿では,元来の主張を言い換える訓練のない手法を提案する。
提案手法は,検索と包含ラベルの精度を大幅に向上させ,強力なクレーム分割ベースラインを4つ備えた。
論文 参考訳(メタデータ) (2025-06-05T02:58:15Z) - Is the Top Still Spinning? Evaluating Subjectivity in Narrative Understanding [40.78154629252038]
曖昧なクレームにバイナリラベルを強制すると、評価の信頼性が低下する。
請求項のニュアンス評価を提供する方法として,LCM生成した要約の編集を紹介する。
我々は,ARMが主張の忠実性に関するアノテータ合意において,絶対的な21%の改善をもたらすことを示す。
論文 参考訳(メタデータ) (2025-04-01T19:08:24Z) - AdaCAD: Adaptively Decoding to Balance Conflicts between Contextual and Parametric Knowledge [57.66282463340297]
知識の衝突は、大きな言語モデルの文脈における情報と、そのパラメータに格納された知識との相違から生じる。
コンフリクトの度合いに基づいて動的に調整の重みを推定する,AdaCADと呼ばれる細粒度なインスタンスレベルのアプローチを提案する。
ADACADは静的コントラストベースラインよりも平均QA精度14.21%(絶対)のデコードベースラインを一貫して上回り、要約の事実性を6.19倍(AlignScore)向上させることを示す。
論文 参考訳(メタデータ) (2024-09-11T16:35:18Z) - End-to-End Page-Level Assessment of Handwritten Text Recognition [69.55992406968495]
HTRシステムは、文書のエンドツーエンドのページレベルの書き起こしに直面している。
標準メトリクスは、現れる可能性のある不整合を考慮していない。
本稿では、転写精度とROの良さを別々に検討する2つの評価法を提案する。
論文 参考訳(メタデータ) (2023-01-14T15:43:07Z) - AmbiFC: Fact-Checking Ambiguous Claims with Evidence [57.7091560922174]
実世界の情報ニーズから10kクレームを抽出したファクトチェックデータセットであるAmbiFCを提示する。
アンビFCの証拠に対する主張を比較する際に,曖昧さから生じる不一致を分析した。
我々は,このあいまいさをソフトラベルで予測するモデルを開発した。
論文 参考訳(メタデータ) (2021-04-01T17:40:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。