論文の概要: When Absence Is Evidence: Evaluating Completeness-Sensitive Negative Reasoning in Large Language Models
- arxiv url: http://arxiv.org/abs/2608.04591v1
- Date: Wed, 05 Aug 2026 08:53:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.79002
- Title: When Absence Is Evidence: Evaluating Completeness-Sensitive Negative Reasoning in Large Language Models
- Title(参考訳): Absenceがエビデンスであるとき:大規模言語モデルにおける完全性-知覚的否定的推論の評価
- Authors: Byoungjae Min, Kennedy Edemacu, Sae-Hong Cho, Yoonhyuk Choi, Beakcheol Jang, Jong Wook Kim,
- Abstract要約: 大規模言語モデル(LLM)は、レコード、リスト、検索されたコンテキストから何かが欠落しているかどうかを尋ねられることが多い。
これを完全性に敏感な負の推論と呼ぶ。
CROWN-QAは,クエリ関係のカバレッジだけを変化させつつ,問題を修正し,事実を観察する,制御されたペアコアである。
- 参考スコア(独自算出の注目度): 11.54793572552358
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are often asked whether something is absent from a record, list, or retrieved context. Yet non-observation licenses a negative answer only when evidence completely covers the query scope; otherwise, the answer should remain unknown. We call this completeness-sensitive negative reasoning. We introduce CROWN-QA, comprising CROWN-Synth, a controlled paired core that fixes the question and observed facts while varying only query-relative coverage, and CROWN-Real, a real-document contrast-set evaluation with controlled coverage variants. Across three LLM families, models show unstable closure judgments and substantial over-closure, failing to reliably distinguish a justified negative answer (Certified-Negative) from insufficient evidence (Unknown). The dominant CROWN-Synth failure is asymmetric: models often recognize implicitly complete evidence yet treat implicitly partial evidence as query-covering. Prompting redistributes errors between over- and under-closure rather than consistently resolving them. Structured certificate elicitation traces many errors to evidence-coverage mischaracterization. CROWN-Real shows that the core partial-coverage asymmetry persists on real-document content, while its strength and the balance between over- and under-closure vary by model, prompt, and source.
- Abstract(参考訳): 大規模言語モデル(LLM)は、レコード、リスト、検索されたコンテキストから何かが欠落しているかどうかを尋ねられることが多い。
しかし、非オブザーブレーションは、クエリの範囲を完全にカバーする証拠がある場合にのみ、否定的な回答を許可する。
これを完全性に敏感な負の推論と呼ぶ。
CROWN-QAは、クエリ相対的カバレッジのみを変化させながら、質問や観察事実を修正できる制御されたペアコアであるCROWN-Synthと、制御されたカバレッジバリアントを備えた実文書のコントラストセット評価であるCROWN-Realから構成される。
3つの LLM ファミリーにわたって、モデルは不安定なクロージャ判断と実質的なオーバークロージャを示し、正当化された負の答え(Certified-Negative)と不十分な証拠(不明)を確実に区別することができない。
モデルはしばしば暗黙的に完全な証拠を認識するが、暗黙的に部分的な証拠をクエリーカバレッジとして扱う。
再試行は、絶えず解決するのではなく、オーバークロージャとアンダークロージャのエラーを分解する。
構造化証明書の引用は、多くの誤りを証拠とカバーの誤認に辿る。
CROWN-Realは、コア部分被覆非対称性が実文書の内容に持続することを示したが、その強さとオーバークロージャーとアンダークロージャーのバランスはモデル、プロンプト、ソースによって異なる。
関連論文リスト
- When benchmark inferences do not compose: Projectibility in AI evaluation [0.0]
AIベンチマークの結果が1ステップで連続的なクレームに達することはめったにない。
評価者はそれをさらなるケースに一般化し、能力の証拠として解釈し、新しいタスクに外挿し、他のシステムやサイトへ輸送する。
保証リンクは保証チェーンを自動的に作らない。
論文 参考訳(メタデータ) (2026-07-28T18:07:04Z) - Auditing Stance Asymmetry in Generative Explanations [0.0]
オープンエンドの説明は、責任、正当性、文脈、欲求を割り当てることで解釈を導く。
モデルは、一方を構造的に理解し、他方を個人的に失敗、過剰反応、あるいは真面目に考える価値の低いものにしながら、敵対的な言語を避けることができる。
本研究では, 具体的グループラベル, 構造的ロールリライト, 明示的サポート, 逆エビデンスとの組み合わせを検証したSDE(Symmetry Decomposition Evaluation)を提案する。
論文 参考訳(メタデータ) (2026-05-27T05:22:17Z) - When Verification Fails: How Compositionally Infeasible Claims Escape Rejection [30.404615085122046]
既存の検証ベンチマークでは,厳密なクレーム検証と簡易な塩分制約依存を区別できないことを示す。
有意な制約が支持されるが、非有意な制約が矛盾する場合に、構成的に不可能なクレームを構築する。
モデル間の差は,基礎的推論能力よりも検証しきい値の差を反映していることを示す。
論文 参考訳(メタデータ) (2026-04-13T04:48:20Z) - The Alignment Bottleneck in Decomposition-Based Claim Verification [17.197804072440665]
我々は、時間的拘束力のある証拠と人間による注釈付きサブステートメント証拠を含む、現実世界の複雑なクレームのデータセットを新たに導入する。
サブステートアラインド・アライメント・エビデンス(SAE)と繰り返しクライム・レベル・エビデンス(SRE)という2つのアライメント・アライメント・セットアップの下での分解を評価する。
以上の結果から,エビデンスがきめ細やかで厳密に整合している場合にのみ,分解が大幅な性能向上をもたらすことが明らかとなった。
論文 参考訳(メタデータ) (2026-02-11T00:02:16Z) - A Closer Look at Bias and Chain-of-Thought Faithfulness of Large (Vision) Language Models [58.32070787537946]
思考の連鎖(CoT)推論は、大きな言語モデルの性能を高める。
大規模視覚言語モデルにおけるCoT忠実度に関する最初の総合的研究について述べる。
論文 参考訳(メタデータ) (2025-05-29T18:55:05Z) - Faithfulness-Aware Uncertainty Quantification for Fact-Checking the Output of Retrieval Augmented Generation [108.13261761812517]
本稿では,RAG出力における幻覚検出の新しい手法であるFRANQ(Fithfulness-based Retrieval Augmented Uncertainty Quantification)を紹介する。
本稿では,事実性と忠実性の両方に注釈を付したQAデータセットを提案する。
論文 参考訳(メタデータ) (2025-05-27T11:56:59Z) - CRAVE: A Conflicting Reasoning Approach for Explainable Claim Verification Using LLMs [15.170312674645535]
CRAVE は、説明可能なクレーム VErification に対する Conflicting Reasoning Approach である。
大規模な言語モデルによって推論される矛盾する理性に基づいて、複雑なクレームを検証することができる。
CRAVEは最先端の手法よりもはるかに優れた性能を実現している。
論文 参考訳(メタデータ) (2025-04-21T07:20:31Z) - AmbiFC: Fact-Checking Ambiguous Claims with Evidence [57.7091560922174]
実世界の情報ニーズから10kクレームを抽出したファクトチェックデータセットであるAmbiFCを提示する。
アンビFCの証拠に対する主張を比較する際に,曖昧さから生じる不一致を分析した。
我々は,このあいまいさをソフトラベルで予測するモデルを開発した。
論文 参考訳(メタデータ) (2021-04-01T17:40:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。