論文の概要: Diversity is Not Ambiguity: Toward Accurate and Efficient Ambiguity Detection for Open-Domain QA
- arxiv url: http://arxiv.org/abs/2608.03177v1
- Date: Tue, 04 Aug 2026 06:13:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.058342
- Title: Diversity is Not Ambiguity: Toward Accurate and Efficient Ambiguity Detection for Open-Domain QA
- Title(参考訳): 多様性はあいまいさではない:オープンドメインQAにおける高精度かつ効率的なあいまいさ検出に向けて
- Authors: Jiwon Lee, Yong-chan Park, Jungin Hong, U Kang,
- Abstract要約: 本稿では,論理的衝突によるあいまいさを検出するフレームワークARCHIVEを提案する。
ARCHIVEは、表面検出可能なケースのための軽量の早期出力エンコーダとコンフリクト推論モジュールを組み合わせる。
実験の結果、ARCHIVEはライバルより優れており、F1アンブは最大10.4%、F1アンブは最大21.6%向上している。
- 参考スコア(独自算出の注目度): 20.772897408550275
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: How can question answering (QA) systems determine whether a query is ambiguous? Ambiguity detection is essential in open-domain QA, as misclassification leads to answering the wrong interpretation or unnecessary clarification. However, existing methods conflate answer diversity with ambiguity, leading to inaccurate predictions. They also process queries uniformly, resulting in wasteful computation. We propose ARCHIVE (Ambiguity Recognition via Cascaded Hypothesis Inspection and Conflict Verification), an accurate and efficient framework that detects ambiguity via logical conflict: a query is ambiguous when its valid answers cannot all be true under a single interpretation. ARCHIVE combines a lightweight early-exit encoder for surface-detectable cases with a conflict reasoning module that models logical relations among answers, reinforced by an invariance objective for robustness to noisy answer sets. We present QuireQA, a 4,703-query benchmark spanning factoid, non-factoid, and ill-formed queries. Experiments show ARCHIVE outperforms competitors, improving F1-amb by up to 10.4% and F1-unamb by up to 21.6%, while operating 16$\times$ faster than the best competitor.
- Abstract(参考訳): 問合せ(QA)システムは、クエリがあいまいかどうかをどう判断するか?
曖昧さの検出はオープンドメインのQAにおいて必須であり、誤分類は誤った解釈や不必要な明確化に答える。
しかし、既存の手法は多様性を曖昧さで説明し、不正確な予測をもたらす。
また、クエリを均一に処理し、結果として無駄な計算を行う。
本稿では,論理的矛盾による曖昧さを正確に検出するARCHIVE(Ambiguity Recognition via Cascaded hypothesis Inspection and Conflict Verification)を提案する。
ARCHIVEは、表面検出可能なケースのための軽量の早期出力エンコーダと、答え間の論理的関係をモデル化する競合推論モジュールを組み合わせる。
ファクトイド、非ファクトイド、不正なクエリにまたがる4,703クエリのベンチマークであるQuileQAを提示する。
実験の結果、ARCHIVEはライバルより優れており、F1-ambを最大10.4%改善し、F1-unmbを最大21.6%改善した。
関連論文リスト
- Beyond Semantic Equivalence: Logical Graphs for LLM Uncertainty Quantification [30.900501335481184]
我々は,回答間の含意と非互換性を明示的にモデル化するフレームワークである,論理グラフ不確実性(LGU)を提案する。
複数の質問応答ベンチマークにおいて、LGUは既存の手法に対する不確実性評価を一貫して改善している。
論文 参考訳(メタデータ) (2026-07-18T16:14:08Z) - Uncertainty as Feature Gaps: Epistemic Uncertainty Quantification of LLMs in Contextual Question-Answering [29.4458902836278]
本稿では,与えられたモデルの予測分布と未知の真の分布との相互エントロピーとして定義されたタスクに依存しないトークンレベルの不確実性尺度を提案する。
我々は不確実性の上限を導出し、与えられたモデルの隠された表現において意味的特徴ギャップとして解釈できることを示す。
この一般的なフレームワークを文脈的QAタスクに適用し、文脈信頼、文脈理解、誠実さの3つの特徴がこのギャップを近似していると仮定する。
論文 参考訳(メタデータ) (2025-10-03T02:09:25Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Retrieval-Augmented Generation with Conflicting Evidence [57.66282463340297]
大規模言語モデル (LLM) エージェントは、応答の事実性を改善するために、検索強化世代 (RAG) をますます採用している。
実際には、これらのシステムは曖昧なユーザクエリを処理し、複数のソースからの情報に衝突する可能性がある。
RAMDocs(Retrieval with Ambiguity and Misinformation in Documents)は,ユーザクエリのエビデンスを矛盾させるような,複雑で現実的なシナリオをシミュレートする新しいデータセットである。
論文 参考訳(メタデータ) (2025-04-17T16:46:11Z) - CondAmbigQA: A Benchmark and Dataset for Conditional Ambiguous Question Answering [9.50840225852638]
Conditional Ambiguous Question-Answering (CondAmbigQA) は2000の曖昧なクエリと条件対応評価指標からなるベンチマークである。
実験により、回答前の条件を考慮したモデルでは解答精度が11.75%向上し、条件が明示された場合にさらに7.15%向上することが示されている。
論文 参考訳(メタデータ) (2025-02-03T17:01:51Z) - Variability Need Not Imply Error: The Case of Adequate but Semantically Distinct Responses [7.581259361859477]
不確実性定量化ツールは、モデルが不確実である場合の応答を拒否するために使用できます。
我々は、モデルがAdequate Responses (PROBAR)に割り当てる確率を推定する。
ProBARはアンビグニティ/オープンエンディエントネスの異なるプロンプトでセマンティックエントロピーを上回ります。
論文 参考訳(メタデータ) (2024-12-20T09:02:26Z) - Certainly Uncertain: A Benchmark and Metric for Multimodal Epistemic and Aleatoric Awareness [106.52630978891054]
視覚言語AIシステムに特有の不確実性の分類法を提案する。
また、精度と校正誤差の両方によく相関する新しい計量信頼度重み付き精度を導入する。
論文 参考訳(メタデータ) (2024-07-02T04:23:54Z) - Answering Ambiguous Questions via Iterative Prompting [84.3426020642704]
オープンドメインの質問応答では、質問のあいまいさのため、複数の妥当な回答が存在する可能性がある。
ひとつのアプローチは、すべての有効な回答を直接予測することですが、これは、妥当性と多様性のバランスに苦労する可能性があります。
本稿では,あいまいな疑問に答える既存手法の欠陥に対処するため,AmbigPromptを提案する。
論文 参考訳(メタデータ) (2023-07-08T04:32:17Z) - Counterfactual Variable Control for Robust and Interpretable Question
Answering [57.25261576239862]
ディープニューラルネットワークに基づく質問応答(QA)モデルは、多くの場合、堅牢でも説明もできない。
本稿では、因果推論を用いてQAモデルのこのような突発的な「能力」を検証する。
本稿では,任意のショートカット相関を明示的に緩和する,CVC(Counterfactual Variable Control)という新しい手法を提案する。
論文 参考訳(メタデータ) (2020-10-12T10:09:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。