論文の概要: Diagnosing the Fact-Grounding Gap in Multi-Hop Question Answering
- arxiv url: http://arxiv.org/abs/2609.17043v1
- Date: Tue, 15 Sep 2026 11:51:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.481892
- Title: Diagnosing the Fact-Grounding Gap in Multi-Hop Question Answering
- Title(参考訳): マルチホップ質問応答におけるFact-Grounding Gapの診断
- Abstract要約: マルチホップ質問応答には、複雑な質問に答えるために、複数のドキュメントからの情報を組み合わせる必要がある。
これらのシステムはますます有能になっているが、失敗すると、エラーは典型的には正しい文書を見つけられないためである。
これらを3つの標準マルチホップQAベンチマークで検討し、障害が2つの異なるモードに分解されることを見出した。
- 参考スコア(独自算出の注目度): 3.5306064069287864
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-hop question answering requires combining information from multiple documents to answer complex questions. These systems have grown increasingly capable, yet when they fail, the error is typically attributed to not finding the right documents. Whether this holds at the level of individual reasoning steps remains largely unexamined. We investigate this across three standard multi-hop QA benchmarks and find that failures decompose into two distinct modes: retrieval failures, where the needed passage was not retrieved, and extraction failures, where the passage was retrieved but the needed fact could not be extracted - a phenomenon we term the fact-grounding gap. Extraction failures account for nearly half of all per-hop deficiencies and are invisible to standard retrieval metrics. They remain unresolved by every retrieval intervention we test, establishing a ceiling for retrieval-only improvements. The gap's severity varies across benchmarks and question types, but extraction failures appear on every dataset we measure. Our findings reveal that retrieval failures and extraction failures are fundamentally different bottlenecks requiring different solutions - a distinction absent from current evaluation practice.
- Abstract(参考訳): マルチホップ質問応答には、複雑な質問に答えるために、複数のドキュメントからの情報を組み合わせる必要がある。
これらのシステムはますます有能になっているが、失敗すると、エラーは典型的には正しい文書を見つけられないためである。
これが個々の推論段階のレベルで成り立つかどうかは、いまだほとんど検討されていない。
そこで本研究では,3つの標準マルチホップQAベンチマークから,必要なパスが検索されない検索障害と,パスが検索できないが必要な事実が抽出できない抽出障害という,障害が2つの異なるモードに分解されることを確かめる。
抽出失敗はホップ当たりの欠陥のほぼ半分を占め、標準的な検索指標には見えない。
テストするすべての検索介入によって解決されず、検索のみの改善のための天井を確立します。
ギャップの深刻度は、ベンチマークや質問タイプによって異なるが、計測するデータセット毎に抽出エラーが現れる。
この結果から,検索障害と抽出障害は,解を必要とするボトルネックが根本的に異なることが明らかとなった。
関連論文リスト
- Diagnosing Search Behavior and Failure Modes in Long-Horizon Search Agents [63.2133766267587]
ディープサーチエージェントは、証拠収集のために検索クエリを反復的に発行することで、難解な情報検索質問に答える。
本研究では,長軸探索エージェントの軌跡レベル診断を用いてこれらの質問について検討する。
我々は,各探索ステップで得られた証拠を評価し,エージェントの行動の2つの段階を分離する。
論文 参考訳(メタデータ) (2026-08-03T08:46:48Z) - HopRefusalBench: Diagnosing Refusal Failures in Search-Augmented Agents for Multi-Hop Reasoning [14.484579581234327]
マルチホップ検索における拒絶の最初のベンチマークであるHopRefusalBenchを紹介する。
根、中、終端位相の3つの解答不可能な原因を横切る。
本稿では,目標認識の拒絶,疑似拒絶,幻覚的完了,探索予算の枯渇にまたがる最終アウトカム分類を提案する。
論文 参考訳(メタデータ) (2026-08-02T16:20:55Z) - HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help? [32.54022440678003]
コーディングエージェントは、完全なコンテキストが与えられたときに複雑なタスクを解決します。
現在のベンチマークは、この障害モードに盲目です。
我々はこの選択的エスカレーションスキルを測定するためにHiL-Benchを提案する。
論文 参考訳(メタデータ) (2026-04-10T15:21:44Z) - When Is Enough Not Enough? Illusory Completion in Search Agents [56.98225130959051]
検索エージェントが、複数の条件をトラッキングし、検証し、維持することで、すべての要件に対して確実に理性性を持たせるかどうかを調査する。
エージェントは、未解決の制約や違反の制約にもかかわらずタスクが完了したと信じており、未検証の回答につながる。
我々は、実行中の明示的な制約状態追跡が、推論時トラッカーであるLiveLedgerを介してこれらの障害を緩和するかどうかを検討する。
論文 参考訳(メタデータ) (2026-02-07T13:50:38Z) - Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics [89.1999907891494]
We present WebDetective, a benchmark of hint-free multi-hop questions with a control Wikipedia sandbox。
25の最先端モデルに対する我々の評価は、すべてのアーキテクチャにまたがる体系的な弱点を明らかにしている。
私たちはエージェントワークフローであるEvidenceLoopを開発し、ベンチマークが特定する課題を明示的にターゲットしています。
論文 参考訳(メタデータ) (2025-10-01T07:59:03Z) - Adaptive Information Seeking for Open-Domain Question Answering [61.39330982757494]
本稿では,オープンドメイン質問応答,すなわちAISOに対する適応型情報探索手法を提案する。
学習方針によると、AISOは適切な検索行動を選択し、各ステップで行方不明の証拠を探すことができる。
AISOは、検索と回答の評価の両方の観点から、事前定義された戦略で全てのベースライン手法を上回ります。
論文 参考訳(メタデータ) (2021-09-14T15:08:13Z) - Joint Passage Ranking for Diverse Multi-Answer Retrieval [56.43443577137929]
質問に対する複数の異なる回答をカバーするために、パスの取得を必要とする探索不足の問題であるマルチアンサー検索について検討する。
モデルが別の有効な答えを逃す費用で同じ答えを含む通路を繰り返すべきではないので、このタスクは、検索された通路の共同モデリングを必要とします。
本稿では,再順位に着目したジョイントパス検索モデルであるJPRを紹介する。
回収された通路の合同確率をモデル化するために、JPRは、新しい訓練および復号アルゴリズムを備えた通路のシーケンスを選択する自動回帰リタイナを利用する。
論文 参考訳(メタデータ) (2021-04-17T04:48:36Z) - Memory Augmented Sequential Paragraph Retrieval for Multi-hop Question
Answering [32.69969157825044]
本稿では,段落を逐次データとしてモデル化し,マルチホップ情報検索をシーケンスラベリングタスクの一種とみなす新しいアーキテクチャを提案する。
本手法は,公開テキストマルチホップQAデータセットであるHotpotQAのフルwikiとイントラクタサブタスクの両方で評価する。
論文 参考訳(メタデータ) (2021-02-07T08:15:51Z) - Answering Any-hop Open-domain Questions with Iterative Document
Reranking [62.76025579681472]
オープンドメインの問に答える統合QAフレームワークを提案する。
提案手法は,シングルホップおよびマルチホップのオープンドメインQAデータセットにおいて,最先端技術に匹敵する性能を継続的に達成する。
論文 参考訳(メタデータ) (2020-09-16T04:31:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。