論文の概要: What Survives Into Context: A Diagnostic for Budget-Constrained Multi-Hop RAG and When Submodular Evidence Packing Improves It
- arxiv url: http://arxiv.org/abs/2607.00725v1
- Date: Wed, 01 Jul 2026 10:12:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.844015
- Title: What Survives Into Context: A Diagnostic for Budget-Constrained Multi-Hop RAG and When Submodular Evidence Packing Improves It
- Title(参考訳): コンテキストに生き残るもの:予算制約付きマルチホップRAGの診断とサブモジュールエビデンスパッケージの改善
- Authors: Ananto Nayan Bala,
- Abstract要約: 文書のリコールは、固定された読者コンテキスト予算で最適化するのに間違った量である、と我々は主張する。
本報告では,ゴールドの回答が,読解コンテキストの連続したスパンとして存続するかどうかを判定する診断手法である「in-in-context」を導入する。
i)マルチホップ補完構造、(ii)エビデンスを表わす検索、(iii)バインドだが極端な予算ではない検索、(iv)読み出し能力ではなく、証拠密度がボトルネックとなるほど弱くなること。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval-augmented generation (RAG) under a fixed reader-context budget forces a selection problem: of the evidence retrieved, only a fraction can be shown to the reader. We argue that document recall -- the standard retrieval metric -- is the wrong quantity to optimize in this regime, and we make two contributions. First, as a general contribution, we introduce answer-in-context, a diagnostic that measures whether a gold answer survives as a contiguous span in the packed reader context (not the retrieved set). It predicts answer F1 better than recall (r=0.39-0.55 vs. about 0.31), separates answer quality roughly five-fold (0.60 vs. 0.12 on HotpotQA), and carries information beyond retrieval: it adds Delta R squared=0.17 over recall and shows a 4.6x EM gap even among questions where all gold was retrieved. We also confirm it interventionally: on 2WikiMultiHopQA a packing change that raises coverage but not answer-in-context yields no accuracy gain. Second, as a conditional contribution, we cast reader-context construction as budgeted monotone submodular maximization and build a packer that jointly optimizes relevance, query coverage, representativeness, and diversity. On HotpotQA with a 160-token budget and a 3B reader it beats a strong focused heuristic, MMR, and naive packing -- by up to +5.1 F1 at equal-or-lower token cost, across three seeds. Crucially, we map the scope of this win honestly: it requires the conjunction of (i) multi-hop complementary structure, (ii) retrieval that surfaces the evidence, (iii) a binding but not extreme budget, and (iv) a reader weak enough that evidence density, not reading capacity, is the bottleneck. A quantization-controlled reader-scale ladder (3B to 7B to 14B) shows the edge over the heuristic is absorbed by 7B and significantly reverses by 14B, while the diagnostic explains every boundary with a single variable.
- Abstract(参考訳): 固定されたリーダコンテキスト予算の下での検索増強世代(RAG)は選択問題を強制する。
標準的な検索基準である文書のリコールは、この体制で最適化するには間違った量であり、2つのコントリビューションを行います。
まず,本論文のコントリビューションとして,金の解答が(検索された集合ではなく)満載の読解コンテキストにおいて連続したスパンとして存続するかどうかを測定する診断法である「in-in-context」を導入する。
解答 F1 はリコールよりも良く(r=0.39-0.55 vs. 0.31)、解答の品質をおよそ5倍に分離し(HotpotQAでは0.60 vs. 0.12)、検索以上の情報を提供する。
2WikiMultiHopQAでは、カバレッジを高めるが、回答・イン・コンテクストの精度は向上しないパッキング変更が行われます。
第2に、条件付きコントリビューションとして、単調部分モジュラー最大化の予算化として読者コンテキスト構築を行い、関連性、クエリカバレッジ、代表性、多様性を共同で最適化するパッカーを構築した。
HotpotQAは160ドルの予算と3Bリーダーを備えており、集中したヒューリスティック、MMR、そしてナイーブなパッキングを最大5.1F1で3つの種に分けて上回っている。
重要なことに、私たちはこの勝利の範囲を正直にマップします。
(i)マルチホップ補完構造
二 証拠に面した検索
三 過度な予算でない結束
(4)読み出し能力ではなく、証拠密度がボトルネックとなるほど弱い読み手。
量子化制御されたリーダスケールラグ(3B〜7B〜14B)は、ヒューリスティック上のエッジが7Bに吸収され、14Bに大幅に逆転し、診断は単一の変数ですべての境界を説明する。
関連論文リスト
- Know Before You Fetch: Calibrated Retrieval-Budget Allocation for Retrieval-Augmented Generation [10.60293484295824]
適応RAGをキャリブレーションした検索予算配分として定式化する。
シーケンスログの確率とプレフィックスログの不確実性信号を正しさの確率に調整する。
シーケンスログの確率については、TriviaQAでは0.275から0.062に、NQでは0.643から0.009に、MS MARCOでは0.711から0.031に低下する。
論文 参考訳(メタデータ) (2026-06-29T08:36:33Z) - Constrained Dominant Sets for Multimodal Document Question Answering [6.071121358322323]
長いマルチモーダルな文書質問応答は、取得された量よりも、証拠が読み手に届く程度に制限される。
この研究は、クエリ拡張親和性グラフ上の制約付き支配セットとしてエビデンスを選択するレトリバーを導入する。
論文 参考訳(メタデータ) (2026-06-05T13:24:46Z) - Answer Presence Drives RAG Rewriting Gains [21.554301305644156]
検索可能な増補QAパイプラインは、小さい読み手より前に、LLMエンプレライターを介して取得した経路をルートすることが多い。
我々は、リライトコンテキストに現れる金の応答文字列によって、リフトが因果的に駆動されるかどうかを問う。
論文 参考訳(メタデータ) (2026-06-04T03:00:42Z) - S3Mem: Structured Spatiotemporal Scene-Event Memory for Long-Horizon Interactive Question Answering [58.90783999951707]
ロングホライゾンの記憶問題に対する答えは、しばしば異質な歴史からスパースな証拠を必要とする。
S3Mem(Structured Spatiotemporal Scene-Event Memory)は,テキスト,視覚,エージェント使用履歴を構造化されたシーン単位に書き込むクエリ時メモリインタフェースである。
LoCoMo、EMemBench Visual Games、AMA-Benchの他、S3Memは強力なスコアツーケントレードオフを提供する。
論文 参考訳(メタデータ) (2026-04-10T07:49:10Z) - Test-Time Strategies for More Efficient and Accurate Agentic RAG [58.44913384057518]
Retrieval-Augmented Generation (RAG) システムは複雑なマルチホップ問題に直面している。
このような手法は、以前に処理された情報の反復的な検索を含む非効率性を導入することができる。
本稿では,これらの問題を軽減するために,サーチ-R1パイプラインに対するテスト時間修正について検討する。
論文 参考訳(メタデータ) (2026-03-12T19:18:59Z) - SE-Search: Self-Evolving Search Agent via Memory and Dense Reward [87.79131676521656]
Retrieval augmented generation (RAG)は、検索した外部知識を条件づけることにより、大規模言語モデル(LLM)における幻覚や事実エラーを低減する。
既存の手法は、無関係または騒々しい文書を蓄積し、希少な強化学習信号に依存することが多い。
我々は,3つのコンポーネントによるオンライン検索行動を改善するセルフ進化検索エージェントであるtextbfSelf-textbfEvolving textbfSearchを提案する。
論文 参考訳(メタデータ) (2026-02-06T09:14:07Z) - $G^2$-Reader: Dual Evolving Graphs for Multimodal Document QA [53.491241153213565]
G2$-Readerはマルチモーダルな質問応答のためのデュアルグラフシステムである。
Qwen3-VL-32B-Instructによる$G2$-Readerの平均精度は66.21%に達し、強力なベースラインとスタンドアローンのGPT-5(53.08%)を上回った。
5つのマルチモーダルドメインにわたるVisDoMBenchでは、Qwen3-VL-32B-Instructを使った$G2$-Readerが平均精度66.21%に達し、強力なベースラインとスタンドアロンのGPT-5(53.08%)を上回っている。
論文 参考訳(メタデータ) (2026-01-29T17:52:54Z) - PluriHop: Exhaustive, Recall-Sensitive QA over Distractor-Rich Corpora [0.0]
PluriHopWINDは、ドイツ語と英語の191の現実世界の風力産業レポートから構築された48のプルホップ質問の診断用多言語データセットである。
PluriHopWIND は他の一般的なデータセットよりも 8-40% の反復性を示し,その有効性を示す。
本稿では,RAGアーキテクチャであるPluriHopRAGを提案する。
論文 参考訳(メタデータ) (2025-10-16T07:22:58Z) - Faithful Chain-of-Thought Reasoning [51.21714389639417]
CoT(Chain-of-Thought)は言語モデル(LM)のパフォーマンスを様々な推論タスクで向上させる。
翻訳と問題解決という2つの段階を含む推論フレームワークであるFithful CoTを提案する。
このことは、推論連鎖が最終回答の忠実な説明を提供することを保証している。
論文 参考訳(メタデータ) (2023-01-31T03:04:26Z) - C-MORE: Pretraining to Answer Open-Domain Questions by Consulting
Millions of References [47.20656650130518]
主な課題は、タスク固有のアノテーションを使わずに、高品質な質問-回答-コンテキスト三つ子を構築する方法である。
本研究では,ウィキペディアで引用される数百万の参照を参考に,3つの基準をすべて満たす大規模コーパスを自動構築する。
事前学習したレトリバーは,トップ20の精度で2%~10%の絶対ゲインを達成し,事前学習した読者では,システム全体の一致率を最大4%向上させる。
論文 参考訳(メタデータ) (2022-03-16T20:30:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。