論文の概要: Do Current Retrievers Cover All the Evidence? A Controlled Study of Conjunctive Cross-Page Retrieval
- arxiv url: http://arxiv.org/abs/2607.24165v2
- Date: Wed, 29 Jul 2026 07:29:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 14:21:10.711292
- Title: Do Current Retrievers Cover All the Evidence? A Controlled Study of Conjunctive Cross-Page Retrieval
- Title(参考訳): カレントレトリバーはすべての証拠をカバーしているか? 整合的クロスページ検索の制御された研究
- Authors: Sungguk Cha, DongWook Kim, Mintae Kim, Youngsub Han, Byoung-Ki Jeon, Sangyeob Lee,
- Abstract要約: 本研究では,1つの文書の異なるページに2つないし3つの明示的な条件を組み込まなければならない連結的文書検索のギャップについて検討する。
我々はn-Clueを制御測定器として使用しています。
70を超える構成では、2つの濃厚なバックボーンを6.8~7.3ポイント改善する。
ビジュアルシステムは、クエリの5.1~5.3%しかサポートしていない。
- 参考スコア(独自算出の注目度): 4.417775569382944
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Finding a long document relevant to a multi-part request is not the same as establishing that it contains every requested piece of evidence. We study this gap for conjunctive document retrieval, where two or three explicit conditions must be supported on different pages of one document. We use n-Clue as a controlled measurement instrument: 1{,}000 queries over 2{,}021 documents pair all-condition golds with naturally occurring documents that satisfy only a subset, and a complete-first success requires a top-10 gold to precede every released subset qrel. Across 70 configurations, condition-wise decomposition improves two dense backbones by 6.8--7.3 points and lexical--visual fusion adds 8.7, while four generic rerankers all reduce Gold-NDCG; these directions replicate on a four-source stress set. Scaling one dense family from 0.6B to 8B changes complete-first success by 0.0 points. The strongest displayed hybrid illustrates the resulting gap: it finds a gold for 81.1\% of queries but succeeds complete-first on only 35.8\%, and the gap persists across condition count, target length, candidate density, query rendering, and the four-source stress set. Finally, page-aware visual systems surface stored support for every condition on only 5.1--5.3\% of queries. These results identify condition coverage, rather than gold discovery alone, as the central bottleneck.
- Abstract(参考訳): 複数部分の要求に関連する長いドキュメントを見つけることは、要求されたすべての証拠を含むことを保証するのと同じではない。
本研究では,1つの文書の異なるページに2つないし3つの明示的な条件を組み込まなければならない,結合型文書検索のためのこのギャップについて検討する。
1{,}000 over 2{,}021 documents pair all-condition Golds with natural generated document that only a subset, and a complete-first success to a top-10 gold to ahead every released subset qrel。
70を超える構成では、2つの濃厚なバックボーンを6.8~7.3ポイント改善し、レキシカル・ビジュアル融合は8.7増加し、4つのジェネリック・リランカがすべてゴールド-NDCGを減少させ、これらの方向は4つのソースの応力セットで再現される。
0.6Bから8Bに1つの高密度なファミリーをスケーリングすると、完全な成功率を0.0ポイント変更する。
最強の表示されたハイブリッドは、81.1\%のクエリでゴールドを見つけるが、わずか35.8\%で完結し、そのギャップは条件数、ターゲット長、候補密度、クエリレンダリング、および4ソースのストレスセットを越えて持続する。
最後に、ページ認識のビジュアルシステムは、クエリの5.1--5.3\%で全ての条件のサポートを格納する。
これらの結果は、金の発見のみではなく、条件のカバレッジを中心的なボトルネックとして認識している。
関連論文リスト
- Hierarchical Evidence-Driven Reasoning for Long Document Understanding [95.51688464037096]
閉領域文書理解のための階層的・エビデンス駆動型マルチモーダルRAGフレームワークであるHIEVI-RAGを紹介する。
我々のフレームワークは、既存のオープンソースベースラインを著しく上回り、最強の報告ベースラインを平均8.05%の精度で上回ります。
論文 参考訳(メタデータ) (2026-07-06T03:08:28Z) - Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity [25.78729251210173]
Invoice Haystackは1500個の匿名化インボイス画像と200個の識別的質問応答ペアを組み合わせたベンチマークである。
Invoice Haystack は、既存のベンチマークで 0.38 (DocHaystack) と 0.31 (InfoHaystack) と比較すると平均で 0.73 である。
VL-RAGはテキストと視覚の埋め込みを協調的に利用するハイブリッド検索拡張生成フレームワークである。
論文 参考訳(メタデータ) (2026-06-24T03:17:30Z) - Novelty-Aware Agentic Retrieval: Comparing Research Contributions Through Structured Multi-Step Reasoning [0.0]
ノベルティ・アウェア・リサーチ・エージェント(英: Novelty-Aware Research Agent)は、エージェント検索システムのプロトタイプである。
RAGパイプライン上の多段階推論を6つのタイプドコントラクトコンポーネントを通じて階層化する。
論文毎のコントリビューション記録、紙レベルのオーバーラップ、問題xメソッドギャップマトリックスなど、構造化された比較アーティファクトを生成する。
論文 参考訳(メタデータ) (2026-06-20T17:04:02Z) - ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence [57.37494162084001]
チェーン・オブ・エビデンス(Chain-of-Evidence, CoE)は、すべてのクレームがエビデンス・ソースにトレース可能であることを要求する検証可能なフレームワークである。
CoE Auditはポストホック監査であり、スコア検証、仕様違反、参照検証、メソッドコードアライメントという4つの整合性チェックが全システムに均一に適用される。
論文 参考訳(メタデータ) (2026-05-25T21:30:27Z) - How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings [56.70440596502351]
昨年は20以上のオープンドキュメントパースモデルが見られたが、ベンチマークはほぼOmniDocBenchにのみ依存している。
HTML/CSSのドキュメントイメージをレンダリングするベンチマークであるPureDocBenchは、10のドメイン、66ページ、1,475ページをカバーしています。
論文 参考訳(メタデータ) (2026-05-08T09:30:31Z) - From BM25 to Corrective RAG: Benchmarking Retrieval Strategies for Text-and-Table Documents [0.0]
スパース, 密度, ハイブリッド融合, クロスエンコーダリグレード, クエリ拡張, インデックス拡張, 適応検索にまたがる10の検索戦略をベンチマークした。
我々はRecall@k,MRR,nDCGによる検索品質とNumber Matchによるエンドツーエンド生成品質を評価する。
論文 参考訳(メタデータ) (2026-04-02T07:53:40Z) - KohakuRAG: A simple RAG framework with hierarchical document indexing [1.0844295385744671]
文書構造を4段階のツリー表現で保存する階層型RAGフレームワークであるKohakuragを提案する。
われわれはWattBot 2025 Challengeの評価を行った。これは32の文書から技術的質問に答えるシステムを必要とするベンチマークである。
論文 参考訳(メタデータ) (2026-03-08T12:52:39Z) - $G^2$-Reader: Dual Evolving Graphs for Multimodal Document QA [53.491241153213565]
G2$-Readerはマルチモーダルな質問応答のためのデュアルグラフシステムである。
Qwen3-VL-32B-Instructによる$G2$-Readerの平均精度は66.21%に達し、強力なベースラインとスタンドアローンのGPT-5(53.08%)を上回った。
5つのマルチモーダルドメインにわたるVisDoMBenchでは、Qwen3-VL-32B-Instructを使った$G2$-Readerが平均精度66.21%に達し、強力なベースラインとスタンドアロンのGPT-5(53.08%)を上回っている。
論文 参考訳(メタデータ) (2026-01-29T17:52:54Z) - UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAG [82.84014669683863]
マルチモーダル検索拡張生成(MM-RAG)は,大規模言語モデルを現実世界の知識ベースに適用するための重要なアプローチである。
UniDoc-Benchは、70万の現実世界のPDFページから構築されたMM-RAGのための最初の大規模で現実的なベンチマークである。
実験により,マルチモーダルテキスト画像融合RAGシステムは,非モーダルおよび共同マルチモーダル埋め込みに基づく検索において一貫して優れていた。
論文 参考訳(メタデータ) (2025-10-04T04:30:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。