論文の概要: Hierarchical Evidence-Driven Reasoning for Long Document Understanding
- arxiv url: http://arxiv.org/abs/2607.04625v1
- Date: Mon, 06 Jul 2026 03:08:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.023651
- Title: Hierarchical Evidence-Driven Reasoning for Long Document Understanding
- Title(参考訳): 長期文書理解のための階層的エビデンス駆動推論
- Abstract要約: 閉領域文書理解のための階層的・エビデンス駆動型マルチモーダルRAGフレームワークであるHIEVI-RAGを紹介する。
我々のフレームワークは、既存のオープンソースベースラインを著しく上回り、最強の報告ベースラインを平均8.05%の精度で上回ります。
- 参考スコア(独自算出の注目度): 95.51688464037096
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieval-Augmented Generation (RAG) streamlines long-document understanding by leveraging retrieval mechanisms to restrict input images to a highly curated subset. However, existing multimodal RAG pipelines primarily face two critical challenges: first, standard semantic similarity retrievers frequently fetch topically overlapping yet answer-void distractor pages that mislead downstream generation; second, rigid single-pass pipelines heavily depend on initial retrieval success, where any omission of core evidence inevitably causes cascading errors. To address these challenges, we introduce HIEVI-RAG, a hierarchical, evidence-driven multimodal RAG framework for closed-domain document understanding. HIEVI-RAG systematically factorizes complex queries into a cooperative four-stage pipeline: (1) hierarchical question decomposition to break multi-hop root queries into atomic child questions; (2) coarse visual page retrieval leveraging a multimodal retriever to fetch candidate pages based on semantic similarity; (3) fine-grained page verification via EVIAGENT, a specialized multi-page verifier trained with GRPO to execute cross-page reasoning over multi-image blocks; and (4) memory-guided iterative generation that leverages accumulated sub-question context to execute multi-round, dynamic reasoning over the prioritized sequence. Extensive evaluations across four benchmarks demonstrate the robust efficacy and synergy of our framework, which significantly outperforms existing open-source baselines and exceeds the strongest reported baseline by an average of 8.05% in accuracy.
- Abstract(参考訳): Retrieval-Augmented Generation (RAG)は、検索機構を利用して入力画像を高度にキュレートされたサブセットに制限することで、長期文書理解を効率化する。
しかし、既存のマルチモーダルRAGパイプラインは、主に2つの重要な課題に直面している: 第一に、標準的なセマンティック類似性レトリバーは、ダウンストリーム生成をミスリードする、位相的に重なり合うが、応答をボイドするイントラクタページをしばしばフェッチする。
これらの課題に対処するために,HIEVI-RAGという階層的,エビデンス駆動型マルチモーダルRAGフレームワークを導入する。
HIEVI-RAGは、複雑なクエリを体系的に4段階のパイプラインに分類する:(1) 階層的質問分解(hierarchical question decomposition to break multi-hop root query into atomic child questions)、(2) 意味的類似性に基づいて候補ページを取得するためのマルチモーダル検索(multimodal retriever)を利用した粗いビジュアルページ検索(coarse visual page acquisition)、(3) GRPOで訓練されたマルチページ検証器であるEVIAGENT(英語版)による、マルチイメージブロック上でのクロスページ推論を実行するための、メモリ誘導反復生成(英語版)、(4) 優先度付きシーケンス上で、蓄積されたサブクエストコンテキストを利用したマルチラウンド動的推論(mul-round, dynamic reasoning)を実行する。
4つのベンチマークにわたる大規模な評価は、我々のフレームワークの堅牢な有効性と相乗効果を示し、これは既存のオープンソースベースラインを著しく上回り、最強のベースラインを平均8.05%の精度で上回っている。
関連論文リスト
- CrossModalQA: A Cross-modal and Multi-hop Benchmark for Multimodal Retrieval-augmented Generation [15.857678905969273]
CrossModalQAは、異種コーパス上のマルチモーダル検索と推論を評価するためのオープンドメインベンチマークである。
視覚からテキストへの道、テキストからテキストへの道、視覚からテキストへの道、複数画像の交叉、画像集合の推論の5つの相補的推論経路を網羅している。
論文 参考訳(メタデータ) (2026-08-31T16:00:59Z) - Generative Universal Multimodal Retrieval with Dual-role Identifiers [1.0981910170846492]
本稿ではDrIGを提案する。DrIGはDual-role Identifierを特徴とするユニバーサルマルチモーダル検索のための新しい生成フレームワークである。
DrIGは、多種多様なタスクにまたがって、最先端のマルチモーダルベースラインを一貫して上回り、一方、ハイブリッドリグレードは、強い高密度レトリバーに対して好適な効率効率効率のトレードオフを実現する。
論文 参考訳(メタデータ) (2026-08-13T09:10:09Z) - HiKEY: Hierarchical Multimodal Retrieval for Open-Domain Document Question Answering [19.052998569565627]
HiKEYは階層木に基づくマルチモーダル検索フレームワークであり、文書階層を1級検索信号に高める。
ODQAベンチマークの実験では、HiKEYはページベースとチャンクベースのベースラインを大きく上回っている。
論文 参考訳(メタデータ) (2026-05-28T08:42:21Z) - Subtraction Gets You More: Gap-Aware Retrieval for Multimodal Multi-Hop QA [11.316299961548415]
本稿では,埋め込みレベルで直接暗黙的なクエリ書き換えを行うパラダイムを提案する。
コンテクスト・サブトラクティブなクエリ・ステアリングにより、GRAILはコンストラクショナル・クロスモーダルな推論において優れている。
タスクタイプに基づいたクエリを動的にルーティングすることで、MultimodalQA上で40.3%のマクロ平均パフォーマンス向上を実現しています。
論文 参考訳(メタデータ) (2026-05-27T15:46:21Z) - LFRAG: Layout-oriented Fine-grained Retrieval-Augmented Generation on Multimodal Document Understanding [23.227000200423458]
本稿では,ページレベルからブロックレベルまで多モードRAGを進化させる新しいフレームワークLFRAGを提案する。
ブロックレベルの遅延検索により、LFRAGは正確なクエリコンテンツアライメントを可能にし、ダウンストリーム生成のための無関係なコンテンツを削減する。
LFDocQAの実験では、LFRAGは検索タスクにおける最先端のパフォーマンスを達成し、解答精度が7.20%向上し、生成タスクにおけるトークン消費が73.07%減少した。
論文 参考訳(メタデータ) (2026-04-18T05:04:49Z) - DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding [63.257540233507626]
本稿では、構造化解析、局所化、推論のワークフローを実行するためにモデルを必要とするパラダイムを提案する。
ショートページトレーニングから超長文書への堅牢な一般化を示し、視覚的検索・拡張生成システムと自然に相乗効果を示す。
論文 参考訳(メタデータ) (2026-04-14T14:39:26Z) - NaviRAG: Towards Active Knowledge Navigation for Retrieval-Augmented Generation [50.16741209529908]
NaviRAGは、パッシブセグメント検索からアクティブな知識ナビゲーションに移行する新しいフレームワークである。
NaviRAGは従来のRAGベースラインよりも検索リコールとエンドツーエンドの応答性能を一貫して改善することを示す。
論文 参考訳(メタデータ) (2026-04-14T14:07:01Z) - LILaC: Late Interacting in Layered Component Graph for Open-domain Multimodal Multihop Retrieval [13.855117422052315]
LILaCは2つのコアイノベーションを特徴とするマルチモーダル検索フレームワークである。
まず,2つのレイヤにおけるマルチモーダル情報を明示的に表現した階層化コンポーネントグラフを提案する。
次に,遅延相互作用に基づくサブグラフ検索手法を提案する。
論文 参考訳(メタデータ) (2026-02-04T06:55:48Z) - MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering [51.19392014547221]
検索型マルチモーダル文書QAは,視覚的にリッチな文書から複雑なマルチモーダル構造を持つ関連情報を識別し,統合することを目的としている。
現在のアプローチは、サージェントなコンテンツを見渡すクエリに依存しないドキュメント表現に依存しています。
本稿では,クエリ適応生成を導入したMultimodal Adaptive Retrieval-Augmented (MARA)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-01T12:27:40Z) - Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding [49.26132236798123]
視覚言語モデル(VLM)は、文書理解における主要なアプローチになりつつある。
本稿では,粗いプロセスにおいて,検索者と4つの協調エージェントを編成するマルチエージェントフレームワークSLEUTHを提案する。
このフレームワークは、検索したページ内の重要なテキストおよび視覚的手がかりを特定し、テーブルやチャートなどの健全な視覚的エビデンスをフィルタし、クエリを分析して推論戦略を考案する。
論文 参考訳(メタデータ) (2025-11-28T03:09:40Z) - Reasoning-enhanced Query Understanding through Decomposition and Interpretation [87.56450566014625]
ReDIは、分解と解釈によるクエリ理解のための推論強化アプローチである。
我々は,大規模検索エンジンから実世界の複雑なクエリの大規模データセットをコンパイルした。
BRIGHT と BEIR の実験により、ReDI はスパースと密度の高い検索パラダイムの両方において、強いベースラインを一貫して超えることを示した。
論文 参考訳(メタデータ) (2025-09-08T10:58:42Z) - DIVER: A Multi-Stage Approach for Reasoning-intensive Information Retrieval [36.38599923075882]
DIVERは、推論集約的な情報検索のために設計された検索パイプラインである。
ドキュメント前処理ステージ、クエリ拡張ステージ、検索ステージ、再ランクステージの4つのコンポーネントで構成されている。
BRIGHTベンチマークでは、DIVERは最先端のnDCG@10スコアを45.8点、オリジナルクエリでは28.9点と達成し、競争力のある推論モデルを上回っている。
論文 参考訳(メタデータ) (2025-08-11T13:57:49Z) - Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering [60.062194349648195]
Document Visual Question Answering (DocVQA)は、長いマルチモーダル文書の処理において2つの課題に直面している。
現在の文書検索拡張生成法(DocRAG)はテキスト中心のアプローチによって制限されている。
MMDocRAGは,多ページのクロスモーダルエビデンスチェーンを持つ4,055のエキスパートアノテーション付きQAペアを特徴とする総合ベンチマークである。
論文 参考訳(メタデータ) (2025-05-22T09:52:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。