論文の概要: HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering
- arxiv url: http://arxiv.org/abs/2607.29638v1
- Date: Fri, 31 Jul 2026 17:17:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.833753
- Title: HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering
- Title(参考訳): HierDoc: 長いドキュメントの視覚的質問応答のための階層的なページ・ツー・レジデンス・ルーティング
- Abstract要約: 複数ページの視覚的質問応答には、ページレベルと地域レベルの両方でスパースエビデンスを見つける必要がある。
文書の長期取得を2段階の予測として定式化する階層的エビデンスルーティングフレームワークであるHierDocを提案する。
HierDocは,オープンウェイトシステム間での最先端ないし競争的なパフォーマンスを実現していることを示す。
- 参考スコア(独自算出の注目度): 89.21987002412051
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-page document visual question answering requires locating sparse evidence at both the page and region levels. Existing approaches typically emphasize one level over the other: page-centric methods focus on page acquisition, with region operations serving mainly as navigation aids, whereas region-centric methods assume that the relevant pages have already been supplied. Consequently, page and region selection remain disconnected rather than forming successive evidence decisions. We propose HierDoc, a hierarchical evidence-routing framework that formulates long-document evidence acquisition as two-stage set prediction from pages to regions. A page policy selects evidence pages from the full document; these pages are then parsed for semantic elements, after which a region policy selects the elements passed to a downstream answer model. Both answer-agnostic policies are optimized with stage-wise GRPO using granularity-specific structured-set rewards. The answer model receives selected full pages together with selected region crops and OCR or table text, preserving global context while emphasizing fine-grained evidence. Across the evaluated benchmarks, HierDoc achieves state-of-the-art or competitive performance among open-weight systems, improving LongDocURL by 16.87% relative to the strongest reported open-weight baseline. Controlled ablations further show that selected regional evidence improves the page-only system in accuracy and F1 by 5.51% and 4.82%, respectively. These results demonstrate the benefit of organizing coarse page routing and fine-grained region routing as successive, separately optimized stages of a unified evidence-acquisition process.
- Abstract(参考訳): 複数ページの視覚的質問応答には、ページレベルと地域レベルの両方でスパースエビデンスを見つける必要がある。
ページ中心の手法はページの取得に焦点を合わせ、地域操作は主にナビゲーション補助として機能するが、地域中心の手法は関連ページが既に供給されていると仮定する。
その結果、ページとリージョンの選択は、連続したエビデンス決定を形成するのではなく、切り離されたままである。
ページから地域への2段階のセット予測として長期文書の取得を定式化する階層的エビデンスルーティングフレームワークであるHierDocを提案する。
ページポリシーは、全文書からエビデンスページを選択し、これらのページは、セマンティックな要素に対して解析され、その後、リージョンポリシーは、下流の回答モデルに渡される要素を選択する。
どちらの回答に依存しないポリシーも、粒度特異的な構造化セットの報酬を用いて、ステージワイズGRPOで最適化される。
回答モデルは、選択された全ページを、選択された地域作物やOCR、テーブルテキストとともに受信し、粒度の細かい証拠を強調しながら、グローバルなコンテキストを保存する。
評価されたベンチマーク全体で、HierDocはオープンウェイトシステムの最先端または競合的な性能を達成し、最強の報告されたオープンウェイトベースラインと比較してLongDocURLを16.87%改善した。
制御された改善により、選択された地域証拠によってページのみの精度が向上し、F1は5.51%、F1は4.82%向上した。
これらの結果は、統一されたエビデンス獲得プロセスの連続的かつ個別に最適化された段階として、粗いページルーティングときめ細かい領域ルーティングを編成する利点を示す。
関連論文リスト
- Hierarchical Evidence-Driven Reasoning for Long Document Understanding [95.51688464037096]
閉領域文書理解のための階層的・エビデンス駆動型マルチモーダルRAGフレームワークであるHIEVI-RAGを紹介する。
我々のフレームワークは、既存のオープンソースベースラインを著しく上回り、最強の報告ベースラインを平均8.05%の精度で上回ります。
論文 参考訳(メタデータ) (2026-07-06T03:08:28Z) - HMARS: A Hierarchical Multi-Agent Memory System for Long-Context Reasoning [17.783618926697066]
長いコンテキスト推論は、文書、対話、相互作用履歴に散在する証拠にアクセス、検索、統合するモデルを必要とする。
本研究では,長いコンテキストをフラットな検索コーパスではなく管理メモリとして扱う階層型マルチエージェントメモリシステムであるHMARSを提案する。
論文 参考訳(メタデータ) (2026-06-03T07:15:11Z) - Structures Facilitate Retrieve, Rerank, and Generate [11.039868951381164]
文書地上対話システム(DGDS)は、外部文書からの知識を利用してドメイン固有のユーザー質問に答える。
本稿では,このような問題に体系的に対処するSF-Re2Gを提案する。
論文 参考訳(メタデータ) (2026-06-02T07:09:41Z) - HiKEY: Hierarchical Multimodal Retrieval for Open-Domain Document Question Answering [19.052998569565627]
HiKEYは階層木に基づくマルチモーダル検索フレームワークであり、文書階層を1級検索信号に高める。
ODQAベンチマークの実験では、HiKEYはページベースとチャンクベースのベースラインを大きく上回っている。
論文 参考訳(メタデータ) (2026-05-28T08:42:21Z) - DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding [29.270128057512284]
本稿では,長期文書QAを構造化推論軌道予測問題として定式化するベンチマークであるDocScopeを紹介する。
軌道の各レベルを独立に監査する4段階評価プロトコルを設計する。
6つのプロプライエタリなモデル、12のオープンウェイトモデル、いくつかのドメイン固有のシステムをベンチマークします。
論文 参考訳(メタデータ) (2026-05-09T11:12:59Z) - Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA [71.42483000929614]
複数ページのドキュメント 視覚的質問回答は、長い、視覚的に密集したドキュメントにおける意味論、レイアウト、および視覚的要素の推論を必要とする。
我々は,多ページDocVQAをシーケンシャルエビデンスアグリゲーションとしてキャストするtextbfOCRフリーエージェントフレームワークであるDoc-$V*$を提案する。
論文 参考訳(メタデータ) (2026-04-15T11:12:27Z) - DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding [63.257540233507626]
本稿では、構造化解析、局所化、推論のワークフローを実行するためにモデルを必要とするパラダイムを提案する。
ショートページトレーニングから超長文書への堅牢な一般化を示し、視覚的検索・拡張生成システムと自然に相乗効果を示す。
論文 参考訳(メタデータ) (2026-04-14T14:39:26Z) - MoDora: Tree-Based Semi-Structured Document Analysis System [62.01015188258797]
半構造化文書は、様々な不規則なレイアウトで配置された様々なインターリーブされたデータ要素を統合する。
MoDora は半構造化文書解析のための LLM を利用したシステムである。
実験では、MoDoraは5.97%-61.07%の精度でベースラインを上回っている。
論文 参考訳(メタデータ) (2026-02-26T14:48:49Z) - RegionRAG: Region-level Retrieval-Augumented Generation for Visually-Rich Documents [40.107303323097646]
Modelnameは、検索パラダイムをドキュメントレベルからリージョンレベルにシフトする、新しいフレームワークです。
6つのベンチマークの実験は、RereaRAGが最先端のパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2025-10-31T08:00:32Z) - RDU: A Region-based Approach to Form-style Document Understanding [69.29541701576858]
キー情報抽出(KIE)は,フォーム形式の文書から構造化された情報を抽出することを目的としている。
我々は、Rerea-based Understanding Document (RDU) と呼ばれる新しいKIEモデルを開発する。
RDUは文書のテキスト内容と対応する座標を入力として、バウンディングボックスのような領域をローカライズして結果を予測しようとする。
論文 参考訳(メタデータ) (2022-06-14T14:47:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。