論文の概要: DocAtlas: Long-Document Understanding as Mutable-State Interaction
- arxiv url: http://arxiv.org/abs/2608.07527v1
- Date: Tue, 21 Jul 2026 09:45:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 01:32:04.547671
- Title: DocAtlas: Long-Document Understanding as Mutable-State Interaction
- Title(参考訳): DocAtlas: 可変状態インタラクションとしての長期ドキュメント理解
- Abstract要約: 本稿では,長期文書理解を可変状態情報探索プロセスとして扱うDocAtlasを提案する。
ドキュメントと質問が与えられた後、DocAtlasは検索、読み取り、メモ取り、レビューツールを公開し、階層的なツリーとノートストアを維持し、エージェントが証拠を記録するように更新する。
GPT-5.4では、DocAtlasはMMLongBench-Docで71.4%に達し、65.8%という人間の専門的基準を超えた。
- 参考スコア(独自算出の注目度): 67.90400271544678
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-document understanding requires models to find and combine evidence across many pages, layouts, tables, figures, and charts. Existing retrieval-augmented systems usually select evidence from a static index before generation, while recent agentic systems add multi-turn tool use but often rely on frozen proprietary backbones whose behavior is set by prompts. We present DocAtlas, a system that treats long-document understanding as a mutable-state information-seeking process. We instantiate DocAtlas as a mutable document harness: an external environment that determines what document information is searched, read, stored, reviewed, and shown to the model at each step. Given a document and question, the harness exposes search, reading, note-taking, and review tools, maintains a hierarchical tree and note store, and updates both as the agent records evidence. DocAtlas combines self-improving retrieval, selective evidence access, and active working memory under a fixed context budget. The same harness supports inference-time use with large VLMs and end-to-end reinforcement learning for compact VLM agents. With GPT-5.4, DocAtlas reaches 71.4\% on MMLongBench-Doc, exceeding the human-expert reference of 65.8\%. A Qwen3.5-4B VLM trained with end-to-end RL in the DocAtlas environment reaches 63.7\%, compared with a 54.4\% direct-input baseline, showing that mutable document-harness design can improve compact document agents by a large margin.
- Abstract(参考訳): 長い文書の理解には、多くのページ、レイアウト、表、図、チャートにまたがるエビデンスを見つけ、組み合わせるモデルが必要である。
既存の検索拡張システムは、生成前に静的インデックスからエビデンスを選択するのが一般的であるが、最近のエージェントシステムはマルチターンツールを使用するが、しばしばプロンプトによって動作が設定されるフリーズプロプライエタリなバックボーンに依存する。
本稿では,長期文書理解を可変状態情報探索プロセスとして扱うDocAtlasを提案する。
DocAtlasを変更可能なドキュメントハーネスとしてインスタンス化する:どのドキュメント情報が検索、読み込み、保存、レビューされ、各ステップでモデルに表示されるかを決定する外部環境。
文書と質問が与えられた場合、ハーネスは検索、読み取り、メモ取り、レビューツールを公開し、階層的なツリーとノートストアを維持し、エージェントが証拠を記録するときに両方を更新する。
DocAtlasは、自己改善された検索、選択的エビデンスアクセス、および固定されたコンテキスト予算の下でアクティブなワーキングメモリを組み合わせる。
同じハーネスは、大規模なVLMによる推論時間の使用と、コンパクトなVLMエージェントのためのエンドツーエンドの強化学習をサポートする。
GPT-5.4では、DocAtlasはMMLongBench-Docで71.4\%に達した。
Qwen3.5-4B VLMはDocAtlas環境でエンドツーエンドのRLで訓練され、54.4\%の直接入力ベースラインと比較して63.7\%に達する。
関連論文リスト
- DocNavRAG: Document-Structured Graph RAG with Stateful Evidence Construction for Complex Document Question Answering [22.38959921864722]
文書階層と地域間関係をナビゲート可能なグラフに整理するDocNavRAGを紹介する。
DocNavRAGは4つの長期およびマルチドキュメントQAベンチマークで、最強のベースラインに対する回答品質とコンテキスト満足度を平均で7.8%と17.7%改善した。
論文 参考訳(メタデータ) (2026-08-03T00:48:05Z) - MAGE-RAG: Multigranular Adaptive Graph Evidence for Agentic Multimodal RAG in Long-Document QA [14.865891513918278]
長い文書のマルチモーダルな質問応答には、長いPDFでスパースエビデンスを見つけるシステムが必要である。
本稿では,長期文書マルチモーダルQAのための多言語適応グラフエビデンスフレームワークであるMAGE-RAGを提案する。
論文 参考訳(メタデータ) (2026-06-14T16:34:15Z) - Trace Only What You Need: Structure-Aware On-Demand Hypergraph Memory for Long-Document Question Answering [11.17007249581283]
長い文書の質問応答は、長い文書に散在する証拠を推論するために大きな言語モデルを必要とする。
既存の構造化RAG手法には,コストのかかるクエリ非依存の知識組織,オリジナルドキュメント構造の使用不足,歴史的推論経験の再利用の3つの制限がある。
本稿では、問合せトリガードナレッジ組織、文書構造認識、経験誘導推論をサポートする長期文書QAのためのマルチエージェントRAGフレームワークDocTraceを提案する。
論文 参考訳(メタデータ) (2026-06-09T14:29:06Z) - Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing [53.41293908252118]
我々は、エキスパートレベルの文書解析のための困難を意識したベンチマークであるDocBench博士を紹介する。
Dr. DocBenchは52のBISACドメインにまたがり、障害ベースのサンプリングによってドキュメントを選択する。
約100ページにわたる長いドキュメントから4,514ページの注釈付きページが含まれており、レイアウト、読み込み順序、階層的関係、ドメイン固有のビジュアルコンテンツなど、65kの高品質なアノテーションがある。
本分析では,文書インテリジェンスを診断・進展するための総合的なテストベッドとしてDocBench博士が注目されている。
論文 参考訳(メタデータ) (2026-05-31T18:35:30Z) - DocQAC: Adaptive Trie-Guided Decoding for Effective In-Document Query Auto-Completion [8.602282135498108]
DocQACは、ユーザーがより高速で正確なクエリを作成できるようにすることで、長いドキュメント内の検索生産性を向上させることを目指している。
ユーザクエリプレフィックスを用いて,言語モデルをソフトに操り,高品質な補完を実現するための適応型トリエン誘導型デコーディングフレームワークを提案する。
提案手法は, ORCAS から派生した新しい DocQAC ベンチマークで評価する。
論文 参考訳(メタデータ) (2026-04-20T13:30:45Z) - Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA [71.42483000929614]
複数ページのドキュメント 視覚的質問回答は、長い、視覚的に密集したドキュメントにおける意味論、レイアウト、および視覚的要素の推論を必要とする。
我々は,多ページDocVQAをシーケンシャルエビデンスアグリゲーションとしてキャストするtextbfOCRフリーエージェントフレームワークであるDoc-$V*$を提案する。
論文 参考訳(メタデータ) (2026-04-15T11:12:27Z) - BigDocs: An Open Dataset for Training Multimodal Models on Document and Code Tasks [57.589795399265945]
我々は,30タスクにわたる750万のマルチモーダルドキュメントからなる高品質なオープンアクセスデータセットであるBigDocs-7.5Mを紹介した。
BigDocs-Benchも導入しています。
実験の結果,BigDocs-Bench を用いたトレーニングでは,クローズドソース GPT-4o よりも平均性能が 25.8% 向上していることがわかった。
論文 参考訳(メタデータ) (2024-12-05T21:41:20Z) - M-Longdoc: A Benchmark For Multimodal Super-Long Document Understanding And A Retrieval-Aware Tuning Framework [75.95430061891828]
851サンプルのベンチマークであるM-LongDocと、大規模マルチモーダルモデルの性能を評価するための自動フレームワークを紹介する。
効率的なマルチモーダル文書読解のための検索対応チューニング手法を提案する。
論文 参考訳(メタデータ) (2024-11-09T13:30:38Z) - M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding [63.33447665725129]
M3DocRAGは、様々な文書コンテキストに柔軟に対応する新しいマルチモーダルRAGフレームワークである。
M3DocRAGは視覚情報を保存しながら、単一の文書や多数の文書を効率的に処理できる。
M3DocVQAはオープンドメインDocVQAを3,000以上のPDFドキュメントと4万以上のページで評価するための新しいベンチマークである。
論文 参考訳(メタデータ) (2024-11-07T18:29:38Z) - DAPR: A Benchmark on Document-Aware Passage Retrieval [57.45793782107218]
我々は,このタスクemphDocument-Aware Passage Retrieval (DAPR)を提案する。
State-of-The-Art(SoTA)パスレトリバーのエラーを分析しながら、大きなエラー(53.5%)は文書コンテキストの欠如に起因する。
提案するベンチマークにより,検索システムの開発・比較を今後行うことができる。
論文 参考訳(メタデータ) (2023-05-23T10:39:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。