論文の概要: DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents
- arxiv url: http://arxiv.org/abs/2606.26122v1
- Date: Wed, 27 May 2026 21:21:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-28 23:46:52.33585
- Title: DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents
- Title(参考訳): DocArena: 生文書を文書検索エージェントのための制御可能な訓練環境に変える
- Authors: Jiamian Wang, Ruiyi Zhang, Tong Yu, Jing Shi, Samyadeep Basu, Rajiv Jain, Zhiqiang Tao, Tong Sun,
- Abstract要約: DocArenaは、生のドキュメントコレクションを、人間のアノテーションなしで検索エージェントのトレーニング環境に変換する。
16のドメインと49の言語にまたがる8,336のドキュメントからQAペアのDocArena-79Kを導入する。
6つのマルチモーダル文書シナリオと7つのテキストベースのQAベンチマーク実験により、DocArenaデータでトレーニングされたエージェントは、検索精度とQA品質の両方で最高のパフォーマンスを達成することが示された。
- 参考スコア(独自算出の注目度): 44.01307558575661
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Recent methods train search agents via reinforcement learning from (question, answer, evidence) tuples without requiring expert trajectories. The tuples serve as the training environment, and whose properties directly shape what search strategies and generalization abilities the agent can develop. While prior works have made encouraging progress in improving training data quality, existing environments remain predominantly text-based and existing approaches can struggle to construct training environments that are controllable, scalable, and account for multimodal data. Given this, we propose DocArena, a fully automated data curation pipeline building on the practical need for multimodal document search and question-answering. It transforms raw document collections into training environments for search agents without any human annotation. The pipeline first structures and indexes documents through MLLM-based visual perception, then profiles and leverage the cross-page information distribution to construct reasoning-intensive QA pairs, as well as performs cascaded quality assurance operations via MLLM. We introduce DocArena-79K with QA pairs from 8,336 documents spanning 16 domains and 49 languages. We further design a Doc-Search agent infrastructure that decouples visual perception from the policy model, allowing text-based LLMs to serve as the reasoning backbone for multimodal document retrieval and QA. Under a unified evaluation framework where only the policy model differs, experiments on six multimodal document scenarios and seven text-based QA benchmarks show that agents trained on DocArena data achieve the best performance on both retrieval accuracy and QA quality. Further analysis on agent search behaviors confirms the effectiveness and controllability of the constructed training environment.
- Abstract(参考訳): 近年の手法では, 専門的軌跡を必要とせず, 調査, 回答, 証拠) タプルからの強化学習による探索エージェントの訓練が行われている。
タプルは訓練環境として機能し、その特性はエージェントが開発できる探索戦略や一般化能力を直接形成する。
以前の作業は、トレーニングデータ品質の改善を奨励してきたが、既存の環境は、主にテキストベースであり、既存のアプローチは、制御可能でスケーラブルでマルチモーダルデータを考慮したトレーニング環境を構築するのに苦労する可能性がある。
そこで本稿では,マルチモーダルな文書検索と質問応答を実現するための,完全自動データキュレーションパイプラインであるDocArenaを提案する。
生文書コレクションを、人間のアノテーションを使わずに、検索エージェントのトレーニング環境に変換する。
パイプラインは、まずMLLMベースの視覚知覚を通して文書を構造化し、次にプロファイルし、ページ間の情報分布を利用して推論集約型QAペアを構築し、MLLMを介してカスケードされた品質保証操作を行う。
16のドメインと49の言語にまたがる8,336のドキュメントからQAペアのDocArena-79Kを導入する。
さらに、ポリシーモデルから視覚的知覚を分離するDoc-Searchエージェントのインフラを設計し、テキストベースのLCMをマルチモーダル文書検索およびQAのための推論バックボーンとして機能させる。
6つのマルチモーダル文書シナリオと7つのテキストベースのQAベンチマークにより、DocArenaデータで訓練されたエージェントが、検索精度とQA品質の両方で最高のパフォーマンスを達成することを示す。
エージェント探索行動のさらなる分析は、構築された訓練環境の有効性と制御性を確認する。
関連論文リスト
- GrepSeek: Training Search Agents for Direct Corpus Interaction [66.69568141699311]
GrepSeekは、コンパクトな検索エージェントを訓練し、大きなテキストコーパスから証拠を見つけ、フィルタリングし、構成する、最適化された直接コーパスインタラクション(DCI)検索エージェントである。
DCIを大規模に実用化するためには、シェルコマンドのシーケンシャルな実行とバイトエクササイズ等価性を保ちながら、シェルベースの検索を最大7.6タイムで高速化するセマンティックス保存のシャード並列実行エンジンを使用する。
論文 参考訳(メタデータ) (2026-05-28T03:37:33Z) - Navigating Large-Scale Document Collections: MuDABench for Multi-Document Analytical QA [25.155696504567718]
本稿では,大規模半構造化文書コレクションに対する解析的質問応答の課題について紹介する。
マルチドキュメント分析QAのベンチマークである MuDABench を提案する。
論文 参考訳(メタデータ) (2026-04-24T05:28:51Z) - DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding [63.257540233507626]
本稿では、構造化解析、局所化、推論のワークフローを実行するためにモデルを必要とするパラダイムを提案する。
ショートページトレーニングから超長文書への堅牢な一般化を示し、視覚的検索・拡張生成システムと自然に相乗効果を示す。
論文 参考訳(メタデータ) (2026-04-14T14:39:26Z) - Model-Document Protocol for AI Search [11.377241012645994]
原文が大規模言語モデル (LLM) にどのようにブリッジされているかを形式化する汎用フレームワークである Model-Document Protocol (MDP) を導入する。
MDPは、検索をパスフェッチとして扱う代わりに、構造化されていない文書をタスク固有のLCM対応の入力に変換する複数の経路を定義している。
本稿では,エージェントプロセスを通じてプロトコルを実現するMPP-Agentを提案する。
論文 参考訳(メタデータ) (2025-10-29T04:29:17Z) - Doc-Researcher: A Unified System for Multimodal Document Parsing and Deep Research [31.973886754355547]
Doc-Researcherは、テキストのみ、ビジョンのみ、ハイブリッドパラダイム間のギャップを埋める統一システムである。
マルチモーダル,マルチホップ,マルチドキュメント,マルチターンディープリサーチの最初のベンチマークであるM4DocBenchを紹介する。
Doc-Researcherの精度は50.6%で、最先端のベースラインよりも3.4倍高い。
論文 参考訳(メタデータ) (2025-10-24T16:07:54Z) - MMESGBench: Pioneering Multimodal Understanding and Complex Reasoning Benchmark for ESG Tasks [56.350173737493215]
環境・社会・ガバナンス(ESG)報告は、持続可能性の実践の評価、規制コンプライアンスの確保、財務透明性の促進に不可欠である。
MMESGBenchは、マルチモーダル理解と複雑な推論を、構造的に多種多様なマルチソースESG文書間で評価するための、最初のベンチマークデータセットである。
MMESGBenchは、45のESG文書から得られた933の検証済みQAペアで構成され、7つの異なるドキュメントタイプと3つの主要なESGソースカテゴリにまたがる。
論文 参考訳(メタデータ) (2025-07-25T03:58:07Z) - Unified Pretraining Framework for Document Understanding [52.224359498792836]
文書理解のための統合事前学習フレームワークであるUDocを紹介する。
UDocは、ほとんどのドキュメント理解タスクをサポートするように設計されており、Transformerを拡張してマルチモーダル埋め込みを入力とする。
UDocの重要な特徴は、3つの自己管理的損失を利用して汎用的な表現を学ぶことである。
論文 参考訳(メタデータ) (2022-04-22T21:47:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。