論文の概要: Hybrid Retriever Evolution for Multimodal Document Reasoning Agents
- arxiv url: http://arxiv.org/abs/2606.29648v1
- Date: Sun, 28 Jun 2026 23:36:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.997661
- Title: Hybrid Retriever Evolution for Multimodal Document Reasoning Agents
- Title(参考訳): マルチモーダル文書推論エージェントのハイブリッドレトリバー進化
- Authors: Bohan Yao, Shruthan Radhakrishna, Vikas Yadav,
- Abstract要約: 本稿では,メタエージェントが自律的にツール利用タスクエージェントの協調方法を検出する,障害駆動型進化フレームワークを提案する。
MMLongBench-DocとDocBenchでは、進化したエージェントは、未進化のベースライン上で最大+19.6ポイントのゲインを達成する。
- 参考スコア(独自算出の注目度): 7.9215284090523355
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Different retrievers, including lexical, semantic, and multimodal approaches, provide highly complementary strengths for multimodal document understanding, yet most systems combine them through fixed pipelines that cannot adapt to the demands of individual reasoning steps. In this work, we ask whether retrieval orchestration itself can be learned as part of the reasoning process. We introduce a failure-driven evolution framework in which a meta-agent autonomously discovers how a tool-using task agent should coordinate diverse retrievers during multi-step document question answering. The meta-agent analyzes incorrect reasoning trajectories, actively probes the same tool environment to diagnose root causes, and iteratively rewrites the task agent's instructions, turning retrieval from a fixed front-end stage into an adaptive, step-wise reasoning decision. The evolved agent learns when to invoke each retriever, how to combine them, and how to compose evidence across modalities and pages. On MMLongBench-Doc and DocBench, the evolved agent achieves gains of up to +19.6 points over the unevolved baseline and consistently outperforms recent systems including MACT, MDocAgent, and SimpleDoc. Detailed retrieval analyses confirm that these improvements arise from adaptive routing and evidence composition rather than reliance on any hard coded retrieval mode, and evolution dynamics reveal a progressive shift from narrow lexical behavior to rich multi-tool coordination. These findings establish autonomous multi-agent coordination as a promising paradigm for multimodal document reasoning.
- Abstract(参考訳): 語彙的、意味的、マルチモーダル的なアプローチを含む異なるレトリバーは、多モーダル文書理解に非常に相補的な強みを提供するが、ほとんどのシステムは、個々の推論ステップの要求に適応できない固定パイプラインを通してそれらを組み合わせている。
本研究は,検索オーケストレーション自体が推論プロセスの一部として学習できるかどうかを問うものである。
メタエージェントは,多段階の文書質問応答において,ツール使用タスクエージェントが多様なレトリバーをどのように調整すべきかを自律的に発見する,障害駆動型進化フレームワークを提案する。
メタエージェントは、誤った推論軌跡を分析し、ルート原因を診断するために、同じツール環境を積極的に探索し、タスクエージェントの指示を反復的に書き直し、固定されたフロントエンドステージからの検索を適応的で段階的な推論決定に変換する。
進化したエージェントは、各レトリバーをいつ呼び出すか、それらをどのように組み合わせるか、そして、モダリティとページをまたいでエビデンスを構成する方法を学ぶ。
MMLongBench-DocとDocBenchでは、進化したエージェントは、未進化のベースライン上で最大+19.6ポイントのゲインを達成し、MACT、MDocAgent、SimpleDocといった最近のシステムより一貫して優れている。
詳細な検索分析により、これらの改善はハードコード検索モードに依存するのではなく、適応的なルーティングとエビデンス構成から生じることが確認され、進化力学は狭い語彙的振る舞いからリッチなマルチツールコーディネートへの進歩的なシフトを示す。
これらの知見は、マルチモーダル文書推論における有望なパラダイムとして、自律的なマルチエージェント協調を確立している。
関連論文リスト
- Meta-Agent: From Task Descriptions to Verified Multi-Agent Systems [36.485119937780524]
本稿では,マルチエージェントシステムの自動構築と実行を行う2相フレームワークMeta-Agentを提案する。
本稿では,局所的,上流的,構造的障害を区別する3段階の誤り帰属機構を提案する。
強力なマルチエージェントベースラインとアブレーションスタディに対する実験では、タスク成功率、エラー回復、ワークフロー安定性が一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-05-24T19:38:54Z) - Beyond Individual Intelligence: Surveying Collaboration, Failure Attribution, and Self-Evolution in LLM-based Multi-Agent Systems [65.90791804095561]
マルチエージェントシステムは、特殊エージェント間の構造化された協調を通じてこの問題に対処するが、より厳密な調整は、あまり検討されていないリスクを増幅する。
既存の調査では、個々のエージェント能力、マルチエージェントのコラボレーション、エージェントの自己進化を別々にカバーしている。
この調査は4つの因果関係のあるステージを中心にまとめられた統一されたレビューを提供する。これはLIFEの進展(Lay the capabilities foundation)、協力によるエージェントの統合、帰属による障害の発見、自律的な自己改善によるEvolveである。
論文 参考訳(メタデータ) (2026-05-14T14:36:13Z) - TacoMAS: Test-Time Co-Evolution of Topology and Capability in LLM-based Multi-Agent Systems [55.81570336226014]
動的マルチエージェントシステムのためのテスト時間共進化フレームワークであるTacoMASを紹介する。
TacoMASはMAS推論をオンライングラフ適応のタスクとして定式化し、ノードは役割固有の能力を持つエージェントを表し、エッジはその通信トポロジを定義する。
4つのベンチマークの実験では、TacoMASは20近いマルチエージェントベースラインを上回り、最強ベースラインよりも平均13.3%向上した。
論文 参考訳(メタデータ) (2026-05-10T13:52:00Z) - Experience as a Compass: Multi-agent RAG with Evolving Orchestration and Agent Prompts [22.323342919724492]
HERAは階層的なフレームワークで、マルチエージェントオーケストレーションとロール固有のエージェントプロンプトを共同で進化させる。
HERAは最近のベースラインよりも平均38.69%改善している。
トポロジカル分析により、スパース探索がコンパクトで高ユーティリティなマルチエージェントネットワークを生み出す創発的な自己組織化が明らかになった。
論文 参考訳(メタデータ) (2026-04-01T13:45:52Z) - ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering [8.852709980681626]
ORCA: 文書視覚質問応答のための協調エージェントを用いたオーケストレーション推論について述べる。
我々のフレームワークは、それぞれが異なるモダリティに特化している専門的なAIエージェントのセットを活用し、さまざまなドキュメントコンポーネントをまたいだ詳細な理解と協調的推論を可能にします。
提案手法は最先端の手法よりも大幅に改善され,視覚的きめ細かな推論における協調エージェントシステムのための新しいパラダイムが確立される。
論文 参考訳(メタデータ) (2026-03-02T22:21:25Z) - Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection [59.04089915447622]
ForenAgentはインタラクティブなIFDフレームワークで、MLLMが検出対象に関するPythonベースの低レベルツールを自律的に生成、実行、洗練することができる。
人間の推論にインスパイアされた我々は、グローバルな認識、局所的な焦点、反復的探索、そして全体論的偏見を含む動的推論ループを設計する。
実験の結果,ForenAgent は IFD 課題に対する創発的なツール利用能力と反射的推論を示すことがわかった。
論文 参考訳(メタデータ) (2025-12-18T08:38:44Z) - Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding [49.26132236798123]
視覚言語モデル(VLM)は、文書理解における主要なアプローチになりつつある。
本稿では,粗いプロセスにおいて,検索者と4つの協調エージェントを編成するマルチエージェントフレームワークSLEUTHを提案する。
このフレームワークは、検索したページ内の重要なテキストおよび視覚的手がかりを特定し、テーブルやチャートなどの健全な視覚的エビデンスをフィルタし、クエリを分析して推論戦略を考案する。
論文 参考訳(メタデータ) (2025-11-28T03:09:40Z) - SIRAG: Towards Stable and Interpretable RAG with A Process-Supervised Multi-Agent Framework [7.37561751991963]
本稿では,レシーバとジェネレータのギャップを埋めるプロセス管理型マルチエージェントフレームワークを提案する。
提案するフレームワークはモジュール式でプラグアンドプレイで、レトリバーやジェネレータを変更する必要はない。
論文 参考訳(メタデータ) (2025-09-17T09:09:28Z) - MAMM-Refine: A Recipe for Improving Faithfulness in Generation with Multi-Agent Collaboration [63.31211701741323]
我々はマルチエージェント・マルチモデル推論を生成にまで拡張し、特に改良による忠実度の向上を図っている。
我々は,各サブタスクに対して固有の評価を設計し,マルチエージェント(複数インスタンス)とマルチモデル(多変数LPMタイプ)の両方がエラー検出やクオリティクスに有効であることを示す。
我々はこれらの知見を、マルチエージェント・マルチモデル・リファインメント(MAMM-Refinement)と呼ばれる最終的な"レシピ"に統合し、マルチエージェント・マルチモデルコラボレーションがパフォーマンスを大幅に向上させる。
論文 参考訳(メタデータ) (2025-03-19T14:46:53Z) - Learning Refined Document Representations for Dense Retrieval via Deliberate Thinking [58.69615583599489]
Deliberate Thinking based Retriever (Debater) は、段階的な思考プロセスを導入することで文書表現を強化する新しいアプローチである。
Debaterは、いくつかのベンチマークで既存のメソッドよりも大幅に優れています。
論文 参考訳(メタデータ) (2025-02-18T15:56:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。