論文の概要: Reason Before You Retrieve: Agentic Planning for Multi-modal RAG
- arxiv url: http://arxiv.org/abs/2607.22643v1
- Date: Wed, 24 Jun 2026 02:40:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.002961
- Title: Reason Before You Retrieve: Agentic Planning for Multi-modal RAG
- Title(参考訳): 検索前の推論:マルチモーダルRAGのエージェントプランニング
- Abstract要約: 本稿では,検索対象と検索対象の両方を明示的にモデル化することで,検索前の理由付けを行うマルチモーダルエージェント検索フレームワークMM-R2を提案する。
MM-R2は、まず、画像検索ペアからインテントグラウンドされた検索状態を構築し、情報要求、グラウンドドレファレント、検索制約をキャプチャする。
その後、構造化されたKnowledgeMap上で検索を行い、エージェントが関連する検索ユニットを選択して、内部にグラウンドドクエリを発行する。
Infoseek と Encyclopedic VQA データセットの実験により、MM-R2 は解答精度でかなり高いベースラインを上回り、より解釈可能で検証可能な検索軌道を得ることが示された。
- 参考スコア(独自算出の注目度): 37.890744636035144
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal retrieval-augmented generation (mRAG) aims to answer image-text queries with external knowledge, but most existing systems still retrieve directly from raw multimodal input over a flat evidence space. This design often struggles with two key challenges: the retrieval target is under-specified because the question intent must be grounded to the correct visual referent, and the search space is weakly structured, forcing semantically distinct evidence to compete in a single global ranking step. We propose MM-R2, a multimodal agentic retrieval framework that reasons before retrieval by explicitly modeling both what to retrieve and where to search. MM-R2 first constructs an intent-grounded retrieval state from the image-question pair, capturing the information need, grounded referent, and retrieval constraints. It then performs retrieval over a structured KnowledgeMap, where the agent selects relevant retrieval units before issuing grounded queries within them. To enable this capability, we build MM-R2-Traj, a large-scale trajectory dataset of multi-step retrieval processes, and adopt a two-stage post-training strategy with supervised fine-tuning and GRPO. Experiments on Infoseek and Encyclopedic VQA datasets show that MM-R2 substantially outperforms strong baselines on answer accuracy while also yielding more interpretable and verifiable retrieval trajectories.
- Abstract(参考訳): マルチモーダル検索拡張生成(mRAG)は、画像テキストクエリに外部知識で答えることを目的としているが、既存のシステムのほとんどは、フラットなエビデンス空間上の生マルチモーダル入力から直接取得する。
この設計はしばしば2つの重要な課題に悩まされる: 探索対象は、質問意図が正しい視覚的参照に基礎を置いている必要があり、探索空間は弱く構造化されており、意味的に異なる証拠を単一のグローバルなランキングステップで競合させなければならないからである。
本稿では,検索対象と検索対象の両方を明示的にモデル化することで,検索前の理由付けを行うマルチモーダルエージェント検索フレームワークMM-R2を提案する。
MM-R2は、まず、画像検索ペアからインテントグラウンドされた検索状態を構築し、情報要求、グラウンドドレファレント、検索制約をキャプチャする。
その後、構造化されたKnowledgeMap上で検索を行い、エージェントが関連する検索ユニットを選択して、内部にグラウンドドクエリを発行する。
この機能を実現するために,多段階探索プロセスの大規模トラジェクトリデータセットであるMM-R2-Trajを構築し,教師付き微調整とGRPOを用いた2段階後学習戦略を採用する。
Infoseek と Encyclopedic VQA データセットの実験により、MM-R2 は解答精度でかなり高いベースラインを上回り、より解釈可能で検証可能な検索軌道を得ることが示された。
関連論文リスト
- Pixel-Grounded Retrieval for Knowledgeable Large Multimodal Models [58.46663983451155]
PixSearchは、地域レベルの認識と検索強化推論を統合する、エンドツーエンドのLMM(Large Multimodal Model)である。
エンコーディング中、PixSearchは検索をトリガーする検索>トークンを出力し、クエリのモダリティ(テキスト、画像、リージョン)を選択し、ビジュアルクエリとして直接機能するピクセルレベルのマスクを生成する。
エゴセントリックでエンティティ中心のVQAベンチマークでは、PixSearchは事実整合性と一般化を大幅に改善する。
論文 参考訳(メタデータ) (2026-01-27T00:46:08Z) - Recurrence Meets Transformers for Universal Multimodal Retrieval [59.92546492752452]
ReT-2は画像とテキストの両方からなるマルチモーダルクエリをサポートする統合検索モデルである。
検索構成の異なるM2KRとM-BEIRのベンチマークでReT-2を評価する。
検索強化された生成パイプラインに統合されると、ReT-2はEncyclopedic-VQAとInfoSeekデータセットのダウンストリームのパフォーマンスも向上する。
論文 参考訳(メタデータ) (2025-09-10T18:00:29Z) - Fishing for Answers: Exploring One-shot vs. Iterative Retrieval Strategies for Retrieval Augmented Generation [11.180502261031789]
Retrieval-Augmented Generation (RAG) は、LLM(Large Language Models)に基づく、業界におけるクローズドソース文書の理解とクエリのための強力なソリューションである。
しかしながら、基本的なRAGは、法律および規制領域における複雑なQAタスクに苦しむことが多い。
証拠のカバレッジを改善し、品質に答えるための2つの戦略を探求する。
論文 参考訳(メタデータ) (2025-09-05T05:44:50Z) - MMSearch-R1: Incentivizing LMMs to Search [49.889749277236376]
MMSearch-R1は,実世界のインターネット環境において,オンデマンドでマルチターン検索が可能な,初のエンドツーエンド強化学習フレームワークである。
本フレームワークは画像検索とテキスト検索の両方を統合し,検索ペナルティによる結果に基づく報酬によって,モデルがいつ,どのように呼び出すかの判断を可能にする。
論文 参考訳(メタデータ) (2025-06-25T17:59:42Z) - Benchmarking Multimodal Retrieval Augmented Generation with Dynamic VQA Dataset and Self-adaptive Planning Agent [92.5712549836791]
マルチモーダル大規模言語モデル(MLLM)に固有の「ハロシン化」問題を緩和する上で,mRAG(Multimodal Retrieval Augmented Generation)が重要な役割を果たしている。
マルチモーダル検索のための自己適応型計画エージェントOmniSearchを提案する。
論文 参考訳(メタデータ) (2024-11-05T09:27:21Z) - End-to-end Knowledge Retrieval with Multi-modal Queries [50.01264794081951]
ReMuQは、テキストと画像のクエリからコンテンツを統合することで、大規模なコーパスから知識を取得するシステムを必要とする。
本稿では,入力テキストや画像を直接処理し,関連する知識をエンドツーエンドで検索する検索モデルReViz'を提案する。
ゼロショット設定下での2つのデータセットの検索において,優れた性能を示す。
論文 参考訳(メタデータ) (2023-06-01T08:04:12Z) - UniKGQA: Unified Retrieval and Reasoning for Solving Multi-hop Question
Answering Over Knowledge Graph [89.98762327725112]
KGQA(Multi-hop Question Answering over Knowledge Graph)は、自然言語の質問で言及されているトピックエンティティから、複数のホップを持つ回答エンティティを見つけることを目的としている。
我々は、モデルアーキテクチャとパラメータ学習の両方において、検索と推論を統合することで、マルチホップKGQAタスクの新しいアプローチであるUniKGQAを提案する。
論文 参考訳(メタデータ) (2022-12-02T04:08:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。