論文の概要: MMAgent-R$^2$: Learning to Rerank and Reject for Agentic mRAG
- arxiv url: http://arxiv.org/abs/2607.07383v1
- Date: Wed, 08 Jul 2026 13:15:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.390594
- Title: MMAgent-R$^2$: Learning to Rerank and Reject for Agentic mRAG
- Title(参考訳): MMAgent-R$^2$: エージェントmRAGのリランクとリジェクションの学習
- Authors: Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Yang, Bing Li, Chunfeng Yuan, Kang Rong, Fengyun Rao, Jing Lyu, Weiming Hu,
- Abstract要約: 知識に基づくビジュアル質問回答 (KB-VQA) では、大規模百科事典の知識ベースからクエリ画像と一致する視覚エンティティを検索し、関連する質問に答える必要がある。
MMAgent-R$2$は、視覚的リランク化と能動的拒絶を内部検証機構として統合したエージェントmRAGフレームワークである。
- 参考スコア(独自算出の注目度): 50.46218163777298
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Knowledge-based Visual Question Answering (KB-VQA) requires models to retrieve visual entities matching the query image from large-scale encyclopedic knowledge bases and answer related questions. Existing multimodal Retrieval Augmented Generation (mRAG) methods rely on global visual features to match candidate entities, yet when the knowledge base contains numerous visually similar entities, the retriever struggles to distinguish them, populating the candidate set with visually similar but factually mismatched distractors. Since subsequent processing steps such as noise filtering are also confined to this fixed candidate set, errors from failed retrieval inevitably propagate to the final answer. To address these challenges, we propose MMAgent-R$^2$, an agentic mRAG framework that integrates visual reranking and active rejection as its internal verification mechanism. Visual reranking directly compares query and candidate images, capturing discriminative details beyond textual descriptions to precisely identify the target entity among similar candidates; active rejection discards unreliable results and retrieves additional candidates when no confident match is found, moving beyond the fixed candidate pool. We design a composite reward function with step-level verification rewards and achieve joint optimization of external retrieval, internal verification, and answer generation via GRPO training. Experiments on InfoSeek, E-VQA, and MMhops demonstrate that \ours{} achieves state-of-the-art performance, with particularly notable advantages in challenging retrieval scenarios and complex multi-image multi-hop reasoning tasks.
- Abstract(参考訳): 知識に基づくビジュアル質問回答 (KB-VQA) では、大規模百科事典の知識ベースからクエリ画像と一致する視覚エンティティを検索し、関連する質問に答える必要がある。
既存のマルチモーダル検索拡張生成法(mRAG)は、候補エンティティにマッチするグローバルな視覚的特徴に依存するが、知識ベースが多くの視覚的に類似したエンティティを含む場合、検索者はそれらを区別するのに苦労し、視覚的に類似しているが、実際はミスマッチした散見器で候補セットをポップアップさせる。
ノイズフィルタリングなどのその後の処理ステップもこの固定された候補セットに制限されるため、検索失敗からのエラーは必然的に最終回答に伝播する。
これらの課題に対処するために,視覚的再評価と能動的拒絶を内部検証機構として統合したエージェントmRAGフレームワークであるMMAgent-R$^2$を提案する。
Visual re rankは、クエリと候補画像を直接比較し、テキスト記述以上の識別的詳細をキャプチャして、類似候補間のターゲットエンティティを正確に識別する。
ステップレベルの検証報酬を持つ複合報酬関数を設計し,GRPOトレーニングによる外部検索,内部検証,回答生成の協調最適化を実現する。
InfoSeek、E-VQA、MMhopsの実験では、‘ours{}’が最先端のパフォーマンスを実現しており、特に難解な検索シナリオや複雑なマルチイメージのマルチホップ推論タスクにおいて顕著なアドバンテージがある。
関連論文リスト
- Learning to Search: A Decision-Based Agent for Knowledge-Based Visual Question Answering [18.5913106358874]
知識に基づく視覚的質問応答(KB-VQA)は、画像を理解し、外部知識を使用するために視覚言語モデルを必要とする。
ほとんどの既存の検索拡張生成(RAG)メソッドは、情報を逐次検索し、フィルタリングし、回答を生成する固定パイプラインを採用している。
我々は,KB-VQAを探索エージェント問題として再定義し,その解法を多段階決定手順としてモデル化する。
論文 参考訳(メタデータ) (2026-04-08T14:37:35Z) - Pixel-Grounded Retrieval for Knowledgeable Large Multimodal Models [58.46663983451155]
PixSearchは、地域レベルの認識と検索強化推論を統合する、エンドツーエンドのLMM(Large Multimodal Model)である。
エンコーディング中、PixSearchは検索をトリガーする検索>トークンを出力し、クエリのモダリティ(テキスト、画像、リージョン)を選択し、ビジュアルクエリとして直接機能するピクセルレベルのマスクを生成する。
エゴセントリックでエンティティ中心のVQAベンチマークでは、PixSearchは事実整合性と一般化を大幅に改善する。
論文 参考訳(メタデータ) (2026-01-27T00:46:08Z) - ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering [54.72902502486611]
ReAG(Reasoning-Augmented Multimodal RAG)は、粗い部分ときめ細かい部分の検索と、無関係な通路をフィルタリングする批評家モデルを組み合わせた手法である。
ReAGは従来の手法よりも優れており、解答精度が向上し、検索された証拠に根ざした解釈可能な推論を提供する。
論文 参考訳(メタデータ) (2025-11-27T19:01:02Z) - Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering [55.49652734090316]
知識に基づく視覚的質問応答(KB-VQA)は、視覚的理解と外部知識検索を統合するために視覚言語モデル(VLM)を必要とする。
本稿では,処理,検索,フィルタリングといった3段階の手法をWiki-PRFと呼ぶ。
ベンチマークデータセット(E-VQAとInfoSeek)の実験では、回答の品質が大幅に向上し、最先端のパフォーマンスが達成された。
論文 参考訳(メタデータ) (2025-10-16T12:10:00Z) - MIXRAG : Mixture-of-Experts Retrieval-Augmented Generation for Textual Graph Understanding and Question Answering [6.596018318578605]
Retrieval-Augmented Generation (RAG)は、推論中に外部知識ソースを組み込むことで、Large Language Models (LLM)を強化する。
既存のアプローチのほとんどは、関連するサブグラフを特定するために単一のレトリバーに依存しており、複雑なクエリのさまざまな側面をキャプチャする能力を制限する。
そこで我々は,Mixture-of-Experts Graph-RAGフレームワークであるMIXRAGを提案する。
論文 参考訳(メタデータ) (2025-09-24T02:44:57Z) - HANRAG: Heuristic Accurate Noise-resistant Retrieval-Augmented Generation for Multi-hop Question Answering [25.01360941843264]
HANRAGは、様々な複雑さの問題に効果的に取り組むために設計された新しいフレームワークである。
強力なレベレータによって駆動されるHANRAGは、クエリをルーティングし、サブクエリに分解し、取得したドキュメントからノイズをフィルタする。
その結果,本フレームワークは,シングルホップおよびマルチホップ問合せタスクにおいて,優れた性能が得られることがわかった。
論文 参考訳(メタデータ) (2025-09-08T06:22:38Z) - Divide by Question, Conquer by Agent: SPLIT-RAG with Question-Driven Graph Partitioning [62.640169289390535]
SPLIT-RAGは、質問駆動セマンティックグラフ分割と協調サブグラフ検索による制限に対処するマルチエージェントRAGフレームワークである。
革新的なフレームワークは、まずリンク情報のセマンティック分割を作成し、次にタイプ特化知識ベースを使用してマルチエージェントRAGを実現する。
属性対応グラフセグメンテーションは、知識グラフを意味的に一貫性のあるサブグラフに分割し、サブグラフが異なるクエリタイプと整合することを保証する。
階層的なマージモジュールは、論理的検証を通じて、部分グラフ由来の解答間の矛盾を解消する。
論文 参考訳(メタデータ) (2025-05-20T06:44:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。