論文の概要: DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation
- arxiv url: http://arxiv.org/abs/2607.28580v1
- Date: Thu, 30 Jul 2026 17:40:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.703136
- Title: DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation
- Title(参考訳): DualG-MRAG:Multimodal Retrieval-Augmented Generationのためのマクロ推論とマイクロマッチングの分離
- Abstract要約: MM-RAG(Multimodal Retrieval-Augmented Generation)は有望な結果を示したが、それでも複雑なマルチホップ推論タスクに苦慮している。
マルチモーダルRAGのためのマクロ推論とマイクロマッチンググラフからなる分離アーキテクチャを導入するデュアル層フレームワークであるDualG-MRAGを提案する。
- 参考スコア(独自算出の注目度): 23.80343378702536
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While Multimodal Retrieval-Augmented Generation (MM-RAG) has shown promising results, it still struggles with complex multi-hop reasoning tasks. Existing methods primarily focus on independent instance-level matching, which often fails to capture explicit relationships across modalities and documents. Although Graph-enhanced methods introduce structural modeling, they face a fundamental challenge in multimodal scenarios: incorporating fine-grained visual features leads to rapid graph expansion and retrieval noise, whereas coarse-grained representations cause the discarding of critical local evidence. To address this dilemma, we propose DualG-MRAG, a Dual-tier framework that introduces a decoupled architecture comprising Macro-reasoning and Micro-matching Graphs for Multimodal RAG. Specifically, to suppress retrieval noise by isolating global structural reasoning from fine-grained evidence matching, we construct a Macro Graph for global topological routing and a Micro Graph for precise local verification. Subsequently, to enable dynamic relevance propagation across heterogeneous evidence sources, we formulate retrieval as a query-driven message passing process via a GNN Retriever. Furthermore, to provide the generative model with coherent structural guidance, we introduce a dynamic programming decoding mechanism that extracts explicit reasoning paths directly from the GNN's forward pass, replacing the standard input of isolated document chunks. Extensive experiments demonstrate that DualG-MRAG outperforms baselines in both evidence recall and complex QA accuracy.
- Abstract(参考訳): MM-RAG(Multimodal Retrieval-Augmented Generation)は有望な結果を示したが、それでも複雑なマルチホップ推論タスクに苦戦している。
既存のメソッドは主に独立したインスタンスレベルのマッチングに重点を置いている。
微細な視覚的特徴を取り入れると、グラフの急速な拡張と検索ノイズが発生するが、粗い粒度の表現は、重要な局所的な証拠を破棄する。
このジレンマに対処するためにDualG-MRAGを提案する。DualG-MRAGはMacro-reasoningとMicro-matching Graphs for Multimodal RAGからなる疎結合アーキテクチャである。
具体的には, 微細なエビデンスマッチングからグローバルな構造的推論を分離することにより, 検索ノイズを抑制するために, グローバルなトポロジ的ルーティングのためのマクログラフと, 正確な局所的検証のためのマイクログラフを構築した。
その後、異種エビデンスソース間の動的関連性伝搬を可能にするため、GNNレトリバーを介してクエリ駆動のメッセージパッシングプロセスとして検索を定式化する。
さらに,GNNのフォワードパスから直接明確な推論経路を抽出し,孤立した文書チャンクの標準入力を置き換える動的プログラミング復号機構を導入する。
大規模な実験により、DualG-MRAGはエビデンスリコールと複雑なQA精度の両方においてベースラインを上回っていることが示された。
関連論文リスト
- Hypergraph-based Multimodal Retrieval-Augmented Generation with Incremental Refinement [19.099989510112604]
Hyper-M2RAGは,高次ハイパー表現学習によるマルチモーダル文書検索を再定義する新しいフレームワークである。
物理的冗長性に起因する意味的断片化を軽減するために,アンカー駆動インクリメンタルリファインメント機構を導入する。
このメカニズムは境界交差型アンカーノードを特定し、ワンホップ近傍コンテキストを用いて局所的ハイパートポロジーを再構築する。
論文 参考訳(メタデータ) (2026-08-17T14:30:09Z) - Dual-Path LLM Reasoning for Multimodal Few-Shot Knowledge Graph Completion [21.217226429970324]
マルチモーダル情報とLLM(Large Language Model)から派生した先行言語は、スパース関係のコンテキストを豊かにすることができる。
DuPLeRは、マルチモーダル型の先行と現実的なサポート構造を組み合わせることで、キャリブレーションされた関係グラフを構築する。
2つのマルチモーダルKG(MMKG)ベンチマークの8つのインダクティブ変種に対する実験は、DuPLeRがデータスカースKGCシナリオで堅牢な性能を達成することを示す。
論文 参考訳(メタデータ) (2026-07-29T13:40:51Z) - EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval [23.778354620399316]
EvoGraph-R1は、知識グラフをエージェントインタラクションによって形成される動的環境として再認識する、自己進化的なGraphRAGフレームワークである。
エージェントがグラフの状態を観察し、クエリ(GraphRetrieve)、拡張(WebSearch)、洗練(GraphEdit)、あるいは終了(Answer)のためのアクションを実行する、マルコフ決定プロセス(MDP)として検索を定式化する。
マルチモーダルVQAとテキストQAベンチマークの実験では、既存のRAGベースラインよりも精度、カバレッジ、トレーサビリティが大幅に向上した。
論文 参考訳(メタデータ) (2026-07-14T13:34:07Z) - DAG-FM: A Foundation Model for Causal Discovery under Heterogeneous Causal Mechanisms [48.57846236686172]
因果発見を記憶する新しい基礎モデルアーキテクチャである textbfDAG-FM を提案する。
直接行列予測とは異なり、DAG-FMは因果発見プロセスを2つの自己回帰段階に分解する。
我々は,DAG-FMが,合成ベンチマークと複雑な実世界のデータセットの両方で最先端の性能を達成することを示す。
論文 参考訳(メタデータ) (2026-07-13T13:00:06Z) - CausalMoE: A Billion-Scale Multimodal Foundation Model for Granger Causal Discovery with Pattern-Routed Heterogeneous Experts [25.563603697914242]
数十億のマルチモーダル・グランガー因果基盤モデルであるCausalMoEを提案する。
CaulMoEは、潜時パターンを動的に識別する、異種エキスパートのパターン制御混合を導入する。
また、変数間で動作し、スパースグランガー因果グラフを生成する因果自覚機構を設計する。
論文 参考訳(メタデータ) (2026-06-11T07:57:23Z) - Robust Multimodal Recommendation via Graph Retrieval-Enhanced Modality Completion [71.20734649881258]
実世界のマルチモーダルデータセットは、センサーの故障、アノテーションの不足、プライバシーの制約によって、しばしばモダリティの不完全性に悩まされる。
効果的な解決策の1つはモダリティ補完であり、下流タスクのためのモダリティ完全グラフを提供するために欠落した特徴を再構成する。
本稿では,これらの制限を克服するグラフ検索拡張モード補完フレームワークであるGRE-MCを提案する。
論文 参考訳(メタデータ) (2026-05-01T13:50:52Z) - Evolutionary Router Feature Generation for Zero-Shot Graph Anomaly Detection with Mixture-of-Experts [60.60414602796664]
ゼロショットGADのための進化的ルータ特徴生成(EvoFG)を備えた新しいMoEフレームワークを提案する。
EvoFGは最先端のベースラインを一貫して上回り、強力で安定したゼロショットGAD性能を実現している。
論文 参考訳(メタデータ) (2026-02-12T06:16:51Z) - RouteRAG: Efficient Retrieval-Augmented Generation from Text and Graph via Reinforcement Learning [69.87510139069218]
Retrieval-Augmented Generation (RAG)は、非パラメトリック知識をLarge Language Models (LLM)に統合する
強化学習(RL)による多ターン推論へのテキストベースRAGの進歩
LLMがマルチターンおよび適応的なグラフテキストハイブリッドRAGを実現するためのRLベースのフレームワークであるモデルを導入する。
論文 参考訳(メタデータ) (2025-12-10T10:05:31Z) - Decoupling and Damping: Structurally-Regularized Gradient Matching for Multimodal Graph Condensation [3.2987327415317895]
マルチモーダルグラフに適した新しい凝縮フレームワークSR-GMを提案する。
SR-GMは、ベースライン法と比較して精度を大幅に向上し、収束を加速する。
本研究は,資源制約環境下でのマルチモーダルグラフに基づく学習のためのスケーラブルな方法論を提供する。
論文 参考訳(メタデータ) (2025-11-25T11:50:34Z) - Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding [61.36285696607487]
文書理解は、財務分析から科学的発見への応用に不可欠である。
現在のアプローチでは、OCRベースのパイプラインがLarge Language Models(LLM)やネイティブのMultimodal LLMs(MLLM)に制限されている。
Retrieval-Augmented Generation (RAG)は、外部データの基底モデルを支援するが、文書のマルチモーダルな性質は、テキスト、テーブル、チャート、レイアウトを組み合わせることで、より高度なパラダイムを必要とする。
論文 参考訳(メタデータ) (2025-10-17T02:33:16Z) - Dynamic Generation of Multi-LLM Agents Communication Topologies with Graph Diffusion Models [99.85131798240808]
我々はtextitGuided Topology Diffusion (GTD) と呼ばれる新しい生成フレームワークを導入する。
条件付き離散グラフ拡散モデルにインスパイアされたGTD式は、反復的な構成過程としてトポロジー合成を行う。
各ステップで生成は、多目的報酬を予測する軽量プロキシモデルによって制御される。
実験により、GTDは高いタスク適応性、スパース、効率的な通信トポロジを生成できることが示されている。
論文 参考訳(メタデータ) (2025-10-09T05:28:28Z) - Think-on-Graph 3.0: Efficient and Adaptive LLM Reasoning on Heterogeneous Graphs via Multi-Agent Dual-Evolving Context Retrieval [35.65907480060404]
Think-on-Graph 3.0 (ToG-3) は、制約を克服するためにMulti-Agent Context Evolution and Retrieval (MACER) メカニズムを導入した新しいフレームワークである。
我々の中心となる革新は、チャンク・トリプレット・コミュニティ・ヘテロジニアスグラフ指数の動的構築と洗練である。
マルチエージェントシステムは、エビデンス検索、回答生成、十分性、そして決定的に進化するクエリとサブグラフの反復的なプロセスに関与する。
論文 参考訳(メタデータ) (2025-09-26T00:13:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。