論文の概要: MEG-RAG: Quantifying Multi-modal Evidence Grounding for Evidence Selection in RAG
- arxiv url: http://arxiv.org/abs/2604.24564v2
- Date: Thu, 30 Apr 2026 01:34:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-01 14:06:12.646564
- Title: MEG-RAG: Quantifying Multi-modal Evidence Grounding for Evidence Selection in RAG
- Title(参考訳): MEG-RAG:RAGにおけるエビデンス選択のためのマルチモーダルエビデンスグラウンドの定量化
- Abstract要約: MRAG(Multimodal Retrieval-Augmented Generation)は、MLLM(Multimodal Large Language Models)の重要な制限に対処する。
得られた証拠の寄与を定量化する意味認識尺度であるMulti-modal Evidence Grounding (MEG)を提案する。
MEG-RAGはマルチモーダル・リランカを訓練し,得られた証拠を基底真実のセマンティックアンカーと整合させるフレームワークである。
- 参考スコア(独自算出の注目度): 29.065833225528127
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Retrieval-Augmented Generation (MRAG) addresses key limitations of Multimodal Large Language Models (MLLMs), such as hallucination and outdated knowledge. However, current MRAG systems struggle to distinguish whether retrieved multimodal data truly supports the semantic core of an answer or merely provides superficial relevance. Existing metrics often rely on heuristic position-based confidence, which fails to capture the informational density of multimodal entities. To address this, we propose Multi-modal Evidence Grounding (MEG), a semantic-aware metric that quantifies the contribution of retrieved evidence. Unlike standard confidence measures, MEG utilizes Semantic Certainty Anchoring, focusing on high-IDF information-bearing tokens that better capture the semantic core of the answer. Building on MEG, we introduce MEG-RAG, a framework that trains a multimodal reranker to align retrieved evidence with the semantic anchors of the ground truth. By prioritizing high-value content based on semantic grounding rather than token probability distributions, MEG-RAG improves the accuracy and multimodal consistency of generated outputs. Extensive experiments on the M$^2$RAG benchmark show that MEG-RAG consistently outperforms strong baselines and demonstrates robust generalization across different teacher models.
- Abstract(参考訳): MRAG(Multimodal Retrieval-Augmented Generation)は、幻覚や古い知識など、MLLM(Multimodal Large Language Models)の重要な制限に対処する。
しかし、現在のMRAGシステムは、検索したマルチモーダルデータが回答のセマンティックコアを本当にサポートしているか、あるいは単に表面的関連性を提供するのかを区別するのに苦労している。
既存のメトリクスは、しばしばヒューリスティックな位置ベースの信頼に頼り、マルチモーダルエンティティの情報密度を捉えるのに失敗する。
そこで本研究では, 得られた証拠の寄与を定量化する意味認識尺度であるMulti-modal Evidence Grounding (MEG)を提案する。
標準的な信頼度測定とは異なり、MEGはSemantic Certainty Anchoringを使用して、回答のセマンティックコアをよりよくキャプチャするハイIDF情報付加トークンにフォーカスしている。
MEG上に構築されたMEG-RAGは,検索した証拠を基底真実の意味的アンカーと整合させるために,マルチモーダル・リランカを訓練するフレームワークである。
MEG-RAGはトークン確率分布よりもセマンティックグラウンドに基づく高価値コンテンツを優先することにより、生成した出力の精度とマルチモーダル整合性を改善する。
M$^2$RAGベンチマークの大規模な実験により、MEG-RAGは強いベースラインを一貫して上回り、異なる教師モデル間で堅牢な一般化を示す。
関連論文リスト
- Achieving Text-based Person Retrieval with Any Granularity [80.69427598925718]
本稿では、任意の粒度を持つテキストベースの人物検索という新しいパラダイムを紹介する。
5段階の粒度スペクトルを定式化し,高品質な多粒度アノテートデータセットであるUFine6926-MGを構築した。
次に、クロスモーダルな多重粒度アライニングおよびマッチングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-23T08:42:25Z) - MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering [73.47440561592556]
トレーニング不要な属性生成手法であるMultAttnAttribを紹介する。
MultAttnAttribは、様々な属性生成方法よりも一貫して優れていることを示す。
提案手法は直接推論遅延の最大7分の1の属性を生成する。
論文 参考訳(メタデータ) (2026-07-01T19:29:19Z) - MKG-RAG-Bench: Benchmarking Retrieval in Multimodal Knowledge Graph-Augmented Generation [32.81707284618515]
我々は、MKG-RAGの検索を評価するクロスドメインベンチマークであるMKG-RAG-Benchを紹介する。
MKG-RAG-Benchは、一般ドメインと医療ドメインにまたがる2つのマルチモーダル知識グラフから構築されている。
本研究は,MKG-RAGのエンド・ツー・エンド性能において,効果的なマルチモーダル検索が依然として不可欠であることを示す。
論文 参考訳(メタデータ) (2026-06-24T23:38:42Z) - SAMA: Semantic Anchor-aligned Augmentation for Unified Low-Resource Multimodal Information Extraction [12.379572218573365]
高忠実でタスク対応の合成データを生成するための統合フレームワークであるSemantic Anchor-aligned Multimodal Augmentation (SAMA)を導入する。
SAMAは,多言語多言語モデル(Multimodal Large Language Model,Multi-Experts Multi-Experts Multimodal Large Language Model)のガイドとして,地上構造ラベルから構造化されたセマンティックアンカーを構築する。
SAMAは、完全に教師された設定と低リソースの設定の両方で、最先端の強化ベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-06-17T07:43:33Z) - OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration [48.11927189422178]
決定のみの信号よりも検証器生成の合理性を利用するマルチモーダルなメタ検証について検討する。
我々は,記号的メタ検証とデカップリングされた強化学習を利用した一般の視覚的検証であるOmniVerifier-M1を訓練する。
このアプローチは、より信頼性が高く、解釈可能で、きめ細かいマルチモーダル検証の道を開き、より安全で、より制御可能な基盤モデルのデプロイメントをサポートする。
論文 参考訳(メタデータ) (2026-05-27T17:56:04Z) - MASS-RAG: Multi-Agent Synthesis Retrieval-Augmented Generation [36.73029890123542]
MASS-RAGは、検索増強生成に対するマルチエージェント合成手法である。
これは、証拠の要約、証拠の抽出、回収された文書に対する推論のために異なるエージェントを適用している。
それらの出力を専用の合成段階を通して組み合わせ、最終的な答えを生成する。
論文 参考訳(メタデータ) (2026-04-20T17:00:38Z) - MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering [51.19392014547221]
検索型マルチモーダル文書QAは,視覚的にリッチな文書から複雑なマルチモーダル構造を持つ関連情報を識別し,統合することを目的としている。
現在のアプローチは、サージェントなコンテンツを見渡すクエリに依存しないドキュメント表現に依存しています。
本稿では,クエリ適応生成を導入したMultimodal Adaptive Retrieval-Augmented (MARA)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-01T12:27:40Z) - M$^3$KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation [20.170643730917963]
M$3$KG-RAGはマルチホップマルチモーダル知識グラフ強化RAGである。
MMKGからクエリアラインな音声視覚知識を検索する。
推論の深さを改善し、MLLMの忠実さに答える。
論文 参考訳(メタデータ) (2025-12-23T07:54:03Z) - CoRe-MMRAG: Cross-Source Knowledge Reconciliation for Multimodal RAG [53.950029990391066]
マルチモーダルRAG(CoRe-MMRAG)のためのクロスソース知識textbfReconciliation
本稿では,知識ソース間の不整合を効果的に解決する新しいエンドツーエンドフレームワークを提案する。
KB-VQAベンチマークの実験では、CoRe-MMRAGはベースライン法よりも大幅に改善されている。
論文 参考訳(メタデータ) (2025-06-03T07:32:40Z) - VisDoM: Multi-Document QA with Visually Rich Elements Using Multimodal Retrieval-Augmented Generation [100.06122876025063]
本稿では,マルチドキュメント設定でQAシステムを評価するために設計された,初の総合ベンチマークであるVisDoMBenchを紹介する。
視覚とテキストのRAGを同時に利用する新しいマルチモーダル検索拡張生成(RAG)手法であるVisDoMRAGを提案する。
論文 参考訳(メタデータ) (2024-12-14T06:24:55Z) - Retrieval Meets Reasoning: Even High-school Textbook Knowledge Benefits Multimodal Reasoning [49.3242278912771]
RMR(Retrieval Meets Reasoning)と呼ばれる新しいマルチモーダルRAGフレームワークについて紹介する。
RMRフレームワークは、最も関連性の高い問合せ対を特定するために、バイモーダル検索モジュールを使用する。
これは、ベンチマークデータセットのスペクトルにわたって様々なビジョン言語モデルの性能を大幅に向上させる。
論文 参考訳(メタデータ) (2024-05-31T14:23:49Z) - Compositional Chain-of-Thought Prompting for Large Multimodal Models [46.721769077885966]
CCoT(コンポジション・チェーン・オブ・ソート)は、新規なゼロショット・オブ・ソート・プロンプト法である。
まず,Large Language Model(LLM)を用いてSGを生成し,そのSGをプロンプトに使用して応答を生成する。
提案手法は,LMMの性能向上だけでなく,一般的なマルチモーダルベンチマーク上でのLMMの性能向上にも寄与する。
論文 参考訳(メタデータ) (2023-11-27T22:23:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。