論文の概要: Purifying Multimodal Retrieval: Fragment-Level Evidence Selection for RAG
- arxiv url: http://arxiv.org/abs/2604.27600v1
- Date: Thu, 30 Apr 2026 08:50:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-01 16:31:54.005102
- Title: Purifying Multimodal Retrieval: Fragment-Level Evidence Selection for RAG
- Title(参考訳): マルチモーダル検索の浄化:RAGのためのフラグメントレベルエビデンス選択
- Authors: Xihang Wang, Zihan Wang, Chengkai Huang, Cao Liu, Ke Zeng, Quan Z. Sheng, Lina Yao,
- Abstract要約: MRAG(Multimodal Retrieval-Augmented Generation)はMLLM(Multimodal Large Language Models)に広く採用されており、幻覚を減らすための外部証拠がある。
既存のほとんどのMRAGフレームワークは、回収された証拠を不可分な文書として扱い、文書内のすべての内容が同様に情報的であると暗黙的に仮定している。
本稿では,RAG (FES-RAG) のためのフラグメントレベルのエビデンス選択法を提案する。
- 参考スコア(独自算出の注目度): 29.15140372436986
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Multimodal Retrieval-Augmented Generation (MRAG) is widely adopted for Multimodal Large Language Models (MLLMs) with external evidence to reduce hallucinations. Despite its success, most existing MRAG frameworks treat retrieved evidence as indivisible documents, implicitly assuming that all content within a document is equally informative. In practice, however, sometimes only a small fraction of a document is relevant to a given query, while the remaining content introduces substantial noise that may lead to performance degradation. We address this fundamental limitation by reframing MRAG as a fine-grained evidence selection problem. We propose Fragment-level Evidence Selection for RAG (FES-RAG), a framework that selects atomic multimodal fragments rather than entire documents as grounding evidence. FES-RAG decomposes retrieved multimodal documents into sentence-level textual fragments and region-level visual fragments, enabling precise identification of evidence that directly supports generation. To guide fragment selection, we introduce Fragment Information Gain (FIG), a principled metric that measures the marginal contribution of each fragment to the MLLM's generation confidence. Based on FIG, we distill fragment-level utility judgments from a high-capacity MLLM into a lightweight selector, achieving accurate evidence selection with low inference overhead. Experiments on the M2RAG benchmark show that FES-RAG consistently outperforms state-of-the-art document-level MRAG methods, achieving up to 27 percent relative improvement in CIDEr. By selecting fewer yet more informative fragments, our approach substantially reduces context length while improving factual accuracy and generation coherence.
- Abstract(参考訳): MRAG(Multimodal Retrieval-Augmented Generation)はMLLM(Multimodal Large Language Models)に広く採用されており、幻覚を減らすための外部証拠がある。
その成功にもかかわらず、ほとんどの既存のMRAGフレームワークは、回収された証拠を不可分な文書として扱い、文書内のすべての内容が同様に情報的であると暗黙的に仮定している。
しかし、実際には、あるドキュメントのごく一部だけが与えられたクエリに関連する場合があり、残りのコンテンツはパフォーマンスの低下につながるような相当なノイズを生じさせる。
MRAGを微細なエビデンス選択問題として再検討することで,この基本的な限界に対処する。
本稿では,RAG (FES-RAG) のためのフラグメントレベルのエビデンス選択法を提案する。
FES-RAGは、検索したマルチモーダル文書を文レベルのテキストの断片と地域レベルの視覚的断片に分解し、生成を直接サポートする証拠の正確な識別を可能にする。
フラグメント選択の指針として,フラグメント情報ゲイン(FIG)を導入し,フラグメントの限界寄与をMLLMの世代信頼度に求める。
FIGに基づいて、高容量MLLMから軽量セレクタにフラグメントレベルの実用性判断を蒸留し、推論オーバーヘッドの少ない正確なエビデンス選択を実現する。
M2RAGベンチマークの実験では、FES-RAGは最先端の文書レベルのMRAG法より一貫して優れており、CIDErでは最大27%の相対的な改善が達成されている。
より少ない情報的断片を選択することで、実数精度と生成コヒーレンスを改善しつつ、文脈長を大幅に削減できる。
関連論文リスト
- M-RAG: Making RAG Faster, Stronger, and More Efficient [15.147969102210759]
大規模言語モデルのための新しいチャンクフリー検索戦略であるM-RAGを提案する。
M-RAGは構造化されたk-v分解メタマーカーを軽量で意図に整合した検索キーで抽出する。
M-RAGは高い効率で解答フレンドリーな証拠を回収できることを示す。
論文 参考訳(メタデータ) (2026-01-06T15:14:54Z) - Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding [49.26132236798123]
視覚言語モデル(VLM)は、文書理解における主要なアプローチになりつつある。
本稿では,粗いプロセスにおいて,検索者と4つの協調エージェントを編成するマルチエージェントフレームワークSLEUTHを提案する。
このフレームワークは、検索したページ内の重要なテキストおよび視覚的手がかりを特定し、テーブルやチャートなどの健全な視覚的エビデンスをフィルタし、クエリを分析して推論戦略を考案する。
論文 参考訳(メタデータ) (2025-11-28T03:09:40Z) - UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAG [82.84014669683863]
マルチモーダル検索拡張生成(MM-RAG)は,大規模言語モデルを現実世界の知識ベースに適用するための重要なアプローチである。
UniDoc-Benchは、70万の現実世界のPDFページから構築されたMM-RAGのための最初の大規模で現実的なベンチマークである。
実験により,マルチモーダルテキスト画像融合RAGシステムは,非モーダルおよび共同マルチモーダル埋め込みに基づく検索において一貫して優れていた。
論文 参考訳(メタデータ) (2025-10-04T04:30:13Z) - Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering [60.062194349648195]
Document Visual Question Answering (DocVQA)は、長いマルチモーダル文書の処理において2つの課題に直面している。
現在の文書検索拡張生成法(DocRAG)はテキスト中心のアプローチによって制限されている。
MMDocRAGは,多ページのクロスモーダルエビデンスチェーンを持つ4,055のエキスパートアノテーション付きQAペアを特徴とする総合ベンチマークである。
論文 参考訳(メタデータ) (2025-05-22T09:52:57Z) - VisDoM: Multi-Document QA with Visually Rich Elements Using Multimodal Retrieval-Augmented Generation [100.06122876025063]
本稿では,マルチドキュメント設定でQAシステムを評価するために設計された,初の総合ベンチマークであるVisDoMBenchを紹介する。
視覚とテキストのRAGを同時に利用する新しいマルチモーダル検索拡張生成(RAG)手法であるVisDoMRAGを提案する。
論文 参考訳(メタデータ) (2024-12-14T06:24:55Z) - Multi-Head RAG: Solving Multi-Aspect Problems with LLMs [18.48202014877111]
MRAG(Multi-Head RAG)は、マルチアスペクト文書を取得するための新しいスキームである。
MRAGは18RAGベースラインに対して設計上の優位性を示し,検索成功率の最大20%を実証的に改善した。
論文 参考訳(メタデータ) (2024-06-07T16:59:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。