論文の概要: MIDR: Enrichment-Augmented Indexing for Multimodal Document Retrieval
- arxiv url: http://arxiv.org/abs/2609.01316v1
- Date: Tue, 01 Sep 2026 14:38:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.769356
- Title: MIDR: Enrichment-Augmented Indexing for Multimodal Document Retrieval
- Title(参考訳): MIDR:マルチモーダル文書検索のための拡張インデックス作成
- Authors: Debanjan Mahata, Atharva Tendle, Daniel Preotiuc-Pietro, Yong Zhuang, Ozan Irsoy,
- Abstract要約: マルチモーダル推論をインデックス時間にシフトする拡張インデックス作成のためのフレームワークであるMIDRを紹介する。
ViDoRe V3では、MIDR Hybridは英国の5つのドメインの平均nDCGが0.6219であり、BM25よりも23.0%上昇している。
2つのフランス語文書ドメインでは、エンリッチメントは英語のクエリとフランス語のページテキストをブリッジし、BM25を0.1532から0.5448のnDCGに引き上げ、ColQwen2.5を上回ります。
- 参考スコア(独自算出の注目度): 11.93163258125452
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval over visually rich documents has a representation problem: important content often lives in tables, charts, figures, and layout relations that plain OCR linearizes, corrupts, or omits. ColPali-family visual retrievers address this with patch-level multi-vector indexes and late-interaction scoring, keeping image-derived retrieval on the query-time serving path. We introduce MIDR (Multimodal Indexing for Document Retrieval), a training-free framework for enrichment-augmented indexing that shifts multimodal reasoning to index time. During ingestion, a multimodal LLM converts rendered pages into verified textual fields that are indexed with BM25F and optionally fused with dense retrieval, enabling text-centric serving over multimodally grounded evidence. On ViDoRe V3, MIDR Hybrid achieves 0.6219 average nDCG across five English domains, a 23.0% relative gain over BM25, remaining competitive with ColQwen2.5. On two French-document domains, enrichment bridges English queries and French page text, lifting BM25 from 0.1532 to 0.5448 nDCG and outperforming ColQwen2.5. Across all seven domains, MIDR leads ColQwen2.5 on four while using approximately 9x smaller index memory and approximately 2x lower query latency. These results establish index-time multimodal reasoning as a compelling accuracy-deployment alternative to serving-time visual late interaction.
- Abstract(参考訳): 重要なコンテンツは表、チャート、図形、レイアウト関係にしばしば存在し、通常のOCRが線形化、破損、省略する。
ColPaliファミリーのビジュアルレトリバーは、パッチレベルのマルチベクターインデックスと遅延インタラクションスコアでこの問題に対処し、クエリ時間サービスパスで画像由来の検索を継続する。
MIDR(Multimodal Indexing for Document Retrieval)は,マルチモーダル推論をインデックス時間にシフトする拡張インデックス作成のためのトレーニングフリーフレームワークである。
摂取中、マルチモーダル LLM はレンダリングされたページを BM25F でインデックスされた検証済みのテキストフィールドに変換する。
ViDoRe V3では、MIDR Hybridはイングランドの5つのドメインで平均0.6219nDCGに達し、BM25よりも23.0%上昇し、ColQwen2.5と競合する。
2つのフランス語文書ドメインでは、エンリッチメントは英語のクエリとフランス語のページテキストをブリッジし、BM25を0.1532から0.5448のnDCGに引き上げ、ColQwen2.5を上回ります。
7つのドメイン全体で、MIDRはColQwen2.5を4つにリードし、約9倍のインデックスメモリと約2倍のクエリレイテンシを使用する。
これらの結果は、サービス時間視覚的遅延相互作用に代わる、説得力のある精度デプロイの手段として、インデックスタイムのマルチモーダル推論を確立する。
関連論文リスト
- VLD-RAG: Agentic Vision-Language Retrieval-Augmented Generation for Long, Visually-Rich Multi-Page Documents [0.0]
VLD-RAGは多ページのエビデンス検索のためのエージェントマルチモーダルRAGフレームワークである。
VLD-RAGはページ保存マルチモーダルインデックスを構築し、解析されたテキスト、ページレベルのメタデータ、密度の高いビジュアル表現を格納する。
検証対象エージェントワークフローは、検索エージェント、アンサーエージェント、バリデーションエージェントをコーディネートし、エビデンスカバレッジを広げ、欠落した引用を検出し、検索要求を精査する。
論文 参考訳(メタデータ) (2026-05-21T13:33:38Z) - LITTA: Late-Interaction and Test-Time Alignment for Visually-Grounded Multimodal Retrieval [0.0]
LITTAは、エビデンスページ検索のためのクエリ拡張中心の検索フレームワークである。
ユーザクエリが与えられた後、LITTAは大きな言語モデルを使用して補完的なクエリ変種を生成する。
拡張されたクエリからの候補は、エビデンスカバレッジを改善するために、相互のランクフュージョンを通じて集約される。
論文 参考訳(メタデータ) (2026-03-10T13:25:39Z) - $G^2$-Reader: Dual Evolving Graphs for Multimodal Document QA [53.491241153213565]
G2$-Readerはマルチモーダルな質問応答のためのデュアルグラフシステムである。
Qwen3-VL-32B-Instructによる$G2$-Readerの平均精度は66.21%に達し、強力なベースラインとスタンドアローンのGPT-5(53.08%)を上回った。
5つのマルチモーダルドメインにわたるVisDoMBenchでは、Qwen3-VL-32B-Instructを使った$G2$-Readerが平均精度66.21%に達し、強力なベースラインとスタンドアロンのGPT-5(53.08%)を上回っている。
論文 参考訳(メタデータ) (2026-01-29T17:52:54Z) - MM-BRIGHT: A Multi-Task Multimodal Benchmark for Reasoning-Intensive Retrieval [18.53521844184766]
MM-BRIGHTは推論集約検索のための最初のマルチモーダルベンチマークである。
我々のデータセットは29の技術的領域にまたがる2,803の現実世界のクエリで構成されています。
論文 参考訳(メタデータ) (2026-01-14T15:31:54Z) - UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAG [82.84014669683863]
マルチモーダル検索拡張生成(MM-RAG)は,大規模言語モデルを現実世界の知識ベースに適用するための重要なアプローチである。
UniDoc-Benchは、70万の現実世界のPDFページから構築されたMM-RAGのための最初の大規模で現実的なベンチマークである。
実験により,マルチモーダルテキスト画像融合RAGシステムは,非モーダルおよび共同マルチモーダル埋め込みに基づく検索において一貫して優れていた。
論文 参考訳(メタデータ) (2025-10-04T04:30:13Z) - VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding [49.07705729597171]
VisR-Benchは、長い文書における質問駆動型マルチモーダル検索のベンチマークである。
ベンチマークは、1.2Kドキュメントで35K以上の高品質なQAペアで構成されています。
テキストベースの手法,マルチモーダルエンコーダ,MLLMなど,さまざまな検索モデルを評価する。
論文 参考訳(メタデータ) (2025-08-10T21:44:43Z) - Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering [60.062194349648195]
Document Visual Question Answering (DocVQA)は、長いマルチモーダル文書の処理において2つの課題に直面している。
現在の文書検索拡張生成法(DocRAG)はテキスト中心のアプローチによって制限されている。
MMDocRAGは,多ページのクロスモーダルエビデンスチェーンを持つ4,055のエキスパートアノテーション付きQAペアを特徴とする総合ベンチマークである。
論文 参考訳(メタデータ) (2025-05-22T09:52:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。