論文の概要: Multimodal CoLRAG-TF: Triple-Filtered Retrieval for Complex PDFs
- arxiv url: http://arxiv.org/abs/2607.20517v1
- Date: Tue, 07 Jul 2026 23:00:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.928452
- Title: Multimodal CoLRAG-TF: Triple-Filtered Retrieval for Complex PDFs
- Title(参考訳): 複合PDF用マルチモーダルCLRAG-TF
- Abstract要約: 複雑な文書に対する高密度テキスト埋め込み、BM25キーワードマッチング、知識グラフトリプルフィルタリング、画像ベース類似性を統合した4軸融合アーキテクチャであるMultimodal CoLRAG-TFを提案する。
本システムでは,43の災害教訓PDFから抽出した2,403ブロックのマルチモーダルインデックスを構築し,ハイブリッドOCRパイプラインとLCMを用いたキャプション生成をサポートする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieval-augmented generation (RAG) over heterogeneous PDF collections remains challenging due to multimodal content, domain-specific terminology, and the need for multi-hop reasoning across dispersed evidence. We present Multimodal CoLRAG-TF, a four-axis fusion architecture that integrates dense text embeddings, BM25 keyword matching, knowledge-graph triple filtering, and image-based similarity for robust retrieval over complex documents. Our system constructs a multimodal index of 2,403 blocks extracted from 43 Japanese disaster lesson PDFs, supported by a hybrid OCR pipeline and LLM-based caption generation. To enhance compositional reasoning, we extract 11,414 OpenIE triples and index them with FAISS, enabling sub-second triple lookup and hierarchical propagation of relevance signals. A HippoRAG2-inspired coarse-to-fine retriever (volume $\to$ chapter $\to$ block) narrows the search space before final fusion scoring. Bayesian optimization over fusion weights reveals that the triple axis must dominate ($α_\text{triple} = 0.44$) to counteract lexical bias and sustain multi-hop retrieval quality. Evaluated on a 457-pair benchmark, Multimodal CoLRAG-TF achieves a Retrieval Recall of 0.9909 and a 71.6$\%$ improvement in multi-hop answer similarity over single-hop queries. An image-to-lesson pipeline using a vision LLM further demonstrates the applicability of the approach to visual inputs. These results show that triple-filtered multimodal fusion is essential for structured reasoning over noisy, heterogeneous PDFs and provides a general framework applicable beyond the disaster domain.
- Abstract(参考訳): 異種PDFコレクションを検索するRAG(Retrieval-augmented Generation)は、マルチモーダルコンテンツ、ドメイン固有の用語、そして分散された証拠をまたいだマルチホップ推論の必要性により、依然として困難である。
複雑な文書に対する高密度テキスト埋め込み、BM25キーワードマッチング、知識グラフトリプルフィルタリング、画像ベース類似性を統合した4軸融合アーキテクチャであるMultimodal CoLRAG-TFを提案する。
本システムでは,43の災害教訓PDFから抽出した2,403ブロックのマルチモーダルインデックスを構築し,ハイブリッドOCRパイプラインとLCMを用いたキャプション生成をサポートする。
コンポジション推論を強化するため,11,414個のOpenIEトリプルを抽出し,FAISSとインデックス付けし,サブ秒以下のトリプルルックアップと関連信号の階層的伝播を可能にする。
HippoRAG2にインスパイアされた粗いリトリーバー($\to$ chapter $\to$ block)は、最終融合スコアの前に検索スペースを狭める。
融合重みに対するベイズ最適化は、三重軸が(α_\text{triple} = 0.44$)支配し、語彙バイアスに対処し、マルチホップ検索品質を維持する必要があることを明らかにしている。
457ペアのベンチマークで評価され、Multimodal CoLRAG-TFは、検索リコールの0.9909と、シングルホップクエリに対するマルチホップ応答類似性の改善71.6$\%を達成している。
ビジョンLLMを用いたイメージ・ツー・レス・パイプラインは、さらに視覚入力へのアプローチの適用性を実証する。
これらの結果から, 3重フィルタ多モード融合は, ノイズの多い異種PDFの構造化推論に不可欠であることが示唆され, 災害領域を超えて適用可能な汎用フレームワークが提供される。
関連論文リスト
- CrossModalQA: A Cross-modal and Multi-hop Benchmark for Multimodal Retrieval-augmented Generation [15.857678905969273]
CrossModalQAは、異種コーパス上のマルチモーダル検索と推論を評価するためのオープンドメインベンチマークである。
視覚からテキストへの道、テキストからテキストへの道、視覚からテキストへの道、複数画像の交叉、画像集合の推論の5つの相補的推論経路を網羅している。
論文 参考訳(メタデータ) (2026-08-31T16:00:59Z) - Hierarchical Evidence-Driven Reasoning for Long Document Understanding [95.51688464037096]
閉領域文書理解のための階層的・エビデンス駆動型マルチモーダルRAGフレームワークであるHIEVI-RAGを紹介する。
我々のフレームワークは、既存のオープンソースベースラインを著しく上回り、最強の報告ベースラインを平均8.05%の精度で上回ります。
論文 参考訳(メタデータ) (2026-07-06T03:08:28Z) - BRIDGE: Multimodal-to-Text Retrieval via Reinforcement-Learned Query Alignment [5.285385905661152]
最高の視覚言語エンコーダはMM-BRIGHT上で27.6 nDCG@10しか達成せず、強いテキストのみのレシーバーよりも優れています。
マルチモーダルエンコーダを使わずにこのミスマッチを解消する2成分システムである textbfBRIDGE を提案する。
textbfFORGEは強化学習によって訓練されたクエリアライメントモデルであり、ノイズの多いマルチモーダルクエリをコンパクトで検索最適化された検索文字列に蒸留する。
textbfLENSは、ForGEが生成するインテントリッチクエリを処理するために、推論集約検索データに基づいて微調整された、推論強化の高密度レトリバーである。
論文 参考訳(メタデータ) (2026-04-08T15:28:21Z) - MARVEL: Multimodal Adaptive Reasoning-intensiVe Expand-rerank and retrievaL [5.5504253907902275]
我々は, LLM によるクエリ拡張, textbfMARVEL-Retriever と GPT-4o ベースのチェーン・オブ・シント・リランクを組み合わせた統合パイプラインである textbfMARVEL (textbfMultimodal textbfAdaptive textbfReasoning-intensitextbfVe textbfExpand-rerank and retrievatextbfL) を紹介する。
論文 参考訳(メタデータ) (2026-04-08T13:35:09Z) - $G^2$-Reader: Dual Evolving Graphs for Multimodal Document QA [53.491241153213565]
G2$-Readerはマルチモーダルな質問応答のためのデュアルグラフシステムである。
Qwen3-VL-32B-Instructによる$G2$-Readerの平均精度は66.21%に達し、強力なベースラインとスタンドアローンのGPT-5(53.08%)を上回った。
5つのマルチモーダルドメインにわたるVisDoMBenchでは、Qwen3-VL-32B-Instructを使った$G2$-Readerが平均精度66.21%に達し、強力なベースラインとスタンドアロンのGPT-5(53.08%)を上回っている。
論文 参考訳(メタデータ) (2026-01-29T17:52:54Z) - UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAG [82.84014669683863]
マルチモーダル検索拡張生成(MM-RAG)は,大規模言語モデルを現実世界の知識ベースに適用するための重要なアプローチである。
UniDoc-Benchは、70万の現実世界のPDFページから構築されたMM-RAGのための最初の大規模で現実的なベンチマークである。
実験により,マルチモーダルテキスト画像融合RAGシステムは,非モーダルおよび共同マルチモーダル埋め込みに基づく検索において一貫して優れていた。
論文 参考訳(メタデータ) (2025-10-04T04:30:13Z) - MR$^2$-Bench: Going Beyond Matching to Reasoning in Multimodal Retrieval [86.35779264575154]
マルチモーダル検索は、現代のAIアプリケーションにおいて重要なコンポーネントになりつつあるが、その評価は、より現実的で困難なシナリオの要求に遅れている。
マルチモーダル検索のための推論集約型ベンチマークであるMR$2$-Benchを紹介する。
論文 参考訳(メタデータ) (2025-09-30T15:09:14Z) - Recurrence Meets Transformers for Universal Multimodal Retrieval [59.92546492752452]
ReT-2は画像とテキストの両方からなるマルチモーダルクエリをサポートする統合検索モデルである。
検索構成の異なるM2KRとM-BEIRのベンチマークでReT-2を評価する。
検索強化された生成パイプラインに統合されると、ReT-2はEncyclopedic-VQAとInfoSeekデータセットのダウンストリームのパフォーマンスも向上する。
論文 参考訳(メタデータ) (2025-09-10T18:00:29Z) - Zero-Shot Document Understanding using Pseudo Table of Contents-Guided Retrieval-Augmented Generation [4.875345207589195]
DocsRayは、トレーニング不要の文書理解システムである。
擬似コンテンツテーブル(TOC)生成と階層型検索拡張生成(RAG)を統合する
論文 参考訳(メタデータ) (2025-07-31T03:14:45Z) - M$^3$Net: Multi-view Encoding, Matching, and Fusion for Few-shot
Fine-grained Action Recognition [80.21796574234287]
M$3$Netは、FS-FGアクション認識のためのマッチングベースのフレームワークである。
textitmulti-view エンコーディング、textitmulti-view matching、textitmulti-view fusion を組み込んで、埋め込みエンコーディング、類似性マッチング、意思決定を容易にする。
説明可能な可視化と実験結果により,M$3$Netの微細な動作の詳細を捉える上での優位性が示された。
論文 参考訳(メタデータ) (2023-08-06T09:15:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。