論文の概要: Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity
- arxiv url: http://arxiv.org/abs/2606.25343v2
- Date: Fri, 26 Jun 2026 04:35:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 13:57:07.321243
- Title: Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity
- Title(参考訳): Invoice Haystack: 強力な視覚的均一性の下での文書検索と視覚的質問のベンチマーク
- Authors: Heethanjan Kanagalingam, Thenukan Pathmanathan, Mokeeshan Vathanakumar, Basim Azam, Sarah Monazam Erfani, Naveed Akhtar,
- Abstract要約: Invoice Haystackは1500個の匿名化インボイス画像と200個の識別的質問応答ペアを組み合わせたベンチマークである。
Invoice Haystack は、既存のベンチマークで 0.38 (DocHaystack) と 0.31 (InfoHaystack) と比較すると平均で 0.73 である。
VL-RAGはテキストと視覚の埋め込みを協調的に利用するハイブリッド検索拡張生成フレームワークである。
- 参考スコア(独自算出の注目度): 25.78729251210173
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Vision Language Models have achieved near-human performance on single-document Visual Question Answering, yet their effectiveness degrades significantly when retrieving information from large collections of visually homogeneous documents. Existing multi-document benchmarks aggregate diverse document types, creating artificial separation in embedding space that does not reflect enterprise document repositories where thousands of records share identical visual templates. We identify this as embedding collapse and introduce Invoice Haystack, a benchmark with 1,500 anonymized invoice images paired with 200 discriminative question-answer pairs, specifically designed to stress-test retrieval under strong visual homogeneity. Invoice Haystack exhibits a mean pairwise cosine similarity of 0.73, compared to 0.38 (DocHaystack) and 0.31 (InfoHaystack) in existing benchmarks, posing a fundamentally more challenging retrieval problem. Addressing the identified challenge, we propose VL-RAG, a hybrid retrieval-augmented generation framework that jointly leverages text and visual embeddings to harness the complementary strengths of both modalities, followed by a VLM-based verification filter for precise document identification. VL-RAG achieves 60.0\% Recall@1 on Invoice Haystack-500, outperforming existing state-of-the-art method by up to an absolute 13.5 percentage points. It further improves retrieval considerably on DocHaystack-1000 (77.1\% vs.\ 75.2\%) and InfoHaystack-1000 (84.5\% vs.\ 80.0\%), establishing the proposed dual-stream fusion as a consistently superior retrieval strategy across both homogeneous and heterogeneous document collections.
- Abstract(参考訳): 視覚言語モデルは、単一文書の視覚質問回答において、ほぼ人間に近い性能を達成しているが、その効果は、視覚的に均質な大量の文書から情報を取得する際に著しく低下する。
既存のマルチドキュメントベンチマークは、さまざまなドキュメントタイプを集約し、何千ものレコードが同じビジュアルテンプレートを共有するエンタープライズドキュメントリポジトリを反映しない埋め込みスペースを人工的に分離する。
Invoice Haystackは1500個の匿名化インボイス画像と200個の識別的問合せペアを組み合わせたベンチマークで、特に強い視覚的均一性の下でのストレス-テスト検索を目的としている。
Invoice Haystack は、既存のベンチマークで 0.38 (DocHaystack) と 0.31 (InfoHaystack) と比較すると平均で 0.73 のコサイン類似性を示しており、基本的にはより困難な検索問題である。
この課題に対処するため,テキストと視覚埋め込みを併用したハイブリッド検索拡張生成フレームワークVL-RAGを提案する。
VL-RAG は Invoice Haystack-500 上で 60.0\% Recall@1 を達成する。
さらにDocHaystack-1000(77.1\% vs.)で検索を大幅に改善する。
75.2\%) と InfoHaystack-1000 (84.5\% vs。
80.0\%)で、同種および異種両方の文書コレクションに対して一貫した優れた検索戦略として提案された二重ストリーム融合を確立した。
関連論文リスト
- Novelty-Aware Agentic Retrieval: Comparing Research Contributions Through Structured Multi-Step Reasoning [0.0]
ノベルティ・アウェア・リサーチ・エージェント(英: Novelty-Aware Research Agent)は、エージェント検索システムのプロトタイプである。
RAGパイプライン上の多段階推論を6つのタイプドコントラクトコンポーネントを通じて階層化する。
論文毎のコントリビューション記録、紙レベルのオーバーラップ、問題xメソッドギャップマトリックスなど、構造化された比較アーティファクトを生成する。
論文 参考訳(メタデータ) (2026-06-20T17:04:02Z) - From BM25 to Corrective RAG: Benchmarking Retrieval Strategies for Text-and-Table Documents [0.0]
スパース, 密度, ハイブリッド融合, クロスエンコーダリグレード, クエリ拡張, インデックス拡張, 適応検索にまたがる10の検索戦略をベンチマークした。
我々はRecall@k,MRR,nDCGによる検索品質とNumber Matchによるエンドツーエンド生成品質を評価する。
論文 参考訳(メタデータ) (2026-04-02T07:53:40Z) - ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios [8.308537658028264]
ViDoRe v3は、視覚的にリッチなドキュメントコーパス上のマルチタイプクエリを特徴とする総合マルチモーダルRAGベンチマークである。
さまざまな専門家ドメインにまたがる10のデータセットをカバーしており、26,000のドキュメントページと3,099の人間認証クエリをペアにしている。
論文 参考訳(メタデータ) (2026-01-13T15:00:33Z) - Hierarchical Retrieval with Evidence Curation for Open-Domain Financial Question Answering on Standardized Documents [9.173952465423966]
標準化されたドキュメントは、反復的なボイラープレートテキストや同様のテーブル構造など、同様のフォーマットを共有している。
この類似性により、従来のRAGメソッドは、ほぼ重複したテキストを誤識別し、精度と完全性を損なう重複検索につながる。
本稿では,これらの問題に対処するためのEvidence Curationフレームワークを用いた階層検索手法を提案する。
論文 参考訳(メタデータ) (2025-05-26T11:08:23Z) - Unifying Multimodal Retrieval via Document Screenshot Embedding [92.03571344075607]
Document Screenshot Embedding (DSE)は、文書のスクリーンショットを統一的な入力フォーマットとして扱う新しい検索パラダイムである。
まず、Wiki-SSというウィキペディアのウェブページのスクリーンショットをコーパスとして作成し、Natural Questionsデータセットからの質問に答える。
例えば、DSEは、BM25をトップ1検索精度で17ポイント上回り、さらにスライド検索の混合モダリティタスクでは、nDCG@10で15ポイント以上OCRテキスト検索手法を著しく上回ります。
論文 参考訳(メタデータ) (2024-06-17T06:27:35Z) - GERE: Generative Evidence Retrieval for Fact Verification [57.78768817972026]
本稿では,ジェネレーション方式で証拠を検索する最初のシステムであるGEREを提案する。
FEVERデータセットの実験結果は、GEREが最先端のベースラインよりも大幅に改善されていることを示している。
論文 参考訳(メタデータ) (2022-04-12T03:49:35Z) - Augmenting Document Representations for Dense Retrieval with
Interpolation and Perturbation [49.940525611640346]
ドキュメント拡張(Document Augmentation for dense Retrieval)フレームワークは、ドキュメントの表現をDense Augmentationとperturbationsで強化する。
2つのベンチマークデータセットによる検索タスクにおけるDARの性能評価を行い、ラベル付き文書とラベルなし文書の密集検索において、提案したDARが関連するベースラインを大幅に上回っていることを示す。
論文 参考訳(メタデータ) (2022-03-15T09:07:38Z) - CODER: An efficient framework for improving retrieval through
COntextualized Document Embedding Reranking [11.635294568328625]
本稿では,最小計算コストで広範囲の検索モデルの性能を向上させるためのフレームワークを提案する。
ベース密度検索法により抽出された事前計算された文書表現を利用する。
実行時に第一段階のメソッドの上に無視可能な計算オーバーヘッドを発生させ、最先端の高密度検索手法と簡単に組み合わせられるようにする。
論文 参考訳(メタデータ) (2021-12-16T10:25:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。