論文の概要: Found but Not Read: When Extracted Text Closes the Retrieval-Reading Gap in Document Vision-Language Models
- arxiv url: http://arxiv.org/abs/2610.02880v1
- Date: Fri, 02 Oct 2026 06:16:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 09:54:32.240591
- Title: Found but Not Read: When Extracted Text Closes the Retrieval-Reading Gap in Document Vision-Language Models
- Title(参考訳): 見つかったが読まれていない: 文書の視覚・言語モデルにおける検索用ギャップを閉じたテキスト
- Abstract要約: 文書質問応答は、適切なページが見つかると、視覚言語モデル(VLM)がそれを読み取ることができると仮定する。
ペア化されたプロトコルは、検索したページ画像からの回答と同一画像からの回答と抽出したテキストとを単独で比較することにより、このギャップを分離する。
FoveDoc-Benchのベンチマークでは、ほぼすべてのエビデンスページを検索し、CPU-OCRテキストを追加することで13から16ポイントの精度が向上した。
- 参考スコア(独自算出の注目度): 5.091876481013286
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieval-augmented document question answering assumes that once the right page is found, a vision-language model (VLM) can read it. We show that this assumption often fails, leaving a retrieval-reading gap: evidence found but not used. A paired protocol isolates this gap by comparing answers from the retrieved page images alone with answers from the same images plus their extracted text. On FoveDoc-Bench, our benchmark with traceable evidence, retrieval finds nearly every evidence page, yet adding CPU-OCR text raises strict accuracy by 13 to 16 points. An exact text layer roughly doubles the gain, which appears across six VLMs from three families and, within one family, narrows with scale without closing. The reader can read this evidence but cannot find it: crops of it recover most of the text gain, boxes around it on the page none. The same protocol identifies two boundaries. Extracted text helps on textual evidence but is neutral or harmful on charts and figures. Its advantage shrinks as retrieval degrades, and unrelated text of the same form adds nothing detectable. Extracted text is an amplifier of retrieval that works, not a substitute for retrieval that does not. Our code is available at https://github.com/atoz03/fovedoc-sup.
- Abstract(参考訳): Retrieval-augmented document questioningは、適切なページが見つかると、視覚言語モデル(VLM)がそれを読むことができると仮定する。
我々は、この仮定がしばしば失敗し、検索可能なギャップを残していることを示す:証拠は見つかっているが、使われていない。
ペア化されたプロトコルは、検索したページ画像からの回答と同一画像からの回答と抽出したテキストとを単独で比較することにより、このギャップを分離する。
FoveDoc-Benchのベンチマークでは、ほぼすべてのエビデンスページを検索し、CPU-OCRテキストを追加することで13から16ポイントの精度が向上した。
正確なテキスト層は、大まかに2倍になり、3つのファミリーから6つのVLMにまたがって現れる。
読み手は、この証拠を読むことはできるが、それを見つけることはできない。
同じプロトコルは2つの境界を識別する。
抽出されたテキストはテキストの証拠に役立つが、チャートや数字では中立か有害である。
その利点は、検索が劣化するにつれて減少し、同じ形式の無関係なテキストは何も検出できない。
抽出テキスト(英: Extracted text)は、検索の増幅器であり、検索の代用ではない。
私たちのコードはhttps://github.com/atoz03/fovedoc-sup.comから入手可能です。
関連論文リスト
- Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning [75.00741348880044]
ツール強化された視覚言語モデル、ますます「イメージで考える」
近年、ブラインドテスト、ゲイン分解、アテンション分析による研究により、返却画像はほとんど寄与していないことが示された。
我々は、返却されたピクセルが到着する前に出力される構造化されたテキストである、と仮定する。
論文 参考訳(メタデータ) (2026-08-10T14:52:10Z) - A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval [3.213898015903824]
コントラッシブな画像テキスト検索のための単一字幕から多文節までの範囲の監督に関する体系的研究を行った。
Qwen2-VL と Llama 3.2 Vision をベースとした合成パイプラインを用いて,500K CC3M 画像に対して,多様なキャプション,強陰性,品質マーク付き段落を生成する。
段落教師付きモデルはShareGPT4V上でLong-CLIP-Lと一致し、画像からテキストへの検索においてDOCCIで14点以上向上した。
論文 参考訳(メタデータ) (2026-08-05T17:09:24Z) - FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora [3.678882282826422]
FindMyTextは、テキストコーパス内で、あるテキストが部分的に、または完全に現れるかどうかを効率的に評価するように設計されたPythonパッケージである。
このツールは、文書指紋の以前の技術をベースにしているが、一致する指紋のシーケンスを明示的にキャプチャする新しいメカニズムでそれを拡張している。
テキストの類似性よりも、与えられたテキストの近似に近いコピーをより確実に検出することができる。
論文 参考訳(メタデータ) (2026-07-10T22:46:11Z) - Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation [19.889854990300595]
反復検索拡張生成(iRAG)は、複雑なマルチホップ問題に答える強力なパラダイムとして登場した。
Evidence (CoE) の textbfChain について述べる。
論文 参考訳(メタデータ) (2026-05-02T06:40:42Z) - Focus, Distinguish, and Prompt: Unleashing CLIP for Efficient and Flexible Scene Text Retrieval [13.315951821189538]
シーンテキスト検索は、画像ギャラリーからクエリテキストを含むすべての画像を見つけることを目的としている。
現在の取り組みでは、複雑なテキスト検出および/または認識プロセスを必要とする光学文字認識(OCR)パイプラインを採用する傾向にある。
我々は,OCRのないシーンテキスト検索のためのCLIP(Contrastive Language- Image Pre-Trening)の本質的な可能性について検討する。
論文 参考訳(メタデータ) (2024-08-01T10:25:14Z) - DAPR: A Benchmark on Document-Aware Passage Retrieval [57.45793782107218]
我々は,このタスクemphDocument-Aware Passage Retrieval (DAPR)を提案する。
State-of-The-Art(SoTA)パスレトリバーのエラーを分析しながら、大きなエラー(53.5%)は文書コンテキストの欠如に起因する。
提案するベンチマークにより,検索システムの開発・比較を今後行うことができる。
論文 参考訳(メタデータ) (2023-05-23T10:39:57Z) - DPIC: Decoupling Prompt and Intrinsic Characteristics for LLM Generated Text Detection [56.513637720967566]
大規模言語モデル(LLM)は、盗作、eコマースプラットフォームへの偽レビューの設置、炎症性偽ツイートなどの誤用のリスクを引き起こすテキストを生成することができる。
既存の高品質な検出手法では、本質的な特徴を抽出するために、モデルの内部にアクセスする必要がある。
ブラックボックスモデル生成テキストの深い内在特性を抽出する。
論文 参考訳(メタデータ) (2023-05-21T17:26:16Z) - AE TextSpotter: Learning Visual and Linguistic Representation for
Ambiguous Text Spotting [98.08853679310603]
本研究はAmbiguity Elimination Text Spotter(AE TextSpotter)という新しいテキストスポッターを提案する。
AE TextSpotterは、視覚的特徴と言語的特徴の両方を学び、テキスト検出の曖昧さを著しく低減する。
我々の知る限り、言語モデルを用いてテキスト検出を改善するのはこれが初めてである。
論文 参考訳(メタデータ) (2020-08-03T08:40:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。