論文の概要: DocPC: Document-Level Visual Retrieval via Representative Page Composition
- arxiv url: http://arxiv.org/abs/2608.25434v2
- Date: Thu, 27 Aug 2026 08:37:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.845505
- Title: DocPC: Document-Level Visual Retrieval via Representative Page Composition
- Title(参考訳): DocPC: 代表ページ構成によるドキュメントレベルのビジュアル検索
- Abstract要約: 本稿では,代表ページ構成に基づく文書レベルのビジュアル検索フレームワークであるDocPCを提案する。
文書レベルで広く普及している多陽性の監督を扱うために,多陽性のコントラスト学習と小数にスケジュールされたリストワイズ最適化を組み合わせる。
DocPC-ColQwenはDocViRe上で44.09のNDCG@5を達成した。
- 参考スコア(独自算出の注目度): 18.884480422710244
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual document retrieval has advanced by encoding page screenshots with vision-language models, bypassing OCR pipelines. However, existing methods remain page-centric, misaligned with real-world scenarios requiring complete document retrieval. A naive page-then-document aggregation suffers from linear indexing cost and degraded retrieval when relevance spans multiple pages. We propose DocPC, a document-level visual retrieval framework based on Representative Page Composition: selecting representative pages and composing them into a single grid image for document-level indexing, reducing indexed images, vectors, and storage by 10.1x and end-to-end indexing time by roughly 7.7x. To handle multi-positive supervision prevalent at the document level, we combine multi-positive contrastive learning with sparsely scheduled listwise optimization. We also introduce DocViRe, a benchmark with multi-positive relevance annotations. DocPC-ColQwen achieves NDCG@5 of 44.09 on DocViRe, outperforming the strongest page-level baseline at 38.91 while reducing storage by 10.1x. Code is available at https://anonymous.4open.science/r/DocPC-Document-Level-Visual-Retrieval-via-Representative-Page-Comp osition-1D52. Data is available at https://huggingface.co/datasets/anonymous-7219/docpc.
- Abstract(参考訳): ビジュアル文書検索は、OCRパイプラインをバイパスし、視覚言語モデルでページスクリーンショットをエンコードすることで進歩した。
しかし、既存の手法はページ中心のままであり、完全な文書検索を必要とする現実のシナリオと一致していない。
単純ページ文書集約は、複数のページに関連性がある場合、線形インデックス作成コストと劣化した検索に悩まされる。
本稿では,代表ページを選択して単一のグリッドイメージに構成し,文書レベルのインデックス化,インデックス画像,ベクトル,ストレージを10.1倍,エンドツーエンドのインデックス化時間を約7.7倍に削減する文書レベルのビジュアル検索フレームワークDocPCを提案する。
文書レベルで広く普及する多正の監督を扱うために,多正のコントラスト学習と小数にスケジュールされたリストワイズ最適化を組み合わせた。
また,多値関連アノテーションを用いたベンチマークであるDocViReも導入した。
DocPC-ColQwenはDocViRe上で44.09のNDCG@5を達成した。
コードはhttps://anonymous.4open.science/r/DocPC-Document-Level-Visual-Retrieval-via-Representative-Page-Comp osition-1D52で公開されている。
データはhttps://huggingface.co/datasets/anonymous-7219/docpc.comで入手できる。
関連論文リスト
- VaRS-Doc: Interpretation-Aware Variant Representations via Latent Self-Probing for Visual Document Retrieval [40.36520318905935]
本稿では,文書表現の多様化を図るビジュアル文書検索フレームワークである VaRS-Doc を提案する。
VaRS-Docは、クエリに依存しないドキュメントエンコーディングとクエリ固有の検索ニーズのミスマッチに対する実用的な解決策を提供する。
論文 参考訳(メタデータ) (2026-08-02T12:55:57Z) - DocAtlas: Long-Document Understanding as Mutable-State Interaction [67.90400271544678]
本稿では,長期文書理解を可変状態情報探索プロセスとして扱うDocAtlasを提案する。
ドキュメントと質問が与えられた後、DocAtlasは検索、読み取り、メモ取り、レビューツールを公開し、階層的なツリーとノートストアを維持し、エージェントが証拠を記録するように更新する。
GPT-5.4では、DocAtlasはMMLongBench-Docで71.4%に達し、65.8%という人間の専門的基準を超えた。
論文 参考訳(メタデータ) (2026-07-21T09:45:34Z) - Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing [53.41293908252118]
我々は、エキスパートレベルの文書解析のための困難を意識したベンチマークであるDocBench博士を紹介する。
Dr. DocBenchは52のBISACドメインにまたがり、障害ベースのサンプリングによってドキュメントを選択する。
約100ページにわたる長いドキュメントから4,514ページの注釈付きページが含まれており、レイアウト、読み込み順序、階層的関係、ドメイン固有のビジュアルコンテンツなど、65kの高品質なアノテーションがある。
本分析では,文書インテリジェンスを診断・進展するための総合的なテストベッドとしてDocBench博士が注目されている。
論文 参考訳(メタデータ) (2026-05-31T18:35:30Z) - MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing [74.84107522458798]
MPDocBench-Parseは、現実世界のアプリケーションにおけるマルチページ文書解析のためのベンチマークである。
433の注釈付き文書に3,246ページあり、英語と中国語の15種類の文書を網羅しており、レイアウトは様々である。
論文 参考訳(メタデータ) (2026-05-21T07:36:41Z) - Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA [71.42483000929614]
複数ページのドキュメント 視覚的質問回答は、長い、視覚的に密集したドキュメントにおける意味論、レイアウト、および視覚的要素の推論を必要とする。
我々は,多ページDocVQAをシーケンシャルエビデンスアグリゲーションとしてキャストするtextbfOCRフリーエージェントフレームワークであるDoc-$V*$を提案する。
論文 参考訳(メタデータ) (2026-04-15T11:12:27Z) - SimpleDoc: Multi-Modal Document Understanding with Dual-Cue Page Retrieval and Iterative Refinement [17.272061289197342]
Document Visual Question Answering (DocVQA)は実用的で難しいタスクである。
最近の手法は、同様のRAG(Retrieval Augmented Generation)パイプラインに従う。
DocVQA用の拡張フレームワークであるSimpleDocを紹介します。
論文 参考訳(メタデータ) (2025-06-16T22:15:58Z) - ColPali: Efficient Document Retrieval with Vision Language Models [15.369861972085136]
我々は、複数のドメイン、言語、実用的な設定にまたがる様々なページレベルの検索タスクからなるVisual Document Retrieval Benchmark ViDoReを紹介する。
現代のシステムの本質的な複雑さと性能上の欠点は、ドキュメントページのイメージを直接埋め込むことで文書検索を行うという新しい概念を動機付けている。
文書ページの画像から高品質なマルチベクトル埋め込みを生成するために訓練されたビジョン言語モデルColPaliをリリースする。
論文 参考訳(メタデータ) (2024-06-27T15:45:29Z) - Unifying Multimodal Retrieval via Document Screenshot Embedding [92.03571344075607]
Document Screenshot Embedding (DSE)は、文書のスクリーンショットを統一的な入力フォーマットとして扱う新しい検索パラダイムである。
まず、Wiki-SSというウィキペディアのウェブページのスクリーンショットをコーパスとして作成し、Natural Questionsデータセットからの質問に答える。
例えば、DSEは、BM25をトップ1検索精度で17ポイント上回り、さらにスライド検索の混合モダリティタスクでは、nDCG@10で15ポイント以上OCRテキスト検索手法を著しく上回ります。
論文 参考訳(メタデータ) (2024-06-17T06:27:35Z) - DocBank: A Benchmark Dataset for Document Layout Analysis [114.81155155508083]
文書レイアウト解析のための詳細なトークンレベルのアノテーションを備えた500Kドキュメントページを含むベンチマークデータセットである textbfDocBank を提示する。
実験の結果,DocBankでトレーニングされたモデルは,さまざまなドキュメントのレイアウト情報を正確に認識することがわかった。
論文 参考訳(メタデータ) (2020-06-01T16:04:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。