論文の概要: ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval
- arxiv url: http://arxiv.org/abs/2608.15698v2
- Date: Fri, 21 Aug 2026 15:34:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:31.652485
- Title: ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval
- Title(参考訳): ConceptFormer: Visual Document Retrievalにおけるクエリドキュメントアライメントのための適応型遅延概念の学習
- Abstract要約: ConceptFormerは、ビジュアル文書検索のための潜在概念表現学習フレームワークである。
クエリ関連エビデンスとは、局所化された視覚的エビデンスとセマンティックな関連性を明確に橋渡しする、連続的でクエリ条件付き潜在概念である。
平均的なNDCG@10では、最強のビジュアル検索ベースラインと最強のOCRベースのテキスト検索ベースラインに対して16.7%と22.1%の相対的な改善が達成されている。
- 参考スコア(独自算出の注目度): 62.80735412748694
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual document retrieval is a critical component of multimodal retrieval-augmented generation, aiming to identify query-relevant pages from document collections where evidence is distributed across text, layout, charts, and visual structures. Recent efforts toward finer-grained supervision primarily rely on textual descriptions or localized visual regions as evidence proxies. However, such supervision signals may either overlook complex visual structures or provide incomplete and inaccurate representations of the underlying evidence. To address these limitations, we propose ConceptFormer, a latent concept representation learning framework for visual document retrieval. ConceptFormer models query-relevant evidence as continuous, query-conditioned latent concepts that explicitly bridge localized visual evidence and semantic relevance, without requiring either textual intermediate representations or direct reliance on raw visual annotations. During training, ConceptFormer employs a strong vision-language model to dynamically determine the number of latent concept tokens and uses these concepts as an intermediate representation to bridge the semantic gap between queries and documents, thereby guiding the learning of the embedding space. Experiments on diverse visual document retrieval benchmarks demonstrate that ConceptFormer achieves 16.7\% and 22.1\% relative improvements in average NDCG@10 over the strongest visual retrieval baseline and the strongest OCR-based text retrieval baseline, respectively. Further analysis reveals that latent concepts effectively connect localized visual evidence with semantic relevance, enabling the retriever to capture both fine-grained textual cues and complex document-level visual structures while preserving strong retrieval alignment. Codes and data are available at https://github.com/Neuir/ConceptFormer.
- Abstract(参考訳): ビジュアルドキュメント検索は、テキスト、レイアウト、チャート、視覚構造にエビデンスが分散している文書コレクションからクエリ関連ページを識別することを目的とした、マルチモーダル検索拡張生成の重要なコンポーネントである。
よりきめ細かい監督に向けた最近の取り組みは、主に証拠プロキシとしてテキスト記述や局所的な視覚領域に依存している。
しかし、そのような監視信号は複雑な視覚構造を見落としたり、根底にある証拠の不完全かつ不正確な表現を与えるかもしれない。
これらの制約に対処するために,視覚文書検索のための潜在概念表現学習フレームワークであるConceptFormerを提案する。
ConceptFormerは、クエリ関連エビデンスを、ローカル化された視覚的エビデンスとセマンティックな関連性を明確に橋渡しし、テキスト中間表現や生の視覚的アノテーションへの直接的な依存を必要としない、連続的でクエリ条件の潜伏した概念としてモデル化する。
トレーニング中、ConceptFormerは強力な視覚言語モデルを使用して、潜在概念トークンの数を動的に決定し、これらの概念を中間表現として使用して、クエリとドキュメント間のセマンティックギャップをブリッジし、埋め込み空間の学習を導く。
多様なビジュアル文書検索ベンチマークの実験では、ConceptFormerは平均的なNDCG@10において、最強のビジュアル検索ベースラインと最強のOCRベースのテキスト検索ベースラインに対して16.7\%と22.1\%の相対的な改善を達成している。
さらに分析した結果,局所的な視覚的証拠を意味的関連性に効果的に結び付けることで,検索者が強力な検索アライメントを維持しつつ,詳細なテキストと複雑な文書レベルの視覚構造の両方をキャプチャできることがわかった。
コードとデータはhttps://github.com/Neuir/ConceptFormer.comで公開されている。
関連論文リスト
- Thinking with Anchors: Grounded and Efficient Document Reasoning [87.07530736788898]
ADOPD 2026はADOPDの拡張である。
ADOPD 2026はページ分解を空間的に基底化された文書理解に変換する。
ADOPD 2026は、ページ分解を検証可能なビジュアル・アンカー推論に接続することで、タスク・フレームワークを提供する。
論文 参考訳(メタデータ) (2026-08-05T04:09:05Z) - VaRS-Doc: Interpretation-Aware Variant Representations via Latent Self-Probing for Visual Document Retrieval [40.36520318905935]
本稿では,文書表現の多様化を図るビジュアル文書検索フレームワークである VaRS-Doc を提案する。
VaRS-Docは、クエリに依存しないドキュメントエンコーディングとクエリ固有の検索ニーズのミスマッチに対する実用的な解決策を提供する。
論文 参考訳(メタデータ) (2026-08-02T12:55:57Z) - MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing [74.84107522458798]
MPDocBench-Parseは、現実世界のアプリケーションにおけるマルチページ文書解析のためのベンチマークである。
433の注釈付き文書に3,246ページあり、英語と中国語の15種類の文書を網羅しており、レイアウトは様々である。
論文 参考訳(メタデータ) (2026-05-21T07:36:41Z) - Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation [19.889854990300595]
反復検索拡張生成(iRAG)は、複雑なマルチホップ問題に答える強力なパラダイムとして登場した。
Evidence (CoE) の textbfChain について述べる。
論文 参考訳(メタデータ) (2026-05-02T06:40:42Z) - ReAlign: Optimizing the Visual Document Retriever with Reasoning-Guided Fine-Grained Alignment [28.897559367200376]
ビジュアルドキュメント検索は、視覚的にリッチなコレクションからクエリに関連するドキュメントページの集合を検索することを目的としている。
既存の手法では、クエリやビジュアルページを共有埋め込み空間にエンコードするために、VLM(Vision-Language Models)を用いることが多い。
そこで我々は,Reasoning-Guided Alignment (ReAlign)を提案する。
論文 参考訳(メタデータ) (2026-04-08T14:47:27Z) - MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns [80.05126590825121]
MonkeyOCR v1.5は、レイアウト理解とコンテンツ認識の両方を強化する統合ビジョン言語フレームワークである。
複雑なテーブル構造に対処するために,視覚的整合性に基づく強化学習手法を提案する。
2つの特別なモジュール、Image-Decoupled Table ParsingとType-Guided Table Mergingを導入し、テーブルの信頼性の高いパースを可能にする。
論文 参考訳(メタデータ) (2025-11-13T15:12:17Z) - Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering [51.7493726399073]
本稿では,長文質問応答を改善するための対話型階層型フレームワークを提案する。
このフレームワークには3つの重要な革新がある: 長文の専門的な談話解析、LLMに基づく談話関係ノードの拡張、構造誘導階層検索である。
論文 参考訳(メタデータ) (2025-05-26T14:45:12Z) - Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding [42.506971197471195]
ドキュメント解析のために約3.8Mの事前学習データペアで構成されるDocMark-Pileと、グラウンドド命令に従うための624kの微調整データアノテーションを備えたDocMark-Instructの2つのきめ細かい構造化データセットを紹介した。
提案手法は,様々なビジュアル文書理解ベンチマークにおいて,既存の最先端MLLMを著しく上回っている。
論文 参考訳(メタデータ) (2025-05-08T17:37:36Z) - QID: Efficient Query-Informed ViTs in Data-Scarce Regimes for OCR-free Visual Document Understanding [53.69841526266547]
トレーニング済みのVision-Language Modelを新しいデータセットで微調整することは、ビジョンエンコーダの最適化に不足することが多い。
視覚エンコーダにクエリの埋め込みを統合する,新しい,合理化されたアーキテクチャ保存アプローチであるQIDを導入する。
論文 参考訳(メタデータ) (2025-04-03T18:47:16Z) - DocTr: Document Transformer for Structured Information Extraction in
Documents [36.1145541816468]
本稿では、視覚的にリッチな文書から構造化情報を取り出すための新しい定式化について述べる。
既存のIOBタグやグラフベースの定式化の制限に対処することを目的としている。
我々は、エンティティをアンカーワードとバウンディングボックスとして表現し、エンティティリンクをアンカーワードの関連付けとして表現する。
論文 参考訳(メタデータ) (2023-07-16T02:59:30Z) - Unified Pretraining Framework for Document Understanding [52.224359498792836]
文書理解のための統合事前学習フレームワークであるUDocを紹介する。
UDocは、ほとんどのドキュメント理解タスクをサポートするように設計されており、Transformerを拡張してマルチモーダル埋め込みを入力とする。
UDocの重要な特徴は、3つの自己管理的損失を利用して汎用的な表現を学ぶことである。
論文 参考訳(メタデータ) (2022-04-22T21:47:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。