論文の概要: Identify, Locate, Link: End-to-End Key-Value Extraction from Document Images
- arxiv url: http://arxiv.org/abs/2608.20868v1
- Date: Fri, 21 Aug 2026 08:36:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.477677
- Title: Identify, Locate, Link: End-to-End Key-Value Extraction from Document Images
- Title(参考訳): Identify, Locate, Link: ドキュメントイメージからエンドツーエンドのキーバリュー抽出
- Abstract要約: 文書処理パイプラインは伝統的に、構造化情報抽出のための下流モデルを備えたカスケード光学文字認識(OCR)エンジンである。
我々は、文書画像から直接エンドツーエンドのキー値抽出を行うために、コンパクト256Mパラメータビジョン言語モデル(VLM)であるSmolDoclingを微調整する。
我々はDocTagsを特別なキー、値、リージョン、リンクタグで拡張し、統一された出力シーケンスで多対多の関係を可能にする。
- 参考スコア(独自算出の注目度): 4.971112189386969
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Document processing pipelines traditionally cascade optical character recognition (OCR) engines with downstream models for structured information extraction, leading to multi-stage error propagation. We fine-tune SmolDocling, a compact 256M-parameter vision-language model (VLM), to perform end-to-end key-value extraction directly from document images, jointly solving identification, localization, and association in a single pass without OCR preprocessing. We extend DocTags with specialized key, value, region, and link tags, enabling many-to-many relationships in a unified output sequence. To address data limitations, we design an augmentation pipeline combining synthetic form filling and graph-based crops that preserve complete key-value subgraphs. We further introduce a layout-aware evaluation framework extending text matching with spatial bounding box verification. On FUNSD, XFUND, and a large-scale private dataset, our model outperforms larger zero-shot VLM baselines under layout-aware evaluation, while being 27 times smaller than Qwen2.5-VL (7B) and over 5 times faster at inference. The model weights will be released publicly after publication.
- Abstract(参考訳): 文書処理パイプラインは伝統的に、構造化情報抽出のための下流モデルを備えたカスケード光学文字認識(OCR)エンジンを使用しており、多段誤差の伝播に繋がる。
我々は、256Mパラメータビジョン言語モデル(VLM)であるSmolDoclingを微調整し、文書画像からエンドツーエンドのキー値を直接抽出し、OCR前処理なしで単一パスで識別、ローカライゼーション、関連付けを行う。
我々はDocTagsを特別なキー、値、リージョン、リンクタグで拡張し、統一された出力シーケンスで多対多の関係を可能にする。
データ制限に対処するために、完全キー値のサブグラフを保持する合成フォームフィリングとグラフベースの作物を組み合わせた拡張パイプラインを設計する。
さらに,テキストマッチングと空間境界ボックス検証を併用したレイアウト認識評価フレームワークを提案する。
FUNSD, XFUND, および大規模プライベートデータセットでは, レイアウト認識によるゼロショットVLMベースラインの精度は, Qwen2.5-VL (7B) の27倍, 推論時の5倍以上に向上した。
モデルは公開後一般公開される予定だ。
関連論文リスト
- MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns [80.05126590825121]
MonkeyOCR v1.5は、レイアウト理解とコンテンツ認識の両方を強化する統合ビジョン言語フレームワークである。
複雑なテーブル構造に対処するために,視覚的整合性に基づく強化学習手法を提案する。
2つの特別なモジュール、Image-Decoupled Table ParsingとType-Guided Table Mergingを導入し、テーブルの信頼性の高いパースを可能にする。
論文 参考訳(メタデータ) (2025-11-13T15:12:17Z) - ModernVBERT: Towards Smaller Visual Document Retrievers [8.752477008109844]
ModernVBERTはコンパクトな視覚言語エンコーダで、文書検索タスクで微調整された場合、最大10倍のモデルで性能が向上する。
我々は、注目マスキング、画像解像度、モダリティアライメントデータレギュレーション、および中心的なパフォーマンス要因として出現する相対的な目標を中心とする遅延相互作用の影響を計測する。
論文 参考訳(メタデータ) (2025-10-01T17:41:17Z) - VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization [7.769156392417315]
鍵情報抽出は、視覚文書の理解の基盤となる。
既存のマルチモーダルな大言語モデル (MLLM) は、高密度な文書ではよく機能しない。
本稿では,空間領域検出と意味的特徴抽出を分離するMLLMであるVDInstructを紹介する。
論文 参考訳(メタデータ) (2025-07-13T08:15:11Z) - Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing [46.14775667559124]
layoutRLは、レイアウトを明示的に認識するようにモデルをトレーニングするエンドツーエンドの強化学習フレームワークである。
堅牢なドキュメント理解の進歩を加速するために、コードとデータセットを公開します。
論文 参考訳(メタデータ) (2025-06-01T15:19:52Z) - Towards Text-Image Interleaved Retrieval [49.96332254241075]
テキスト画像検索(TIIR)タスクを導入し、クエリと文書をインターリーブしたテキスト画像シーケンスとする。
我々は、自然にインターリーブされたwikiHowチュートリアルに基づいてTIIRベンチマークを構築し、インターリーブされたクエリを生成するために特定のパイプラインを設計する。
異なる粒度で視覚トークンの数を圧縮する新しいMMEを提案する。
論文 参考訳(メタデータ) (2025-02-18T12:00:47Z) - TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document [60.01330653769726]
テキスト中心タスクに適した大規模マルチモーダルモデル(LMM)であるTextMonkeyを提案する。
ゼロ初期化によるシフトウィンドウアテンションの導入により、高い入力解像度でクロスウィンドウ接続を実現する。
テキストスポッティングとグラウンド化を包含する能力を拡張し、位置情報を応答に組み込むことで、解釈可能性を高める。
論文 参考訳(メタデータ) (2024-03-07T13:16:24Z) - LOCOST: State-Space Models for Long Document Abstractive Summarization [76.31514220737272]
長いコンテキスト入力を持つ条件付きテキスト生成のための状態空間モデルに基づくエンコーダデコーダアーキテクチャであるLOCOSTを提案する。
計算複雑性が$O(L log L)$の場合、このアーキテクチャは疎注意パターンに基づく最先端モデルよりもはるかに長いシーケンスを処理できる。
論文 参考訳(メタデータ) (2024-01-31T15:33:37Z) - One-shot Key Information Extraction from Document with Deep Partial
Graph Matching [60.48651298832829]
ドキュメントからキー情報抽出(KIE)は、多くの産業シナリオにおいて効率、生産性、セキュリティを改善する。
KIEタスクのための既存の教師付き学習手法は、多数のラベル付きサンプルを供給し、異なる種類の文書の別々のモデルを学ぶ必要がある。
部分グラフマッチングを用いたワンショットKIEのためのディープエンド・ツー・エンド・トレーニング可能なネットワークを提案する。
論文 参考訳(メタデータ) (2021-09-26T07:45:53Z) - Spatial Dual-Modality Graph Reasoning for Key Information Extraction [31.04597531115209]
本研究では,非構造化文書画像から鍵情報を抽出するSDMG-R法を提案する。
我々はWildReceiptという新しいデータセットを公開し、野生の目に見えないテンプレートの文書画像からキー情報を抽出し、注釈を付ける。
論文 参考訳(メタデータ) (2021-03-26T13:46:00Z) - Beyond 512 Tokens: Siamese Multi-depth Transformer-based Hierarchical
Encoder for Long-Form Document Matching [28.190001111358438]
長文文書マッチングのためのシームズ多層変換器を用いたSMITHを提案する。
我々のモデルには、より長いテキスト入力に自己注意モデルを適用するためのいくつかの革新が含まれている。
われわれはウィキペディアベースのベンチマークデータセット、コード、トレーニング済みのチェックポイントをオープンソース化し、長文文書マッチングの今後の研究を加速する。
論文 参考訳(メタデータ) (2020-04-26T07:04:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。