論文の概要: Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.22723v1
- Date: Wed, 22 Jul 2026 03:27:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.842856
- Title: Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models
- Title(参考訳): 分類誘導型大規模視覚言語モデルによる文書からの視覚情報抽出
- Abstract要約: 最小限の監督で高精度な多型VIEのための分類誘導型大規模視覚言語モデル(LVLM)を提案する。
このフレームワークは、オフィス自動化における複雑なドキュメント理解のための効率的でスケーラブルなソリューションを提供する。
- 参考スコア(独自算出の注目度): 7.176656402971074
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual information extraction (VIE) from visually rich documents remains challenging due to high layout variability and real-world impairments. Existing methods typically rely on sequential OCR pipelines or end-to-end models requiring extensive labeled data and layout-specific training, limiting their scalability.We propose a classification-guided large vision-language model (LVLM) framework for multi-type VIE that achieves high accuracy with minimal supervision. The approach decouples document-type classification from content extraction and employs in-context learning (ICL)-based dynamic prompt engineering to inject task-specific knowledge, enabling robust zero-shot inference across diverse layouts. From a theoretical perspective, the proposed method can be viewed as a form of conditional computation that reduces task uncertainty and improves information efficiency during prompt-based inference. Evaluated on a real-world bidding dataset with 16 certificate types, our zero-shot method (based on Qwen2.5-VL-7B) outperforms a strong supervised baseline by 18.35 percentage points in F1-score (86.43\% vs. 68.08\%) and 0.23 in normalized edit distance (0.90 vs. 0.67). Optional domain-specific fine-tuning further improves performance to 93.65\% F1 and 0.93 NED, demonstrating superior robustness against seals, watermarks, and low contrast. The framework offers an efficient, scalable solution for complex document understanding in office automation. Code is available at https://github.com/FairmeHIT/Multi-VIE, and fine-tuned models at https://huggingface.co/fairme/Qwen2.5-VL-7B-SFT.
- Abstract(参考訳): 視覚的にリッチなドキュメントからの視覚情報抽出(VIE)は、高いレイアウトのばらつきと現実世界の障害のため、依然として困難である。
既存の手法では,広範にラベル付けされたデータとレイアウト固有のトレーニングを必要とする,逐次的なOCRパイプラインやエンド・ツー・エンドモデルに頼り,そのスケーラビリティを制限し,最小限の監視で高精度なマルチタイプVIEのための分類誘導型大規模視覚言語モデル(LVLM)フレームワークを提案する。
このアプローチは、文書タイプの分類をコンテンツ抽出から切り離し、インコンテキスト学習(ICL)ベースの動的プロンプト工学を用いてタスク固有の知識を注入し、多様なレイアウトにわたって堅牢なゼロショット推論を可能にする。
理論的観点からは、提案手法はタスクの不確実性を低減し、プロンプトベース推論時の情報効率を向上させる条件計算の一形態と見なすことができる。
Qwen2.5-VL-7Bに基づく)ゼロショット法では、F1スコアで18.35ポイント(86.43\%対68.08\%)、正規化編集距離で0.23ポイント(0.90対0.67)の強い教師付きベースラインを上回ります。
任意のドメイン固有の微調整により、さらに93.65\% F1および0.93 NEDのパフォーマンスが向上し、アザラシ、透かし、低コントラストに対して優れた堅牢性を示す。
このフレームワークは、オフィス自動化における複雑なドキュメント理解のための効率的でスケーラブルなソリューションを提供する。
コードはhttps://github.com/FairmeHIT/Multi-VIEで、微調整されたモデルはhttps://huggingface.co/fairme/Qwen2.5-VL-7B-SFTで入手できる。
関連論文リスト
- CMAP: Cross-Modal Adaptive Prompting for Multi-Domain Task-Incremental Learning [3.1368611610608856]
テキスト空間のタスクルーティングは、凍結されたCLIPテキストプロトタイプとコサイン類似のビジュアルガウスマッチングを置き換える。
視覚テキストの信頼度は、単一ガウスのクラスモデリングをK平均視覚プロトタイプとタスク校正しきい値の下でのクロスモーダルアライメントスコアに置き換える。
MTILベンチマークは118.7%と1201のクラスで74.2%のTransfer、80.5%のAverage、そして8のLast Under Order-Iを達成した。
論文 参考訳(メタデータ) (2026-05-25T11:09:48Z) - What Matters for Grocery Product Retrieval with Open Source Vision Language Models [0.0]
本稿では,GroceryVision Challenge の MPR タスクにおいて,190個のオープンソース VLM のゼロショット評価を行った。
生のWebスクレイプからフィルタリングデータセットへの切り替えは、最大16.6%の精度向上をもたらす。
最先端モデルは94.5%のRecall@5を達成するが、Recall@1では17.5%の低下を被り、対照的な埋め込みはクラスタカテゴリを効果的に活用するが、視覚的に類似したSKUをランク付けすることができないことが明らかになった。
論文 参考訳(メタデータ) (2026-05-18T08:20:13Z) - Learning Hyperspectral Images with Curated Text Prompts for Efficient Multimodal Alignment [1.7188280334580195]
我々は、CLIPスタイルのコントラストトレーニングフレームワークを利用して、超スペクトルシーン理解のための視覚言語モデル(VLM)の最適化を試みる。
我々のフレームワークは、視覚バックボーンから凍結した大きな埋め込みモデルの潜在空間へのボクセルレベルの埋め込みをマッピングする。
提案手法は全パラメータの0.07パーセントしか更新していないが、最先端の性能が得られる。
論文 参考訳(メタデータ) (2025-09-20T23:23:04Z) - MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm [60.14048367611333]
MonkeyOCRはドキュメント解析のためのビジョン言語モデルである。
SRR(Structure-Recognition-Relation)三重項パラダイムを活用することで、最先端の技術の進歩を図っている。
論文 参考訳(メタデータ) (2025-06-05T16:34:57Z) - EfficientLLaVA:Generalizable Auto-Pruning for Large Vision-language Models [64.18350535770357]
マルチモーダル推論の効率を高めるために,大規模視覚言語モデルの自動プルーニング手法を提案する。
提案手法では,所望のプルーニングポリシーを探索するために,少数のサンプルのみを活用する。
視覚的質問応答のためのScienceQA, Vizwiz, MM-vet, LLaVA-Benchデータセットについて広範な実験を行った。
論文 参考訳(メタデータ) (2025-03-19T16:07:04Z) - Learning to Decompose Visual Features with Latent Textual Prompts [140.2117637223449]
視覚言語モデルを改善するために,Decomposed Feature Prompting (DeFo)を提案する。
我々の実証研究は、視覚言語モデルを改善する上でDeFoが重要であることを示している。
論文 参考訳(メタデータ) (2022-10-09T15:40:13Z) - Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding [88.88844606781987]
マルチモーダル文書事前学習モデルは、様々な視覚的にリッチな文書理解(VrDU)タスクにおいて非常に効果的であることが証明されている。
ドキュメント上の視覚と言語間の相互作用をモデル化し、活用する方法は、より優れた一般化能力とより高い精度から妨げられている。
本稿では,VrDUにおける視覚言語共同表現学習の問題点について,主に監視信号の観点から検討する。
論文 参考訳(メタデータ) (2022-06-27T09:58:34Z) - Masked Unsupervised Self-training for Zero-shot Image Classification [98.23094305347709]
Masked Unsupervised Self-Training (MUST)は、疑似ラベルと生画像という2つの異なる、補完的な監督源を活用する新しいアプローチである。
MUSTはCLIPを大きなマージンで改善し、教師なしと教師なしの分類のパフォーマンスギャップを狭める。
論文 参考訳(メタデータ) (2022-06-07T02:03:06Z) - Information Extraction from Visually Rich Documents with Font Style
Embeddings [0.6291443816903801]
本稿では,トークンスタイルと視覚表現の両方が利用可能である場合に,コンピュータビジョンの利用に挑戦する。
実世界の3つの複雑なデータセットに対する実験では、生の視覚的な埋め込みではなくトークンスタイルの属性をベースとした埋め込みが有用であることが示されている。
論文 参考訳(メタデータ) (2021-11-07T10:29:54Z) - LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document
Understanding [49.941806975280045]
テキストとレイアウトの事前トレーニングは、視覚的に豊富な文書理解タスクで有効であることが証明されています。
テキスト,レイアウト,イメージをマルチモーダルフレームワークで事前学習することで,テキスト-bfLMv2を提示する。
論文 参考訳(メタデータ) (2020-12-29T13:01:52Z) - Robust Layout-aware IE for Visually Rich Documents with Pre-trained
Language Models [23.42593796135709]
視覚的にリッチな文書(VRD)からの情報抽出の問題について検討する。
ビジネス文書のテキスト情報と視覚情報の両方を効率的に符号化するために,大規模な事前学習言語モデルとグラフニューラルネットワークのパワーを組み合わせたモデルを提案する。
論文 参考訳(メタデータ) (2020-05-22T06:04:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。