論文の概要: The Right Information Extraction Pipeline Depends on the Document: Accuracy-Energy Trade-offs for Small, Local Models
- arxiv url: http://arxiv.org/abs/2609.31341v1
- Date: Fri, 25 Sep 2026 14:43:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.442928
- Title: The Right Information Extraction Pipeline Depends on the Document: Accuracy-Energy Trade-offs for Small, Local Models
- Title(参考訳): 文書に係わる正しい情報抽出パイプライン:小局所モデルにおける精度・エネルギートレードオフ
- Abstract要約: 情報抽出パイプラインがページイメージを処理すべきか,あるいは解析されたテキストは文書に依存するかを検討する。
FP8の量子化は、リクエストが一度に1つずつ提供されると27~32%節約されるのに対し、支配的なエネルギーレバーは、精度の面で38~85%削減されている。
本研究は,エネルギー効率,プライバシーに配慮した地域情報抽出に関する具体的なガイドラインを提示する。
- 参考スコア(独自算出の注目度): 0.9558392439655014
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Whether an information extraction pipeline should process page images or parsed text depends on the document, and the answer flips across the layout spectrum. We study this trade-off under a constraint that rules out (closed) cloud services: privacy-sensitive documents processed on-premise by small ($\le 8\mathrm{B}$ parameter) text-only and vision--language models, evaluated on both accuracy and energy over a design space spanning input representation, model family, and inference configuration. Benchmarking on the near-plain-text Kleister-NDA contracts and the layout-rich VRDU forms, we find that batching is the dominant energy lever, cutting energy per page by 38-85% at no cost in accuracy, while FP8 quantization saves 27-32% when requests are served one at a time but less than 1mWh per page (9-19%) once batching is applied. Preprocessing dominates what remains: neural OCR costs $17\times$ more energy per page than classical OCR and never reaches the Pareto frontier. Which representation wins flips with the type of document: vision--language models on layout-rich documents and small text-only models with a cheap parser on near-plain text, where they are both more accurate and cheaper than any vision--language configuration. Our work yields concrete guidelines for energy-efficient, privacy-compliant local information extraction.
- Abstract(参考訳): 情報抽出パイプラインがページイメージや解析されたテキストを処理すべきかどうかはドキュメントに依存し、回答はレイアウトスペクトルを横切る。
プライバシに敏感なドキュメントは、小さな (\le 8\mathrm{B}$ parameter) テキストのみおよびビジョン言語モデルで処理され、入力表現、モデルファミリー、推論設定にまたがるデザイン空間上の正確性とエネルギーの両方で評価されます。
ほぼ平文のKleister-NDA契約とレイアウトに富んだVRDUフォーマットをベンチマークした結果,バッチ処理が主流のエネルギーレバーであり,1ページあたりのエネルギーを38~85%削減できることがわかった。
ニューラルOCRは、従来のOCRよりも1ページ当たりのエネルギーが17ドル以上かかり、パレートフロンティアには到達しない。
レイアウトに富んだドキュメントの視覚言語モデルと、ほぼ平易なテキストのパーサを備えた小さなテキストのみのモデル。
本研究は,エネルギー効率,プライバシーに配慮した地域情報抽出に関する具体的なガイドラインを提示する。
関連論文リスト
- MonkeyOCRv2: A Visual-Text Foundation Model for Document AI [71.06391669976786]
MonkeyOCRv2は、ドキュメントAIのためのビジュアルテキスト事前トレーニングモデルである。
MonkeyDoc v2は17言語にまたがる1億1300万のイメージからなる、最大規模のドキュメントイメージ事前トレーニングコーパスである。
論文 参考訳(メタデータ) (2026-07-13T13:43:39Z) - MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing [74.84107522458798]
MPDocBench-Parseは、現実世界のアプリケーションにおけるマルチページ文書解析のためのベンチマークである。
433の注釈付き文書に3,246ページあり、英語と中国語の15種類の文書を網羅しており、レイアウトは様々である。
論文 参考訳(メタデータ) (2026-05-21T07:36:41Z) - A Multistage Extraction Pipeline for Long Scanned Financial Documents: An Empirical Study in Industrial KYC Workflows [12.24651956963792]
本稿では,画像前処理,多言語OCR,ハイブリッドページレベルの検索,VLMに基づく構造化抽出を統合した多段階抽出フレームワークを提案する。
提案したパイプラインはPDF-to-VLMベースラインを一貫して上回り、フィールドレベルの精度を最大31.9%向上させた。
論文 参考訳(メタデータ) (2026-04-29T09:19:16Z) - Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA [71.42483000929614]
複数ページのドキュメント 視覚的質問回答は、長い、視覚的に密集したドキュメントにおける意味論、レイアウト、および視覚的要素の推論を必要とする。
我々は,多ページDocVQAをシーケンシャルエビデンスアグリゲーションとしてキャストするtextbfOCRフリーエージェントフレームワークであるDoc-$V*$を提案する。
論文 参考訳(メタデータ) (2026-04-15T11:12:27Z) - MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios [72.8160644291677]
我々は,多言語デジタルおよび写真文書解析のための最初のベンチマークであるMultilingual Document Parsing Benchmarkを紹介する。
MDPBenchは17言語にまたがる3,400のドキュメントイメージ、多様なスクリプト、さまざまな写真条件で構成されている。
論文 参考訳(メタデータ) (2026-03-30T07:47:46Z) - Multi-Stage Field Extraction of Financial Documents with OCR and Compact Vision-Language Models [2.6300820904868263]
金融文書は、規制当局、監査官、金融機関にとって重要な情報源である。
これらの文書は異質であり、同じレポートの中で物語、表、図形、多言語の内容が混在する傾向がある。
本稿では,従来の画像処理モデルとOCR抽出を利用するマルチステージパイプラインと,構造化されたフィールド抽出のためのコンパクトなVLMを提案する。
論文 参考訳(メタデータ) (2025-10-27T06:56:08Z) - MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm [60.14048367611333]
MonkeyOCRはドキュメント解析のためのビジョン言語モデルである。
SRR(Structure-Recognition-Relation)三重項パラダイムを活用することで、最先端の技術の進歩を図っている。
論文 参考訳(メタデータ) (2025-06-05T16:34:57Z) - Arctic-TILT. Business Document Understanding at Sub-Billion Scale [1.2286461468814107]
これらのユースケースで1000$times=そのサイズに匹敵する精度を実現したArctic-TILTを導入する。
単一の24GB GPU上で微調整およびデプロイが可能で、最大400kのトークンでVisually Rich Documentsを処理しながら、運用コストを削減できる。
このモデルは、7つの異なる理解ドキュメントベンチマークの最先端結果を確立し、信頼性の高い信頼性スコアと迅速な推論を提供する。
論文 参考訳(メタデータ) (2024-08-08T17:59:46Z) - Robust PDF Document Conversion Using Recurrent Neural Networks [0.0]
本稿では,リカレントニューラルネットワークを用いたpdfの文書構造復元手法を提案する。
ニューラルネットワークへの入力としてPDF印刷コマンドのシーケンスをどのように使用できるかを示す。
17の異なる構造ラベルで97%の重み付き平均F1スコアを得るモデルを実装します。
論文 参考訳(メタデータ) (2021-02-18T14:39:54Z) - Robust Layout-aware IE for Visually Rich Documents with Pre-trained
Language Models [23.42593796135709]
視覚的にリッチな文書(VRD)からの情報抽出の問題について検討する。
ビジネス文書のテキスト情報と視覚情報の両方を効率的に符号化するために,大規模な事前学習言語モデルとグラフニューラルネットワークのパワーを組み合わせたモデルを提案する。
論文 参考訳(メタデータ) (2020-05-22T06:04:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。