論文の概要: Closing Cost-Quality Gap in Document VLMs: Difficulty-Aware Data Curation and Quality-Adjusted Deployment Economics
- arxiv url: http://arxiv.org/abs/2609.01575v1
- Date: Tue, 01 Sep 2026 17:40:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.902294
- Title: Closing Cost-Quality Gap in Document VLMs: Difficulty-Aware Data Curation and Quality-Adjusted Deployment Economics
- Title(参考訳): 文書VLMにおけるコスト・クオリティのギャップ:困難に配慮したデータキュレーションと品質調整展開経済
- Authors: Maksim Evdokimov, Matvey Ivanov, Dmitrii Tsiupin, Olga Tsymboi, Anatolii Potapov, Aleksandr Ivanov,
- Abstract要約: 我々は、Mixture-of-Experts VLM(合計35B、3Bアクティブ)上に構築された文書理解システムを提案する。
レイアウトの多様性、事実抽出性、モデル間の整合性のために、Difficulty-Awareパイプラインによってキュレーションされたオープンドメインドキュメントと混在する社内生産データに基づいて微調整された。
これは、人間のベースラインに対して80%以上コストを削減し、最高の競合するオープンソースモデルに対して50%以上コストを削減します。
- 参考スコア(独自算出の注目度): 35.7787137037136
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Extracting structured fields from hundreds of millions of documents annually remains costly in regulated industries: bespoke OCR cascades cover only a fraction of workflows, privacy rules preclude external models, and existing open-source VLMs that clear quality thresholds cost more to serve than human annotation. We present a deployed document-understanding system built on a Mixture-of-Experts VLM (35B total, 3B active), fine-tuned on in-house production data mixed with open-domain documents curated by a Difficulty-Aware pipeline for layout diversity, fact-extractability, and cross-model consistency. Fitting on a single H100 and serving heterogeneous workflows via prompting, the model leads all deployable (non-reasoning) baselines up to an order of magnitude larger. A quality-adjusted cost analysis, with confirmation and correction costs calibrated from production telemetry, shows it reduces expected costs by over 80% against the human baseline and by more than 50% against the best competing open-source model, while larger baselines remain economically unviable.
- Abstract(参考訳): 毎年数億のドキュメントから構造化されたフィールドを抽出することは、規制された業界でコストがかかる。OCRカスケードはワークフローのごく一部をカバーし、プライバシールールは外部モデルを妨げる。
本稿では,Mixture-of-Experts VLM (35B total, 3B active) 上に構築された文書理解システムについて述べる。
1つのH100に設定し、プロンプトを通じて異種ワークフローを提供すると、モデルはすべてのデプロイ可能な(非推論)ベースラインを桁違いに大きく導きます。
品質調整されたコスト分析は、生産テレメトリから調整された確認と補正のコストで、人間のベースラインに対して80%以上コストを削減し、最高の競合するオープンソースモデルに対して50%以上コストを削減し、より大きなベースラインは経済的に不可能なままである。
関連論文リスト
- ScaleSense: Cost-Intelligent Scaling Framework via Learned Resource Estimation in Alibaba AnalyticDB [59.708423132520515]
クラウドネイティブなサーバレスデータウェアハウスは、計算からストレージを分離することで、きめ細かい弾力性を達成する。
しかし、高度にヘテロジニアスなアドホッククエリに対する最適なリソース割り当てを決定することは、深刻な産業上の課題である。
プロアクティブでクエリレベルのリソーススケーリングフレームワークであるScaleSenseを提案する。
論文 参考訳(メタデータ) (2026-08-08T06:10:35Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - Assessment of RAG and Fine-Tuning for Industrial Question-Answering-Applications [2.497641182907452]
本研究では,自動車産業に特化した2つの閉じたデータセットに対するRAGとFTの影響について検討した。
我々の研究結果によると、プレミアムモデルは最初から最高の性能を発揮するが、オープンソースモデルはRAGで拡張すると同等の品質が得られる。
論文 参考訳(メタデータ) (2026-05-10T13:35:16Z) - DharmaOCR: Specialized Small Language Models for Structured OCR that outperform Open-Source and Commercial Baselines [0.0]
この原稿では、構造化OCR用の特殊小言語モデル(SSLM)であるDharmaOCR Full and Liteを紹介している。
DharmaOCR-Benchmarkも紹介されている。DharmaOCR-Benchmarkは、印刷、手書き、および法的/行政文書をカバーするベンチマークである。
テキストの劣化を明示的に追跡しながら、忠実度と構造を測定する統一評価プロトコルを提案する。
論文 参考訳(メタデータ) (2026-04-15T18:17:11Z) - Better Datasets Start From RefineLab: Automatic Optimization for High-Quality Dataset Refinement [39.059969362018286]
RefineLabは、生のQA(QA)データを制御可能なトークン予算制約の下で高品質なデータセットに自動的に洗練するフレームワークである。
リソース制限を尊重しながらQAサンプルの品質を改善するという制約付き最適化問題に対処する。
実験によると、RefineLabは、カバレッジ、アライメントの難しさ、事実の忠実さ、イントラクタの品質など、専門家データセットからのばらつきを一貫して制限している。
論文 参考訳(メタデータ) (2025-11-09T20:32:35Z) - Cut Costs, Not Accuracy: LLM-Powered Data Processing with Guarantees [10.940593916080276]
大規模言語モデル(LLM)は、大規模テキストデータセットを処理するために、データシステムのビルディングブロックとしてますます使われています。
高いコストを避けるため、より安価だが低品質のLCMをレコード処理に使用することができる。
BARGAINは,データ処理に安価なLCMを用いてコストを大幅に削減する手法である。
論文 参考訳(メタデータ) (2025-09-02T23:41:50Z) - Democratizing LLMs: An Exploration of Cost-Performance Trade-offs in
Self-Refined Open-Source Models [53.859446823312126]
SoTAは7Bから65Bまでのさまざまなサイズのオープンソースモデルを平均して、ベースラインのパフォーマンスから8.2%改善している。
厳密に言えば、Vicuna-7Bのような非常に小さなメモリフットプリントを持つモデルでさえ、全体的な11.74%の改善と、高い創造性、オープンエンドタスクの25.39%の改善を示している。
論文 参考訳(メタデータ) (2023-10-11T15:56:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。