論文の概要: MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding
- arxiv url: http://arxiv.org/abs/2603.22458v1
- Date: Mon, 23 Mar 2026 18:25:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.142223
- Title: MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding
- Title(参考訳): MinerU-Diffusion:ドキュメントOCRを拡散復号化による逆レンダリングとして再考
- Authors: Hejun Dong, Junbo Niu, Bin Wang, Weijun Zeng, Wentao Zhang, Conghui He,
- Abstract要約: 我々は、左から右への因果生成は、タスクの本質的な性質よりも直列化の成果物であると主張する。
我々は,自己回帰的逐次復号を並列拡散復号化に置き換える,統一拡散に基づくフレームワークMinerU-Diffusionを提案する。
実験により、MinerU-Diffusionは、自己回帰ベースラインに比べて最大3.2倍高速なデコードを実現しながら、一貫して堅牢性を改善することが示されている。
- 参考スコア(独自算出の注目度): 32.0980373186604
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Optical character recognition (OCR) has evolved from line-level transcription to structured document parsing, requiring models to recover long-form sequences containing layout, tables, and formulas. Despite recent advances in vision-language models, most existing systems rely on autoregressive decoding, which introduces sequential latency and amplifies error propagation in long documents. In this work, we revisit document OCR from an inverse rendering perspective, arguing that left-to-right causal generation is an artifact of serialization rather than an intrinsic property of the task. Motivated by this insight, we propose MinerU-Diffusion, a unified diffusion-based framework that replaces autoregressive sequential decoding with parallel diffusion denoising under visual conditioning. MinerU-Diffusion employs a block-wise diffusion decoder and an uncertainty-driven curriculum learning strategy to enable stable training and efficient long-sequence inference. Extensive experiments demonstrate that MinerU-Diffusion consistently improves robustness while achieving up to 3.2x faster decoding compared to autoregressive baselines. Evaluations on the proposed Semantic Shuffle benchmark further confirm its reduced dependence on linguistic priors and stronger visual OCR capability.
- Abstract(参考訳): 光文字認識(OCR)は、行レベルの転写から構造化文書解析へと進化し、レイアウト、テーブル、公式を含む長い形式のシーケンスをモデルが復元する必要がある。
近年の視覚言語モデルの発展にもかかわらず、既存のシステムの多くは自動回帰復号化に依存しており、シーケンシャルレイテンシを導入し、長いドキュメントでのエラーの伝播を増幅している。
本稿では,OCRを逆レンダリングの観点から再考し,左から右への因果生成はタスクの本質的な性質ではなくシリアライゼーションの成果であると主張した。
この知見に触発されたMinerU-Diffusionは、自己回帰的逐次復号を視覚条件下での並列拡散復号に置き換える統合拡散に基づくフレームワークである。
MinerU-Diffusionはブロックワイド拡散デコーダと不確実性駆動型カリキュラム学習戦略を用いて、安定したトレーニングと効率的なロングシーケンス推論を実現する。
大規模な実験により、MinerU-Diffusionは、自己回帰ベースラインに比べて最大3.2倍高速なデコードを実現しながら、一貫して堅牢性を改善することが示されている。
提案したセマンティック・シャッフル・ベンチマークの評価により、言語的先行とより強力な視覚的OCR能力への依存度が低下していることが確認された。
関連論文リスト
- DODO: Discrete OCR Diffusion Models [15.352694377412229]
離散拡散ブロックを利用した最初の VLM であるDODO を導入し,OCR の高速化の可能性を明らかにする。
提案手法は, 自己回帰ベースラインに比べて最大3倍高速な推論を実現するとともに, 最先端の精度を実現する。
論文 参考訳(メタデータ) (2026-02-18T20:59:22Z) - Causal Autoregressive Diffusion Language Model [70.7353007255797]
CARDは厳密な因果注意マスク内の拡散過程を再構成し、単一の前方通過で密集した1対1の監視を可能にする。
我々の結果は,CARDが並列生成のレイテンシの利点を解放しつつ,ARMレベルのデータ効率を実現することを示す。
論文 参考訳(メタデータ) (2026-01-29T17:38:29Z) - Reversible Diffusion Decoding for Diffusion Language Models [69.10149777322108]
Reversible Diffusion Decoding (RDD) はブロックワイド拡散生成に可逆性を導入するデコーディングフレームワークである。
RDDは、逆プロセスの状態依存的な障害として停滞を検出し、以前のブロックへの効率的なバックトラックを可能にする。
実験により、RDDは最小の計算オーバーヘッドでベースラインよりも生成の堅牢性と品質を向上させることが示された。
論文 参考訳(メタデータ) (2026-01-29T12:52:33Z) - Deferred Commitment Decoding for Diffusion Language Models with Confidence-Aware Sliding Windows [33.361153168706444]
トレーニング不要なデコード戦略として,Dederred Commitment Decoding (DCD)を提案する。
DCDは、マスクされたトークンの上に信頼性を意識したスライディングウィンドウを保持しており、十分な文脈証拠が得られるまで、高い不確実性トークンを延期しながら、早期に低不確実性トークンを解決している。
実験の結果、DCDは固定ブロックベースの拡散法に比べて平均時間で1.39%向上し、最も顕著な改善は9.0%に達した。
論文 参考訳(メタデータ) (2026-01-05T12:57:33Z) - WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference [44.87788417755154]
本稿では,標準因果注意に基づく拡散復号化フレームワークWeDLMを提案する。
WeDLMは強力なARバックボーンの品質を維持しつつ,大幅な高速化を実現している。
論文 参考訳(メタデータ) (2025-12-28T01:25:48Z) - Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies [62.653984010274485]
VLA(Vision-Language-Action)モデルは、画像や命令をロボットアクションにマッピングするために、大きな視覚言語バックボーンを適応させる。
prevailingAsは、固定された左から右への順序で自動回帰的にアクションを生成するか、バックボーンの外側で分離または拡散ヘッドをアタッチする。
本稿では離散拡散を伴う離散化作用チャンクをモデル化する統一変換器ポリシである離散拡散VLAを提案する。
論文 参考訳(メタデータ) (2025-08-27T17:39:11Z) - Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding [51.711605076319216]
拡散に基づく大規模言語モデル (Diffusion LLM) は、並列復号機能を持つ非自己回帰テキスト生成を約束している。
本稿では,双方向拡散モデルに適したブロック単位で近似したKVキャッシュ機構を提案する。
本稿では,信頼しきい値を超えるトークンを選択的に復号し,依存関係違反を軽減し,生成品質を維持できる信頼度対応並列復号方式を提案する。
論文 参考訳(メタデータ) (2025-05-28T17:39:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。