論文の概要: DocPure: Prompt-Free Unified Document Restoration via Degradation-Aware Structure-Guided Wavelet Modulation
- arxiv url: http://arxiv.org/abs/2608.09536v1
- Date: Mon, 10 Aug 2026 12:35:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.262385
- Title: DocPure: Prompt-Free Unified Document Restoration via Degradation-Aware Structure-Guided Wavelet Modulation
- Title(参考訳): DocPure: 構造に配慮したウェーブレット変調によるプロンプトフリー統一文書復元
- Authors: Lingming Su, Wanglong Lu, Tao Wang, Kaihao Zhang, Nan Zhang, Liyan An, Hanli Zhao,
- Abstract要約: DocPureは、分解を意識したドキュメント復元を実現する、プロンプトフリーの統一フレームワークである。
周波数領域の特徴と空間意味を橋渡しする構造誘導ウェーブレット相互作用機構を提案する。
DocPureは最先端の手法と比較して高いパフォーマンスを実現している。
- 参考スコア(独自算出の注目度): 21.204693986982686
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High-quality document images are pivotal for information archiving and downstream automatic processing. However, they are frequently compromised by diverse degradations during uncontrolled acquisition and transmission. While unified document restoration techniques have been proposed to restore images from multiple degradations, they often struggle with training multiple degradation-specific models, reliance on manual task-specific prompts, or cross-task data pairing. To address these limitations, we propose DocPure, a prompt-free unified framework that achieves degradation-aware document restoration. We design a degradation-aware structure auto-encoder with degradation-informed routing regularization to predict clean structural priors from degraded inputs. The model is prompt-free at inference, and degradation labels are only used as auxiliary supervision for the routing regularization during training. Furthermore, we introduce a structure-guided wavelet interaction mechanism to bridge frequency-domain features and spatial semantics. Within the structure-guided wavelet interaction mechanism, a cross-frequency adaptive modulation utilizes low-frequency sub-bands to modulate high-frequency recovery, ensuring structural consistency. Extensive experiments demonstrate that DocPure achieves strong performance compared with state-of-the-art methods across various tasks, including deblurring, denoising, compression artifact reduction, and deshadowing.
- Abstract(参考訳): 高品質な文書画像は、情報アーカイブと下流の自動処理に欠かせない。
しかし、それらは、制御されていない取得と送信の過程で、多種多様な劣化によってしばしば損なわれる。
複数の劣化からイメージを復元するために統一された文書復元技術が提案されているが、多くの場合、複数の劣化特異的モデル、手動タスク固有のプロンプトへの依存、あるいはクロスタスクデータペアリングの訓練に苦慮している。
このような制約に対処するため,文書の復元を迅速に行うための統合フレームワークDocPureを提案する。
我々は、劣化した入力からクリーンな構造先行を予測するために、劣化インフォーマルなルーティング正規化を備えた劣化対応構造自動エンコーダを設計する。
モデルは推論時に即時フリーであり、劣化ラベルはトレーニング中のルーティング規則化の補助的監視としてのみ使用される。
さらに、周波数領域の特徴と空間意味を橋渡しする構造誘導ウェーブレット相互作用機構を導入する。
構造誘導ウェーブレット相互作用機構において、クロス周波数適応変調は低周波サブバンドを用いて高周波回復を変調し、構造的整合性を確保する。
大規模な実験によりDocPureは、デブロアリング、デノイング、圧縮アーティファクトの削減、デシャドーイングなど、さまざまなタスクにわたる最先端のメソッドと比較して、高いパフォーマンスを実現していることが示された。
関連論文リスト
- Degradation-Aware Prompt Learning with Cross-Modal Compensation for Adverse Weather Removal [56.34780145346335]
Degradation-Aware Cross-Modal Prompt Compensation Network (DCMPC-Net)
DCMPC-Netは、CMPG(Cross-Modal Prompt Generator)、PGAAM(Prompt-Guided Attention Alignment Module)、DFCM(Dual Feature Compensation Module)で構成される。
実験により、DCMPC-Netはタスク固有の設定と統一された設定の両方で最先端のメソッドより優れていることが示された。
論文 参考訳(メタデータ) (2026-08-07T08:13:40Z) - DR-Mamba: Automatic Inference-Time Domain Adaptation for Document Image Binarization via Sample-Conditioned Detail-Background Suppression [0.42970700836450487]
DR-Mambaは、文書画像のバイナライゼーションのためのサンプル条件付き詳細背景抑圧フレームワークである。
1つのフォワードパス内の入力依存ゲートを介して、各入力ドキュメントに適合する。
最もひどく劣化したホールドアウトフォールドに強いパフォーマンスを示す。
論文 参考訳(メタデータ) (2026-06-21T18:09:28Z) - Degradation-Aware Adaptive Context Gating for Unified Image Restoration [57.06559692537862]
単一モデルを用いた統一画像復元は、多種多様な劣化によるタスク干渉に直面することが多い。
DACG-IRは,劣化特性を明瞭に認識し,特徴表現を動的に変調する。
DACG-IRは、単一タスク、オールインワン、悪天候除去、複合劣化設定において最先端の手法よりも優れた性能を示す。
論文 参考訳(メタデータ) (2026-05-02T04:18:43Z) - Breaking Degradation Coupling: A Structural Entropy Guided Decoupled Framework and Benchmark for Infrared Enhancement [29.128631067023846]
既存のオールインワンアプローチでは、多種多様な劣化を処理するために、単一の共有バックボーンを使用するのが一般的である。
本稿では, 複合劣化を独立したサブプロセスに分解する構造エントロピー誘導デカップリングフレームワークを提案する。
本研究は,SEGDが最先端手法を超越し,より少ないパラメータで高い効率を達成することを示す。
論文 参考訳(メタデータ) (2026-04-24T08:58:55Z) - Compressed-Sensing-Guided, Inference-Aware Structured Reduction for Large Language Models [0.0]
大規模言語モデルは強力な生成性能を提供するが、膨大なパラメータ数、メモリ使用量、復号遅延のコストがかかる。
動的LLM実行のための統合圧縮センシング誘導フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-22T14:27:24Z) - ClusIR: Towards Cluster-Guided All-in-One Image Restoration [72.16989784735796]
ClusIRは、統一されたフレームワーク内でさまざまな劣化から高品質なイメージを復元することを目的としている。
ClusIRは、確率的クラスタ誘導ルーティング機構(PCGRM)と劣化対応周波数変調モジュール(DAFMM)の2つの重要なコンポーネントから構成される。
論文 参考訳(メタデータ) (2025-12-11T18:59:47Z) - Beyond Degradation Redundancy: Contrastive Prompt Learning for All-in-One Image Restoration [109.38288333994407]
コントラスト・プロンプト・ラーニング(Contrastive Prompt Learning, CPL)は、プロンプト・タスクのアライメントを根本的に強化する新しいフレームワークである。
本フレームワークは,パラメータ効率を保ちながら,新たな最先端性能を確立し,統一画像復元のための原理的ソリューションを提供する。
論文 参考訳(メタデータ) (2025-04-14T08:24:57Z) - Cross-Consistent Deep Unfolding Network for Adaptive All-In-One Video
Restoration [78.14941737723501]
オールインワンVRのためのクロスコンセントディープ・アンフォールディング・ネットワーク(CDUN)を提案する。
2つのカスケード手順を編成することにより、CDUNは様々な劣化に対する適応的な処理を達成する。
さらに、より隣接するフレームからの情報を活用するために、ウィンドウベースのフレーム間融合戦略を導入する。
論文 参考訳(メタデータ) (2023-09-04T14:18:00Z) - DocDiff: Document Enhancement via Residual Diffusion Models [7.972081359533047]
文書強調問題に特化して設計された拡散型フレームワークであるDocDiffを提案する。
DocDiffは2つのモジュールで構成されている: 粗い予測器(CP)と高周波数残差リファインメント(HRR)モジュール。
事前学習したDocDiffのHRRモジュールは,4.17Mのパラメータしか持たない,プラグアンドプレイで使用可能である。
論文 参考訳(メタデータ) (2023-05-06T01:41:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。