論文の概要: In-Token Learning for High-Fidelity Image Restoration via Diffusion Transformers
- arxiv url: http://arxiv.org/abs/2609.33523v1
- Date: Sun, 27 Sep 2026 12:45:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 16:06:37.59843
- Title: In-Token Learning for High-Fidelity Image Restoration via Diffusion Transformers
- Title(参考訳): 拡散変換器を用いた高精細画像復元のためのインToken学習
- Abstract要約: In-Token Learningは、条件付き整流マッチングを用いて事前学習した拡散変圧器を適応する画像復元フレームワークである。
DIV2K, LSDIR, FFHQ, RealLQ250, RealPhoto60の超高分解能・高分解能化とDIV2KとLSDIRの自動着色について検討した。
- 参考スコア(独自算出の注目度): 0.8409980020848167
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present In-Token Learning, an image restoration framework that adapts a pretrained diffusion transformer using conditional rectified flow matching. Clean targets paired with degraded inputs supervise transport from Gaussian noise to restored images. Spatially aligned degraded-image tokens are fused with evolving latent tokens along the channel dimension, preserving the image-token count at a given resolution. Direct Low-Quality Guidance (DLG) combines frozen degraded-image embeddings with a fixed task prompt through the native conditioning pathway, without a trainable ControlNet-style branch or image captioning. We evaluate super-resolution and denoising on DIV2K, LSDIR, FFHQ, RealLQ250, and RealPhoto60, and automatic colorization on DIV2K and LSDIR. The tasks use separately trained checkpoints under the same framework. Results show competitive fidelity and perceptual quality under the evaluated protocols, with weaker generalization on RealLQ250. We report full-image QHD ($2560{\times}1440$) inference and a tiled $12$K restoration demonstration of Along the River During the Qingming Festival. Attention cost still increases with resolution. This technical report preserves the early broader study underlying Fill2SR, which subsequently developed the real-world super-resolution direction.
- Abstract(参考訳): In-Token Learningは、条件付き整流マッチングを用いて事前学習した拡散変圧器を適応する画像復元フレームワークである。
劣化した入力と組み合わせたクリーンターゲットは、ガウスノイズから復元された画像への輸送を監督する。
空間的に整列された劣化画像トークンは、チャネル次元に沿って進化する遅延トークンと融合し、所定の解像度で画像トークン数を保存する。
Direct Low-Quality Guidance (DLG)は、トレーニング可能なControlNetスタイルのブランチやイメージキャプションなしで、凍結したデグレードイメージの埋め込みと、ネイティブコンディショニングパスを介して、固定されたタスクプロンプトを結合する。
DIV2K, LSDIR, FFHQ, RealLQ250, RealPhoto60の超高分解能・高分解能化とDIV2KとLSDIRの自動着色について検討した。
タスクは同じフレームワークの下で個別にトレーニングされたチェックポイントを使用する。
以上の結果から,RealLQ250における競合的忠実度と知覚的品質が評価された。
本報告では,QHD (2560{\times}1440$) の推測と,清水祭期間中の川岸における12ドルの復元デモを報告する。
維持コストは分解能とともに上昇する。
この技術報告は、Fill2SRの基礎となる初期のより広範な研究を保存し、その後、現実世界の超解像方向を発達させた。
関連論文リスト
- Fill2SR: Repurposing Inpainting Diffusion Transformers for Real-World Super-Resolution [0.8409980020848167]
余分な空間枝を持たないSR用マスク付き塗装拡散変圧器を応用したFill2SRを提案する。
RCDTは、未使用の実際の画像から劣化ディスクリプタを蒸留し、凍結したオープンソースモデルを使用してクリーンなターゲットに転送する。
RCDTのベースモデルでは,RealLQ250とRealPhoto60の非参照品質を継続的に向上させるため,LPIPSドロップを小さくする。
論文 参考訳(メタデータ) (2026-09-27T13:55:22Z) - PixRestore: Unified Image Restoration via Pixel Diffusion Transformer [25.58481833908051]
統一画像復元(UIR)は、低品質(LQ)画像から高品質(HQ)コンテンツを異なる劣化で復元することを目的としている。
本稿では,VAEフリー画素空間拡散変換器(DiT)であるPixRestoreについて述べる。
PixRestoreは、パッチされたピクセル上で直接フローマッチングを実行し、トークンシーケンスをトラクタブルに保ちながら、きめ細かい詳細を保存する。
論文 参考訳(メタデータ) (2026-08-17T16:49:55Z) - Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You Think [63.25744258438214]
REPAとその変種は、事前訓練されたモデルから外部の視覚表現を取り入れることで、拡散モデルのトレーニング課題を効果的に軽減する。
偏見推論過程全体において欠落している外部アライメントは、識別的表現の可能性を完全に活用するに足らないと我々は主張する。
本稿では,事前学習した基礎モデルから,低レベル画像ラテントを1つの高レベルクラストークンで絡み合わせるRepresentation Entanglement for Generation (REG)を提案する。
論文 参考訳(メタデータ) (2025-07-02T08:29:18Z) - Iterative Token Evaluation and Refinement for Real-World
Super-Resolution [77.74289677520508]
実世界の画像超解像(RWSR)は、低品質(LQ)画像が複雑で未同定の劣化を起こすため、長年にわたる問題である。
本稿では,RWSRのための反復的トークン評価・リファインメントフレームワークを提案する。
ITERはGAN(Generative Adversarial Networks)よりも訓練が容易であり,連続拡散モデルよりも効率的であることを示す。
論文 参考訳(メタデータ) (2023-12-09T17:07:32Z) - DiffBIR: Towards Blind Image Restoration with Generative Diffusion Prior [70.46245698746874]
DiffBIRは、視覚の異なる画像復元タスクを処理できる一般的な修復パイプラインである。
DiffBIRは, ブラインド画像復元問題を, 1) 劣化除去: 画像に依存しない内容の除去; 2) 情報再生: 失われた画像内容の生成の2段階に分離する。
第1段階では, 修復モジュールを用いて劣化を除去し, 高忠実度復元結果を得る。
第2段階では、潜伏拡散モデルの生成能力を活用して現実的な詳細を生成するIRControlNetを提案する。
論文 参考訳(メタデータ) (2023-08-29T07:11:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。