論文の概要: IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation
- arxiv url: http://arxiv.org/abs/2607.09133v1
- Date: Fri, 10 Jul 2026 06:43:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.800417
- Title: IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation
- Title(参考訳): IB-Flow:Few-Stepテキスト・画像生成のためのインフォメーション・ボトルネック誘導CFG蒸留
- Authors: Yiting Wang, Jingyi Zhang, Wenhu Zhang, Ke Chao, Yves Liang, Kun Cheng, Kang Zhao,
- Abstract要約: 自由誘導軌道を対象とする蒸留は2次元圧縮パラダイムとして広く普及している。
我々は、情報理論の理論レンズを通して蒸留プロセスを再検討する。
本稿では、難解なKL分散制約をゼロオーバーヘッド閉形式解に変換するインスタンス認識選択機構を提案する。
- 参考スコア(独自算出の注目度): 9.17007090517294
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While large-scale text-to-image generative models have achieved unprecedented visual performance, their inherent reliance on multi-step iterative solvers incurs severe inference latency. Few-step distillation targeting the Classifier-Free Guidance (CFG) trajectory has emerged as the prevalent dual-dimensional compression paradigm. However, existing frameworks remain subjugated by a coarse-grained blind injection paradigm that perpetually enforces a globally static guidance strength while indiscriminately sampling the supervisor timestep. This state-agnostic design completely disregards the intrinsic nature of image generation as a dynamic evolutionary process characterized by progressive entropy reduction, which not only restricts the performance boundary of few-step compression but also precipitates severe CFG over-conditioning artifacts. To transcend these limitations, we re-examine the distillation procedure through the theoretical lens of Information Theory, formally modeling it as a dynamic mutual information game constrained by the Information Bottleneck (IB) principle. Specifically, we dismantle traditional blind assumptions via a dual-track adaptive framework. To determine the injection target, we propose an instance-aware selection mechanism that transmutes the intractable KL divergence constraint into a zero-overhead closed-form solution predicated on the local vector field norm. To regulate the injection strength, we introduce an entropy-aware schedule that dynamically decays alongside the SNR, applying maximal thrust for initial structural anchoring before smoothly reverting to the natural manifold to refine micro-details. Extensive empirical evaluations corroborate that our framework fundamentally eradicates over-conditioning artifacts, shattering the performance ceiling to achieve SOTA generative fidelity under extremely stringent 2-step configurations.
- Abstract(参考訳): 大規模テキストから画像への生成モデルは、前例のない視覚的性能を達成したが、多段階反復解法に固有の依存は、深刻な推論遅延を引き起こす。
二次元圧縮パラダイムとして,CFGトラジェクトリを対象とする多段蒸留が注目されている。
しかし、既存のフレームワークは、監督タイムステップを無差別にサンプリングしながら、グローバルに静的なガイダンス強度を永久に強制する粗いブラインドインジェクションパラダイムによって、いまだ従属している。
この状態に依存しない設計は、プログレッシブエントロピー還元を特徴とする動的進化過程として、画像生成の本質的な性質を完全に無視する。
これらの制限を超越するために、我々は、情報理論の理論レンズを通して蒸留プロセスを再検討し、インフォメーション・ボトルネック(IB)の原理に制約された動的相互情報ゲームとして正式にモデル化する。
具体的には、従来の盲点仮定をデュアルトラック適応フレームワークで分解する。
そこで本研究では, 局所ベクトル場ノルムに基づくゼロオーバーヘッド閉形式解に, 難解なKL分散制約を変換するインスタンス認識選択機構を提案する。
そこで本研究では,SNRとともに動的に崩壊するエントロピー対応のスケジュールを導入し,初期構造アンカーに最大推力を適用し,自然多様体に滑らかに逆戻りしてマイクロディテールを洗練させる。
過条件のアーティファクトを根本から根本から根絶し, 極端に厳密な2ステップ構成でSOTA生成率を達成するため, 性能天井を破砕した。
関連論文リスト
- Partial Skeleton Visibility for Action Recognition: A Constrained Field-of-View Approach [60.596944437968524]
partialVisGraphは、制約されたフィールド・オブ・ビューの下で、堅牢なスケルトンベースのアクション認識のための新しいフレームワークである。
部分的な可視性の下では、最先端の精度を一貫して達成し、厳しいFoV制限のあるサブセットでは68.8%まで上昇する。
提案手法は,非拘束環境下でのスケルトンに基づく行動理解を実現するための,原則的かつ実践的な経路を提供する。
論文 参考訳(メタデータ) (2026-07-01T10:03:11Z) - Curvature-Adaptive Consistency Flow Matching: Autonomous Trajectory Optimization via Reinforcement Learning [8.422673935994451]
連続蒸留は拡散モデルの推論を 著しく加速させました
本稿では,静的サンプリングの限界に対処するため,曲率適応整合フローマッチングを提案する。
提案手法は,FLUXやSDXLといった大規模モデルに対して,最新の結果を実現する。
論文 参考訳(メタデータ) (2026-06-21T08:49:50Z) - Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation [50.139984798361375]
遅延不一致による冗長性を除去する学習自由フレームワークを提案する。
LD-Pruningは、Infinity-8Bの最大2.35倍のスピードアップを実現し、高い生成品質を維持しながら推論を大幅に削減する。
論文 参考訳(メタデータ) (2026-05-29T19:34:39Z) - Bridging Restoration and Generation Manifolds in One-Step Diffusion for Real-World Super-Resolution [22.963799508399365]
最近の単一段階蒸留は推論を加速するが、認識歪んだトレードオフに直面している。
実時間ISR(IDaS-SR)の適応的インバージョンと劣化認識サンプリングを提案する。
IDaS-SRは決定論的復元と生成のボトルネックを埋める一段階のフレームワークである。
論文 参考訳(メタデータ) (2026-04-27T07:43:00Z) - Co-Diffusion: An Affinity-Aware Two-Stage Latent Diffusion Framework for Generalizable Drug-Target Affinity Prediction [19.66162559968931]
Co-DiffusionはDTA予測を再定義する新しいフレームワークである。
我々は,Co-Diffusionが最先端のベースラインを著しく上回ることを示す。
論文 参考訳(メタデータ) (2026-03-11T14:47:58Z) - Score-Guided Proximal Projection: A Unified Geometric Framework for Rectified Flow Editing [1.0312968200748118]
Rectified Flowモデルは最先端の世代品質を実現するが、正確なタスクのためにそれらを制御することは依然として困難である。
現在のアプローチは「幾何学的ロック」に苦しむ逆法に基づくガイダンスに分岐する
Score-Guided Proximal Projectionは,決定論的最適化と縮尺サンプリングのギャップを埋める統一フレームワークである。
論文 参考訳(メタデータ) (2026-03-05T23:44:45Z) - Gradients Must Earn Their Influence: Unifying SFT with Generalized Entropic Objectives [22.29000001610794]
Supervised Fine-Tuning (SFT) の標準的な負の対数構造は、均一なトークンレベルの重み付けを適用する。
この剛性は2重の障害モードを生成する: (i)低確率目標を過度に強調することは、ノイズの監督の勾配を増幅し、頑健な事前を妨害し、 (ii)一様重み付けは、モデルが既に自信を持っているときに弱いシャープニングを与える。
既存の方法は可塑性の解決に失敗し、不安定なジレンマがしばしば有害なジレンマとともに必要な学習信号を抑圧する。
パラメータ自由度を変調する動的エントロピーファインチューニング(DEFT)を導入する。
論文 参考訳(メタデータ) (2026-02-11T22:56:43Z) - Normalized Attention Guidance: Universal Negative Guidance for Diffusion Models [57.20761595019967]
注意空間にL1をベースとした正規化・精細化を施した,効率的かつトレーニング不要な機構である正規化注意誘導(NAG)を提案する。
NAGは、CFGが忠実性を維持しながら崩壊する効果的な負のガイダンスを復元する。
NAGはアーキテクチャ(UNet、DiT)、サンプリングレシスタンス(複数ステップ、複数ステップ)、モダリティ(イメージ、ビデオ)をまたいで一般化する
論文 参考訳(メタデータ) (2025-05-27T13:30:46Z) - Toward Certified Robustness Against Real-World Distribution Shifts [65.66374339500025]
我々は、データから摂動を学ぶために生成モデルを訓練し、学習したモデルの出力に関して仕様を定義する。
この設定から生じるユニークな挑戦は、既存の検証者がシグモイドの活性化を厳密に近似できないことである。
本稿では,古典的な反例誘導的抽象的洗練の概念を活用するシグモイドアクティベーションを扱うための一般的なメタアルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-06-08T04:09:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。