論文の概要: On the Diffusibility of High-Dimensional Latents
- arxiv url: http://arxiv.org/abs/2609.28473v1
- Date: Wed, 23 Sep 2026 17:59:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:18.141917
- Title: On the Diffusibility of High-Dimensional Latents
- Title(参考訳): 高次元潜水剤の拡散性について
- Abstract要約: オフザシェルフエンコーダは忠実な再構築には最適化されておらず、きめ細かい視覚的詳細は捨てている。
この高次元空間における流れマッチングにおける標準速度予測は、低次元信号多様体の外側の雑音方向を適合させる必要があることを示す。
これは代わりにクリーンなデータパラメータ化(boldsymbolx_0$-prediction)を使うことを動機付け、基礎となる信号多様体を学習する。
- 参考スコア(独自算出の注目度): 58.53062634202064
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Representation Autoencoders (RAEs) enable diffusion models to operate in the feature spaces of pretrained visual encoders. However, many off-the-shelf encoders are not optimized for faithful reconstruction, discarding fine-grained visual details. As expected, finetuning these encoders for image reconstruction recovers such details. However, perhaps counterintuitively, this procedure reduces the effective dimensionality of the resulting representation, and the altered geometry has downstream effects on generation. Specifically, we show that using the standard velocity prediction in flow matching in this high-dimensional space requires the model to fit orthogonal noise directions outside the low-dimensional signal manifold, making optimization inefficient. This motivates using the clean data parameterization ($\boldsymbol{x}_{0}$-prediction) instead, which focuses learning on the underlying signal manifold. Across experiments with multiple strong-reconstruction encoders, we show that $\boldsymbol{x}_{0}$-prediction consistently improves text-to-image generation performance.
- Abstract(参考訳): 表現オートエンコーダ(RAE)は、事前訓練された視覚エンコーダの特徴空間で拡散モデルを動作させることができる。
しかし、多くの既製のエンコーダは忠実な再構築に最適化されておらず、きめ細かい視覚的詳細は捨てられている。
予想通り、画像再構成のためのエンコーダの微調整は、そのような詳細を回復する。
しかし、おそらく逆向きに、この手順は結果の表現の有効次元を減少させ、変化した幾何学は生成に下流の影響を与える。
具体的には、この高次元空間における流れマッチングにおける標準速度予測を用いることで、低次元信号多様体の外側の直交雑音方向を適合させ、最適化を非効率にするモデルが必要であることを示す。
これは代わりにクリーンなデータパラメータ化("\boldsymbol{x}_{0}$-prediction")を使うことを動機付け、基礎となる信号多様体を学習する。
複数の強再構成エンコーダを用いた実験で、$\boldsymbol{x}_{0}$-prediction はテキスト・画像生成性能を一貫して改善することを示した。
関連論文リスト
- Improving Reconstruction of Representation Autoencoder [52.817427902597416]
低レベル情報を欠いた意味的特徴を増強する表現オートエンコーダLV-RAEを提案する。
実験により,LV-RAEは意味的抽象化を保ちながら,再構成の忠実度を著しく向上することが示された。
論文 参考訳(メタデータ) (2026-02-09T13:12:35Z) - Epsilon-VAE: Denoising as Visual Decoding [61.29255979767292]
復号化は1段階の再構成から反復的改良へと移行する。
具体的には、デコーダを拡散処理に置き換え、ノイズを反復的に改善して元の画像を復元する。
拡散による反復的再構成により, 自己エンコーダであるEpsilon-VAEは高い再構成品質を実現する。
論文 参考訳(メタデータ) (2024-10-05T08:27:53Z) - Complexity Matters: Rethinking the Latent Space for Generative Modeling [65.64763873078114]
生成的モデリングにおいて、多くの成功したアプローチは、例えば安定拡散のような低次元の潜在空間を利用する。
本研究では, モデル複雑性の観点から潜在空間を再考することにより, 未探索の話題に光を当てることを目的としている。
論文 参考訳(メタデータ) (2023-07-17T07:12:29Z) - Lossy Image Compression with Conditional Diffusion Models [25.158390422252097]
本稿では,拡散生成モデルを用いた画像圧縮のエンドツーエンド最適化について概説する。
VAEベースのニューラル圧縮とは対照的に、(平均)デコーダは決定論的ニューラルネットワークであり、私たちのデコーダは条件付き拡散モデルである。
提案手法では,GANモデルよりもFIDスコアが強く,VAEモデルとの競合性能も高い。
論文 参考訳(メタデータ) (2022-09-14T21:53:27Z) - The Deep Generative Decoder: MAP estimation of representations improves
modeling of single-cell RNA data [0.0]
モデルパラメータと表現を直接最大後部推定(MAP)により計算する単純な生成モデルを提案する。
このアプローチの利点は、その単純さと、同等のVAEよりもはるかに小さな次元の表現を提供する能力である。
論文 参考訳(メタデータ) (2021-10-13T12:17:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。