論文の概要: Where Does Generative Difficulty Reside? An Empirical Study of Target Representations
- arxiv url: http://arxiv.org/abs/2608.00626v1
- Date: Sat, 01 Aug 2026 12:32:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.830345
- Title: Where Does Generative Difficulty Reside? An Empirical Study of Target Representations
- Title(参考訳): 生成困難はどこに残るのか? : ターゲット表現の実証的研究
- Abstract要約: ターゲット表現は、イメージジェネレータが学ぶ必要がある分布を定義するが、しばしば交換可能なインターフェースとして扱われる。
マスク付き自己回帰整流モデルにおいて,生画素,SD-VAE潜伏剤,DINOv2,MAE表現-オートエンコーダの特徴について検討した。
その結果, 圧縮, 再構成忠実度, トークン次元, 可視的セマンティッククラスタリングは生成挙動を個別に予測できないことがわかった。
- 参考スコア(独自算出の注目度): 62.54876287800644
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The target representation defines the distribution an image generator must learn, yet it is often treated as an interchangeable interface. This assumption is particularly questionable for continuous masked generators, which combine contextual inference from visible tokens with conditional modeling of each missing token. We study raw pixels, SD-VAE latents and DINOv2 as well as MAE representation-autoencoder features within a unified masked autoregressive rectified-flow model. Under a shared ImageNet training budget, these spaces exhibit distinct optimization and inference regimes. DINOv2 converges fastest in both iterations and computation but benefits strongly from a wider local denoiser and direct context fusion. Pixels optimize substantially more slowly and require a different prediction, masking, and guidance configuration. MAE reconstructs images more faithfully and exhibits clear semantic clustering, yet produces generations substantially worse than DINOv2. The representations also respond differently to classifier-free guidance and occupy distinct precision-recall trade-offs. Together, our results show that compression, reconstruction fidelity, token dimensionality, and visible semantic clustering do not individually predict generative behavior. Instead, target representations redistribute difficulty across contextual modeling, per-token denoising, and inference-time distributional control.
- Abstract(参考訳): ターゲット表現は、イメージジェネレータが学ぶ必要がある分布を定義するが、しばしば交換可能なインターフェースとして扱われる。
この仮定は、目に見えるトークンからの文脈的推論と、欠落するトークンの条件的モデリングを組み合わせた連続的なマスク付きジェネレータにとって特に問題となる。
マスク付き自己回帰整流モデルにおいて,生画素,SD-VAE潜伏剤,DINOv2,MAE表現-オートエンコーダの特徴について検討した。
共有されたImageNetトレーニング予算の下では、これらの空間は異なる最適化と推論規則を示す。
DINOv2は反復と計算の両方で最速に収束するが、より広い局所的なデノイザと直接文脈融合の恩恵を受ける。
ピクセルの最適化は大幅に遅くなり、予測やマスキング、ガイダンスの設定が違う。
MAEはイメージをより忠実に再構築し、明確なセマンティッククラスタリングを示すが、DINOv2よりもはるかに悪い世代を生成する。
表現はまた、分類器なしのガイダンスに異なる応答をし、異なる精度のリコールトレードオフを占有する。
その結果, 圧縮, 再構成忠実度, トークン次元, 可視的セマンティッククラスタリングは生成挙動を個別に予測できないことがわかった。
代わりに、ターゲット表現は、コンテキストモデリング、トーケンごとのdenoising、推論時分布制御における難易度を再分配する。
関連論文リスト
- Rarity-Aware Discrete Diffusion with Spatially Consistent Decoding for Photo-Realistic Image Super-Resolution [80.28905986756685]
DiMOO-SRは光リアル画像超解法のための多モード離散拡散フレームワークである。
広く使われている実世界のSRベンチマークの実験では、DiMOO-SRはいくつかの並列デコードステップで競合する知覚品質を達成する。
論文 参考訳(メタデータ) (2026-07-20T07:01:01Z) - Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis [93.7120829382642]
Nemotron-Labs-Diffusion-Imageは、テキスト・画像合成のための最先端のマスク付き離散拡散モデルである。
標準的なMDMには自己修正機能がない。
Nemotron-Labs-Diffusion-Imageにはトークン編集機構が組み込まれている。
論文 参考訳(メタデータ) (2026-06-29T05:48:41Z) - RPiAE: A Representation-Pivoted Autoencoder Enhancing Both Image Generation and Editing [37.46832944462102]
拡散モデルは画像生成と編集において支配的なパラダイムとなっている。
近年、事前に訓練された視覚表現モデルをトークンライザとして活用しようとする試みは、拡散特徴を表現特徴に整合させるか、凍結トークンライザとして直接表現エンコーダを再利用するかのいずれかである。
生成と編集の両方を改善する表現ベースのトークン化器であるRepresentation-Pivoted AutoEncoderを提案する。
論文 参考訳(メタデータ) (2026-03-19T17:54:43Z) - UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations [45.861324782424326]
現在の統合マルチモーダルモデルは、通常、モダリティギャップを埋めるために離散的な視覚トークン化器に依存している。
圧縮された連続表現によるマルチモーダル理解と生成を調和させる統一フレームワークUniComを導入する。
論文 参考訳(メタデータ) (2026-03-11T12:14:26Z) - ResTok: Learning Hierarchical Residuals in 1D Visual Tokenizers for Autoregressive Image Generation [64.84095852784714]
Residual Tokenizer (ResTok)は、画像トークンと潜在トークンの両方の階層的残基を構築する1Dビジュアルトークンライザである。
視覚的トークン化における階層的残差の復元はAR画像生成を著しく改善し,ImageNet-256ではわずか9ステップで2.34gFIDを達成した。
論文 参考訳(メタデータ) (2026-01-07T14:09:18Z) - Tokenize Image as a Set [17.142970970610616]
本稿では,局所的意味複雑性に基づく符号化能力の動的割り当てを行うために,非順序付きトークン集合表現を導入する。
離散集合をモデル化することの課題に対処するために、集合を固定長整数列に変換する双対変換機構を考案する。
提案手法のセマンティック・アウェア表現と生成品質における優位性を示す実験を行った。
論文 参考訳(メタデータ) (2025-03-20T17:59:51Z) - Frequency Autoregressive Image Generation with Continuous Tokens [31.833852108014312]
本稿では、周波数プログレッシブ自己回帰(textbfFAR)パラダイムを導入し、連続トークン化器を用いてFARをインスタンス化する。
我々は、ImageNetデータセットの総合的な実験を通して、FARの有効性を実証する。
論文 参考訳(メタデータ) (2025-03-07T10:34:04Z) - Traditional Classification Neural Networks are Good Generators: They are
Competitive with DDPMs and GANs [104.72108627191041]
従来のニューラルネットワーク分類器は、最先端の生成モデルに匹敵する高品質な画像を生成することができることを示す。
マスクをベースとした再構成モジュールを提案し, 意味的勾配を意識し, 可視画像の合成を行う。
また,本手法は,画像テキスト基盤モデルに関して,テキスト・画像生成にも適用可能であることを示す。
論文 参考訳(メタデータ) (2022-11-27T11:25:35Z) - Diffusion Visual Counterfactual Explanations [51.077318228247925]
VCE(Visual Counterfactual Explanations)は、画像の決定を理解するための重要なツールである。
VCEの生成に対する現在のアプローチは、逆向きに堅牢なモデルに制限されており、しばしば非現実的なアーティファクトを含んでいる。
本稿では、任意のイメージネット分類器に対して、視覚拡散対実説明(DVCE)を生成することでこれを克服する。
論文 参考訳(メタデータ) (2022-10-21T09:35:47Z) - The Deep Generative Decoder: MAP estimation of representations improves
modeling of single-cell RNA data [0.0]
モデルパラメータと表現を直接最大後部推定(MAP)により計算する単純な生成モデルを提案する。
このアプローチの利点は、その単純さと、同等のVAEよりもはるかに小さな次元の表現を提供する能力である。
論文 参考訳(メタデータ) (2021-10-13T12:17:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。