論文の概要: GEAR: Guided End-to-End AutoRegression for Image Synthesis
- arxiv url: http://arxiv.org/abs/2606.32039v1
- Date: Tue, 30 Jun 2026 17:59:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.35006
- Title: GEAR: Guided End-to-End AutoRegression for Image Synthesis
- Title(参考訳): GEAR:画像合成のためのエンド・ツー・エンド自動回帰
- Authors: Bin Lin, Zheyuan Liu, Chenguo Lin, Sixiang Chen, Yunyang Ge, Yunlong Lin, Jianwei Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Li Yuan,
- Abstract要約: GEARはベクトル量子化(VQ)トークンライザと自己回帰(AR)ジェネレータを共同およびエンドツーエンドでトレーニングする。
GEARは、強力なLlamaGen-REPAベースラインと比較して、ImageNet gFID収束を最大10倍高速化する。
- 参考スコア(独自算出の注目度): 45.98061600562716
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual generative models are typically trained in two stages. A tokenizer is first trained for reconstruction and then frozen, after which a generator is trained on its discrete indices or continuous latents. This decoupling leaves the tokenizer unaware of what the generator finds easy to model. We present GEAR (Guided End-to-end AutoRegression), which trains a vector-quantized (VQ) tokenizer and an autoregressive (AR) generator jointly and end-to-end, guided by representation alignment. The key obstacle is that the VQ index fed to the AR model is non-differentiable, so gradients cannot reach the tokenizer, and a straight-through estimator collapses. GEAR resolves this with a dual read-out of the codebook assignment. A hard, one-hot branch trains the AR with next-token prediction, while a differentiable soft branch carries a representation-alignment loss that flows back to guide only the tokenizer. The AR model thereby steers its tokenizer toward an index distribution it can predict more easily. This shifts the alignment burden from the tokenizer to the AR: the tokenizer's own features become less DINOv2-like while the AR's become more so, the opposite of diffusion-side recipes that make the latent itself semantic. GEAR speeds up ImageNet gFID convergence by up to 10x relative to the strong LlamaGen-REPA baseline, learns markedly better patch-level and spatially-coherent features, and generalizes across quantizers (VQVAE, LFQ, IBQ) and to text-to-image generation.
- Abstract(参考訳): 視覚生成モデルは典型的には2段階で訓練される。
トークン化剤は、最初に再構築のために訓練され、凍結され、その後、ジェネレータはその個別の指標または連続的な潜伏剤で訓練される。
この分離は、ジェネレータが簡単にモデル化できるものを理解しないトークン化器を残します。
本稿では,ベクトル量子化(VQ)トークンライザと自己回帰(AR)ジェネレータを協調的に駆動するGEAR(Guided End-to-end AutoRegression)について述べる。
鍵となる障害は、ARモデルに供給されるVQ指数が微分不可能であるため、勾配がトークン化器に到達することができず、ストレートスルー推定器が崩壊することである。
GEARは、コードブックの代入の二重読み出しでこれを解決している。
ハードでワンホットのブランチは次のトーケン予測でARをトレーニングし、差別化可能なソフトブランチは表現調整損失を持ち、トークン化器のみを誘導する。
これにより、ARモデルは、より簡単に予測できるインデックス分布に向けて、トークン化ツールを操縦する。
これにより、アライメントの負担がトークンライザからARにシフトする: トークンライザ自身の機能はDINOv2のようなものより少なくなり、ARはより複雑になるが、潜在子自体を意味のあるものにする拡散側レシピとは逆になる。
GEARは、強力なLlamaGen-REPAベースラインと比較して、ImageNet gFID収束を最大10倍スピードアップし、パッチレベルと空間コヒーレントな特徴を著しく改善し、量子化器(VQVAE, LFQ, IBQ)とテキスト・ツー・イメージ生成を一般化する。
関連論文リスト
- Learning Discrete Autoregressive Priors with Wasserstein Gradient Flow [17.114307498606724]
離散画像トークン化器は、まず再構成用、次に凍結トークンシーケンスに適合した事前モデルという2つの段階で訓練される。
我々はこのミスマッチを,潜時変分学習を3つの整合条件に分解する三部変分整合(TVC)を用いて解析する。
我々はこの信号をWasserstein-gradient-flow updateで最適化する。
論文 参考訳(メタデータ) (2026-05-07T12:41:46Z) - CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization [122.88484422855934]
本稿では,MeanFlowデコーダを備えた1次元因果画像トークンであるCaTokを紹介する。
時間間隔でトークンを選択することで、CaTokは高速なワンステップ生成と高忠実なマルチステップサンプリングの両方をサポートする因果1D表現を学ぶ。
実験により、CaTokはImageNet再構成の最先端の結果を達成し、0.75 FID、22.53 PSNR、0.674 SSIMに達した。
論文 参考訳(メタデータ) (2026-03-06T16:39:17Z) - ResTok: Learning Hierarchical Residuals in 1D Visual Tokenizers for Autoregressive Image Generation [64.84095852784714]
Residual Tokenizer (ResTok)は、画像トークンと潜在トークンの両方の階層的残基を構築する1Dビジュアルトークンライザである。
視覚的トークン化における階層的残差の復元はAR画像生成を著しく改善し,ImageNet-256ではわずか9ステップで2.34gFIDを達成した。
論文 参考訳(メタデータ) (2026-01-07T14:09:18Z) - REAR: Rethinking Visual Autoregressive Models via Generator-Tokenizer Consistency Regularization [130.46612643194973]
reARはトークン単位の正規化目標を導入する単純なトレーニング戦略です。
ImageNetでは、gFIDを3.02から1.86に削減し、標準化ベースのトークンーザを使用してISを316.9に改善している。
高度なトークン化器に適用すると、177Mパラメータしか持たない1.42のgFIDが達成され、その性能はより大きな最先端拡散モデル(675M)と一致する。
論文 参考訳(メタデータ) (2025-10-06T02:48:13Z) - Paraformer: Fast and Accurate Parallel Transformer for
Non-autoregressive End-to-End Speech Recognition [62.83832841523525]
そこで我々はParaformerと呼ばれる高速かつ高精度な並列トランスを提案する。
出力トークンの数を正確に予測し、隠れた変数を抽出する。
10倍以上のスピードアップで、最先端のARトランスフォーマーに匹敵するパフォーマンスを実現することができる。
論文 参考訳(メタデータ) (2022-06-16T17:24:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。