論文の概要: ViTok-v2: Scaling Native Resolution Auto-Encoders to 5 Billion Parameters
- arxiv url: http://arxiv.org/abs/2605.05331v1
- Date: Wed, 06 May 2026 18:03:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.358927
- Title: ViTok-v2: Scaling Native Resolution Auto-Encoders to 5 Billion Parameters
- Title(参考訳): ViTok-v2: ネイティブレゾリューションオートエンコーダを50億パラメータに拡張
- Abstract要約: Vision Transformer (ViT) オートエンコーダは画像の魅力的なトークンライザとして登場し、畳み込みトークンライザの再構築を改善している。
ViTok は、圧縮比 r が、低い r がより良い再構成を意味するが、より難しい世代である再生世代トレードオフを媒介することを示した。
ViTok-v2は、これらの制限をNaFlexによるネイティブな解像度サポートで解決し、解像度とアスペクト比をまたいで一般化します。
- 参考スコア(独自算出の注目度): 30.67825027089147
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Vision Transformer (ViT) autoencoders have emerged as compelling tokenizers for images, offering improved reconstruction over convolutional tokenizers. However, existing ViT tokenizers cannot explore this landscape as performance degrades outside training resolutions, and reliance on adversarial losses prevents stable scaling. ViTok (Hansen-Estruch et al., 2025) found that the compression ratio r mediates a reconstruction-generation trade-off where lower r means better reconstructions but harder generations, so improving tokenizer reconstruction is key to more Pareto-optimal tokenizers. We introduce ViTok-v2, which addresses these limitations with native resolution support via NaFlex for generalization across resolutions and aspect ratios, and a novel DINOv3 perceptual loss that replaces both LPIPS and GAN objectives for stable training at any scale. ViTok-v2 is trained on about 2B images and scaled to 5B parameters, the largest image autoencoder to date. ViTok-v2 matches or exceeds state-of-the-art reconstruction at 256p and outperforms all baselines at 512p and above. In joint scaling experiments with flow matching generators, we show that scaling both the autoencoder and the generator advances the Pareto frontier of this trade-off.
- Abstract(参考訳): Vision Transformer (ViT) オートエンコーダは画像の魅力的なトークンライザとして登場し、畳み込みトークンライザの再構築を改善している。
しかし、既存のViTトークンーは、トレーニングの解像度の外で性能が低下し、敵の損失に依存するため、安定したスケーリングができないため、この状況を探ることができない。
ViTok (Hansen-Estruch et al , 2025) は、圧縮比 r は、低r がより良い再構成を意味するが、より難しい世代である再生世代トレードオフを媒介するので、よりパレート最適トークン化器にとって、トークン化器の再構築は鍵となる。
我々は、これらの制限に対処するViTok-v2を紹介し、NaFlexによる、解像度とアスペクト比をまたいだ一般化のためのネイティブ解像度サポートと、LPIPSとGANの両方の目的をあらゆるスケールで安定したトレーニングのために置き換える新しいDINOv3パーセプチュアルロスを紹介した。
ViTok-v2は約2Bイメージでトレーニングされ、これまでで最大のイメージオートエンコーダである5Bパラメータに拡張されている。
ViTok-v2は256pで最先端の再構築と一致し、512p以上ですべてのベースラインを上回ります。
フローマッチングジェネレータを用いた共同スケーリング実験では、オートエンコーダとジェネレータの両方のスケーリングが、このトレードオフのParetoフロンティアを前進させることを示した。
関連論文リスト
- TC-AE: Unlocking Token Capacity for Deep Compression Autoencoders [51.71228803075235]
我々は、深部圧縮オートエンコーダのためのViTベースのアーキテクチャであるTC-AEを提案する。
トークン・ツー・ラテント圧縮を2段階に分解し,構造的情報損失を低減する。
画像トークンのセマンティック構造を,共同指導による訓練によって強化し,より生成しやすい潜伏者へと導いた。
論文 参考訳(メタデータ) (2026-04-08T17:53:52Z) - SFTok: Bridging the Performance Gap in Discrete Tokenizers [72.9996757048065]
複数ステップの反復機構を組み込んだ離散トークン化機構である textbfSFTok を提案する。
画像当たり64トークンの高速圧縮速度で、SFTokはImageNetの最先端の再構築品質を達成する。
論文 参考訳(メタデータ) (2025-12-18T18:59:04Z) - Diffusion Transformers with Representation Autoencoders [35.43400861279246]
事前学習された自己エンコーダが拡散過程の遅延空間に画素をマッピングする潜在生成モデリングは拡散変換器(DiT)の標準戦略となっている。
ほとんどのDiTはオリジナルのVAEエンコーダに依存しており、いくつかの制限が課されている。
本研究では、VAEをトレーニングされたデコーダと組み合わせた事前訓練された表現エンコーダに置き換え、Representation Autoencoders (RAE) と呼ぶものを形成する。
論文 参考訳(メタデータ) (2025-10-13T17:51:39Z) - SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization [56.12853087022071]
スケーリングとトレーニングの安定性を向上させるために,新しい画素拡散デコーダアーキテクチャを導入する。
蒸留を用いて, 拡散復号器の性能を効率よく再現する。
これによりSSDDは、敵の損失なしに訓練された単一ステップ再構成に最適化された最初の拡散デコーダとなる。
論文 参考訳(メタデータ) (2025-10-06T15:57:31Z) - GigaTok: Scaling Visual Tokenizers to 3 Billion Parameters for Autoregressive Image Generation [81.58846231702026]
視覚トークン化のスケーリングにおいて、画像再構成、生成、表現学習を改善するための最初のアプローチであるGigaTokを紹介する。
我々は、遅延空間の増大する複雑さを、再生と世代ジレンマの主な要因とみなす。
数十億ドルのパラメータにスケールアップすることで、GigaTokは、再構築、下流のAR生成、下流のAR表現品質における最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-04-11T17:59:58Z) - Learnings from Scaling Visual Tokenizers for Reconstruction and Generation [30.942443676393584]
自動エンコーディングによるビジュアルトークン化は、ピクセルを潜在空間に圧縮することで、最先端の画像およびビデオ生成モデルを促進する。
私たちの研究は、この空白を埋めるために自動エンコーダのスケーリングを調査することを目的としています。
我々は、ImageNet-1Kを超える大規模な画像およびビデオデータセット上でViTokをトレーニングし、トークンのスケーリングに関するデータ制約を取り除く。
論文 参考訳(メタデータ) (2025-01-16T18:59:04Z) - ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models [77.59651787115546]
高解像度のLMM(Large Multimodal Models)は、過度な視覚トークンと二次的な視覚的複雑さの課題に直面する。
本稿では,LMMのビジュアルエンコーダとして,階層的なバックボーンであるConvNeXtを用いるConvLLaVAを提案する。
ConvLLaVAは高解像度画像を情報豊富な視覚特徴に圧縮し、過剰な視覚トークンの発生を効果的に防止する。
論文 参考訳(メタデータ) (2024-05-24T17:34:15Z) - ViTAR: Vision Transformer with Any Resolution [80.95324692984903]
ビジョントランスフォーマーは、トレーニング中に見られるものと異なる処理解像度で性能低下を経験する。
複数の解像度で一貫した位置認識を提供するために、視覚変換器にファジィ位置符号化を導入する。
我々のモデルであるViTARは、1120x1120の解像度で83.3%、4032x4032の解像度で80.4%の精度で、優れた適応性を示す。
論文 参考訳(メタデータ) (2024-03-27T08:53:13Z) - ConvNeXt-ChARM: ConvNeXt-based Transform for Efficient Neural Image
Compression [18.05997169440533]
ConvNeXt-ChARMは,効率的なConvNeXtベースのトランスフォーメーションコーディングフレームワークである。
ConvNeXt-ChARMは、VVC参照エンコーダ(VTM-18.0)と最先端の学習画像圧縮手法であるSwinT-ChARMに対して、平均5.24%と1.22%と、一貫したBDレート(PSNR)の低下をもたらすことを示した。
論文 参考訳(メタデータ) (2023-07-12T11:45:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。