論文の概要: MEPA: Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts
- arxiv url: http://arxiv.org/abs/2607.00371v1
- Date: Wed, 01 Jul 2026 03:11:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.700545
- Title: MEPA: Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts
- Title(参考訳): MEPA: エキスパートの混在による視覚的自己回帰モデリングのためのマルチスケール表現アライメント
- Abstract要約: 我々は、スケール適応型エキスパート選択を可能にする、スケール対応のトークン制御型Mixture of Experts (MoE)アーキテクチャを導入する。
ナイーブアライメントとは異なり、私たちはVisual AutoRegressiveのモデリングパラダイムに合わせて、残像アグリゲーションスキームを分析、設計します。
提案モデルでは,ImageNet 256*256ベンチマークの高密度ベースラインに比べてFIDが優れている。
- 参考スコア(独自算出の注目度): 41.67455261906954
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual AutoRegressive modeling (VAR) has pioneered a coarse-to-fine multi-scale autoregressive generative paradigm, demonstrating strong capabilities in image generation. However, VAR still suffers from inherent deficiencies in multi-scale representation learning. Specifically, lower scales primarily capture global semantics, while higher scales focus on fine-grained details. Employing a shared architecture across scales induces optimization conflicts. Moreover, due to the causal autoregressive process, inaccurate semantics at early scales can propagate and significantly degrade the final output. To address these issues, we introduce a scale-aware token-routed Mixture of Experts (MoE) architecture, allowing scale-adaptive expert selection, thereby facilitating decoupled representation learning across scales. In addition, we enhance semantic modeling at early scales by incorporating external self-supervised features. Unlike naive alignment, we analyse and design a residual feature aggregation scheme tailored to the VAR paradigm. Extensive experiments show that our method significantly improves both training efficiency and generation quality. On the ImageNet 256*256 benchmark, our model achieves a superior FID compared to the dense baseline while requiring only half of the default training epochs and a smaller parameter budget, with a merely marginal increase in training cost. Moreover, the performance gap further widens with larger training epochs.
- Abstract(参考訳): Visual AutoRegressive Modeling (VAR)は、画像生成において強力な能力を示す、粗大から細粒のマルチスケールの自己回帰生成パラダイムを開拓した。
しかし、VARは依然としてマルチスケール表現学習における固有の欠陥に悩まされている。
特に、低スケールは主にグローバルセマンティクスを捉え、高スケールはきめ細かな詳細に焦点を当てている。
スケールにまたがって共有アーキテクチャを採用すると、最適化の衝突が引き起こされる。
さらに、因果自己回帰過程により、初期のスケールでの不正確な意味論が伝播し、最終的な出力が著しく低下する可能性がある。
これらの問題に対処するために、スケール対応の専門家選択を可能にする、スケール対応のトークン制御型Mixture of Experts (MoE)アーキテクチャを導入し、スケール間の非結合表現学習を容易にする。
さらに、外部の自己教師付き機能を組み込むことにより、早期の規模でのセマンティックモデリングを強化する。
ナイーブアライメントとは異なり、我々はVARパラダイムに合わせた残像集約スキームを分析・設計する。
大規模な実験により,本手法はトレーニング効率と生成品質の両方を著しく改善することが示された。
ImageNet 256*256ベンチマークでは、デフォルトのトレーニングエポックの半数しか必要とせず、パラメータの予算も小さく、トレーニングコストの限界にすぎず、高密度ベースラインに比べて優れたFIDを実現している。
さらに、より大きなトレーニングエポックによってパフォーマンスギャップはさらに拡大する。
関連論文リスト
- Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models [12.459927405623624]
Divide-and-Conquer Inference (DCI)はMLLMを用いた視覚認識のための新しいテスト時間スケーリング戦略である。
DCIは、複雑なグローバルな分類タスクを、より単純で局所化されたサブプロブレムに分解し、探索空間を圧縮するために動的プルーニング機構を使用する。
モデルに依存しないプラグアンドプレイのパラダイムとして、DCIは大規模なシナリオでMLLMの推論精度をスケールするための効率的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-05-24T01:07:05Z) - Hierarchical Image Tokenization for Multi-Scale Image Super Resolution [47.66856101347057]
本稿では,ビジュアルオートレグレッシブ(VAR)モデリングの最近の進歩に基づいて,マルチスケール画像スーパーレゾリューション(ISR)手法を提案する。
ISRのVARトレーニングには2つの新しいコンポーネントを導入し、柔軟性の向上と複雑さの低減を目的としている。
我々の提案したHITは、VARトレーニングの強い誘導バイアスとして機能し、その結果、外部トレーニングデータなしで最先端の結果が得られる小さなモデルとなった。
論文 参考訳(メタデータ) (2026-05-14T14:35:51Z) - Neural Network Optimization Reimagined: Decoupled Techniques for Scratch and Fine-Tuning [49.751529745537546]
我々はDualOptを提案する。DualOptは、スクラッチからトレーニングに適した最適化技術を分離する新しいアプローチである。
スクラッチからのトレーニングでは、収束と一般化の両面を強化するために設計されたリアルタイムな層ワイド・ウェイト・デポジットを導入する。
我々は、異なる下流タスクの様々な要求に適応して、レイヤ単位の重量減衰を拡張して、レイヤ間のロールバックレベルを動的に調整する。
論文 参考訳(メタデータ) (2026-04-21T06:27:18Z) - RAE-AR: Taming Autoregressive Models with Representation Autoencoders [61.73674018219353]
分散正規化によるトークンの単純化により、モデリングの難易度を緩和し、収束性を向上させる。
我々は、露光バイアスを軽減するために、訓練中にガウスノイズ注入を取り入れて予測を強化する。
この作業は、視覚的理解と生成的モデリングをまたいだ、より統一されたアーキテクチャの道を開く。
論文 参考訳(メタデータ) (2026-04-02T02:39:28Z) - DreamVAR: Taming Reinforced Visual Autoregressive Model for High-Fidelity Subject-Driven Image Generation [108.71044040025374]
本稿では,視覚的自己回帰モデルに基づく主観的画像合成のための新しいフレームワークを提案する。
本研究では,Dreamtheが従来の拡散法よりも優れた外観保存を実現していることを示す。
論文 参考訳(メタデータ) (2026-01-30T03:32:29Z) - Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders [74.72147962028265]
表現オートエンコーダ(RAE)は、ImageNet上で拡散モデリングにおいて明確な利点を示している。
本稿では,このフレームワークが大規模でフリーフォームなテキスト・ツー・イメージ(T2I)生成に拡張できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-01-22T18:58:16Z) - Improving Progressive Generation with Decomposable Flow Matching [50.63174319509629]
Decomposable Flow Matching (DFM)は、ビジュアルメディアのプログレッシブな生成のためのシンプルで効果的なフレームワークである。
Imagenet-1k 512pxでは、DFMはベースアーキテクチャよりも35.2%改善され、ベースラインは26.4%向上した。
論文 参考訳(メタデータ) (2025-06-24T17:58:02Z) - Visual Autoregressive Modeling for Image Super-Resolution [14.935662351654601]
次世代の予測モデルとして, ISRフレームワークの視覚的自己回帰モデルを提案する。
大規模データを収集し、ロバストな生成先行情報を得るためのトレーニングプロセスを設計する。
論文 参考訳(メタデータ) (2025-01-31T09:53:47Z) - Denoising Autoregressive Representation Learning [13.185567468951628]
DARLはデコーダのみのトランスフォーマーを用いて,画像パッチの自動回帰予測を行う。
提案手法では, 適応型ノイズスケジュールを用いて学習表現を改良し, より大規模なモデルでより長い訓練を行えることを示す。
論文 参考訳(メタデータ) (2024-03-08T10:19:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。