論文の概要: Adversarial Error Correction for Visual Autoregressive Generation
- arxiv url: http://arxiv.org/abs/2605.24843v1
- Date: Sun, 24 May 2026 03:22:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:18.472896
- Title: Adversarial Error Correction for Visual Autoregressive Generation
- Title(参考訳): 視覚自己回帰生成における逆誤差補正
- Authors: Ligong Bi, Tao Huang, Jianyuan Guo, Chang Xu,
- Abstract要約: 本稿では,事前学習したVisual Autoregressive(VAR)モデルを拡張するプラグイン・アンド・プレイフレームワークを提案する。
標準的な受動的生成の代わりに、AID-moreは、GANの敵対的フィードバックにインスパイアされた能動的誤り訂正機構を導入する。
その結果、AID-moreはよりシャープなテクスチュラルな詳細と、無視できるオーバーヘッドを伴う構造歪みを少なくすることを示した。
- 参考スコア(独自算出の注目度): 32.13829630849993
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual Autoregressive (VAR) models have emerged as a powerful paradigm for image synthesis by performing hierarchical next-scale prediction. However, VAR models are inherently prone to cascading error propagation, where subtle coarse-scale mispredictions are amplified across the hierarchy, ultimately distorting the final synthesis. To mitigate this, we propose AID-VAR, a plug-and-play framework that enhances pre-trained VARs through Adversarially Injected Diagnosis. Instead of a standard passive generation, AID-VAR introduces a proactive error-correction mechanism inspired by the adversarial feedback in GANs. We deploy a discriminator to diagnose fidelity gaps at each scale transition, coupled with a lightweight guidance injector. This module operates as a non-invasive adapter that refines the feature manifold of a frozen VAR backbone, effectively steering the generation toward the distribution of real images without destabilizing the pre-trained latent space. Furthermore, to rigorously evaluate this cross-scale progression, we introduce the Inter-Scale Consistency Score (ISCS), a novel metric that quantifies the fidelity and structural alignment between consecutive resolution scales. Experimental results across various backbones demonstrate that AID-VAR delivers sharper textural details and fewer structural distortions with negligible overhead. For instance, AID-VAR-d20 achieves a 16% improvement in FID with only a 3% increase in parameters. These results establish AID-VAR as a highly efficient and scalable pathway for upgrading large-scale VAR generators, enhancing global coherence and local detail without altering training data, base architectures, or sampling schedules. Code is available at https://github.com/bijiw515/AID-VAR.
- Abstract(参考訳): Visual Autoregressive (VAR)モデルは階層的な次のスケールの予測を実行することで画像合成の強力なパラダイムとして登場した。
しかしながら、VARモデルは本質的にカスケードエラーの伝播に傾向があり、微妙な粗いスケールの誤予測が階層全体に増幅され、最終的な合成が歪む。
これを軽減するために,Adversarially Injected diagnosis を通じて事前学習VARを強化するプラグイン・アンド・プレイ・フレームワーク AID-VAR を提案する。
標準的な受動的生成の代わりに、AID-VARはGANの敵からのフィードバックにインスパイアされた能動的誤り訂正機構を導入する。
我々は,各スケール遷移における忠実度ギャップを診断するための判別器を,軽量誘導インジェクタとともに展開する。
このモジュールは、凍結したVARバックボーンの特徴多様体を洗練する非侵襲的なアダプタとして機能し、トレーニング済みの潜伏空間を不安定にすることなく、実画像の分布に向けて効果的に生成を操る。
さらに、このクロススケール進行を厳密に評価するために、連続分解スケール間の忠実度と構造的整合性を定量化する新しい計量であるISCS(Inter-Scale Consistency Score)を導入する。
AID-VARは、よりシャープなテクスチャ細部と、無視できるオーバーヘッドを伴う構造歪みが少ないことを実証した。
例えば、AID-VAR-d20はFIDの16%の改善を実現し、パラメータはわずか3%増加した。
これらの結果は、AID-VARを大規模なVARジェネレータをアップグレードし、トレーニングデータ、ベースアーキテクチャ、サンプリングスケジュールを変更することなく、グローバルコヒーレンスとローカルディテールを向上するための、高効率でスケーラブルな経路として確立する。
コードはhttps://github.com/bijiw515/AID-VARで入手できる。
関連論文リスト
- VARestorer: One-Step VAR Distillation for Real-World Image Super-Resolution [76.19751531910039]
本稿では,事前学習したテキストから画像へのVARモデルを,ワンステップのISRモデルに変換するフレームワークであるVARestorerを提案する。
VARestorerは、DIV2Kデータセット上で72.32 MUSIQと0.7669 CLIPIQAで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-04-23T09:09:36Z) - RAE-AR: Taming Autoregressive Models with Representation Autoencoders [61.73674018219353]
分散正規化によるトークンの単純化により、モデリングの難易度を緩和し、収束性を向上させる。
我々は、露光バイアスを軽減するために、訓練中にガウスノイズ注入を取り入れて予測を強化する。
この作業は、視覚的理解と生成的モデリングをまたいだ、より統一されたアーキテクチャの道を開く。
論文 参考訳(メタデータ) (2026-04-02T02:39:28Z) - Scaling Up AI-Generated Image Detection via Generator-Aware Prototypes [15.99138549265524]
GAPL(Generator-Aware Prototype Learning)は、構造化学習パラダイムで表現を制約するフレームワークである。
GAPLは最先端の性能を達成し、多様なGANおよび拡散型ジェネレータにおいて優れた検出精度を示す。
論文 参考訳(メタデータ) (2025-12-15T04:58:08Z) - SDAR: A Synergistic Diffusion-AutoRegression Paradigm for Scalable Sequence Generation [62.14510717860079]
本稿では, 自己回帰モデルの学習効率を, 拡散の並列推論能力で統一するSynergistic Diffusion-Autoregressionパラダイムを提案する。
SDARは、十分に訓練された自己回帰モデル(AR)を、簡潔でデータ効率のよい適応を通じてブロックワイズ拡散モデルに変換する、軽量なパラダイム変換を実行する。
この知見に基づいて、SDARは最小コストで効率的なAR-拡散変換を実現し、並列生成を可能にしながら、ARレベルのパフォーマンスを維持する。
論文 参考訳(メタデータ) (2025-10-07T17:29:28Z) - RestoreVAR: Visual Autoregressive Generation for All-in-One Image Restoration [51.77917733024544]
潜時拡散モデル(LDM)はオールインワン画像復元法(AiOR)の知覚的品質を改善した。
LDMは反復的なデノゲーションプロセスによって推論が遅くなり、時間に敏感なアプリケーションでは実用的でない。
VAR(Visual Autoregressive Modeling)は、スケールスペースの自己回帰を行い、最先端の拡散変換器に匹敵する性能を実現する。
論文 参考訳(メタデータ) (2025-05-23T15:52:26Z) - Variational Rank Reduction Autoencoders [1.4353812560047186]
本稿では、RRAEとVAEの両方の利点を生かしたモデルとして、変動ランク低減オートエンコーダ(VRRAE)を提案する。
私たちの結果には、VRRAEの破壊に対する堅牢性を示す小さなサイズの合成データセットと、3つの実世界のデータセットが含まれています。
論文 参考訳(メタデータ) (2025-05-14T15:08:28Z) - How to train your VAE [0.0]
変分オートエンコーダ(VAE)は、機械学習における生成モデリングと表現学習の基盤となっている。
本稿では,ELBO(エビデンス・ロウアー・バウンド)における重要な構成要素であるKLディバージェンス(Kulback-Leibler)の解釈について検討する。
提案手法は, ELBOを後続確率のガウス混合体で再定義し, 正規化項を導入し, テクスチャリアリズムを高めるためにPatchGAN識別器を用いる。
論文 参考訳(メタデータ) (2023-09-22T19:52:28Z) - The Deep Generative Decoder: MAP estimation of representations improves
modeling of single-cell RNA data [0.0]
モデルパラメータと表現を直接最大後部推定(MAP)により計算する単純な生成モデルを提案する。
このアプローチの利点は、その単純さと、同等のVAEよりもはるかに小さな次元の表現を提供する能力である。
論文 参考訳(メタデータ) (2021-10-13T12:17:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。