論文の概要: Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation
- arxiv url: http://arxiv.org/abs/2606.00310v1
- Date: Fri, 29 May 2026 19:34:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.275391
- Title: Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation
- Title(参考訳): どこでリファインか、いつ停止するか:効率的な視覚自己回帰生成のための潜在離散性による冗長性の再考
- Authors: Changwang Mei, Peisong Wang, Zekun Li, Changsheng Li, Shuang Qiu, Qinghao Hu, Gang Li, Yifan Zhang, Zhihui Wei, Jian Cheng,
- Abstract要約: 遅延不一致による冗長性を除去する学習自由フレームワークを提案する。
LD-Pruningは、Infinity-8Bの最大2.35倍のスピードアップを実現し、高い生成品質を維持しながら推論を大幅に削減する。
- 参考スコア(独自算出の注目度): 50.139984798361375
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual Autoregressive (VAR) models deliver high-quality image generation but suffer from significant inference latency at high resolutions. Recent acceleration approaches most rely on heuristic measures with layer features to prune tokens. Such heuristics are sensitive to complex contextual semantics, leading to inaccurate identification of redundant computation and poor adaptability across prompts. We rethink redundancy in VAR from the perspective of its impact on pixel-space generation and introduce Latent Discrepancy. This unified metric quantifies a token's contribution by measuring the change in model states during generation. Our analysis shows that redundancy is more accurately identified when guided by image latent or pixel-space signals. We further observed that in classifier-free guidance (CFG), the convergence trend of the discrepancy between conditional and unconditional branches exhibits high dynamics with different prompts. Based on these findings, we propose LD-Pruning (Latent Discrepancy Pruning), a training-free framework that removes redundancy via latent discrepancy by integrating decoding-free region selection and adaptive unconditional-branch skipping. Extensive experiments show that LD-Pruning substantially reduces inference latency while maintaining high generation quality, achieving up to 2.35x speedup on Infinity-8B.
- Abstract(参考訳): Visual Autoregressive (VAR)モデルは高品質な画像生成を提供するが、高解像度では大きな推論遅延に悩まされる。
最近の加速法は、層の特徴を持つヒューリスティックな測度をプルー・トークンに頼っている。
このようなヒューリスティックスは複雑な文脈意味論に敏感であり、冗長計算の不正確な同定とプロンプト間の適応性の低下につながる。
VARにおける冗長性は、ピクセル空間生成への影響の観点から再考し、遅延離散性を導入する。
この統一計量は、生成中のモデル状態の変化を測定することによってトークンの寄与を定量化する。
画像遅延信号や画素空間信号で導かれる場合、冗長性がより正確に識別されることを示す。
さらに, 分類器フリーガイダンス(CFG)では, 条件分岐と非条件分岐との差の収束傾向が, 異なるプロンプトで高いダイナミクスを示すことを示した。
これらの知見に基づき,非符号化領域選択と適応的非条件分岐スキップを統合して,遅延不一致による冗長性を除去する学習自由フレームワークLD-Pruning(Latent Discrepancy Pruning)を提案する。
LD-Pruningは、高ジェネレーション品質を維持しながら推論遅延を大幅に低減し、Infinity-8Bの最大2.35倍のスピードアップを実現している。
関連論文リスト
- Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning [11.461705552241163]
Closed-Loop Visual Reasoning (CLVR)は、視覚言語論理計画とピクセルレベルの拡散生成を結合した総合システムである。
CLVRは、信頼性の高い推論軌跡を合成するためのステップレベルの視覚的検証を備えた自動データエンジンを導入している。
繰り返し復調による遅延ボトルネックを軽減するため,DSWM($$-Space Weight)を提案する。
論文 参考訳(メタデータ) (2026-05-14T14:22:25Z) - CASCADE: Context-Aware Relaxation for Speculative Image Decoding [9.004650208708235]
自己回帰生成は高忠実度画像合成のための強力なアプローチである。
現在のアプローチでは、テキスト生成で見られるものと同等の効率向上を達成できない。
木に基づく投機的復号法で自然に現れる対象モデルの振舞いにおいて,これまで見過ごされていたパターンを同定する。
論文 参考訳(メタデータ) (2026-05-08T04:32:17Z) - CIAR: Interval-based Collaborative Decoding for Image Generation Acceleration [47.52310736101766]
自動回帰(AR)モデルは最近画像生成において顕著な進歩を遂げ、拡散ベースのアプローチに匹敵するパフォーマンスを実現している。
我々は、デバイス上での自己検証を利用して視覚合成の2つの重要な特性を扱うクラウド・デバイス・コラボレーション・フレームワークである textbfCIAR を通じてこの問題に対処する。
提案手法は, 連続確率間隔を用いて処理を高速化し, 大規模視覚語彙で実現可能なオンデバイストークン不確実性定量化器に重点を置いている。
論文 参考訳(メタデータ) (2026-03-26T14:04:50Z) - LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models [10.535207607235046]
Locality-Aware Dynamic Rescue (LADR) は画像の空間マルコフ特性を利用して推論を高速化する訓練不要の手法である。
LADRは、観測されたピクセルに空間的に隣接した領域である'世代フロンティア'でのトークンの回収を優先する。
4つのテキスト・画像生成ベンチマークの実験により、LADRは標準ベースラインよりも約4倍のスピードアップを達成することが示された。
論文 参考訳(メタデータ) (2026-03-13T15:12:41Z) - Guiding Diffusion-based Reconstruction with Contrastive Signals for Balanced Visual Representation [81.40978077888693]
対照的に、CLIP(Contrastive Language- Image Pre-training)は、下流のパフォーマンスにおいて重要なボトルネックとなっている。
近年のソリューションでは、拡散モデルを用いて、CLIP視覚トークンに画像再構成を条件付けることで表現を強化する。
我々は、より包括的な視覚表現を追求するために、コントラスト信号を拡散に基づく再構成に統合する。
論文 参考訳(メタデータ) (2026-03-05T04:45:49Z) - Multi-Scale Local Speculative Decoding for Image Generation [10.239314110594249]
マルチスケールローカル投機復号(MuLo-SD)を導入する。
MuLo-SDは、多重解像度のドラフトと空間情報による検証を組み合わせることで、AR画像生成を高速化する。
我々は MuLo-SD が $mathbf1.7times$ までの大幅な高速化を実現することを示した。
論文 参考訳(メタデータ) (2026-01-08T17:39:35Z) - Training-Free Generation of Diverse and High-Fidelity Images via Prompt Semantic Space Optimization [50.5332987313297]
本稿では,トレーニングフリーでモデルに依存しないモジュールであるToken-Prompt Embedding Space Optimization (TPSO)を提案する。
TPSOは、トークン埋め込み空間の未表現領域を探索するために学習可能なパラメータを導入し、学習された分布の強いモードからサンプルを繰り返し生成する傾向を減少させる。
MS-COCOと3つの拡散バックボーンの実験では、TPSOは画像品質を犠牲にすることなく、生成多様性を著しく向上し、ベースライン性能を1.10から4.18ポイントに改善した。
論文 参考訳(メタデータ) (2025-11-25T00:42:09Z) - Rethinking Discrete Tokens: Treating Them as Conditions for Continuous Autoregressive Image Synthesis [79.98107530577576]
DisConは、離散トークンを生成ターゲットではなく条件信号として再解釈する新しいフレームワークである。
DisConは、ImageNet 256$times $256 世代で gFID スコアが 1.38 に達し、最先端の自己回帰アプローチよりも明確なマージンで優れている。
論文 参考訳(メタデータ) (2025-07-02T14:33:52Z) - Multi-Modality Driven LoRA for Adverse Condition Depth Estimation [61.525312117638116]
逆条件深さ推定のためのMulti-Modality Driven LoRA(MMD-LoRA)を提案する。
Prompt Driven Domain Alignment (PDDA) と Visual-Text Consistent Contrastive Learning (VTCCL) の2つのコアコンポーネントで構成されている。
nuScenesとOxford RobotCarデータセットの最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2024-12-28T14:23:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。