論文の概要: Improving Sample Diversity in Autoregressive Text-to-Image Generation via Cluster Truncation
- arxiv url: http://arxiv.org/abs/2607.10535v1
- Date: Sun, 12 Jul 2026 02:14:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.46016
- Title: Improving Sample Diversity in Autoregressive Text-to-Image Generation via Cluster Truncation
- Title(参考訳): クラスタトリニケーションによる自動回帰テキスト画像生成におけるサンプル多様性の改善
- Authors: Trang Nguyen, Shuang Wu, Runyan Tan, Phillip Howard,
- Abstract要約: 本稿では,AR画像生成モデルにおけるサンプルの多様性に関する最初の体系的研究について述べる。
本稿では,AR画像生成の2つの重要な特性,永続的に高いトークンレベルのエントロピーと,既存のトークンレベルの復号法の有効性を抑える視覚トークン空間におけるかなりの冗長性を示す。
トークンレベルではなく、クラスタレベルでエントロピーベースのトランケーションサンプリングを行う新しいデコード戦略である、$p$lessクラスタを提案する。
- 参考スコア(独自算出の注目度): 13.22167262492576
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: While diffusion models achieve state-of-the-art image quality for text-to-image (T2I) generation, recent work has demonstrated that they suffer from sample diversity collapse. In this work, we investigate whether autoregressive (AR) image generation models can push the Pareto frontier between image quality and sample diversity. With recent advances in quality and efficiency, AR models have emerged as a viable alternative to diffusion-based image generation. Beyond enabling new use cases such as interleaved image-text generation, their sequential generation process makes them compatible with a wide range of token-based decoding strategies originally developed to improve diversity in text generation. Motivated by the potential of a better diversity-quality tradeoff in the AR paradigm, we present the first systematic study of sample diversity in AR image generation models. We show that two key properties of AR image generation, persistently high token-level entropy and substantial redundancy in visual token spaces, limit the effectiveness of existing token-level decoding methods for diversity enhancement. We therefore propose $p$-less cluster, a new decoding strategy that performs entropy-based truncation sampling at cluster level rather than at token level. We evaluate our approach and baseline decoding methods across four autoregressive T2I models and two datasets using a comprehensive suite of metrics spanning image quality, prompt alignment, and diversity. Our results show that $p$-less cluster unlocks the greatest diversity across most evaluated autoregressive T2I models and datasets while maintaining image quality and prompt alignment.
- Abstract(参考訳): 拡散モデルはテキスト・トゥ・イメージ(T2I)生成における最先端の画像品質を実現する一方で,近年の研究では,サンプルの多様性の崩壊に悩まされていることが示されている。
本研究では, 自己回帰(AR)画像生成モデルが, パレートフロンティアを画像品質とサンプルの多様性の間に押し付けることができるかどうかを検討する。
近年の品質と効率の進歩により、ARモデルは拡散ベースの画像生成の代替として実現可能なものとして登場した。
インターリーブ画像テキスト生成などの新しいユースケースを実現するだけでなく、シーケンシャルな生成プロセスによって、もともとテキスト生成の多様性を改善するために開発された幅広いトークンベースのデコード戦略と互換性がある。
ARパラダイムにおけるより良い多様性品質のトレードオフの可能性に触発され、我々はAR画像生成モデルにおけるサンプルの多様性に関する最初の体系的な研究を提示する。
本稿では,AR画像生成の2つの重要な特性,永続的に高いトークンレベルのエントロピーと,既存のトークンレベルの復号法の有効性を抑える視覚トークン空間におけるかなりの冗長性を示す。
そこで我々は,トークンレベルではなく,クラスタレベルでエントロピーベースのトランケーションサンプリングを行う新しいデコード戦略である,$p$-lessクラスタを提案する。
我々は4つの自己回帰的T2Iモデルと2つのデータセットにまたがるアプローチとベースライン復号法を、画像品質、迅速なアライメント、多様性にまたがる総合的な指標を用いて評価した。
その結果、$p$-lessクラスタは、画像の品質を維持しながら、最も評価された自己回帰的T2Iモデルとデータセットの最大の多様性を解放することがわかった。
関連論文リスト
- UniGenDet: A Unified Generative-Discriminative Framework for Co-Evolutionary Image Generation and Generated Image Detection [68.03391421239583]
共進化画像生成と生成画像検出のための統一生成識別フレームワークUniGenDetを提案する。
タスクギャップを埋めるために,マルチモーダルな共生型自己保持機構と統一的な微調整アルゴリズムを設計する。
提案手法は,複数のデータセット上での最先端性能を実現する。
論文 参考訳(メタデータ) (2026-04-23T17:49:25Z) - DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO [50.89703227426486]
強化学習(RL)は、同一グループ内で生成された画像の相対的性能を比較することにより、画像生成品質を著しく向上させる。
トレーニングの後半段階では、モデルは創造性と視覚的多様性を欠いた均質化されたアウトプットを生成する傾向にある。
この問題は、報酬モデリングとジェネレーションダイナミクスの両方の観点から分析することができる。
論文 参考訳(メタデータ) (2025-12-25T05:37:37Z) - DiverseAR: Boosting Diversity in Bitwise Autoregressive Image Generation [22.400053095939402]
視覚的品質を犠牲にすることなく、画像の多様性を高める、原則的で効果的な方法であるDiverseARを紹介する。
具体的には、サンプリング中のバイナリ出力分布のシャープネスを動的に調整する適応ロジット分布スケーリング機構を導入する。
分散平滑化による電位忠実度損失を軽減するため,低信頼トークンのサンプリングを回避するエネルギーベース生成経路探索アルゴリズムを開発した。
論文 参考訳(メタデータ) (2025-12-02T16:54:36Z) - DiverseVAR: Balancing Diversity and Quality of Next-Scale Visual Autoregressive Models [23.12099227251494]
テスト時にテキスト条件付き視覚自己回帰モデル(VAR)の多様性を高めるフレームワークであるDiverse VARを紹介する。
Varモデルは、画像生成のための拡散とフローモデルに対する強力な競争相手として現れている。
Varモデルは多様性の限界に悩まされ、単純なプロンプトであってもほとんど同じ画像を生成する。
論文 参考訳(メタデータ) (2025-11-26T14:06:52Z) - Towards Better & Faster Autoregressive Image Generation: From the Perspective of Entropy [23.573364375818553]
本研究は,現在の自己回帰画像生成モデルにおけるサンプリング問題を再検討する。
画像トークンは、テキストトークンとは異なり、低い情報密度と一様でない空間分布を示す。
本稿では,高速な合成速度で自己回帰生成品質を向上させるエントロピーインフォームデコード戦略を提案する。
論文 参考訳(メタデータ) (2025-10-10T05:26:11Z) - D2C: Unlocking the Potential of Continuous Autoregressive Image Generation with Discrete Tokens [80.75893450536577]
モデル生成能力を向上させる新しい2段階法であるD2Cを提案する。
第1段階では、小さな離散値発生器を用いて粗粒度画像特徴を表す離散値トークンをサンプリングする。
第2段階では、離散トークンシーケンスに基づいて、きめ細かい画像特徴を表す連続値トークンを学習する。
論文 参考訳(メタデータ) (2025-03-21T13:58:49Z) - Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis [62.57727062920458]
本稿では,非自己回帰型マスク画像モデリング(MIM)をSDXLのような最先端拡散モデルに匹敵するレベルまで高めるMeissonicを提案する。
高品質なトレーニングデータを活用し、人間の嗜好スコアから得られるマイクロ条件を統合し、特徴圧縮層を用いる。
我々のモデルは、高画質の高精細画像を生成する際に、SDXLのような既存のモデルに適合するだけでなく、しばしば性能を上回ります。
論文 参考訳(メタデータ) (2024-10-10T17:59:17Z) - Enhance Image Classification via Inter-Class Image Mixup with Diffusion Model [80.61157097223058]
画像分類性能を高めるための一般的な戦略は、T2Iモデルによって生成された合成画像でトレーニングセットを増強することである。
本研究では,既存のデータ拡張技術の欠点について検討する。
Diff-Mixと呼ばれる革新的なクラス間データ拡張手法を導入する。
論文 参考訳(メタデータ) (2024-03-28T17:23:45Z) - DiffDis: Empowering Generative Diffusion Model with Cross-Modal
Discrimination Capability [75.9781362556431]
本稿では,拡散過程下での1つのフレームワークに,モダクティブと差別的事前学習を統一するDiffDisを提案する。
DiffDisは画像生成タスクと画像テキスト識別タスクの両方において単一タスクモデルよりも優れていることを示す。
論文 参考訳(メタデータ) (2023-08-18T05:03:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。