論文の概要: Attribute Token Arithmetic: Disentangled and Continuous Semantic Control for Visual Autoregressive Models
- arxiv url: http://arxiv.org/abs/2608.28082v1
- Date: Fri, 28 Aug 2026 08:51:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.257794
- Title: Attribute Token Arithmetic: Disentangled and Continuous Semantic Control for Visual Autoregressive Models
- Title(参考訳): 属性Token Arithmetic:視覚自己回帰モデルに対するアンタングルと連続セマンティック制御
- Abstract要約: 本稿では,視覚的自己回帰モデルにおける非交叉的・連続的属性制御を可能にする Attribute Token Arithmetic (ATA) を提案する。
ATAは自己保存, 微粒化, 多属性化を実現し, 制御性, 汎用性, 計算効率において, 既存の自己回帰的編集ベースラインよりも優れていることを示す。
- 参考スコア(独自算出の注目度): 39.64892851584864
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autoregressive text-to-image generation has recently achieved remarkable progress, offering high-fidelity synthesis via a unified generative framework. However, fine-grained semantic control remains challenging due to the attribute entanglement and the misalignment between textual and fine-grained visual representations. In this paper, we introduce Attribute Token Arithmetic (ATA), a method that enables disentangled and continuous attribute control in visual autoregressive modelling. Inspired by the vector arithmetic property observed in word embeddings, ATA identifies semantic directions corresponding to visual attributes (e.g., aging, fatness, emotion) directly within the pretrained autoregressive latent space. These directions are learned from a single reference image, without model retraining or large-scale supervision. During generation, attributes can be continuously adjusted and compositionally combined through simple arithmetic operations with other attribute tokens. Extensive experiments demonstrate that ATA achieves identity-preserving, fine-grained, and multi-attribute adjustment, outperforming existing autoregressive editing baselines in controllability, generality, and computational efficiency. Our code will be available at https://github.com/Madaoer/ATA.
- Abstract(参考訳): 自動回帰テキスト・画像生成は、最近顕著な進歩を遂げ、統一された生成フレームワークを通じて高忠実な合成を提供する。
しかし、属性の絡み合いや、テキストと微粒な視覚表現の相違により、微粒化セマンティックコントロールは依然として困難である。
本稿では,視覚自己回帰モデルにおける非交叉的・連続的属性制御を可能にする Attribute Token Arithmetic (ATA) を提案する。
単語埋め込みで観測されるベクトル演算特性にインスパイアされたATAは、事前学習された自己回帰潜在空間内で、視覚的属性(例えば、加齢、太さ、感情)に対応する意味方向を識別する。
これらの方向は、モデルの再訓練や大規模な監視なしに、単一の参照画像から学習される。
生成の間、属性は他の属性トークンと単純な算術演算によって連続的に調整され、構成的に結合される。
広範囲な実験により、ATAはアイデンティティ保存、微粒化、マルチ属性調整を実現し、制御性、一般性、計算効率において既存の自己回帰的編集ベースラインを上回ります。
私たちのコードはhttps://github.com/Madaoer/ATAで公開されます。
関連論文リスト
- ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both [55.182037225013836]
ATLASは、単一の独立した「ワード」を機能トークンと呼び、エージェント操作と潜在視覚推論ユニットの両方として機能するフレームワークである。
ATLASは、明確な解釈可能性を維持しながら、挑戦的なベンチマークで優れたパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-14T17:59:55Z) - TokenDial: Continuous Attribute Control in Text-to-Video via Spatiotemporal Token Offsets [26.16152568319517]
TokenDialは、事前訓練されたテキスト-ビデオ生成モデルにおける連続的なスライダスタイルの属性制御のためのフレームワークである。
我々は、事前学習された理解信号を用いて、バックボーンをトレーニングすることなく属性固有のトークンオフセットを学習する。
TokenDialsの有効性を様々な属性やプロンプトで実証し、最先端のベースラインよりも強力な制御性と高品質な編集を実現する。
論文 参考訳(メタデータ) (2026-03-29T05:07:41Z) - Self-Corrected Image Generation with Explainable Latent Rewards [55.29175717238288]
我々は、説明可能なLatent RewarDを通じて生成をガイドする自己修正フレームワークであるxLARDを提案する。
xLARDは、モデル生成参照からの構造化されたフィードバックに基づいて遅延表現を洗練する軽量な修正器を導入している。
実験により、xLARDは、生成前の状態を維持しながら、意味的アライメントと視覚的忠実性を改善することが示された。
論文 参考訳(メタデータ) (2026-03-26T02:59:35Z) - IAR2: Improving Autoregressive Visual Generation with Semantic-Detail Associated Token Prediction [77.06211178777939]
IAR2は、階層的なセマンティックディーテール合成プロセスを可能にする高度な自己回帰フレームワークである。
我々は、IAR2が自動回帰画像生成のための新しい最先端技術を設定し、ImageNet上で1.50のFIDを達成することを示す。
論文 参考訳(メタデータ) (2025-10-08T12:08:21Z) - Continuous, Subject-Specific Attribute Control in T2I Models by Identifying Semantic Directions [20.351245266660378]
テキスト・ツー・イメージ(T2I)拡散モデルの最近の進歩は、生成画像の品質を大幅に向上させた。
個々の被写体、特にそれらの特徴の効率的な制御を提供することは、依然として重要な課題である。
現在のアプローチでは、両方を同時に提供しないため、正確な連続性および主題固有の属性変調を達成しようとすると、ギャップが生じる。
論文 参考訳(メタデータ) (2024-03-25T18:00:42Z) - Text Attribute Control via Closed-Loop Disentanglement [72.2786244367634]
本稿では,コンテンツ保存性を高めつつ,属性のロバストな制御を実現するための新しい手法を提案する。
本稿では,半教師付きコントラスト学習法を用いて,潜在空間における属性のアンタングル化を促進する。
Yelp Serviceレビューデータセット、Amazon Product Reviewデータセット、GoEmotionsデータセットを含む3つのテキストデータセットの実験を行った。
論文 参考訳(メタデータ) (2023-12-01T01:26:38Z) - Exploiting Semantic Attributes for Transductive Zero-Shot Learning [97.61371730534258]
ゼロショット学習は、視覚的特徴と、そのクラスから学んだ意味的属性の関係を一般化することにより、目に見えないクラスを認識することを目的としている。
本稿では,未知データの意味的属性を生成し,生成過程に付加する新しいZSL法を提案する。
5つの標準ベンチマーク実験により,本手法がゼロショット学習の最先端結果をもたらすことが示された。
論文 参考訳(メタデータ) (2023-03-17T09:09:48Z) - Towards Disentangling Latent Space for Unsupervised Semantic Face
Editing [21.190437168936764]
修正属性の編集には注釈付きトレーニングデータが必要で、編集可能な属性をラベル付き属性に制限する。
本稿では、重み分解と直交正規化(STIA-WO)を用いた構造テクスチュア独立アーキテクチャ(Structure-Texture Independent Architecture)と呼ばれる新しい手法を提案する。
論文 参考訳(メタデータ) (2020-11-05T03:29:24Z) - Fine-grained Sentiment Controlled Text Generation [28.20006438705556]
制御されたテキスト生成技術は、属性独立コンテンツを保持しながら、特定の属性を規制することを目的としている。
本稿では,情報に富んだ絡み合い表現と属性固有の非絡み合い表現の両方をキャプチャする階層型フレームワークDE-VAEを提案する。
論文 参考訳(メタデータ) (2020-06-17T14:17:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。