論文の概要: SJD-SV: Speculative Jacobi Decoding with Semantics Verification for Autoregressive Image Generation
- arxiv url: http://arxiv.org/abs/2609.13245v1
- Date: Fri, 04 Sep 2026 10:28:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 16:32:15.669143
- Title: SJD-SV: Speculative Jacobi Decoding with Semantics Verification for Autoregressive Image Generation
- Title(参考訳): SJD-SV:自動回帰画像生成のためのセマンティック検証による投機的ヤコビデコーディング
- Abstract要約: 投機的ヤコビ復号法(SJD)は自己回帰画像生成を高速化する重要な手法である。
セマンティックス検証を用いた新しい投機的ヤコビ復号法(SJD-SV)を提案する。
本手法はプラグインであり,既存のSJDとその変種に直接組み込むことができる。
- 参考スコア(独自算出の注目度): 28.644438089847217
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Speculative Jacobi Decoding (SJD) is an important approach for accelerating autoregressive image generation. Although SJD has shown superior performance, recent studies point out that it usually suffers from a token ambiguity issue during token verification but its reason can not be well explained. To figure out this reason, in this paper, we conduct a visualization analysis on vision token and find that different from text tokens, vision tokens generally corresponds to some local, small, and unclear vision details, which means only using single token is difficult to accurately express a certain semantic, thereby causing token ambiguity issue. To this end, we propose a novel Speculative Jacobi Decoding with Semantics Verification (called SJD-SV), for accelerating autoregressive image generation. The key idea is that leveraging the strong correction characters between tokens to recognize semantic-aware token subsequence and then instead of perform token-by-token verification, turning to perform verification on semantic-aware token subsequence level for accelerating image generation. In particular, our method is plug-in, which can be directly integrated into existing SJD and its variants. Extensive experiments on various datasets show that existing SJD methods achieve significant performance improvement after integrating our SJD-SV method.
- Abstract(参考訳): 投機的ヤコビ復号法(SJD)は自己回帰画像生成を高速化する重要な手法である。
SJDは優れた性能を示したが、最近の研究では、トークン検証中にトークンのあいまいさの問題に悩まされることが多いが、その理由はよく説明できないと指摘している。
この理由を解明するために,本論文では,視覚トークンの可視化分析を行い,テキストトークンとの違いとして,視覚トークンが局所的,小さく,不明瞭な視覚の詳細に対応すること,すなわち,特定の意味を正確に表現することが困難であることを示す。
そこで本研究では,自動回帰画像生成の高速化を目的とした,セマンティックス検証による仮説的ヤコビ復号法(SJD-SV)を提案する。
鍵となる考え方は、トークン間の強い補正文字を活用してセマンティック・アウェア・トークン・サブシーケンスを認識し、トークン・バイ・トークンの検証を行う代わりに、画像生成を加速するためのセマンティック・アウェア・トークン・サブシーケンスの検証を行うことである。
特に,本手法はプラグインであり,既存のSJDとその変種に直接組み込むことができる。
各種データセットに対する大規模な実験により,既存のSJD法はSJD-SV法を統合した結果,大幅な性能向上が得られた。
関連論文リスト
- Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers [16.996490884328455]
テキスト・ツー・イメージ拡散変換器(DiT)は,共同注意による画像生成を行う。
大規模なDiTでは、条件付け入力はユーザープロンプトだけでなくチャットテンプレートトークンも含んでいる。
本稿では,これらのトークンが量子化計算にどのように関与するかを調べるために,因果的解釈可能性フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-21T14:29:59Z) - SJD-VP: Speculative Jacobi Decoding with Verification Prediction for Autoregressive Image Generation [64.43642479951576]
投機的ヤコビ復号法(SJD)は自己回帰画像生成を高速化するための有望な手法として登場した。
検証予測付き投機的ヤコビ復号法(SJD-VP)を提案する。
我々のSJD-VPはプラグアンドプレイであり、既存のSJDメソッドにシームレスに統合できる。
論文 参考訳(メタデータ) (2026-03-28T03:59:03Z) - SJD-PV: Speculative Jacobi Decoding with Phrase Verification for Autoregressive Image Generation [20.808533388639468]
自己回帰(AR)画像モデルは、最近顕著な生成能力を示したが、そのシーケンシャルな性質は大きな推論遅延をもたらす。
フレーズレベルの投機的検証を行う新しい学習自由加速フレームワークを提案する。
提案手法は,視覚的忠実度を損なうことなく,最大30%高速な復号化を実現する。
論文 参考訳(メタデータ) (2026-03-02T13:09:15Z) - SJD++: Improved Speculative Jacobi Decoding for Training-free Acceleration of Discrete Auto-regressive Text-to-Image Generation [92.34355601866629]
大規模な自己回帰モデルは高品質で高解像度の画像を生成することができるが、生成速度が遅い。
本稿では,SJD++ (Speculative Jacobi Decoding++) を提案する。
SJD++は、各フォワードパスでマルチトークン予測を実行し、生成ステップを大幅に削減する。
論文 参考訳(メタデータ) (2025-12-08T12:36:43Z) - Images are Worth Variable Length of Representations [13.136831256070343]
ほとんどの視覚エンコーダは、画像を固定長のトークン列にマッピングし、異なる画像が様々な量の情報を含んでいるという事実を見渡す。
本稿では,動的視覚エンコーダであるDOVEを提案する。
その結果,DOVEは高い復元品質を維持しつつ,平均トークン数を大幅に削減できることがわかった。
論文 参考訳(メタデータ) (2025-06-04T07:40:33Z) - Accelerating Auto-regressive Text-to-Image Generation with Training-free Speculative Jacobi Decoding [60.188309982690335]
本稿では,SJD (Speculative Jacobi Decoding) の学習自由確率並列復号法を提案する。
SJDは、サンプリングベースのトークン復号におけるランダム性を維持しつつ、自動回帰テキスト・画像生成の推論を加速する。
具体的には、SJDは各ステップで複数のトークンを予測し、確率的基準に基づいてトークンを受け付けます。
論文 参考訳(メタデータ) (2024-10-02T16:05:27Z) - Object Recognition as Next Token Prediction [99.40793702627396]
オブジェクト認識を次のトークン予測として提案する。
その考え方は、画像埋め込みからフォームラベルへのテキストトークンの自動回帰予測を行う言語デコーダを適用することである。
論文 参考訳(メタデータ) (2023-12-04T18:58:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。