論文の概要: Mutual Enhancement Between Global Tokens and Patch Tokens: From Theory to Practice
- arxiv url: http://arxiv.org/abs/2605.16384v1
- Date: Mon, 11 May 2026 10:51:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 23:51:08.310608
- Title: Mutual Enhancement Between Global Tokens and Patch Tokens: From Theory to Practice
- Title(参考訳): グローバルトークンとパッチトークンの相互強化:理論から実践へ
- Authors: Xiusheng Huang, Xin Jiang, Jun Zhao, Kang Liu, Yequan Wang,
- Abstract要約: TaTokは理論的に基礎付けられた適応型イメージトークン化フレームワークである。
パッチトークン間で相互情報をモデル化するグローバルトークンを導入する。
実験では、TaTokの最先端性能を確認し、1.3倍のgFID改善と8.7倍の推論速度を提供する。
- 参考スコア(独自算出の注目度): 32.91418593188147
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Accurate and effective discrete image tokenization is crucial for long image sequence processing. However, current methods rigidly compress all content at a fixed rate, ignoring the variable information density of images and leading to either redundancy or information loss. Inspired by information entropy, we propose TaTok, a Theoretically grounded adaptive image Tokenization framework. We rigorously identify two key drawbacks in existing methods: information insufficiency when reconstructing images with patch tokens alone, and information redundancy among patch tokens. To address these, we introduce global tokens that model mutual information across patch tokens, and a Dynamic Token Filtering (DTF) algorithm based on cumulative conditional entropy to eliminate redundancy. Experiments confirm TaTok's state-of-the-art performance, delivering a 1.3x gFID improvement and 8.7x inference speedup. By allocating tokens according to information richness, TaTok enables more compressed yet accurate image tokenization, offering valuable insights for future research.
- Abstract(参考訳): 高精度かつ効果的な離散画像トークン化は、長い画像シーケンス処理に不可欠である。
しかし、現在の方法では、画像の変動情報密度を無視して、すべてのコンテンツを固定レートで厳密に圧縮し、冗長性または情報損失をもたらす。
情報エントロピーに着想を得たTaTokを提案する。
既存の手法では,パッチトークンのみで画像を再構成する際の情報不足と,パッチトークン間の情報冗長性という2つの重要な欠点を厳格に識別する。
これを解決するために,パッチトークン間の相互情報をモデル化するグローバルトークンと,累積条件エントロピーに基づく動的トークンフィルタリング(DTF)アルゴリズムを導入する。
実験では、TaTokの最先端性能を確認し、1.3倍のgFID改善と8.7倍の推論速度を提供する。
情報豊かさに応じてトークンを割り当てることによって、TaTokはより圧縮されながら正確な画像トークン化を可能にし、将来の研究に有用な洞察を提供する。
関連論文リスト
- Improving Flexible Image Tokenizers for Autoregressive Image Generation [53.238708824055664]
textbfReToKは、アンダーライン冗長なアンダーラインToken Paddingと階層的セマンティック正規化を備えたフレキシブルなトークンライザである。
本手法は, フレキシブルかつ固定長のトークン化器と比較して, 優れた生成性能を実現する。
論文 参考訳(メタデータ) (2026-01-04T14:11:45Z) - Hita: Holistic Tokenizer for Autoregressive Image Generation [56.81871174745175]
自己回帰(AR)画像生成のための新しい画像トークンであるtextitHita を紹介する。
学習可能な全体的クエリとローカルパッチトークンを備えた、全体論的から局所的なトークン化スキームを導入している。
論文 参考訳(メタデータ) (2025-07-03T06:44:26Z) - One-D-Piece: Image Tokenizer Meets Quality-Controllable Compression [1.7942265700058988]
可変長トークン化のための離散画像トークンであるOne-D-Pieceを紹介する。
Tail Token Dropは、"Tail Token Drop"と呼ばれる正規化メカニズムを1次元画像トークンに分割する。
コンストラクタを複数の再構成品質指標で評価した結果,既存の品質管理可能な圧縮手法よりもはるかに優れた知覚品質が得られることがわかった。
論文 参考訳(メタデータ) (2025-01-17T09:29:33Z) - Adaptive Length Image Tokenization via Recurrent Allocation [81.10081670396956]
現在の視覚システムは、情報内容に関わらず、画像に一定長の表現を割り当てている。
そこで本研究では,2次元画像に対する可変長トークン表現の学習手法を提案する。
論文 参考訳(メタデータ) (2024-11-04T18:58:01Z) - Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding [54.532578213126065]
ほとんどの文書理解手法は、サブイメージ内の全てのトークンを保存し、それらを等しく扱う。
これにより、異なる情報性が無視され、画像トークンの数が大幅に増加する。
トークン処理を最適化するためのパラメータフリーかつプラグアンドプレイ手法であるトークンレベルの相関誘導圧縮を提案する。
論文 参考訳(メタデータ) (2024-07-19T16:11:15Z) - LeMeViT: Efficient Vision Transformer with Learnable Meta Tokens for Remote Sensing Image Interpretation [37.72775203647514]
本稿では,学習可能なメタトークンを用いてスパーストークンを定式化し,キー情報を効果的に学習し,推論速度を向上させることを提案する。
視覚トークンが密集した早期にデュアル・クロス・アテンション(DCA)を用いることで,様々な大きさの階層型アーキテクチャLeMeViTが得られる。
分類と密接な予測タスクの実験結果は、LeMeViTがベースラインモデルと比較して1.7倍のスピードアップ、少ないパラメータ、競争性能を持っていることを示している。
論文 参考訳(メタデータ) (2024-05-16T03:26:06Z) - Not All Patches are What You Need: Expediting Vision Transformers via
Token Reorganizations [37.11387992603467]
ViT(Vision Transformer)は、すべてのイメージパッチをトークンとして取り込んで、MHSA(Multi-head Self-attention)を構築する。
例えば、意味的に無意味な画像背景を含むトークンがある。
本稿では、トレーニング中にViTに統合されたVTモデルのフィードフォワードプロセス中に画像トークンを再編成することを提案する。
論文 参考訳(メタデータ) (2022-02-16T00:19:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。