論文の概要: Vision Transformers Need Better Token Interaction
- arxiv url: http://arxiv.org/abs/2605.23868v1
- Date: Fri, 22 May 2026 17:25:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-25 17:29:20.445092
- Title: Vision Transformers Need Better Token Interaction
- Title(参考訳): 視覚変換器は剣の相互作用を改善する必要がある
- Authors: Linxiang Su,
- Abstract要約: ビジョントランスフォーマー(ViT)は、画像レベルの強い表現を学習できるが、パッチ表現は、長期トレーニング中の密集予測にはあまり効果がない。
我々は,グローバルな意味情報がパッチトークンを通じて局所的に正当化されるものを超えて拡散する最適化ショートカットを特徴付ける。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision Transformers (ViTs) can learn strong image-level representations while their patch representations become less effective for dense prediction during prolonged training. We revisit this dense degradation phenomenon and argue that it is not fully explained by high-norm artifacts alone. Instead, we characterize \emph{semantic diffusion}: an optimization shortcut in which global semantic information spreads through patch tokens beyond what is locally justified. Our analysis shows that dense representation quality is not captured by locality alone: shallow features can remain better aligned with foreground regions yet underperform deeper features, and \texttt{[CLS]} features remain complementary for dense prediction. These observations suggest that the goal should not be to remove global context, but to make token interactions more selective. We therefore study sparse attention as a minimal intervention, replacing softmax attention with entmax-1.5 while preserving global token connectivity. On DINOv1 ViT-S/16 trained for 200 epochs on ImageNet-1K, this change preserves ImageNet linear probing accuracy and substantially improves semantic segmentation performance: VOC mIoU increases from 42.80 to 48.78, ADE20K from 19.85 to 21.97, and Cityscapes from 36.79 to 37.87. These results suggest that selective token mixing is a simple and effective bias for improving dense ViT representations.
- Abstract(参考訳): ビジョントランスフォーマー(ViT)は、画像レベルの強い表現を学習できるが、パッチ表現は、長期トレーニング中の密集予測にはあまり効果がない。
我々は、この高密度劣化現象を再考し、高ノルム人工物だけでは完全には説明できないと主張している。
代わりに、グローバルな意味情報が局所的に正当化されるものを超えてパッチトークンを通して拡散する最適化ショートカットを特徴付ける。
我々の分析では, 局所性だけでは密度表現の質は捉えられず, 浅部特徴は前景領域とよく一致しているが, より深い特徴は得られず, \texttt{[CLS]} 特徴は密度予測に相補的のままである。
これらの観察から、ゴールはグローバルな文脈を取り除くことではなく、トークンの相互作用をより選択的にすることであることを示唆している。
そこで我々は,少人数の注意を最小限の介入として研究し,グローバルトークン接続性を維持しつつ,ソフトマックスの注意をentmax-1.5に置き換えた。
DINOv1 ViT-S/16は、ImageNet-1K上で200エポックで訓練された。この変更は、ImageNet線形探索の精度を保ち、セマンティックセグメンテーションのパフォーマンスを大幅に改善する: VOC mIoUは42.80から48.78、ADE20Kは19.85から21.97、Cityscapesは36.79から37.87である。
これらの結果から, 選択的トークン混合は高密度なViT表現を改善するための単純かつ効果的なバイアスであることが示唆された。
関連論文リスト
- AiluRus: A Scalable ViT Framework for Dense Prediction [95.1313839257891]
視覚変換器 (ViT) は、その優れた性能のため、視覚タスクの一般的なアーキテクチャとして登場した。
本稿では,画像の異なる領域に対して,その重要度に応じて適応分解能を適用することを提案する。
提案手法を3つの異なるデータセット上で評価し,有望な性能を観察する。
論文 参考訳(メタデータ) (2023-11-02T12:48:43Z) - SG-Former: Self-guided Transformer with Evolving Token Reallocation [89.9363449724261]
本稿では,適応的な微粒化を伴う効果的なグローバル自己注意に向けて,自己誘導変換器と呼ばれる新しいモデルを提案する。
我々は、細かな注意を得られるために、細かな領域により多くのトークンを割り当てる一方で、効率とグローバルな受容場と引き換えに、小さな領域に少ないトークンを割り当てる。
提案したSG-Formerは,最先端技術よりも優れたパフォーマンスを実現している。我々のベースサイズモデルは,ImageNet-1K上のTop-1精度,textbf51.2mAP BBAP on CoCo, textbf52.7mIoU
論文 参考訳(メタデータ) (2023-08-23T15:52:45Z) - Making Vision Transformers Efficient from A Token Sparsification View [26.42498120556985]
本稿では,グローバル・ローカル・ビジョン・トランスフォーマのための新しいセマンティック・トークンViT(STViT)を提案する。
提案手法は,対象検出やインスタンスセグメンテーションにおける元のネットワークと比較して,30%以上のFLOPを削減できる。
さらに,STViTに基づいて詳細な空間情報を復元するためのSTViT-R(ecover)ネットワークを設計し,下流タスクに有効である。
論文 参考訳(メタデータ) (2023-03-15T15:12:36Z) - Vision Transformer with Super Token Sampling [93.70963123497327]
多くの視覚タスクにおいて、視覚変換器は印象的なパフォーマンスを達成した。
浅い層のために局所的な特徴を捉える際に、高い冗長性に悩まされる可能性がある。
スーパートークンは、視覚的コンテンツの意味的に意味のあるテッセルレーションを提供しようとする。
論文 参考訳(メタデータ) (2022-11-21T03:48:13Z) - DynamicViT: Efficient Vision Transformers with Dynamic Token
Sparsification [134.9393799043401]
入力に基づいて冗長なトークンを抽出する動的トークンスペーシフィケーションフレームワークを提案する。
入力トークンの66%を階層的にプルーニングすることで,FLOPの31%37%を大幅に削減し,スループットを40%以上向上する。
DynamicViTモデルは、ImageNetの最先端CNNやビジョントランスフォーマーと比較して、非常に競争力のある複雑性/精度のトレードオフを実現することができる。
論文 参考訳(メタデータ) (2021-06-03T17:57:41Z) - Rethinking Global Context in Crowd Counting [70.54184500538338]
純粋な変換器は、重なり合う画像パッチからグローバル情報で特徴を抽出するために用いられる。
分類によってインスピレーションを得て、入力シーケンスにコンテキストトークンを追加し、画像パッチに対応するトークンと情報交換を容易にする。
論文 参考訳(メタデータ) (2021-05-23T12:44:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。