論文の概要: Subtoken Vision Transformer for Fine-grained Recognition
- arxiv url: http://arxiv.org/abs/2607.09086v1
- Date: Fri, 10 Jul 2026 04:07:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.778379
- Title: Subtoken Vision Transformer for Fine-grained Recognition
- Title(参考訳): 微粒化認識のためのサブToken Vision Transformer
- Authors: Jie Zhu, Ivy Zhang, Minchul Kim, Xiaoming Liu,
- Abstract要約: SubViTは、きめ細かい視覚認識のための選択的な画像トークン化手法である。
これは、グローバルコンテキストのオリジナルのトークンシーケンスを保持しながら、複数のサブトークンを持つ識別パッチを表す。
DINOv2の平均新規カテゴリー精度を811.3%から84.7%に改善し、0.50$msの追加遅延と3.4%のFLOPが加わった。
- 参考スコア(独自算出の注目度): 21.033814568458897
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present Subtoken Vision Transformer (SubViT), a selective image tokenization method for fine-grained visual recognition. Standard Vision Transformers compress each fixed-size patch into a single token, although fine-grained distinctions often depend on localized variations within only a few patches. SubViT addresses this mismatch by representing discriminative patches with multiple subtokens while retaining the original token sequence for global context, thereby allocating additional capacity where it is most needed. Since attention heads encode complementary semantics and extracting attention maps at inference requires an extra backbone forward, we adopt a two-stage training strategy. Stage 1 fine-tunes the ViT using subdivision regions sampled from random attention heads, exposing the model to diverse subdivision patterns. Stage 2 identifies informative attention maps through feature-degradation distances and distills them into a lightweight single-map router, which directly predicts deterministic token-importance scores without a separate attention forward. We evaluate SubViT on Generalized Category Discovery (GCD), a challenging task requiring both fine-grained discrimination and generalization to unlabeled novel categories. Across CUB, FGVC-Aircraft, and Stanford Cars, SubViT improves the average novel-category accuracy of DINOv2 from $81.3\%$ to $84.7\%$, with only $0.50$ ms additional latency and $3.4\%$ more FLOPs, while reducing latency by $73.8\%$ relative to Retina Patch. Results on CIFAR-10 and ImageNet-100 demonstrate its broader applicability.
- Abstract(参考訳): 本稿では,微粒な視覚認識のための選択的画像トークン化手法であるSubViTを提案する。
標準ビジョン変換器は固定サイズのパッチを1つのトークンに圧縮するが、微細な区別はしばしばいくつかのパッチで局所的なバリエーションに依存する。
SubViTはこのミスマッチに対処するため、複数のサブトークンで識別パッチを表現し、グローバルコンテキストに元のトークンシーケンスを保持することで、最も必要なキャパシティを割り当てる。
注意頭は相補的意味論を符号化し、推論時に注意マップを抽出するためには、後骨を前方に追加する必要があるため、2段階のトレーニング戦略を採用する。
ステージ1は、ランダムアテンションヘッドからサンプリングされたサブディビジョン領域を使用して、ViTを微調整し、様々なサブディビジョンパターンにモデルを公開する。
ステージ2では、特徴分解距離を通して情報的注意マップを特定し、それらを軽量のシングルマップルータに蒸留し、個別の注意を向けずに決定論的トークン重要スコアを直接予測する。
我々は,未ラベルの新規カテゴリーに対して,細粒度識別と一般化の両方を必要とする課題である,一般化カテゴリー発見(GCD)におけるSubViTの評価を行った。
CUB、FGVC-Aircraft、スタンフォード・カーズ全体で、SubViTはDINOv2の平均ノベル・カテゴリ精度を811.3 %$から84.7 %$に改善し、0.50$msの追加遅延と3.4 %$のFLOPが加わった。
CIFAR-10とImageNet-100の結果は、より広い適用性を示している。
関連論文リスト
- [CLS] is Not Enough: Multi-Label Recognition via Patch-Level Inference and Adaptive Aggregation [20.637119409165418]
PIAAは、アダプティブアグリゲーション(Adaptive Aggregation)によって、パッチレベルの推論として予測を定式化する。
パッチレベルのスコアを最終的なマルチラベル予測に集約するアダプティブアグリゲーションモジュールを導入する。
実験の結果,提案手法は最小限の余剰計算で強い改善を達成できることがわかった。
論文 参考訳(メタデータ) (2026-05-25T13:19:12Z) - Saccadic Vision for Fine-Grained Visual Classification [10.681604440788854]
きめ細かい視覚分類(FGVC)は、微妙で局所的な特徴によって視覚的に類似したカテゴリーを区別する必要がある。
既存のパートベースの手法は、ピクセルからサンプル空間へのマッピングを学習する複雑なローカライゼーションネットワークに依存している。
本稿では,まず周辺特徴を抽出し,サンプルマップを生成する2段階プロセスを提案する。
我々は、周辺と焦点の表現を融合する前に、各固定パッチの影響を定量的に評価するために、文脈選択的注意を用いる。
論文 参考訳(メタデータ) (2025-09-19T07:03:37Z) - LookupViT: Compressing visual information to a limited number of tokens [36.83826969693139]
ビジョントランスフォーマー (ViT) は、多くの業界グレードのビジョンソリューションのデファクト選択として登場した。
しかし、それらの推論コストは、トークン数の複雑さに悩まされる各レイヤにおける自己注意を計算するため、多くの設定で禁止される可能性がある。
本研究では、この情報空間を利用してViT推論コストを削減するLookupViTを紹介する。
論文 参考訳(メタデータ) (2024-07-17T17:22:43Z) - AiluRus: A Scalable ViT Framework for Dense Prediction [95.1313839257891]
視覚変換器 (ViT) は、その優れた性能のため、視覚タスクの一般的なアーキテクチャとして登場した。
本稿では,画像の異なる領域に対して,その重要度に応じて適応分解能を適用することを提案する。
提案手法を3つの異なるデータセット上で評価し,有望な性能を観察する。
論文 参考訳(メタデータ) (2023-11-02T12:48:43Z) - Making Vision Transformers Efficient from A Token Sparsification View [26.42498120556985]
本稿では,グローバル・ローカル・ビジョン・トランスフォーマのための新しいセマンティック・トークンViT(STViT)を提案する。
提案手法は,対象検出やインスタンスセグメンテーションにおける元のネットワークと比較して,30%以上のFLOPを削減できる。
さらに,STViTに基づいて詳細な空間情報を復元するためのSTViT-R(ecover)ネットワークを設計し,下流タスクに有効である。
論文 参考訳(メタデータ) (2023-03-15T15:12:36Z) - Patch-level Representation Learning for Self-supervised Vision
Transformers [68.8862419248863]
視覚変換器(ViT)は近年、より優れたアーキテクチャ選択として多くの注目を集めており、様々な視覚タスクにおいて畳み込みネットワークよりも優れています。
これに触発された私たちは、パッチレベルの表現をより良く学習するための、SelfPatchという、シンプルで効果的なビジュアルプリテキストタスクを設計しました。
我々は、既存のSSLメソッドの様々な視覚的タスクに対する性能を大幅に改善できることを実証した。
論文 参考訳(メタデータ) (2022-06-16T08:01:19Z) - Self-Promoted Supervision for Few-Shot Transformer [178.52948452353834]
SUN(Self-promoted sUpervisioN)は視覚変換器(ViT)のための数発の学習フレームワークである
SUNは、数ショットの学習データセットでViTを事前トレーニングし、各パッチトークンを導くために、個別のロケーション固有の監視を生成する。
実験によると、ViTを使ったSUNは、ViTを使った他の数発の学習フレームワークを大幅に上回っており、CNNの最先端技術よりも高いパフォーマンスを実現している。
論文 参考訳(メタデータ) (2022-03-14T12:53:27Z) - Shunted Self-Attention via Multi-Scale Token Aggregation [124.16925784748601]
最近のビジョン変換器(ViT)モデルは、様々なコンピュータビジョンタスクにまたがる励振結果を実証している。
注意層ごとのハイブリッドスケールでの注意をViTsでモデル化するShunted Self-attention(SSA)を提案する。
SSAベースの変換器は84.0%のTop-1精度を実現し、ImageNetの最先端のFocal Transformerより優れている。
論文 参考訳(メタデータ) (2021-11-30T08:08:47Z) - Vision Transformer with Progressive Sampling [73.60630716500154]
本稿では,識別領域を特定するための反復的・漸進的なサンプリング手法を提案する。
ImageNetでスクラッチからトレーニングされた場合、PS-ViTはトップ1の精度でバニラViTよりも3.8%高いパフォーマンスを示す。
論文 参考訳(メタデータ) (2021-08-03T18:04:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。