論文の概要: Decoding the Functional Roles of Register and High-Norm Patch Tokens in Vision Transformers
- arxiv url: http://arxiv.org/abs/2610.03698v1
- Date: Fri, 02 Oct 2026 17:55:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.554879
- Title: Decoding the Functional Roles of Register and High-Norm Patch Tokens in Vision Transformers
- Title(参考訳): 視覚変換器におけるレジスタと高ノルムパッチトークンの機能的役割の復号化
- Abstract要約: DINOv2におけるレジスタ・トケンとアウトリア・トケンの活性化を解析した。
レジスタ・トークンの機能は、高レベルなセマンティックな概念に強く結びついていることがわかりました。
対照的に、アウトリアトーケンの特徴は、しばしば低レベルの構造、背景、テクスチャに支配的なパターンと結びついている。
- 参考スコア(独自算出の注目度): 4.186493153054612
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Self-supervised Vision Transformers (ViTs), such as DINOv2, learn rich visual representations, but the functions of their internal tokens remain poorly understood. Recent architectures introduce dedicated register tokens to reduce high-norm out- lier patch tokens that emerge in background re- gions, yet the semantic and functional roles of both token types have not been fully established. In this paper, we analyze these roles by training sparse autoencoders (SAEs) on register-token and outlier-token activations in DINOv2. Using an automated interpretability pipeline, UMAP clus- tering, and CLIP-space cross-checks, we find that register-token features are more strongly associ- ated with high-level semantic concepts. Outlier- token features, by contrast, are more often associ- ated with lower-level structural, background, and texture-dominant patterns. Causal ablations fur- ther reveal a substantial functional asymmetry: disrupting top-activating register-derived features produces a 48.17% drop in representation cosine similarity, whereas disrupting outlier-derived fea- tures produces only a 0.31% drop. Together, our results provide evidence for token specialization in self-supervised ViTs.
- Abstract(参考訳): DINOv2のような自己監督型視覚変換器(ViT)はリッチな視覚表現を学習するが、内部トークンの機能はあまり理解されていない。
最近のアーキテクチャでは、バックグラウンドのre-gionに現れるハイノームなout-lierパッチトークンを減らすために専用のレジスタトークンが導入されているが、両方のトークンタイプのセマンティックな役割と機能的な役割は完全には確立されていない。
本稿では,DINOv2におけるレジスタ・トケンとアウトリア・トケンのアクティベーションに対するスパース・オートエンコーダ(SAE)の訓練により,これらの役割を解析する。
自動解釈可能性パイプライン, UMAP clus-tering, CLIP-space cross-checks を用いることで, レジスタ・ツーケン機能は高レベルのセマンティックな概念とより強く結びついていることが分かる。
対照的に、外部トークンの特徴は、より低いレベルの構造、背景、テクスチャに支配的なパターンと結びついていることが多い。
トップアクティベートなレジスタ由来の特徴を乱すとコサイン類似度が48.17%低下するのに対し、アウリエ由来のフェーアチャーは0.31%低下しか生じない。
その結果,自己監督型ViTにおけるトークンの特殊化の証拠が得られた。
関連論文リスト
- TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models [6.132992639292891]
VLM(Vision-Language Models)は、様々なタスクにまたがる印象的な機能を示しているが、その計算コストはモデルに供給される多数の視覚トークンに支配されている。
本稿では,VLMの適応的視覚トークン削減のためのプラグイン・アンド・プレイフレームワークであるTORINOを紹介する。
論文 参考訳(メタデータ) (2026-07-06T01:43:09Z) - Vision Transformers for Face Recognition Need More Registers [16.250163286204593]
顔認識(FR)のための視覚変換器(ViT)の最近の進歩は、標準のCLSベースのパラダイムを超えて進んでいる。
このパラダイムでは、パッチ埋め込みに特別な分類トークン(トークン)がプリコンパイルされ、下流タスクの入力の表現として使用される。
本稿では,CPE (ConChenated Patch Embeddings) を提案する。その代わりに,すべてのパッチトークンを単一のベクトルに結合して,コンパクトな顔表現に投影する。
論文 参考訳(メタデータ) (2026-06-10T12:58:23Z) - Taming Outlier Tokens in Diffusion Transformers [55.42341508886889]
画像生成のための拡散変換器(DiT)の外部トークンについて検討する。
この現象は、現代の表現オートエンコーダ(RAE)-DiTパイプラインのエンコーダとデノイザの両方に現れる。
両コンポーネントのレジスタベースの介入であるDSR(Dual-Stage Registers)を導入する。
論文 参考訳(メタデータ) (2026-05-06T17:59:42Z) - REAR: Rethinking Visual Autoregressive Models via Generator-Tokenizer Consistency Regularization [130.46612643194973]
reARはトークン単位の正規化目標を導入する単純なトレーニング戦略です。
ImageNetでは、gFIDを3.02から1.86に削減し、標準化ベースのトークンーザを使用してISを316.9に改善している。
高度なトークン化器に適用すると、177Mパラメータしか持たない1.42のgFIDが達成され、その性能はより大きな最先端拡散モデル(675M)と一致する。
論文 参考訳(メタデータ) (2025-10-06T02:48:13Z) - ToDRE: Visual Token Pruning via Diversity and Task Awareness for Efficient Large Vision-Language Models [59.47738955960352]
ToDREは、2段階でトレーニング不要なトークン圧縮フレームワークである。
トークンの多様性とトークン-タスク関連性に基づいてトークンをプルーニングすることで、優れたパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-05-24T15:47:49Z) - "Principal Components" Enable A New Language of Images [79.45806370905775]
証明可能なPCAのような構造を潜在トークン空間に組み込む新しい視覚トークン化フレームワークを導入する。
提案手法は、最先端の再構築性能を実現し、人間の視覚システムとの整合性を向上する。
論文 参考訳(メタデータ) (2025-03-11T17:59:41Z) - Multi-Scale And Token Mergence: Make Your ViT More Efficient [3.087140219508349]
Vision Transformer (ViT) はコンピュータビジョン領域において一般的なモデルとして登場した。
より重要なトークンとマージすることで,非機密トークンからの情報を保持できる新しいトークンプルーニング手法を提案する。
提案手法は,DeiT-Sの精度は0.1%しか低下せず,計算コストの33%の大幅な削減を実現している。
論文 参考訳(メタデータ) (2023-06-08T02:58:15Z) - Patch-level Representation Learning for Self-supervised Vision
Transformers [68.8862419248863]
視覚変換器(ViT)は近年、より優れたアーキテクチャ選択として多くの注目を集めており、様々な視覚タスクにおいて畳み込みネットワークよりも優れています。
これに触発された私たちは、パッチレベルの表現をより良く学習するための、SelfPatchという、シンプルで効果的なビジュアルプリテキストタスクを設計しました。
我々は、既存のSSLメソッドの様々な視覚的タスクに対する性能を大幅に改善できることを実証した。
論文 参考訳(メタデータ) (2022-06-16T08:01:19Z) - On Improving Adversarial Transferability of Vision Transformers [97.17154635766578]
視覚変換器(ViT)は、入力画像を、自己注意によるパッチのシーケンスとして処理する。
本稿では,ViTモデルの対角的特徴空間とその伝達性について検討する。
本稿では,ViTモデルのアーキテクチャに特有な2つの新しい戦略を紹介する。
論文 参考訳(メタデータ) (2021-06-08T08:20:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。