論文の概要: Feature Evolution and Migration during Vision Transformer Training
- arxiv url: http://arxiv.org/abs/2608.20134v1
- Date: Thu, 20 Aug 2026 15:00:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.617121
- Title: Feature Evolution and Migration during Vision Transformer Training
- Title(参考訳): 視覚変換器訓練における特徴の進化と移動
- Abstract要約: ネットワーク深さ(層)とトレーニング時間(エポック)の2次元にわたるトレーニングプロセスを可視化することで、視覚変換器(ViT)の機能進化の新たな視点を示す。
我々はSparse Autoencoders (SAEs) を用いて、CLS-token表現から候補スパース特徴を抽出し、そのアクティベーションプロファイルをエポック層対間で比較する。
この機能進化のフレームワークが、トレーニング中に最も検出可能なレイヤの変更である、機能マイグレーションをいかに記述できるかを示します。
- 参考スコア(独自算出の注目度): 1.7966001353008776
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present a novel view on feature evolution in Vision Transformers (ViTs) by visualizing the training process over two dimensions -- network depth (layer) and training time (epochs). We employ Sparse Autoencoders (SAEs) to extract candidate sparse features from CLS-token representations and compare their activation profiles across epoch--layer pairs. This allows us to study feature-level dynamics that are not directly visible from representation-level similarity measures. Furthermore, we demonstrate how this framework of feature evolution allows us to describe feature migration, the change in the layer where a feature is most detectable during training. Our experiments show that migration is concentrated early in training, occurs more often toward earlier layers than toward deeper layers, and declines as feature organization stabilizes. We further find that deeper layers stabilize earlier and more strongly than shallow layers. The results show that our approach can be employed as a tool for understanding how ViTs learn and evolve.
- Abstract(参考訳): ネットワーク深さ(層)とトレーニング時間(エポック)という2次元のトレーニングプロセスを可視化することで,視覚変換器(ViT)の機能進化の新たな視点を示す。
我々はSparse Autoencoders (SAEs) を用いて、CLS-token表現から候補スパース特徴を抽出し、そのアクティベーションプロファイルをエポック層対間で比較する。
これにより、表現レベルの類似度から直接見えない特徴レベルのダイナミクスを研究できる。
さらに、この機能進化のフレームワークが、トレーニング中に最も検出可能なレイヤの変更である機能マイグレーションをいかに記述できるかを実演する。
実験の結果、移行は早期に集中しており、より深い層へ向けて、より早い層へ向けて起こることが多く、機能組織が安定化するにつれて減少することがわかった。
さらに、より深い層が浅い層よりも早く、より強く安定していることが分かりました。
その結果,ViTの学習と進化の方法を理解するツールとして,我々のアプローチが有効であることが示唆された。
関連論文リスト
- IRIS: A Visual Cortex-Inspired Framework for Analyzing Orientation Selectivity in Vision Transformers [6.663781005865136]
視覚変換器(ViT)は多くの知覚タスクにおける画像符号化のデファクトスタンダードとなっている。
神経科学にインスパイアされた一連の指標を導入することで、ViTの配向選択性がどのように現れるかを検討する。
論文 参考訳(メタデータ) (2026-08-05T17:49:45Z) - Gym-V: A Unified Vision Environment System for Agentic Vision Research [51.62136909074774]
Gym-Vは、手続き的に生成された10ドメインにわたる179の視覚環境の統一プラットフォームであり、制御が難しい。
我々は,RLアルゴリズムの選択よりも,観測足場がトレーニングの成功に決定的であることを見出した。
クロスドメイン転送実験は、多様なタスクのトレーニングが広範囲に一般化され、狭いトレーニングが負の転送を引き起こすことを示している。
論文 参考訳(メタデータ) (2026-03-16T15:37:07Z) - Evolution of Concepts in Language Model Pre-Training [53.994470178155105]
クロスコーダと呼ばれるスパース辞書学習手法を用いて,事前学習スナップショットにおける線形解釈可能な特徴の進化を追跡する。
ほとんどの機能が特定のポイントの周りに形成され始め、さらに複雑なパターンが後のトレーニング段階に現れます。
論文 参考訳(メタデータ) (2025-09-21T18:53:12Z) - Which Direction to Choose? An Analysis on the Representation Power of Self-Supervised ViTs in Downstream Tasks [43.473390101413166]
視覚変換のための自己監督学習(ViTs)は、近年、様々なコンピュータビジョンタスクの事前学習戦略としてかなりの可能性を示している。
本研究の目的は,画像分類とセグメント化タスクにまたがる未修正特徴の使用を体系的に評価することで,ギャップを埋めることである。
論文 参考訳(メタデータ) (2025-09-18T11:46:07Z) - Tracking the Feature Dynamics in LLM Training: A Mechanistic Study [11.64581123817424]
SAE-Trackは, 連続したSAEを効率よく取得するための新しい手法である。
本研究は,(2)特徴の意味的進化,(3)特徴形成の基盤過程,(4)特徴の方向性の漂流について論じる。
私たちの研究は、大規模言語モデル(LLM)の機能のダイナミクスに関する新たな洞察を提供し、トレーニングメカニズムと機能進化に対する理解を深めます。
論文 参考訳(メタデータ) (2024-12-23T14:58:37Z) - Locality Alignment Improves Vision-Language Models [55.275235524659905]
近年では視覚言語モデル (VLM) が普及しているが、その多くが基本的な空間推論の誤りに悩まされている。
私たちのゴールは、ローカルとグローバルの両方の画像セマンティクスを効果的にキャプチャするビジョンバックボーンでこれを解決することです。
局所性アライメントとMaskEmbedと呼ばれる新しい微調整手順を提案する。
論文 参考訳(メタデータ) (2024-10-14T21:01:01Z) - What do Vision Transformers Learn? A Visual Exploration [68.50771218442776]
視覚変換器(ViT)はコンピュータビジョンのデファクトアーキテクチャとして急速に普及しつつある。
本稿では、ViT上での可視化の障害に対処し、ViTとCNNの根本的な相違について検討する。
また、DeiT、CoaT、ConViT、PiT、Swin、Twinなど、さまざまなViT変種に対して大規模な可視化を行っています。
論文 参考訳(メタデータ) (2022-12-13T16:55:12Z) - Pretraining the Vision Transformer using self-supervised methods for
vision based Deep Reinforcement Learning [0.0]
いくつかの最先端の自己教師型手法を用いて視覚変換器の事前学習を行い、学習した表現の質を評価する。
その結果,すべての手法が有用な表現を学習し,表現の崩壊を避けるのに有効であることが示唆された。
時間順序検証タスクで事前訓練されたエンコーダは、すべての実験で最高の結果を示す。
論文 参考訳(メタデータ) (2022-09-22T10:18:59Z) - SSMTL++: Revisiting Self-Supervised Multi-Task Learning for Video
Anomaly Detection [108.57862846523858]
自己教師型マルチタスク学習フレームワークを再考し、元の手法にいくつかのアップデートを提案する。
マルチヘッド・セルフアテンション・モジュールを導入することで3次元畳み込みバックボーンを近代化する。
モデルをさらに改良するために,セグメントマップの予測などの自己指導型学習タスクについて検討した。
論文 参考訳(メタデータ) (2022-07-16T19:25:41Z) - PreViTS: Contrastive Pretraining with Video Tracking Supervision [53.73237606312024]
PreViTSは、同じオブジェクトを含むクリップを選択するための教師なしSSLフレームワークである。
PreViTSはフレーム領域を空間的に制約し、モデルから学習し、意味のあるオブジェクトを見つけるように訓練する。
モーメントコントラスト(MoCo)エンコーダを,PreViTSを用いてVGG-SoundとKinetics-400データセットでトレーニングする。
論文 参考訳(メタデータ) (2021-12-01T19:49:57Z) - Do Vision Transformers See Like Convolutional Neural Networks? [45.69780772718875]
近年の研究では、画像分類タスクにおいて、(Vision) Transformer Model (ViT) が同等またはそれ以上の性能を達成できることが示されている。
畳み込みネットワークのように振る舞うのか、それとも全く異なる視覚表現を学ぶのか?
例えば、ViTはすべての層にわたってより均一な表現を持つ。
論文 参考訳(メタデータ) (2021-08-19T17:27:03Z) - Less is More: Pay Less Attention in Vision Transformers [61.05787583247392]
注意の少ないvIsion Transformerは、畳み込み、完全接続層、自己アテンションが、画像パッチシーケンスを処理するためにほぼ同等な数学的表現を持つという事実に基づいている。
提案したLITは、画像分類、オブジェクト検出、インスタンス分割を含む画像認識タスクにおいて有望な性能を達成する。
論文 参考訳(メタデータ) (2021-05-29T05:26:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。