論文の概要: IRIS: A Visual Cortex-Inspired Framework for Analyzing Orientation Selectivity in Vision Transformers
- arxiv url: http://arxiv.org/abs/2608.05122v1
- Date: Wed, 05 Aug 2026 17:49:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.067845
- Title: IRIS: A Visual Cortex-Inspired Framework for Analyzing Orientation Selectivity in Vision Transformers
- Title(参考訳): IRIS:視覚変換器のオリエンテーション選択性分析のためのビジュアル・コーテックスにインスパイアされたフレームワーク
- Authors: Vaishnavi B Mohan, Vijayakrishna Naganoor, Yashas Annadani, Shashank Hegde,
- Abstract要約: 視覚変換器(ViT)は多くの知覚タスクにおける画像符号化のデファクトスタンダードとなっている。
神経科学にインスパイアされた一連の指標を導入することで、ViTの配向選択性がどのように現れるかを検討する。
- 参考スコア(独自算出の注目度): 6.663781005865136
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision transformers (ViTs) have become the de facto standard for image encoding across many perception tasks. Despite their empirical success, it remains mechanistically unclear how they encode low-level features, given their lack of inductive biases: ViTs process information globally rather than relying on local structure. Biological visual systems, in contrast, build low-level features, such as orientation selectivity in the primary visual cortex, by combining information from small, localized regions of the visual field. These features are general-purpose representations, shared and required across multiple specialized neural pathways, unlike higher-level, task-specific semantic features. This raises the question if such biologically-grounded features arise in ViTs. In this work, we systematically study how orientation selectivity emerges in ViTs by introducing a suite of neuroscience-inspired metrics: representational similarity score (RSS), orientation recruitment score (ORS), and orientation tuning bandwidth to quantify how orientation is encoded in representational geometry and as a function of model depth. Through extensive analysis, we find that: (1) the training paradigm is the strongest determinant of orientation selectivity, with models sharing an objective, peaking at comparable relative depths regardless of scale (2) many units are orientation-selective early in training, with early-to-middle layers recruiting more such units over time, while deeper layers lose selectivity and broaden their tuning toward semantic encoding and (3) our metrics offer a mechanistic heuristic for how many layers to unfreeze for best downstream generalization. Our framework presents a way to track biologically-grounded features during ViT training, probes how desired properties are encoded in transformer representations, and builds a systematic understanding of how ViTs generalize across tasks.
- Abstract(参考訳): 視覚変換器(ViT)は、多くの知覚タスクにまたがる画像符号化のデファクトスタンダードとなっている。
実証的な成功にもかかわらず、インダクティブバイアスの欠如を考えると、どのように低レベルの特徴をエンコードするかは、機械学的に不明である。
対照的に生物学的視覚システムは、視覚野の小さな局所的な領域からの情報を組み合わせることで、一次視覚野の方向選択性のような低レベルの特徴を構築する。
これらの機能は汎用的な表現であり、より高いレベルのタスク固有のセマンティック機能とは異なり、複数の特殊な神経経路で共有され、必要となる。
このような生物学的な特徴がViTに現れるかどうかという疑問が浮かび上がっている。
本研究では,視覚神経科学にインスパイアされた指標として,表現的類似度スコア(RSS),配向採用スコア(ORS),配向調整帯域幅を導入し,配向選択性がViTにどのように出現するかを系統的に検討する。
学習パラダイムは,(1) 学習パラダイムが指向性選択性の最も強い決定要因であり,(2) 規模に関係なく相対的な深度を最大化するモデル,(2) 多くのユニットは訓練の初期段階において指向性に富み,(2) 早期から中級の層は時間とともに多くのユニットを募集する一方で,より深い層は選択性を失い,セマンティックエンコーディングに向けてのチューニングを拡大し,(3) 当社のメトリクスは,下流の一般化のために何層を解凍するかという機械的ヒューリスティックを提供する。
我々のフレームワークは,ViTトレーニング中の生物学的な特徴の追跡方法を示し,所望のプロパティをトランスフォーマー表現にエンコードする方法を探索し,ViTがタスク全体をどのように一般化するかを体系的に理解する。
関連論文リスト
- Semantic Generative Tuning for Unified Multimodal Models [62.18894352635965]
統一マルチモーダルモデル(UMM)は、単一のアーキテクチャ内で視覚的理解と視覚的生成を統合する。
訓練パラダイムは 独立して テキスト信号を通して 理解を最適化する 密集したピクセルの目的を通して 生成する
本研究は,UMMの分離を橋渡しするための生成プロキシとして階層的視覚タスクを定式化する,生成後学習に関する最初の体系的な研究である。
論文 参考訳(メタデータ) (2026-05-18T17:46:46Z) - Which Direction to Choose? An Analysis on the Representation Power of Self-Supervised ViTs in Downstream Tasks [43.473390101413166]
視覚変換のための自己監督学習(ViTs)は、近年、様々なコンピュータビジョンタスクの事前学習戦略としてかなりの可能性を示している。
本研究の目的は,画像分類とセグメント化タスクにまたがる未修正特徴の使用を体系的に評価することで,ギャップを埋めることである。
論文 参考訳(メタデータ) (2025-09-18T11:46:07Z) - Self-Supervised Monocular Depth Estimation by Direction-aware Cumulative
Convolution Network [80.19054069988559]
自己教師付き単眼深度推定は, 方向感度と環境依存性を示す。
本稿では2つの側面において深度表現を改善する方向対応累積畳み込みネットワーク(DaCCN)を提案する。
実験の結果,提案手法は広く使用されている3つのベンチマークにおいて大幅な改善が得られた。
論文 参考訳(メタデータ) (2023-08-10T14:32:18Z) - Vision Transformers: From Semantic Segmentation to Dense Prediction [139.15562023284187]
視覚的予測のための視覚変換器(ViT)のグローバルな文脈学習の可能性について検討する。
我々のモチベーションは、グローバルコンテキストを全受容界層で学習することで、ViTがより強力な長距離依存性情報を取得することである。
階層型ローカル・グローバル・トランスフォーマー (HLG) のファミリを定式化し, 窓内部の局所的な注意と, ピラミッド建築における窓全体のグローバルアテンションを特徴とする。
論文 参考訳(メタデータ) (2022-07-19T15:49:35Z) - Do Vision Transformers See Like Convolutional Neural Networks? [45.69780772718875]
近年の研究では、画像分類タスクにおいて、(Vision) Transformer Model (ViT) が同等またはそれ以上の性能を達成できることが示されている。
畳み込みネットワークのように振る舞うのか、それとも全く異なる視覚表現を学ぶのか?
例えば、ViTはすべての層にわたってより均一な表現を持つ。
論文 参考訳(メタデータ) (2021-08-19T17:27:03Z) - Intriguing Properties of Vision Transformers [114.28522466830374]
視覚変換器(ViT)は、様々なマシンビジョン問題にまたがって印象的な性能を誇示している。
我々は、この問題を広範囲の実験を通して体系的に研究し、高性能畳み込みニューラルネットワーク(CNN)との比較を行った。
ViTsの効果的な特徴は、自己認識機構によって可能なフレキシブルな受容と動的場によるものであることを示す。
論文 参考訳(メタデータ) (2021-05-21T17:59:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。