論文の概要: Understanding Geometric Representations in Self-Supervised Vision Transformers via Subspace Intervention
- arxiv url: http://arxiv.org/abs/2607.01987v1
- Date: Thu, 02 Jul 2026 10:18:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.787161
- Title: Understanding Geometric Representations in Self-Supervised Vision Transformers via Subspace Intervention
- Title(参考訳): 部分空間干渉による自己監督型視覚変換器の幾何学的表現の理解
- Authors: Weichen Zhou, Yawen Zou, Chunzhi Gu, Ran Dong, Haoran Xie, Chao Zhang,
- Abstract要約: 本研究では、自己教師型視覚変換器(ViT)が高密度な幾何学的情報をエンコードする方法を検討するために、制御されたサブスペース介入フレームワークを導入する。
これらの知見は、内部符号化機構と下流性能を結合することにより、効率的な特徴選択と軽量デコーダ設計の基礎となる。
- 参考スコア(独自算出の注目度): 7.887469434417159
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce a controlled subspace intervention framework to investigate how self-supervised Vision Transformers (ViTs) encode dense geometric information. While linear probing is widely used to assess geometric representations, it treats features as a black box, failing to disentangle the underlying topology. To address this issue, we decompose the weights of converged linear probes to isolate the low-rank subspaces containing explicit geometric signals using Singular Value Decomposition (SVD). Our perspective yields three key insights: (1) Pre-training objectives determine how features are encoded. DINOv2 aligns spatial features for efficient linear extraction, while Masked Autoencoders (MAE) tend to disperse these signals, requiring a broader spatial context. (2) Explicit geometric representations are highly compressible, suggesting dense predictive heads could potentially be constrained to low-rank subspaces with minimal performance loss. (3) The layer-wise task affinity suggests that geometric precision peaks at intermediate layers before yielding to semantic abstraction in the final layers. By connecting internal encoding mechanics with downstream performance, these findings provide a basis for effective feature selection and lightweight decoder design. The source code is available at https://github.com/Zhou-Weichen/Geosubprobe.
- Abstract(参考訳): 本研究では、自己教師型視覚変換器(ViT)が高密度な幾何学的情報をエンコードする方法を検討するために、制御されたサブスペース介入フレームワークを導入する。
線形探索は幾何学的表現を評価するために広く用いられているが、特徴をブラックボックスとして扱い、基礎となる位相を乱すことができない。
この問題に対処するために、収束線形プローブの重みを分解し、特異値分解(SVD)を用いて明示的な幾何学的信号を含む低ランク部分空間を分離する。
1) 事前学習の目的が機能のエンコード方法を決定する。
DINOv2は効率的な線形抽出のために空間的特徴を整列するが、Masked Autoencoders (MAE)はこれらの信号を分散させ、より広い空間的コンテキストを必要とする。
2) 幾何表現は非常に圧縮性が高く、密度の強い予測ヘッドは性能損失が最小限である低ランク部分空間に制約される可能性があることを示唆する。
3) 階層的タスク親和性は, 中間層で幾何学的精度がピークに達することを示唆する。
これらの知見は、内部符号化機構と下流性能を結合することにより、効率的な特徴選択と軽量デコーダ設計の基礎となる。
ソースコードはhttps://github.com/Zhou-Weichen/Geosubprobe.comで入手できる。
関連論文リスト
- From Extrinsic to Intrinsic: Geodesic-Guided Representation Learning for 3D Geometric Data [56.41479248637621]
我々は,textbfPreトレーニングのための新しい3D表現学習パラダイムであるtextbfPRISMを紹介した。
PRISMは textbfIntrinsic textbfSurface geodesic textbfMetric を検索して埋め込みを学習する。
提案手法は測地線距離予測において, 良好な精度, 堅牢性, 高効率性を示す。
論文 参考訳(メタデータ) (2026-06-01T13:54:26Z) - Topo-GS: Continuous Volumetric Embedding of High-Dimensional Data via Topological Gaussian Splatting [4.621191941382847]
Topo-GS は 3D Gaussian Splatting (3DGS) を再利用し、メッシュレスボリューム再構成プロセスとして多次元投影を行うフレームワークである。
Topo-GSは離散散乱プロットを連続体積表現に変換することに成功した。
論文 参考訳(メタデータ) (2026-05-16T14:21:08Z) - Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images [81.94999489820974]
UniSplat (UniSplat) は、未提示のマルチビュー画像から3D表現を学習するためのフィードフォワードフレームワークである。
エンコーダにおける幾何誘導を強化するデュアルマスキング戦略を導入する。
第2に,外見のセマンティックな矛盾を解消する粗大なガウス的スプレイティング戦略を開発する。
第3に、予測された3次元点と意味マップを画像平面に相互に関連付ける、ポーズ条件の補正機構を導入する。
論文 参考訳(メタデータ) (2026-04-12T10:36:18Z) - SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments [49.966170814478915]
UAV VLNのための幾何学誘導空間表現フレームワークを提案する。
明示的な3次元再構成を伴わないRGB観測において、SpatialFlyは幾何学誘導2次元表示アライメント機構を導入する。
実験結果から、SpatialFlyは現状のUAV VLNベースラインを目に見える環境と見えない環境の両方で一貫して上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2026-03-22T03:56:58Z) - Cross-Modal Geometric Hierarchy Fusion: An Implicit-Submap Driven Framework for Resilient 3D Place Recognition [9.411542547451193]
本稿では,密度に依存しない幾何学的推論により3次元位置認識を再定義するフレームワークを提案する。
具体的には、元のシーンポイント雲密度の干渉に免疫する弾性点に基づく暗黙の3次元表現を導入する。
これら2種類の情報を活用することで,鳥眼視と3Dセグメントの両視点から幾何学的情報を融合する記述子を得る。
論文 参考訳(メタデータ) (2025-06-17T07:04:07Z) - Flattening-Net: Deep Regular 2D Representation for 3D Point Cloud
Analysis [66.49788145564004]
我々は、任意の幾何学と位相の不規則な3次元点雲を表現するために、Flattning-Netと呼ばれる教師なしのディープニューラルネットワークを提案する。
我々の手法は、現在の最先端の競合相手に対して好意的に機能する。
論文 参考訳(メタデータ) (2022-12-17T15:05:25Z) - Self-supervised Geometric Perception [96.89966337518854]
自己教師付き幾何知覚(self-supervised geometric perception)は、基底幾何モデルラベルなしで対応マッチングのための特徴記述子を学ぶためのフレームワークである。
また,SGPは,地上トラスラベルを用いて訓練した教師付きオークルよりも同等か優れる最先端性能を達成できることを示す。
論文 参考訳(メタデータ) (2021-03-04T15:34:43Z) - Scan-based Semantic Segmentation of LiDAR Point Clouds: An Experimental
Study [2.6205925938720833]
最先端の手法では、深いニューラルネットワークを使用して、LiDARスキャンの各点のセマンティッククラスを予測する。
LiDAR測定を処理するための強力で効率的な方法は、2次元の画像のような投影を使うことである。
メモリの制約だけでなく、パフォーマンスの向上やランタイムの改善など、さまざまなテクニックを実証する。
論文 参考訳(メタデータ) (2020-04-06T11:08:12Z) - Cylindrical Convolutional Networks for Joint Object Detection and
Viewpoint Estimation [76.21696417873311]
3次元空間で定義された畳み込みカーネルの円筒形表現を利用する学習可能なモジュールである円筒型畳み込みネットワーク(CCN)を導入する。
CCNはビュー固有の畳み込みカーネルを通してビュー固有の特徴を抽出し、各視点におけるオブジェクトカテゴリスコアを予測する。
本実験は,円柱状畳み込みネットワークが関節物体の検出と視点推定に与える影響を実証する。
論文 参考訳(メタデータ) (2020-03-25T10:24:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。