論文の概要: Active Spatial Guidance: Eliminating Injected Positional Mechanisms in Vision Transformers
- arxiv url: http://arxiv.org/abs/2607.00580v1
- Date: Wed, 01 Jul 2026 08:02:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.797308
- Title: Active Spatial Guidance: Eliminating Injected Positional Mechanisms in Vision Transformers
- Title(参考訳): アクティブな空間誘導:視覚変換器における注入型位置決め機構の除去
- Authors: Cong Liu, Xiaofang Li, Simon X. Yang,
- Abstract要約: 本研究では,位置注入を無効にするトレーニング専用目標として,アクティブ空間ガイダンス(Guidance)を提案する。
ガイダンスは、ImageNet-100分類、ADE20Kセマンティックセグメンテーション、ハイパーシム単分子深度推定の性能を一貫して改善する。
以上の結果から,ViTの空間誘導バイアスは建築的に注入される必要はなく,訓練時の監督によって形成可能であることが示唆された。
- 参考スコア(独自算出の注目度): 14.844683088763118
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Vision Transformers (ViTs) commonly rely on injected positional mechanisms to address self-attention's permutation invariance. Motivated by the spatial regularities of natural images, we ask whether spatial organization can be induced from data rather than explicitly injected. Under controlled, matched from-scratch training, we propose Active Spatial Guidance (Guidance), a training-only objective that disables positional injection and applies an auxiliary 2D coordinate-regression loss to the final-layer patch tokens. The guidance head is used only during training and removed for inference; the deployed model consists of a positional-injection-free ViT encoder and the task-specific prediction module. Using DINOv3 ViT backbones, Guidance consistently improves performance on ImageNet-100 classification, ADE20K semantic segmentation, and Hypersim monocular depth estimation, outperforming strong injected baselines such as learned absolute positional embeddings and rotary positional embeddings under identical training protocols. On ImageNet-100, broader comparisons against representative injected positional designs further support Guidance's effectiveness. Guidance also improves robustness under resolution transfer, and multi-resolution training further strengthens accuracy across input sizes. Overall, our results suggest that spatial inductive bias in ViTs need not be architecturally injected, but can be shaped through training-time supervision. The code used for training and evaluation is publicly available in https://github.com/cloudlc/asg.
- Abstract(参考訳): 視覚変換器(ViT)は通常、自己アテンションの置換不変性に対処するために注入された位置決め機構に依存している。
自然画像の空間的規則性によって動機づけられた空間的組織は、明示的に注入されるのではなく、データから引き起こされるのかを問う。
そこで本研究では, 位置注入を禁止し, 最終層パッチトークンに補助的な2次元座標回帰損失を付与する, アクティブ空間ガイダンス(Guidance)を提案する。
誘導ヘッドはトレーニング時にのみ使用され、推論のために取り除かれ、デプロイされたモデルは位置注入のないViTエンコーダとタスク固有の予測モジュールで構成される。
DINOv3 ViTのバックボーンを用いて、GuidanceはImageNet-100分類、ADE20Kセマンティックセグメンテーション、ハイパーシム単分子深度推定の性能を一貫して改善し、学習された絶対位置埋め込みや同じトレーニングプロトコル下での回転位置埋め込みなどの強い注入ベースラインよりも優れている。
ImageNet-100では、代表的なインジェクトされた位置設計との比較により、Guidanceの有効性がさらに向上した。
ガイダンスは、解像度転送時の堅牢性も向上し、マルチレゾリューショントレーニングは入力サイズ全体の精度をさらに高める。
以上の結果から,ViTの空間的帰納バイアスは建築的に注入される必要はなく,訓練時の監督によって形成される可能性が示唆された。
トレーニングと評価に使われるコードはhttps://github.com/cloudlc/asg.comで公開されている。
関連論文リスト
- Direct Action-Head Injection of A Grounded 3D Point Unlocks Spatial and Task Generalization [6.3170928681089995]
Vision-Language-Action (VLA)モデルは、柔軟なロボット操作のために大規模な視覚言語事前訓練を利用する。
それらは2つの軸に沿って不安定なままであり、空間的一般化、物体の位置が訓練中に見られるものと異なる場合、タスク一般化、慣れ親しんだシーンと異なる言語命令がペアリングされる場合である。
本稿では、3次元のグラウンド信号を表す軽量なモデルに依存しないモジュールを提案し、グリップへの相対変位を計算し、その結果をアクションヘッドに直接注入する。
論文 参考訳(メタデータ) (2026-06-26T02:44:27Z) - AHPA: Adaptive Hierarchical Prior Alignment for Diffusion Transformers [24.937985157569823]
我々は,信号と雑音の比に応じて,表現監督の有用な粒度が体系的に変化するため,このような時間ステップに依存しないアライメントが最適であると主張する。
ハイノイズでは拡散モデルはより粗い意味とレイアウトレベルのアンカーの恩恵を受けるが、低ノイズでは、トレーニング信号は空間的詳細で構造的に忠実な洗練を強調するべきである。
この非定常アライメント動作は、静的なシングルレベルスーパーバイザーに対する表現ミスマッチを生成する。
論文 参考訳(メタデータ) (2026-05-05T03:07:29Z) - Locality-Attending Vision Transformer [39.7650646299574]
グローバルな自己注意は、セグメンテーションのようなタスクに不可欠な、きめ細かい空間的詳細を曖昧にすることができる。
本稿では,視覚変換器のイメージレベルの認識能力を維持しつつ,セグメンテーションタスクの性能を向上させる,シンプルで効果的なアドオンを提案する。
論文 参考訳(メタデータ) (2026-03-05T07:31:49Z) - Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization [65.37179698521766]
VLA(Vision-Language-Action)モデルは、ジェネラリストロボットの制御を強く約束する。
標準的な「スケールデータ」レシピがロボット工学に翻訳されるかどうかはまだ不明だ。
本稿では,多様なロボットを対象とした事前学習のためのコアトレーニング選択を再考する,VLAスケーリングの体系的かつ制御された研究を提案する。
論文 参考訳(メタデータ) (2026-02-10T12:25:43Z) - GTransPDM: A Graph-embedded Transformer with Positional Decoupling for Pedestrian Crossing Intention Prediction [5.647541727494757]
GTransPDMは多モード特徴を利用した歩行者横断意図予測のために開発された。
PIEデータセットでは92%の精度で、JAADデータセットでは87%の精度で処理速度は0.05msである。
論文 参考訳(メタデータ) (2024-09-30T12:02:17Z) - Location-Aware Self-Supervised Transformers [74.76585889813207]
画像部品の相対的な位置を予測し,セマンティックセグメンテーションのためのネットワークを事前訓練する。
参照パッチのサブセットを問合せのサブセットにマスキングすることで,タスクの難しさを制御します。
実験により,この位置認識事前学習が,いくつかの難解なセマンティックセグメンテーションベンチマークに競合する表現をもたらすことが示された。
論文 参考訳(メタデータ) (2022-12-05T16:24:29Z) - Distributed Adversarial Training to Robustify Deep Neural Networks at
Scale [100.19539096465101]
現在のディープニューラルネットワーク(DNN)は、入力に対する敵の摂動が分類を変更したり操作したりする敵の攻撃に対して脆弱である。
このような攻撃を防御するために、敵の訓練(AT)として知られる効果的なアプローチが、堅牢な訓練を緩和するために示されている。
複数のマシンにまたがって実装された大規模バッチ対逆トレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2022-06-13T15:39:43Z) - Stagewise Unsupervised Domain Adaptation with Adversarial Self-Training
for Road Segmentation of Remote Sensing Images [93.50240389540252]
リモートセンシング画像からの道路セグメンテーションは、幅広い応用可能性を持つ課題である。
本稿では,この領域における領域シフト(DS)問題に対処するため,RoadDAと呼ばれる新たな段階的ドメイン適応モデルを提案する。
2つのベンチマーク実験の結果、RoadDAはドメインギャップを効率的に減らし、最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2021-08-28T09:29:14Z) - Adjoint Rigid Transform Network: Task-conditioned Alignment of 3D Shapes [86.2129580231191]
Adjoint Rigid Transform (ART) Networkは、さまざまな3Dネットワークと統合可能なニューラルネットワークモジュールである。
ARTは入力の形状を学習した標準方向に回転させることを学び、多くのタスクに欠かせない。
さらなる研究のために、コードと事前訓練されたモデルをリリースします。
論文 参考訳(メタデータ) (2021-02-01T20:58:45Z) - Understanding Self-Training for Gradual Domain Adaptation [107.37869221297687]
段階的なドメイン適応は、対象領域へ徐々にシフトするラベルのないデータのみを与えられたソースドメインで訓練された初期分類器を適応させることが目的である。
目標領域への直接適応が非有界誤差をもたらすような設定下において、段階的なシフトを伴う自己学習の誤差に対する最初の非無空上界を証明した。
この理論解析はアルゴリズムの洞察を導き、無限のデータを持つ場合でも正規化とラベルのシャープ化が不可欠であることを強調し、より小さなワッサーシュタイン無限距離のシフトに対して自己学習が特にうまく働くことを示唆している。
論文 参考訳(メタデータ) (2020-02-26T08:59:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。