論文の概要: A Unified Framework for Vision Transformers Equivariant to Discrete Subgroups of $\mathrm{O}(2)$
- arxiv url: http://arxiv.org/abs/2606.27864v2
- Date: Mon, 29 Jun 2026 08:45:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 15:56:39.063112
- Title: A Unified Framework for Vision Transformers Equivariant to Discrete Subgroups of $\mathrm{O}(2)$
- Title(参考訳): 視覚変換器の統一フレームワークは$\mathrm{O}(2)$の部分群を離散化する
- Authors: Tīkun Ông, Georg Bökman,
- Abstract要約: 我々は、$mathrmO(2)$の任意の離散部分群に同値な視覚変換器の族を導入する。
私たちの構成では、コアトランスコンポーネントの同変アナログと、結果の層に対する表現性保証が得られます。
- 参考スコア(独自算出の注目度): 8.549379020585462
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision transformers have become a dominant architecture for visual recognition. However, standard models do not explicitly encode the planar symmetries that arise in many vision domains. We introduce a family of vision transformers equivariant to arbitrary discrete subgroups of $\mathrm{O}(2)$, providing a unified framework that generalizes prior flipping- and $D_4$-equivariant transformer architectures. Our construction yields equivariant analogues of the core transformer components, together with expressivity guarantees for the resulting layers. In particular, we show that whenever $H \le G$, the class of $G$-equivariant ViTs embeds naturally into the class of $H$-equivariant ViTs. We also prove that, in the single-head setting, the corresponding equivariant self-attention layer realizes every $G$-equivariant self-attention map representable by ordinary self-attention. We further construct a $D_6$-equivariant model based on hexagonal patches, making the architecture compatible with six-fold rotational symmetries. We evaluate the resulting models on the PatternNet aerial image dataset in artificially data-scarce regimes across subgroups of $D_4$ and $D_6$. Our experiments compare two equivariant attention mechanisms and analyze how the choice of homogeneous-space configurations used in the nonlinearities affects performance. Preliminary results under matched parameter budgets indicate that equivariance can improve recognition accuracy, motivating further study of how discrete symmetry groups shape transformer-based visual recognition models.
- Abstract(参考訳): 視覚変換器は視覚認識において支配的なアーキテクチャとなっている。
しかし、標準的なモデルは、多くの視覚領域で生じる平面対称性を明示的に符号化していない。
視覚変換器の族を$\mathrm{O}(2)$の任意の離散部分群に同型とし、事前のフリップと$D_4$-同変変換器アーキテクチャを一般化する統一的なフレームワークを提供する。
我々の構成では、コアトランスコンポーネントの同変アナログと、結果の層に対する表現性保証が得られる。
特に、$H \le G$ が成り立つと、$G$-equivariant ViTs のクラスは自然に$H$-equivariant ViTs のクラスに埋め込まれる。
また、単頭部設定において、対応する同変自己アテンション層は、通常の自己アテンションで表現可能なすべての$G$-同変自己アテンション写像を実現する。
さらに、ヘキサゴナルパッチに基づくD_6$-equivariantモデルを構築し、アーキテクチャを6倍回転対称性に適合させる。
本研究では,D_4$とD_6$のサブグループにまたがる人工データスカースシステムにおいて,PatternNet空中画像データセット上で得られたモデルを評価する。
実験では,2つの同変アテンション機構を比較し,非線形性における均質空間構成の選択が性能に与える影響を解析した。
一致したパラメータ予算の下での予備的な結果は、等分散が認識精度を向上させることを示し、離散対称性群がどのようにトランスフォーマーに基づく視覚認識モデルを形成するかのさらなる研究を動機付けている。
関連論文リスト
- On the Equivariant Learning of the $Q$-tensor Order Parameter [0.7734726150561086]
ネマティック液晶の2次元$Q$-tensor次数パラメータの予測のためのグループ同変ニューラルネットワークの構築と評価を行う。
等変モデルは低い誤差を一貫して達成し、より堅牢に欠陥構成を一般化する。
論文 参考訳(メタデータ) (2026-05-26T20:54:38Z) - Any-Subgroup Equivariant Networks via Symmetry Breaking [47.72921214239821]
均質なアーキテクチャは、通常非常に制約があり、事前に選択された対称性のために設計されます。
これにより、多様なデータを均等に処理できるフレキシブルでマルチモーダルな基礎モデルの開発が妨げられる。
特定の補助入力特徴を変調することによって、複数の群に同時に同値な単一モデルを構築する。
論文 参考訳(メタデータ) (2026-03-19T21:30:41Z) - Generalized Linear Mode Connectivity for Transformers [87.32299363530996]
驚くべき現象はリニアモード接続(LMC)であり、独立に訓練されたモデルを低損失またはゼロ損失の経路で接続することができる。
以前の研究は主に置換によるニューロンの並べ替えに焦点を合わせてきたが、そのようなアプローチは範囲に限られている。
我々は、4つの対称性クラス(置換、半置換、変換、一般可逆写像)をキャプチャする統一的なフレームワークを導入する。
この一般化により、独立に訓練された視覚変換器とGPT-2モデルの間の低障壁とゼロバリア線形経路の発見が可能となった。
論文 参考訳(メタデータ) (2025-06-28T01:46:36Z) - Transformers as Support Vector Machines [54.642793677472724]
自己アテンションの最適化幾何と厳密なSVM問題との間には,形式的等価性を確立する。
勾配降下に最適化された1層変圧器の暗黙バイアスを特徴付ける。
これらの発見は、最適なトークンを分離し選択するSVMの階層としてのトランスフォーマーの解釈を刺激していると信じている。
論文 参考訳(メタデータ) (2023-08-31T17:57:50Z) - Learning Probabilistic Symmetrization for Architecture Agnostic Equivariance [16.49488981364657]
群対称性を持つ学習関数における同変アーキテクチャの限界を克服する新しい枠組みを提案する。
我々は、不変量や変圧器のような任意の基底モデルを使用し、それを与えられた群に同変するように対称性付けする。
実証実験は、調整された同変アーキテクチャに対する競争結果を示す。
論文 参考訳(メタデータ) (2023-06-05T13:40:54Z) - Frame Averaging for Invariant and Equivariant Network Design [50.87023773850824]
フレーム平均化(FA)は、既知の(バックボーン)アーキテクチャを新しい対称性タイプに不変あるいは同変に適応するためのフレームワークである。
FAモデルが最大表現力を持つことを示す。
我々は,新しいユニバーサルグラフニューラルネット(GNN),ユニバーサルユークリッド運動不変点クラウドネットワーク,およびユークリッド運動不変メッセージパッシング(MP)GNNを提案する。
論文 参考訳(メタデータ) (2021-10-07T11:05:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。