論文の概要: REViT: Roto-reflection Equivariant Convolutional Vision Transformer
- arxiv url: http://arxiv.org/abs/2606.25318v1
- Date: Wed, 24 Jun 2026 02:32:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.192755
- Title: REViT: Roto-reflection Equivariant Convolutional Vision Transformer
- Title(参考訳): REViT: Roto-reflection Equivariant Convolutional Vision Transformer
- Abstract要約: 畳み込み注意を伴う離散ロト・リフレクション群同変視覚変換器を提案する。
回転反射同変ネットワークは、特徴写像における回転対称性、フリップ対称性、位置対称性を保持する。
- 参考スコア(独自算出の注目度): 42.698418800007865
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In this paper, we propose a discrete roto-reflection group equivariant vision transformer with convolutional attention. Roto-reflection equivariant networks preserve the rotational, flip and positional symmetry in feature maps, making them useful for tasks where orientation of the inputs is relevant to the model outputs. In image classification and object detection, most of the studies on roto-reflection equivariant models have focused on using convolutional neural networks rather than vision transformers. In this paper, we examine the challenges involved in achieving equivariance in vision transformers, and we propose a simpler way to implement a discretized roto-reflection group equivariant vision transformer. The experimental results demonstrate that our approach outperforms the existing approaches for developing discrete roto-reflection group equivariant neural networks for image classification.
- Abstract(参考訳): 本稿では、畳み込み注意を伴う離散ロト反射群同変視覚変換器を提案する。
回転反射同変ネットワークは特徴写像の回転対称性、フリップ対称性、位置対称性を保ち、入力の向きがモデル出力に関係するタスクに有用である。
画像分類と物体検出において、ロト・リフレクション同変モデルの研究の多くは、視覚変換器ではなく畳み込みニューラルネットワークを使うことに重点を置いている。
本稿では,視覚変換器の等価性を実現する上での課題について検討し,離散化ロト・リフレクション群同変視覚変換器の実装方法を提案する。
実験により,本手法は画像分類のための離散ロト反射群同変ニューラルネットワークの開発において,既存の手法よりも優れていることが示された。
関連論文リスト
- Equi-ViT: Rotational Equivariant Vision Transformer for Robust Histopathology Analysis [4.388994056961038]
等価な畳み込みカーネルをViTアーキテクチャのパッチ埋め込みステージに統合するEqui-ViTを提案する。
Equi-ViTは、画像の向きによって、良好な回転整合パッチ埋め込みと安定した分類性能を実現する。
論文 参考訳(メタデータ) (2026-01-14T04:03:20Z) - Understanding Transformer-based Vision Models through Inversion [0.8124699127636158]
本研究では,本手法のより効率的な適用を可能にする新しいモジュラー変動を導入することにより,特徴の逆転を再考する。
本研究では,大規模変換器を用いた視覚モデル,検出変換器,視覚変換器に対して,我々の手法を体系的に適用する方法を実証する。
我々の分析では、これらのモデルがどのようにコンテキスト形状と画像の詳細をエンコードするか、それらの層がどのように相関し、色摂動に対する堅牢性を示す。
論文 参考訳(メタデータ) (2024-12-09T14:43:06Z) - PseudoNeg-MAE: Self-Supervised Point Cloud Learning using Conditional Pseudo-Negative Embeddings [55.55445978692678]
PseudoNeg-MAEは、ポイントクラウドマスマスキングオートエンコーダのグローバルな特徴表現を強化する。
本研究では,ネットワークが識別的表現を保ちながら,よりリッチな変換キューをキャプチャできる新たな損失を提案する。
論文 参考訳(メタデータ) (2024-09-24T07:57:21Z) - Learning Rotation-Equivariant Features for Visual Correspondence [41.79256655501003]
本稿では,識別的回転不変記述子を抽出する自己教師型学習フレームワークを提案する。
グループ同変CNNを利用することで、回転同変の特徴とその配向を効果的に学習する。
本手法は,既存の回転不変ディスクリプタ間で,回転の異なる状態のマッチング精度を示す。
論文 参考訳(メタデータ) (2023-03-25T13:42:07Z) - Image Deblurring by Exploring In-depth Properties of Transformer [86.7039249037193]
我々は、事前訓練された視覚変換器(ViT)から抽出した深い特徴を活用し、定量的な測定値によって測定された性能を犠牲にすることなく、回復した画像のシャープ化を促進する。
得られた画像と対象画像の変換器特徴を比較することにより、事前学習された変換器は、高解像度のぼやけた意味情報を提供する。
特徴をベクトルとみなし、抽出された画像から抽出された表現とユークリッド空間における対象表現との差を計算する。
論文 参考訳(メタデータ) (2023-03-24T14:14:25Z) - Self-Supervised Learning for Group Equivariant Neural Networks [75.62232699377877]
群同変ニューラルネットワーク(英: Group equivariant Neural Network)は、入力の変換で通勤する構造に制限されたモデルである。
自己教師型タスクには、同変プリテキストラベルと異変コントラスト損失という2つの概念を提案する。
標準画像認識ベンチマークの実験では、同変ニューラルネットワークが提案された自己教師型タスクを利用することを示した。
論文 参考訳(メタデータ) (2023-03-08T08:11:26Z) - SPIN: Simplifying Polar Invariance for Neural networks Application to
vision-based irradiance forecasting [2.624902795082451]
画像の極座標への展開は、畳み込みアーキテクチャを訓練するためのより明示的な表現を提供する。
この前処理ステップはシーン表現の標準化によって予測結果を大幅に改善することを示す。
この変換は回転の中心を取り巻く領域を拡大し、より正確な短期照射予測をもたらす。
論文 参考訳(メタデータ) (2021-11-29T12:58:57Z) - Deformation Robust Roto-Scale-Translation Equivariant CNNs [10.44236628142169]
グループ同変畳み込みニューラルネットワーク(G-CNN)は,固有対称性を持つ一般化性能を著しく向上させる。
G-CNNの一般的な理論と実践的実装は、回転またはスケーリング変換の下での平面画像に対して研究されている。
論文 参考訳(メタデータ) (2021-11-22T03:58:24Z) - Topographic VAEs learn Equivariant Capsules [84.33745072274942]
本稿では, 地理的に整理された潜伏変数を用いた深部生成モデルを効率的に学習するための新しい手法であるTopographic VAEを紹介する。
このようなモデルでは,MNIST上での桁数クラス,幅,スタイルなどの健全な特徴に応じて,その活性化を組織化することが実際に学べることが示される。
我々は、既存の群同変ニューラルネットワークの能力を拡張して、複素変換に近似した同値性を示す。
論文 参考訳(メタデータ) (2021-09-03T09:25:57Z) - Generalizing Convolutional Neural Networks for Equivariance to Lie
Groups on Arbitrary Continuous Data [52.78581260260455]
任意の特定のリー群からの変換に同値な畳み込み層を構築するための一般的な方法を提案する。
同じモデルアーキテクチャを画像、ボール・アンド・スティック分子データ、ハミルトン力学系に適用する。
論文 参考訳(メタデータ) (2020-02-25T17:40:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。