論文の概要: REViT-v2: Hierarchical Windowed Roto-reflection Equivariant ViT for Equivariant Feature Extraction
- arxiv url: http://arxiv.org/abs/2610.07585v1
- Date: Tue, 06 Oct 2026 01:23:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.743831
- Title: REViT-v2: Hierarchical Windowed Roto-reflection Equivariant ViT for Equivariant Feature Extraction
- Title(参考訳): REViT-v2: 等変特徴抽出のための階層型ウィンドウ付きロト反射同変ViT
- Abstract要約: ウィンドウ化されたグループ・畳み込み自己注意に基づくスケーラブルなロト・リフレクション・グループ・等価な視覚変換器を提案する。
我々の手法は、数百万のパラメータと大きなデータセットを持つグループ同変視覚変換器(ViT)に拡張可能であることを実証する。
- 参考スコア(独自算出の注目度): 1.267655246219136
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We propose a scalable roto-reflection-group-equivariant vision transformer based on windowed group-convolutional self-attention and a hierarchical feature architecture. We demonstrate that our approach can be scaled to group-equivariant vision transformers (ViTs) with millions of parameters and large datasets with practically sized images, i.e., ImageNet. The code and pretrained weights for the proposed Hierarchical Windowed Roto-reflection Equivariant ViTs (REViT-v2) are available at https://github.com/kc-ml2/revit.
- Abstract(参考訳): ウィンドウ付きグループ畳み込み自己アテンションと階層的特徴アーキテクチャに基づくスケーラブルなロト・リフレクション・グループ同変視覚変換器を提案する。
我々は,この手法を,数百万のパラメータを持つグループ同種視覚変換器(ViT)や,事実上の大きさのイメージを持つ大規模データセット,すなわちImageNetに拡張できることを実証した。
Hierarchical Windowed Roto-reflection Equivariant ViTs (REViT-v2)のコードはhttps://github.com/kc-ml2/revitで公開されている。
関連論文リスト
- EA-ViT: Efficient Adaptation for Elastic Vision Transformer [37.442677800641164]
ビジョントランスフォーマー(ViT)は、コンピュータビジョンの基礎モデルとして登場し、下流タスクへの一般化と適応性に優れている。
多様なリソース制約をサポートするためにViTをデプロイするには、通常、複数のサイズ固有のViTを再トレーニングする必要がある。
資源制約の異なるプラットフォーム上でのデプロイにおいて,単一のプロセスでさまざまなサイズで複数のモデルを生成することが可能な,効率的なViT適応フレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-25T15:11:09Z) - Slicing Vision Transformer for Flexible Inference [79.35046907288518]
一つのネットワークが複数の小さな ViT を表現できるように,Scala という名前の汎用フレームワークを提案する。
S Scalaは、パラメータが少ないImageNet-1Kで平均1.6%の改善を実現している。
論文 参考訳(メタデータ) (2024-12-06T05:31:42Z) - Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures [96.00848293994463]
本稿では、NLPフィールドで使用されるRWKVモデルから適応したVision-RWKVを紹介する。
我々のモデルは、スパース入力を効率的に処理し、ロバストなグローバル処理能力を実証するために設計されている。
評価の結果,VRWKVは画像分類におけるViTの性能を超え,高速化とメモリ使用量の削減を図っている。
論文 参考訳(メタデータ) (2024-03-04T18:46:20Z) - Vision Transformer with Quadrangle Attention [76.35955924137986]
窓面に基づく注意を一般的な四角形定式化に拡張する新しい四角形注意法(QA)を提案する。
提案手法では,既定のウィンドウを対象の四角形に変換するために,変換行列を予測し,エンドツーエンドで学習可能な四角形回帰モジュールを用いる。
QAをプレーンかつ階層的な視覚変換器に統合し、QFormerという名の新しいアーキテクチャを作成します。
論文 参考訳(メタデータ) (2023-03-27T11:13:50Z) - S2WAT: Image Style Transfer via Hierarchical Vision Transformer using
Strips Window Attention [19.42715085294994]
本稿では,スタイル転送用に設計された新しい階層型視覚変換器であるStrips Window Attention Transformer (S2WAT)を紹介する。
S2WATは、ショートレンジとロングレンジの両方の依存関係をキャプチャするために、様々なウィンドウ形状の注意計算を使用する。
論文 参考訳(メタデータ) (2022-10-22T07:56:13Z) - Adaptive Transformers for Robust Few-shot Cross-domain Face
Anti-spoofing [71.06718651013965]
我々は、堅牢なクロスドメイン顔アンチスプーフィングのための適応型視覚変換器(ViT)を提案する。
私たちはVTをバックボーンとして採用し、その強度を利用して画素間の長距離依存を考慮します。
いくつかのベンチマークデータセットの実験では、提案されたモデルが堅牢かつ競合的なパフォーマンスを達成することが示されている。
論文 参考訳(メタデータ) (2022-03-23T03:37:44Z) - ViTAEv2: Vision Transformer Advanced by Exploring Inductive Bias for
Image Recognition and Beyond [76.35955924137986]
我々は、内在性IBを畳み込み、すなわちViTAEから探索するビジョントランスフォーマーを提案する。
ViTAEはいくつかの空間ピラミッド縮小モジュールを備えており、入力イメージをリッチなマルチスケールコンテキストでトークンに埋め込む。
我々は、ImageNet検証セット上で88.5%のTop-1分類精度と、ImageNet実検証セット上で最高の91.2%のTop-1分類精度を得る。
論文 参考訳(メタデータ) (2022-02-21T10:40:05Z) - ViTAE: Vision Transformer Advanced by Exploring Intrinsic Inductive Bias [76.16156833138038]
コンボリューション, ie, ViTAEから内在性IBを探索するビジョントランスフォーマーを提案する。
ViTAEはいくつかの空間ピラミッド縮小モジュールを備えており、入力イメージをリッチなマルチスケールコンテキストでトークンに埋め込む。
各トランス層では、ViTAEはマルチヘッド自己保持モジュールと平行な畳み込みブロックを持ち、その特徴は融合されフィードフォワードネットワークに供給される。
論文 参考訳(メタデータ) (2021-06-07T05:31:06Z) - CvT: Introducing Convolutions to Vision Transformers [44.74550305869089]
畳み込み視覚変換器(CvT)は、視覚変換器(ViT)の性能と効率を向上する。
新しいアーキテクチャはViTに畳み込み、両方の設計で最高のものを生み出す。
論文 参考訳(メタデータ) (2021-03-29T17:58:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。