論文の概要: Efficient Equivariant Transformer for Self-Driving Agent Modeling
- arxiv url: http://arxiv.org/abs/2604.01466v1
- Date: Wed, 01 Apr 2026 23:20:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-03 14:21:10.100953
- Title: Efficient Equivariant Transformer for Self-Driving Agent Modeling
- Title(参考訳): 自律型エージェントモデリングのための効率的な等価変圧器
- Abstract要約: DriveGATrは、エージェントモデリングのためのトランスフォーマーベースのアーキテクチャである。
既存の手法の計算コストを使わずにSE(2)-等分散を実現する。
DriveGATrは、交通シミュレーションにおける最先端技術に匹敵する。
- 参考スコア(独自算出の注目度): 23.858855004235128
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Accurately modeling agent behaviors is an important task in self-driving. It is also a task with many symmetries, such as equivariance to the order of agents and objects in the scene or equivariance to arbitrary roto-translations of the entire scene as a whole; i.e., SE(2)-equivariance. The transformer architecture is a ubiquitous tool for modeling these symmetries. While standard self-attention is inherently permutation equivariant, explicit pairwise relative positional encodings have been the standard for introducing SE(2)-equivariance. However, this approach introduces an additional cost that is quadratic in the number of agents, limiting its scalability to larger scenes and batch sizes. In this work, we propose DriveGATr, a novel transformer-based architecture for agent modeling that achieves SE(2)-equivariance without the computational cost of existing methods. Inspired by recent advances in geometric deep learning, DriveGATr encodes scene elements as multivectors in the 2D projective geometric algebra $\mathbb{R}^*_{2,0,1}$ and processes them with a stack of equivariant transformer blocks. Crucially, DriveGATr models geometric relationships using standard attention between multivectors, eliminating the need for costly explicit pairwise relative positional encodings. Experiments on the Waymo Open Motion Dataset demonstrate that DriveGATr is comparable to the state-of-the-art in traffic simulation and establishes a superior Pareto front for performance vs computational cost.
- Abstract(参考訳): エージェントの動作を正確にモデル化することは、自動運転において重要な課題である。
また、シーン内のエージェントやオブジェクトの順序に等しく、シーン全体の任意のロト変換に等しく、SE(2)-等分散といった多くの対称性を持つタスクでもある。
トランスフォーマーアーキテクチャは、これらの対称性をモデリングするためのユビキタスなツールである。
標準自己アテンションは本質的に置換同変であるが、明示的なペアワイズ相対的な位置エンコーディングはSE(2)-等分散を導入するための標準となっている。
しかし、このアプローチはエージェントの数に二次的な追加コストを導入し、スケーラビリティをより大きなシーンとバッチサイズに制限する。
本稿では,既存の手法の計算コストを伴わずにSE(2)-等価性を実現する,エージェントモデリングのための新しいトランスフォーマーベースアーキテクチャであるDriveGATrを提案する。
幾何学的深層学習の最近の進歩に触発されて、DriveGATr は2次元射影幾何学代数 $\mathbb{R}^*_{2,0,1}$ においてシーン要素を多ベクトルとして符号化し、同変変変圧器ブロックのスタックでそれらを処理した。
重要なことは、DriveGATrは、多ベクトル間の標準的な注意力を用いて幾何学的関係をモデル化し、コストがかかるペアワイドな相対的な位置エンコーディングの必要性を排除している。
Waymo Open Motion Datasetの実験では、DriveGATrはトラフィックシミュレーションの最先端と同等であり、パフォーマンスと計算コストの面で優れたParetoフロントを確立している。
関連論文リスト
- A Unified Framework for Vision Transformers Equivariant to Discrete Subgroups of $\mathrm{O}(2)$ [8.549379020585462]
我々は、$mathrmO(2)$の任意の離散部分群に同値な視覚変換器の族を導入する。
私たちの構成では、コアトランスコンポーネントの同変アナログと、結果の層に対する表現性保証が得られます。
論文 参考訳(メタデータ) (2026-06-26T09:05:47Z) - Revisiting Padded Transformer Expressivity: Which Architectural Choices Matter and Which Don't [78.36679389968772]
パッド付き$textL$ constantprecision transformerは、表現性に対して驚くほど堅牢である。
glogd-looped constant-precision transformer reach $textFO-uniform TCd$, growing-precision transformer reach $textFO-uniform TCd$
論文 参考訳(メタデータ) (2026-05-28T19:58:43Z) - AOT-POT: Adaptive Operator Transformation for Large-Scale PDE Pre-training [50.28798360093496]
複雑で多様な解演算子をよりシンプルで、より整合性の高い形式に変換し、共同でモデリングしやすくすることを提案する。
我々はこのアイデアをAOT-POT (adaptive operator-transformation for pre-training operator transformer) としてインスタンス化し、隠れ表現を複数の並列ストリームに拡張する。
AOT-POTは、3%の追加パラメータを持つ12のPDEベンチマークで最先端のパフォーマンスを実現し、相対的なL2エラーを77.6%削減した(平均40.9%)。
論文 参考訳(メタデータ) (2026-05-15T09:50:34Z) - Platonic Transformers: A Solid Choice For Equivariance [25.29042615187704]
このトレードオフを解決するために、Platonic Transformerを導入します。
プラトンソリッド対称性群から参照フレームに対する注意を定義することにより、本手法は原則的重み共有スキームを導出する。
この注意は、動的群畳み込みと正式に等価であることを示し、モデルが適応的幾何フィルタを学習していることを明らかにする。
論文 参考訳(メタデータ) (2025-10-03T20:51:25Z) - Clebsch-Gordan Transformer: Fast and Global Equivariant Attention [19.720202550140325]
我々はClebsch-Gordon Transformerを提案し、新しいClebsch-Gordon Convolutionを$SO(3)$の既約表現で実現した。
提案手法は,O(N log N)$入力トークンの複雑さを達成しつつ,任意の順序で特徴の同変モデリングを可能にする。
提案手法は,n体シミュレーション,QM9,ModelNet点クラウド分類,ロボットによる把握データセットなど,さまざまなベンチマークでベンチマークを行う。
論文 参考訳(メタデータ) (2025-09-28T22:09:36Z) - Linear Memory SE(2) Invariant Attention [8.734687343991364]
本稿では,シーン内のオブジェクト数に対して線形メモリを必要とするSE(2)不変スケールドット積注意機構を提案する。
我々のアプローチは、同等の非不変アーキテクチャと比較して実装し、性能を改善します。
論文 参考訳(メタデータ) (2025-07-24T17:28:57Z) - seq-JEPA: Autoregressive Predictive Learning of Invariant-Equivariant World Models [1.474723404975345]
本稿では,協調埋め込み型予測アーキテクチャにアーキテクチャバイアスを導入する世界モデリングフレームワークSeq-JEPAを提案する。
Seq-JEPA は2つのアーキテクチャ的に分離された表現を同時に学習する。
行動間の経路統合や眼球運動間の予測学習など、本質的に一連の観察を必要とするタスクに優れています。
論文 参考訳(メタデータ) (2025-05-06T04:39:11Z) - Transformers as Support Vector Machines [54.642793677472724]
自己アテンションの最適化幾何と厳密なSVM問題との間には,形式的等価性を確立する。
勾配降下に最適化された1層変圧器の暗黙バイアスを特徴付ける。
これらの発見は、最適なトークンを分離し選択するSVMの階層としてのトランスフォーマーの解釈を刺激していると信じている。
論文 参考訳(メタデータ) (2023-08-31T17:57:50Z) - Isomer: Isomerous Transformer for Zero-shot Video Object Segmentation [59.91357714415056]
コンテクスト共有変換器(CST)とセマンティックガザリング散乱変換器(SGST)の2つの変種を提案する。
CSTは、軽量な計算により、画像フレーム内のグローバル共有コンテキスト情報を学習し、SGSTは、前景と背景のセマンティック相関を別々にモデル化する。
多段核融合にバニラ変換器を使用するベースラインと比較して,我々は13倍の速度向上を実現し,新しい最先端ZVOS性能を実現する。
論文 参考訳(メタデータ) (2023-08-13T06:12:00Z) - The Lie Derivative for Measuring Learned Equivariance [84.29366874540217]
我々は、CNN、トランスフォーマー、ミキサーアーキテクチャにまたがる数百の事前訓練されたモデルの同値性について検討する。
その結果,不等式違反の多くは,不等式などのユビキタスネットワーク層における空間エイリアスに関連付けられることがわかった。
例えば、トランスはトレーニング後の畳み込みニューラルネットワークよりも同種である。
論文 参考訳(メタデータ) (2022-10-06T15:20:55Z) - Frame Averaging for Invariant and Equivariant Network Design [50.87023773850824]
フレーム平均化(FA)は、既知の(バックボーン)アーキテクチャを新しい対称性タイプに不変あるいは同変に適応するためのフレームワークである。
FAモデルが最大表現力を持つことを示す。
我々は,新しいユニバーサルグラフニューラルネット(GNN),ユニバーサルユークリッド運動不変点クラウドネットワーク,およびユークリッド運動不変メッセージパッシング(MP)GNNを提案する。
論文 参考訳(メタデータ) (2021-10-07T11:05:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。