論文の概要: Journey Operators for Structured Multi-Axis Composition
- arxiv url: http://arxiv.org/abs/2607.26775v1
- Date: Wed, 29 Jul 2026 11:14:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.650221
- Title: Journey Operators for Structured Multi-Axis Composition
- Title(参考訳): 構造化多軸合成のための航法演算子
- Authors: Mahesh Godavarti,
- Abstract要約: 独立軸全体では、組成も運動も軸の順序に依存してはならない。
この種の多軸構造をモデル化するためのフレームワークを開発する。
これらのパスが適切に定義されたタイミングを正確に示す。
また、記述されたToral-frame対称性、コサイクル、双線型性、ノルム保存仮定の下では、結果として得られるペアのスコアリング規則がブロックワイズ回転の形式をとる必要があることを証明している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Many kinds of data have structure along one or more axes: words in a sentence, pixels in an image, nodes in a tree, frames in audio, or cells in a 3D volume. Along one axis, order matters: "the dog bit the man" is different from "the man bit the dog." Across independent axes, however, neither composition nor movement should depend on the order of axes: in an image, composing right then down should give the same result as composing down then right, and moving right then down should describe the same relative position as moving down then right. We develop a framework for modeling this kind of multi-axis structure. Each data item carries its content together with a small transformation for each axis. A path connecting two positions defines a journey; the journey operator is the product of per-axis transformations along that path, governing both how data composes along the path and how relative position is described. When the transformations are fixed, our framework recovers Rotary Position Embedding (RoPE) and its multi-dimensional variants. When they depend on the data, the model gains a content-adaptive positional inductive bias. We show exactly when these paths are well-defined: both composition and movement across axes are path-independent precisely when the axis transformations commute. We also prove that, under the stated toral-frame symmetry, cocycle, bilinearity, and norm-preservation assumptions, the resulting pairwise scoring rule must take the form of block-wise rotations, explaining why RoPE-like methods arise naturally. Finally, we use this theory to design JoFormer, a model for value aggregation, and relate it to attention and state-space models (SSMs). Initial experiments across vision, language, and length generalization suggest that these inductive biases can have observable consequences in practice.
- Abstract(参考訳): テキスト中の単語、画像中のピクセル、ツリー内のノード、オーディオ中のフレーム、あるいは3Dボリュームのセルなどです。
ある軸に沿って、順序は重要:「犬は男を噛んだ」が「男は犬を噛んだ」と異なる。
しかし、独立した軸全体では、構成や運動は軸の順序に依存してはならない:画像では、右に作曲するときに右に作曲するのと同じ結果を与え、右に動くときは右に移動するのと同じ相対的な位置を記述するべきである。
この種の多軸構造をモデル化するためのフレームワークを開発する。
各データ項目は、各軸の小さな変換とともに内容を運ぶ。
経路演算子は、その経路に沿ってデータがどのように構成され、どのように相対的な位置が記述されるかを定義する。
変換が固定された場合、我々のフレームワークはロータリー位置埋め込み(RoPE)とその多次元変種を復元する。
データに依存すると、そのモデルはコンテンツ適応的な位置誘導バイアスを得る。
軸間の合成と運動は、軸変換が可換であるときに正確にパス非依存である。
また、記述されたトラルフレーム対称性、コサイクル、双線型性、ノルム保存仮定の下では、結果として得られるペアのスコアリング規則がブロックワイズ回転の形式を採り、なぜRoPEのような手法が自然に生じるのかを説明する必要がある。
最後に、この理論を用いて、価値集約のモデルであるJoFormerを設計し、注意と状態空間モデル(SSM)に関連付ける。
視覚、言語、長さの一般化に関する最初の実験は、これらの誘導バイアスが実際に観測可能な結果をもたらすことを示唆している。
関連論文リスト
- From Self-Attention to Connection Laplacian: A Unified Operator View of Transformers [53.505136935517925]
自己注意は現代のシーケンスモデルにおいてユビキタスプリミティブであるが、作用素レベルの幾何学は部分的には理解されていない。
単頭注意 (SHA) は, 常に搬送される接続伝播ステップであることを示す。
トレーニングされたトランスフォーマー(124Mから8B)と構造(エンコーダ/デコーダ)は、我々の理論と整合した幾何学的構造を示す。
論文 参考訳(メタデータ) (2026-07-12T09:44:54Z) - MoCapAnything V2: End-to-End Motion Capture for Arbitrary Skeletons [56.68975315643491]
本稿では,ビデオ・ツー・ローテーションとビデオ・ツー・ローテーションを共同で学習し,最適化する,最初のエンドツーエンドフレームワークを提案する。
本手法は, メッシュベースパイプラインの20倍の速度で, 回転誤差を17度から10度, 見えない骨格では6.54度に低減する。
論文 参考訳(メタデータ) (2026-04-30T17:16:38Z) - The Curved Spacetime of Transformer Architectures [0.3670422696827525]
本稿では,トランスフォーマーに基づく言語モデルを理解するための幾何学的枠組みを提案する。
トークン埋め込みは特徴空間の直線経路を横切るべきではないことを示し、代わりに、それらの層回りのステップは、空間曲率の埋め込みによって媒介される相互作用として屈曲し、順応するべきである。
論文 参考訳(メタデータ) (2025-11-04T22:58:40Z) - Moment kernels: a simple and scalable approach for equivariance to rotations and reflections in deep convolutional networks [0.0]
この同値性は、単純な畳み込みカーネルを用いて達成可能であることを示す。
標準畳み込みモジュールを用いて同変ニューラルネットワークを実装した。
論文 参考訳(メタデータ) (2025-05-27T20:27:00Z) - Orthonormal Convolutions for the Rotation Based Iterative
Gaussianization [64.44661342486434]
本稿では、画像ガウス化を可能にする回転型反復ガウス化RBIGの拡張について詳述する。
RBIGの回転は主成分分析や独立成分分析に基づくため、画像では小さな画像パッチや孤立画素に制限されている。
emphConvolutional RBIG:この問題を緩和する拡張として,RBIGの回転が畳み込みであることを示す。
論文 参考訳(メタデータ) (2022-06-08T12:56:34Z) - HDGT: Heterogeneous Driving Graph Transformer for Multi-Agent Trajectory
Prediction via Scene Encoding [76.9165845362574]
運転シーンをノードやエッジの異なる異種グラフとしてモデル化するバックボーンを提案する。
空間的関係符号化では、ノードの座標とエッジの座標は局所ノード中心座標系に含まれる。
実験結果から,HDGTは軌道予測のタスクに対して最先端の性能を達成することが示された。
論文 参考訳(メタデータ) (2022-04-30T07:08:30Z) - Symmetry-driven graph neural networks [1.713291434132985]
ノード座標に影響を及ぼすいくつかの変換に同値なグラフネットワークアーキテクチャを2つ導入する。
我々はこれらの機能を$n$次元の幾何学的オブジェクトからなる合成データセット上で実証する。
論文 参考訳(メタデータ) (2021-05-28T18:54:12Z) - Learning Equivariant Representations [10.745691354609738]
畳み込みニューラルネットワーク(CNN)はこの原理の成功例である。
対称性の群で定義される異なる変換に対する同変モデルを提案する。
これらのモデルはデータの対称性を利用して、サンプルとモデルの複雑さを減らし、一般化性能を向上させる。
論文 参考訳(メタデータ) (2020-12-04T18:46:17Z) - On Path Integration of Grid Cells: Group Representation and Isotropic
Scaling [135.0473739504851]
格子セルによる経路積分の一般的な表現モデルの理論的解析を行う。
我々は、歯列脳の格子細胞の同様の性質を共有する六角形格子パターンを学習する。
学習したモデルは、正確な長距離経路積分を行うことができる。
論文 参考訳(メタデータ) (2020-06-18T03:44:35Z) - Generalizing Convolutional Neural Networks for Equivariance to Lie
Groups on Arbitrary Continuous Data [52.78581260260455]
任意の特定のリー群からの変換に同値な畳み込み層を構築するための一般的な方法を提案する。
同じモデルアーキテクチャを画像、ボール・アンド・スティック分子データ、ハミルトン力学系に適用する。
論文 参考訳(メタデータ) (2020-02-25T17:40:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。