論文の概要: From Self-Attention to Connection Laplacian: A Unified Operator View of Transformers
- arxiv url: http://arxiv.org/abs/2607.10677v1
- Date: Sun, 12 Jul 2026 09:44:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.503046
- Title: From Self-Attention to Connection Laplacian: A Unified Operator View of Transformers
- Title(参考訳): 自己注意から接続ラプラシアンへ:変圧器の統一操作者視点
- Abstract要約: 自己注意は現代のシーケンスモデルにおいてユビキタスプリミティブであるが、作用素レベルの幾何学は部分的には理解されていない。
単頭注意 (SHA) は, 常に搬送される接続伝播ステップであることを示す。
トレーニングされたトランスフォーマー(124Mから8B)と構造(エンコーダ/デコーダ)は、我々の理論と整合した幾何学的構造を示す。
- 参考スコア(独自算出の注目度): 53.505136935517925
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Self-attention is a ubiquitous primitive in modern sequence models, yet its operator-level geometry is only partially understood. We view a token sequence as a vector field over the token-position graph and identify attention as a connection walk: messages are aggregated by a nonnegative walk matrix while being transported along each edge by a learned linear map. Within this framework, we prove that single-head attention (SHA) is exactly a connection propagation step with constant transport, and that multi-head attention (MHA) is exactly a single edge-dependent connection walk whose effective transport is an attention-gated mixture of headwise transports. We further clarify the conditions under which the corresponding generator reduces to a random-walk connection Laplacian, highlighting the roles of stochasticity, reversibility, and metric-compatible transports. Empirically, we find that trained Transformers across scales (from 124M to 8B) and structures (encoder/decoder) exhibit geometric structure consistent with our theory: effective attention graphs converge to stable geometric operators in deeper layers, learned transports self-organize into approximate scaled isometries, and both phenomena strengthen consistently with scale. Overall, the paper provides a precise connection-walk formalism that links self-attention to classical geometric operators, along with a set of operator-level tools for analyzing transformer models from a geometric perspective.
- Abstract(参考訳): 自己注意は現代のシーケンスモデルにおいてユビキタスプリミティブであるが、作用素レベルの幾何学は部分的には理解されていない。
我々はトークン列をトークン配置グラフ上のベクトル場とみなし、注意を接続ウォークとして認識する:メッセージは、学習された線形写像によって各エッジに沿って輸送されながら、非負のウォーク行列によって集約される。
本枠組みでは, 単頭注意 (SHA) が, 一定の移動量を持つ接続伝播ステップであり, 多頭注意 (MHA) が, 効果的輸送量である単一エッジ依存接続ウォークであることを示す。
さらに、対応するジェネレータがランダムウォーク接続のラプラシアンに還元される条件を明らかにし、確率性、可逆性、およびメートル法互換輸送の役割を強調した。
実効的な注意グラフは、より深い層において安定な幾何学演算子に収束し、学習された輸送体は、近似されたスケールのイソメトリーに自己組織化され、両者の現象はスケールとともに一貫した強度を持つ。
本論文は,古典的幾何学的演算子に自己注意を結び付ける正確な接続ウォーク形式と,幾何学的視点からトランスフォーマーモデルを解析するための演算子レベルのツールセットを提供する。
関連論文リスト
- How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Trajectories [51.16651846289446]
我々は,個々のCoTステップの粒度における労力を定量化するための幾何学的枠組みであるステップ・アウェア・推論・エナジー(SARE)を提案する。
推理エネルギーはステップタイプにまたがって非常に不均一であり、軌道レベルの指標からは見えない位相的な遷移を示す。
SAREベースの機能は、ほとんどの設定でアウトプットベースの信頼ベースラインにマッチするか、向上します。
論文 参考訳(メタデータ) (2026-07-28T06:15:51Z) - Function graph transformers universally approximate operators between function spaces [14.886643480836817]
変換器による関数空間間の非線形作用素の近似について検討する。
我々のアプローチは、グラフ上でサポートされている測度に関数を持ち上げ、最近導入された変圧器の測度理論的視点を活用することである。
本稿では,このフレームワークが収束度測定による離散化改善をモデル化し,演算子学習の自然な設定を提供することを示す。
論文 参考訳(メタデータ) (2026-05-18T07:25:14Z) - TensorLens: End-to-End Transformer Analysis via High-Order Attention Tensors [53.891337639229285]
高次アテンション・インタラクション接続を通して表現された入力依存線形演算子として変換器全体をキャプチャする新しい定式化である attentionLens を導入する。
本実験は,注目テンソルが,解釈可能性とモデル理解を目的としたツール開発のための強力な基盤となることを実証した。
論文 参考訳(メタデータ) (2026-01-25T19:21:25Z) - Deep Delta Learning [91.75868893250662]
本稿では,標準残差接続を一般化した新しいアーキテクチャであるDeep Delta Learning(DDL)を紹介する。
我々はこの演算子のスペクトル解析を行い、ゲート$(mathbfX)$がアイデンティティマッピング、投影、幾何反射のダイナミックな相互作用を可能にすることを示した。
この統合により、ネットワークは階層的な遷移作用素のスペクトルを明示的に制御することができ、複雑な非単調力学のモデリングを可能にする。
論文 参考訳(メタデータ) (2026-01-01T18:11:38Z) - Generalized Linear Mode Connectivity for Transformers [87.32299363530996]
驚くべき現象はリニアモード接続(LMC)であり、独立に訓練されたモデルを低損失またはゼロ損失の経路で接続することができる。
以前の研究は主に置換によるニューロンの並べ替えに焦点を合わせてきたが、そのようなアプローチは範囲に限られている。
我々は、4つの対称性クラス(置換、半置換、変換、一般可逆写像)をキャプチャする統一的なフレームワークを導入する。
この一般化により、独立に訓練された視覚変換器とGPT-2モデルの間の低障壁とゼロバリア線形経路の発見が可能となった。
論文 参考訳(メタデータ) (2025-06-28T01:46:36Z) - RiemannFormer: A Framework for Attention in Curved Spaces [0.43512163406552]
この研究は、トランスフォーマーベースのアーキテクチャのさらなる可能性を解き放つための洞察を提供する努力である。
主な動機の1つは、変圧器における注意機構の幾何学的解釈を提供することである。
論文 参考訳(メタデータ) (2025-06-09T03:56:18Z) - Unveiling Induction Heads: Provable Training Dynamics and Feature Learning in Transformers [54.20763128054692]
我々は,2層変換器が$n$-gramのマルコフ連鎖データ上でICLを実行するためにどのように訓練されているかを検討する。
クロスエントロピー ICL 損失に対する勾配流が極限モデルに収束することを証明する。
論文 参考訳(メタデータ) (2024-09-09T18:10:26Z) - Transformer Block Coupling and its Correlation with Generalization in LLMs [3.007031501305338]
トークン埋め込みの軌跡をトランスフォーマーブロックを通過して解析し、ジャコビアン行列を通してこれらの軌跡に沿って系を線形化する。
我々は,多言語モデルにおけるtextbftransformer ブロックの結合現象を明らかにし,トークンと深さをまたいだ頂点特異ベクトルの結合を特徴とする。
さらに,これらの特性が学習中にどのように出現するかを考察し,結合の進行,線形性の向上,トークン軌道の層ワイド指数的成長を観察する。
論文 参考訳(メタデータ) (2024-07-10T16:30:27Z) - Neural Isometries: Taming Transformations for Equivariant ML [8.203292895010748]
本稿では,観測空間を汎用潜在空間にマップする方法を学習する自動エンコーダフレームワークであるNeural Isometriesを紹介する。
トレーニング済みの潜伏空間で動作する単純なオフ・ザ・シェルフ同変ネットワークは、巧妙に設計された手作りのネットワークと同等の結果が得られることを示す。
論文 参考訳(メタデータ) (2024-05-29T17:24:25Z) - Curve Your Attention: Mixed-Curvature Transformers for Graph
Representation Learning [77.1421343649344]
本稿では,一定曲率空間の積を完全に操作するトランスフォーマーの一般化を提案する。
また、非ユークリッド注意に対するカーネル化されたアプローチを提供し、ノード数とエッジ数に線形に時間とメモリコストでモデルを実行できるようにします。
論文 参考訳(メタデータ) (2023-09-08T02:44:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。