論文の概要: The Laplacian Mechanism Improves Transformers by Reshaping Token Geometry
- arxiv url: http://arxiv.org/abs/2602.09297v1
- Date: Tue, 10 Feb 2026 00:27:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-11 20:17:43.295772
- Title: The Laplacian Mechanism Improves Transformers by Reshaping Token Geometry
- Title(参考訳): ラプラシアン機構はトーケン幾何を変形させることにより変圧器を改善する
- Abstract要約: ラプラシアン機構をトランスフォーマーに組み込むことで、コンピュータビジョンと言語におけるベンチマーク間で一貫した改善がもたらされることを示す。
本研究は,ラプラシアン機構が最大分離性の幾何へのトークン埋め込みを再現することを示す。
- 参考スコア(独自算出の注目度): 15.311893064721856
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Transformers leverage attention, the residual connection, and layer normalization to control the variance of token representations. We propose to modify attention into a Laplacian mechanism that gives the model more direct control over token variance. We conjecture that this helps transformers achieve the ideal token geometry. To investigate our conjecture, we first show that incorporating the Laplacian mechanism into transformers induces consistent improvements across benchmarks in computer vision and language. Next, we study how the Laplacian mechanism impacts the geometry of token representations using various tools: 1) principal component analysis, 2) cosine similarity metric, 3) analysis of variance, and 4) Neural Collapse metrics. Our investigation shows that the Laplacian mechanism reshapes token embeddings toward a geometry of maximal separability: tokens collapse according to their classes, and the class means exhibit Neural Collapse.
- Abstract(参考訳): トランスフォーマーは、トークン表現の分散を制御するために注意、残差接続、層正規化を利用する。
我々は,トークンの分散をより直接的に制御するラプラシアン機構に注意を向けることを提案する。
これはトランスフォーマーが理想的なトークン幾何学を達成するのに役立つと推測する。
まず,ラプラシアン機構をトランスフォーマーに組み込むことで,コンピュータビジョンと言語におけるベンチマーク間で一貫した改善がもたらされることを示す。
次に,ラプラシアン機構が様々なツールを用いてトークン表現の幾何学にどのように影響するかを検討する。
1)主成分分析
2)コサイン類似度尺度
3)分散の分析,及び
4) 神経崩壊の指標。
本研究により,Laplacian の機構は,最大分離性の幾何へのトークン埋め込みを想起させることが明らかとなった。
関連論文リスト
- From Self-Attention to Connection Laplacian: A Unified Operator View of Transformers [53.505136935517925]
自己注意は現代のシーケンスモデルにおいてユビキタスプリミティブであるが、作用素レベルの幾何学は部分的には理解されていない。
単頭注意 (SHA) は, 常に搬送される接続伝播ステップであることを示す。
トレーニングされたトランスフォーマー(124Mから8B)と構造(エンコーダ/デコーダ)は、我々の理論と整合した幾何学的構造を示す。
論文 参考訳(メタデータ) (2026-07-12T09:44:54Z) - Lost in Tokenization: Fundamental Trade-offs in Graph Tokenization for Transformers [50.98108117044413]
グラフ・ツー・トケン写像の選択は変換器の表現性の基本成分であることを示す。
既存の多くのグラフトークン化のためのビルディングブロックとして機能する3つのトークン化(スペクトル、ランダムウォーク、隣接トークン化)について検討する。
論文 参考訳(メタデータ) (2026-05-21T13:32:20Z) - Transformer-like Inference from Optimal Control [0.5161531917413708]
第一原理から、同じ予測問題を解く推論アーキテクチャを導出する。
2つのモデルクラスに対して、予測目標を最適制御問題として再構成する。
実験により、埋め込み次元が不足すると、変圧器は非マルコフ構造を暗黙的に活用することが明らかになった。
論文 参考訳(メタデータ) (2026-05-15T04:42:19Z) - Distinct mechanisms underlying in-context learning in transformers [5.844274234531923]
現代の分散ネットワーク、特にトランスフォーマーは、その計算を入力統計に適応させる顕著な能力(文脈内学習)を取得する。
我々は、離散マルコフ連鎖の有限集合$S$で訓練された変圧器において、この挙動の完全な力学的特徴を与える。
論文 参考訳(メタデータ) (2026-04-14T00:01:14Z) - Selective Induction Heads: How Transformers Select Causal Structures In Context [50.09964990342878]
因果構造を扱うトランスフォーマーの能力を示す新しいフレームワークを提案する。
我々のフレームワークは、遷移確率を固定しつつ、ラグの異なるマルコフ鎖をインターリーブすることで因果構造を変化させる。
この設定は、コンテクスト内で正しい因果構造を選択できる新しい回路である選択誘導ヘッド(Selective induction Heads)を形成する。
論文 参考訳(メタデータ) (2025-09-09T23:13:41Z) - Plain Transformers Can be Powerful Graph Learners [64.50059165186701]
研究者たちは、Transformerをグラフ学習に移行しようとしたが、ほとんどの高度なGraph Transformerは、普通のTransformerから遠く離れている。
この研究は、普通のTransformerアーキテクチャが強力なグラフ学習者になれることを示した。
論文 参考訳(メタデータ) (2025-04-17T02:06:50Z) - Unveiling Induction Heads: Provable Training Dynamics and Feature Learning in Transformers [54.20763128054692]
我々は,2層変換器が$n$-gramのマルコフ連鎖データ上でICLを実行するためにどのように訓練されているかを検討する。
クロスエントロピー ICL 損失に対する勾配流が極限モデルに収束することを証明する。
論文 参考訳(メタデータ) (2024-09-09T18:10:26Z) - Clustering in pure-attention hardmax transformers and its role in sentiment analysis [0.0]
ハードマックス自己アテンションと正規化サブ層を有する変圧器の挙動を, 層数が無限大になる傾向があるため, 厳密に特徴づける。
変換器は、リーダーと呼ばれる特別な点によって決定されるクラスター平衡にインプット的に収束することを示す。
そして、この理論的理解を利用して、完全に解釈可能なトランスフォーマーモデルを用いて、言語処理から感情分析問題を解く。
論文 参考訳(メタデータ) (2024-06-26T16:13:35Z) - Token Transformation Matters: Towards Faithful Post-hoc Explanation for Vision Transformer [16.97186100288621]
視覚変換器は、領域を変換トークンとして表現し、注意重みを通してそれらを統合することによって視覚情報を抽出する。
既存のポストホックな説明法は単にこれらの注意重みを考慮し、変換されたトークンから重要な情報を無視するだけである。
本稿では,トークン変換効果の測定を利用したポストホックな説明手法であるTokenTMを提案する。
論文 参考訳(メタデータ) (2024-03-21T16:52:27Z) - Understanding the Expressive Power and Mechanisms of Transformer for Sequence Modeling [10.246977481606427]
ドット積自己注意などのトランスフォーマーの異なる成分が表現力に影響を及ぼすメカニズムについて検討する。
本研究では,トランスフォーマーにおける臨界パラメータの役割を明らかにする。
論文 参考訳(メタデータ) (2024-02-01T11:43:13Z) - In-Context Convergence of Transformers [63.04956160537308]
勾配降下法により訓練したソフトマックスアテンションを有する一層変圧器の学習力学について検討した。
不均衡な特徴を持つデータに対しては、学習力学が段階的に収束する過程をとることを示す。
論文 参考訳(メタデータ) (2023-10-08T17:55:33Z) - Transformers as Support Vector Machines [54.642793677472724]
自己アテンションの最適化幾何と厳密なSVM問題との間には,形式的等価性を確立する。
勾配降下に最適化された1層変圧器の暗黙バイアスを特徴付ける。
これらの発見は、最適なトークンを分離し選択するSVMの階層としてのトランスフォーマーの解釈を刺激していると信じている。
論文 参考訳(メタデータ) (2023-08-31T17:57:50Z) - What Makes for Good Tokenizers in Vision Transformer? [62.44987486771936]
変圧器は自己注意を用いて対関係を抽出することができる。
優れたトークンライザとなるものは、コンピュータビジョンではよく理解されていない。
Tokens (MoTo) を横断する変調は、正規化によるトークン間モデリング機能を備えている。
TokenPropの正規化対象は、標準トレーニング体制で採用されている。
論文 参考訳(メタデータ) (2022-12-21T15:51:43Z) - Unraveling Attention via Convex Duality: Analysis and Interpretations of
Vision Transformers [52.468311268601056]
本稿では凸双対性のレンズを通して注意を解析する。
我々は、大域的最適性に対して解釈可能で解ける等価な有限次元凸問題を導出する。
自己認識ネットワークがトークンを暗黙的にクラスタリングする方法を示す。
論文 参考訳(メタデータ) (2022-05-17T04:01:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。