論文の概要: Global Divergence, Local Convergence: Representation Geometry in SSMs and Transformers
- arxiv url: http://arxiv.org/abs/2609.08692v1
- Date: Tue, 08 Sep 2026 12:57:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 15:57:28.129941
- Title: Global Divergence, Local Convergence: Representation Geometry in SSMs and Transformers
- Title(参考訳): グローバルな多様性と局所収束:SSMと変圧器の表現幾何学
- Abstract要約: Mambaのような最近の状態空間モデル(SSM)は、トランスフォーマーに匹敵する言語モデリング性能を達成する。
これらの構造的差異は、内部表現の幾何学的および機能的性質にどのように影響を与えるのか?
本稿では,変換器,SSM,ハイブリッドアーキテクチャにおける表現のマルチスケール解析を通じて,この問題を考察する。
- 参考スコア(独自算出の注目度): 4.71326501896672
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent state-space models (SSMs) such as Mamba achieve language modeling performance comparable to transformers despite relying on fundamentally different architectures. This raises an important question: how do these structural differences influence the geometry and functional nature of their internal representations? We study this question through a multi-scale analysis of representations in transformers, SSMs, and hybrid architecture. First, we find that SSMs distribute their representational information evenly across all dimensions, whereas transformer representations are heavily dominated by a single principal direction. By evaluating hybrid architectures, we observe that the representation space becomes increasingly skewed toward a single dominant direction after each attention layer. Next, we explore how the different geometric spread of representations impacts representational capacity through compressibility. Surprisingly, we find that despite their contrasting geometric structures, both architectures exhibit tightly matched effective capacities. We further investigate whether this skewed geometry affects how concepts are encoded. Using rank-constrained probes, we demonstrate that both architectures encode concepts in subspaces of surprisingly similar dimensionality. Furthermore, we demonstrate that the transformers' dominant principal direction does not inherently encode more conceptual information. Finally, we zoom in and examine the alignment between manifolds, either by analyzing representations of specific topics or by looking at the nearest neighborhoods of tokens, and find that they are highly aligned. Ultimately, our analysis suggests that while transformers and SSMs induce different usage of latent space, they display a striking functional convergence at the level of local semantic manifolds.
- Abstract(参考訳): Mambaのような最近の状態空間モデル(SSM)は、根本的に異なるアーキテクチャに依存するにもかかわらず、トランスフォーマーに匹敵する言語モデリング性能を達成する。
これらの構造的差異は、内部表現の幾何学的および機能的性質にどのように影響を与えるのか?
本稿では,変換器,SSM,ハイブリッドアーキテクチャにおける表現のマルチスケール解析を通じて,この問題を考察する。
まず、SSMは各次元に均等に表現情報を分配するのに対し、トランスフォーマー表現は1つの主方向で大きく支配されている。
ハイブリッドアーキテクチャを評価することにより、各注目層の後、表現空間が1つの支配的な方向に傾きつつあることが分かる。
次に,表現の幾何学的拡散が圧縮性を通じて表現能力に与える影響について検討する。
驚くべきことに、両アーキテクチャは、対照的な幾何学的構造にもかかわらず、密に整合した実効能力を示す。
さらに、この歪んだ幾何学が概念のエンコードにどう影響するかについても検討する。
階数制約されたプローブを用いて、両アーキテクチャが驚くほど類似した次元を持つ部分空間で概念を符号化することを示した。
さらに、変換器の主方向が本質的により概念的な情報を符号化していないことを示す。
最後に、特定のトピックの表現を分析したり、最も近いトークンの近傍を見ることによって、多様体間のアライメントを拡大して検討し、それらが高度にアライメントされていることを確認する。
究極的には、変換器とSSMは潜在空間の異なる利用を誘導するが、局所意味多様体のレベルでは顕著な汎函数収束を示す。
関連論文リスト
- Transformer Geometry Observatory TGO-IV: Developmental Topology Observatory [2.4900509453584156]
Transformer Geometry Observatory-TGO-IVは、Transformer表現の進化を分析するためのトポロジカルフレームワークを導入している。
TGO-IVは局所幾何学的性質のみを研究するのではなく、トークンレベルの表現点雲からビエトリス-リップス単純錯体を構成する。
提案フレームワークは, 永続図, バーコード図, ベティ曲線, 永続景観, ボトルネック距離, ワッサーシュタイン距離などの相補的なトポロジカル・オブザーバトリーから構成される。
論文 参考訳(メタデータ) (2026-08-07T13:11:22Z) - Geometric Asymmetry in MoE Specialization: Functional Decorrelation and Representational Overlap [0.5414847001704249]
Mixture-of-Experts (MoE)アーキテクチャはスパースルーティングによってスケーラブルなキャパシティを実現する。
本稿では,関数空間と表現空間の両方においてMoE層を解析するための統一Jacobian-PCA-Grassmannフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-08T04:17:10Z) - What matters for Representation Alignment: Global Information or Spatial Structure? [64.67092609921816]
表現アライメント(REPA)は、強い事前訓練された視覚エンコーダから中間拡散特徴への表現を蒸留することにより、生成訓練を導く。
本稿では,対象表現のどの側面が生成に重要であるか,そのテクスト・グロバル・リビジョン・セマンティック・情報について検討する。
我々はREPAの標準射影層を単純な畳み込み層に置き換え、外部表現のための空間正規化層を導入する。
論文 参考訳(メタデータ) (2025-12-11T16:39:53Z) - Generalized Linear Mode Connectivity for Transformers [87.32299363530996]
驚くべき現象はリニアモード接続(LMC)であり、独立に訓練されたモデルを低損失またはゼロ損失の経路で接続することができる。
以前の研究は主に置換によるニューロンの並べ替えに焦点を合わせてきたが、そのようなアプローチは範囲に限られている。
我々は、4つの対称性クラス(置換、半置換、変換、一般可逆写像)をキャプチャする統一的なフレームワークを導入する。
この一般化により、独立に訓練された視覚変換器とGPT-2モデルの間の低障壁とゼロバリア線形経路の発見が可能となった。
論文 参考訳(メタデータ) (2025-06-28T01:46:36Z) - What Does It Mean to Be a Transformer? Insights from a Theoretical Hessian Analysis [8.008567379796666]
トランスフォーマーと他のアーキテクチャを区別する点について、基本的な理解を提供する。
この結果から,トランスフォーマーにおける様々なアーキテクチャと最適化の選択は,その非線形な依存関係に遡ることができることが示唆された。
論文 参考訳(メタデータ) (2024-10-14T18:15:02Z) - How Do Transformers Learn Topic Structure: Towards a Mechanistic
Understanding [56.222097640468306]
我々は、トランスフォーマーが「意味構造」を学ぶ方法の機械的理解を提供する
数学的解析とウィキペディアデータの実験を組み合わせることで、埋め込み層と自己保持層がトピック構造をエンコードしていることを示す。
論文 参考訳(メタデータ) (2023-03-07T21:42:17Z) - The geometry of hidden representations of large transformer models [43.16765170255552]
大規模トランスは、さまざまなデータタイプをまたいだ自己教師型データ分析に使用される強力なアーキテクチャである。
データセットのセマンティック構造は、ある表現と次の表現の間の変換のシーケンスから現れることを示す。
本研究は,データセットのセマンティクス情報が第1ピークの終わりによりよく表現されることを示し,この現象を多種多様なデータセットで訓練された多くのモデルで観測できることを示した。
論文 参考訳(メタデータ) (2023-02-01T07:50:26Z) - Demystify Transformers & Convolutions in Modern Image Deep Networks [80.16624587948368]
本稿では,一般のコンボリューションとアテンション演算子の真の利益を,詳細な研究により同定することを目的とする。
注意や畳み込みのようなこれらの特徴変換モジュールの主な違いは、それらの空間的特徴集約アプローチにある。
様々なSTMが統合されたフレームワークに統合され、包括的な比較分析を行う。
論文 参考訳(メタデータ) (2022-11-10T18:59:43Z) - CSformer: Bridging Convolution and Transformer for Compressive Sensing [65.22377493627687]
本稿では,CNNからの詳細な空間情報を活用するためのハイブリッドフレームワークと,表現学習の強化を目的としたトランスフォーマーが提供するグローバルコンテキストを統合することを提案する。
提案手法は、適応的なサンプリングとリカバリからなるエンドツーエンドの圧縮画像センシング手法である。
実験により, 圧縮センシングにおける専用トランスアーキテクチャの有効性が示された。
論文 参考訳(メタデータ) (2021-12-31T04:37:11Z) - Transformers with Competitive Ensembles of Independent Mechanisms [97.93090139318294]
隠れた表現とパラメータを複数のメカニズムに分割し、注意を通して情報を交換する新しいトランスフォーマー層を提案する。
TIM を大規模 BERT モデル、画像変換器、および音声強調について研究し、意味的に意味のある専門化とパフォーマンスの向上の証拠を見つけます。
論文 参考訳(メタデータ) (2021-02-27T21:48:46Z) - The Geometry of Deep Generative Image Models and its Applications [0.0]
generative adversarial networks (gans) は、実世界のデータセットの統計パターンをモデル化する強力な教師なし手法として登場した。
これらのネットワークは、潜在空間内のランダムな入力を学習データを表す新しいサンプルにマップするように訓練される。
潜在空間の構造は、その高い寸法性と発電機の非線形性のために内挿しが困難である。
論文 参考訳(メタデータ) (2021-01-15T07:57:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。