論文の概要: The Attention Within: Consensus Dynamics in Selective State Space Models
- arxiv url: http://arxiv.org/abs/2609.17997v1
- Date: Wed, 16 Sep 2026 01:34:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.593042
- Title: The Attention Within: Consensus Dynamics in Selective State Space Models
- Title(参考訳): 内部の注意:選択状態空間モデルにおける合意ダイナミクス
- Abstract要約: SSM(Selective State Space Model)は、最近、トランスフォーマーの代替として登場した。
SSMのコアにおける再発がトークンを集約することを示す。
- 参考スコア(独自算出の注目度): 2.631744051718347
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Selective state space models (SSMs) have recently emerged as a compelling alternative to transformers, combining competitive performance with substantially improved inference efficiency. At each SSM layer, a sequence of hidden states are propagated by a recurrence, mixing information of different tokens. Despite using a different mechanism, this mixing plays a role analogous to attention in transformers. In fact, recent works have shown that the two architectures may be closer than they first appear, as this recurrence admits a formulation akin to linear attention. In transformers, attention is known to drive the tokens to cluster, i.e., to reach consensus, collapsing in the limit to a single direction. Thus, we ask: does the recurrence at the core of SSMs drive the tokens to consensus, as attention does in transformers? To answer this question, we take a dynamical systems perspective on SSMs, modeling the evolution of tokens across layers as an ordinary differential equation. By exploiting input-to-state stability arguments, we establish local exponential stability of the consensus equilibria and characterize their domain of attraction for time-varying weight matrices, a setting not addressed by previous results. We thereby show that the resemblance between SSMs and transformers does run deeper: the recurrence at the core of SSMs aggregates tokens just as attention does. Numerical experiments on a pretrained Mamba-2 model point to the output gate as the component that regulates the extent of this consensus, preventing the tokens from reaching it in full.
- Abstract(参考訳): SSM(Selective State Space Model)は、最近、競合性能と推論効率を大幅に改善した、トランスフォーマーの魅力的な代替品として登場した。
各SSM層では、隠された状態列が繰り返し伝播され、異なるトークンの情報が混合される。
異なる機構を用いるにもかかわらず、この混合は変圧器の注意に類似した役割を果たす。
事実、近年の研究では、2つのアーキテクチャが最初に現れるよりも近い可能性があることが示されており、この再帰は線形注意に類似した定式化が認められる。
トランスでは、トークンをクラスタに駆動することで、すなわちコンセンサスに到達し、単一方向の制限で崩壊することが知られている。
したがって、私たちは、SSMのコアにおける再発はトークンをコンセンサスに導くのか、トランスフォーマーで注意を向けるのか?
この質問に答えるために、我々はSSMの動的システムの観点から、通常の微分方程式として層間のトークンの進化をモデル化する。
インプット・ツー・ステート安定性の議論を生かして、コンセンサス均衡の局所指数的安定性を確立し、時間変化重み行列のアトラクション領域を特徴付ける。
その結果,SSMと変圧器の類似性はより深くなり,SSMのコアでの再発は注目と同様にトークンを集約することがわかった。
事前訓練されたマンバ2モデルの数値実験は、このコンセンサスの範囲を規定する成分として出力ゲートを指し、トークンが完全に到達するのを防ぐ。
関連論文リスト
- Krause Synchronization Transformers [63.8469912831803]
トランスフォーマーにおける自己注意は、グローバルに正規化されたソフトマックスの重みに依存しており、すべてのトークンがすべての層で影響を競う。
クラーズ・アテンション(Krause Attention)は、有界信頼コンセンサス・ダイナミクスにインスパイアされた注意機構である。
論文 参考訳(メタデータ) (2026-02-12T03:47:53Z) - Clustering in Deep Stochastic Transformers [10.988655177671255]
層正規化を伴うディープトランスフォーマーの既存の理論は、通常、トークンが単一のポイントにクラスタされることを予測している。
ランダムな値からノイズが発生する深層変圧器を解析する。
2つのトークンに対して、相互作用強度とトークン次元によって支配される相転移を証明します。
論文 参考訳(メタデータ) (2026-01-29T16:28:13Z) - When to Think Fast and Slow? AMOR: Entropy-Based Metacognitive Gate for Dynamic SSM-Attention Switching [4.238040764117957]
ステートスペースモデル(SSM)は効率的な代替手段を提供するが、長期にわたって正確な情報検索に苦慮している。
認知の二重プロセス理論に着想を得たAMORは,SSMバックボーンが"不確か"である場合にのみ,スパークアテンションを動的に行うハイブリッドアーキテクチャである。
小規模な合成検索タスクでは、AMORはSSMのみのベースラインとトランスフォーマーのみのベースラインの両方を上回っている。
論文 参考訳(メタデータ) (2026-01-22T17:19:58Z) - Differential Gated Self-Attention [9.478010910852964]
マルチヘッド差分ゲーテッド・セルフアテンションは、ヘッドごとの入力依存ゲーティングを学習し、注意雑音を動的に抑制する。
筆者らの貢献は, 側方抑制を基礎とした自己保持のための新たな入力依存型ゲーティング機構, (ii) 生物学的コントラスト増強と自己保持理論の原理的合成, (iii) 耐雑音性およびクロスドメイン適用性を示す総合的な実験である。
論文 参考訳(メタデータ) (2025-05-29T22:52:56Z) - Understanding and Mitigating Bottlenecks of State Space Models through the Lens of Recency and Over-smoothing [56.66469232740998]
構造化状態空間モデル (Structured State Space Models, SSMs) は, 強い相対バイアスによって本質的に制限されていることを示す。
このバイアスにより、モデルが遠方の情報を思い出す能力が損なわれ、堅牢性の問題がもたらされる。
本研究では, 状態遷移行列の2つのチャネルをSSMで分極し, それぞれ0と1に設定し, 電流バイアスと過平滑化に同時に対処することを提案する。
論文 参考訳(メタデータ) (2024-12-31T22:06:39Z) - Theoretical Foundations of Deep Selective State-Space Models [13.971499161967083]
ディープSSMは、さまざまなドメインセットで優れたパフォーマンスを示す。
最近の研究で、線形リカレンス電力が入力と隠れ状態の間の乗法的相互作用を可能にすることが示されている。
ランダム線形再帰が単純な入力制御遷移を備える場合、隠れ状態は強力な数学的対象の低次元射影であることを示す。
論文 参考訳(メタデータ) (2024-02-29T11:20:16Z) - STMT: A Spatial-Temporal Mesh Transformer for MoCap-Based Action Recognition [50.064502884594376]
本研究では、モーションキャプチャー(MoCap)シーケンスを用いた人間の行動認識の問題点について検討する。
メッシュシーケンスを直接モデル化する新しい時空間メッシュ変換器(STMT)を提案する。
提案手法は,スケルトンベースモデルやポイントクラウドベースモデルと比較して,最先端の性能を実現する。
論文 参考訳(メタデータ) (2023-03-31T16:19:27Z) - Transformers with Competitive Ensembles of Independent Mechanisms [97.93090139318294]
隠れた表現とパラメータを複数のメカニズムに分割し、注意を通して情報を交換する新しいトランスフォーマー層を提案する。
TIM を大規模 BERT モデル、画像変換器、および音声強調について研究し、意味的に意味のある専門化とパフォーマンスの向上の証拠を見つけます。
論文 参考訳(メタデータ) (2021-02-27T21:48:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。