論文の概要: MuonSSM: Orthogonalizing State Space Models for Sequence Modeling
- arxiv url: http://arxiv.org/abs/2606.30461v1
- Date: Mon, 29 Jun 2026 15:27:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.313919
- Title: MuonSSM: Orthogonalizing State Space Models for Sequence Modeling
- Title(参考訳): MuonSSM:シーケンスモデリングのための直交状態空間モデル
- Authors: Thai-Khanh Nguyen, Ngoc-Bich-Uyen Vo, Thieu N. Vo, Tan M. Nguyen, Cuong Pham,
- Abstract要約: 状態空間モデル(SSM)は、長いシーケンスモデリングに注目する効率的な線形時間代替手段として登場した。
メモリ更新の幾何を明示的に条件付けすることで、SSMトレーニングを安定化するフレームワークであるMuonSSMを紹介する。
我々は,MuonSSMが勾配伝搬を改善し,スペクトル増幅を緩和し,長い地平線上でのメモリ表現を強化することを示す。
- 参考スコア(独自算出の注目度): 4.4972560829708454
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: State space models (SSMs) have emerged as efficient linear-time alternatives to attention for long-sequence modeling. However, existing SSMs often suffer from instability and memory degradation over extended horizons due to poorly conditioned first-order updates and unbalanced update geometry. We introduce MuonSSM, a general framework that stabilizes SSM training by explicitly conditioning the geometry of memory updates rather than the recurrent transition matrix. MuonSSM augments SSMs with a momentum-based pathway and a lightweight Newton Schulz transformation on low-rank input injections, yielding bounded and spectrally conditioned updates while preserving parallel scan complexity. Theory shows that MuonSSM improves gradient propagation, mitigates spectral amplification, and enriches memory representations over long horizons. Extensive experiments across language, vision, and time-series benchmarks show consistent gains in accuracy, robustness, and long-context performance when integrated into diverse SSM backbones. These results establish geometric conditioning of updates as a principled pathway to stable, scalable sequence modeling.
- Abstract(参考訳): 状態空間モデル(SSM)は、長いシーケンスモデリングに注目する効率的な線形時間代替手段として登場した。
しかし、既存のSSMは、低条件の1次更新と不均衡な更新幾何学のために、水平線をまたいだ不安定性とメモリ劣化に悩まされることが多い。
本稿では,再帰遷移行列ではなく,メモリ更新の幾何を明示的に条件付けすることで,SSMトレーニングを安定化する汎用フレームワークであるMuonSSMを紹介する。
MuonSSMは、運動量に基づく経路と、低ランクな入力インジェクションに対するニュートン・シュルツ変換でSSMを増強し、並列スキャンの複雑さを保ちながら、有界およびスペクトル条件の更新をもたらす。
理論によれば、MuonSSMは勾配伝播を改善し、スペクトル増幅を緩和し、長い地平線上でのメモリ表現を強化する。
言語、ビジョン、時系列のベンチマークにわたる大規模な実験では、多様なSSMバックボーンに統合された場合、精度、堅牢性、長期コンテキストのパフォーマンスが一貫した向上を示した。
これらの結果は、安定かつスケーラブルなシーケンスモデリングへの原則的経路として、更新の幾何学的条件付けを確立する。
関連論文リスト
- Flash PD-SSM: Memory-Optimized Structured Sparse State-Space Models [62.362971723881095]
状態空間モデル(SSM)は効率性と表現性の間に根本的なトレードオフに直面している。
我々はFlash PD-SSMを提案する。これは、広く使われている構造化SSMに匹敵するスループットを実現し、表現性を保証する。
我々は、Flash PD-SSMが競合するSSM法の中で新しい最先端(SoTA)の精度を定義していることを示す。
論文 参考訳(メタデータ) (2026-05-18T22:06:33Z) - MS-SSM: A Multi-Scale State Space Model for Efficient Sequence Modeling [60.648359990090846]
状態空間モデル(SSM)は、最近、計算コストのかかるシーケンスモデルに対する効率的な代替手段として注目されている。
本稿では,複数の解像度にまたがるシーケンスダイナミクスを表現するマルチスケールSSMフレームワークを提案し,各解像度を特殊な状態空間ダイナミクスで処理する。
論文 参考訳(メタデータ) (2025-12-29T19:36:28Z) - The Curious Case of In-Training Compression of State Space Models [49.819321766705514]
ステートスペースモデル(SSM)は、並列化可能なトレーニングと高速推論の両方を提供する。
鍵となる設計上の課題は、表現力の最大化と計算負荷の制限の間の適切なバランスを打つことだ。
我々のアプローチである textscCompreSSM はリニアリカレントユニットのような線形時間不変SSMに適用されるが、選択モデルにも拡張可能である。
論文 参考訳(メタデータ) (2025-10-03T09:02:33Z) - Quantum-Optimized Selective State Space Model for Efficient Time Series Prediction [39.146761527401424]
本稿では、状態空間のダイナミクスと変分量子ゲートを統合するハイブリッド量子最適化手法を提案する。
我々は、広く使われている3つのベンチマーク(ETT、トラフィック、為替レート)で、Q-SSMを実証的に検証する。
その結果,Q-SSMは強いベースラインよりも一貫して改善されていることがわかった。
論文 参考訳(メタデータ) (2025-08-29T22:00:48Z) - Exemplar-Free Continual Learning for State Space Models [32.73275711666184]
State-Space Models (SSM) は構造化された再帰で長距離の依存関係をキャプチャする。
彼らの進化する内部状態は、継続的学習の下でそれらを適応する上で困難を生じさせる。
Inf-SSMを提案する。
論文 参考訳(メタデータ) (2025-05-24T08:59:13Z) - Learning to Dissipate Energy in Oscillatory State-Space Models [51.98491034847041]
状態空間モデル (SSM) はシーケンス学習のためのネットワークのクラスである。
我々は,D-LinOSSがLinOSSの手法を長距離学習タスクで一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2025-05-17T23:15:17Z) - SMR: State Memory Replay for Long Sequence Modeling [19.755738298836526]
本稿では並列畳み込み計算における互換性の限界を克服する新しい非再帰的非一様サンプル処理戦略を提案する。
本研究では,学習可能な記憶を利用する状態記憶再生(SMR)を導入し,学習データと異なるサンプリングポイントでの一般化のために,現在の状態を多段階情報で調整する。
自己回帰言語モデリングとLong Range Arenaにおける長距離モデリングタスクの実験は、一連のSSMモデルに対するSMRメカニズムの一般的な効果を実証している。
論文 参考訳(メタデータ) (2024-05-27T17:53:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。