論文の概要: A Comparative Analysis of Attention versus State-Space Models for In-Context Learning
- arxiv url: http://arxiv.org/abs/2609.32341v1
- Date: Sat, 26 Sep 2026 07:59:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 17:35:04.338498
- Title: A Comparative Analysis of Attention versus State-Space Models for In-Context Learning
- Title(参考訳): 文脈内学習における意識と状態空間モデルの比較分析
- Abstract要約: 広義の注意クラスとSSMの表現能力を比較するための統一的なフレームワークである信念幾何学を開発する。
信念維持のため、SSMは静止集約カーネルよりも最適に後悔し、位置集合ではSSMはメモリ上の優位性を持ち、コンテンツ対応では、ソフトマックスアテンションはシグモイド選択SSMよりも指数的な幅の優位性を持つ。
- 参考スコア(独自算出の注目度): 16.566605776410068
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Transformers and state-space models (SSMs) are two prominent sequential learning architectures, yet their comparison remains largely empirical and existing theoretical analyses are typically task-specific or architecturally restricted. In this paper, we develop belief geometry, a unified analytical framework for comparing the representational capabilities of broad classes of attention and SSMs. Starting from a generalized formulation of in-context linear regression and using cumulative Bayes regret as our measure, we abstract three capabilities required by many sequential learning problems in our belief geometry: evidence assembly, belief maintenance, and addressing. We then study three cases of our formulation that isolate these capabilities and yield sharp architectural lessons: For belief maintenance, SSMs attain the optimal regret over stationary aggregation kernels; for positional assembly, SSMs have a memory advantage; and for content addressing, softmax attention has an exponential width advantage over sigmoid-selective SSMs. Experiments with LLaMA-type Transformers and Mamba-2 show that these architectural insights extend beyond our analytically tractable classes and linear-regression testbed.
- Abstract(参考訳): トランスフォーマーとステートスペースモデル(SSM)は2つの顕著なシーケンシャルラーニングアーキテクチャであるが、それらの比較は大半が経験的であり、既存の理論的分析は通常タスク固有またはアーキテクチャ的に制限されている。
本稿では,広義の注意クラスとSSMの表現能力を比較するための統合分析フレームワークである信念幾何学を開発する。
In-context linear regressionの一般化された定式化から始まり、累積ベイズ後悔を指標として、我々の信念幾何学における多くの逐次学習問題(エビデンスアセンブリ、信念維持、対処)で必要とされる3つの能力を抽象化する。
次に、これらの機能を分離し、鋭いアーキテクチャの教訓をもたらす3つの事例について研究する。信念維持のために、SSMは静止集約カーネルに対して最適な後悔を達成し、位置集合では、SSMは記憶上の優位性を持ち、コンテンツ対応では、SSMよりも、ソフトマックスアテンションは、シグモイド選択SSMよりも指数関数的に幅の優位性を持つ。
LLaMA型トランスフォーマーとMamba-2を用いた実験は、これらのアーキテクチャ上の洞察が、解析的に抽出可能なクラスや線形回帰テストベッドを超えて拡張されていることを示している。
関連論文リスト
- On the Importance of Gating: Memorization vs. In-Context Learning in State Space Models [50.824624057327725]
State Space Models (SSM) は Transformers の代替品として登場した。
我々は、このゲーティング機構がSSMにまず、重み付き「記憶」の解を学習させるという理論と実験を通して示している。
一方、ゲーティングは長い列長への一般化を改善するのにしばしば有用である。
論文 参考訳(メタデータ) (2026-09-15T02:36:13Z) - SEMASIA: A Large-Scale Dataset of Semantically Structured Latent Representations [12.185380843937196]
約1,700個の事前学習された視覚モデルから抽出した潜在表現の大規模コレクションであるSEMASIAを紹介する。
個々の潜在空間の概念的構造を解析し、一貫したプロトタイプのようなクラスタリングを示す。
プレトレーニングデータの複雑性,特殊化,伝達学習,拡張,モデルスケールが,埋め込みの幾何学的および探索的特性とどのように関係しているかを,大規模回帰分析により解析する。
論文 参考訳(メタデータ) (2026-05-10T11:42:36Z) - Coordinates of Capability: A Unified MTMM-Geometric Framework for LLM Evaluation [2.464003792743989]
本稿では,Large Language Models (LLMs) 評価のための汎用多言語多手法(MTMM)フレームワークを提案する。
パラフレーズ不安定度,ドリフトスコア,オーバートン幅,プラナリズムスコアの9つの評価指標を定式化し,共有潜在座標空間内の幾何的測度として解釈する。
タスク非関連摂動を真の能力の範囲から体系的に分離することにより、このフレームワークは、堅牢で経験的に安定したベンチマーク設計のために理論的に基礎とドメインに依存しない分類を提供する。
論文 参考訳(メタデータ) (2026-05-08T22:05:19Z) - How and Why LLMs Generalize: A Fine-Grained Analysis of LLM Reasoning from Cognitive Behaviors to Low-Level Patterns [51.02752099869218]
大きな言語モデル(LLM)は、非常に異なる一般化の振る舞いを示す。
推論を原子核スキルに分解する新しいベンチマークを導入する。
SFTモデルはよりシャープなドリフトと表面パターンへの過度な適合を示すのに対し、RL型モデルはより安定した行動プロファイルを維持し、推論スキルの崩壊に抵抗することを示す。
論文 参考訳(メタデータ) (2025-12-30T08:16:20Z) - Rethinking the Role of Dynamic Sparse Training for Scalable Deep Reinforcement Learning [58.533203990515034]
ニューラルネットワークのスケーリングは機械学習における画期的な進歩をもたらしたが、このパラダイムは深層強化学習(DRL)では失敗している。
我々は、動的スパーストレーニング戦略が、アーキテクチャの改善によって確立された主要なスケーラビリティ基盤を補完するモジュール固有の利点を提供することを示す。
アーキテクチャ改善の利点を生かした実践的なフレームワークであるModule-Specific Training (MST) にこれらの知見を精査し、アルゴリズムの修正なしに様々なRLアルゴリズムをまたいだ大幅なスケーラビリティ向上を示す。
論文 参考訳(メタデータ) (2025-10-14T03:03:08Z) - A Comparative Analysis of Contextual Representation Flow in State-Space and Transformer Architectures [27.45316137669387]
状態空間モデル(SSM)は、長いシーケンス処理のためにTransformer-Based Models(TBM)の効率的な代替品として登場した。
本稿では,SSM と TBM における表現伝搬の統一・トークン・層レベルでの初めての解析について述べる。
TBMはトークン表現を急速に均質化し、多様性は後層のみに再燃し、SSMはトークンの特異性を早期に保存するが、より深い均質化に収束する。
論文 参考訳(メタデータ) (2025-10-08T04:46:11Z) - Understanding and Mitigating Bottlenecks of State Space Models through the Lens of Recency and Over-smoothing [56.66469232740998]
構造化状態空間モデル (Structured State Space Models, SSMs) は, 強い相対バイアスによって本質的に制限されていることを示す。
このバイアスにより、モデルが遠方の情報を思い出す能力が損なわれ、堅牢性の問題がもたらされる。
本研究では, 状態遷移行列の2つのチャネルをSSMで分極し, それぞれ0と1に設定し, 電流バイアスと過平滑化に同時に対処することを提案する。
論文 参考訳(メタデータ) (2024-12-31T22:06:39Z) - Provable Benefits of Complex Parameterizations for Structured State Space Models [51.90574950170374]
構造化状態空間モデル (Structured State Space Model, SSM) は、指定された構造に固執する線形力学系である。
パラメータ化が現実の典型的なニューラルネットワークモジュールとは対照的に、SSMは複雑なパラメータ化を使用することが多い。
本稿では,実対角 SSM と複素対角 SSM の形式的ギャップを確立することにより,SSM の複雑なパラメータ化の利点を説明する。
論文 参考訳(メタデータ) (2024-10-17T22:35:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。