論文の概要: Kaczmarz Linear Attention
- arxiv url: http://arxiv.org/abs/2605.08587v1
- Date: Sat, 09 May 2026 01:07:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.759331
- Title: Kaczmarz Linear Attention
- Title(参考訳): Kaczmarzリニアアテンション
- Abstract要約: リニアリカレントモデルはコンテキストを固定サイズの状態に圧縮し、情報を忘れ、書き、編集するルールを中心的な設計問題とする。
Gated DeltaNet (GDN) は、ゲート状態崩壊とデルタルール残差書き込みを結合し、学習可能な係数を用いて、忘れと更新の規模をバランスさせる。
状態形状,ゲート,リニアリカレンス,チャンクワイズ並列アルゴリズムを保存するGDNの1スカラー修正であるKaczmarz Linear (KLA)を提案する。
- 参考スコア(独自算出の注目度): 11.650692583508663
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-context language modeling remains central to modern sequence modeling, but the quadratic cost of Transformer attention makes scaling computationally prohibitive. Linear recurrent models address this bottleneck by compressing the context into a fixed-size state, making the rule that forgets, writes, and edits information a central design problem. To address state maintenance, Gated DeltaNet (GDN) combines gated state decay with delta-rule residual writes, using a learnable coefficient to balance forgetting and update magnitude. However, this coefficient is learned empirically rather than derived from the underlying objective, which can lead to suboptimal update magnitudes. We revisit the online-regression objective underlying GDN and, inspired by the Kaczmarz projection method, derive the key-norm-normalized dynamic step size $β_t = η_t / (\|k_t\|_2^2 + ε)$ for residual updates. We propose Kaczmarz Linear Attention (KLA), a one-scalar modification of GDN that preserves the state shape, gates, linear recurrence, and chunkwise parallel algorithm. At the 0.4B scale with a 1B-token budget, KLA achieves the lowest validation perplexity among evaluated linear-time baselines, 8.09 versus 8.50 for GDN, and remains stable up to 65K tokens. On controlled tasks, KLA reaches 100% on single-needle-in-a-haystack retrieval, improves 8x multi-query associative recall by 7.03 points over GDN, and delivers 2.1x higher decode throughput at 32K context. These results suggest that the key-norm-normalized Kaczmarz coefficient is a first-order design axis for delta-rule sequence models: it improves accuracy, extrapolation, and decoding efficiency without changing the recurrent state or hardware kernel.
- Abstract(参考訳): 長文言語モデリングは現代的なシーケンスモデリングの中心に留まっているが、Transformerの注意の二次コストは、スケーリングを計算的に禁止する。
線形リカレントモデルは、コンテキストを固定サイズの状態に圧縮し、情報を忘れ、書き、編集するルールを設計の中心的な問題とすることで、このボトルネックに対処する。
状態維持に対処するため、Gated DeltaNet (GDN) はゲート状態の崩壊とデルタルール残差書き込みを結合し、学習可能な係数を使用して、忘れることと更新サイズのバランスを取る。
しかし、この係数は基礎となる目的から導かれるのではなく、経験的に学習されるため、最適下更新等級につながる可能性がある。
我々は、GDNの根底にあるオンライン回帰目標を再考し、Kaczmarz射影法に触発されて、キーノルム正規化された動的ステップサイズ $β_t = η_t / (\|k_t\|_2^2 + ε)$ を残留更新のために導出した。
我々は,状態形状,ゲート,線形再帰,チャンクワイズ並列アルゴリズムを保存したGDNの一スカラー修正であるKaczmarz Linear Attention (KLA)を提案する。
1Bの予算で0.4Bスケールで、KLAは評価された線形時間ベースラインの中で最低の検証難易度を達成し、GDNは8.09対8.50であり、65Kトークンまで安定している。
制御されたタスクでは、KLAはシングルニードル・イン・ア・ヘイスタック検索で100%に達し、8倍のマルチクエリ連想リコールをGDNで7.03ポイント改善し、32Kコンテキストで2.1倍高いデコードスループットを提供する。
これらの結果から,キーノルム正規化Kaczmarz係数はデルタルール列モデルの1次設計軸であり,再帰状態やハードウェアカーネルを変更することなく精度,外挿,復号効率を向上させることが示唆された。
関連論文リスト
- Online Bayesian Node Classification on Inductive Graphs under Distribution Shift [4.1234601543641904]
我々は,エンコーダと近似した最終層後層を共同で訓練する変分ベイズ最終層(VBLL)の目的を導入する。
オンラインGVBLLは、データセット毎に最適な精度と負のログ類似性を達成する唯一の方法である。
最強の非GVBLLベースラインよりも最大17ポイント、Ogbn-arxiv14ポイントの精度が向上する。
論文 参考訳(メタデータ) (2026-09-12T02:23:30Z) - Kalman Delta Networks: Uncertainty-aware Associative Memory [27.530297884143604]
線形ガウス状態空間モデルとして再帰的連想記憶を再構成する。
KDN内では、遷移は記憶状態と不確実性の両方を伝播させる。
KDNの変種は、最先端のリニアアテンションモデルよりも相反するパープレキシティと平均下流精度を向上させる。
論文 参考訳(メタデータ) (2026-09-07T17:53:29Z) - REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - Learning to Solve Generative ODEs Beyond the Linear Span [50.13853710831612]
空間残留演算子を用いてスカラー係数更新を増強する軽量ニューラルソルバであるSpanLiftを提案する。
SpanLiftは、ピクセル空間の拡散、潜水流のマッチング、降水は今、最先端の数ステップのサンプリングを実現している。
論文 参考訳(メタデータ) (2026-06-07T15:22:13Z) - OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention [12.93065958346192]
Online Scaled DeltaNetは、JRTスタイルのインコンテキストリコールをDeltaNetよりも32%改善した。
1.3Bパラメータにスケーリングすると、リコール残差比が39%減少する。
論文 参考訳(メタデータ) (2026-05-13T12:59:26Z) - MDN: Parallelizing Stepwise Momentum for Delta Linear Attention [27.145174798663035]
線形注意(LA)は、大規模言語モデルを長いシーケンスにスケールするための有望なパラダイムを提供する。
Mamba2やGDNのような最近のLAモデルは、線形反復を閉形式オンライン勾配勾配として解釈する。
Momentum DeltaNet (MDN) はTritonカーネルを活用して、競合する線形モデルと同等のトレーニングスループットを実現する。
論文 参考訳(メタデータ) (2026-05-07T08:12:09Z) - Preconditioned DeltaNet: Curvature-aware Sequence Modeling for Linear Recurrences [51.38664601405696]
我々はDeltaNet,GDN,KDAのプレコンディション付き変種を,効率的なチャンクワイズ並列アルゴリズムとともに導入する。
予備条件付きデルタルールの繰り返しは,340M,1Bスケールでの合成リコールベンチマークと言語モデリングにおいて一貫した性能向上をもたらす。
論文 参考訳(メタデータ) (2026-04-22T21:38:25Z) - BASIS: Balanced Activation Sketching with Invariant Scalars for "Ghost Backpropagation" [0.0]
正確なバックプロパゲーションに必要な活性化メモリは、ネットワーク深さ、コンテキスト長、特徴次元と線形にスケールする。
本稿では,活性化メモリをバッチ次元とシーケンス次元から完全に分離する効率的なバックプロパゲーションアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-03-05T20:38:25Z) - Gated KalmaNet: A Fading Memory Layer Through Test-Time Ridge Regression [53.48692193399171]
Gated KalmaNet(GKA)は、次のトークンを予測する際に、すべての過去を説明することによってギャップを低減するレイヤである。
テスト時間におけるオンラインリッジ回帰問題を一定メモリと線形計算コストで解決する。
ロングコンテキストでは、GKAは現実世界のRAGタスクとLongQAタスクを最大128kトークンまで拡張し、他の薄型メモリベースラインよりも10ドル%以上の相対的な改善を実現している。
論文 参考訳(メタデータ) (2025-11-26T03:26:37Z) - Continuous Autoregressive Language Models [56.49239051750678]
我々はCALM(Continuous Autoregressive Language Models)を紹介する。
CALMは高忠実度オートエンコーダを使用して、Kトークンの塊を1つの連続ベクトルに圧縮する。
我々は、堅牢なトレーニング、評価、および制御可能なサンプリングを可能にする包括的可能性のないフレームワークを開発する。
論文 参考訳(メタデータ) (2025-10-31T17:58:11Z) - Comba: Improving Bilinear RNNs with Closed-loop Control [57.800320390698516]
本稿では,これらのモデルの利点と限界を包括的に分析したBilinear RNNの概念を紹介する。
我々は,状態フィードバックと出力フィードバックの両補正を併用した,スカラー+低ランク状態遷移を取り入れた新しいバイリニアRNNであるCombaを提案する。
また,大規模コーパス上での340M/1.3Bパラメータのトレーニングモデルと,ハードウェア効率のよいチャンクワイド並列カーネルを実装した。
論文 参考訳(メタデータ) (2025-06-03T05:44:50Z) - Hyperspherical Normalization for Scalable Deep Reinforcement Learning [57.016639036237315]
SimbaV2は最適化を安定させるために設計された新しい強化学習アーキテクチャである。
57の連続制御タスクにおいて、より大きなモデルとより大きな計算で効果的にスケールアップし、最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-02-21T08:17:24Z) - Robust Implicit Networks via Non-Euclidean Contractions [63.91638306025768]
暗黙のニューラルネットワークは、精度の向上とメモリ消費の大幅な削減を示す。
彼らは不利な姿勢と収束の不安定さに悩まされる。
本論文は,ニューラルネットワークを高機能かつ頑健に設計するための新しい枠組みを提供する。
論文 参考訳(メタデータ) (2021-06-06T18:05:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。