論文の概要: Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing
- arxiv url: http://arxiv.org/abs/2607.07953v1
- Date: Wed, 08 Jul 2026 22:14:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.352921
- Title: Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing
- Title(参考訳): 線形アテンションアーキテクチャ:メカニズム、トレードオフ、階層間ルーティング
- Abstract要約: 自己注意により、各トークンは完全なコンテキストから情報を取得することができるが、シーケンス長のトレーニングと長いコンテキストでの推論のコストは二次的である。
我々は、これらのメカニズムを共通のリカレントメモリ表記法で表現する。
DeltaNetスタイルのメモリに軽量な層間転送機構を導入,評価する。
- 参考スコア(独自算出の注目度): 5.945255135393071
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-attention lets each token retrieve information from the full context, but its quadratic cost in sequence length limits training and inference at long context. This paper presents a comparative study of softmax attention and four recent recurrent linear-attention architectures: DeltaNet, Gated DeltaNet, Kimi Delta Attention, and Gated DeltaNet-2. We express these mechanisms in a common recurrent-memory notation, making explicit how they differ in expressivity, memory decay, erase and write control, training throughput, and implementation complexity. Our experiments center on 350M-parameter models trained for 15B tokens, and include optimizer and learning-rate comparisons, hybrid-versus-pure stack comparisons, sequence-length runtime measurements, larger DeltaNet runs at 1.3B and 3B parameters, and a small set of downstream evaluations. The reported speed results measure training throughput and iteration time; we do not provide an empirical inference-speed benchmark. Within the reported 350M-parameter, 15B-token sweep, Kimi Delta Attention with Muon reaches the lowest final validation loss, a pure Gated DeltaNet stack trained with AdamW has the highest normalized training throughput, hybrid stacks generally improve loss at a throughput cost, and Muon consistently lowers final validation loss relative to AdamW in the matched architecture settings we evaluate. We introduce and evaluate lightweight cross-layer routing mechanisms for DeltaNet-style memories. The most natural DeltaNet-inspired formulation, forwarding a lower layer's delta-rule write error into the next layer's value target, does not improve over matched baselines. Routing into the aligned hidden stream and forwarding the write value instead yields a modest improvement in the matched runs we report: Cross-Layer Value Routing (CLVR) lowers final validation loss for both DeltaNet and Gated DeltaNet.
- Abstract(参考訳): 自己注意により、各トークンは完全なコンテキストから情報を取得することができるが、シーケンス長における2次コストは、長いコンテキストでのトレーニングと推論を制限する。
本稿では,ソフトマックスアテンションと最近のリカレントリニアアテンションアーキテクチャであるDeltaNet,Gated DeltaNet,Kim Delta Attention,Gated DeltaNet-2の比較検討を行う。
我々は、これらのメカニズムを共通のリカレントメモリ表記法で表現し、表現性、メモリ劣化、消去と書き込み制御、トレーニングのスループット、実装の複雑さの違いを明確にする。
実験では,15Bトークンをトレーニングした350Mパラメータモデルを中心に,最適化と学習速度比較,ハイブリッド・ヴァーサス・プアスタック比較,シーケンス長実行時測定,1.3Bおよび3BパラメータでのDeltaNetの大規模実行,ダウンストリーム評価の小規模なセットについて検討した。
報告された速度は、トレーニングのスループットとイテレーション時間を測定します。
また、AdamWでトレーニングされた純粋なGated DeltaNetスタックは、最高の正規化されたトレーニングスループットを持ち、ハイブリッドスタックは一般的にスループットコストで損失を改善する。
DeltaNetスタイルのメモリのための軽量な層間ルーティング機構を導入・評価する。
最も自然なDeltaNetにインスパイアされた定式化は、下位層のデルタルール書き込みエラーを次の層の値ターゲットに転送するが、一致したベースラインよりも改善されない。
Cross-Layer Value Routing (CLVR)は、DeltaNetとGated DeltaNetの両方の最終的なバリデーション損失を下げます。
関連論文リスト
- On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - Autoencoder Architectures for Athlete Performance Scoring from Wearable Telemetry [0.0]
本稿では,9つのセンサランナープロファイルを1つのスカラー性能指標である潜時スコアに圧縮する能力について,次元縮小モデル,3種類のオートエンコーダ,PCA,変分オートエンコーダについて検討する。
論文 参考訳(メタデータ) (2026-06-26T14:41:24Z) - REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention [81.79922329750674]
リニアアテンションは、ソフトマックスアテンションのキャッシュを固定サイズのリカレント状態に置き換え、シーケンシャルミキシングを線形時間に短縮し、定メモリに復号する。
我々はGated DeltaNet-2を紹介し、Gated DeltaNetとKim Delta Attentionの両方を一般化する。
Gated DeltaNet-2は、言語モデリング、常識推論、検索にまたがるMamba Gated DeltaNet、KDA、Mamba-3の変種の中で、最も優れた総合的な結果を得る。
論文 参考訳(メタデータ) (2026-05-21T17:44:57Z) - Preconditioned DeltaNet: Curvature-aware Sequence Modeling for Linear Recurrences [51.38664601405696]
我々はDeltaNet,GDN,KDAのプレコンディション付き変種を,効率的なチャンクワイズ並列アルゴリズムとともに導入する。
予備条件付きデルタルールの繰り返しは,340M,1Bスケールでの合成リコールベンチマークと言語モデリングにおいて一貫した性能向上をもたらす。
論文 参考訳(メタデータ) (2026-04-22T21:38:25Z) - The Delta Learning Hypothesis: Preference Tuning on Weak Data can Yield Strong Gains [50.66245575710432]
個々のデータポイントからなるペアの嗜好データにより、個々のデータポイントの強度を超える利得が得られることを示す。
私たちの研究は、モデルが一般的に弱いと考えられるペアデータから驚くほどうまく学習できることを示しています。
論文 参考訳(メタデータ) (2025-07-08T17:14:44Z) - DeltaProduct: Improving State-Tracking in Linear RNNs via Householder Products [60.72655477351486]
リニアリカレントニューラルネットワーク(線形RNN)は、シーケンスモデリングのためのトランスフォーマーの競合代替手段として登場した。
既存のアーキテクチャは、表現性と効率の基本的なトレードオフに直面しており、状態遷移行列の構造によって規定されている。
論文 参考訳(メタデータ) (2025-02-14T16:59:05Z) - Gated Delta Networks: Improving Mamba2 with Delta Rule [64.58149707073915]
Gated DeltaNetは、複数のベンチマークで、Mamba2やDeltaNetのような既存のモデルを一貫して上回っている。
我々は,Gated DeltaNet 層とスライディングウィンドウアテンション,あるいは Mamba2 層を組み合わせたハイブリッドアーキテクチャを開発し,学習効率の向上とタスク性能の向上を実現した。
論文 参考訳(メタデータ) (2024-12-09T13:09:04Z) - Freshness or Accuracy, Why Not Both? Addressing Delayed Feedback via
Dynamic Graph Neural Networks [23.952923773407043]
遅延フィードバック問題は、変換率を予測する上で最も困難な課題の1つである。
動的グラフニューラルネットワーク(DGDFEM)による遅延フィードバックモデリングを提案する。
データパイプラインの作成、動的グラフの構築、CVR予測モデルのトレーニングという3つのステージが含まれている。
論文 参考訳(メタデータ) (2023-08-15T23:49:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。