論文の概要: DeltaLog: Deferred Materialization of Recurrent States for Linear Attention Decoding
- arxiv url: http://arxiv.org/abs/2608.15533v1
- Date: Sun, 16 Aug 2026 05:04:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.329903
- Title: DeltaLog: Deferred Materialization of Recurrent States for Linear Attention Decoding
- Title(参考訳): DeltaLog:リニアアテンションデコーディングのためのリカレントステートのマテリアル化
- Abstract要約: 線形アテンションモデルでは、ペアワイズトークンの相互作用をリカレント状態更新に置き換えることで、2次プレフィックス計算と、ソフトマックスアテンションの文脈成長KVキャッシュを排除している。
既存の復号化実装は、生成されたトークン毎に完全な再帰状態を実現し、書き戻すことが多い。
本稿では,モデルセマンティクスを変更することなく,このオーバヘッドを低減する再帰状態復号方式であるDeltaLogを提案する。
- 参考スコア(独自算出の注目度): 6.8533987856750045
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Linear attention models eliminate the quadratic prefix computation and context-growing KV cache of softmax attention by replacing pairwise token interactions with recurrent state updates. However, existing decoding implementations often materialize and write back the full recurrent state after every generated token, making state maintenance a major source of memory traffic, especially for models with large states and many heads. This paper presents DeltaLog, a recurrent-state decoding scheme that reduces this overhead without changing the model semantics. Specifically, DeltaLog represents the recurrent state as a dense base state together with a bounded log of recent compact updates. Most decode steps append only compact update factors to this log, while periodic merge steps fold the accumulated updates back into the dense base state. Thus, the model observes the same dense state as in eager decoding, but most full-state write-backs are replaced by lightweight append operations. We implement DeltaLog for GDN, KDA, and RWKV6 and integrate it into a prototype serving stack. Across these models, DeltaLog accelerates the recurrent-state update kernel by up to $1.86\times$, reduces profiled recurrent-state write traffic by up to $7.83\times$, and achieves $1.05$--$1.20\times$ end-to-end serving speedups over dense recurrent baselines.
- Abstract(参考訳): 線形アテンションモデルでは、ペアワイズトークンの相互作用をリカレント状態更新に置き換えることで、2次プレフィックス計算と、ソフトマックスアテンションの文脈成長KVキャッシュを排除している。
しかし、既存の復号化実装は、生成されるトークン毎に完全な再帰状態を生成して書き戻すことが多く、特に大きな状態と多くのヘッドを持つモデルでは、状態のメンテナンスがメモリトラフィックの主要なソースとなる。
本稿では,モデルセマンティクスを変更することなく,このオーバヘッドを低減する再帰状態復号方式であるDeltaLogを提案する。
具体的には、DeltaLogは、最近のコンパクトアップデートのバウンドログとともに、リカレントステートを密度の高いベースステートとして表現する。
ほとんどのデコードステップは、このログにコンパクトな更新要素のみを付加するが、定期的なマージステップは、蓄積した更新を高密度のベース状態に折り畳む。
したがって、このモデルは熱心に復号するのと同じ密度の状態を観測するが、ほとんどのフルステートの書き込みは軽量な追加操作に置き換えられる。
GDN,KDA,RWKV6用のDeltaLogを実装し,プロトタイプサービススタックに統合する。
これらのモデル全体で、DeltaLogはリカレントステート更新カーネルを最大1.86\times$で高速化し、プロファイルされたリカレントステート書き込みトラフィックを最大7.83\times$で削減し、1.05$--$1.20\times$高密度リカレントベースライン上でエンドツーエンドのサービススピードアップを達成する。
関連論文リスト
- TreeWY: Speculative Verification for Gated DeltaNet Hybrids [0.0]
階層はリニアアテンション(Gated DeltaNet, GDN)層であり、キーバリューキャッシュの増大ではなく、小さな固定サイズのリカレントステートを持つ。
今日のシステムは、GDNレイヤのすべてのドラフト位置でフルリカレントステートをスナップショットし、これらのスナップショットはドラフトツリーのブランチ間で共有することはできない。
すべてのドラフトノードの出力を1つの三角形の解で計算し、コミット時に受け入れられた状態のみを再構築する。
論文 参考訳(メタデータ) (2026-08-21T10:31:15Z) - Raven: High-Recall Sequence Modeling with Sparse Memory Routing [88.47618436676748]
メモリスロットの固定セットを維持する線形時間シーケンスモデルであるRavenを導入し、各ステップにおいて、学習された入力依存ルーティングによって選択されたサブセットのみを減衰・更新する。
リコール集約ベンチマーク全体では、Ravenは以前のリニアタイムベースラインと競合するか、より優れており、SWAとSSMの両方が大幅に低下する強いロングコンテキストリコールを実現している。
論文 参考訳(メタデータ) (2026-07-28T07:04:32Z) - Persistent Computational State: A Session-Centric Runtime for Generative World Models [4.4664120040328035]
ジェネレーティブワールドモデルはシミュレーターとしてますます推進されている。
最近のベンチマークでは、現在のビデオワールドモデルは、この使用を失敗している。
この属性は不完全であり、重要なモデルのクラスは単に間違っている。
論文 参考訳(メタデータ) (2026-07-23T14:39:46Z) - DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models [61.3037243251433]
現在のUnified Large Multimodal Models (ULMM) は、テキスト推論と中間視覚状態によるインターリーブされたマルチモーダル推論をサポートする。
このフルイメージ生成パラダイムは、実質的な視覚的冗長性を導入し、スパースで推論クリティカルな状態遷移を監督する。
フルイメージ生成を視覚的更新に置き換えるULMMであるDeltaVを提案する。
論文 参考訳(メタデータ) (2026-07-09T12:54:05Z) - Execution-State Capsules: Graph-Bound Execution-State Checkpoint and Restore for Low-Latency, Small-Batch, On-Device Physical-AI Serving [0.5076419064097734]
我々は、低レイテンシ、小バッチ、デバイス上の物理AIサービスという、反対の体制について研究する。
完全復元可能な状態に対するグラフバウンドチェックポイントと復元機構である実行状態カプセルを導入する。
これにより、トークンアドレス付きKVフラグメントからグラフバウンド実行状態境界への再利用が実現される。
論文 参考訳(メタデータ) (2026-06-18T17:49:36Z) - DeltaBox: Scaling Stateful AI Agents with Millisecond-Level Sandbox Checkpoint/Rollback [4.718590395003422]
既存のメカニズムは状態全体を複製し、C/Rあたり数百ミリ秒から秒のレイテンシを発生させる。
本稿では,AIエージェントに対する変更ベースのトランザクションC/Rを実現するため,新しいOSレベルの抽象化であるDeltaStateを提案する。
2つの新しいメカニズムによりミリ秒単位のC/Rを実現する新しいエージェントであるDeltaBoxを提案する。
論文 参考訳(メタデータ) (2026-05-21T17:36:17Z) - Preconditioned DeltaNet: Curvature-aware Sequence Modeling for Linear Recurrences [51.38664601405696]
我々はDeltaNet,GDN,KDAのプレコンディション付き変種を,効率的なチャンクワイズ並列アルゴリズムとともに導入する。
予備条件付きデルタルールの繰り返しは,340M,1Bスケールでの合成リコールベンチマークと言語モデリングにおいて一貫した性能向上をもたらす。
論文 参考訳(メタデータ) (2026-04-22T21:38:25Z) - Evolving Beyond Snapshots: Harmonizing Structure and Sequence via Entity State Tuning for Temporal Knowledge Graph Forecasting [7.888094875654798]
時間的知識グラフ(TKG)予測には、スナップショット内の構造的依存関係とスナップショット間の時間的進化を共同でモデル化する必要がある。
我々は,TKG予測器に永続的かつ連続的に進化するエンティティ状態を与えるエンコーダに依存しないフレームワークであるEntity State Tuning (EST)を提案する。
ESTはグローバルな状態バッファを保持し、クローズドループ設計を通じて構造的エビデンスとシーケンシャルな信号とを段階的に整列する。
論文 参考訳(メタデータ) (2026-02-12T20:33:35Z) - EmbeddingRWKV: State-Centric Retrieval with Reusable States [12.535698360263988]
State-Centric Retrievalは、埋め込みモデルと再ランカを接続するブリッジとして"states"を利用する統一的な検索パラダイムである。
テストの結果,システム全体の効率を大幅に向上させながら,高品質な検索と再ランク付けを実現していることがわかった。
論文 参考訳(メタデータ) (2026-01-10T03:29:43Z) - Diffusion Language Models Know the Answer Before Decoding [56.96815863705218]
拡散言語モデル (DLM) は自己回帰的アプローチの代替として登場した。
我々の研究は、DLMの早期回答収束の見過ごされた特性を強調し、活用する。
Prophetは、早期コミット復号を可能にするトレーニングフリーの高速復号化パラダイムである。
論文 参考訳(メタデータ) (2025-08-27T15:40:25Z) - Scaling Linear Attention with Sparse State Expansion [62.749291436866606]
トランスフォーマーアーキテクチャは、2次計算と線形メモリ成長による長期コンテキストシナリオに苦慮している。
より効率的な文脈圧縮を実現するための2つの重要な革新を提案する。
まず、情報分類として状態更新を概念化し、線形注意のための行スパース更新定式化を導入する。
次に、スパースフレームワーク内にスパース状態拡張(SSE)を示し、コンテキスト状態を複数のパーティションに拡張する。
論文 参考訳(メタデータ) (2025-07-22T13:27:31Z) - On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention [53.22963042513293]
大規模言語モデル(LLM)は、自己アテンションを通じてグローバルトークンの依存関係をキャプチャするが、長い入力に対する計算とメモリコストに直面する。
まず,二状態線形注意(Dual-state linear attention, A)を提案する。これは2つの隠れ状態を保持する設計であり,その1つは,リニアアテンションアーキテクチャの典型的な短距離バイアスを緩和し,リニアアテンションを追尾するものである。
本稿では,DSLA層を段階的に置き換えるオンライン適応蒸留フレームワークであるDSLA-Serveを紹介する。
論文 参考訳(メタデータ) (2025-06-11T01:25:06Z) - NAMER: Non-Autoregressive Modeling for Handwritten Mathematical Expression Recognition [80.22784377150465]
手書き数学的表現認識(HMER)は、文書理解における多種多様な応用のために、パターン認識において大きな注目を集めている。
本稿では,HMERのためのボトムアップ非自己回帰モデリング手法であるNAMERを初めて構築する。
NAMERは、VAT(Visual Aware Tokenizer)とPGD(Parallel Graph)を備える。
論文 参考訳(メタデータ) (2024-07-16T04:52:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。