論文の概要: Maglev: Sliding Recurrent Memory
- arxiv url: http://arxiv.org/abs/2608.02870v2
- Date: Wed, 05 Aug 2026 16:58:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.238849
- Title: Maglev: Sliding Recurrent Memory
- Title(参考訳): Maglev: リカレントメモリのスライディング
- Authors: Bo Liu, Qiang Liu,
- Abstract要約: 我々のアーキテクチャは、スライディングウインドウの注意を一般化する固定サイズのメモリを備えたリカレントトランスフォーマーアーキテクチャである。
私たちは、$m_t$と$m'_t$を一致させるメモリ一貫性の損失でトレーニングします。
- 参考スコア(独自算出の注目度): 8.788753986099902
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce \ours{}, a recurrent Transformer architecture with fixed-size memory that generalizes sliding-window attention while remaining parallelizable during training. \ours{} consists of two coupled models: a prefiller $Q$, which leverages full attention\footnote{In practice, we use interleaved full and sliding-window attention for $Q$, as this yields stronger performance. The essential requirement is that $Q$ be more expressive than $P$, with access to the full history.} to produce memory targets $m'_t$, and a decoder $P$, which uses only sliding-window attention and recurrent K/V injection to produce decoder memories $m_t$ for next-token prediction. We train \ours{} with a memory consistency loss that aligns $m_t$ with $m'_t$, allowing inference to use $P$ alone. Empirically, \ours{} improves validation loss and downstream pretraining benchmarks over sliding-window and latent recurrent transformer baselines. Moreover, sharing parameters between $P$ and $Q$ reduces parameter memory while preserving most of the gains.
- Abstract(参考訳): トレーニング中に並列化を保ちながらスライディングウインドウの注意を一般化する固定サイズのメモリを備えたリカレントトランスフォーマーアーキテクチャである \ours{} を導入する。
プリフィル(prefiller)$Q$(prefiller) $Q$(prefiller) $Q$(prefiller) $Q$(prefiller) $Q$(prefiller) $Q$(prefiller) $Q$(prefiller) $Q$(prefiller) $Q$(prefiller) $Q$(prefiller)$)。
必須要件は、$Q$が$P$よりも表現力が高く、すべての履歴にアクセスすることである。
これは、スライディングウィンドウアテンションとK/Vインジェクションのみを使用して、次のトーケン予測のためにデコーダメモリ$m_t$を生成する。
私たちは、$m_t$と$m'_t$を調整したメモリ一貫性の損失で \ours{} をトレーニングします。
経験的に、‘ours{} はスライディングウインドウと遅延リカレントトランスフォーマーベースラインよりも検証損失と下流事前トレーニングベンチマークを改善する。
さらに、$P$と$Q$のパラメータ共有は、ほとんどのゲインを保持しながらパラメータメモリを削減する。
関連論文リスト
- Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes [70.61868608402723]
我々は$textbfSelf-Correcting Coupled Markov Jump Processes (SC-CMJP)を紹介する。
SC-CMJPと組み合わせて、共同マルチモーダルジェネレーションのための新しいトレーニングフリーシングルパスサンプリングであるtextttCO_texttt2textttJump$を紹介する。
トレーニングと評価のために,我々は3つの大規模ジョイントマルチモーダル生成コーパスを作成し,リリースする。
論文 参考訳(メタデータ) (2026-07-14T18:39:29Z) - Enhancing Software Engineering Through Closed-Loop Memory Optimization [50.418699819003486]
ソフトウェア工学 (SE) エージェントにおけるメモリ拡張のためのクローズドループフレームワークである ours を紹介する。
タスクに依存しない textbf ベンチマークとアノテーションのない textbf 最適化信号としての有用性を確立する。
その結果、SEエージェントは設定によって常に改善され、成功率で$uparrow5.25%、解決効率で$uparrow4.63%という絶対的なゲインが得られることが示された。
論文 参考訳(メタデータ) (2026-06-04T03:17:21Z) - Tensor Cache: Eviction-conditioned Associative Memory for Transformers [20.67103891489219]
キャッシュは、第1レベルのキャッシュ(L1)としてスライディングウインドウのソフトマックスの注意を、固定サイズの外積高速なメモリとして、ウィンドウから放出されるKVペアによって供給される第2レベルのキャッシュとする。
取り除かれたペアは、層ごとの行列に$A$に圧縮され、単一の行列乗算によって将来のクエリによって読み込まれる。
論文 参考訳(メタデータ) (2026-05-21T00:21:51Z) - Inhibitory Cross-Talk Enables Functional Lateralization in Attention-Coupled Latent Memory [0.0]
本稿では,検索,統合,書き込みバック操作を同時に行うメモリ拡張変換器を提案する。
我々は、メモリを左右に分割し、符号制御されたクロストーク行列$W_s$で結合し、この結合の符号が特殊化に決定的であることを示す。
論文 参考訳(メタデータ) (2026-02-27T08:58:51Z) - Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution [52.76038908826961]
我々は静的ストレージと動的推論のギャップを埋めるため、$textbfReMe$ ($textitRemember Me, Refine Me$)を提案する。
ReMeは3つのメカニズムを通じてメモリライフサイクルを革新する: $textitmulti-faceted distillation$, きめ細かい経験を抽出する。
BFCL-V3とAppWorldの実験では、ReMeが新しい最先端のエージェントメモリシステムを確立している。
論文 参考訳(メタデータ) (2025-12-11T14:40:01Z) - QKV Projections Require a Fraction of Their Memory [11.048086031066623]
本稿では,注意層におけるQ,K,V$プロジェクションのメモリ消費を最大512ドルまで削減するテンソル圧縮手法を提案する。
PAMMはFlashAttentionのような効率的な注意手法で完全に構成可能であり、メモリ効率のLLMトレーニングのための実用的で補完的な方法である。
論文 参考訳(メタデータ) (2025-06-03T14:37:17Z) - Scaling Embedding Layers in Language Models [61.939921364422936]
$SCONE$は入力埋め込み層を拡張して言語モデルのパフォーマンスを向上させる新しいメソッドである。
SCONE$は、n-gramの頻繁なセットに埋め込みを導入しながら、元の語彙を保持します。
これらの埋め込みは、各入力トークンに対してコンテキスト化された表現を提供し、トレーニング中に別のモデルで学習する。
$SCONE$は、n-gram埋め込みの数を増やし、それらを学ぶために使用するモデルをスケーリングする、という2つの新しいスケーリング戦略を可能にします。
論文 参考訳(メタデータ) (2025-02-03T18:59:32Z) - Sub-Linear Memory: How to Make Performers SLiM [38.068090269482425]
vanilla Transformerは、入力長$L$の関数としてシリアル時間とメモリで$O(L2)$を必要とする。
最近の研究は、連続計算に$o(l)$でしかスケールしない様々な線形自己アテンション機構を提案している。
計算の柔軟性は顕著であり, サブリニアメモリを用いた近似をすることなく, 前方および後方の伝播を行うことができる。
論文 参考訳(メタデータ) (2020-12-21T13:56:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。