論文の概要: A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets
- arxiv url: http://arxiv.org/abs/2607.02303v1
- Date: Thu, 02 Jul 2026 15:19:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.900156
- Title: A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets
- Title(参考訳): リニアアテンションのためのヒッポカンポ:リカレントステートが何を期待しているかを正確に記憶する
- Abstract要約: HOLA(Hippocampal Linear Attention)は、通常のデルタルール状態を圧縮メモリとして保持し、正確なKVキャッシュを追加する。
15B SlimPajamaトークンでトレーニングされた340万のパラメータで、HOLAはWikitextのパープレキシティを27.32から22.92(-16.1%)に下げる。
また、最高のリニアインコンテキスト検索を実現し、GDNやRULERのニードル・イン・ア・ヘイスタック上のHOLA+リカレンシキャッシュよりもずっと堅牢であり、32kトークン(トレーニング長の16倍)にリコールされる。
- 参考スコア(独自算出の注目度): 14.349344554516259
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Linear-attention and state-space language models compress the prefix into a fixed-size recurrent state, yielding O(1) memory at the cost of a lossy exact memory: when many key--value associations compete, earlier facts are overwritten and needle recall degrades. Inspired by Complementary Learning Systems, we give linear attention a hippocampal complement. HOLA (Hippocampal Linear Attention) keeps the usual delta-rule state as a compressive memory and adds a bounded exact KV cache, forming a semiparametric test-time memory: the state models linearly compressible structure, while the cache stores associations that should not be forced through that state. The cache writes without a learned eviction module, keeping tokens with large beta * ||e||, the prediction residual actually committed to the state; a decoupled RMSNorm-gamma cache read then turns these exact KV pairs into sharp retrieval rather than soft averaging. At 340M parameters trained on 15B SlimPajama tokens, HOLA lowers Wikitext perplexity from 27.32 to 22.92 (-16.1%), below a full-attention Transformer++ (26.88), and improves LAMBADA perplexity from 30.95 to 30.26. It also achieves the best linear in-context retrieval and remains much more robust than GDN or a matched HOLA+recency cache on RULER needle-in-a-haystack recall out to 32k tokens (16x its training length).
- Abstract(参考訳): リニアアテンションとステートスペース言語モデルはプレフィックスを固定サイズのリカレント状態に圧縮し、O(1)メモリを損失の少ない正確なメモリで生成する。
補完学習システムに着想を得て,海馬の補体として線形注意を喚起する。
HOLA (Hippocampal Linear Attention) は通常のデルタルール状態を圧縮メモリとして保持し、半パラメトリックテスト時間メモリ(英語版)を形成する境界正確なKVキャッシュを追加する。
キャッシュは学習した消去モジュールなしで書き込み、大きなベータ*|e||でトークンを保持し、予測残差は実際に状態にコミットする。
15B SlimPajamaトークンでトレーニングされた340Mパラメータで、HOLAはWikitextのパープレキシティを27.32から22.92(-16.1%)に下げ、フルアテンションのTransformer++ (26.88)より低くし、LAMBADAパープレキシティを30.95から30.26に改善した。
また、最高のリニアインコンテキスト検索を実現し、GDNやRULERのニードル・イン・ア・ヘイスタックのHOLA+リカレンシキャッシュよりもずっと堅牢で、32kトークン(トレーニング長の16倍)にリコールされる。
関連論文リスト
- Fixed State, Long Reach: What a Constant-Size Cache Buys Block Diffusion at Scale [18.318746660954663]
ブロック拡散はブロックバイブロックを復号することでキャッシュを復元する。
我々はこのレシピを大規模に研究し,300Bトークン上に3つの3Bブロック拡散復号器を事前学習した。
論文 参考訳(メタデータ) (2026-09-09T23:37:47Z) - Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - Raven: High-Recall Sequence Modeling with Sparse Memory Routing [88.47618436676748]
メモリスロットの固定セットを維持する線形時間シーケンスモデルであるRavenを導入し、各ステップにおいて、学習された入力依存ルーティングによって選択されたサブセットのみを減衰・更新する。
リコール集約ベンチマーク全体では、Ravenは以前のリニアタイムベースラインと競合するか、より優れており、SWAとSSMの両方が大幅に低下する強いロングコンテキストリコールを実現している。
論文 参考訳(メタデータ) (2026-07-28T07:04:32Z) - Forgetful Attention: A Trainable Support-Vector Memory with Certified Selection and Exact Unlearning [0.16921396880325776]
固定ボックスパラメータCの1クラスSfpの支持係数が重みを持つメモリであるSupport Vector Attention(SV-Attention)を導入する。
アクティブセットのパーティションは、リザーブトークンを正確にゼロウェイト、出力ウェイトを与え、インクリメンタルインクリメンタルソルバトークンは、同じCの下で再トレーニングせずに生成した状態を回復する。
また,実文埋め込み上での外科的排除,正確な編集,患者記録の削除,忘れやすい検索メモリも示す。
論文 参考訳(メタデータ) (2026-07-13T23:13:57Z) - NestedKV: Nested Memory Routing for Long-Context KV Cache Compression [35.62789874560166]
NestedKVは、Nested LearningのContinuum Memory SystemにインスパイアされたキーのみのKVキャッシュ圧縮方式である。
マルチタイムスケールのコサイン異常によってトークンをスコアし、その結果のランキングとトレーニング不要な外部学習者を組み合わせる。
論文 参考訳(メタデータ) (2026-05-26T08:14:39Z) - CAMeR: Keyword-Gated Hybrid Activation for Adaptive Memory Retention in LLM Agents [0.7977229957867867]
大規模言語モデル(LLM)エージェントは、膨大な量の情報を蓄積する。
本稿では,キーワード付きハイブリッドアクティベーションを組み合わせたメモリ保持フレームワークCAMeRを提案する。
CAMeR-Benchでは、CAMeRのキーワードゲートは、高周波と非参照メモリの間の保持ギャップが1.6$times$大きい。
論文 参考訳(メタデータ) (2026-05-15T01:38:30Z) - KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference [9.84177443010824]
KV-Foldは、キー値(KV)キャッシュを列チャンク上の左折り重なりのアキュムレータとして扱う、トレーニング不要な長文推論プロトコルである。
各ステップで、モデルは蓄積されたキャッシュに条件付けられた次のチャンクを処理し、新しく生成されたキーと値を付加し、拡張されたキャッシュを前方に渡す。
Llama-3.1-8Bでは、16Kから128Kのトークンのコンテキストにまたがる152のトライアルで100%の正確なマッチ検索を実現し、単一の40GB GPUのメモリ制限内に留まっている。
論文 参考訳(メタデータ) (2026-05-12T17:53:47Z) - KEEP: A KV-Cache-Centric Memory Management System for Efficient Embodied Planning [8.216400469571084]
効率的な実施計画のためのKVキャッシュ型メモリ管理システムKEEPを提案する。
KEEPは,(1)混合粒度メモリグループによるKVキャッシュ再計算を低減する静的動的メモリ構築アルゴリズム,(2)異なるメモリグループ間の重要なクロスアテンションを動的に識別するマルチホップメモリ再計算アルゴリズム,(3)不均衡なKVキャッシュのロードと異なるレイヤ間のクロスアテンションを排除するレイヤバランスのメモリローディングという3つの重要なイノベーションを特徴としている。
論文 参考訳(メタデータ) (2026-02-27T01:48:07Z) - Learning What to Write: Write-Gated KV for Efficient Long-Context Inference [10.915483460983411]
我々は,KVキャッシュ管理を3つのプリミティブの因果系として定式化した。
我々は、キャッシュに入る前にトークンユーティリティを予測する軽量メカニズムであるWrite-Gated KVを介してKVAdmissionをインスタンス化する。
論文 参考訳(メタデータ) (2025-12-19T11:08:58Z) - OjaKV: Context-Aware Online Low-Rank KV Cache Compression with Oja's Rule [54.37983890753086]
我々は,戦略的ハイブリッドストレージポリシとオンラインサブスペース適応を統合したフレームワークであるOjaKVを紹介する。
OjaKVは、重要かつ最新のトークンをフルランクで保存し、注意のために高忠実なアンカーを維持している。
オンライン主成分分析のためのOjaのアルゴリズムを用いて、プロジェクションベースを漸進的に適応させることにより、低ランク圧縮を適用する。
論文 参考訳(メタデータ) (2025-09-25T21:42:27Z) - Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction [53.83828564664595]
大規模言語モデル(LLM)は、キー値(KV)キャッシュを使用して、シーケンス処理中に履歴情報を格納する。
KVキャッシュ消去の現在の方法は、通常、プレフィルフェーズからの最後のウィンドウをクエリとして利用し、消去のためのKV重要度スコアを計算する。
ソフトトークンリストを組み込んだ新しいトレーニング手法であるジャッジQを提案する。
論文 参考訳(メタデータ) (2025-09-13T03:34:12Z) - CommVQ: Commutative Vector Quantization for KV Cache Compression [50.37946553931796]
本稿では,長期LLM推論におけるメモリ使用量を大幅に削減するために,CommVQ(CommVQ)を提案する。
まず、KVキャッシュを圧縮するための軽量エンコーダとコードブックを用いた加算量子化を導入する。
提案手法は,RoPE-commutative codebook を用いた加算量子化と低オーバーヘッド化により高い精度を実現する。
論文 参考訳(メタデータ) (2025-06-23T17:50:11Z) - Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs [82.08922896531618]
大規模言語モデル(LLM)における生成推論のメモリフットプリントを削減するプラグイン・アンド・プレイ方式である適応KVキャッシュ圧縮を導入する。
我々は,アテンションモジュールの本質的な構造を明らかにするために,ターゲットプロファイリングを行う。
認識された構造に基づいて、我々はKVキャッシュを適応的に構築する: 注意頭上の長距離コンテキストを排除し、局所的なコンテキストを強調し、特別なトークンを中心とした注意頭上の特別なトークンを排除し、すべてのトークンに広く参加する注目頭に対して標準のKVキャッシュのみを使用する。
論文 参考訳(メタデータ) (2023-10-03T05:17:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。