論文の概要: A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets
- arxiv url: http://arxiv.org/abs/2607.02303v1
- Date: Thu, 02 Jul 2026 15:19:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.900156
- Title: A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets
- Title(参考訳): リニアアテンションのためのヒッポカンポ:リカレントステートが何を期待しているかを正確に記憶する
- Authors: Wanyun Cui,
- Abstract要約: HOLA(Hippocampal Linear Attention)は、通常のデルタルール状態を圧縮メモリとして保持し、正確なKVキャッシュを追加する。
15B SlimPajamaトークンでトレーニングされた340万のパラメータで、HOLAはWikitextのパープレキシティを27.32から22.92(-16.1%)に下げる。
また、最高のリニアインコンテキスト検索を実現し、GDNやRULERのニードル・イン・ア・ヘイスタック上のHOLA+リカレンシキャッシュよりもずっと堅牢であり、32kトークン(トレーニング長の16倍)にリコールされる。
- 参考スコア(独自算出の注目度): 14.349344554516259
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Linear-attention and state-space language models compress the prefix into a fixed-size recurrent state, yielding O(1) memory at the cost of a lossy exact memory: when many key--value associations compete, earlier facts are overwritten and needle recall degrades. Inspired by Complementary Learning Systems, we give linear attention a hippocampal complement. HOLA (Hippocampal Linear Attention) keeps the usual delta-rule state as a compressive memory and adds a bounded exact KV cache, forming a semiparametric test-time memory: the state models linearly compressible structure, while the cache stores associations that should not be forced through that state. The cache writes without a learned eviction module, keeping tokens with large beta * ||e||, the prediction residual actually committed to the state; a decoupled RMSNorm-gamma cache read then turns these exact KV pairs into sharp retrieval rather than soft averaging. At 340M parameters trained on 15B SlimPajama tokens, HOLA lowers Wikitext perplexity from 27.32 to 22.92 (-16.1%), below a full-attention Transformer++ (26.88), and improves LAMBADA perplexity from 30.95 to 30.26. It also achieves the best linear in-context retrieval and remains much more robust than GDN or a matched HOLA+recency cache on RULER needle-in-a-haystack recall out to 32k tokens (16x its training length).
- Abstract(参考訳): リニアアテンションとステートスペース言語モデルはプレフィックスを固定サイズのリカレント状態に圧縮し、O(1)メモリを損失の少ない正確なメモリで生成する。
補完学習システムに着想を得て,海馬の補体として線形注意を喚起する。
HOLA (Hippocampal Linear Attention) は通常のデルタルール状態を圧縮メモリとして保持し、半パラメトリックテスト時間メモリ(英語版)を形成する境界正確なKVキャッシュを追加する。
キャッシュは学習した消去モジュールなしで書き込み、大きなベータ*|e||でトークンを保持し、予測残差は実際に状態にコミットする。
15B SlimPajamaトークンでトレーニングされた340Mパラメータで、HOLAはWikitextのパープレキシティを27.32から22.92(-16.1%)に下げ、フルアテンションのTransformer++ (26.88)より低くし、LAMBADAパープレキシティを30.95から30.26に改善した。
また、最高のリニアインコンテキスト検索を実現し、GDNやRULERのニードル・イン・ア・ヘイスタックのHOLA+リカレンシキャッシュよりもずっと堅牢で、32kトークン(トレーニング長の16倍)にリコールされる。
関連論文リスト
- NestedKV: Nested Memory Routing for Long-Context KV Cache Compression [35.62789874560166]
NestedKVは、Nested LearningのContinuum Memory SystemにインスパイアされたキーのみのKVキャッシュ圧縮方式である。
マルチタイムスケールのコサイン異常によってトークンをスコアし、その結果のランキングとトレーニング不要な外部学習者を組み合わせる。
論文 参考訳(メタデータ) (2026-05-26T08:14:39Z) - KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference [9.84177443010824]
KV-Foldは、キー値(KV)キャッシュを列チャンク上の左折り重なりのアキュムレータとして扱う、トレーニング不要な長文推論プロトコルである。
各ステップで、モデルは蓄積されたキャッシュに条件付けられた次のチャンクを処理し、新しく生成されたキーと値を付加し、拡張されたキャッシュを前方に渡す。
Llama-3.1-8Bでは、16Kから128Kのトークンのコンテキストにまたがる152のトライアルで100%の正確なマッチ検索を実現し、単一の40GB GPUのメモリ制限内に留まっている。
論文 参考訳(メタデータ) (2026-05-12T17:53:47Z) - KEEP: A KV-Cache-Centric Memory Management System for Efficient Embodied Planning [8.216400469571084]
効率的な実施計画のためのKVキャッシュ型メモリ管理システムKEEPを提案する。
KEEPは,(1)混合粒度メモリグループによるKVキャッシュ再計算を低減する静的動的メモリ構築アルゴリズム,(2)異なるメモリグループ間の重要なクロスアテンションを動的に識別するマルチホップメモリ再計算アルゴリズム,(3)不均衡なKVキャッシュのロードと異なるレイヤ間のクロスアテンションを排除するレイヤバランスのメモリローディングという3つの重要なイノベーションを特徴としている。
論文 参考訳(メタデータ) (2026-02-27T01:48:07Z) - Learning What to Write: Write-Gated KV for Efficient Long-Context Inference [10.915483460983411]
我々は,KVキャッシュ管理を3つのプリミティブの因果系として定式化した。
我々は、キャッシュに入る前にトークンユーティリティを予測する軽量メカニズムであるWrite-Gated KVを介してKVAdmissionをインスタンス化する。
論文 参考訳(メタデータ) (2025-12-19T11:08:58Z) - OjaKV: Context-Aware Online Low-Rank KV Cache Compression with Oja's Rule [54.37983890753086]
我々は,戦略的ハイブリッドストレージポリシとオンラインサブスペース適応を統合したフレームワークであるOjaKVを紹介する。
OjaKVは、重要かつ最新のトークンをフルランクで保存し、注意のために高忠実なアンカーを維持している。
オンライン主成分分析のためのOjaのアルゴリズムを用いて、プロジェクションベースを漸進的に適応させることにより、低ランク圧縮を適用する。
論文 参考訳(メタデータ) (2025-09-25T21:42:27Z) - Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction [53.83828564664595]
大規模言語モデル(LLM)は、キー値(KV)キャッシュを使用して、シーケンス処理中に履歴情報を格納する。
KVキャッシュ消去の現在の方法は、通常、プレフィルフェーズからの最後のウィンドウをクエリとして利用し、消去のためのKV重要度スコアを計算する。
ソフトトークンリストを組み込んだ新しいトレーニング手法であるジャッジQを提案する。
論文 参考訳(メタデータ) (2025-09-13T03:34:12Z) - CommVQ: Commutative Vector Quantization for KV Cache Compression [50.37946553931796]
本稿では,長期LLM推論におけるメモリ使用量を大幅に削減するために,CommVQ(CommVQ)を提案する。
まず、KVキャッシュを圧縮するための軽量エンコーダとコードブックを用いた加算量子化を導入する。
提案手法は,RoPE-commutative codebook を用いた加算量子化と低オーバーヘッド化により高い精度を実現する。
論文 参考訳(メタデータ) (2025-06-23T17:50:11Z) - Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs [82.08922896531618]
大規模言語モデル(LLM)における生成推論のメモリフットプリントを削減するプラグイン・アンド・プレイ方式である適応KVキャッシュ圧縮を導入する。
我々は,アテンションモジュールの本質的な構造を明らかにするために,ターゲットプロファイリングを行う。
認識された構造に基づいて、我々はKVキャッシュを適応的に構築する: 注意頭上の長距離コンテキストを排除し、局所的なコンテキストを強調し、特別なトークンを中心とした注意頭上の特別なトークンを排除し、すべてのトークンに広く参加する注目頭に対して標準のKVキャッシュのみを使用する。
論文 参考訳(メタデータ) (2023-10-03T05:17:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。