論文の概要: Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention
- arxiv url: http://arxiv.org/abs/2607.09889v1
- Date: Fri, 10 Jul 2026 18:28:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.238411
- Title: Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention
- Title(参考訳): 個別のアイテムを忘れずに - 状態空間モデルと注意の間の学習可能なDirichlet-Processキャッシュ
- Authors: Siddharth Pal, Viktoria Rojkova,
- Abstract要約: 本稿では,入力が新規である場合にのみスロットを割り当てるスパースキャッシュについて検討する。
固定濃度の静的キャッシュと,最近の新規性率に追従したサプライズ適応変種という2つの形態で開発する。
- 参考スコア(独自算出の注目度): 0.48342038441006796
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Fixed-state sequence models compress an unbounded past into a bounded state, which caps their associative recall at roughly the state dimension; attention escapes the cap by keeping a key-value entry for every token, at quadratic compute and a cache that grows with the sequence. We study the middle ground: a sparse cache that allocates a slot only when an input is novel, so its size tracks the number of distinct items rather than the number of tokens. The allocation rule is the DP-means clustering rule, the small-variance limit of a Dirichlet-process mixture, used not as latent-variable inference but as the key-value memory operator for a deep recurrent backbone. We develop it in two forms, a static cache with a fixed concentration and a surprise-adaptive variant whose concentration follows the recent novelty rate. On a controlled associative-recall benchmark with redundancy we show that the cache matches full-attention recall while storing only the distinct items, that it dominates a fixed-budget eviction cache on the recall-versus-size frontier, and that on a state-space backbone it answers both a recall query and a long-range aggregate at the lowest memory of any model tested. The allocation is learnable end to end: a two-parameter novelty-threshold gate trained on the task loss alone recovers the rule exactly, whereas an over-parameterized gate fails, so the operative ingredient is the inductive bias rather than capacity. The evidence is a family of controlled mechanism studies at modest scale, with the distinct-items property confirmed on four real streams (recommendation, systems logs, clinical events, and insurance claims); a real-backbone, real-corpus language validation is pursued in a companion study.
- Abstract(参考訳): 固定状態シーケンスモデルは、非有界な過去を有界な状態に圧縮し、大まかに状態次元で連想的リコールをカプセル化する。
入力が新規である場合にのみスロットを割り当てるスパースキャッシュで、そのサイズはトークンの数ではなく、異なるアイテムの数を追跡する。
割り当てルールはDP-meansクラスタリングルールであり、ディリクレ-プロセス混合の小さな分散制限であり、潜在変数推論ではなく、深いリカレントバックボーンのキー値メモリ演算子として使われる。
固定濃度の静的キャッシュと,最近の新規性率に追従したサプライズ適応変種という2つの形態で開発する。
冗長性のある制御されたアソシエイト・リコールベンチマークでは、キャッシュは、異なるアイテムのみを格納しながら、フルアテンション・リコールと一致し、リコール・リバース・サイズフロンティアの固定予算削減キャッシュを支配し、ステートスペースバックボーンでは、テスト対象モデルの最低メモリにおけるリコールクエリと長距離アグリゲーションの両方に応答することを示す。
割り当ては、タスク損失だけで訓練された2パラメータのノベルティホールドゲートがルールを正確に回復するのに対して、オーバーパラメータ化ゲートは失敗するため、動作成分はキャパシティよりも誘導バイアスである。
この証拠は, 4つの実ストリーム(勧告, システムログ, 臨床イベント, 保険請求)において, 個別項目の属性が確認され, 実バックボーン, 実コーパス言語検証が共同研究で進められている。
関連論文リスト
- Context by Distinct Information: An Auditable Dirichlet-Process Working Memory for Long, Redundant Context Streams [0.48342038441006796]
作業メモリコンポーネントとしてアロケーション・オン・ノベルティキャッシュを開発します。
また,トークンの約半数に到達しながら,新規な注目度がフルアテンション性能に達することを示す。
実験は小規模で、公開データのみを使用する。
論文 参考訳(メタデータ) (2026-07-11T18:58:22Z) - What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents [1.0742675209112622]
4つの研究コミュニティがそれぞれ,大規模言語メモリのコンパクト化を学んでいることを示す。
我々は、これらが1つの問題の例であると主張する。
このレンズを1つのコンパクト化目標と層に依存しない下界で正確にし、スタック全体からメソッドを一様に分類する7軸分類法を構築するために使用する。
論文 参考訳(メタデータ) (2026-07-09T01:15:03Z) - Interdomain Attention: Beyond Token-Level Key-Value Memory [15.708551010135407]
本稿では,カーネルメソッドを通じてSSMをアテンションモジュールに統合するインタードメインアテンションを提案する。
注意カーネルは有限特徴写像によって近似され、結果として得られる主要な特徴と値は、基底関数の共有集合に投影される。
それぞれのクエリは、自身の特徴マップを通じて圧縮された係数に対応し、固定サイズの状態上でクエリ条件付き注意を回復する。
論文 参考訳(メタデータ) (2026-05-23T01:18:00Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - A Parametric Memory Head for Continual Generative Retrieval [52.66674234249913]
生成情報検索(GenIR)は、検索を単一のニューラルモデルに統合し、クエリから直接ドキュメント識別子(ドシデント)をデコードする。
逐次適応は、新たに追加された文書の検索を改善するが、以前のスライスの性能は著しく低下することを示す。
本稿では,モジュール型パラメトリックメモリヘッドで適応モデルを拡張するメモリのみの安定化ステージである,後適応メモリチューニング(PAMT)を提案する。
論文 参考訳(メタデータ) (2026-04-25T17:38:51Z) - Sparse Prefix Caching for Hybrid and Recurrent LLM Serving [0.7284556903703034]
重なり合う深さの分布の下で,スパースプレフィックスキャッシングをチェックポイント配置として定式化する。
リクエストが非自明なプレフィックスを共有する場合、実世界のデータ上で標準非対称性によって追跡されるフロンティアを一貫して改善することを示す。
正確な出力を保持し、リカレント計算自体を変更したり、新しいリカレント更新カーネルを必要としたりしない。
論文 参考訳(メタデータ) (2026-04-17T09:24:58Z) - Evoking User Memory: Personalizing LLM via Recollection-Familiarity Adaptive Retrieval [59.295767860331004]
RF-Memは、親しみやすい不確実性誘導デュアルパスメモリレトリバーである。
それは、人間のようなデュアルプロセス認識をレトリバーに埋め込む。
一定の予算とレイテンシの制約の下で、ワンショット検索とフルコンテキスト推論を一貫して上回る。
論文 参考訳(メタデータ) (2026-03-10T06:31:44Z) - Emergence of Primacy and Recency Effect in Mamba: A Mechanistic Point of View [16.8179962093575]
予備効果と回帰効果を行動ツールとして用いた状態空間言語モデルの記憶について検討し、時間とともに情報がどのように保持され忘れられているかを明らかにする。
構造的リコールタスクをMambaアーキテクチャに適用し、入力シーケンスの開始と終了における強い性能を示す、一貫したU字型精度プロファイルを観察する。
論文 参考訳(メタデータ) (2025-06-18T06:02:02Z) - Efficient Inference of Vision Instruction-Following Models with Elastic Cache [76.44955111634545]
我々は,命令追従型大規模視覚言語モデルの効率的なデプロイのための新しい戦略であるElastic Cacheを紹介する。
本稿では,冗長キャッシュを具現化する重要なキャッシュマージ戦略を提案する。
命令符号化では,キャッシュの重要性を評価するために周波数を利用する。
様々なLVLMの結果は、Elastic Cacheが効率を向上するだけでなく、言語生成における既存のプルーニングメソッドよりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-25T15:29:05Z) - Training-Free Exponential Context Extension via Cascading KV Cache [49.608367376911694]
カスケードサブキャッシュバッファを利用して,最も関連性の高いトークンを選択的に保持する機構を導入する。
本手法は,1Mトークンのフラッシュアテンションと比較して,プリフィルステージ遅延を6.8倍削減する。
論文 参考訳(メタデータ) (2024-06-24T03:59:17Z) - Dual Cluster Contrastive learning for Person Re-Identification [78.42770787790532]
私たちはDual Cluster Contrastive Learning(DCC)という統合クラスタコントラストフレームワークを定式化します。
DCCは、個々のメモリバンクとセントロイドクラスタメモリバンクの2種類のメモリバンクを維持している。
教師なしまたは監督されていない人物のReIDに容易に適用できる。
論文 参考訳(メタデータ) (2021-12-09T02:43:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。