論文の概要: Structured Memory for Edge Language Models: Persistent Context and Corpus Retrieval via O(1) SSM State Injection
- arxiv url: http://arxiv.org/abs/2608.02560v1
- Date: Mon, 03 Aug 2026 17:43:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.743331
- Title: Structured Memory for Edge Language Models: Persistent Context and Corpus Retrieval via O(1) SSM State Injection
- Title(参考訳): エッジ言語モデルのための構造化メモリ:O(1) SSM状態注入による永続コンテキストとコーパス検索
- Authors: Anusha Madan Gopal, Aras Pirbadian, Kristofor D. Carlson, M Anthony Lewis, Jonathan Tapson,
- Abstract要約: ステートスペースモデル(SSM)は、建設によるプレフィルコストを回避する。
文書コーパスをSSM隠蔽状態としてオフラインでプリエンコードする。
プリフィルレイテンシは、エッジハードウェアで$sim$27 sから$6 msに削減される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval-augmented generation (RAG) imposes a prefill cost proportional to retrieved context length, and -- with Transformer backbones -- a KV-cache that grows with each generated token. State-Space Models (SSMs) avoid the second cost by construction; we eliminate the first, collapsing prefill from $O(L_{context})$ to $O(1)$ per query. We introduce PRECOG (Pre-Computed Context Injection), a retrieval mechanism that exploits a property unique to SSMs: the fixed-size, position-agnostic recurrent hidden state is a complete summary of everything the model has read. PRECOG pre-encodes document corpora offline as SSM hidden states and injects the best-matching state directly at query time, bypassing in-context re-ingestion entirely. The same state-injection mechanism enables SMC (Structured Memory Consolidation): a hierarchical persistent memory with cognitive-domain clustering, an adjustable fidelity-vs-storage dial, and $O(1)$ session initialization, which consolidates short-term episodic states into long-term semantic memory and fuses both with retrieved corpus states at query time. We demonstrate the system on TENNs-LLM, a 1.2B-parameter gated-SSM language model with a 192 KB hidden state. PRECOG matches in-context RAG answer quality, reducing prefill latency from $\sim$27 s to $<$6 ms on edge hardware -- a $\sim$4500$\times$ speedup that crosses the threshold from unusable to interactive. The mechanism is architecturally impossible for Transformer KV-caches, which are position-entangled and grow linearly with context length.
- Abstract(参考訳): Retrieval-augmented Generation (RAG)は、検索したコンテキスト長に比例したプリフィルコストを課す。
クエリあたり$O(L_{context})$から$O(1)$まで、最初のプリフィルを廃止します。
Pre-Computed Context Injection(Pre-Computed Context Injection)は,SSM特有の特性を利用する検索機構である。
PreCOGは文書コーパスをSSMの隠された状態としてオフラインにエンコードし、クエリ時に直接ベストマッチ状態を注入し、コンテキスト内再入力を完全にバイパスする。
同じ状態注入機構により、SMC (Structured Memory Consolidation): 認知ドメインクラスタリングを備えた階層型永続メモリ、調整可能なfidelity-vs-storageダイアル、および$O(1)$セッション初期化が可能となる。
192KBの隠れ状態を持つ1.2Bパラメトリックゲート-SSM言語モデルTENNs-LLMを実演する。
PreCOGは、コンテキスト内のRAG回答の品質にマッチし、プリフィルのレイテンシを$\sim$27 sから$<6 ms on edge hardware -- a $\sim$4500$\times$ speedupで、使用不能からインタラクティブにしきい値を越える。
このメカニズムはTransformer KV-cachesではアーキテクチャ上不可能である。
関連論文リスト
- Scaling Self-Evolving Agents via Parametric Memory [69.96398842169002]
既存のメモリ拡張LDMエージェントは、過去の経験をプロンプト空間にのみ保存する。
自己進化型パラメトリックメモリフレームワークである textttTMEM を導入する。
textttTMEMは、様々なモデルスケールで要約ベースのベースラインと検索ベースのベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-06-03T07:18:31Z) - DMF: A Deterministic Memory Framework for Conversational AI Agents [0.0]
我々は、生成メモリ圧縮を完全な決定論的パイプラインに置き換えるCPUファーストアプローチである決定論的メモリフレームワーク(DMF)を提案する。
DMFは、決定論的コンテンツ信号、会話の手がかり、構造化された前兆から計算されたSurvival Scoreを、ロジスティック・プロジェクションで組み合わせて割り当てる。
LoCoMoとLongMemEvalのデータセットを使用して、目的を組み込んだベンチマークで実験を行う。
論文 参考訳(メタデータ) (2026-06-02T10:41:28Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Echo: KV-Cache-Free Associative Recall with Spectral Koopman Operators [45.88028371034407]
スペクトルクープマン注意(SKA)を中心に構築されたKV-cacheフリー連想リコールアーキテクチャ
我々は、SKA(Spectral Koopman Attention)を中心に構築されたKV-cacheフリーな連想型リコールアーキテクチャであるEchoを紹介する。
論文 参考訳(メタデータ) (2026-05-07T22:26:27Z) - Sparse Prefix Caching for Hybrid and Recurrent LLM Serving [0.7284556903703034]
重なり合う深さの分布の下で,スパースプレフィックスキャッシングをチェックポイント配置として定式化する。
リクエストが非自明なプレフィックスを共有する場合、実世界のデータ上で標準非対称性によって追跡されるフロンティアを一貫して改善することを示す。
正確な出力を保持し、リカレント計算自体を変更したり、新しいリカレント更新カーネルを必要としたりしない。
論文 参考訳(メタデータ) (2026-04-17T09:24:58Z) - Persistent Memory Through Triple-Loop Consolidation in a Non-Gradient Dissipative Cognitive Architecture [0.0]
本稿では,三重ループ統合サイクルを通した非段階的な永続メモリ機構であるDeep Memoryを紹介する。
我々は、Mixture-of-Experts (MoE) ゲーティングによる個別のエキスパートルーティングがDMの因果的前提であることを示した。
以上の結果から, DMは, 海馬統合と機能的並行性を有する非段階認知システムにおいて, 持続記憶の機構として確立された。
論文 参考訳(メタデータ) (2026-03-28T08:29:48Z) - The Bureaucracy of Speed: Structural Equivalence Between Memory Consistency Models and Multi-Agent Authorization Revocation [0.0]
我々はアイデンティティとアクセス管理のための能力コヒーレンスシステムを開発した。
安全定理は、実行カウント リリース 一貫性指向のコヒーレンス戦略に対する無許可の操作を束縛する。
ティックベースの離散イベントシミュレーションは、機能ごとの安全性を保証する。
論文 参考訳(メタデータ) (2026-03-10T16:37:02Z) - Dynamic Large Concept Models: Latent Reasoning in an Adaptive Semantic Space [56.37266873329401]
大規模言語モデル (LLM) は、高度に一様でない情報密度を示す言語にもかかわらず、全てのトークンに一様計算を適用する。
我々は,潜在表現から意味境界を学習し,トークンから推論がより効率的である圧縮概念空間へ移行する階層型言語モデリングフレームワークである$textbfDynamic Large Concept Models (DLCM)$を提案する。
論文 参考訳(メタデータ) (2025-12-31T04:19:33Z) - Structured Sparse Transition Matrices to Enable State Tracking in State-Space Models [68.31088463716269]
状態空間モデル(SSM)における遷移行列の構造的スパースパラメトリゼーションを提案する。
我々の方法PD-SSMは、遷移行列をカラム1ホット行列(P$)と複素数値対角行列(D$)の積としてパラメータ化する。
このモデルは、様々なFSA状態追跡タスクにおいて、現代のSSMの多種多様なバリエーションを著しく上回っている。
論文 参考訳(メタデータ) (2025-09-26T12:46:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。