論文の概要: Trained Persistent Memory for Frozen Decoder-Only LLMs
- arxiv url: http://arxiv.org/abs/2603.22329v1
- Date: Fri, 20 Mar 2026 19:11:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.067681
- Title: Trained Persistent Memory for Frozen Decoder-Only LLMs
- Title(参考訳): 冷凍デコーダ専用LCMの学習永続メモリ
- Authors: Hong Jeong,
- Abstract要約: トレーニングされたメモリアダプタは、凍結したエンコーダ-デコーダバックボーン、永続的な潜時空間メモリを提供する。
LoCoMoでは、インダクティブバイアスの二分法が目覚ましい。キャパシティが1ドル以上で、強いアーキテクチャ上の先行点を持つ3つのメソッドが、7〜18%のメモリスコアを達成します。
これらの知見は、大きなトランスフォーマーファミリーにまたがる一般的なパラダイムとして、永続的な潜在空間記憶を確立した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Decoder-only language models are stateless: hidden representations are discarded after every forward pass and nothing persists across sessions. Jeong (2026a) showed that trained memory adapters give a frozen encoder-decoder backbone persistent latent-space memory, building on the lateral-memory framework of Jeong (2026b,c). Here we ask whether the same principle transfers to the decoder-only setting, where no cross-attention pathway exists and memory must enter through self-attention alone. We adapt six methods -- prefix, parallel cross-attention, KV extension, Hebbian memory, context-gated branch, and slot-based sparse write -- to a frozen GPT-2, training only a small adapter $θ_{mem}$. The write rule is shared; only the read injection changes from decoder cross-attention to self-attention KV prefix or parallel branch. On LoCoMo we find a striking inductive-bias dichotomy: at $1\times$ capacity, three methods with strong architectural priors -- cross-attention (M.2), Hebbian (M.4), and slot write (M.6) -- achieve retained-memory scores of $7-18\%$ and knowledge gains $ΔK$ of $7-10$, while the other three fail ($< 0.4\%$). At $10\times$ capacity all six converge, showing the gap is architectural, not fundamental. Together with the encoder-decoder results of Jeong (2026a) and the brain-inspired modules of Jeong (2026b,c), these findings establish persistent latent-space memory as a general paradigm spanning major transformer families.
- Abstract(参考訳): デコーダのみの言語モデルはステートレスで、隠された表現はフォワードパス毎に破棄され、セッション間で何も持続しない。
Jeong (2026a) は、トレーニング済みのメモリアダプタが、Jeong (2026b,c) のサイドメモリフレームワーク上に構築された、凍結したエンコーダ/デコーダのバックボーンを永続的なラテント空間メモリとして提供することを示した。
ここでは、同じ原理がデコーダのみの設定に移行するかどうかを問う。
我々は6つのメソッド(プレフィックス、パラレルクロスアテンション、KV拡張、ヘビアンメモリ、コンテキストゲート分岐、スロットベースのスパース書き込み)を凍結したGPT-2に適用し、小さなアダプタ$θ_{mem}$だけをトレーニングする。
書き込みルールは共有され、リードインジェクションのみがデコーダのクロスアテンションから自己アテンションKVプレフィックスまたはパラレルブランチに変更される。
LoCoMoでは、インダクティブバイアスの二分法が目覚ましい。 キャパシティが1\times$で、強いアーキテクチャの先行 -- クロスアテンション (M.2)、Hebbian (M.4)、スロットライト (M.6) の3つのメソッドが、7-18\%のメモリスコアを獲得し、知識が7-10ドルのΔK$を獲得し、残りの3つは(0.4\%$)失敗する。
10\times$キャパシティは6つすべて収束し、ギャップはアーキテクチャであり、基本的なものではない。
Jeong (2026a) のエンコーダデコーダとJeong (2026b,c) の脳にインスパイアされたモジュールとともに、これらの発見は、主要なトランスフォーマーファミリーにまたがる一般的なパラダイムとして、永続的な潜時記憶を確立した。
関連論文リスト
- MemMA: Coordinating the Memory Cycle through Multi-Agent Reasoning and In-Situ Self-Evolution [52.29303869050117]
メモリ拡張LDMエージェントは、長期の相互作用をサポートするために外部メモリバンクを保持する。
MemMAはプラグアンドプレイのマルチエージェントフレームワークで、前方と後方の両方の経路に沿ってメモリサイクルを調整する。
論文 参考訳(メタデータ) (2026-03-19T10:15:59Z) - Trained Persistent Memory for Frozen Encoder--Decoder LLMs: Six Architectural Methods [0.0]
凍結した言語モデルにおける永続メモリは、厳しいリソース制約の下でも実現可能であることを示す。
3つのインジェクションポイントと4つの書き込みメカニズムにまたがる6つのアーキテクチャ手法を実装した。
我々は、大規模モデル、大規模データ、大規模メモリによる完全なエンドツーエンドトレーニングが、より強力な結果をもたらすと論じている。
論文 参考訳(メタデータ) (2026-03-17T11:51:21Z) - KEEP: A KV-Cache-Centric Memory Management System for Efficient Embodied Planning [8.216400469571084]
効率的な実施計画のためのKVキャッシュ型メモリ管理システムKEEPを提案する。
KEEPは,(1)混合粒度メモリグループによるKVキャッシュ再計算を低減する静的動的メモリ構築アルゴリズム,(2)異なるメモリグループ間の重要なクロスアテンションを動的に識別するマルチホップメモリ再計算アルゴリズム,(3)不均衡なKVキャッシュのロードと異なるレイヤ間のクロスアテンションを排除するレイヤバランスのメモリローディングという3つの重要なイノベーションを特徴としている。
論文 参考訳(メタデータ) (2026-02-27T01:48:07Z) - TinyVLM: Zero-Shot Object Detection on Microcontrollers via Vision-Language Distillation with Matryoshka Embeddings [0.14504054468850666]
メモリ1MB未満のリソース制約MCU上でゼロショットオブジェクト検出を可能にする最初のフレームワークであるTinyVLMを提案する。
TinyVLMはCOCO、Flowers102、Food101で、RAMは285KB、フラッシュメモリは892KBである。
論文 参考訳(メタデータ) (2026-02-24T05:32:51Z) - Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution [52.76038908826961]
我々は静的ストレージと動的推論のギャップを埋めるため、$textbfReMe$ ($textitRemember Me, Refine Me$)を提案する。
ReMeは3つのメカニズムを通じてメモリライフサイクルを革新する: $textitmulti-faceted distillation$, きめ細かい経験を抽出する。
BFCL-V3とAppWorldの実験では、ReMeが新しい最先端のエージェントメモリシステムを確立している。
論文 参考訳(メタデータ) (2025-12-11T14:40:01Z) - Agentic Learner with Grow-and-Refine Multimodal Semantic Memory [50.81667005063605]
ViLoMemは、コンパクトなスキーマベースのメモリを構築するデュアルストリームメモリフレームワークである。
視覚的障害パターンと論理的推論エラーを符号化し、MLLMが成功し失敗した経験から学ぶことを可能にする。
論文 参考訳(メタデータ) (2025-11-26T18:55:08Z) - MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation [59.31354761628506]
このようなタスクは本質的にマルコフ的ではないが、主流のVLAモデルはそれを見落としているため、ロボット操作には時間的コンテキストが不可欠である。
本稿では,長距離ロボット操作のためのコグニション・メモリ・アクション・フレームワークであるMemoryVLAを提案する。
本稿では,3つのロボットを対象とした150以上のシミュレーションと実世界のタスクについて評価する。
論文 参考訳(メタデータ) (2025-08-26T17:57:16Z) - G-Memory: Tracing Hierarchical Memory for Multi-Agent Systems [44.844636264484905]
大規模言語モデル (LLM) を利用したマルチエージェントシステム (MAS) は、単一のLLMエージェントよりもはるかに高い認知と実行能力を示している。
組織記憶理論に触発されたMASのための階層型エージェントメモリシステムG-Memoryを紹介する。
Gメモリは、インボディードアクションの成功率と知識QAの精度を、それぞれ20.89%$と10.12%$で改善する。
論文 参考訳(メタデータ) (2025-06-09T03:43:46Z) - Efficient Beam Search for Large Language Models Using Trie-Based Decoding [13.496312069446963]
本研究は,バッチベースのビームサーチのメモリ非効率性に対処する,トリエ(ツリー)ベースの並列デコーディング手法を提案する。
ビーム間で1つのKVキャッシュを共通プレフィックスで共有することにより,メモリ使用量を劇的に削減し,効率的な復号化を実現する。
論文 参考訳(メタデータ) (2025-01-31T16:22:36Z) - You Only Cache Once: Decoder-Decoder Architectures for Language Models [132.4064488592704]
大規模言語モデルのためのデコーダ・デコーダアーキテクチャであるYOCOを導入する。
YOCOはキーと値のペアを一度だけキャッシュする。
全体的なモデルはデコーダのみのTransformerのように振る舞うが、YOCOは一度だけキャッシュする。
論文 参考訳(メタデータ) (2024-05-08T17:57:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。