論文の概要: Procedural Memory Distillation: Online Reflection for Self-Improving Language Models
- arxiv url: http://arxiv.org/abs/2607.01480v1
- Date: Wed, 01 Jul 2026 21:20:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.595221
- Title: Procedural Memory Distillation: Online Reflection for Self-Improving Language Models
- Title(参考訳): 手続き記憶蒸留:自己改善型言語モデルのためのオンラインリフレクション
- Abstract要約: 検証可能な報酬(RLVR)による強化学習は、検証対象に対する各ロールアウトを評価し、そのエピソードレベルの信号からポリシーを更新する。
エピソードやエポック全体を通じて、モデルは変更ポリシーの下で関連する問題に何度も遭遇し、エピソードローカル更新がキャプチャーできないエピソード横断信号を生成する。
本稿では,これらのクロスエピソード信号を再利用可能なプロシージャメモリに変換し,トレーニング中のポリシーの重みに蒸留するプロシージャメモリ蒸留(PMD)を提案する。
- 参考スコア(独自算出の注目度): 51.938248694868584
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR), along with recent selfdistillation variants such as SDPO, evaluates each rollout against a verifier and updates the policy from that episode-level signal. However, the richer procedural information in the rollout is rarely retained or reused. Across episodes and epochs, the model repeatedly encounters related problems under a changing policy, producing cross-episode signals that episode-local updates cannot capture: which strategies consistently pass verification, which failure modes persist, which patterns recur. We propose Procedural Memory Distillation (PMD), which converts these crossepisode signals into reusable procedural memory and distills it into the policy's weights during training. This memory functions as a training scaffold, absorbed into the policy itself, yielding a memory-free model at inference. PMD organizes the memory at three levels of abstraction: raw trajectories, self-reflected strategies and lessons, and higher-level behavioral patterns that recur across problems, all extracted online from the model's own trajectories. A memory-conditioned self-teacher draws on the accumulated experience to supervise the student on its own rollouts, enabling student to progressively internalize procedural knowledge within its parameters. The central design principle is co-evolution: the policy generates rollouts that update the memory, and memory shapes the supervision that updates the policy. Empirically, across Qwen3-8B and OLMo3-Instruct-7B, PMD improves over SDPO by 3.8-5.5% on SCIKNOWEVAL and 7.9-13.6% on LIVECODEBENCH. Co-evolution powers these gains: freezing either the memory or the policy trails PMD by more than 10% across SCIKNOWEVAL domains.
- Abstract(参考訳): 検証可能な報酬(RLVR)による強化学習は、SDPOなどの最近の自己蒸留変種とともに、検証者に対する各ロールアウトを評価し、そのエピソードレベルの信号からポリシーを更新する。
しかし、ロールアウトにおけるよりリッチな手続き情報は、ほとんど保持または再利用されない。
エピソードやエポック全体にわたって、モデルは、変更ポリシーの下で関連する問題に繰り返し遭遇し、エピソードローカル更新がキャプチャできないという、エピソードローカル更新信号を生成する。
本稿では,これらのクロスエピソード信号を再利用可能なプロシージャメモリに変換し,トレーニング中のポリシーの重みに蒸留するプロシージャメモリ蒸留(PMD)を提案する。
このメモリはトレーニングの足場として機能し、ポリシー自体に吸収され、推論時にメモリフリーモデルを生成する。
PMDは、生の軌跡、自己反映された戦略と教訓、問題にまたがる高レベルの行動パターンの3段階の抽象化でメモリを編成し、これらは全てモデル自身の軌跡からオンラインに抽出される。
記憶条件の自己学習者は、蓄積した経験に基づいて、生徒が自身のロールアウトを監督し、学生がそのパラメータの中で手続き的知識を段階的に内部化することを可能にする。
ポリシーは、メモリを更新するロールアウトを生成し、メモリはポリシーを更新する監督を形作る。
実証的には、Qwen3-8BとOLMo3-Instruct-7Bで、PSDはSCIKNOWEVALで3.8-5.5%、LIVECODEBENCHで7.9-13.6%改善している。
SCIKNOWEVALドメイン全体で、メモリまたはポリシーパスを10%以上凍結する。
関連論文リスト
- OnEvoMemory: Evolving Memory through Online Robot Rollouts for Pretrained Robot Policies [2.9005223064604078]
ロングホライズンロボットの操作は、完了したサブタスクと重要な相互作用イベントを追跡するポリシーを必要とする。
本研究では,事前学習型ロボットポリシーのための値誘導型メモリモジュールOnEvoMemoryを提案する。
論文 参考訳(メタデータ) (2026-08-09T14:53:19Z) - AttriMem: Attribution-Guided Process Feedback for Agent Memory Learning [13.898789808338634]
RLを用いてメモリ構築ポリシーを学習するための帰属誘導プロセスフィードバックフレームワークを提案する。
AttriMemは、最終回答に対するトークンレベルのコントリビューションから得られる局所的な報酬で、グローバルな成果報酬を強化する。
論文 参考訳(メタデータ) (2026-07-23T09:35:34Z) - EvolveMem:Self-Evolving Memory Architecture via AutoResearch for LLM Agents [80.59925936278162]
本稿では,自己進化型メモリアーキテクチャであるEvolveMemについて述べる。
このクローズループの自己進化はAutoResearchプロセスを実現している。システムは自力で独自のアーキテクチャ上で反復的な研究サイクルを実行し、手動構成のチューニングを置き換える。
論文 参考訳(メタデータ) (2026-05-13T17:12:44Z) - MemEvoBench: Benchmarking Memory MisEvolution in LLM Agents [78.95081012334116]
永続メモリを持つ大規模言語モデル(LLM)は、相互作用の継続性とパーソナライゼーションを高めるが、新たな安全性リスクをもたらす。
汚染または偏りのある記憶蓄積は、異常な作用を引き起こす可能性がある。
MemeEvoBenchは、LLMエージェントのメモリ安全性を評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-04-17T07:29:52Z) - MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory [46.632646462295234]
提案するMemRLは,非パラメトリック強化学習をエピソードメモリ上で行うことで,エージェントの自己進化を可能にするフレームワークである。
MemRLは、セマンティックな関連性によって候補をフィルタリングし、学習したQ値に基づいて候補を選択する2相検索機構を採用している。
解析実験により,MemRLは安定性・塑性ジレンマを効果的に調整し,重み付けを伴わずに連続的なランタイム改善を可能にすることを確認した。
論文 参考訳(メタデータ) (2026-01-06T17:14:50Z) - Memento 2: Learning by Stateful Reflective Memory [4.7052412989773975]
本研究では,多言語モデル(LLM)に基づくエージェントにおける連続学習について検討する。
我々は、リフレクション、エージェントが過去の経験を再考し、将来の行動をどのように選択するかを調整する能力に焦点を当てる。
我々は、エージェントがエピソード記憶を維持・更新し、新しい体験を記憶に書き込むことと、関連する事例を読み取って意思決定をガイドする「ステートフル・リフレクティブ・意思決定プロセス(SRDP)」を紹介した。
論文 参考訳(メタデータ) (2025-12-27T22:15:03Z) - Memp: Exploring Agent Procedural Memory [72.41472703974935]
LLM(Large Language Models)ベースのエージェントは様々なタスクをこなすが、静的パラメータで手動で設計または絡み合うような不安定なプロシージャメモリに悩まされる。
本稿では,過去のエージェントの軌跡をステップバイステップの細粒度と高レベルなスクリプトライクな抽象化の両方に蒸留するMempを提案する。
メモリレポジトリが洗練されるにつれて、エージェントは着実に高い成功率と類似タスクの効率を達成できることを示す。
論文 参考訳(メタデータ) (2025-08-08T16:20:56Z) - Offline Reinforcement Learning with Implicit Q-Learning [85.62618088890787]
現行のオフライン強化学習手法では、トレーニング中に見つからない行動の価値を問い合わせて、ポリシーを改善する必要がある。
本稿では,データセット外の動作を評価する必要のないオフラインRL手法を提案する。
この方法により、学習したポリシーは、一般化によってデータの最良の振る舞いを大幅に改善することができる。
論文 参考訳(メタデータ) (2021-10-12T17:05:05Z) - Evolutionary Stochastic Policy Distillation [139.54121001226451]
本稿では,GCRS課題を解決するための進化的政策蒸留法(ESPD)を提案する。
ESPDは、政策蒸留(PD)技術により、ターゲットポリシーを一連の変種から学習することを可能にする
MuJoCo制御系に基づく実験により,提案手法の学習効率が向上した。
論文 参考訳(メタデータ) (2020-04-27T16:19:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。