論文の概要: MemOPD: On-Policy Distillation through Memory State Alignment for Long-Horizon Agents
- arxiv url: http://arxiv.org/abs/2608.07068v1
- Date: Fri, 07 Aug 2026 10:18:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.463195
- Title: MemOPD: On-Policy Distillation through Memory State Alignment for Long-Horizon Agents
- Title(参考訳): MemOPD:ロングホライゾン剤のメモリ状態アライメントによるオンポリシィ蒸留
- Abstract要約: ロングホライゾンエージェントは相互作用中に成長するコンテキストを蓄積し、性能と安定性を損なう。
本稿では,メモリアライメントオンポリシィ蒸留法(MemOPD)を提案する。
MemOPDは、各モデル呼び出しの入力とサンプル出力を記録し、元のトークン位置を復元し、再構築された呼び出しをパックして、効率的な教師のスコアリングを行う。
- 参考スコア(独自算出の注目度): 48.05798760668219
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon agents accumulate growing contexts during interaction, impairing performance and stability. Compact memory mitigates this problem by compressing and rewriting the history retained between model invocations. Learning what to retain typically relies on proximal policy optimization (PPO) with final task rewards, but sparse rewards provide little guidance for individual memory updates. This limitation motivates on-policy distillation (OPD), which supplies dense teacher supervision on student rollouts. For such supervision to be valid, the teacher must evaluate each sampled action under the same state in which it was generated. However, the context rewriting performed during memory compression can break this alignment. When sampled responses are retained and re-encoded for later invocations, flattening the interaction into a persistent history may cause the teacher to score the action under a state that the student never visited during rollout. The action therefore remains on-policy by provenance, but not necessarily by state. We therefore propose Memory-Aligned On-Policy Distillation (MemOPD). MemOPD records the inputs and sampled outputs of each model invocation, restores its original token positions and causal visibility, and packs the reconstructed invocations for efficient teacher scoring. The teacher provides full-vocabulary supervision at the sampled action positions, while PPO preserves the final task objective. Experiments verify state alignment across several context updates and show that it improves F1 by 7.0% over persistent-history teacher scoring in a matched control. Overall, MemOPD-3B improves F1 over PPO by up to 416.2%, while packing yields up to a 1.63x speedup in actor computation during training. The code for this work is publicly available at: https://github.com/TPssp/MemOPD.
- Abstract(参考訳): ロングホライゾンエージェントは相互作用中に成長するコンテキストを蓄積し、性能と安定性を損なう。
コンパクトメモリは、モデル呼び出しの間に保持された履歴を圧縮して書き直すことでこの問題を軽減する。
保持すべきものを学ぶには、通常、最終タスク報酬を伴う近似ポリシー最適化(PPO)に依存するが、スパース報酬は個々のメモリ更新に対するガイダンスをほとんど提供しない。
この制限は、学生のロールアウトを監督する密集した教師に供給するオンライン蒸留(OPD)を動機付けている。
このような監督が有効であるためには、教師は、各サンプルアクションが生成された状態の下で評価する必要がある。
しかし、メモリ圧縮中に行われたコンテキスト書き換えは、このアライメントを損なう可能性がある。
サンプリングされた応答が後続の呼び出しのために保持され、再エンコードされると、相互作用を永続的な履歴に平らにすることで、教師はロールアウト中に学生が訪れなかった状態の下でアクションをスコアリングする可能性がある。
したがって、この行動は立証によって政治に留まるが、必ずしも国家によってではない。
そこで我々はメモリアライメントオンポリシィ蒸留(MemOPD)を提案する。
MemOPDは、各モデル呼び出しの入力とサンプル出力を記録し、元のトークンの位置と因果的可視性を復元し、再構築された呼び出しを効率的な教師スコアのためにパックする。
教師は、サンプル化された行動位置をフル語彙で監視し、PPOは最終タスク目標を保存する。
実験では、いくつかのコンテキスト更新における状態アライメントを検証するとともに、マッチした制御における教師のスコアよりもF1を7.0%改善することを示す。
全体として、MemOPD-3BはPPO上のF1を最大416.2%改善し、パッキングはトレーニング中にアクターの計算を最大1.63倍高速化する。
この作業のコードは、https://github.com/TPssp/MemOPD.comで公開されている。
関連論文リスト
- Rethinking On-Policy Distillation of Large Language Models II: One Training Example [31.843793429278808]
オンライン蒸留は、学生が生み出したロールアウトと教師からの密集したトークンレベルの監督を組み合わせたものである。
ワンショットPDは数百ステップの改善を続けており、タスクドメインやモデルファミリー全体にわたるフルデータPDの利益のほとんどを回復している。
本研究は,教員の研修期間中に訪れた州と,学生が教師に同調する割合を通じて,この結果を説明する。
論文 参考訳(メタデータ) (2026-09-03T17:54:38Z) - OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models [39.15861870749305]
OPTD, On-Policy Transition Distillation with consistency-guided Adaptive compression。
これは、数段階の学生自身の軌跡から部分的な状態をサンプリングし、凍結した質問のみの教師を使用して結果に整合した将来の候補者を特定し、現状の信頼でそれらを注文する。
品質効率のトレードオフを継続的に改善し、評価された数ステップのベースラインの中で、全体的な品質に制約のあるAUPを最強に達成します。
論文 参考訳(メタデータ) (2026-08-03T23:09:43Z) - TFP: Temporally Conditioned Memory-Fusion Policies for Visuomotor Learning [11.149498165285491]
Vision-Language-Action(VLA)ポリシーは、$_0.5$やOpenVLAのような多くのタスクでうまく機能するが、リアクティブであることが多い。
このようなタスクは、メモリだけでなく、動的に認識される信念の更新も必要である、と我々は主張する。
論文 参考訳(メタデータ) (2026-07-09T09:24:30Z) - Multi-Turn On-Policy Distillation with Prefix Replay [73.10000453999088]
エージェントタスクに対するReplayed-Prefix On-Policy Distillation (ReOPD)を提案する。
ReOPDは、プレコンパイルされた教師の軌跡を再生プレフィックスとして再利用する。
OPDレベルの精度を保存または改善し、学生のトレーニング中にゼロツールコールを使用し、PDよりもトレーニングステップあたり最低4$times$高速である。
論文 参考訳(メタデータ) (2026-07-06T07:56:53Z) - Procedural Memory Distillation: Online Reflection for Self-Improving Language Models [51.938248694868584]
検証可能な報酬(RLVR)による強化学習は、検証対象に対する各ロールアウトを評価し、そのエピソードレベルの信号からポリシーを更新する。
エピソードやエポック全体を通じて、モデルは変更ポリシーの下で関連する問題に何度も遭遇し、エピソードローカル更新がキャプチャーできないエピソード横断信号を生成する。
本稿では,これらのクロスエピソード信号を再利用可能なプロシージャメモリに変換し,トレーニング中のポリシーの重みに蒸留するプロシージャメモリ蒸留(PMD)を提案する。
論文 参考訳(メタデータ) (2026-07-01T21:20:57Z) - Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning [66.52232008796294]
Prune-OPDはトレーニング予算と監督品質を動的に調整する。
トレーニング時間を37.6%減らし-68.0%削減すると同時に、しばしば改善され、挑戦的なベンチマークのパフォーマンスが向上する。
論文 参考訳(メタデータ) (2026-05-08T14:38:53Z) - TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents [55.27396165691312]
マルチターンエージェント設定におけるバニラOPDの鍵となる制限を,トラジェクトリレベルKL不安定(Trajectory-Level KL Instability)と呼ぶ。
学生に露出する軌道深度を制御し,カリキュラムのスケジュールを段階的に拡張するフレームワークであるTCODを提案する。
4組の生徒と教師のペアによる実験結果から,TCODはKLのエスカレーションを軽減し,トレーニングを通してKLの安定性を高め,バニラPDよりも最大18ポイントのエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-04-27T03:38:27Z) - Offline Reinforcement Learning with Implicit Q-Learning [85.62618088890787]
現行のオフライン強化学習手法では、トレーニング中に見つからない行動の価値を問い合わせて、ポリシーを改善する必要がある。
本稿では,データセット外の動作を評価する必要のないオフラインRL手法を提案する。
この方法により、学習したポリシーは、一般化によってデータの最良の振る舞いを大幅に改善することができる。
論文 参考訳(メタデータ) (2021-10-12T17:05:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。