論文の概要: Continuous Context Management
- arxiv url: http://arxiv.org/abs/2609.35540v1
- Date: Mon, 28 Sep 2026 16:20:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 21:00:49.242031
- Title: Continuous Context Management
- Title(参考訳): 継続的コンテキスト管理
- Abstract要約: 継続的コンテキスト管理は、インタラクション履歴がアクティブプロンプトに蓄積されるのを防ぐ。
CCMは累積入力使用量とアクティブプロンプトサイズを大幅に削減する。
我々は,オープンウェイトモデルのCCMを改善するために,GRPOと特権付きフルヒストリー蒸留を用いる。
- 参考スコア(独自算出の注目度): 8.572241655978404
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon large language model (LLM) agents commonly retain their complete interaction history until compaction is triggered at a predefined threshold. We study Continuous Context Management (CCM), which performs compaction at every turn to prevent interaction history from accumulating in the active prompt. At each turn, a CCM agent emits an updated memory together with an environment action; its next prompt contains the original task, retained memory, and newest observation rather than the complete transcript. We first evaluate CCM without fine-tuning on TerminalBench-2 using Claude Sonnet 4.6, Claude Opus 4.6, GLM-5, and Kimi K3. CCM substantially reduces cumulative input usage and active-prompt size, although it lowers task success for most models while preserving performance for Kimi K3. We use GRPO with privileged full-history distillation to improve CCM in open-weight models. A frozen copy of the student's initial model scores each sampled student action under the complete history reconstructed from that student's rollout, providing dense action-token supervision without a separate teacher rollout or reference solution. On WebShop, this objective substantially improves CCM over GRPO at both evaluated model scales and surpasses full-history GRPO for Qwen3-4B-Instruct, though not for Qwen3-8B. On Endless Terminals, the augmented method provides a modest improvement over GRPO, with both CCM policies outperforming the untrained full-history baseline. These results demonstrate that CCM is a viable inference paradigm for agents operating with substantially reduced retained context and that its performance can be improved through reinforcement learning with privileged full-history distillation.
- Abstract(参考訳): Long-Horizon Large Language Model (LLM) エージェントは、あらかじめ定義された閾値で圧縮がトリガーされるまで、その完全な相互作用履歴を一般的に保持する。
対話履歴がアクティブなプロンプトに蓄積されるのを防ぐために,各ターンでコンパクト化を行う連続コンテキスト管理(CCM)について検討する。
それぞれのターンで、CCMエージェントは、環境アクションと共に更新されたメモリを出力し、次のプロンプトには、元のタスク、保持されたメモリ、そして完全な書き起こしよりも最新の観察が含まれている。
我々はまずCCMをClaude Sonnet 4.6, Claude Opus 4.6, GLM-5, Kimi K3を用いて, TerminalBench-2の微調整なしで評価した。
CCMは累積入力使用量とアクティブプロンプトサイズを大幅に削減するが、ほとんどのモデルではタスク成功率を低下させ、Kim K3のパフォーマンスを維持できる。
我々は,オープンウェイトモデルのCCMを改善するために,GRPOと特権付きフルヒストリー蒸留を用いる。
学生の初期モデルの凍結したコピーは、学生のロールアウトから再構成された完全な履歴の下で各学生のアクションをスコアし、個別の教師ロールアウトや参照ソリューションなしで、密集したアクションツーケント監視を提供する。
WebShopでは、この目的は両方の評価されたモデルスケールにおいてGRPOよりもCCMを大幅に改善し、Qwen3-4B-インストラクトのフルヒストリーGRPOより優れているが、Qwen3-8Bではそうではない。
Endless Terminalsでは、拡張手法はGRPOよりも緩やかに改善され、CCMポリシーはトレーニングされていないフルヒストリーベースラインを上回っている。
これらの結果から, CCMは, 保持状況が大幅に低下したエージェントに対して有効な推論パラダイムであり, その性能は, フルヒストリー蒸留による強化学習により向上できることが示唆された。
関連論文リスト
- AD-WM: Action-Discriminative World Models for Counterfactual Model Predictive Control [31.53438833300694]
対実的MPCのための行動識別型共同埋め込み世界モデルであるAD-WMを紹介する。
一致したLeWMベースラインに対して,AD-WMはハードスタート成功率を3.7%から52.0%に改善することを示した。
また,実際の予測誤差と銀行全体の行動ランクが閉ループ成功順序に従わないことを示す。
論文 参考訳(メタデータ) (2026-09-24T17:59:41Z) - RL Forgets! Towards Continual Policy Optimization [57.4336338996653]
継続的なポストトレーニングは、進化するタスクに視覚言語モデルを適用するための中心的なパラダイムになりつつある。
最近の研究は、強化学習が本質的に忘れやすいという信念から、教師付き微調整よりも強化学習を好んでいる。
我々は,事前タスク動作KL目標に基づくリプレイフリーフレームワークである継続ポリシー最適化(CPO)を提案する。
論文 参考訳(メタデータ) (2026-07-05T15:46:11Z) - TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents [55.27396165691312]
マルチターンエージェント設定におけるバニラOPDの鍵となる制限を,トラジェクトリレベルKL不安定(Trajectory-Level KL Instability)と呼ぶ。
学生に露出する軌道深度を制御し,カリキュラムのスケジュールを段階的に拡張するフレームワークであるTCODを提案する。
4組の生徒と教師のペアによる実験結果から,TCODはKLのエスカレーションを軽減し,トレーニングを通してKLの安定性を高め,バニラPDよりも最大18ポイントのエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-04-27T03:38:27Z) - Actor-Critic for Continuous Action Chunks: A Reinforcement Learning Framework for Long-Horizon Robotic Manipulation with Sparse Reward [85.84943447589511]
本稿では,高次元連続行動系列を生成するための新しいRLフレームワークであるAC3(Actor-Critic for Continuous Chunks)を紹介する。
この学習プロセスを安定させ、データ効率を高めるため、AC3はアクターと批評家の両方に目標安定化機構を組み込む。
論文 参考訳(メタデータ) (2025-08-15T01:27:15Z) - GCR: Gradient Coreset Based Replay Buffer Selection For Continual
Learning [1.911678487931003]
調査対象のオフライン学習環境において,最先端の学習に比べて有意な増加(2%~4%)を示した。
また、オンライン/ストリーミングのCL設定にも効果的に移行し、既存のアプローチよりも最大5%向上しました。
論文 参考訳(メタデータ) (2021-11-18T18:01:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。