論文の概要: ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL
- arxiv url: http://arxiv.org/abs/2608.28476v1
- Date: Fri, 28 Aug 2026 16:01:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.389115
- Title: ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL
- Title(参考訳): ContextPilot: きめ細かいRLによるプロアクティブコンテキスト管理のためのエージェント
- Authors: Zhuoshi Pan, Qizhi Pei, Junru Lu, Honglin Lin, H. Vicky Zhao, Di Yin, Xing Sun,
- Abstract要約: ロングホライゾンのエージェントタスクは、多ターンインタラクションをまたいだ分散情報を反復的に取得、統合、維持するために大きな言語モデルを必要とする。
近年のプロアクティブなコンテキスト管理手法では、モデルが独自の作業コンテキストを特別なツールで編集できるようになっている。
本稿では,長期エージェント推論のための能動的コンテキスト管理フレームワークであるContextPilotを紹介する。
- 参考スコア(独自算出の注目度): 30.70875568757697
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon agentic tasks require large language models (LLMs) to iteratively retrieve, integrate, and maintain dispersed information across multi-turn interactions, but preserving all interaction histories leads to a continuously growing working context. Recent proactive context management methods allow models to edit their own working context with specialized tools, yet they still face three key limitations: (1) a limited toolset restricted to search, deletion, and summarization, with no support for global planning, long-term memory, and adaptive compression; (2) inefficient exploration that treats context management actions uniformly despite their heterogeneous impacts on final outcomes; and (3) coarse-grained credit assignment that assigns the final trajectory-level reward to all intermediate context editing actions during RL. To bridge these gaps, we introduce ContextPilot, a proactive context management framework for long-horizon agentic reasoning. Our approach systematically augments the toolset with planning, long-term memory, and soft context offloading tools. We further propose an RL method tailored for context management, which uses context and entropy variation to identify critical editing decisions for branch sampling and estimates action-level advantages from all branched trajectories that pass through the corresponding context editing action. Experiments on long-context QA and deep search tasks show that ContextPilot achieves stronger performance with a more compact working context, consistently outperforming existing baselines across various base models and benchmarks. Code is available at https://github.com/Tencent/ContextPilot.
- Abstract(参考訳): ロングホライゾンのエージェントタスクは、多ターンインタラクションをまたいだ分散情報を反復的に取得、統合、維持するために大きな言語モデル(LLM)を必要とするが、すべてのインタラクション履歴を保存することは、継続的な作業コンテキストに繋がる。
近年のプロアクティブなコンテキスト管理手法では,検索,削除,要約に制限のあるツールセットに,グローバルな計画,長期記憶,適応圧縮がサポートされていないこと,最終結果に対する不均一な影響にもかかわらず,コンテキスト管理動作を均一に扱う非効率な探索,RL中のすべての中間的コンテキスト編集動作に対して,最終的なトラジェクティブレベルの報酬を割り当てる粗い粒度の信用割当,という3つの制限がある。
これらのギャップを埋めるために、長期エージェント推論のためのアクティブなコンテキスト管理フレームワークであるContextPilotを紹介します。
当社のアプローチでは,計画,長期記憶,ソフトコンテキストオフロードといったツールセットを体系的に強化しています。
さらに、コンテキスト管理に適したRL手法を提案し、コンテキストとエントロピーの変動を利用して、ブランチサンプリングのための重要な編集決定を識別し、対応するコンテキスト編集アクションを通過するすべてのブランチトラジェクトリからアクションレベルのアドバンテージを推定する。
長いコンテキストのQAと深層検索タスクの実験から、ContextPilotはよりコンパクトな作業コンテキストでパフォーマンスを向上し、さまざまなベースモデルやベンチマークで既存のベースラインを一貫して上回ります。
コードはhttps://github.com/Tencent/ContextPilot.comから入手できる。
関連論文リスト
- ACM: Agentic Context Management for Long Horizon Tasks [27.337726990282928]
Agentic Context Management (ACM) は、エージェントに汎用的なコンテキスト編集ツールを提供するフレームワークである。
短期記憶と長期記憶の相互作用にインスパイアされたエージェントは、いつそのコンテキストを圧縮するかを自律的に決定する。
論文 参考訳(メタデータ) (2026-07-26T19:19:24Z) - AgentSwing: Adaptive Parallel Context Management Routing for Long-Horizon Web Agents [115.18197165538943]
大規模言語モデル(LLM)は、長距離情報探索のための自律エージェントへと進化する。
既存のコンテキスト管理手法は通常、軌道全体を通して単一の固定戦略にコミットする。
本稿では,探索効率と終端精度の2つの相補的な次元を通じて,長期的成功を特徴付ける確率的枠組みを提案する。
論文 参考訳(メタデータ) (2026-03-29T02:59:27Z) - Coding Agents are Effective Long-Context Processors [32.55917012704666]
長いコンテキスト処理は、潜在的注意から明示的で実行可能な相互作用へと外部化することができる。
コーディングエージェントは、平均して17.3%の最先端を公表している。
論文 参考訳(メタデータ) (2026-03-20T19:03:20Z) - LOCA-bench: Benchmarking Language Agents Under Controllable and Extreme Context Growth [32.1520194112537]
大規模言語モデル(LLM)は、長期の現実世界のタスクを実行する能力がますます高まっている。
文脈の量が増えるにつれて、その信頼性はしばしば悪化し、これは"context rot"と呼ばれる現象である。
論文 参考訳(メタデータ) (2026-02-08T13:20:39Z) - Context as a Tool: Context Management for Long-Horizon SWE-Agents [38.950807465620365]
我々は,エージェントの意思決定プロセスに統合された呼び出し可能なツールにコンテキストメンテナンスを高める新しいコンテキスト管理パラダイムであるCATを提案する。
CATは、安定なタスクセマンティクス、凝縮した長期記憶、高忠実な短期相互作用からなる構造化されたコンテキストワークスペースを形式化する。
我々は,SWE圧縮機が57.6%の解率に達し,ReActベースのエージェントと静的圧縮ベースラインを著しく上回っていることを示す。
論文 参考訳(メタデータ) (2025-12-26T17:15:47Z) - Scaling Long-Horizon LLM Agent via Context-Folding [46.685552398338295]
エージェントが作業コンテキストを積極的に管理することを可能にするフレームワークであるContext-Foldingを紹介します。
エージェントは、サブトラックに手続き的に分岐してサブタスクを処理し、完了時に折り畳み、結果の簡潔な要約を保持しながら中間ステップを崩壊させる。
論文 参考訳(メタデータ) (2025-10-13T22:00:58Z) - ContextNav: Towards Agentic Multimodal In-Context Learning [85.05420047017513]
ContextNavは、自動検索のスケーラビリティと人間のようなキュレーションの品質と適応性を統合するエージェントフレームワークである。
リソースを意識したマルチモーダル埋め込みパイプラインを構築し、検索可能なベクトルデータベースを維持し、エージェント検索と構造アライメントを適用して、ノイズ耐性のあるコンテキストを構築する。
実験の結果、ContextNavはさまざまなデータセットで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-10-06T07:49:52Z) - A Controlled Study on Long Context Extension and Generalization in LLMs [85.4758128256142]
広義のテキスト理解とテキスト内学習は、完全な文書コンテキストを利用する言語モデルを必要とする。
長期コンテキストモデルを直接訓練する際の実装上の課題のため、長期コンテキストを扱うためにモデルを拡張する多くの方法が提案されている。
我々は,一貫したベースモデルと拡張データを利用して,標準化された評価による拡張メソッドの制御プロトコルを実装した。
論文 参考訳(メタデータ) (2024-09-18T17:53:17Z) - Exploring Relational Context for Multi-Task Dense Prediction [76.86090370115]
我々は,共通バックボーンと独立タスク固有のヘッドで表される,密集予測タスクのためのマルチタスク環境を考える。
マルチタスク設定では,グローバルやローカルなど,さまざまな注意に基づくコンテキストを探索する。
タスクペアごとに利用可能なすべてのコンテキストのプールをサンプリングするAdaptive Task-Relational Contextモジュールを提案する。
論文 参考訳(メタデータ) (2021-04-28T16:45:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。