論文の概要: From History to State: Constant-Context Skill Learning for LLM Agents
- arxiv url: http://arxiv.org/abs/2605.05413v1
- Date: Wed, 06 May 2026 20:13:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.403367
- Title: From History to State: Constant-Context Skill Learning for LLM Agents
- Title(参考訳): 歴史から国家へ: LLMエージェントのための定文脈スキル学習
- Authors: Haoyang Xie, Xinyuan Wang, Yancheng Wang, Puda Zhao, Feng Ju,
- Abstract要約: 大規模言語モデル(LLM)エージェントは、ブラウザ、ファイル、コード、ツールを操作するためにますます使われており、パーソナルアシスタントを自然なデプロイメントターゲットにしている。
クラウドモデルはマルチステップをうまく実行しますが、機密性の高い中間コンテキストを外部APIに公開します。
本稿では,タスクファミリーの軽量モジュールで再利用可能な手順を学習し,現在の観測状況とコンパクトな状態ブロックにのみ推論条件を学習する,反復エージェントのコンテキスト・ツー・ウェイト・フレームワークであるコンスタント・コンテキスト・ラーニングを提案する。
- 参考スコア(独自算出の注目度): 8.492402666210335
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) agents are increasingly used to operate browsers, files, code and tools, making personal assistants a natural deployment target. Yet personal agents face a privacy-cost-capability tension: cloud models execute multi-step workflows well but expose sensitive intermediate context to external APIs, while local models preserve privacy but remain less reliable. Both settings also pay repeatedly for long skill prompts and growing histories. We propose constant-context skill learning, a context-to-weights framework for recurring agent workflows: reusable procedures are learned in lightweight task-family modules, while inference conditions only on the current observation and a compact state block. A deterministic tracker renders this state block from task progress and supplies aligned subgoal rewards, so each module can be trained with step-level SFT and refined through online RL. Across ALFWorld, WebShop, and SciWorld, our agents achieve strong performance across Qwen3-4B, Qwen3-8B and Llama-3.1-8B. With Qwen3-8B, SFT+RL reaches 89.6\% unseen success on ALFWorld, 76.8\% success on WebShop, and 66.4\% unseen success on SciWorld. They match or exceed strong published agent-training results while reducing prompt tokens per turn by 2--7$\times$ relative to controlled ReAct prompting baselines, showing that procedural context can be moved from prompts into weights.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、ブラウザ、ファイル、コード、ツールを操作するためにますます使われており、パーソナルアシスタントを自然なデプロイメントターゲットにしている。
クラウドモデルはマルチステップワークフローをうまく実行しますが、機密性の高い中間コンテキストを外部APIに公開します。
どちらの設定も、長いスキルプロンプトと成長履歴のために繰り返し支払います。
本稿では,エージェントワークフローを再現するためのコンテキスト・ツー・ウェイト・フレームワークであるコンスタント・コンテキスト・スキル・ラーニングを提案する。
決定論的トラッカーはこの状態ブロックをタスクの進捗からレンダリングし、各モジュールをステップレベルのSFTでトレーニングし、オンラインRLを通して洗練することができる。
ALFWorld、WebShop、SciWorld全体で、当社のエージェントはQwen3-4B、Qwen3-8B、Llama-3.1-8Bで強いパフォーマンスを達成しています。
Qwen3-8B では、SFT+RL は ALFWorld で89.6 %、WebShop で76.8 %、SciWorld で66.4 % に到達した。
プロシージャコンテキストがプロシージャから重みに移動可能であることを示しながら、プロシージャトレーニングの結果に適合または超えながら、1ターン当たりのプロシージャトークンをコントロールされたReActに対して2--7$\times$で削減する。
関連論文リスト
- Synthetic Sandbox for Training Machine Learning Engineering Agents [26.34347159807133]
SandMLEは、少数のシードタスクから検証可能な合成MLE環境を生成するマルチエージェントフレームワークである。
我々は,SandMLEが13回以上実行時間を短縮し,MLEドメインで初めて大規模かつオン・ポリティクスなRLを実現することを示す。
論文 参考訳(メタデータ) (2026-04-06T17:19:29Z) - Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL [28.82521610729606]
大規模言語モデル(LLM)は、すべてのタスク関連情報が事前に利用できる場合、高いパフォーマンスを達成する。
ORBITはマルチタスク・マルチタスク・メタ強化学習フレームワークで,文脈におけるインタラクションから学習するためにLDMを訓練する。
メタトレーニングの後、比較的小さなオープンソースモデル(Qwen3-14B)は、完全に見えない環境でコンテキスト内オンライン学習を大幅に改善することを示した。
論文 参考訳(メタデータ) (2026-02-03T23:53:05Z) - Grounded in Reality: Learning and Deploying Proactive LLM from Offline Logs [72.08224879435762]
textttLearn-to-Askは、プロアクティブな対話エージェントの学習とデプロイのためのシミュレータフリーフレームワークである。
当社のアプローチは,LLMの大規模オンラインAIサービスへの展開を成功に導くものです。
論文 参考訳(メタデータ) (2025-10-29T12:08:07Z) - Fine-tuning with RAG for Improving LLM Learning of New Skills [8.825427873545063]
大規模言語モデル(LLM)エージェントは予測可能な方法で頻繁に失敗する。
本稿では,推論時間検索を蒸留による学習能力に変換する単純なパイプラインを提案する。
論文 参考訳(メタデータ) (2025-10-01T19:03:48Z) - Reinforcement Learning for Machine Learning Engineering Agents [52.03168614623642]
強化学習によって改善される弱いモデルによって支援されるエージェントは、はるかに大きいが静的モデルによって支援されるエージェントよりも優れていることを示す。
分散非同期RLフレームワークにおいて,高コストかつ高利回りな動作を増幅するための時間依存性の勾配更新を提案する。
また,早期に失敗するプログラムとほぼ正しくないプログラムを区別し,部分クレジットを提供する環境機器を提案する。
論文 参考訳(メタデータ) (2025-09-01T18:04:10Z) - Memento: Fine-tuning LLM Agents without Fine-tuning LLMs [36.3424780932712]
本稿では,適応型大言語モデル(LLM)エージェントのための新しい学習パラダイムを提案する。
本手法は,メモリベースのオンライン強化学習により,低コストで連続的な適応を可能にする。
我々はエージェントモデルを,GAIA検証でトップ1に達するemphMementoというディープリサーチ環境でインスタンス化する。
論文 参考訳(メタデータ) (2025-08-22T07:25:30Z) - ImagineBench: Evaluating Reinforcement Learning with Large Language Model Rollouts [10.273192140887481]
強化学習(RL)における中心的な課題は、タスク固有のポリシーを学ぶために、広範囲の現実世界のインタラクションデータに依存することである。
我々は、オフラインRLアルゴリズムを評価するための最初の包括的なベンチマークであるImagineBenchを紹介する。
既存のオフラインRLアルゴリズムを単純に適用すれば、目に見えないタスクにおいて、最適以下のパフォーマンスが得られることを観察する。
論文 参考訳(メタデータ) (2025-05-15T06:45:37Z) - Reinforcement Learning for Long-Horizon Interactive LLM Agents [56.9860859585028]
インタラクティブデジタルエージェント(IDA)は、ステートフルなデジタル環境のAPIを利用して、ユーザの要求に応じてタスクを実行する。
対象環境で直接IDAを訓練する強化学習(RL)手法を提案する。
我々は、近似ポリシー最適化のデータおよびメモリ効率の亜種である LOOP を導出する。
論文 参考訳(メタデータ) (2025-02-03T18:35:42Z) - Online Intrinsic Rewards for Decision Making Agents from Large Language Model Feedback [52.763620660061115]
ONIは、RLポリシーと本質的な報酬関数を同時に学習する分散アーキテクチャである。
我々は、様々な複雑さを持つ報酬モデリングのためのアルゴリズムの選択範囲を探索する。
提案手法は,NetHack Learning Environment の様々な課題にまたがって,最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2024-10-30T13:52:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。