論文の概要: TRACE: Capability-Targeted Agentic Training
- arxiv url: http://arxiv.org/abs/2604.05336v1
- Date: Tue, 07 Apr 2026 02:22:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.575349
- Title: TRACE: Capability-Targeted Agentic Training
- Title(参考訳): TRACE: 能力目標エージェントトレーニング
- Authors: Hangoo Kang, Tarun Suresh, Jon Saad-Falcon, Azalia Mirhoseini,
- Abstract要約: 環境特異的なエージェント自己改善のためのエンドツーエンドシステムであるTRACEを紹介する。
TRACEは、機能不足を特定するために、成功と失敗の軌跡を対比している。
目標とするトレーニング環境を合成し、その能力が行使されたかどうかを報奨する。
各合成環境において、LoRAアダプタをRL経由でトレーニングし、推論時に関連するアダプタにルーティングする。
- 参考スコア(独自算出の注目度): 11.088296897059157
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) deployed in agentic environments must exercise multiple capabilities across different task instances, where a capability is performing one or more actions in a trajectory that are necessary for successfully solving a subset of tasks in the environment. Many existing approaches either rely on synthetic training data that is not targeted to the model's actual capability deficits in the target environment or train directly on the target environment, where the model needs to implicitly learn the capabilities across tasks. We introduce TRACE (Turning Recurrent Agent failures into Capability-targeted training Environments), an end-to-end system for environment-specific agent self-improvement. TRACE contrasts successful and failed trajectories to automatically identify lacking capabilities, synthesizes a targeted training environment for each that rewards whether the capability was exercised, and trains a LoRA adapter via RL on each synthetic environment, routing to the relevant adapter at inference. Empirically, TRACE generalizes across different environments, improving over the base agent by +14.1 points on $τ^2$-bench (customer service) and +7 perfect scores on ToolSandbox (tool use), outperforming the strongest baseline by +7.4 points and +4 perfect scores, respectively. Given the same number of rollouts, TRACE scales more efficiently than baselines, outperforming GRPO and GEPA by +9.2 and +7.4 points on $τ^2$-bench.
- Abstract(参考訳): エージェント環境にデプロイされる大規模言語モデル(LLM)は、複数のタスクインスタンスにまたがって複数の機能を実行する必要がある。
既存の多くのアプローチは、ターゲット環境における実際の能力不足を対象としていない合成トレーニングデータに依存するか、ターゲット環境に直接トレーニングする。
TRACE(Turning Recurrent Agent failures in Capability-targeted Training Environments)は,環境特異的なエージェント自己改善のためのエンドツーエンドシステムである。
TRACEは、機能不足を自動的に識別するために成功し失敗した軌跡を対比し、その能力が行使されたかどうかを報奨する目標のトレーニング環境を合成し、各合成環境上でRLを介してLoRAアダプタを訓練し、推論時に関連するアダプタにルーティングする。
実証的に、TRACEは様々な環境にまたがって一般化し、$τ^2$-benchの+14.1ポイント、ToolSandboxの+7パーフェクトスコアが+7.4ポイント、+4パーフェクトスコアが+4パーフェクトスコアが+7.4ポイントである。
同じ数のロールアウトが与えられると、TRACEはベースラインよりも効率的にスケールし、GRPOとGEPAを$τ^2$-benchで+9.2と+7.4で上回る。
関連論文リスト
- EnterpriseBench Corecraft: Training Generalizable Agents on High-Fidelity RL Environments [0.10934862523101825]
我々は,高忠実度強化学習環境におけるAIエージェントの訓練が,トレーニング分布を超えて一般化する能力を生み出すことを示す。
私たちは、Surge AIのエージェントRL環境スイートであるEnterpriseBenchの最初の環境であるCoreCraftを紹介します。
論文 参考訳(メタデータ) (2026-02-18T04:35:46Z) - Autonomous Continual Learning of Computer-Use Agents for Environment Adaptation [57.65688895630163]
ACuRLは自律的なカリキュラム強化学習フレームワークで、エージェントを人間データゼロの特定の環境に継続的に適応させる。
本研究では,環境内学習と環境横断学習の両方を効果的に実現し,既存の環境を忘れずに4~22%の性能向上を実現した。
論文 参考訳(メタデータ) (2026-02-10T23:06:02Z) - Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning [62.499592503950026]
大規模言語モデル(LLM)は、ツールや環境とのマルチターンインタラクションを必要とする複雑なタスクを実行するために、自律エージェントに権限を与えている。
完全合成環境生成パイプラインであるエージェント・ワールド・モデル(AWM)を提案する。
私たちは、エージェントがリッチなツールセットと対話できる、毎日のシナリオをカバーする1,000の環境にスケールします。
論文 参考訳(メタデータ) (2026-02-10T18:55:41Z) - Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystem [90.17610617854247]
本稿では,エージェントモデルの生産パイプラインを最適化する基盤インフラであるエージェント学習エコシステム(ALE)を紹介する。
ALEは、重量最適化のためのトレーニング後のフレームワークであるROLL、軌道生成のためのサンドボックス環境マネージャであるROCK、効率的なコンテキストエンジニアリングのためのエージェントフレームワークであるiFlow CLIの3つのコンポーネントで構成されている。
ROMEはALEが基盤として100万件以上のトラジェクトリをトレーニングしたオープンソースエージェントです。
論文 参考訳(メタデータ) (2025-12-31T14:03:39Z) - Efficient Multi-turn RL for GUI Agents via Decoupled Training and Adaptive Data Curation [65.3648667980258]
視覚言語モデル(VLM)に基づくGUIエージェントは複雑なタスクの自動化を約束するが、強化学習(RL)の適用において大きな課題に直面している。
異種モジュールを高度に非結合的に協調するGUIエージェントのための非結合エージェントRLトレーニングフレームワークであるDARTを提案する。
OSWorldのベンチマークでは、DART-GUI-7Bは42.13%のタスク成功率、14.61%の絶対ゲイン、オープンソースSOTAよりも7.34%高い。
論文 参考訳(メタデータ) (2025-09-28T13:19:20Z) - Generalizable End-to-End Tool-Use RL with Synthetic CodeGym [52.31172214690965]
エージェントRLのための多目的ツール環境を多種多様な、検証可能な、制御可能な、多目的ツール環境を合成するフレームワークであるCodeGymを紹介する。
CodeGymは、静的コーディングの問題を対話的な環境に書き換え、原子関数やロジックを呼び出し可能なツールに抽出する。
さまざまなサイズのモデルとCodeGymでトレーニングされたチェーン・オブ・コンフィグレーションは、一貫したアウト・オブ・ディストリビューションの一般化性を示す。
論文 参考訳(メタデータ) (2025-09-22T03:03:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。