論文の概要: ClawGym II: Exploring Black-Box RL on Agent Harness
- arxiv url: http://arxiv.org/abs/2608.16798v1
- Date: Mon, 17 Aug 2026 16:53:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.799035
- Title: ClawGym II: Exploring Black-Box RL on Agent Harness
- Title(参考訳): ClawGym II:エージェントハーネスでブラックボックスのRLを探る
- Authors: Huatong Song, Fei Bai, Ming Yang, Renyuan Li, Jia Deng, Jujie He, Zhange Zhang, Daixuan Cheng, Yan Xing, Qi Yun, Xuxing Chen, Danyang Li, Feng Chang, Chuan Hao, Ran Tao, Jian Yang, Bryan Dai, Wayne Xin Zhao, Mingjie Tang, Ji-Rong Wen,
- Abstract要約: エージェントハーネスは、エージェントと環境との相互作用を調整することで、長期タスクの性能を大幅に改善した。
複雑なハーネスによる汎用エージェントの安定かつスケーラブルな最適化のための統合ブラックボックスRLフレームワークを提案する。
- 参考スコア(独自算出の注目度): 82.92963070856416
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agent harnesses have substantially improved performance on long-horizon tasks by coordinating agent interactions with the environment. However, reinforcement learning through complex harnesses remains largely unexplored, as scaling such training to long-horizon agent tasks introduces fundamental challenges. In this work, we present a unified black-box RL framework for stable and scalable optimization of general agents through complex harnesses. Concretely, we first build a sandbox-based execution infrastructure that isolates task environments and harnesses within temporary sandboxes for large-scale concurrent rollouts. We then decouple policy optimization from opaque harness execution and place a serving proxy at the model boundary to capture model calls. To reconstruct multi-turn trajectories and improve training efficiency, we organize the captured calls into prefix trees and further adapt both critic-based PPO and critic-free GRPO to optimize over the recovered tree structure. Meanwhile, we maintain training-inference consistency throughout the optimization process. Finally, we introduce mix-harness training, allowing a single model to be jointly optimized by heterogeneous harnesses. With Qwen3-30A3B, black-box RL improves Pass@1 on ClawGym-Bench by 9.98 and 14.81 points through OpenClaw and Claude Code, respectively, while remaining stable over 200-400 optimization steps. Moreover, the framework yields consistent gains on more challenging tasks such as JobBench and OfficeQA. Overall, our framework enables effective, stable, and scalable optimization of general agents through black-box harnesses, supporting unified training across heterogeneous execution systems.
- Abstract(参考訳): エージェントハーネスは、エージェントと環境との相互作用を調整することで、長期タスクの性能を大幅に改善した。
しかし, 複雑なハーネスを通した強化学習は, 長期間のエージェントタスクにそのような訓練を拡大することは, 根本的な課題をもたらすため, 未解明のままである。
本研究では,複雑なハーネスによる汎用エージェントの安定かつスケーラブルな最適化のための統合ブラックボックスRLフレームワークを提案する。
具体的には,タスク環境を分離したサンドボックスベースの実行インフラストラクチャを構築し,大規模な同時ロールアウトを行うための一時的なサンドボックス内にハーネスを配置する。
次に、ポリシー最適化を不透明なハーネス実行から切り離し、モデル呼び出しをキャプチャするために、モデル境界にサービスプロキシを置く。
マルチターントラジェクトリを再構築し,訓練効率を向上させるため,プレフィックスツリーに捕捉したコールを整理し,批判ベースのPPOと批判なしGRPOの両方を適応させて,復元されたツリー構造を最適化する。
一方、最適化プロセスを通してトレーニングと推論の整合性を維持します。
最後に、混合ハーネストレーニングを導入し、一台のモデルを異種ハーネスで共同最適化できるようにする。
Qwen3-30A3B では、ブラックボックス RL は ClawGym-Bench の Pass@1 を OpenClaw と Claude Code を通じて 9.98 と 14.81 で改善し、200-400 以上の最適化ステップは安定している。
さらに、このフレームワークはJobBenchやOfficeQAといったより困難なタスクに対して一貫した利益をもたらす。
全体として、我々のフレームワークはブラックボックスハーネスによる汎用エージェントの効率的で安定的でスケーラブルな最適化を可能にし、異種実行システム間の統一的なトレーニングをサポートする。
関連論文リスト
- Self-Evolving Embodied Agents via Skill-Harness Evolution [53.307052568223945]
身体的エージェントは、ファンデーションモデルを中心としたシステムとして、ますます構築されている。
教師付き微調整と強化学習はエージェントを新しい環境に適応させることができるが、追加のデータ、報酬、トレーニングの実行が必要である。
SHAPERは,モデルパラメータの凍結を保ちつつ,列車不要な態様適応のための自己進化型フレームワークである。
論文 参考訳(メタデータ) (2026-08-11T18:55:58Z) - Co-Harness: Co-Evolving Harnesses and Model Weights for LLM Agents [37.91666123749406]
Co-Harnessは、ポストトレーニング中にエージェントハーネスとモデルパラメータを共同で最適化するフレームワークである。
自律的なケーススタディによると、Co-Harnessはシステムのクラッシュから回復し、推論効率を改善し、人間の介入なしにアンサンブル戦略を発見することができる。
論文 参考訳(メタデータ) (2026-07-17T02:39:57Z) - Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning [47.00572734047258]
本稿では,非同期RLの安定性と非政治的課題に対処するため,単一ロールアウト非同期最適化(SAO)を提案する。
SAOはグループワイドサンプリングを単一ロールアウトサンプリングに置き換える。
SAOは、オープンなGLM-5.2モデルをトレーニングするために、エージェントRLパイプラインにうまくデプロイされる。
論文 参考訳(メタデータ) (2026-07-08T15:02:19Z) - A Comparative Study of Bayesian Contextual Bandits for Real-Time Warehouse Sorter Optimization [1.8807636852384417]
本研究では,高量電子商取引倉庫におけるインバウンド受信ソーダを主なユースケースとして用いた。
このリアルタイムソータディバージョン最適化の課題に対処するため、我々は3つのハイブリッド機械学習フレームワークの比較研究を行った。
以上の結果から,木に基づく報酬モデルでは予測能力は若干向上するが,BCBフレームワークは全体のパフォーマンス向上を実現し,ベースラインに対する報酬の上昇率は2.03%であった。
論文 参考訳(メタデータ) (2026-06-22T22:07:36Z) - Learning Reactive Dexterous Grasping via Hierarchical Task-Space RL Planning and Joint-Space QP Control [50.28263951510334]
本稿では,リアクティブなデクスタリーグルーピングのためのハイブリッド階層型制御フレームワークを提案する。
提案手法は,低レベル共同実行から高レベル空間意図を明示的に分離する。
我々は厳密なシミュレーションと現実のパイプラインを通して提案したフレームワークを広範囲に検証する。
論文 参考訳(メタデータ) (2026-05-05T04:49:38Z) - ClawGym: A Scalable Framework for Building Effective Claw Agents [47.47444724291439]
ClawGymは、Clawスタイルのパーソナルエージェント開発の全ライフサイクルをサポートするスケーラブルなフレームワークである。
ClawGym-SynDataは、ペルソナ駆動のインテントとスキル接地操作から合成された13.5Kのフィルタリングタスクのデータセットである。
次に、ブラックボックスのロールアウト軌跡の教師付き微調整を通じて、ClawGym-Agentsと呼ばれる有能なClawスタイルのモデルのファミリーを訓練する。
さらに、自動フィルタリングとヒューマンLLMレビューを通じて200インスタンスのベンチマークであるClawGym-Benchを構築します。
論文 参考訳(メタデータ) (2026-04-29T17:12:22Z) - HAD: Combining Hierarchical Diffusion with Metric-Decoupled RL for End-to-End Driving [51.268878540511054]
我々は階層的拡散政策を備えたエンドツーエンドの計画フレームワークであるHADを提案する。
我々は,NAVSIMとHUGSIMの両方でHADが新たな最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2026-04-04T04:12:47Z) - ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning [75.73135757250806]
エージェント強化学習(ARL)は、複雑で多段階の対話的なタスクを解決するためのトレーニングエージェントにとって有望なパラダイムとして急速に注目を集めている。
初期の成果を奨励しているにもかかわらず、ARLは非常に不安定であり、しばしばトレーニングの崩壊につながる。
本稿では,制御された再現可能な環境下でのトレーニング安定性を検証した,安定したトレーニングレシピと系統的分析フレームワークであるARLArenaを提案する。
論文 参考訳(メタデータ) (2026-02-25T03:43:34Z) - DiRL: An Efficient Post-Training Framework for Diffusion Language Models [54.405206032785706]
Diffusion Language Models (dLLMs) はAuto-Regressive(AR)モデルに代わる有望な代替品として登場した。
既存の手法は、訓練と推論の間の計算の非効率性と客観的なミスマッチに悩まされている。
我々は,FlexAttention-accelerated blockwise trainingとLMDeploy-timized inferenceを密接に統合した,効率的なポストトレーニングフレームワークであるDiRLを紹介した。
論文 参考訳(メタデータ) (2025-12-23T08:33:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。