論文の概要: OpenForgeRL: Train Harness-native Agents in Any Environment
- arxiv url: http://arxiv.org/abs/2607.21557v2
- Date: Fri, 24 Jul 2026 02:46:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 14:08:31.047841
- Title: OpenForgeRL: Train Harness-native Agents in Any Environment
- Title(参考訳): OpenForgeRL: 任意の環境におけるハーネスネイティブエージェントのトレーニング
- Authors: Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou, Qianhui Wu, Hao Cheng, Wenlin Yao, Nikhil Singh, Zhou Yu, Jianfeng Gao,
- Abstract要約: 多様な環境でハーネスベースのエージェントをエンドツーエンドにトレーニングするためのオープンソースのフレームワークであるOpenForgeRLを紹介します。
推論を分離することで、OpenForgeRLは研究者がデプロイする実際のハーネスや環境において、エージェントを直接訓練、研究、改善することができる。
- 参考スコア(独自算出の注目度): 60.23309689179493
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern AI agents rely on elaborate inference harnesses such as Claude Code, Codex, and OpenClaw to drive multi-turn reasoning, tool use, and access to external systems. While powerful, these complex harnesses also make agents hard to train end-to-end with open infrastructure, whose SFT/RL stacks cannot natively express stateful, multi-process harness inference. To address this, we present OpenForgeRL, an open-source framework for training harness-based agents end-to-end in diverse environments. OpenForgeRL achieves this with a lightweight proxy that serves the harness's model calls while recording them as training data for a standard RL codebase (e.g., veRL), and a Kubernetes orchestrator that runs each rollout in its own remote container, together enabling training on any harness in any environment at scale. By decoupling training and inference, OpenForgeRL allows researchers to easily train, study, and improve agents directly in the real harnesses and environments they are deployed with. We validate our framework across diverse, complex harnesses and environments, spanning tool/claw-based agents and multimodal GUI browser- and computer-use agents. Using only hundreds to a few thousand tasks, OpenForgeClaw reaches 31.7 pass^3 and 55.9 pass@3 on ClawEval and 33.7 on QwenClawBench. OpenForgeGUI reaches 37.7 on OSWorld-Verified, 63.0 on Online-Mind2Web, and 72.3 on WebVoyager. Both outperform open baselines of similar size on nearly all benchmarks, and in the GUI setting match or surpass models several times larger. Beyond benchmarks, we analyze how harness choice (e.g., ZeroClaw, OpenClaw, Codex) and RL shape agent behavior. We find that some harnesses are substantially harder to learn than others, and that RL improves agentic reliability, such as self-verification, tool coverage, and completing multi-step plans, though critical abilities such as error recovery remain weak.
- Abstract(参考訳): 現代のAIエージェントは、複数ターン推論、ツールの使用、外部システムへのアクセスを促進するために、Claude Code、Codex、OpenClawなどの精巧な推論ハーネスに依存している。
これらの複雑なハーネスは、SFT/RLスタックがステートフルなマルチプロセスハーネス推論をネイティブに表現できないような、オープンインフラストラクチャによるエンドツーエンドのトレーニングを難しくする。
この問題を解決するために、さまざまな環境でハーネスベースのエージェントをエンドツーエンドにトレーニングするためのオープンソースのフレームワークであるOpenForgeRLを紹介します。
OpenForgeRLは、標準のRLコードベース(例えば、veRL)のトレーニングデータとして記録しながらハーネスのモデルコールを提供する軽量プロキシと、各ロールアウトを自身のリモートコンテナで実行するKubernetesオーケストレータを使用して、大規模な任意の環境におけるハーネスのトレーニングを可能にする。
トレーニングと推論を分離することにより、OpenForgeRLは、デプロイされる実際のハーネスと環境において、エージェントを直接トレーニング、研究、改善することができる。
多様な複雑なハーネスと環境、ツール/爪ベースのエージェント、マルチモーダルGUIブラウザおよびコンピュータ利用エージェントにまたがるフレームワークを検証する。
数百から数千のタスクしか使わず、OpenForgeClawはClawEvalでは31.7 pass^3、55.9 pass@3、QwenClawBenchでは33.7に達した。
OpenForgeGUIはOSWorld-Verifiedで37.7、Online-Mind2Webで63.0、WebVoyagerで72.3に達した。
どちらもほぼ全てのベンチマークで同じ大きさのオープンベースラインより優れており、GUI設定はモデルよりも数倍大きい。
ベンチマーク以外にも、選択方法(例えば、ZeroClaw、OpenClaw、Codex)とRL形状エージェントの動作を分析します。
RLは自己検証やツールカバレッジ,マルチステップ計画の完成など,エージェントの信頼性を向上するが,エラー回復などの重要な能力は依然として弱いままである。
関連論文リスト
- SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL [38.05711358650287]
コンピュータ利用エージェント(CUA)は、視覚認識とGUI実行を通じて複雑なデジタルを自動化する強力なインターフェースとして登場しつつある。
検証可能な報酬(RLVR)を備えたオンライン強化学習は、その能力をスケールアップするための重要な方向として現れている。
検証可能なタスク合成と効率的なトレーニングを通じてCUAのオンラインRLをスケールする統合フレームワークであるScaleCUAを紹介する。
論文 参考訳(メタデータ) (2026-07-13T07:32:35Z) - ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning [91.51460129144654]
我々はParaVTを紹介した。ParaVTは、Parallel Video Tool呼び出しのための、最初のマルチエージェントのエンドツーエンドRLトレーニングフレームワークである。
ParaVTはQwen3-VLベースラインを平均で+7.9%改善し、PARA-GRPOはトレーニングタイムのフォーマット準拠を0.13から0.64に引き上げた。
論文 参考訳(メタデータ) (2026-05-19T18:01:26Z) - OpenClaw-RL: Train Any Agent Simply by Talking [54.06773485601523]
次状態信号は普遍的であり、ポリシーはそれらすべてから同時に学習することができる。
個人的な会話、端末の実行、GUIインタラクション、SWEタスク、ツールコールトレースは、別個のトレーニング問題ではない。
OpenClaw-RLは、エージェントを単に使用することで改善し、ユーザのリクエリ、修正、明示的なフィードバックから会話信号を復元する。
論文 参考訳(メタデータ) (2026-03-10T18:59:01Z) - INTELLECT-3: Technical Report [5.3998786788822]
INTELLECT-3は、大規模な強化学習で訓練されたMixture-of-Expertsモデル(12Bアクティブ)である。
私たちは、RLフレームワークを含む、モデルを作成するのに使用される完全なインフラストラクチャスタックとともに、モデルをオープンソースにしています。
大規模非同期強化学習のためのオープンフレームワークである Prime-rl を紹介する。
論文 参考訳(メタデータ) (2025-12-18T03:57:01Z) - RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments [111.87296453908199]
適応検証環境(RLVE)を用いた強化学習の導入
RLVEは、各検証可能な環境が、トレーニングが進むにつれて、問題の難易度分布をポリシーモデルの能力に動的に適応させることを可能にする。
環境スケーリング,すなわち,トレーニング環境の収集を拡大することで,推論能力が継続的に向上することを示す。
論文 参考訳(メタデータ) (2025-11-10T17:18:35Z) - RLtools: A Fast, Portable Deep Reinforcement Learning Library for Continuous Control [7.259696592534715]
深層強化学習(Deep Reinforcement Learning, RL)は、複数のドメインで有能なエージェントとコントロールポリシーを得られるが、一般的には、非常に長い訓練時間によって悩まされる。
RLtoolsは依存性のない、ヘッダのみの純粋なC++ライブラリで、深い教師付きと強化学習のためのライブラリである。
論文 参考訳(メタデータ) (2023-06-06T09:26:43Z) - ElegantRL-Podracer: Scalable and Elastic Library for Cloud-Native Deep
Reinforcement Learning [141.58588761593955]
クラウドネイティブな深層強化学習のためのライブラリElegantRL-podracerを提案する。
数百万のコアを効率的にサポートし、複数のレベルで大規模な並列トレーニングを実行する。
低レベルでは、各ポッドは1つのGPUで7,000近いGPUコアをフル活用することで、エージェントと環境のインタラクションを並列にシミュレートする。
論文 参考訳(メタデータ) (2021-12-11T06:31:21Z) - Godot Reinforcement Learning Agents [10.413185820687021]
Godot RL Agentsインターフェースは、挑戦的な2Dおよび3D環境におけるエージェントの動作の設計、生成、学習を可能にする。
このフレームワークは、研究者やゲームデザイナが、離散的、連続的、混合的なアクション空間を持つ環境を作成できる汎用的なツールである。
論文 参考訳(メタデータ) (2021-12-07T11:24:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。