論文の概要: The Rollout Infrastructure Tax in Coding-Agent Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.01415v1
- Date: Wed, 01 Jul 2026 19:20:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.575511
- Title: The Rollout Infrastructure Tax in Coding-Agent Reinforcement Learning
- Title(参考訳): コーディング・エージェント強化学習におけるロールアウトインフラ税
- Abstract要約: コーディングエージェント強化学習は、多数のインタラクティブソフトウェアロールアウトに依存しながら、実行インフラストラクチャをバックグラウンド実装として扱う。
インフラのオーバーヘッドを測定することで、小規模のロールアウト単位の貯蓄を大規模に行うRLポストトレーニングの実践的効率向上が明らかになる。
単一のコンテナ、ホストされたサンドボックス、オーケストレーションされたコンテナ、クラウド仮想マシンの4つの実行基板の比較研究を行った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Coding-agent reinforcement learning treats execution infrastructure as a background implementation detail, despite relying on large numbers of interactive software rollouts. This is a missed opportunity: measuring infrastructure overhead can reveal practical efficiency gains for RL post-training, where small per-rollout savings compound at scale. We present a comparative study of four execution substrates: single containers, hosted sandboxes, Kubernetes-orchestrated containers, and cloud virtual machines. We find up to $110\times$ variation in cold-start latency and a $1.8\times$ spread in projected worker-hours for one million 150-step trajectories. Our results suggest that future coding-agent RL systems should optimize execution substrates as part of the training system itself, not merely as deployment plumbing.
- Abstract(参考訳): コーディングエージェント強化学習は、多数のインタラクティブソフトウェアロールアウトに依存しながら、実行インフラストラクチャをバックグラウンド実装として扱う。
インフラのオーバーヘッドを測定することで、小規模のロールアウト単位の貯蓄を大規模に行うRLポストトレーニングの実践的効率向上が明らかになる。
単一のコンテナ、ホストされたサンドボックス、Kubernetesオーケストレーションされたコンテナ、クラウド仮想マシンの4つの実行基板を比較した。
コールドスタートのレイテンシの変動は最大$110\times$で、ワーカ時間の予測では$1.8\times$で100万の150ステップのトラジェクトリが展開されます。
この結果から,将来のコーディングエージェントRLシステムは,単なる配置配管ではなく,トレーニングシステム自体の一部として実行基板を最適化すべきであることが示唆された。
関連論文リスト
- Not All Prompts Are Equal: Exploration-Guided Prompt Scaffolding for Multimodal Reinforcement Post-Training [15.647521419163985]
オンライン強化学習(RL)のトレーニングプロンプトは,現行の方針にどのような影響を及ぼすかという点で大きく異なる。
マルチモーダル大言語モデル(MLLM)の学習後,RLを通して動的にトレーニングプロンプト分布を適応する探索誘導型プロンプト足場構築フレームワークを提案する。
教師モデルを用いて、元のタスク意図を保存しつつ、その後のトレーニングをより有益なものにする、足場付き書き直しを生成する。
論文 参考訳(メタデータ) (2026-09-14T05:12:05Z) - Spend Your Rollouts Where It Counts: Rollout Allocation for Group-Based RL Post-Training [34.81218483901967]
強化学習は、大規模言語モデルの訓練後において支配的なパラダイムである。
グループベースのポリシー最適化手法は、プロンプト毎に複数のロールアウトから利点を計算する。
Pilot-Commitは、グループベースのRLポストトレーニングのための、予算対応のロールアウトアロケーションフレームワークである。
論文 参考訳(メタデータ) (2026-05-26T06:41:13Z) - SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling [54.276306194000405]
SortedRLを提案する。SortedRLは、強化学習をスケールするためのオンライン長対応スケジューリング戦略である。
SortedRLは、出力長に基づいてロールアウトサンプルをリオーダーし、短いサンプルが早期更新のためにグループを形成することを優先順位付けする。
LLaMA-3.1-8BとQwen-2.5-32Bを論理パズルを含む様々なタスクで実験した結果、SortedRLはRLトレーニングバブル比を50%以上削減することが示された。
論文 参考訳(メタデータ) (2026-03-24T16:48:31Z) - RollArt: Scaling Agentic RL Training via Disaggregated Infrastructure [49.88201789074532]
エージェント強化学習(RL)は、大規模言語モデル(LLM)が自律的な意思決定と長期計画を行うことを可能にする。
分散インフラストラクチャ上でマルチタスクエージェントRLのスループットを最大化する分散システムであるRollArcを提案する。
論文 参考訳(メタデータ) (2025-12-27T11:14:23Z) - GRAND: Guidance, Rebalancing, and Assignment for Networked Dispatch in Multi-Agent Path Finding [6.416429054645992]
本稿では,生涯多エージェントピックアップ・アンド・デリバリ(MAPD)のタスクスケジューリングについて述べる。
学習に基づくグローバルガイダンスと軽量な最適化を組み合わせたハイブリッド手法を提案する。
最大500エージェントの集約された倉庫ベンチマークでは、2024年の勝利スケジューラよりもスループットを最大10%向上させる。
論文 参考訳(メタデータ) (2025-12-02T19:44:57Z) - Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels [96.35283762778137]
我々は、強化学習のためのスケーラブルなデータエンジンであるWebscale-RLパイプラインを紹介した。
9ドメイン以上にわたる120万のサンプルを含むWebscale-RLデータセットを構築した。
我々の研究は、RLを事前学習レベルに拡張するための実行可能なパスを示し、より有能で効率的な言語モデルを可能にします。
論文 参考訳(メタデータ) (2025-10-07T22:30:59Z) - Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward [54.708851958671794]
オフラインとオンラインの両方のデータ選択のための最適化戦略を組み合わせた,データ効率のよいポリシ最適化パイプラインを提案する。
オフラインフェーズでは、多様性、影響、適切な難易度に基づいて、トレーニングサンプルの高品質なサブセットをキュレートする。
オンラインRLVRトレーニングにおいて、探索可能性の低いサンプルを動的にフィルタリングするサンプルレベルの探索性指標を導入する。
論文 参考訳(メタデータ) (2025-09-01T10:04:20Z) - RepoForge: Training a SOTA Fast-thinking SWE Agent with an End-to-End Data Curation Pipeline Synergizing SFT and RL at Scale [15.199441664697988]
トレーニングソフトウェアエンジニアリング(SWE) LLMは、高価なインフラストラクチャ、非効率な評価パイプライン、少ないトレーニングデータ、高価な品質管理によってボトルネックになっている。
本稿では,SWEエージェントを大規模に生成し,評価し,訓練する,自律的なエンドツーエンドパイプラインであるRepoForgeを紹介する。
論文 参考訳(メタデータ) (2025-08-03T02:34:16Z) - Rethinking Closed-loop Training for Autonomous Driving [82.61418945804544]
本研究は,学習エージェントの成功に対する異なるトレーニングベンチマーク設計の影響を分析した最初の実証的研究である。
複数ステップのルックアヘッドで計画を行うRLベースの駆動エージェントであるtrajectory value learning (TRAVL)を提案する。
実験の結果,TRAVLはすべてのベースラインと比較してより速く学習でき,安全な操作が可能であることがわかった。
論文 参考訳(メタデータ) (2023-06-27T17:58:39Z) - Online Convolutional Re-parameterization [51.97831675242173]
2段階のパイプラインであるオンライン畳み込み再パラメータ化(OREPA)は、複雑なトレーニング時間ブロックを単一の畳み込みに絞ることで、巨大なトレーニングオーバーヘッドを低減することを目的としている。
最先端のre-paramモデルと比較して、OREPAはトレーニング時間のメモリコストを約70%削減し、トレーニング速度を約2倍向上させることができる。
また、オブジェクト検出とセマンティックセグメンテーションの実験を行い、下流タスクに一貫した改善を示す。
論文 参考訳(メタデータ) (2022-04-02T09:50:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。