論文の概要: Counterfactual Rollout Replay: Forkable Environments as Free Process Rewards for Software Engineering Agents
- arxiv url: http://arxiv.org/abs/2609.33875v3
- Date: Sat, 03 Oct 2026 05:22:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.399648
- Title: Counterfactual Rollout Replay: Forkable Environments as Free Process Rewards for Software Engineering Agents
- Title(参考訳): ソフトウェアエンジニアリングエージェントのためのフリープロセスリワードとしてのフォーク可能な環境
- Abstract要約: アウトカムのみの強化学習は、ソフトウェアエンジニアリング(SWE)エージェントに最終成功のシグナルを与えるが、中間決定に関する直接的なガイダンスはほとんどない。
本稿では,フォーク可能な実行環境を利用するトレーニングタイムであるCounterfactual Rollout Replay (CRR)を紹介する。
CRRは、小さな決定ポイントを選択し、各状態を復元し、代替アクションをサンプルし、ポリシーの下でブランチを前進させる。
- 参考スコア(独自算出の注目度): 10.086808492456266
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Outcome-only reinforcement learning gives software engineering (SWE) agents a terminal success signal but little direct guidance about intermediate decisions. We introduce Counterfactual Rollout Replay (CRR), a training-time procedure that uses forkable executable environments to obtain step-level return contrasts. CRR selects a small set of decision points, restores each state, samples an alternative action, and rolls the branch forward under the policy. It retains the realised training trajectory and replaces the advantage at selected steps with the difference between its terminal return and the sampled counterfactual return. The method needs no human process labels or learned process reward model; free refers to those supervision costs, not replay compute. With a 14B policy, CRR improves pass@1 on SWE-bench Verified, SWE-bench Live, and SWE-rebench, and combines with process-reward and trajectory-search methods. On SWE-bench Verified, an equal-wall-clock comparison on the same hardware yields 41.7% versus 36.7% for extended outcome-only GRPO, a 5.0-point gain with fork overhead included. These results apply to environments with affordable, reliable state restoration; stochastic continuations and expensive or imperfect replay remain limitations.
- Abstract(参考訳): アウトカムのみの強化学習は、ソフトウェアエンジニアリング(SWE)エージェントに最終成功のシグナルを与えるが、中間決定に関する直接的なガイダンスはほとんどない。
我々は、フォーク可能な実行環境を使ってステップレベルのリターンコントラストを得る訓練時間であるCRR(Counterfactual Rollout Replay)を導入する。
CRRは、小さな決定ポイントを選択し、各状態を復元し、代替アクションをサンプルし、ポリシーの下でブランチを前進させる。
実現した訓練軌道を維持し、選択されたステップにおける利点を、その終端リターンとサンプルされた反事実リターンの差に置き換える。
この方法は人間のプロセスラベルや学習プロセス報酬モデルを必要としない。
14Bポリシーにより、CRRはSWE-bench Verified、SWE-bench Live、SWE-rebenchのpass@1を改善し、プロセス・リワードとトラジェクトリ・リサーチの手法と組み合わせる。
SWE-bench Verifiedでは、同じハードウェア上で均等なウォールクロック比較が41.7%、拡張結果のみのGRPOが36.7%、フォークオーバーヘッドが5.0ポイントである。
これらの結果は、安価で信頼性の高い状態回復、確率的継続、高価または不完全なリプレイが制限されている環境に適用できる。
関連論文リスト
- TACIT-Switch: Cost-Aware Model Escalation for LLM Agents from Censored Supervision [2.681967953218225]
より小さな言語モデルバックボーンを持つエージェントは永続的な障害モードにドリフトできるが、より大きなバックボーンを持つエージェントは一般的により信頼性が高いがよりコストがかかる。
この信頼性の高いトレードオフは、より大きなバックボーンを持つエージェントをいつ呼び出すかを決定するルーティングメソッドを動機付けます。
提案手法であるTACIT-SWITCHは,蓄積された軌跡の証拠から永久的ハンドオフポリシーを学習する。
論文 参考訳(メタデータ) (2026-08-28T04:33:11Z) - Retry, Switch, or Abstain? Learning Strategy-Aware Tool-Use Policies via Controlled Error Injection [27.166611699378205]
BENCH2ROBUSTは,障害のないツール使用ベンチマークをシナリオ制御の可解性を持つ制御環境に変換するフレームワークである。
本稿では,Bayesian Tool Memory(BTM)による構造化実行時回復コンテキストと,カリキュラム制御強化学習の2つの補完的介入について検討する。
論文 参考訳(メタデータ) (2026-08-12T12:08:39Z) - Process Reward Informed Tree Rollout for Effective Multi-Turn RL [58.392997761968566]
長期のエージェントタスクでは、均一なロールアウト戦略は、非形式的なデッドエンドの試みに予算を無駄にする可能性がある。
本稿では,マルチターンエージェントRLの品質を意識したロールアウトフレームワークであるProcess-Scorer Guided Adaptive Tree Rollout (PATR)を提案する。
PATRはタスクに適したプロセスフィードバックを使用して部分的軌跡をスコアし、将来性のある状態から選択的に分岐し、共有プレフィックスを再利用し、無駄なサンプリングを減らすために経路を保守的に停止する。
論文 参考訳(メタデータ) (2026-07-17T04:16:58Z) - Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models [90.09182925511317]
Process Aligned Policy Optimization (PAPO) は、RL更新をdLLMの生成軌道と整合させる新しいフレームワークである。
PAPOはスパース端末の報酬を、高不確実なステップで真の軌道を再生するエントロピー誘導歴史再生(EHR)に変換する。
論文 参考訳(メタデータ) (2026-06-07T07:59:55Z) - ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents [48.80766702702854]
LLMベースの検索エージェントは、主に結果のみの報酬で訓練され、検索プロセス自体は監督されていない。
この信号は、全てのサンプル軌跡が同じ正当性を共有する結果同質な群に対して退化し、群内の優位性はゼロとなり、勾配は得られない。
ARBOR(Adaptive Buffer for Online Reward)は,クエリ間で共有されるルーリックメモリを維持する再利用可能なプロセス・リワードフレームワークである。
論文 参考訳(メタデータ) (2026-06-02T06:58:54Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning [90.23629291067763]
大規模言語モデルにおける推論を改善するための有望なアプローチは、プロセス報酬モデル(PRM)を使用することである。
PRMは多段階の推論トレースの各ステップでフィードバックを提供し、結果報酬モデル(ORM)よりも信用割当を改善する可能性がある。
PRMに対して探索を行ったり、強化学習(RL)の報酬として使ったりすることで、基本方針を改善するために、「プロセス報酬をどう設計すべきか?」と質問する。
理論的には,良質なプロデューサの集合を特徴付けるとともに,このようなプロデューサからのプロセス報酬の最適化が,テスト時間探索やオンラインRLの探索を改善することを示す。
論文 参考訳(メタデータ) (2024-10-10T17:31:23Z) - You Can't Count on Luck: Why Decision Transformers Fail in Stochastic
Environments [31.117949189062895]
予測タスクへの強化学習を減らし、教師付き学習(RvS)によって解決する決定変換器は、その単純さ、ハイパースに対する堅牢性、オフラインタスクにおける全体的なパフォーマンスの強化などにより人気を博している。
しかし、単にモデルに所望のリターンを条件付け、予測されたアクションを取るだけで、運の悪さによるリターンをもたらす環境において、劇的に失敗する可能性がある。
本稿では,環境におけるRvSアプローチの限界について述べ,その解決策を提案する。
従来の手法のように単一軌道の戻りを単に条件づけるのではなく、提案手法であるESPERはクラスタ・トラジェクトリと条件を学ぶ。
論文 参考訳(メタデータ) (2022-05-31T17:15:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。