論文の概要: FC-SWE: Failure-Conditioned RL for Long-Horizon Software Engineering Agents
- arxiv url: http://arxiv.org/abs/2610.07898v1
- Date: Tue, 06 Oct 2026 07:44:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.872703
- Title: FC-SWE: Failure-Conditioned RL for Long-Horizon Software Engineering Agents
- Title(参考訳): FC-SWE:長距離ソフトウェアエンジニアリングエージェントのための故障条件付きRL
- Abstract要約: リポジトリレベルのソフトウェアエンジニアリング(SWE)は、難しい長期的設定です。
最近のSWEエージェントは、グループ相対的政策最適化のような強化学習手法で訓練されている。
本稿では,リカバリの試みを政策訓練に取り入れた,障害条件付きRLフレームワークFC-SWEを紹介する。
- 参考スコア(独自算出の注目度): 33.62846918344099
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Repository-level software engineering (SWE) is a challenging long-horizon setting: agents must reason over extended interactions, use tools, and adapt to stateful environments. Recent work trains SWE agents with reinforcement learning methods such as Group Relative Policy Optimization (GRPO), which independently sample multiple trajectories per issue, test the resulting patches, and compare terminal rewards within a fixed group. However, this training setup does not reuse verifier feedback from failed patches as context for subsequent attempts, even though this feedback contains valuable diagnostic information about what went wrong. Training on recovery trajectories is challenging because the preceding outcome determines whether the next trajectory is generated, while the failed execution determines its conditioning context. We introduce FC-SWE, a failure-conditioned RL framework that incorporates recovery attempts into policy training. After a patch fails verification, FC-SWE restores the repository to its original task state and uses the failed patch and verifier feedback as context for a recovery trajectory. FC-SWE adapts GRPO to these chains of complete, multi-turn tool-use trajectories through two mechanisms. Trajectory-local rewards preserve each attempt's verifier outcome, preventing recovery success from rewarding an earlier failed patch. Active-set advantage estimation forms a comparison group from all initial and recovery trajectories actually executed for the same issue, so failed attempts remain in the group while unexecuted attempts are excluded. On all 500 SWE-bench Verified tasks under a verifier-assisted protocol, FC-SWE with Qwen3.5-4B and SWE-agent achieves 41.7% Resolved@1 and 52.8% Resolved@2, compared with 38.9% and 48.5% for GRPO. Although trained with at most two attempts per chain, FC-SWE reaches 70.7% Resolved@11 under an eleven-attempt test-time budget.
- Abstract(参考訳): エージェントは、拡張されたインタラクションを推論し、ツールを使用し、ステートフルな環境に適応する必要があります。
最近のSWEは、グループ相対政策最適化(GRPO)のような強化学習手法でエージェントを訓練し、問題ごとに複数の軌道を個別にサンプリングし、その結果のパッチをテストし、固定グループ内の端末報酬を比較する。
しかし、このトレーニング設定では、問題が発生したかどうかについての貴重な診断情報を含むにもかかわらず、失敗したパッチからの検証済みフィードバックを、その後の試みのコンテキストとして再利用していない。
前の結果が次の軌道が生成されるかどうかを判断し、失敗した実行が条件付けコンテキストを決定するので、回復軌道の訓練は困難である。
本稿では,リカバリの試みを政策訓練に取り入れた,障害条件付きRLフレームワークFC-SWEを紹介する。
パッチが検証に失敗した後、FC-SWEはリポジトリを元のタスク状態に復元し、失敗したパッチと検証者フィードバックを回復軌道のコンテキストとして使用する。
FC-SWEはGRPOを2つの機構を通じて完全な多ターンツール利用軌道に適応させる。
軌道局所報酬は、各試行の検証結果を保存し、回復の成功を早期に失敗したパッチに報いるのを防ぐ。
アクティブセットの利点推定は、同じ問題のために実際に実行されたすべての初期および回復軌道の比較グループを形成するため、未実行の試行は除外され、失敗した試行はグループ内に留まる。
Qwen3.5-4BとSWE-agentを使った検証済みの500のSWE-benchタスクでは、GRPOの38.9%と48.5%と比較して41.7%のResolved@1と52.8%のResolved@2が達成されている。
FC-SWEは1チェーンあたり2回のトライでトレーニングを受けたが、11回の試験時間予算で70.7%のResolved@11に達した。
関連論文リスト
- Counterfactual Rollout Replay: Forkable Environments as Free Process Rewards for Software Engineering Agents [10.086808492456266]
アウトカムのみの強化学習は、ソフトウェアエンジニアリング(SWE)エージェントに最終成功のシグナルを与えるが、中間決定に関する直接的なガイダンスはほとんどない。
本稿では,フォーク可能な実行環境を利用するトレーニングタイムであるCounterfactual Rollout Replay (CRR)を紹介する。
CRRは、小さな決定ポイントを選択し、各状態を復元し、代替アクションをサンプルし、ポリシーの下でブランチを前進させる。
論文 参考訳(メタデータ) (2026-09-27T19:50:50Z) - MeshHeal: Two-Timescale Self-Healing for Gray Failures in Decentralized LLM Agent Networks [60.95806999869478]
MeshHealは、完全に分散化された自己修復フレームワークである。
能力にマッチしたピアレビューを2つのタイムスケールに分けている。
1タスクあたり51kのトータルモデルトークンを使用して0.839の劣化位相精度を達成し、最強のベースラインでは1タスクあたり115kの0.807の精度を達成した。
論文 参考訳(メタデータ) (2026-09-24T04:29:37Z) - FailForge: Distilling Procedural Competence from Persistent Failures into Code Agents [49.519184792774304]
FailForgeは、失敗したロールアウトをトレーニングシグナルに変換するエージェントフレームワークである。
FailForgeは、これまで失敗したインスタンスの26%を、限界的な追加コストでリカバリする。
論文 参考訳(メタデータ) (2026-08-09T08:22:57Z) - Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction [62.42945715963878]
リポジトリレベルの脆弱性の再現は、要求の多いソフトウェアエンジニアリング(SE)タスクである。
最近のLLMエージェントは、アプローチが正しい場合、しばしばこれらのステップを実行するが、間違った戦略を選択することで失敗する。
本論では, アクションの完全な軌跡ではなく, 戦略がSEエージェントの適切な学習単位であることを論じる。
論文 参考訳(メタデータ) (2026-07-02T06:27:27Z) - ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents [48.80766702702854]
LLMベースの検索エージェントは、主に結果のみの報酬で訓練され、検索プロセス自体は監督されていない。
この信号は、全てのサンプル軌跡が同じ正当性を共有する結果同質な群に対して退化し、群内の優位性はゼロとなり、勾配は得られない。
ARBOR(Adaptive Buffer for Online Reward)は,クエリ間で共有されるルーリックメモリを維持する再利用可能なプロセス・リワードフレームワークである。
論文 参考訳(メタデータ) (2026-06-02T06:58:54Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。