論文の概要: SWE-MILE: Asynchronous Potential-Induced Milestone Credit Assignment for Long-Horizon Software Engineering Agents
- arxiv url: http://arxiv.org/abs/2609.32631v1
- Date: Sat, 26 Sep 2026 13:49:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:51:49.552858
- Title: SWE-MILE: Asynchronous Potential-Induced Milestone Credit Assignment for Long-Horizon Software Engineering Agents
- Title(参考訳): SWE-MILE: 長期ソフトウェアエンジニアリングエージェントのための非同期電位誘起マイルストーンクレジットアサインメント
- Abstract要約: SWE-MILEは、ワークフローランタイムからきめ細かいプロセス監視を導出するプロセス監視フレームワークである。
非同期シャドウプローブは、分離されたサンドボックス内のリポジトリ変更アクションを再生し、エージェントのプライマリインタラクションと並行して検証を実行する。
2つの代表的な長期SWEタスクの実験は、エージェント性能を大幅に改善したことを示している。
- 参考スコア(独自算出の注目度): 52.92536111845184
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon software engineering (SWE) agents trained with reinforcement learning with verifiable rewards (RLVR) typically receive only terminal outcome supervision, making it difficult to distinguish productive actions from redundant exploration or functional regressions. We propose SWE-MILE, an asynchronous potential-induced milestone credit assignment framework that derives fine-grained process supervision from workflow runtime, without auxiliary reward models or external evaluators. SWE-MILE quantifies task-relevant file exposure and test-state alignment as navigation and verification potentials, respectively. Differences in these potentials attribute milestone progress and regressions to individual actions, while discounted backward credit propagates supervision to preceding steps. To efficiently acquire intermediate verification states, SWE-MILE further introduces asynchronous shadow probing, which replays repository-changing actions in an isolated sandbox and runs verification in parallel with the agent's primary interaction, largely hiding verification latency. The resulting process credit augments terminal outcome advantages and provides informative learning signals. Experiments on two representative long-horizon SWE tasks demonstrate substantial improvements in agent performance, highlighting workflow runtime signals as a practical source of process supervision for long-horizon SWE agents.
- Abstract(参考訳): 強化学習と検証可能な報酬(RLVR)で訓練された長期水平ソフトウェア工学(Long-Horizon Software Engineering, SWE)エージェントは、通常、終末結果の監督を受けるのみであり、冗長な探索や機能的回帰と生産的行動の区別が難しい。
SWE-MILEは,ワークフロー実行時の細粒度プロセスの監視を補助的な報酬モデルや外部評価装置を使わずに実現する,非同期電位によるマイルストーンクレジット割り当てフレームワークである。
SWE-MILEはタスク関連ファイル露出とテスト状態アライメントをそれぞれナビゲーションと検証ポテンシャルとして定量化する。
これらのポテンシャルの違いは、マイルストーンの進行と個々の行動への回帰に起因し、後方クレジットは前段階の監督を宣伝する。
中間検証状態を効率的に取得するために、SWE-MILEはさらに非同期シャドウプロービングを導入し、サンドボックス内のリポジトリ変更アクションをリプレイし、エージェントのプライマリインタラクションと並行して検証を実行する。
結果のプロセスクレジットは、端末結果の利点を高め、情報学習信号を提供する。
2つの代表的な長期SWEタスクの実験は、長期SWEエージェントのプロセス監視の実践的情報源としてワークフロー実行時の信号を強調し、エージェント性能を大幅に改善したことを示す。
関連論文リスト
- Success Leaves Detours: Learning Executable Walkthroughs for Long-Horizon Agents [11.833965746124408]
テストタイムの自己進化エージェントは過去の経験を再利用することで改善されるが、スパース・リワード・トラジェクトリには障害、ループ、デトゥールが含まれる。
我々は、ノイズの多いトラジェクトリを実行可能なウォークスルーメモリにコンパイルする依存基盤フレームワークであるTraceを提案する。
J-TTL、WebShop、ScienceWorldの3つのオープンソースのLCMによる実験によると、トレースは8つのテスト時間学習とメモリベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-08-20T01:10:11Z) - From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents [75.69180947909148]
大規模言語モデル(LLM)エージェントのためのトラジェクトリレベルのUQフレームワークを提案する。
RuPAは、推論状態、ツールインタラクション、環境フィードバックが時間的およびセマンティックな依存関係エッジで接続されたノードである、指向的なトラジェクトリグラフとして実行履歴を表現している。
我々は,複数のモデルファミリにまたがる6つのオープンソースLCMを用いて,代用エージェントベンチマーク($2, Terminal-Bench-2, GAIA)でRUPAを評価した。
論文 参考訳(メタデータ) (2026-08-17T01:40:14Z) - AgentR A Stateful and Recovery-Aware Software Architecture for LLM-based Auditable Workflows [14.042464830509864]
AgentRは、研究意図、生成されたクエリ、候補論文の評価、ギャップ分析を耐久性のあるワークフローアーティファクトとして表現する。
設計には、明示的な処理状態遷移、指数的バックオフによるリトライ、クレジット対応の事前チェック、ACIDトークンコストのログ、価格レコードの徐々に変化するType-2が含まれている。
LLMの段階では、99.2%のジョブ完了を達成し、意図分解、クエリ生成、および紙スコアのための平均遅延は9.0秒、18.9秒25.4秒である。
論文 参考訳(メタデータ) (2026-08-15T14:51:43Z) - A Task-State Representation for Long-Horizon Mobile GUI Agents [53.359524744953575]
Task-State Representation (TSR)は、感覚入力からタスク状態を明示的に分離する、トレーニング不要のフレームワークである。
4つのモバイルGUIベンチマークによる実験では、TSRの有効性が検証され、成功率が12ポイントまで向上した。
論文 参考訳(メタデータ) (2026-07-01T06:37:21Z) - SWE-TRACE: Optimizing Long-Horizon SWE Agents Through Rubric Process Reward Models and Heuristic Test-Time Scaling [13.335296846555204]
現在のパイプラインは、最適化されていないデモデータ、スパース実行報酬、計算的に禁止された推論スケーリングによってボトルネックされる。
SWE-TRACEはデータキュレーション、強化学習(RL)、テスト時間推論にまたがるSWEエージェントライフサイクルを最適化する統合フレームワークである。
標準SWEベンチマークの実験により、SWE-TRACEは、両方のトークン消費推論遅延を大幅に削減しつつ、解決率を最大化し、最先端の精度を大幅に向上することが示された。
論文 参考訳(メタデータ) (2026-04-16T09:41:47Z) - SWE-Shepherd: Advancing PRMs for Reinforcing Code Agents [0.31034395048547575]
既存のアプローチは、コード編集、ファイルナビゲーション、テスト実行などのアクションを選択するための静的なプロンプト戦略や手作業に依存している。
本稿では,プロセス・リワード・モデル(Process Reward Models,PRM)を導入するフレームワークであるSWE-Shepherdを提案する。
SWE-Bench Verifiedの実験では、インタラクション効率とアクション品質の改善に加えて、中間報酬と最終タスク成功の整合性の課題も強調されている。
論文 参考訳(メタデータ) (2026-04-12T06:51:47Z) - LongCLI-Bench: A Preliminary Benchmark and Study for Long-horizon Agentic Programming in Command-Line Interfaces [65.11019654023978]
LongCLI-Benchは、長期にわたる現実的なタスクにまたがるエージェント能力を評価するために設計されたベンチマークである。
私たちは、1000以上のコンピュータサイエンスの課題と現実世界のタスクから、20の高品質で長い水平タスクをキュレートしました。
実験によると、最先端のエージェントでさえLongCLI-Benchの20%未満のパスレートを達成する。
論文 参考訳(メタデータ) (2026-02-15T23:12:57Z) - Audited Skill-Graph Self-Improvement for Agentic LLMs via Verifiable Rewards, Experience Synthesis, and Continual Memory [3.7163033180152536]
Audited Skill-Graph Self-Improvementは、自己改善をエージェントの反復的なコンパイルとしてスキルグラフに扱うフレームワークである。
本稿では,完全なシステムアーキテクチャ,脅威モデル,セキュリティ解析を提案し,完全に実行可能な参照実装を提供する。
論文 参考訳(メタデータ) (2025-12-28T19:39:47Z) - AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress [71.02263260394261]
大規模言語モデル(LLM)は、マルチターン意思決定タスクにおいて依然として課題に直面している。
プロセス報酬モデル(PRM)を構築し、各意思決定を評価し、エージェントの意思決定プロセスを導く。
AgentPRMは、シーケンシャルな決定と最終的な目標への貢献の間の相互依存の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-11-11T14:57:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。