論文の概要: Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation
- arxiv url: http://arxiv.org/abs/2609.01603v1
- Date: Tue, 01 Sep 2026 17:59:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.944687
- Title: Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation
- Title(参考訳): 軌道認識による効率的なSWEエージェントベンチマーク
- Authors: Kefeng Duan, Dewu Zheng, Yanlin Wang, Xiwen Wang, Ensheng Shi, Xilin Liu, Yuchi Ma, Jiachi Chen, Mingwei Liu, Zibin Zheng,
- Abstract要約: プロセスと結果信号を融合するPTA-IRTを提案する。
低キャリブレーションの予算の下では、PTA-IRTは4つのSWEベンチマークのスコアとランキングのリカバリでIRT以前のベースラインを上回っている。
- 参考スコア(独自算出の注目度): 46.74484954631231
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Evaluating software engineering agents on realistic benchmarks is costly, since each task may require multi-step code exploration, modification, and test execution. Existing efficient evaluation methods select representative subsets to estimate full-benchmark performance, but are largely result-only: they fit historical pass/fail response matrices or static task semantics, discarding how agents solve problems. We propose PTA-IRT, a Privileged Trajectory-Aware Item Response Theory framework that fuses process and outcome signals. Historical execution trajectories supply process-level evidence beyond pass/fail, such as explored context, attempted edits, and solving paths, which PTA-IRT uses as privileged information for calibration subset selection and ability estimation. Under low calibration budgets, PTA-IRT consistently outperforms prior IRT baselines on score and ranking recovery across four SWE benchmarks. Code and data are publicly available at https://github.com/DeepSoftwareAnalytics/PTA-IRT.
- Abstract(参考訳): ソフトウェアエンジニアリングエージェントを現実的なベンチマークで評価するにはコストがかかる。
既存の効率的な評価手法では、代表的なサブセットを選択して、フルベンチマークのパフォーマンスを見積もるが、主に結果のみであり、それらは過去のパス/フェイル応答行列や静的タスクセマンティクスに適合し、エージェントの問題解決方法を捨てる。
プロセスと結果信号を融合するPTA-IRTを提案する。
過去の実行トラジェクトリでは、パス/フェイルを超えたプロセスレベルのエビデンス(コンテキスト探索、編集の試み、解決パスなど)が提供され、PTA-IRTはキャリブレーションサブセットの選択と能力推定の特権情報として使用している。
低キャリブレーション予算の下では、PTA-IRTは4つのSWEベンチマークのスコアとランキングのリカバリでIRT以前のベースラインを上回っている。
コードとデータはhttps://github.com/DeepSoftwareAnalytics/PTA-IRTで公開されている。
関連論文リスト
- Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis [68.28714988482703]
プロセス・リワード・モデル(PRM)は、LLM(Large Language Models)の推論能力を増強することに成功した。
本稿では,一般ドメインのPRMがデータ分析エージェントの監督に苦慮していることを示す。
本稿では,新しい環境対応生成プロセス報酬モデルであるDataPRMを紹介する。
論文 参考訳(メタデータ) (2026-04-27T09:00:30Z) - SWE-TRACE: Optimizing Long-Horizon SWE Agents Through Rubric Process Reward Models and Heuristic Test-Time Scaling [13.335296846555204]
現在のパイプラインは、最適化されていないデモデータ、スパース実行報酬、計算的に禁止された推論スケーリングによってボトルネックされる。
SWE-TRACEはデータキュレーション、強化学習(RL)、テスト時間推論にまたがるSWEエージェントライフサイクルを最適化する統合フレームワークである。
標準SWEベンチマークの実験により、SWE-TRACEは、両方のトークン消費推論遅延を大幅に削減しつつ、解決率を最大化し、最先端の精度を大幅に向上することが示された。
論文 参考訳(メタデータ) (2026-04-16T09:41:47Z) - Runtime Execution Traces Guided Automated Program Repair with Multi-Agent Debate [8.424102114588559]
自動プログラム修復(APR)は複雑なロジックエラーとサイレント障害に悩まされる。
現在のLLMベースのAPRメソッドは主に静的であり、ソースコードと基本的なテスト出力に依存している。
我々は、パッチ検証のための共有制約としてランタイム事実を活用するマルチエージェントフレームワークであるTraceRepairを提案する。
論文 参考訳(メタデータ) (2026-04-03T02:23:25Z) - ELT-Bench-Verified: Benchmark Quality Issues Underestimate AI Agent Capabilities [4.5258165293324515]
Extract-Load-Transformパイプラインは、労働集約的なデータエンジニアリングタスクであり、AI自動化の高インパクトターゲットである。
エンドツーエンドのETLパイプライン構築のための最初のベンチマークであるETL-Benchでは、AIエージェントが最初に成功率を低くした。
これらの結果を再検討し,エージェント能力を著しく過小評価する要因を2つ同定した。
論文 参考訳(メタデータ) (2026-03-31T08:02:16Z) - Verified Critical Step Optimization for LLM Agents [67.05296684575445]
クリティカルステップ最適化は、検証されたクリティカルステップに優先学習を集中する。
メソッドは、専門家のデモンストレーションではなく、失敗するポリシーの軌道から始まります。
GAIA-Text-103とXBench-DeepSearchの実験では、CSOはSFTベースラインよりも37%、相対的に26%改善している。
論文 参考訳(メタデータ) (2026-02-03T11:41:02Z) - Guided by Trajectories: Repairing and Rewarding Tool-Use Trajectories for Tool-Integrated Reasoning [65.10602992874787]
AutoTrajはツール使用トラジェクトリの修復と報酬によってTIRを自動的に学習するフレームワークである。
実世界のベンチマークの実験では、AutoTrajの有効性が示されている。
論文 参考訳(メタデータ) (2026-01-30T14:42:04Z) - BOTS: A Unified Framework for Bayesian Online Task Selection in LLM Reinforcement Finetuning [82.925106913459]
強化微調整(Reinforcement Finetuning, RFT)は、大規模言語モデル(LLM)を人間の嗜好と整合させ、推論を強化するための重要な手法である。
RFT強化微調整におけるベイズオンラインタスク選択のための統合フレームワークBOTSを紹介する。
論文 参考訳(メタデータ) (2025-10-30T11:15:23Z) - Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents [22.781523439717223]
エージェントのパフォーマンスを適切に評価するには、最終回答を超え、問題解決の軌跡も評価する必要がある。
ツール拡張LDMエージェント性能の多次元評価のためのフレームワークであるTRACEを紹介する。
TRACEはこれらの複雑な挙動を,スケーラブルで費用対効果の高い方法で正確に評価する。
論文 参考訳(メタデータ) (2025-10-03T09:19:15Z) - Re-Evaluating LiDAR Scene Flow for Autonomous Driving [80.37947791534985]
自己教師型LiDARシーンフローの一般的なベンチマークは、動的動き、非現実的な対応、非現実的なサンプリングパターンの非現実的な速度を持つ。
実世界のデータセットのスイート上で,トップメソッドのスイートを評価する。
学習に重点を置いているにもかかわらず、ほとんどのパフォーマンス向上は前処理と後処理のステップによって引き起こされる。
論文 参考訳(メタデータ) (2023-04-04T22:45:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。