論文の概要: Trajectory-Aware Benchmark Subset Selection for Cost-Efficient Software Engineering Agent Regression Testing
- arxiv url: http://arxiv.org/abs/2609.24928v2
- Date: Mon, 28 Sep 2026 15:48:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 14:47:47.863263
- Title: Trajectory-Aware Benchmark Subset Selection for Cost-Efficient Software Engineering Agent Regression Testing
- Title(参考訳): コスト効率の良いソフトウェアエンジニアリングエージェント回帰テストのための軌道対応ベンチマークサブセット選択
- Abstract要約: 自動ソフトウェアエンジニアリングエージェント(SWEエージェント)は、コーディングタスクを自動化する。
1つの解決策は、ベンチマークインスタンスのサブセットのみを評価することである。
トラジェクティブ・アウェア・サブセット選択手法を提案し, トラジェクティブ・埋め込みに基づくランダムサンプリングを決定論的選択に置き換える。
- 参考スコア(独自算出の注目度): 13.445714489253703
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous software engineering agents (SWE-agents) automate coding tasks. Each agent update may require re-running the full benchmark to detect regressions and improvements, at a cost of hundreds of millions of LLM tokens per run, which makes evaluation a bottleneck. One solution is to evaluate only a subset of benchmark instances. Yet, simple approaches, such as random sampling or stratified random sampling based on past pass/fail outcomes, risk producing high variance and unrepresentative subsets. We turn to agent trajectories, the step-by-step record of the actions an agent took. We propose a trajectory-aware subset selection approach that replaces random sampling with deterministic selection based on trajectory embeddings. We first group test set instances by their test outcome in a recent full test run to preserve the historical pass/fail rate, then select the subset using the trajectory's embedding space. We evaluate 76 subset selection configurations, including random sampling, embedding-based selection, clustering-based selection, and hybrid shortlist-then-subsample strategies, across three regression scenarios: same-configuration reruns, model and configuration changes, and agent framework changes. Our best trajectory-aware method is the one selecting benchmark instances closest to the centroid of each outcome group in the embedding space. It achieves the lowest estimation error among all methods we evaluate. For instance, when evaluating a given agent version on a selected subset of 5% or 10% of the test instances, our approach reduces the average estimation error by 3--11% and the worst-case error by 4--11% relative to the typical draw and 38--46% relative to the 95th-percentile draw of the strongest baseline. Our results show that a 10% trajectory-aware subset keeps the median estimation error below 5% while cutting token cost by roughly 90%.
- Abstract(参考訳): 自動ソフトウェアエンジニアリングエージェント(SWEエージェント)は、コーディングタスクを自動化する。
各エージェント更新では、レグレッションと改善を検出するために完全なベンチマークを再実行する必要がある。
1つの解決策は、ベンチマークインスタンスのサブセットのみを評価することである。
しかし、過去のパス/フェイル結果に基づくランダムサンプリングや階層化されたランダムサンプリングのような単純なアプローチは、高い分散と非表現のサブセットを生み出すリスクを生んでいる。
エージェントが行ったアクションのステップバイステップ記録であるエージェントトラジェクトリに目を向ける。
トラジェクティブ・アウェア・サブセット選択手法を提案し, トラジェクティブ・埋め込みに基づくランダムサンプリングを決定論的選択に置き換える。
我々はまず、最近のフルテスト実行でテスト結果によってテストセットインスタンスをグループ化し、履歴パス/フェイル率を保存し、トラジェクトリの埋め込みスペースを使用してサブセットを選択する。
ランダムサンプリング,埋め込みベース選択,クラスタリングベース選択,ハイブリッドショートリスト-then-サブサンプル戦略を含む76のサブセット選択構成を,3つの回帰シナリオ – 同一設定の再実行,モデルと構成の変更,エージェントフレームワークの変更 – で評価した。
提案手法は,組込み空間における各結果群のセントロイドに最も近いベンチマークインスタンスを選択する手法である。
評価したすべての手法の中で最も低い推定誤差を達成する。
例えば、テストインスタンスの5%または10%の選択されたサブセット上で与えられたエージェントバージョンを評価する場合、最も高いベースラインの95パーセントのドローに対して平均推定誤差を3~11%、最悪のケースエラーを4~11%減らし、38~46%減らす。
その結果,10%のトラジェクトリ対応サブセットは,トークンコストを約90%削減しつつ,中央値推定誤差を5%以下に抑えることができた。
関連論文リスト
- Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents [60.650808962786364]
外部判断や選択時間テストの実行なしに,ネイティブなMoEルータトレースがステアリングと選択をガイドできるかどうかを検討する。
我々の分析は、ルーティングが堅牢な行動的役割シグナルを提供することを示している。トークン・グラニュラ・リードアウトと決定整合比較セットは、ルーティングを効果的に制御する。
オープンウェイトスパースMOEエージェントを用いたSWEベンチ検証を行い,評価を行った。
論文 参考訳(メタデータ) (2026-08-23T03:07:03Z) - Diversity Matters: Distributional Feature Coverage Sample Selection for Data-Efficient Backdoor Attacks [22.452076838251575]
バックドア攻撃は、モデルがクリーンな精度を維持するためにトレーニングデータを妥協するが、トリガされた入力に対してアタッカー・チョーゼンターゲットを予測する。
本研究では,無訓練トリガ診断法であるDFCS(Distributal Feature Coverage Sample Selection)を提案する。
BadNetsとBlendedのCIFAR-10、Tiny-ImageNet、Imagenetteに対する攻撃全体で、DFCSは6つのデータセット-アタック設定で7つのセレクタの中で最高平均攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-08-10T02:52:24Z) - PACE: A Proxy for Agentic Capability Evaluation [60.3743414796937]
PACEは、既存の非エージェント評価からインスタンスを選択することで、プロキシベンチマークを構築するフレームワークである。
14のモデル、4つのエージェントベンチマーク、19の非エージェントベンチマークによる実験では、PACE-Benchがエージェントスコアを予測し、LOOCVは絶対誤差(MAE)を4%以下、スピアマン相関は0.80以上、ペアワイズモデルの精度は85%で、いずれもエージェント評価コストの1%以下である。
論文 参考訳(メタデータ) (2026-07-02T10:59:03Z) - Benchmarking on Tasks That Matter: Dataset Selection for Preserving Model Rankings [0.9870126088784975]
機械学習モデルのベンチマークには、多くのデータセットが含まれることが多い。
効率性のためには、代わりに、小さくて代表的なデータセットの評価が好ましい。
本稿では,データセットのサブセットを選択する作業を行うためのフレームワークを紹介し,その選択戦略がグローバルモデルランキングをいかに保持するかを評価する。
論文 参考訳(メタデータ) (2026-06-26T11:50:22Z) - From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning [19.659110958894335]
Supervised Fine-tuning (SFT) データ選択は、一般的にインスタンスランキングとして定式化される。
効果的なSFTトレーニングサブセットは、しばしば順序づけられたキュレーションレシピによって生成される。
キャッシュされたタスク、データ、モデル側信号に基づいて、固定プールの実体化を分離する2層解法であるAutoSelectionを導入する。
論文 参考訳(メタデータ) (2026-05-13T03:27:21Z) - What If We Allocate Test-Time Compute Adaptively? [2.1713977971908944]
テストタイムスケーリングは、推論計算を均一に割り当て、固定されたサンプリング戦略を使用し、再ランク付けにのみ検証を適用する。
本稿では,推論を反復的軌跡生成と選択として扱う検証器誘導適応フレームワークを提案する。
データセット全体にわたって、当社の動的PRMガイダンスアプローチは、テスト時間の直接スケーリングよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-02-01T07:30:22Z) - Rethinking LLM Evaluation: Can We Evaluate LLMs with 200x Less Data? [82.09573568241724]
EssenceBenchは反復遺伝的アルゴリズム(GA)を利用した粗粒度フレームワーク
提案手法は, 再構成誤差が低く, 効率が著しく向上した, 優れた圧縮結果が得られる。
HellaSwagベンチマーク(10Kサンプル)では,25倍少ないサンプルを用いて,全モデルが5%以内の順位を保ち,わずか200倍少ないサンプルを用いて,95%未満のランキング保持シフトを達成している。
論文 参考訳(メタデータ) (2025-10-12T05:38:10Z) - How Benchmark Prediction from Fewer Data Misses the Mark [18.693874781163657]
ベンチマーク予測は、評価ポイントの小さなサブセットを選択し、そのサブセットからベンチマーク全体のパフォーマンスを予測することを目的としている。
本論文では,19種類のベンチマークにおいて,11種類のベンチマーク予測手法の長所と短所を体系的に評価する。
論文 参考訳(メタデータ) (2025-06-09T11:50:41Z) - Reducing Variance in Temporal-Difference Value Estimation via Ensemble
of Deep Networks [109.59988683444986]
MeanQは単純なアンサンブル法であり、ターゲット値をアンサンブル平均として推定する。
本稿では,Atari Learning Environmentベンチマークを用いた実験において,MeanQが顕著なサンプル効率を示すことを示す。
論文 参考訳(メタデータ) (2022-09-16T01:47:36Z) - Local policy search with Bayesian optimization [73.0364959221845]
強化学習は、環境との相互作用によって最適な政策を見つけることを目的としている。
局所探索のための政策勾配は、しばしばランダムな摂動から得られる。
目的関数の確率モデルとその勾配を用いたアルゴリズムを開発する。
論文 参考訳(メタデータ) (2021-06-22T16:07:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。