論文の概要: PERFOPT-Bench: Evaluating Coding Agents on Software Performance Optimization
- arxiv url: http://arxiv.org/abs/2607.07744v1
- Date: Wed, 08 Jul 2026 08:32:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.283973
- Title: PERFOPT-Bench: Evaluating Coding Agents on Software Performance Optimization
- Title(参考訳): PERFOPT-Bench: ソフトウェアパフォーマンス最適化におけるコーディングエージェントの評価
- Authors: Yingyun Cui, Yi Xie, Piaohong Wang, Jiawei Ma, Bo Liu, Liangliang Cao,
- Abstract要約: パフォーマンスの最適化は独特なエージェント的タスクである。
本稿では,このフルパフォーマンス・エンジニアリング・ループを評価するベンチマークであるPERFOPT-Benchを紹介する。
- 参考スコア(独自算出の注目度): 18.924749191192433
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Coding-agent benchmarks have largely measured whether agents can produce functionally correct patches, but production software also demands measurable speedups on real execution targets. Performance optimization is a distinct agentic task: agents must profile executions, diagnose cross-layer bottlenecks, edit code without breaking correctness, and verify that gains are reproducible rather than measurement artifacts. We introduce PERFOPT-Bench, a benchmark for evaluating this full performance-engineering loop. Each task provides a correct but deliberately suboptimal codebase and asks the agent to improve a target performance metric; scoring requires hidden correctness tests, verified-speedup measurement, and trajectory-level audit. We evaluate 7 agent stacks with different LLMs and agent frameworks on 7 long-horizon optimization tasks. The results show that optimization performance is workload-dependent rather than determined by model identity alone: no single stack dominates, and changing the agent framework can materially change the same LLM's per-task speedup profile. We further find that raw speedup is unsafe as a benchmark score, since some large gains arise from benchmark-specific shortcut exploitation; an exploratory relay pilot suggests that restarting from an externalized optimization summary can recover additional headroom after an initial session stops. The benchmark and our evaluation are available at: https://anonymous.4open.science/r/Dataset-D3CC.
- Abstract(参考訳): コードエージェントベンチマークは、エージェントが機能的に正しいパッチを作成できるかどうかを主に測定しているが、本番ソフトウェアは実際の実行目標に対して測定可能なスピードアップを要求する。
エージェントは実行をプロファイル化し、層間ボトルネックを診断し、正確性を損なうことなくコードを編集し、成果物の測定よりも成果物が再現可能であることを確認する。
本稿では,このフルパフォーマンス・エンジニアリング・ループを評価するベンチマークであるPERFOPT-Benchを紹介する。
各タスクは正しいが故意に最適なコードベースを提供し、エージェントに目標のパフォーマンス指標を改善するよう要求する。
我々は、7つの長期最適化タスクにおいて、異なるLLMとエージェントフレームワークを持つ7つのエージェントスタックを評価した。
その結果、モデル識別だけで決定されるのではなく、最適化性能がワークロードに依存していることが示され、単一のスタックが支配的であり、エージェントフレームワークの変更は、同じLLMのタスク毎のスピードアッププロファイルを実質的に変更することができる。
探索的リレーパイロットは、初期セッションが停止した後、外部最適化の要約から再起動することで、追加のヘッドルームを復元できることを示唆している。
ベンチマークと評価は以下の通りである。 https://anonymous.4open.science/r/Dataset-D3CC。
関連論文リスト
- LLM-as-a-Verifier: A General-Purpose Verification Framework [74.40111651545979]
本稿では,汎用検証フレームワーク LLM-as-a-Verifier を紹介する。
追加のトレーニングを必要とせずに、エージェントタスクに対してきめ細かいフィードバックを提供する。
いくつかのベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-07-06T17:59:35Z) - ISO-Bench: Can Coding Agents Optimize Real-World Inference Workloads? [0.8749675983608171]
実世界の推論タスクでその能力をテストするためのコーディングエージェントのベンチマークであるISO-Benchを紹介する。
統合プルリクエストから54のタスクをキュレートし、測定可能なパフォーマンスを改善しました。
論文 参考訳(メタデータ) (2026-02-23T08:37:53Z) - Structured Prompting Enables More Robust Evaluation of Language Models [38.53918044830268]
DSPy+HELMフレームワークを提案する。
構造化されたプロンプトがなければ、HELMはLM性能(平均4%)を過小評価し、性能評価はベンチマークによって異なることがわかった。
これは、構造化されたプロンプトを確立された評価フレームワークに体系的に統合する最初のベンチマーク研究である。
論文 参考訳(メタデータ) (2025-11-25T20:37:59Z) - AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress [71.02263260394261]
大規模言語モデル(LLM)は、マルチターン意思決定タスクにおいて依然として課題に直面している。
プロセス報酬モデル(PRM)を構築し、各意思決定を評価し、エージェントの意思決定プロセスを導く。
AgentPRMは、シーケンシャルな決定と最終的な目標への貢献の間の相互依存の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-11-11T14:57:54Z) - SWE-fficiency: Can Language Models Optimize Real-World Repositories on Real Workloads? [22.075705411944895]
SWE-fficiencyは、実際のワークロードにおけるリポジトリレベルのパフォーマンス最適化を評価するためのベンチマークである。
私たちのスイートには、9つの広く使用されているデータサイエンス、機械学習、HPCリポジトリにわたる498のタスクが含まれています。
論文 参考訳(メタデータ) (2025-11-08T17:55:09Z) - PerfBench: Can Agents Resolve Real-World Performance Bugs? [4.879400115033142]
PerfBenchは、GitHubから81の実際のパフォーマンスバグ修正タスクからなるベンチマークである。
PerfBenchは、エージェントが独自のパフォーマンスベンチマークを生成することができる新しい評価ハーネスを備えている。
OpenHands-Perf-Agentは、パフォーマンスに配慮したツールと命令を組み、ベンチマークで20%の成功率を達成する。
論文 参考訳(メタデータ) (2025-09-28T22:00:33Z) - AgentRewardBench: Evaluating Automatic Evaluations of Web Agent Trajectories [61.38499597241457]
我々は,LLM審査員によるWebエージェント評価の有効性を評価する最初のベンチマークであるAgentRewardBenchを提案する。
ベンチマークを用いて,12名のLLM審査員を評価し,全てのベンチマークでLLMが排他的でないことを発見した。
また、一般的なベンチマークで使用されるルールベースの評価は、Webエージェントの成功率を過小評価する傾向にあることも見出した。
論文 参考訳(メタデータ) (2025-04-11T19:49:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。