論文の概要: SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
- arxiv url: http://arxiv.org/abs/2608.09802v1
- Date: Mon, 10 Aug 2026 16:23:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.383973
- Title: SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
- Title(参考訳): SWE-Bench ProMax: 大規模多言語コードリファクタリングにおけるベンチマークエージェント
- Abstract要約: SWE-Bench ProMax(SWE-Bench ProMax)は、実際のコミットから170のインスタンスを抽出した、専門家による多言語コードベンチマークである。
各インスタンスは厳格で多段階的なキュレーションを実行し、以前のベンチマークで特定された品質問題に対処する。
2つのエージェント足場下でのフロンティアモデルによる実験では、最良のモデルは41.2%しか解決できない。
- 参考スコア(独自算出の注目度): 31.684059339633013
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As AI coding agents take on increasingly complex, long-horizon software engineering tasks, existing benchmarks are rapidly saturating and their evaluation quality has come under serious scrutiny: a recent audit found that nearly 60% of unsolved SWE-bench Verified instances contain flawed tests -- either overly narrow tests that reject correct solutions or overly broad tests that check unstated requirements -- and that frontier models can verbatim reproduce gold patches from training data. Code refactoring, which requires coordinated, behavior-preserving changes across many files, offers a substantially harder and more realistic test of agent capability, yet remains underserved by current benchmarks. We introduce SWE-Bench ProMax, an expert-curated, multilingual code refactoring benchmark of 170 instances drawn from real commits across seven programming languages (Python, Java, TypeScript, Go, C, C++, and Rust). Every instance undergoes rigorous, multi-stage curation that directly addresses the quality problems identified in prior benchmarks: issue descriptions are rewritten from scratch to provide precise, unambiguous specifications, and test suites are manually reviewed to remove overly narrow and overly broad tests. Tasks with insufficient complexity or limited cross-file scope are filtered out, yielding a benchmark of challenging, large-scale refactoring tasks that average 11.4 modified files and 261.6 lines of code per instance, substantially exceeding the scale of existing benchmarks. Experiments with frontier models under two agent scaffolds show that the best model achieves only 41.2% resolve rate, confirming that SWE-Bench ProMax presents a meaningful and unsaturated challenge for current AI coding agents. Our benchmark is available at https://huggingface.co/datasets/swe-bench-promax/SWE-Bench-ProMax.
- Abstract(参考訳): 最近の監査では、未解決のSWEベンチ検証インスタンスの60%が欠陥のあるテストを含んでいることが判明した -- 正解を拒否する過度に狭いテストか、未解決の要求をチェックする過度に広いテスト -- が、フロンティアモデルはトレーニングデータからゴールドパッチを冗長に再現することができる。
多くのファイルにまたがってコーディネートし、動作を保存する必要があるコードリファクタリングは、エージェント機能のはるかに難しく、より現実的なテストを提供するが、現在のベンチマークでは守られていない。
SWE-Bench ProMaxは,7つのプログラミング言語(Python,Java,TypeScript,Go,C++,Rust)の実際のコミットから引き出された170のインスタンスを対象とした,専門家による多言語コードリファクタリングベンチマークである。
問題記述はスクラッチから書き直され、正確で曖昧な仕様を提供し、テストスイートは手動でレビューされ、過度に狭く、広範囲なテストを削除する。
複雑さが不足したり、クロスファイルスコープが制限されたタスクがフィルタリングされ、既存のベンチマークの規模をはるかに上回る11.4の修正ファイルとインスタンスあたり261.6行のコードを含む、挑戦的で大規模なリファクタリングタスクのベンチマークが作成される。
2つのエージェントの足場下でのフロンティアモデルによる実験では、最良のモデルは41.2%のリゾルバ率しか達成せず、SWE-Bench ProMaxが現在のAIコーディングエージェントにとって有意義で不飽和な課題であることを確認した。
私たちのベンチマークはhttps://huggingface.co/datasets/swe-bench-promax/SWE-Bench-ProMaxで公開されています。
関連論文リスト
- DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks [1.7623000586936592]
DeepSWEは、コーディングエージェントを評価するための、113のオリジナルで長期のソフトウェアエンジニアリングタスクのベンチマークである。
タスクは91のアクティブなオープンソースリポジトリと5つの言語でスクラッチから書かれており、上流にコントリビュートされることはない。
SWE-Bench Proのプロンプトの約半分の長さにもかかわらず、DeepSWEのプロンプトは参照ソリューションが5.5倍のコードに触れるタスクを記述する。
論文 参考訳(メタデータ) (2026-07-08T21:45:34Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites [49.16055123488827]
十分に強力なテストスイートは、報告された成功率を膨らませながら、妥当だが意味的に正しくないパッチを認めることができる。
STINGは、意味的に変化するプログラムの変種を診断ストレス要因として利用する、ターゲットテスト拡張のためのフレームワークである。
STINGは211インスタンスにまたがる1014の検証テストを生成し、パッチリージョンラインとブランチカバレッジを10.8%、9.5%向上させた。
論文 参考訳(メタデータ) (2026-04-02T01:13:40Z) - SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks [55.76734816061826]
我々は20の問題と93のチェックポイントからなる言語に依存しないベンチマークであるSlopCodeBenchを紹介する。
我々は、冗長性、重複コードの割合、構造的侵食という2つの軌道レベルの品質信号を追跡する。
11モデルにまたがるエンドツーエンドの問題を解決するエージェントは存在しない。
論文 参考訳(メタデータ) (2026-03-25T19:26:44Z) - SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models [59.90381306452982]
ソフトウェアエンジニアリングのための大規模言語モデル(LLM)の評価は、タスクカバレッジの狭さ、言語バイアス、現実世界の開発者との整合性の不足によって制限されている。
SWE-1は、不均一なコード関連評価を構造化および生産整合性のあるフレームワークに統合する包括的なベンチマークである。
SWE-は8つのタスクタイプ、8つのプログラミングシナリオ、10のプログラミング言語にまたがる。
論文 参考訳(メタデータ) (2025-11-07T18:01:32Z) - ImpossibleBench: Measuring LLMs' Propensity of Exploiting Test Cases [58.411135609139855]
タスク完了のための「ショートカット」は、大規模言語モデルの信頼性評価と展開に重大なリスクをもたらす。
我々は,LLMエージェントがテストケースを利用するための正当性を測定するベンチマークフレームワークであるImpossibleBenchを紹介する。
実践的なフレームワークとして、ImpossibleBenchは単なる評価ではなく、汎用的なツールである。
論文 参考訳(メタデータ) (2025-10-23T06:58:32Z) - UTBoost: Rigorous Evaluation of Coding Agents on SWE-Bench [8.00058513405915]
LLM駆動のテストケースジェネレータであるUTGeneratorを導入し、実世界のPythonプロジェクトのテストケースを生成する。
UTGenerator上に構築されたUTBoostは、テストケース拡張のための包括的なフレームワークである。
評価では,テストケースが不十分な36のタスクインスタンスを同定し,元のSWE Benchに渡された345の誤ったパッチを誤ってラベル付けした。
論文 参考訳(メタデータ) (2025-06-10T22:56:49Z) - SWT-Bench: Testing and Validating Real-World Bug-Fixes with Code Agents [10.730852617039451]
ユーザ問題をテストケースに形式化するLLMベースのコードエージェントについて検討する。
我々は人気のあるGitHubリポジトリに基づいた新しいベンチマークを提案し、現実世界の問題、地味なバグフィックス、ゴールデンテストを含む。
コード修復用に設計されたコードエージェントは,テスト生成用に設計されたシステムの性能を上回っている。
論文 参考訳(メタデータ) (2024-06-18T14:54:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。