論文の概要: SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution
- arxiv url: http://arxiv.org/abs/2605.08366v1
- Date: Fri, 08 May 2026 18:21:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.590109
- Title: SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution
- Title(参考訳): SWE Atlas: 課題解決を超えて、コーディングエージェントのベンチマークを行う
- Abstract要約: SWE Atlasは、Codebase Q&A(124タスク)、テストライティング(90タスク)、リファクタリング(70タスク)という、3つのプロフェッショナルソフトウェアエンジニアリングにまたがるコーディングエージェントのためのベンチマークスイートである。
あまり表現されていないが事実上重要なカテゴリをターゲットとし、包括的なカテゴリ固有の評価プロトコルを使用し、未指定のルーリックを採用する。
全体として、SWE Atlasは、コーディングエージェントの正確性とエンジニアリング品質の両方を測定するための補完的な評価スイートを提供する。
- 参考スコア(独自算出の注目度): 16.25554650122462
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce SWE Atlas, a benchmark suite for coding agents spanning three professional software engineering workflows: Codebase Q&A (124 tasks), Test Writing (90 tasks), and Refactoring (70 tasks). SWE Atlas differs from prior SWE benchmarks in three key ways: it targets underrepresented but practically important task categories, uses comprehensive category-specific evaluation protocols, and adopts under-specified, agentic task formulations that better reflect real-world usage. Its evaluation framework combines programmatic checks with rubric-based assessment. This goes beyond functional correctness, evaluating software engineering quality, including test and refactor completeness, maintainability, reusable abstractions, and codebase hygiene. We evaluate a range of frontier and open-weight models on SWE Atlas and find that GPT-5.4 and Opus 4.7 achieve the strongest overall performance, while even the best open-weight models score poorly. Our analysis suggests that top models rely on extensive codebase exploration and runtime-driven reasoning. However, even top models consistently struggle with subtle edge cases, complex runtime analysis, and adherence to software engineering best practices. Overall, SWE Atlas provides a complementary evaluation suite for measuring both correctness and engineering quality in coding agents.
- Abstract(参考訳): 私たちは、Codebase Q&A(124タスク)、Test Writing(1290タスク)、Refactoring(70タスク)という、3つのプロのソフトウェアエンジニアリングワークフローにまたがるコーディングエージェントのためのベンチマークスイートであるSWE Atlasを紹介します。
SWE Atlas は以前の SWE ベンチマークと3つの重要な方法で異なる: あまり表現されていないが事実上重要なタスクカテゴリをターゲットにし、包括的なカテゴリ固有の評価プロトコルを使用し、現実世界の使用をよりよく反映した、未特定でエージェント的なタスクの定式化を採用する。
その評価フレームワークは、プログラムチェックとルーリックベースのアセスメントを組み合わせたものである。
これは、テストとリファクタリングの完全性、保守性、再利用可能な抽象化、コードベース衛生など、ソフトウェアエンジニアリングの品質を評価する機能的正確性を超えています。
我々は、SWE Atlas上でのフロンティアモデルとオープンウェイトモデルの評価を行い、GPT-5.4とOpus 4.7が、最高のオープンウェイトモデルでさえも、最も優れた全体的なパフォーマンスを達成することを発見した。
私たちの分析では、トップモデルは広範なコードベースの探索とランタイム駆動の推論に依存していることを示唆しています。
しかし、トップモデルでさえ、微妙なエッジケース、複雑なランタイム分析、ソフトウェアエンジニアリングのベストプラクティスへの固執に一貫して苦労しています。
全体として、SWE Atlasは、コーディングエージェントの正確性とエンジニアリング品質の両方を測定するための補完的な評価スイートを提供する。
関連論文リスト
- Benchmarking the Titans: A Multi-Dimensional Empirical Evaluation of LLM Code Generation Quality in the .NET Ecosystem [41.99844472131922]
既存のベンチマークは、機能的正しさと構造的品質の間の重要なトレードオフを曖昧にする1つのPass@kメトリックに評価を還元する。
本稿では,C#コード生成のための多次元自動評価フレームワークを提案し,それを4つの最先端大規模言語モデル(LLM)に適用する。
我々はHumanEvalから派生した85のアルゴリズムタスクに対して制御された実験を行い、合計340の解を生成し評価し、各解は3つの独立した次元で評価する。
論文 参考訳(メタデータ) (2026-08-23T17:59:19Z) - AISE-Bench: A Full-Cycle Curated Benchmark for Information Seeking on Academic Knowledge Graphs [55.8213573429699]
AISE-Benchは、学術知識グラフに基づく情報検索のための実世界のフルサイクルアノテートベンチマークである。
AISE-Benchリリースには1,133のQAペアが含まれている。クエリ、完全なAPI実行、検証されたパラメータ、リファレンスリンクによるソースグラウンドの回答などだ。
我々は,回答の品質,参照基盤,API計画の正確性,実行成功を総合的に評価するプロトコルを開発した。
論文 参考訳(メタデータ) (2026-06-16T07:59:46Z) - ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development [49.63491095660809]
ProjDevBenchはエンドツーエンドのベンチマークで、コーディングエージェントにプロジェクト要件を提供し、その結果のリポジトリを評価する。
概念指向タスクと実世界のアプリケーションシナリオの両方をカバーし、8つのカテゴリにまたがる20のプログラミング問題をキュレートします。
エージェントは基本的な機能を扱うが、複雑なシステム設計、時間最適化、リソース管理に苦労する。
論文 参考訳(メタデータ) (2026-02-02T05:17:23Z) - SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models [59.90381306452982]
ソフトウェアエンジニアリングのための大規模言語モデル(LLM)の評価は、タスクカバレッジの狭さ、言語バイアス、現実世界の開発者との整合性の不足によって制限されている。
SWE-1は、不均一なコード関連評価を構造化および生産整合性のあるフレームワークに統合する包括的なベンチマークである。
SWE-は8つのタスクタイプ、8つのプログラミングシナリオ、10のプログラミング言語にまたがる。
論文 参考訳(メタデータ) (2025-11-07T18:01:32Z) - When Models Can't Follow: Testing Instruction Adherence Across 256 LLMs [0.0]
本稿では,20個のプロンプトを慎重に設計し,指示追従の評価を行う合理化評価フレームワークを提案する。
我々は2025年10月14日に行われた大規模な実証的研究を通じて、この枠組みを実証した。
本研究は、一貫した障害モードを明らかにし、特定の課題を呈する特定の命令タイプを特定する。
論文 参考訳(メタデータ) (2025-10-18T16:33:15Z) - Establishing Best Practices for Building Rigorous Agentic Benchmarks [94.69724201080155]
多くのエージェントベンチマークがタスク設定や報酬設計に問題があることを示す。
このような問題は、エージェントのパフォーマンスを最大100%相対的に過小評価することにつながる可能性がある。
我々はベンチマーク構築経験から要約したガイドラインの集合であるAgentic Benchmark Checklist (ABC)を紹介した。
論文 参考訳(メタデータ) (2025-07-03T17:35:31Z) - carps: A Framework for Comparing N Hyperparameter Optimizers on M Benchmarks [61.79411281702448]
carpsはComprehensive Automated Research Performance Studiesのベンチマークフレームワークである。
我々は、ブラックボックス、マルチオブジェクト、マルチオブジェクト、マルチオブジェクトの4つの重要なタイプのHPOタスクに焦点をあてる。
5つのコミュニティベンチマークコレクションから336のタスクと28種類の9つのファミリーで、私たちはこれまでで最大のGotoライブラリを提供しています。
論文 参考訳(メタデータ) (2025-06-06T15:01:39Z) - Assessing and Advancing Benchmarks for Evaluating Large Language Models in Software Engineering Tasks [16.696044684014435]
大規模言語モデル(LLM)は、ソフトウェア工学(SE)で人気が高まっている。
この分野での有効性を 理解するためには 有効性の評価が不可欠です
本稿では、291ベンチマークの徹底的なレビューを行い、どのベンチマークが利用可能か、どのようにベンチマークを構築しているか、これらのベンチマークの将来展望の3つの主要な側面に対処する。
論文 参考訳(メタデータ) (2025-05-13T18:45:10Z) - HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems [2.4241401076864]
HackerRank-ASTRA Benchmarkでは、実際のシナリオを反映したプロジェクトベースのコーディング問題が導入されている。
モデル一貫性を32ラン(k = 32)と中央標準偏差で評価する。
上位3モデル(o1、o1-preview、Claude-3.5-Sonnet-1022)は75%のスコアを記録した。
論文 参考訳(メタデータ) (2025-01-31T23:47:02Z) - The BrowserGym Ecosystem for Web Agent Research [151.90034093362343]
BrowserGymエコシステムは、Webエージェントの効率的な評価とベンチマークの必要性の高まりに対処する。
本稿では,Webエージェント研究のためのBrowserGymベースの拡張エコシステムを提案する。
大規模なマルチベンチマークWebエージェント実験を初めて実施し、6つのWebエージェントベンチマークで6つの最先端LCMの性能を比較した。
論文 参考訳(メタデータ) (2024-12-06T23:43:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。