論文の概要: SWE-NFI: Studying and Benchmarking Coding Agents for Non-Functional Improvements
- arxiv url: http://arxiv.org/abs/2607.27409v1
- Date: Wed, 29 Jul 2026 19:28:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.315104
- Title: SWE-NFI: Studying and Benchmarking Coding Agents for Non-Functional Improvements
- Title(参考訳): SWE-NFI:ノンファンクション改善のための学習・ベンチマークコーディングエージェント
- Authors: Pengyu Xue, He Yang Yuan, Xin Wang, Junkai Chen, Haonan Zhang, Boyuan Chen, Zishuo Ding, Zhenhao Li, Weiyi Shang,
- Abstract要約: SWE-NFIは,NFI上の符号化エージェントを機能的正当性を超えて評価するためのベンチマークである。
機能的正当性テストとルールに基づくNFI評価を組み合わせた総合評価スイートを開発した。
- 参考スコア(独自算出の注目度): 25.010113476664923
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Although coding agents have achieved impressive performance on correctness-oriented benchmarks, their ability to make behavior-preserving non-functional improvements (NFIs) remains underexplored. In real-world software development, developers continuously improve software quality without changing observable behavior, yet existing benchmarks primarily evaluate functional correctness and provide limited support for assessing these non-functional improvements. In this paper, we present SWE-NFI, a benchmark for evaluating coding agents on NFIs beyond functional correctness. Our benchmark contains 188 tasks constructed from real merged pull requests in open-source Python projects. We operationalize developer-oriented NFIs into 92 executable rules and develop a comprehensive evaluation suite that combines functional correctness testing with rule-based NFI evaluation. We evaluate state-of-the-art commercial and open-source coding agents. Although the best-performing agent achieves a 70.0\% functional correctness rate, all evaluated agents generally fall short of human developers in overall NFI capability. The gap is particularly evident for structural code improvements, where agents' NFI scores range from 0.0 to 1.3, compared with 1.5 for the human reference. Our benchmark and findings provide a reproducible foundation for evaluating and advancing coding agents beyond functional correctness.
- Abstract(参考訳): 符号化エージェントは、正当性指向のベンチマークで顕著なパフォーマンスを達成しているが、動作保存型非機能改善(NFI)を行う能力は未定である。
現実世界のソフトウェア開発では、開発者は観測可能な振る舞いを変えることなくソフトウェア品質を継続的に改善するが、既存のベンチマークは主に機能の正しさを評価し、これらの非機能的な改善を評価するための限定的なサポートを提供する。
本稿では,NFI上の符号化エージェントを機能的正当性を超えて評価するためのベンチマークであるSWE-NFIを提案する。
私たちのベンチマークには、オープンソースのPythonプロジェクトで実際にマージされたプルリクエストから構築された188のタスクが含まれています。
開発者指向のNFIを92の実行可能なルールに運用し、機能的正当性テストとルールに基づくNFI評価を組み合わせた総合的な評価スイートを開発する。
我々は最先端の商用およびオープンソースコーディングエージェントを評価する。
最高の性能のエージェントは機能的正当性率は70.0\%に達するが、評価されたエージェントはすべて、全体的なNFI能力において、人間の開発者より劣っている。
エージェントのNFIスコアは0.0から1.3の範囲であり、人間の参照では1.5である。
我々のベンチマークと結果は、機能的正当性を超えたコーディングエージェントの評価と進歩のための再現可能な基盤を提供する。
関連論文リスト
- REFORGE: A Method for Benchmarking LLMs' Reverse Engineering Capabilities in Decompiled Binary Function Naming [0.0]
大規模な言語モデル(LLM)は、リバースエンジニアリングタスクにますます適用されている。
しかし、彼らの能力に関する主張は、それを測定する能力よりも優れている。
本稿では,関数レベル基底真理をCソースから構築する証明追跡パイプラインであるReforgeを提案する。
論文 参考訳(メタデータ) (2026-07-07T23:17:03Z) - The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development? [80.24951682268332]
本稿では,自律エージェント開発のためのフロンティアモデルのキャパシティをテストするための評価フレームワークであるMeta-Agent Challenge(MAC)を紹介する。
評価の整合性を確保するため、このフレームワークは報奨ハッキングに対する多層防御によって確保される。
メタエージェントは人間工学的な基本方針とほとんど一致せず、その一部はプロプライエタリなフロンティアモデルに支配されている。
論文 参考訳(メタデータ) (2026-06-03T04:58:17Z) - AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation [59.964989458924585]
AdaExploreは、パフォーマンスクリティカルなカーネルコード生成のための蓄積された実行フィードバックによる自己改善を可能にするエージェントフレームワークである。
適応段階では、エージェントはタスクを合成し、繰り返し発生する障害を有効ルールの再利用可能なメモリに変換する。
探索段階では、候補核を木として整理し、小さな局所精製とより大きな構造再生を交互に行う。
論文 参考訳(メタデータ) (2026-04-17T18:25:03Z) - SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks [55.76734816061826]
我々は20の問題と93のチェックポイントからなる言語に依存しないベンチマークであるSlopCodeBenchを紹介する。
我々は、冗長性、重複コードの割合、構造的侵食という2つの軌道レベルの品質信号を追跡する。
11モデルにまたがるエンドツーエンドの問題を解決するエージェントは存在しない。
論文 参考訳(メタデータ) (2026-03-25T19:26:44Z) - FeatureBench: Benchmarking Agentic Coding for Complex Feature Development [42.26354337364403]
FeatureBenchは、エンドツーエンドのフィーチャ指向ソフトウェア開発におけるエージェントコーディングのパフォーマンスを評価するために設計されたベンチマークである。
実行ベースの評価プロトコルと、人間の最小限の労力でコードリポジトリからタスクを自動的に引き出す、スケーラブルなテスト駆動メソッドが組み込まれている。
実証的な評価により、クロード4.5オプスのような最先端のエージェントモデルがSWEベンチで74.4%の解決率を達成することが明らかになった。
論文 参考訳(メタデータ) (2026-02-11T16:06:32Z) - InnoGym: Benchmarking the Innovation Potential of AI Agents [74.64144272881414]
InnoGymはAIエージェントのイノベーションの可能性を評価するために設計された最初のベンチマークである。
InnoGym氏は2つの相補的なメトリクスを紹介している。パフォーマンスゲイン(パフォーマンスゲイン)と、従来のアプローチと方法論的な違いを捉えるノベルティ(ノベルティ)だ。
論文 参考訳(メタデータ) (2025-12-01T16:03:04Z) - LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering [90.84806758077536]
textbfLoCoBench-Agentは,大規模言語モデル(LLM)エージェントを現実的,長期的ソフトウェア工学で評価するための総合的な評価フレームワークである。
我々のフレームワークは、LoCoBenchの8000のシナリオを対話型エージェント環境に拡張し、マルチターン会話の体系的評価を可能にする。
我々のフレームワークは,8つの特殊なツール(ファイル操作,検索,コード解析)をエージェントに提供し,それを10Kから1Mトークンの範囲で評価する。
論文 参考訳(メタデータ) (2025-11-17T23:57:24Z) - PerfBench: Can Agents Resolve Real-World Performance Bugs? [4.879400115033142]
PerfBenchは、GitHubから81の実際のパフォーマンスバグ修正タスクからなるベンチマークである。
PerfBenchは、エージェントが独自のパフォーマンスベンチマークを生成することができる新しい評価ハーネスを備えている。
OpenHands-Perf-Agentは、パフォーマンスに配慮したツールと命令を組み、ベンチマークで20%の成功率を達成する。
論文 参考訳(メタデータ) (2025-09-28T22:00:33Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z) - NoFunEval: Funny How Code LMs Falter on Requirements Beyond Functional Correctness [10.502272765892908]
既存のコード言語モデルの評価ベンチマーク(コードLM)は、LMが機能的に正しいコードを生成することができるかどうかにのみ焦点を絞っている。
非機能要件と非機能要件の両方に対する単純な分類インスタンスに基づいて、コードLMを評価するため、新しいベンチマークNoFunEvalを提案する。
私たちの発見は、LMがベンチマークでテストすると、一般的に失敗し、トレーニング設定の基本的な盲点を示唆していることです。
論文 参考訳(メタデータ) (2024-01-29T08:47:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。