論文の概要: SWE-Prometheus: Measuring Engineering Governance Improvements in Real-World Repositories
- arxiv url: http://arxiv.org/abs/2609.29465v1
- Date: Thu, 24 Sep 2026 12:23:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.918726
- Title: SWE-Prometheus: Measuring Engineering Governance Improvements in Real-World Repositories
- Title(参考訳): SWE-Prometheus: 実世界のリポジトリにおけるエンジニアリングガバナンス改善の測定
- Abstract要約: SWE-Prometheusは、リポジトリエンジニアリングガバナンスを改善するためのより広範なタスクのためのベンチマークである。
SWE-Prometheusは、ペア化されたエビデンス、クリーンな環境調査、行動ゲート、同じエビデンスに関する2つの独立した教師評価を通じて、6つのガバナンス次元を評価している。
- 参考スコア(独自算出の注目度): 27.5408805687601
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model based coding agents have made substantial progress on repository-level software engineering tasks. Existing repository benchmarks, however, usually start from a human-identified issue and evaluate whether a patch satisfies a functional signal. We present SWE-Prometheus, a benchmark for the broader task of improving repository engineering governance. Each task provides a fixed snapshot and an open-ended objective, requiring the agent to identify risks, prioritize interventions, and verify the resulting changes. SWE-Prometheus evaluates six governance dimensions through paired evidence, clean-environment probes, behavior gates, and two independent teacher ratings of the same evidence. The benchmark contains 60 repositories; ten models are evaluated on a shared 22-repository public subset, where mean Normalized Governance Improvement ranges from 0.0568 to 0.5760 and observed behavior-breakage rates range from 0% to 23%. On a frozen ten-repository batch, a repository-blind template obtains mean NGI 0.272, but its gains concentrate in Tests & CI, Quality Gates, and Documentation; it improves Reproducible Environment and Dependency & Security on none of the repositories. This baseline makes the distinction between adding governance artifacts and producing execution-backed improvements measurable. The no-op condition has median NGI zero and standard deviation 0.073; two teachers agree exactly on 57 of 60 dimension scores for the same no-op evidence. For the two highest conditional-mean systems, common-valid NGI is similar, while full-pool comparisons that include behavior failures favor Kimi-K3. These results show why repository-governance evaluation should report improvement, behavior preservation, evidence quality, and coverage together.
- Abstract(参考訳): 大規模言語モデルに基づくコーディングエージェントは、リポジトリレベルのソフトウェアエンジニアリングタスクに大きく進歩した。
しかし、既存のリポジトリベンチマークは通常、人間識別された問題から始まり、パッチが機能的なシグナルを満たすかどうかを評価する。
SWE-Prometheusは、リポジトリエンジニアリングガバナンスを改善するためのより広範なタスクのためのベンチマークです。
各タスクは固定スナップショットとオープンな目標を提供し、エージェントはリスクを特定し、介入を優先順位付けし、結果の変更を検証する必要がある。
SWE-Prometheusは、ペア化されたエビデンス、クリーンな環境調査、行動ゲート、および同じエビデンスに対する2つの独立した教師評価を通じて、6つのガバナンス次元を評価する。
ベンチマークには60のリポジトリが含まれており、22リポジトリのパブリックサブセットで10のモデルが評価されている。
フリーズされた10リポジトリバッチでは、リポジトリ盲のテンプレートが平均的なNGI 0.272を取得するが、その利益はTests & CI、Quality Gates、Documentationに集中している。
このベースラインは、ガバナンスアーティファクトの追加と、実行支援による改善の計測とを区別します。
ノープ条件は、中央値のNGIゼロと標準偏差0.073であり、2人の教師は同じノープ証拠に対して、60次元の57点に正確に一致している。
2つの最も高い条件付き平均系では、共通値のNGIが似ており、行動障害を含むフルプール比較はKim-K3を好んでいる。
これらの結果は,レポジトリ・ガバナンス評価が改善,行動保存,エビデンス・クオリティ,カバレッジを共に報告すべき理由を示唆している。
関連論文リスト
- SWE-Serve: Benchmarking Agentic Engineering For Production Inference Serving [20.264552597118207]
SWE-Serveは、プロダクション推論エンジニアリングタスクのエージェントを評価するためのベンチマークである。
SWE-Serveは、タスクをローカルに完了し、プロダクションの正確性を達成するための大きなギャップを露呈する。
論文 参考訳(メタデータ) (2026-09-22T17:54:59Z) - SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents [63.65682461568621]
ソフトウェアエンジニアリングエージェントのためのリポジトリレベルのベンチマークであるSWE-Gateを導入し、機能的正当性とともにレビュー制約コンプライアンスを明示的に評価する。
SWE-Gateは、実際のプルリクエストレビューコメントからレビュー制約を導き、これらの制約に関するリポジトリレベルの修復インスタンスを合成する。
各インスタンスは、非準拠およびゴールドパッチとともに、機能テストと制約テストの分離を提供し、イシュー解決能力とレビュー制約コンプライアンスの明確な分離を可能にする。
論文 参考訳(メタデータ) (2026-09-03T17:53:34Z) - Semantic Drift in Bug Resolution: How Behavioral Signals Propagate from Reports to Tests and Patches [18.727291516223115]
Desc2Fixは、バグレポートのセマンティックアライメント、テストのトリガー、開発者による修正を測定するフレームワークである。
GPT-4o と DeepSeek-Chat を用いて,Defects4J と SWT-Bench の2,857 個のレポート・パッチを解析した。
論文 参考訳(メタデータ) (2026-07-20T22:32:23Z) - Verifier-First Evaluation of Agentic LLMs for Infrastructure-as-Code Generation [0.0]
自然言語からインフラストラクチャ・アズ・コード(IaC)を生成するには、プロバイダのスキーマ、依存関係の計画、組織的なポリシの制約を満たす必要がある。
Rego v1ポリシを備えた186タスクのAWS/TerraformベンチマークであるIaC-Eval v2で評価されたTerraform生成のための7つのエージェント戦略に関する検証初の実験的研究を示す。
論文 参考訳(メタデータ) (2026-05-29T12:43:27Z) - Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites [49.16055123488827]
十分に強力なテストスイートは、報告された成功率を膨らませながら、妥当だが意味的に正しくないパッチを認めることができる。
STINGは、意味的に変化するプログラムの変種を診断ストレス要因として利用する、ターゲットテスト拡張のためのフレームワークである。
STINGは211インスタンスにまたがる1014の検証テストを生成し、パッチリージョンラインとブランチカバレッジを10.8%、9.5%向上させた。
論文 参考訳(メタデータ) (2026-04-02T01:13:40Z) - Needle in the Repo: A Benchmark for Maintainability in AI-Generated Repository Edits [3.9532936038777144]
Needle in the Repo (NITR) は、リポジトリの動作的に正しい編集が維持可能な構造を保存するかどうかを評価するためのフレームワークである。
NITRは、ソフトウェアエンジニアリングの知恵を、小さな、現実的なマルチファイルに埋め込まれた制御されたプローブに蒸留する。
GPT、Claude、Gemini、Qwenの各ファミリーの23のコーディング構成を、直接推論とエージェントベースの設定の両方で評価する。
論文 参考訳(メタデータ) (2026-03-29T15:56:05Z) - A Benchmark for Evaluating Repository-Level Code Agents with Intermediate Reasoning on Feature Addition Task [11.218318079376365]
RACE-benchは、機能追加タスクでコードエージェントを評価するための推論強化ベンチマークである。
RACE-benchには、12のオープンソースリポジトリから528の現実世界の機能追加インスタンスが含まれている。
RACE-bench上での3つのリポジトリレベルのコードエージェントの評価を行った。
論文 参考訳(メタデータ) (2026-03-27T11:58:47Z) - RepoGenesis: Benchmarking End-to-End Microservice Generation from Readme to Repository [52.98970048197381]
RepoGenesisは、リポジトリレベルのエンドツーエンドWebマイクロサービス生成のための、最初の多言語ベンチマークである。
18のドメインと11のフレームワークに106のリポジトリ(60のPython、46のJava)があり、1,258のAPIエンドポイントと2,335のテストケースが検証されている。
その結果、高いAC(最大73.91%)とDSR(最大100%)にもかかわらず、最高のパフォーマンスのシステムはPythonで23.67%のPass@1、Javaで21.45%しか達成していないことが明らかになった。
論文 参考訳(メタデータ) (2026-01-20T13:19:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。