論文の概要: What Does an Agentic Software Engineering Benchmark Measure? Profiling Task Demands and Agent Behaviour Beyond What Category Labels Reveal
- arxiv url: http://arxiv.org/abs/2609.01271v1
- Date: Tue, 01 Sep 2026 14:04:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.720384
- Title: What Does an Agentic Software Engineering Benchmark Measure? Profiling Task Demands and Agent Behaviour Beyond What Category Labels Reveal
- Title(参考訳): エージェントソフトウェアエンジニアリングのベンチマークは何を測るのか? - カテゴリーラベル以上のタスク要求とエージェントの振る舞いをプロファイリングする
- Authors: Radin Shayanfar, Keheliya Gallaba, Ahmed E. Hassan,
- Abstract要約: 本稿では,レポジトリレベルのコーディングタスクの要求を3軸で評価するSpread-Novelty-Centrality (SNC)プロファイルを紹介する。
このプロファイルを5つの広く使用されているベンチマークと2つのモデルファミリーの14,922のトラジェクトリに適用し,その3つの知見を報告する。
- 参考スコア(独自算出の注目度): 4.308559182560684
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agentic software engineering benchmarks are typically summarized by nominal category labels such as "bug fix" or "feature implementation," yet benchmarks carrying the same label are built through very different curation pipelines. A label thus reveals little about the engineering work a benchmark demands. We introduce the Spread--Novelty--Centrality (SNC) profile, a three-axis characterization of the demands of repository-level coding tasks, grounded in empirical software engineering research. We apply the profile to five widely used benchmarks and 14,922 trajectories of two model families at three scales, and report three findings. (1) A label is an unreliable proxy for task demands, as every pair of benchmarks is statistically separated on at least two SNC axes, and the separations trace back to specific curation decisions. (2) Agent behaviour reveals demands that the human-written gold solution cannot. Agents produce larger solutions than the gold where problem statements withhold hints and smaller ones where curation inflates the gold. How a task is phrased shapes what an agent produces. (3) Task demands correlate with success uniformly, with resolved runs concentrating in the low-SNC region for every family and scale, whereas the behavioural signatures of success are family-specific. Claude succeeds by matching the scope of the gold solution, and its parity share on files rises from $0.17$ at the smallest scale to $0.54$ at the largest. Qwen succeeds by exceeding the gold scope at every scale, and editing too little marks failure for both families.
- Abstract(参考訳): エージェントソフトウェアエンジニアリングベンチマークは通常、"bug fix"や"feature implementation"といった名目上のカテゴリラベルで要約されるが、同じラベルを持つベンチマークは、全く異なるキュレーションパイプラインによって構築される。
したがって、ラベルは、ベンチマークの要求するエンジニアリング作業についてはほとんど明らかにしません。
本稿では,実証ソフトウェア工学研究を基盤とした,リポジトリレベルのコーディングタスクの要求を3軸評価した,SNCプロファイルを紹介する。
このプロファイルを5つの広く使用されているベンチマークと2つのモデルファミリーの14,922のトラジェクトリに適用し,その3つの知見を報告する。
1)ラベルは,少なくとも2つのSNC軸上で各ベンチマークが統計的に分離され,その分離は特定のキュレーション決定に遡るため,タスク要求に対する信頼性の低いプロキシである。
2)エージェントの動作は、人間が書いた金のソリューションができないという要求を明らかにする。
エージェントは、問題文がヒントを保たない金や、キュレーションが金を膨らませる小さな金よりも大きな溶液を生成する。
タスクがどのようにフレーズ化されるかは、エージェントが生成するものを形作る。
3)課題要求は,家族ごとの低SNC領域に集中し,成功の行動的シグネチャは家族固有のものとなる。
クロードは金のソリューションの範囲を一致させることで成功し、ファイルのパリティのシェアは最小のスケールで0.17ドルから最大で0.54ドルへと上昇する。
Qwenは、あらゆるスケールでゴールドのスコープを超え、両方の家族にとってマークの失敗が少なすぎるように編集することに成功している。
関連論文リスト
- EcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM Agents [8.799203536862382]
EcoAgent-Benchを紹介します。
その結果、予算と経済的な行動選択の完了は、異なる特性であることが明らかとなった。
論文 参考訳(メタデータ) (2026-08-06T01:47:47Z) - BLAgent: Agentic RAG for File-Level Bug Localization [2.2917707112773593]
BLAgentはファイルレベルのバグローカライゼーションのための新しいエージェントRAGフレームワークである。
BLAgentは、オープンソースモデルで78%以上のTop-1精度を達成した。
BLAgentは、エンドツーエンドの修復の成功を20%以上改善する。
論文 参考訳(メタデータ) (2026-05-18T07:20:13Z) - SysTradeBench: An Iterative Build-Test-Patch Benchmark for Strategy-to-Code Trading Systems with Drift-Aware Diagnostics [25.854191624941677]
我々はSysTradeBenchを紹介した。SysTradeBenchは、ストラテジ-コードトレーディングシステムのベンチマークのための監査可能なベンチマークである。
サンドボックス化されたハーネスは、決定論とアンチ推論チェックを実行し、ルールドリフトを検出し、制約されたパッチをサポートするエビデンスバンドルを返す。
上位モデルでは91.7%以上を強力な集計スコアで達成しているが、エビデンス駆動の反復はIter2によるコード収束も引き起こす。
論文 参考訳(メタデータ) (2026-04-06T16:16:24Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - Understanding Code Agent Behaviour: An Empirical Study of Success and Failure Trajectories [10.751728274263536]
本稿では,エージェントのトラジェクトリ,すなわちソフトウェア問題の解決に際し,エージェントが行うステップを捉えた実行トレースについて,実証的研究を行う。
我々は、SWE-Benchベンチマークで、最先端の3つのコードエージェント(OpenHands、SWE-agent、Prometheus)の軌跡を分析し、成功と失敗の両方について検討した。
論文 参考訳(メタデータ) (2025-10-31T18:58:13Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - AGENTICT$^2$S:Robust Text-to-SPARQL via Agentic Collaborative Reasoning over Heterogeneous Knowledge Graphs for the Circular Economy [42.73610751710192]
AgenticT$2$Sは、知識グラフを専門エージェントが管理するサブタスクに分解するフレームワークである。
2段階検証器は、構造的に無効で意味的に不特定なクエリを検出する。
実世界の循環経済の実験では、AgenticT$2$Sが実行精度を17.3%向上することを示した。
論文 参考訳(メタデータ) (2025-08-03T15:58:54Z) - Why Do Multi-Agent LLM Systems Fail? [87.90075668488434]
MAST-Dataは7つの人気のあるMASフレームワークで収集された1600以上の注釈付きトレースの包括的なデータセットである。
我々はMAST(Multi-Agent System Failure Taxonomy)を初めて構築する。
MASTとMAST-Dataを利用して、モデル(GPT4、Claude 3、Qwen2.5、CodeLlama)とタスク(コーディング、数学、汎用エージェント)の障害パターンを分析します。
論文 参考訳(メタデータ) (2025-03-17T19:04:38Z) - Collaborative Propagation on Multiple Instance Graphs for 3D Instance
Segmentation with Single-point Supervision [63.429704654271475]
本稿では,1つのオブジェクトを1つのポイントでラベル付けするだけでよい,弱教師付き手法RWSegを提案する。
これらの疎いラベルにより、セマンティック情報とインスタンス情報を伝達する2つの分岐を持つ統一的なフレームワークを導入する。
具体的には、異なるインスタンスグラフ間の競合を促進するクロスグラフ競合ランダムウォークス(CRW)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-08-10T02:14:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。