論文の概要: How Many Tasks Are Enough for Agent Benchmark Decisions? A Replay Analysis of Public LLM Agent Benchmarks
- arxiv url: http://arxiv.org/abs/2607.12338v1
- Date: Tue, 14 Jul 2026 04:36:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.036168
- Title: How Many Tasks Are Enough for Agent Benchmark Decisions? A Replay Analysis of Public LLM Agent Benchmarks
- Title(参考訳): エージェントベンチマーク決定に十分なタスクはいくつあるか? 公開LLMエージェントベンチマークのリプレイ分析
- Abstract要約: タスク分数だけでは、部分的な実行が完了したベンチマークと同じペアの結論をサポートするかどうかは示さない。
本研究では,SWE-bench,AppWorld,tau-benchの公開タスクレベルレコードを再生することで,この問題を考察する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agent benchmarks often compare two agents after all tasks have run, but costly evaluations make partial runs tempting. A task fraction alone does not show whether a partial run supports the same pairwise conclusion as the completed benchmark. We study this question by replaying completed public task-level records from SWE-bench, AppWorld, and tau-bench. A partial budget counts as enough only when it supports the completed benchmark's decision, covers required task groups, and leaves no more than a target fraction of comparisons unresolved. The required task fraction varies sharply. At the strict 0 percentage point threshold on a 5 percentage point budget grid, AppWorld first meets all targets at 15 percent, tau-bench at 25 percent, and SWE-bench Verified at 90 percent; SWE-bench Lite does not meet all targets by 95 percent under the primary coverage rule. Partial-evaluation reports should state how much one agent must outperform another, how tasks are selected, what coverage rule is required, what decision rule is used, and how many comparisons may remain unresolved.
- Abstract(参考訳): エージェントベンチマークは、すべてのタスクが実行された後に2つのエージェントを比較することが多いが、コストの高い評価は部分的な実行を誘惑させる。
タスク分数だけでは、部分的な実行が完了したベンチマークと同じペアの結論をサポートするかどうかは示さない。
本研究では,SWE-bench,AppWorld,tau-benchの公開タスクレベルレコードを再生することで,この問題を考察する。
部分的な予算は、完了したベンチマークの決定を支持し、必要なタスクグループをカバーし、対象とする比較のごく一部を未解決のまま残すだけで十分である。
要求されるタスクの割合は急変する。
5パーセントの予算グリッド上の厳格な0ポイントの閾値では、AppWorldが最初に全目標を15%、Tau-benchが25%、SWE-benchが90%、SWE-bench Liteが95%の目標を達成している。
部分評価レポートは、あるエージェントがどれくらい他のエージェントより優れているか、どのようにタスクが選択されるか、どのカバレッジルールが必要か、どの決定ルールが使用されるか、そして何つの比較が未解決のままであるかを記述すべきである。
関連論文リスト
- xDailyBench: Benchmarking LLMs on Professional Consultation for Real-Life Problems [57.62172039072062]
xDailyBenchは、個人生活、ホワイトカラーワーク、学習と研究、ドメイン横断アクティビティなど、51のシナリオにまたがる248の慎重にキュレートされたタスクのベンチマークである。
これらのタスクは、ユーザがAIで実際に完了した、あるいは真に達成することを意図した要求に基づいており、明示的な要件と暗黙的な要件の両方をカバーする、きめ細かいバイナリルーブリックで評価される。
最高のモデルではタスクレベルのスコアが75.6%に達し、すべてのモデルは明示的な要件よりも暗黙的にパフォーマンスが悪く、ギャップは9ポイント以下である。
論文 参考訳(メタデータ) (2026-09-07T17:30:58Z) - ParEvalLayer: When Partial LLM-Agent Evaluations Support a Decision [0.0]
LLMエージェントの評価は、ベンチマークの実行が完了するずっと前にタスク結果を生成することが多い。
部分的なスコアは報告を誘惑するが、観察されたタスクが完了した評価と同じ結論を支持するかどうかは示さない。
本稿では,2つのエージェントシステムのペア化結果を読み取る決定層であるParEvalLayerと,事前に選択した比較ポリシを紹介する。
論文 参考訳(メタデータ) (2026-08-03T16:22:51Z) - Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution [1.733151600403503]
大規模言語モデル(LLM)エージェントは、ますます多段階のエンジニアリングと情報処理を自動化する。
彼らはしばしば、最大コンテキストファーストの戦略に従い、ファイルや依存関係を読み取り、一行の編集を小さなコードベースの監査に切り替える。
タスク対応型実行-スコープ推定の欠如を論じる。
論文 参考訳(メタデータ) (2026-07-14T17:59:31Z) - DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks [1.7623000586936592]
DeepSWEは、コーディングエージェントを評価するための、113のオリジナルで長期のソフトウェアエンジニアリングタスクのベンチマークである。
タスクは91のアクティブなオープンソースリポジトリと5つの言語でスクラッチから書かれており、上流にコントリビュートされることはない。
SWE-Bench Proのプロンプトの約半分の長さにもかかわらず、DeepSWEのプロンプトは参照ソリューションが5.5倍のコードに触れるタスクを記述する。
論文 参考訳(メタデータ) (2026-07-08T21:45:34Z) - PACE: A Proxy for Agentic Capability Evaluation [60.3743414796937]
PACEは、既存の非エージェント評価からインスタンスを選択することで、プロキシベンチマークを構築するフレームワークである。
14のモデル、4つのエージェントベンチマーク、19の非エージェントベンチマークによる実験では、PACE-Benchがエージェントスコアを予測し、LOOCVは絶対誤差(MAE)を4%以下、スピアマン相関は0.80以上、ペアワイズモデルの精度は85%で、いずれもエージェント評価コストの1%以下である。
論文 参考訳(メタデータ) (2026-07-02T10:59:03Z) - Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents? [15.202813683786337]
リポジトリレベルのパフォーマンス最適化ベンチマークは、実際のリポジトリにパッチを適用することで、コーディングエージェントを評価する。
リーダボードスコアは、実行時の不安定性、ベンチマーク固有のスコアリングルール、および少なくとも1つの公開提案によってすでに解決されているタスク数を説明できることを示す。
我々は、少なくとも1つの提案が85.3%(384/450)のリプレイバリGSOとSWE-fficiencyタスクで参照パッチと一致し、99.8%(449/450)で最適化されていないベースコードを破ることを発見した。
論文 参考訳(メタデータ) (2026-07-01T17:50:48Z) - SEAL: Can Saturated Benchmarks Be Revived by LLM-as-a-Meta-Judge? [26.684941358964704]
SEALは飽和ベンチマークから遅延ランキング信号を抽出するための自己改善評価プロトコルである。
我々は、コード生成、数学的推論、知識集約型質問応答、ツール使用エージェントタスク完了を含む複数の飽和ベンチマーク上でSEALを評価する。
論文 参考訳(メタデータ) (2026-05-28T15:46:54Z) - ISO-Bench: Can Coding Agents Optimize Real-World Inference Workloads? [0.8749675983608171]
実世界の推論タスクでその能力をテストするためのコーディングエージェントのベンチマークであるISO-Benchを紹介する。
統合プルリクエストから54のタスクをキュレートし、測定可能なパフォーマンスを改善しました。
論文 参考訳(メタデータ) (2026-02-23T08:37:53Z) - Establishing Best Practices for Building Rigorous Agentic Benchmarks [94.69724201080155]
多くのエージェントベンチマークがタスク設定や報酬設計に問題があることを示す。
このような問題は、エージェントのパフォーマンスを最大100%相対的に過小評価することにつながる可能性がある。
我々はベンチマーク構築経験から要約したガイドラインの集合であるAgentic Benchmark Checklist (ABC)を紹介した。
論文 参考訳(メタデータ) (2025-07-03T17:35:31Z) - AgentRewardBench: Evaluating Automatic Evaluations of Web Agent Trajectories [61.38499597241457]
我々は,LLM審査員によるWebエージェント評価の有効性を評価する最初のベンチマークであるAgentRewardBenchを提案する。
ベンチマークを用いて,12名のLLM審査員を評価し,全てのベンチマークでLLMが排他的でないことを発見した。
また、一般的なベンチマークで使用されるルールベースの評価は、Webエージェントの成功率を過小評価する傾向にあることも見出した。
論文 参考訳(メタデータ) (2025-04-11T19:49:22Z) - Localizing Task Information for Improved Model Merging and Compression [61.16012721460561]
我々は,各タスクの重み付けが重なり合わないことが多いため,各タスクがマージされた後も,各タスクの解決に必要な情報が保存されていることを示す。
本稿では,そのような重みを排除し,既存のモデルマージ手法の一般的な性能を改善するアルゴリズムであるConsensus Mergingを提案する。
論文 参考訳(メタデータ) (2024-05-13T14:54:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。