論文の概要: PACE: A Proxy for Agentic Capability Evaluation
- arxiv url: http://arxiv.org/abs/2607.02032v1
- Date: Thu, 02 Jul 2026 10:59:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.79835
- Title: PACE: A Proxy for Agentic Capability Evaluation
- Title(参考訳): PACE: エージェント能力評価のためのプロキシ
- Abstract要約: PACEは、既存の非エージェント評価からインスタンスを選択することで、プロキシベンチマークを構築するフレームワークである。
14のモデル、4つのエージェントベンチマーク、19の非エージェントベンチマークによる実験では、PACE-Benchがエージェントスコアを予測し、LOOCVは絶対誤差(MAE)を4%以下、スピアマン相関は0.80以上、ペアワイズモデルの精度は85%で、いずれもエージェント評価コストの1%以下である。
- 参考スコア(独自算出の注目度): 60.3743414796937
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Evaluating LLM agents on benchmarks like SWE-Bench and GAIA can be expensive, time-consuming, and requires complex infrastructure. A single evaluation can cost thousands of dollars and take days to complete. In contrast, non-agentic LLM benchmarks that test individual capabilities (e.g., reasoning, code generation) are fast and cheap to run. In this paper, we investigate whether performance on expensive agentic benchmarks can be accurately predicted by the performance on a small, carefully selected subset of atomic evaluation instances. We introduce PACE, a framework that constructs proxy benchmarks by selecting instances from existing non-agentic evaluations whose aggregate scores most reliably predict model performances on agentic benchmarks. Given a pool of candidate instances spanning atomic capabilities, PACE fits a regression that maps a model's scores on a compact subset of source instances to its score on the target agentic benchmark. The subset itself is curated by combining two complementary instance-selection strategies, target-relevance local selection and globally informative global selection. We apply PACE to the 4 target agentic benchmarks in this paper, which yields PACE-Bench, the concrete proxy benchmark that we evaluate in the paper. Experiments across 14 models, 4 agentic benchmarks, and 19 non-agentic benchmarks show that PACE-Bench predicts agentic scores with leave-one-out cross-validation (LOOCV) mean absolute error (MAE) under 4%, Spearman correlation above 0.80, and pairwise model-ranking accuracy around 85%, all at much less than 1% of the full agentic evaluation cost. We further analyze the selected proxy instances, revealing which skills each agentic benchmark uniquely demands. PACE enables practitioners to obtain reliable estimates of agentic performance during model development, selection, and routing, without the overhead of full agent evaluation.
- Abstract(参考訳): SWE-Bench や GAIA のようなベンチマーク上で LLM エージェントを評価するのは費用がかかり、時間がかかり、複雑なインフラを必要とする。
単一の評価は何千ドルもかかり、完成までに数日かかる。
対照的に、個々の機能(例えば、推論、コード生成)をテストする非エージェントのLCMベンチマークは、高速かつ安価に実行される。
本稿では,高価なエージェントベンチマークの性能が,原子評価インスタンスの小さな,慎重に選択されたサブセットの性能によって正確に予測できるかどうかを検討する。
PACEは,エージェントベンチマークのモデル性能を最も確実に予測する既存の非エージェント評価から,インスタンスを選択することで,プロキシベンチマークを構築するフレームワークである。
アトミックな機能にまたがる候補インスタンスのプールを考えると、PACEはモデルのスコアをソースインスタンスのコンパクトなサブセットとターゲットエージェントベンチマークのスコアにマッピングするレグレッションに適合する。
サブセット自体は、2つの補完的なインスタンス選択戦略、ターゲット関連ローカルセレクションとグローバルインフォメーショングローバルセレクションを組み合わせることで硬化する。
本稿では,本論文で評価した具体的なプロキシベンチマークである PACE-Bench が得られた 4 つのエージェントベンチマークに PACE を適用した。
14のモデル、4つのエージェントベンチマーク、19の非エージェントベンチマークによる実験では、PACE-Benchがエージェントスコアを予測し、LOOCVは絶対誤差(MAE)を4%以下、スピアマン相関は0.80以上、ペアワイズモデルの精度は85%で、いずれもエージェント評価コストの1%以下である。
さらに、選択したプロキシインスタンスを分析し、各エージェントベンチマークが要求するスキルを明らかにします。
PACEは, モデル開発, 選択, ルーティングにおいて, エージェント評価のオーバーヘッドを伴わずに, エージェント性能の信頼性の高い推定値を得ることを可能にする。
関連論文リスト
- AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility [104.46861849039357]
エージェントシステムはドメイン間で急速に進歩しているが、その評価は断片化されている。
根本的問題は、オープンでエージェントに依存しないアセスメントインタフェースがないことである。
我々は、審査員が評価を行い、すべての参加者が標準化されたプロトコルを介して対話するエージェントエージェントアセスメント(AAA)を提唱する。
論文 参考訳(メタデータ) (2026-06-11T17:23:54Z) - Benchmark Everything Everywhere All at Once [28.30618112297148]
ベンチマーク構築用に設計された完全自律型エージェントシステムであるBenchmark Agentを紹介する。
本フレームワークは,ユーザクエリ分析やサブタスク設計からデータアノテーション,品質管理に至るまで,完全なベンチマーク構築パイプラインを編成する。
テキスト理解やマルチモーダル理解,ドメイン固有の推論など,さまざまな評価シナリオにまたがる15の代表的なベンチマークを作成した。
論文 参考訳(メタデータ) (2026-06-04T17:52:04Z) - A Unified Framework for the Evaluation of LLM Agentic Capabilities [36.43241368835721]
LLMエージェント能力の公平な評価のための統一的なフレームワークを提案する。
統合された構成システムによって駆動されるこのフレームワークは、様々なベンチマークを標準化された命令-ツール-環境フォーマットに統合する。
我々は15モデルで400Kロールアウトと5Bトークンに対して大規模な実証分析を行う。
論文 参考訳(メタデータ) (2026-05-27T03:20:45Z) - Efficient Benchmarking of AI Agents [0.0]
小型タスクサブセットがエージェントランキングを極めて低コストで維持できるかどうかを検討する。
絶対スコア予測は足場駆動の分布シフトで低下することがわかった。
本稿では,中間的履歴パス率を持つタスクに対してのみ,新しいエージェントを評価できる最適化フリープロトコルを提案する。
論文 参考訳(メタデータ) (2026-03-24T22:17:11Z) - Benchmark^2: Systematic Evaluation of LLM Benchmarks [66.2731798872668]
3つの相補的なメトリクスからなる包括的なフレームワークであるBenchmark2を提案する。
数学、推論、知識ドメインにまたがる15のベンチマークで実験を行います。
本分析により,既存のベンチマーク間での有意な品質変化が明らかとなり,選択的なベンチマーク構築が同等な評価性能を達成できることが示されている。
論文 参考訳(メタデータ) (2026-01-07T14:59:03Z) - How can we assess human-agent interactions? Case studies in software agent design [52.953425368394306]
我々は,人間とエージェントの相互作用の厳密な評価に向けて,二つの大きな一歩を踏み出した。
エージェント設計のより効率的な人間中心評価のためのフレームワークであるPULSEを提案する。
私たちは、オープンソースのソフトウェアエージェントOpenHandsを中心に構築された大規模なWebプラットフォームにフレームワークをデプロイします。
論文 参考訳(メタデータ) (2025-10-10T19:04:28Z) - Establishing Best Practices for Building Rigorous Agentic Benchmarks [94.69724201080155]
多くのエージェントベンチマークがタスク設定や報酬設計に問題があることを示す。
このような問題は、エージェントのパフォーマンスを最大100%相対的に過小評価することにつながる可能性がある。
我々はベンチマーク構築経験から要約したガイドラインの集合であるAgentic Benchmark Checklist (ABC)を紹介した。
論文 参考訳(メタデータ) (2025-07-03T17:35:31Z) - Beyond the Singular: The Essential Role of Multiple Generations in Effective Benchmark Evaluation and Analysis [10.133537818749291]
大規模言語モデル(LLM)は、現実世界のアプリケーションにおいて重要なユーティリティを実証している。
LLMの能力を評価するにはベンチマーク評価が不可欠である。
論文 参考訳(メタデータ) (2025-02-13T03:43:33Z) - Data Efficient Evaluation of Large Language Models and Text-to-Image Models via Adaptive Sampling [3.7467864495337624]
SubLIMEはテキスト・ツー・イメージ・モデルのためのデータ効率評価フレームワークである。
我々のアプローチは、完全なデータセットと比較して統計的に整合したモデルランキングを保証する。
HEIMのリーダーボードを利用して、17の異なるベンチマークで25のテキスト・ツー・イメージモデルをカバーしています。
論文 参考訳(メタデータ) (2024-06-21T07:38:55Z) - GREAT Score: Global Robustness Evaluation of Adversarial Perturbation using Generative Models [60.48306899271866]
GREATスコア(GREAT Score)と呼ばれる新しいフレームワークを提案する。
我々は,ロバストベンチにおける攻撃ベースモデルと比較し,高い相関性を示し,GREATスコアのコストを大幅に削減した。
GREAT Scoreは、プライバシーに敏感なブラックボックスモデルのリモート監査に使用することができる。
論文 参考訳(メタデータ) (2023-04-19T14:58:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。