論文の概要: EvalResearchBench: Can AI Agents Design Their Own Evaluations?
- arxiv url: http://arxiv.org/abs/2610.04184v1
- Date: Sat, 03 Oct 2026 00:49:27 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:30:03.167027
- Title: EvalResearchBench: Can AI Agents Design Their Own Evaluations?
- Title(参考訳): EvalResearchBench: AIエージェントは独自の評価を設計できるか?
- Abstract要約: EvalResearchBenchは、自律的な評価研究のためのベンチマークである。
人的専門家は、ベンチマークサブセットを選択したり、コンパクトスイートを設計することで、このコストを削減する。
我々はAIエージェントがこの設計プロセスを自動化し、自律的な評価研究のベンチマークであるEvalResearchBench(ERB)を導入することができるかどうか尋ねる。
- 参考スコア(独自算出の注目度): 33.49539501088443
- License:
- Abstract: Recursive self-improvement (RSI) relies on evaluation feedback to assess progress and guide further research, yet repeatedly running complex benchmarks is costly and slows iteration. Human experts reduce this cost by selecting benchmark subsets or designing compact suites. We ask whether AI agents can automate this design process and introduce EvalResearchBench (ERB), a benchmark for autonomous evaluation research. Given target materials, development references, candidate APIs, and fixed time and API budgets, an agent called the researcher selects or synthesizes tasks, implements graders, and revises them in pilot tests before freezing an executable evaluator for coding, co-work, and reasoning. We study 9 researchers and 13 candidate models and compare each frozen evaluator with 14 target benchmarks on score concordance and pairwise agreement. The best evaluators order about 75\% of candidate pairs as the targets do, below the 91\% ceiling set by disagreements among the targets. No researcher leads on every metric, and the best evaluator on development targets is not the best on sealed targets hidden from the researcher. A human-designed sample of public tasks remains a strong baseline, and the evaluator with the lowest recorded execution cost attains the highest pairwise agreement. Agents repair tasks and graders through pilot feedback, yet their evaluators can still truncate answers, exhaust the evaluation budget, or let a few questions dominate a domain score.
- Abstract(参考訳): 再帰的自己改善(RSI)は、進捗を評価し、さらなる研究を導くために評価フィードバックに依存するが、複雑なベンチマークを繰り返し実行することはコストがかかり、イテレーションが遅くなる。
人的専門家は、ベンチマークサブセットを選択したり、コンパクトスイートを設計することで、このコストを削減する。
我々はAIエージェントがこの設計プロセスを自動化し、自律的な評価研究のベンチマークであるEvalResearchBench(ERB)を導入することができるかどうか尋ねる。
対象の材料、開発リファレンス、候補API、固定時間およびAPI予算が与えられた場合、研究者と呼ばれるエージェントは、タスクを選択し、合成し、グレーダーを実装し、パイロットテストで修正し、コーディング、共同作業、推論のための実行可能な評価器を凍結する。
9人の研究者と13人の候補モデルを調査し、各凍結評価器と14の目標ベンチマークをスコア一致とペア一致で比較した。
最高の評価者は、ターゲット間の不一致によって設定された91\%の天井の下に、ターゲットのおよそ75\%の候補ペアを注文する。
研究者はすべての指標を導いておらず、開発目標に対する最高の評価は、研究者から隠された封印されたターゲット上では最善ではない。
人間によって設計された公開タスクのサンプルは、依然として強力なベースラインであり、記録された実行コストが最も低い評価器は、最高のペアワイズ合意に達する。
エージェントはパイロットフィードバックを通じてタスクやグレーダーを修復するが、評価者は依然として回答を減らしたり、評価予算を浪費したり、いくつかの質問がドメインスコアを支配したりすることができる。
関連論文リスト
- PACE: A Proxy for Agentic Capability Evaluation [60.3743414796937]
PACEは、既存の非エージェント評価からインスタンスを選択することで、プロキシベンチマークを構築するフレームワークである。
14のモデル、4つのエージェントベンチマーク、19の非エージェントベンチマークによる実験では、PACE-Benchがエージェントスコアを予測し、LOOCVは絶対誤差(MAE)を4%以下、スピアマン相関は0.80以上、ペアワイズモデルの精度は85%で、いずれもエージェント評価コストの1%以下である。
論文 参考訳(メタデータ) (2026-07-02T10:59:03Z) - Establishing Best Practices for Building Rigorous Agentic Benchmarks [94.69724201080155]
多くのエージェントベンチマークがタスク設定や報酬設計に問題があることを示す。
このような問題は、エージェントのパフォーマンスを最大100%相対的に過小評価することにつながる可能性がある。
我々はベンチマーク構築経験から要約したガイドラインの集合であるAgentic Benchmark Checklist (ABC)を紹介した。
論文 参考訳(メタデータ) (2025-07-03T17:35:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。