論文の概要: A2Eval: Agentic and Automated Evaluation for Embodied Brain
- arxiv url: http://arxiv.org/abs/2602.01640v1
- Date: Mon, 02 Feb 2026 04:55:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-03 19:28:33.909734
- Title: A2Eval: Agentic and Automated Evaluation for Embodied Brain
- Title(参考訳): A2Eval:脳のエージェント的および自動評価
- Abstract要約: 現在のVLMの評価は静的で専門家が定義し、手動で注釈付けされたベンチマークに依存している。
Agentic Automatic Evaluation (A2Eval)は、ベンチマークのキュレーションと2つの協調エージェントによる評価を自動化する最初のエージェントフレームワークである。
10のベンチマークと13のモデルで評価され、A2Evalは評価スイートを85%圧縮し、全体的な計算コストを77%削減し、4.6倍のスピードアップを提供する。
- 参考スコア(独自算出の注目度): 26.357063836707223
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Current embodied VLM evaluation relies on static, expert-defined, manually annotated benchmarks that exhibit severe redundancy and coverage imbalance. This labor intensive paradigm drains computational and annotation resources, inflates costs, and distorts model rankings, ultimately stifling iterative development. To address this, we propose Agentic Automatic Evaluation (A2Eval), the first agentic framework that automates benchmark curation and evaluation through two collaborative agents. The Data Agent autonomously induces capability dimensions and assembles a balanced, compact evaluation suite, while the Eval Agent synthesizes and validates executable evaluation pipelines, enabling fully autonomous, high-fidelity assessment. Evaluated across 10 benchmarks and 13 models, A2Eval compresses evaluation suites by 85%, reduces overall computational costs by 77%, and delivers a 4.6x speedup while preserving evaluation quality. Crucially, A2Eval corrects systematic ranking biases, improves human alignment to Spearman's rho=0.85, and maintains high ranking fidelity (Kendall's tau=0.81), establishing a new standard for high-fidelity, low-cost embodied assessment. Our code and data will be public soon.
- Abstract(参考訳): 現在のVLM評価は、厳密な冗長性とカバレッジの不均衡を示す静的で専門家が定義した手動の注釈付きベンチマークに依存している。
この労働集約パラダイムは計算資源とアノテーション資源を排水し、コストを膨らませ、モデルランキングを歪ませ、最終的には反復的な開発を阻害する。
これを解決するために,ベンチマークのキュレーションと2つの協調エージェントによる評価を自動化する最初のエージェントフレームワークであるエージェント自動評価(A2Eval)を提案する。
データエージェントは、能力次元を自律的に誘導し、バランスの取れたコンパクトな評価スイートを組み立て、Eval Agentは実行可能な評価パイプラインを合成し、検証し、完全に自律的で高忠実な評価を可能にする。
10のベンチマークと13のモデルで評価され、A2Evalは評価スイートを85%圧縮し、全体的な計算コストを77%削減し、評価品質を維持しながら4.6倍のスピードアップを提供する。
重要な点として、A2Evalは体系的なランキングバイアスを補正し、スピアマンのrho=0.85と人間のアライメントを改善し、高いランク忠実性を維持する(ケンドールのtau=0.81)。
コードとデータはまもなく公開されます。
関連論文リスト
- Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation [141.29138788636013]
任意のエージェントを評価するために80以上のベンチマークを移植するベンチマークアダプタを開発した。
54のベンチマークで,機能レベルにまたがる8モデルの大規模評価を行う。
私たちは29のベンチマークにまたがる82の難易度、多様性、高品質なタスクをキュレートしたHarbor-Indexを紹介します。
論文 参考訳(メタデータ) (2026-09-03T16:26:20Z) - Automated Trajectory Evaluation for Mobile Agents via Step-Level Consequence Reasoning and Aggregation [23.628754736526975]
本稿では,モバイルエージェントの自動評価のための新しい2段階VLM-as-judgeフレームワークであるCRATEを紹介する。
さらに、運用安全評価のためにCRATEをCRATE-Sに拡張する。
CRATEはAndroidWorldで0.833のF1スコアを獲得し、CRATE-SはMobileRiskで0.697のF1スコアに達した。
論文 参考訳(メタデータ) (2026-08-21T07:16:36Z) - PACE: A Proxy for Agentic Capability Evaluation [60.3743414796937]
PACEは、既存の非エージェント評価からインスタンスを選択することで、プロキシベンチマークを構築するフレームワークである。
14のモデル、4つのエージェントベンチマーク、19の非エージェントベンチマークによる実験では、PACE-Benchがエージェントスコアを予測し、LOOCVは絶対誤差(MAE)を4%以下、スピアマン相関は0.80以上、ペアワイズモデルの精度は85%で、いずれもエージェント評価コストの1%以下である。
論文 参考訳(メタデータ) (2026-07-02T10:59:03Z) - The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators [17.44053709945519]
自己改善エージェントはエージェントコーディングベンチマークの最先端(SOTA)であり、最近一般的なドメインに拡張されている。
非定常ユーティリティ下での自己改善のための進化的フレームワークであるRed Queen Godel Machine(RQGM)を紹介する。
RQGMは、補完的なエージェント・アズ・ア・ジャッジ・コード・レビュー信号を追加することにより、以前のSOTAよりもテストパス率を向上させることを示す。
次に、科学論文の執筆とレビュー、オリンピアードレベルの証明の執筆と評価に目を向け、RQGMは以前の自己改善エージェントよりもパフォーマンスを向上させる。
論文 参考訳(メタデータ) (2026-06-24T18:38:26Z) - AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility [104.46861849039357]
エージェントシステムはドメイン間で急速に進歩しているが、その評価は断片化されている。
根本的問題は、オープンでエージェントに依存しないアセスメントインタフェースがないことである。
我々は、審査員が評価を行い、すべての参加者が標準化されたプロトコルを介して対話するエージェントエージェントアセスメント(AAA)を提唱する。
論文 参考訳(メタデータ) (2026-06-11T17:23:54Z) - WMAttack: Automated Attack Search for Adversarial Evaluation of World-Model Agents [53.84430233754606]
WMAttackは、世界モデルエージェントの敵意評価のための自動攻撃探索フレームワークである。
WMAttackは攻撃構成に対する有限予算探索としてロバストネス評価を定式化する。
WMAttackは評価ベースラインよりも強力な攻撃を継続的に発見することを示す。
論文 参考訳(メタデータ) (2026-05-22T04:31:09Z) - An Empirical Study of Automating Agent Evaluation [14.239299198848764]
エンドツーエンドエージェント評価パイプラインを自動化するAIアシスタントであるEvalAgentを紹介する。
EvalAgentは評価ドメインの専門知識を評価スキルとしてエンコードする。
EvalAgentは、焦点を絞った評価を行い、Eval@1を17.5%から65%に改善し、ベースラインアプローチよりも79.5%の人間専門家の選好を達成した。
論文 参考訳(メタデータ) (2026-05-12T01:06:34Z) - Efficient Benchmarking of AI Agents [0.0]
小型タスクサブセットがエージェントランキングを極めて低コストで維持できるかどうかを検討する。
絶対スコア予測は足場駆動の分布シフトで低下することがわかった。
本稿では,中間的履歴パス率を持つタスクに対してのみ,新しいエージェントを評価できる最適化フリープロトコルを提案する。
論文 参考訳(メタデータ) (2026-03-24T22:17:11Z) - ReLE: A Scalable System and Structured Benchmark for Diagnosing Capability Anisotropy in Chinese LLMs [37.23311145049677]
本稿では,機能異方性(Capability Anisotropy)を診断するためのスケーラブルなシステムであるReLEを提案する。
我々は,207,843サンプルからなる領域$times$ Capability SymbolicMatrixの304モデルを評価した。
論文 参考訳(メタデータ) (2026-01-24T09:57:59Z) - AutoBench: Automating LLM Evaluation through Reciprocal Peer Assessment [12.9569411072262]
AutoBenchは、大規模言語モデル(LLM)を評価するための、完全に自動化され、自己持続的なフレームワークである
本稿では,eZecute S.R.L によるオープンソースプロジェクトとして開発された AutoBench 方法論の厳密な科学的検証を行う。
論文 参考訳(メタデータ) (2025-10-26T09:20:39Z) - Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains [97.5573252172065]
自動推論評価器(FARE)のファミリーを,簡易な反復的リジェクションサンプリング制御による微調整手法で訓練する。
FARE-8Bはより大型のRL訓練評価器に挑戦し、FARE-20Bはオープンソース評価器の新しい標準となる。
推論時リランカとして、FARE-20BはMATH上でのニアオークル性能を達成する。
論文 参考訳(メタデータ) (2025-10-20T17:52:06Z) - NAIPv2: Debiased Pairwise Learning for Efficient Paper Quality Estimation [58.30936615525824]
本稿では,紙の品質評価のための非バイアスで効率的なフレームワークであるNAIPv2を提案する。
NAIPv2は、レビューアレーティングの不整合を低減するために、ドメイン年グループ内でペアワイズ学習を採用している。
これはペアワイズ比較に基づいてトレーニングされるが、デプロイ時に効率的なポイントワイズ予測を可能にする。
論文 参考訳(メタデータ) (2025-09-29T17:59:23Z) - Bench-2-CoP: Can We Trust Benchmarking for EU AI Compliance? [2.010294990327175]
現在のAI評価プラクティスは、確立されたベンチマークに大きく依存しています。
この研究は、この「ベンチマーク・規制ギャップ」を定量化する緊急の必要性に対処する。
評価のエコシステムは、その焦点の大部分を狭い行動規範に捧げています。
論文 参考訳(メタデータ) (2025-08-07T15:03:39Z) - The Great Nugget Recall: Automating Fact Extraction and RAG Evaluation with Large Language Models [53.12387628636912]
本稿では,人間のアノテーションに対して評価を行う自動評価フレームワークを提案する。
この手法は2003年にTREC Question Answering (QA) Trackのために開発された。
完全自動ナゲット評価から得られるスコアと人間に基づく変種とのランニングレベルでの強い一致を観察する。
論文 参考訳(メタデータ) (2025-04-21T12:55:06Z) - AutoEval: A Practical Framework for Autonomous Evaluation of Mobile Agents [5.995751996623217]
モバイルエージェントを手作業なしでテストする評価フレームワークであるAutoEvalを提案する。
提案手法では,タスク報酬信号の自動生成に使用可能なUI状態変化表現を設計する。
我々はまた、我々のフレームワークを使って最先端のモバイルエージェントを評価し、その性能と限界について洞察を提供する。
論文 参考訳(メタデータ) (2025-03-04T08:44:30Z) - Early-Exit and Instant Confidence Translation Quality Estimation [46.13074343863971]
本研究では,(1)スケールにおける品質推定のコスト削減,(2)品質推定のための安価な不確実性推定手法の開発,という2つの課題に対処する。
後者に対処するため,従来の手法の性能を若干のコストで一致させる不確実性を考慮した品質評価モデルであるInstant Confidence COMETを導入する。
我々はこれを、初期のモデル層ですでに品質スコアと関連する信頼度を計算できる品質評価モデルであるEarly-Exit COMETに拡張し、計算の早期実行と評価コストの削減を可能にします。
論文 参考訳(メタデータ) (2025-02-20T10:27:13Z) - Autonomous Evaluation and Refinement of Digital Agents [57.12281122337407]
ドメイン汎用自動評価器は,Webナビゲーションやデバイス制御のためのエージェントの性能を大幅に向上させることができることを示す。
我々は、これらのモデルの性能をいくつかの一般的なデジタルエージェントのベンチマークで検証し、オラクル評価指標との74.4から92.9%の一致を見出した。
論文 参考訳(メタデータ) (2024-04-09T17:25:47Z) - Position: AI Evaluation Should Learn from How We Test Humans [65.36614996495983]
人間の評価のための20世紀起源の理論である心理測定は、今日のAI評価における課題に対する強力な解決策になり得る、と我々は主張する。
論文 参考訳(メタデータ) (2023-06-18T09:54:33Z) - From Adversarial Arms Race to Model-centric Evaluation: Motivating a
Unified Automatic Robustness Evaluation Framework [91.94389491920309]
テキストの敵対攻撃は、セマンティック保存されているが、入力に誤解を招く摂動を加えることでモデルの弱点を発見することができる。
既存のロバストネス評価の実践は、包括的評価、非現実的評価プロトコル、無効な対人サンプルの問題を示す可能性がある。
我々は、敵攻撃の利点を活用するために、モデル中心の評価にシフトする統合された自動ロバストネス評価フレームワークを構築した。
論文 参考訳(メタデータ) (2023-05-29T14:55:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。