論文の概要: $A^2E$ : An End-to-End Agent Auditing Engine
- arxiv url: http://arxiv.org/abs/2608.07346v2
- Date: Mon, 10 Aug 2026 09:34:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 13:55:18.84002
- Title: $A^2E$ : An End-to-End Agent Auditing Engine
- Title(参考訳): A^2E$ : エンド・ツー・エンドのエージェント監査エンジン
- Abstract要約: A2E$はエージェントハーネス用に設計されたエンドツーエンドの評価エンジンである。
実験中に標準化された実行トレースをキャプチャして生成する。
A2E$は多次元メトリクスのスイートを使用してハーネス機能を評価する。
- 参考スコア(独自算出の注目度): 25.281617098281277
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: With the rapid advancement of large language models (LLMs), harnesses have become essential infrastructure for deploying agents across a wide range of domains. The fast-evolving harness ecosystem has also made rigorous capability evaluation increasingly important. However, efficiently building an end-to-end, systematic, and comprehensive evaluation pipeline remains a significant challenge. To address this challenge, we introduce $A^2E$ (Agent Auditing Engine), an end-to-end evaluation engine designed for agent harnesses. $A^2E$ leverages our newly proposed Agent Task Protocol (ATP) to enable the rapid integration of evaluation tasks with different harnesses. Through an automatically instrumented Monitor, it captures and generates standardized execution traces during experiments. In the Evaluation stage, $A^2E$ systematically assesses harness capabilities using a suite of multidimensional metrics. Compared with correctness alone, these metrics provide a more fine-grained characterization of differences among harnesses in execution efficiency, tool use, task planning, and error recovery. Experiments conducted with $A^2E$ further reveal that model-harness combinations exhibit substantial performance variation across different types of tasks, and that no single combination consistently outperforms all others across every task. These findings not only demonstrate the necessity of systematic evaluation but also provide useful guidance for the co-evolving of models and harnesses. Our code is available at https://github.com/datamllab/A2E.
- Abstract(参考訳): 大規模言語モデル(LLM)の急速な進歩により、エージェントを幅広い領域に展開する上で、ハーネスは不可欠な基盤となっている。
急速に進化するハーネスエコシステムもまた、厳格な能力評価をますます重要にしている。
しかし、エンドツーエンドで体系的で包括的な評価パイプラインを効率的に構築することは、依然として大きな課題である。
この課題に対処するために,エージェントハーネス用に設計されたエンドツーエンド評価エンジンである$A^2E$(Agent Auditing Engine)を紹介した。
A^2E$は、新しく提案されたエージェントタスクプロトコル(ATP)を活用して、異なるハーネスで評価タスクの迅速な統合を可能にします。
自動計測されたモニターを通じて、実験中に標準化された実行トレースをキャプチャして生成する。
評価段階では、$A^2E$は多次元のメトリクスのスイートを使用して、利用能力を体系的に評価する。
正確性だけで比較すると、これらの指標は実行効率、ツールの使用、タスク計画、エラー回復におけるハーネスの違いをよりきめ細やかな評価を提供する。
さらに、$A^2E$で行った実験では、モデルハーネスの組み合わせは、異なるタイプのタスクでかなりのパフォーマンスのばらつきを示し、すべてのタスクにおいて、どの組み合わせも一貫して他のすべてのタスクより優れていないことが明らかになった。
これらの知見は、体系的な評価の必要性を示すだけでなく、モデルとハーネスの共進化のための有用なガイダンスを提供する。
私たちのコードはhttps://github.com/datamllab/A2E.comで利用可能です。
関連論文リスト
- HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? [61.02699867449589]
評価単位をタスク出力から実行インフラストラクチャにシフトするベンチマークであるHarnessDevを紹介します。
Creationでは、エージェントは最小限のシードと少数のケースから始まり、完全な実行システムを構築する。
Evolutionでは、独自のハーネスから始まり、ベンチマークのパフォーマンス向上を目標として、下流の実行フィードバックを使用して反復的に修正する。
論文 参考訳(メタデータ) (2026-09-01T15:45:33Z) - Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification [30.941867057615223]
既存の提案と検証のメソッドは、固定されたタスクセットですべての候補をスコアします。
私たちは、自動化ハーネス進化のための予算対応フレームワークであるHarnessLensを紹介します。
論文 参考訳(メタデータ) (2026-08-27T16:12:23Z) - Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection [51.39973047614183]
本稿では,適応型検証タスク選択によるLLMの効率向上のための新しい手法を提案する。
$textbfTask-CoEvolve$.textbfTask-CoEvolve$.textbfTask-CoEvolve$.textbfTaskは、情報的タスクの選択と、部分的な評価からフルセットのパフォーマンスの推定という2つの課題に対処することで、ハーネスでバリデーションタスクを共進化させる。
論文 参考訳(メタデータ) (2026-08-20T15:24:54Z) - HarnessOpt-Bench: Evaluating LLMs at Harness Optimization [3.846854817984248]
高価な評価体制下でのエンド・ツー・エンドのハーネス最適化のためのベンチマークを導入する。
信頼された実行環境は、評価境界、ターゲットエージェントリソースの使用を強制し、監査のための候補バージョンを保存する。
実験結果から、モデルはコードハーネスよりも分離され、ネイティブハーネスは一貫して優れておらず、タスク間で利得が大きく異なることがわかった。
論文 参考訳(メタデータ) (2026-08-06T17:21:05Z) - Automated Discovery Has No Universally Superior Harness [63.53666712024897]
我々はOpenEvolveスタイルの進化的探索とTT-Discoverサーチハーネスを構成成分に分解する。
12組のモデルプロブレムペアで30個の予算整合ハーネスを評価した。
論文 参考訳(メタデータ) (2026-07-20T17:59:37Z) - Recursive Harness Self-Improvement [28.432258880153125]
モデル-ハーネス共進化の下では、ハーネスはデータ生成コンポーネントであり、実行トレースは将来の基礎モデルを形成することができる。
本稿では,エージェントループのプロンプトレベル仕様としてハーネスを表現したRecursive Harness Self-Improvement (RHI)を紹介する。
RHIは、自身のリビジョン履歴に対してペアのフィードバックを使って、反復的にそれを洗練します。
論文 参考訳(メタデータ) (2026-07-17T00:21:19Z) - Rethinking the Evaluation of Harness Evolution for Agents [83.07258924910069]
既存のハーネス進化法では、単体テストケースを使用してハーネス構成を検索し、同じ公開ベンチマークで最終的なパフォーマンスを報告している。
このプロトコルは2つの基本的な懸念を提起する。
エージェントによるテスト時間スケーリングと同様に、一致したフィードバックと推論予算の下で単純なタスクレベルの検索ベースラインと比較すべきである。
論文 参考訳(メタデータ) (2026-07-14T00:18:42Z) - From Question Answering to Task Completion: A Survey on Agent System and Harness Design [67.8241530947325]
本研究はモデルハーネスレンズを用いてLCMをベースとしたエージェントについて検討する。
まず, LLMをベースとしたエージェントを基礎モデルと実行ハーネスとして, エージェントの機能的定義と実装の視点を明らかにする。
次に、モデル中心のスケーリングの限界を分析し、エージェントエンジニアリングの4つのパラダイムをトレースし、実行ハーネスを6つの結合ランタイム責任に分解する。
論文 参考訳(メタデータ) (2026-06-14T05:40:16Z) - Scaling Laws for Agent Harnesses via Effective Feedback Compute [53.68149869349268]
emphEffective Feedback Compute (EFC)は、情報的、有効、非冗長な場合にのみフィードバックを信用し、その後の決定のために保持するトレースレベルのスケーリング座標である。
EFCベースの座標は、生の計算ベースラインよりも失敗率を常に予測する。
論文 参考訳(メタデータ) (2026-05-28T09:45:47Z) - CORE: Full-Path Evaluation of LLM Agents Beyond Final State [2.0391237204597368]
既存のエージェントベンチマークでは、最終状態のバイナリ判断に対する評価を少なくすることが多い。
本稿では,タスクを有効なツール利用経路の集合として符号化する決定論的有限オートマトンに基づくフレームワークを提案する。
CORE(Path Correctness)、Path Correctness(Path Correctness)、Kendall's tau Composite(Kendall's tau Composite)、Prefix Criticality(Prefix Criticality)、Harmful-Call Rate(Harmful-Call Rate)、Efficency(Efficency)の5つのメトリクススイートを紹介します。
論文 参考訳(メタデータ) (2025-09-25T10:49:35Z) - AnyPos: Automated Task-Agnostic Actions for Bimanual Manipulation [24.199522837278128]
本稿では,タスク固有の条件からアクション実行を分離するタスク非依存のアクションパラダイムを提案する。
ATARAはスケーラブルなセルフ教師付きフレームワークで、人間の遠隔操作と比較して30倍以上のコレクションを高速化する。
我々はArm-Decoupled EstimationとDirection-Aware Decoderを備えた逆動的モデルであるAnyPosを提案する。
論文 参考訳(メタデータ) (2025-07-17T03:48:57Z) - Runaway is Ashamed, But Helpful: On the Early-Exit Behavior of Large Language Model-based Agents in Embodied Environments [54.67512489842682]
大規模言語モデル(LLM)は、複雑な実施環境において、強力な計画と意思決定能力を示す。
LLMをベースとしたエージェントの早期退避行動を探究する第一歩を踏み出す。
論文 参考訳(メタデータ) (2025-05-23T08:23:36Z) - On the Role of Feedback in Test-Time Scaling of Agentic AI Workflows [71.92083784393418]
エージェントAI(自律的な計画と行動を行うシステム)は広く普及しているが、複雑なタスクにおけるタスクの成功率は低いままである。
推論時のアライメントは、サンプリング、評価、フィードバックの3つのコンポーネントに依存します。
本稿では,様々な形態の批判から抽出されたフィードバックを繰り返し挿入するIterative Agent Decoding(IAD)を紹介する。
論文 参考訳(メタデータ) (2025-04-02T17:40:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。