論文の概要: The Evaluation Context Protocol (ECP): A Portable Contract for AI Agent Evaluation
- arxiv url: http://arxiv.org/abs/2608.19263v1
- Date: Tue, 18 Aug 2026 07:14:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.352759
- Title: The Evaluation Context Protocol (ECP): A Portable Contract for AI Agent Evaluation
- Title(参考訳): 評価コンテキストプロトコル(ECP):AIエージェント評価のためのポータブルコントラクト
- Abstract要約: 本稿では,AIエージェントの評価における重要な方法論と,高度な可観測性基盤の不可欠な役割について考察する。
本稿では,エージェントシステムの契約層として機能することを目的とした,初期段階のベンダ中立フレームワークである評価コンテキストプロトコル(ECP)を提案する。
本稿では,LangChain,LlamaIndex,CrewAI,PydanticAIのアダプタを含むオープンソースリファレンス実装について述べる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The evolution of artificial intelligence has necessitated a fundamental shift from evaluating isolated Large Language Models (LLMs) to assessing autonomous agentic architectures. This paper explores the critical methodologies for evaluating AI agents and the essential role of advanced observability infrastructure. We analyze the architectural components of agents and identify the severe limitations of current evaluation paradigms, including benchmark exploitation, the "confidently wrong" phenomenon, and the discrepancy between theoretical capability and operational reliability. To begin addressing the fragmentation in current evaluation infrastructure, this paper proposes the Evaluation Context Protocol (ECP), an early-stage, vendor-neutral framework intended to act as a portable evaluation contract layer for agentic systems. In its current form ECP defines a small JSON-RPC interface over which an agent exposes its user-visible output, the tool calls it made, and evaluator-safe audit context, and against which programmatic checks can be run uniformly across frameworks and continuous integration systems. We describe an open-source reference implementation that includes adapters for LangChain, LlamaIndex, CrewAI, and PydanticAI, and we situate the design against failure modes documented in the recent literature. ECP is presented as work in progress rather than a finished standard: the evaluation surface, method set, and grader families are all expected to change as the protocol is exercised against more systems, and the empirical validation required to justify adoption is outlined as future work.
- Abstract(参考訳): 人工知能の進化は、孤立した大規模言語モデル(LLM)の評価から自律的なエージェントアーキテクチャ評価への根本的なシフトを必要としている。
本稿では,AIエージェントの評価における重要な方法論と,高度な可観測性基盤の不可欠な役割について考察する。
エージェントのアーキテクチャコンポーネントを分析し、ベンチマークの活用、"秘密の誤り"現象、理論能力と運用信頼性の相違など、現在の評価パラダイムの厳しい限界を識別する。
本稿では,エージェントシステムのためのポータブルな評価契約層として機能することを目的とした,初期段階のベンダ中立フレームワークである評価コンテキストプロトコル(ECP)を提案する。
現在の形式では、エージェントがユーザ可視の出力を公開する小さなJSON-RPCインターフェースを定義し、ツールがそれを呼び出し、監査コンテキストを評価できる。
本稿では,LangChain,LlamaIndex,CrewAI,PydanticAIのアダプタを含むオープンソースリファレンス実装について述べる。
評価面、メソッドセット、グレーダーファミリーは、プロトコルがより多くのシステムに対して実行されているため、変更されると予想され、採用を正当化するために必要な実証的な検証は将来の作業として概説される。
関連論文リスト
- AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities [55.23913617185508]
Agentは、LLM(Large Language Models)ベースのエージェントを評価するための、オープンソース、軽量、インフラストラクチャである。
Benchmark、Harness、Environmentという3つの独立したコンポーネントに関する評価プロセスを編成する。
フォールトトレラントなランタイムと、報酬ハックのような障害モードを透過的に診断する包括的なトラジェクトリ分析ツールを備えている。
論文 参考訳(メタデータ) (2026-07-15T11:11:17Z) - Autonomous Information Seeking: A Roadmap for Agentic Recommender Systems [64.88044474617854]
大規模言語モデルベースのエージェントをリコメンダシステムに迅速に統合することで、静的なランキングベースのパイプラインから、自律的でインタラクティブなシステムへのシフトが加速した。
この調査では、自律性のレベルとエージェントレコメンデータシステムの3つのコアパラダイムを基盤とした統合された分類法を紹介した。
論文 参考訳(メタデータ) (2026-07-05T17:55:05Z) - From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape [79.30826980815927]
ルーブリックは、複雑な品質判断を構造化され、実行可能な標準に変換する明示的な基準セットです。
我々は,既存のルーリックデザインを体系的に整理し,その構築と最適化を検証し,評価と訓練をまたいだ役割を解析する。
論文 参考訳(メタデータ) (2026-06-07T13:34:55Z) - The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development? [80.24951682268332]
本稿では,自律エージェント開発のためのフロンティアモデルのキャパシティをテストするための評価フレームワークであるMeta-Agent Challenge(MAC)を紹介する。
評価の整合性を確保するため、このフレームワークは報奨ハッキングに対する多層防御によって確保される。
メタエージェントは人間工学的な基本方針とほとんど一致せず、その一部はプロプライエタリなフロンティアモデルに支配されている。
論文 参考訳(メタデータ) (2026-06-03T04:58:17Z) - Interactive Evaluation Requires a Design Science [90.62695599188204]
大規模言語モデル(LLM)は、ツールや環境、ユーザ、その他のエージェントを通じて、時間とともに機能するシステムとして、ますます多くデプロイされている。
フィールドはインタラクティブなベンチマークを構築し始めたが、その結果のランドスケープは断片化されている。
本論では,対話的評価は原則的評価パラダイムとして扱うべきであると論じる。
論文 参考訳(メタデータ) (2026-05-18T04:03:18Z) - Benchmarked Yet Not Measured -- Generative AI Should be Evaluated Against Real-World Utility [9.928824688627037]
我々は、生成AI評価は、静的なベンチマーク中心の透明性から、人間の成果軌跡に根ざしたステークホルダー、ゴール、コンテキスト条件付きユーティリティ透明性へのパラダイムシフトを必要とすると論じる。
SCU-GenEvalは,利害関係者と利害関係者のゴールマッピング,構成指標仕様,メカニズムモデリング,長手効用測定からなる4段階評価フレームワークである。
論文 参考訳(メタデータ) (2026-05-07T18:56:07Z) - Beyond Benchmark Islands: Toward Representative Trustworthiness Evaluation for Agentic AI [45.21562889170875]
シナリオ多様体に対するエージェントの信頼性を特徴付けるシステム評価パラダイムを提案する。
このフレームワークは,静的認知と政策分析,対話型サンドボックスシミュレーション,社会倫理アライメントアライメントアセスメント,および(iv)分散対応の代表サンプリングエンジンの4つの補完的コンポーネントを統合している。
論文 参考訳(メタデータ) (2026-03-16T08:51:33Z) - From Prompt-Response to Goal-Directed Systems: The Evolution of Agentic AI Software Architecture [0.0]
Agentic AIは、ステートレスでプロンプト駆動型生成モデルからゴール指向システムへのアーキテクチャ移行を表す。
本稿では、知的エージェント理論と現代のLCM中心のアプローチを結びつけることによって、この遷移を考察する。
この研究は、標準化されたエージェントループ、登録、監査可能な制御機構への収束を特定する。
論文 参考訳(メタデータ) (2026-02-11T03:34:48Z) - Beyond Task Completion: An Assessment Framework for Evaluating Agentic AI Systems [0.0]
エージェントAIの最近の進歩は、スタンドアロンの大規模言語モデルから統合システムへと焦点を移している。
LLM、メモリ、ツール、環境を含む4つの評価柱を持つエンドツーエンドのエージェントアセスメントフレームワークを提案する。
我々はこのフレームワークを、従来のメトリクスによる振る舞いの偏りを示す、代表的なAutonomous CloudOpsユースケースで検証する。
論文 参考訳(メタデータ) (2025-12-14T18:17:40Z) - AgentCompass: Towards Reliable Evaluation of Agentic Workflows in Production [4.031479494871582]
本稿では,エージェントパイプラインのデプロイ後監視と推論に特化して設計された,最初の評価フレームワークであるAgentを紹介する。
Agentは、主要なメトリクスに関する最先端の結果を達成すると同時に、人間のアノテーションで見逃された重要な問題を明らかにする。
論文 参考訳(メタデータ) (2025-09-18T05:59:04Z) - Deep Research Agents: A Systematic Examination And Roadmap [109.53237992384872]
Deep Research (DR) エージェントは複雑な多ターン情報研究タスクに取り組むように設計されている。
本稿では,DRエージェントを構成する基礎技術とアーキテクチャコンポーネントの詳細な分析を行う。
論文 参考訳(メタデータ) (2025-06-22T16:52:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。