論文の概要: AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities
- arxiv url: http://arxiv.org/abs/2607.13705v3
- Date: Mon, 20 Jul 2026 12:05:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 14:24:57.504151
- Title: AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities
- Title(参考訳): AgentCompass: エージェント機能のための統一された評価基盤
- Authors: Kai Chen, Zichen Ding, Jiaye Ge, Shufan Jiang, Mo Li, Qingqiu Li, Zehao Li, Zonglin Li, Tianhao Liang, Shudong Liu, Zerun Ma, Zixin Shang, Wenhui Tian, Zun Wang, Liwei Wu, Zhenyu Wu, Jun Xu, Bowen Yang, Dingbo Yuan, Qi Zhang, Songyang Zhang, Peiheng Zhou, Dongsheng Zhu,
- Abstract要約: Agentは、LLM(Large Language Models)ベースのエージェントを評価するための、オープンソース、軽量、インフラストラクチャである。
Benchmark、Harness、Environmentという3つの独立したコンポーネントに関する評価プロセスを編成する。
フォールトトレラントなランタイムと、報酬ハックのような障害モードを透過的に診断する包括的なトラジェクトリ分析ツールを備えている。
- 参考スコア(独自算出の注目度): 55.23913617185508
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As Large Language Models (LLMs) evolve into autonomous agents, the need for unified evaluation infrastructure becomes critical. However, current evaluation pipelines remain highly fragmented and tightly coupled, hindering reproducibility and causing redundant engineering. To address this, we introduce AgentCompass, an open-source, lightweight, and extensible infrastructure for evaluating LLM-based agents. AgentCompass organizes the evaluation process around three independent components, namely Benchmark, Harness, and Environment, thereby enabling flexible configurations without requiring the reimplementation of complex execution logic. Furthermore, it features a fault-tolerant asynchronous runtime and comprehensive trajectory analysis tools to transparently diagnose nuanced failure modes like reward-hacking. Natively supporting over 20 benchmarks across five capability dimensions, AgentCompass provides the community with a scalable and reproducible infrastructure for advancing agent research.
- Abstract(参考訳): 大規模言語モデル(LLM)が自律エージェントへと進化するにつれて、統一された評価インフラの必要性が重要になる。
しかし、現在の評価パイプラインは高度に断片化され、密結合され、再現性を阻害し、冗長なエンジニアリングを引き起こしている。
そこで我々は,LDMベースのエージェントを評価するための,オープンソースで軽量で拡張可能なインフラストラクチャであるAgentCompassを紹介した。
AgentCompassは、Benchmark、Harness、Environmentという3つの独立したコンポーネントに関する評価プロセスを整理し、複雑な実行ロジックを再実装する必要なしに柔軟な構成を可能にする。
さらに、フォールトトレラントな非同期ランタイムと、報酬ハックのようなニュアンスド障害モードを透過的に診断する包括的なトラジェクトリ分析ツールを備えている。
AgentCompassは5つの機能範囲で20以上のベンチマークをネイティブにサポートしており、エージェント研究を進めるためのスケーラブルで再現可能なインフラストラクチャをコミュニティに提供する。
関連論文リスト
- From Atomic Actions to Standard Operating Procedures: Iterative Tool Optimization for Self-Evolving LLM Agents [90.3279207163486]
EvoSOPは、エージェントが実行軌跡からSOPを抽出し、反復的にツールセットを最適化することを可能にするフレームワークである。
EvoSOPはタスク成功率を大幅に向上し,インタラクションラウンドの回数を大幅に削減することを示す。
論文 参考訳(メタデータ) (2026-07-08T12:09:49Z) - VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora [24.484384823423216]
既存のベンチマークでは、情報ノイズを考慮せず、複数ソースの事実矛盾を無視し、論理的計画に視覚的認識を根ざす必要性を見落としている。
エージェントの堅牢性と信頼性の増大に対応するために設計された検証可能なベンチマークであるVeriTripを紹介する。
論文 参考訳(メタデータ) (2026-05-27T16:14:47Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - Evolutionary Ensemble of Agents [7.465452178698495]
EvEは、分散化されたフレームワークであり、アルゴリズム発見のためのライブで共進化するシステムにコーディングエージェントを編成する。
2つの共進化する人口を維持することで、EvEはエージェントを同期レースを通じて評価し、経験的Elo格付けを更新する。
固定初期エージェントや凍結した「ベスト進化」エージェントによって駆動される変種と比較して、EvEは位相ミスマッチを独自に回避する。
論文 参考訳(メタデータ) (2026-05-09T15:56:10Z) - NetAgentBench: A State-Centric Benchmark for Evaluating Agentic Network Configuration [0.669087470775851]
本稿では,FSM(Finite State Machine)形式化によるエージェントインタラクションの評価を行うベンチマークであるNetAgentBenchを紹介する。
これにより、複雑なマルチターン動作を測定するための厳密な基盤を備えたネットワーク環境が提供されます。
論文 参考訳(メタデータ) (2026-04-03T05:11:05Z) - SBOMs into Agentic AIBOMs: Schema Extensions, Agentic Orchestration, and Reproducibility Evaluation [11.812618112854116]
ソフトウェアサプライチェーンのセキュリティには、動的実行条件下での脆弱性評価をサポートするプロビデンスメカニズムが必要である。
本稿では,AIBOM(Agenic Artificial Intelligence Bills of Materials)を紹介する。
i)ベースライン環境再構築剤(MCP)、(ii)ランタイム依存性およびドリフト監視剤(A2A)、(iii)ポリシー対応脆弱性とVEX推論剤(AGNTCY)からなるマルチエージェントアーキテクチャに基づくエージェントAIBOMフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-09T19:11:45Z) - A Lightweight Modular Framework for Constructing Autonomous Agents Driven by Large Language Models: Design, Implementation, and Applications in AgentForge [1.932555230783329]
LLM駆動の自律エージェントの構築を民主化するために設計された軽量でオープンソースのPythonフレームワーク。
AgentForgeは、(1)正式に定義された入出力契約できめ細かいタスク分解を可能にする構成可能なスキル抽象化、(2)クラウドベースのAPIとローカル推論エンジンのシームレスな切り替えをサポートする統一されたバックエンドインターフェース、(3)エージェントロジックと実装の詳細を分離する宣言型YAMLベースの構成システムである。
論文 参考訳(メタデータ) (2026-01-19T20:33:26Z) - Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystem [90.17610617854247]
本稿では,エージェントモデルの生産パイプラインを最適化する基盤インフラであるエージェント学習エコシステム(ALE)を紹介する。
ALEは、重量最適化のためのトレーニング後のフレームワークであるROLL、軌道生成のためのサンドボックス環境マネージャであるROCK、効率的なコンテキストエンジニアリングのためのエージェントフレームワークであるiFlow CLIの3つのコンポーネントで構成されている。
ROMEはALEが基盤として100万件以上のトラジェクトリをトレーニングしたオープンソースエージェントです。
論文 参考訳(メタデータ) (2025-12-31T14:03:39Z) - Towards Efficient Agents: A Co-Design of Inference Architecture and System [66.59916327634639]
本稿では,エージェントアクセラレーションのための統合フレームワークであるAgentInferを提案する。
問題をAgentCollab、AgentSched、AgentSAM、AgentCompressの4つの相乗的コンポーネントに分解する。
BrowseComp-zhとDeepDiverベンチマークの実験では、これらの手法の相乗的コラボレーションを通じて、AgentInferは非効率なトークン消費を50%以上削減することを示した。
論文 参考訳(メタデータ) (2025-12-20T12:06:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。