論文の概要: AgentPulse: A Continuous Multi-Signal Framework for Evaluating AI Agents in Deployment
- arxiv url: http://arxiv.org/abs/2604.24038v1
- Date: Mon, 27 Apr 2026 04:48:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-28 17:12:07.742278
- Title: AgentPulse: A Continuous Multi-Signal Framework for Evaluating AI Agents in Deployment
- Title(参考訳): AgentPulse: デプロイメントにおけるAIエージェント評価のための継続的マルチ署名フレームワーク
- Authors: Yuxuan Gao, Megan Wang, Yi Ling Yu,
- Abstract要約: 静的ベンチマークは、AIエージェントが一定時点で何ができるかを測定するが、どのように採用され、維持され、デプロイの経験があるかは測らない。
AgentPulseは,10のワークロードカテゴリにまたがる50のエージェントを4つの要因から評価する継続的評価フレームワークである。
すべての収集信号、スコア出力、評価ハーネスをCC BY 4.0でリリースする。
- 参考スコア(独自算出の注目度): 1.2299000423193074
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Static benchmarks measure what AI agents can do at a fixed point in time but not how they are adopted, maintained, or experienced in deployment. We introduce AgentPulse, a continuous evaluation framework scoring 50 agents across 10 workload categories along four factors (Benchmark Performance, Adoption Signals, Community Sentiment, and Ecosystem Health) aggregated from 18 real-time signals across GitHub, package registries, IDE marketplaces, social platforms, and benchmark leaderboards. Three analyses ground the framework. The four factors capture largely complementary information (n=50; $ρ_{\max}=0.61$ for Adoption-Ecosystem, all others $|ρ| \leq 0.37$). A circularity-controlled test (n=35) shows the Benchmark+Sentiment sub-composite, which contains no GitHub-derived signals, predicts external adoption proxies it does not aggregate: GitHub stars ($ρ_s=0.52$, $p<0.01$) and Stack Overflow question volume ($ρ_s=0.49$, $p<0.01$), with VS Code installs ($ρ_s=0.44$, $p<0.05$) reported as illustrative given that only 11 of 35 agents have non-zero installs. On the n=11 subset with published SWE-bench scores, composite and benchmark-only rankings are nearly uncorrelated ($ρ_s=0.25$; 9 of 11 agents shift by at least 2 ranks), driven by a strong negative Adoption-Capability correlation among closed-source high-capability agents within this subset. This is precisely why we rest the framework's validity claim on the broader n=35 test rather than the SWE-bench overlap. AgentPulse surfaces deployment signal absent from benchmarks; it is a methodology, not a ground-truth ranking. The framework, all collected signals, scoring outputs, and evaluation harness are released under CC BY 4.0.
- Abstract(参考訳): 静的ベンチマークは、AIエージェントが一定時点で何ができるかを測定するが、どのように採用され、維持され、デプロイの経験があるかは測らない。
AgentPulseは、GitHubの18のリアルタイムシグナル、パッケージレジストリ、IDEマーケットプレース、ソーシャルプラットフォーム、ベンチマークリーダボードから集約された、4つの要因(ベンチマークパフォーマンス、採用シグナル、コミュニティセンチメント、エコシステムヘルス)に沿って、10のワークロードカテゴリに50のエージェントをスコア付けする継続的評価フレームワークである。
3つの分析がフレームワークの基礎となる。
4つの因子は相補的な情報(n=50; $ρ_{\max}=0.61$ for Adoption-Ecosystem, all else $|ρ| \leq 0.37$)をほとんど取得する。
GitHubのスター(ρ_s=0.52$, $p<0.01$)とStack Overflowの問題ボリューム(ρ_s=0.49$, $p<0.01$)。
公表されたSWEベンチスコアを持つn=11サブセットでは、複合的およびベンチマークのみのランキングはほぼ無相関(ρ_s=0.25$; 9 of 11 agent shift by least 2 rank)であり、このサブセット内のクローズドソースのハイキャパビリティーエージェント間の強い負のAccession-Capability相関によって引き起こされる。
これが、SWE-ベンチ重なりではなく、より広い n=35 テストに対するフレームワークの妥当性主張を確実に残す理由である。
AgentPulseは、ベンチマークから外れたデプロイメントシグナルをサーフェスする。
すべての収集信号、スコア出力、評価ハーネスをCC BY 4.0でリリースする。
関連論文リスト
- Measuring the Unmeasurable: Markov Chain Reliability for LLM Agents [0.7161783472741748]
エージェントの実行トレースをMarkovチェーンに適合させる再現可能なパイプラインである textscTraceToChain を提示する。
パイプラインは自動クラスタ分類を構築し、Laplace-smoothed maximum-likelihood Estimation (MLE) による遷移を推定し、複合的なAkaike Information criterion (AIC) と Kolmogorov-Smirnov (KS) に適合する。
結果として得られたファーストパスビューは、通常別々に報告されるメトリクスを再構成する: pass$$k$, pass$k$, and the reliability decay curve (RDC) is projections of one。
論文 参考訳(メタデータ) (2026-04-27T15:05:45Z) - Label-Free Cross-Task LoRA Merging with Null-Space Compression [50.63908869296697]
我々は,ラベルフリーで出力に依存しない手法であるNull-Space Compression (NSC) Mergingを紹介した。
NSCは、従来のメソッドがタスクのサブセットに収まるバランスの取れたゲインを持つ20の異種視覚タスクに対して、最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-03-27T11:34:41Z) - TDAD: Test-Driven Agentic Development - Reducing Code Regressions in AI Coding Agents via Graph-Based Impact Analysis [0.0]
TDADはソースコードとテスト間の依存性マップを構築し、パッチをコミットする前に、エージェントはどのテストを検証して自己修正するかを知っている。
本稿では,AI符号化エージェントの事前変更影響分析を行うオープンソースツールであるTDADを提案する。
論文 参考訳(メタデータ) (2026-03-18T17:38:22Z) - Agentic Rubrics as Contextual Verifiers for SWE Agents [8.469998524915818]
本稿では,エージェントルーブリックがSWEエージェントに対して,効率的でスケーラブルで粒度の高い検証信号を提供することを示す。
結果から,Agenic rubricsは接地トルーステストと整合性を示し,テストが捉えない問題をフラグ付けする。
論文 参考訳(メタデータ) (2026-01-07T18:38:23Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents [58.00130492861884]
TraitBasisは、AIエージェントを体系的にストレステストするための軽量でモデルに依存しない方法である。
TraitBasisは、ステアブルなユーザ特性に対応するアクティベーション空間で方向を学習する。
We observed on average a 2%-30% performance degradation on $tau$-Trait across frontier model。
論文 参考訳(メタデータ) (2025-10-06T05:03:57Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Agent-Testing Agent: A Meta-Agent for Automated Testing and Evaluation of Conversational AI Agents [2.3429263075112288]
本稿では,静的コード解析,デザイナの尋問,文献マイニング,ペルソナ駆動の対人テスト生成を組み合わせたメタエージェントであるAgent-Testing Agent(ATA)を提案する。
各対話はLLM-as-a-Judge (LAAJ)ルーブリックでスコアされ、その後の試験をエージェントの最も弱い能力に向けて操るために使用される。
論文 参考訳(メタデータ) (2025-08-24T15:02:13Z) - Acting in Delayed Environments with Non-Stationary Markov Policies [57.52103323209643]
本稿では,MDPにおける学習と計画のためのフレームワークについて紹介する。
実行が遅れると、元の状態空間における決定論的マルコフポリシーは最大報酬を得るのに十分であるが、非定常である必要があることを証明します。
我々は、状態拡張に頼らずに遅延実行タスクを解く非定常Q学習スタイルのモデルベースアルゴリズムを考案した。
論文 参考訳(メタデータ) (2021-01-28T13:35:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。