論文の概要: AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP
- arxiv url: http://arxiv.org/abs/2607.11098v3
- Date: Wed, 15 Jul 2026 06:22:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 12:21:59.377057
- Title: AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP
- Title(参考訳): AgentCheck: MCP 上の LLM エージェントのためのリプロデューサ・インターベイン・マイチゲートワークベンチ
- Authors: Aritra Mazumder, Nusrat jahan Lia,
- Abstract要約: AgentCheckは、実際のツールに対してエージェントを実行し、すべてのツール応答を記録し、その後、障害(12タイプ)インジェクタによって妨害されたレスポンスでエージェントを再実行します。
マッチングツールコールはキャッシュからリプレイされ、その後、エージェントが分岐した後にツールコールがライブになる。
開発者は緩和をトグルし、同じ障害に対して再実行し、障害が消滅するかどうかを確認する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tool-using LLM agents are mostly evaluated assuming all tools work. When a tool times out, returns a week-stale value, or has its description poisoned in deployment, the developer needs a controlled way to reproduce the failure, test a fix, and confirm the fix worked before deployment. We present AgentCheck, an open-source web workbench that turns an MCP server into an intervention surface. AgentCheck runs an agent against its real tools and records every tool response, then re-runs the agent with the response perturbed by a fault (12 types) injector. Matching tool calls are replayed from cache, and later tool calls go live after the agent diverges. This yields a reproduce-intervene-confirm loop: the developer toggles a mitigation, re-runs against the identical fault, and sees if the failure goes away. Scoring has two parts: deterministic pass/fail rules, plus an LLM judge for interpretive labels, validated against human annotations. Across five agents, the best passes 105/120 scenarios and the weakest only 77. The failures are usually silent, confident use of incorrect tool outputs rather than crashes. On the weakest agent, a retry mitigation raises success on timeout error faults from as few as 30% of cases to 100%, whereas stale-data faults remain near 3-4 of 10 regardless of the mitigation. AgentCheck makes these failure modes reproducible, comparable, and verifiable before deployment.
- Abstract(参考訳): ツールを使用するLLMエージェントは、すべてのツールが動作すると仮定して、主に評価される。
ツールがタイムアウトし、週単位の値を返すか、あるいは、その説明がデプロイメントで悪用されている場合、開発者は、障害を再現し、修正をテストし、デプロイ前に動作した修正を確認する制御された方法が必要である。
我々は、MSPサーバを介入面に変換するオープンソースのWebワークベンチであるAgentCheckを紹介する。
AgentCheckは、実際のツールに対してエージェントを実行し、すべてのツール応答を記録し、その後、障害(12タイプ)インジェクタによって妨害されたレスポンスでエージェントを再実行します。
マッチングツールコールはキャッシュからリプレイされ、その後、エージェントが分岐した後にツールコールがライブになる。
開発者は緩和をトグルし、同じ障害に対して再実行し、障害が消滅するかどうかを確認する。
Scoringには、決定論的パス/フェイルルールと、人間のアノテーションに対して検証された解釈ラベルのLLMジャッジの2つの部分がある。
5つのエージェントにまたがって、ベストは105/120シナリオをパスし、最も弱いのは77のみである。
失敗は通常静かで、クラッシュよりも間違ったツール出力を確実に使用します。
最も弱いエージェントでは、リトライ緩和はタイムアウトエラーの障害を30%から100%に改善するが、古いデータ障害は緩和によらず10の3〜4付近にとどまる。
AgentCheckは、これらの障害モードを再現可能で、同等で、デプロイ前に検証可能である。
関連論文リスト
- AgentTether: Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operation [27.0859707906163]
AgentTetherは実行時修復フレームワークで、基礎となるエージェントや環境を変更することなく、実行後の診断とガイド付きリカバリを自動化する。
オフラインのノーマルビヘイビアモデルとランローカルグラフ検出器を組み合わせることで、障害クリティカルなサブトラジェクトリをローカライズする。
オフラインの診断とガイダンスツールとして、あるいはオンラインの修復レイヤとしてデプロイできる。
論文 参考訳(メタデータ) (2026-07-07T13:40:31Z) - AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation [0.18567307896771823]
AgentLensはインタラクティブなコードエージェントのための実運用評価ベンチマークである。
LLMで書かれた軌道レビューとサイド・バイ・サイド比較との形式的検証を組み合わせている。
モデル行動の診断、エージェントの連続したバージョンの比較、夜間評価パイプラインでの製品回帰の取得に使用しています。
論文 参考訳(メタデータ) (2026-07-07T11:27:43Z) - When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents [7.986500985812644]
私たちはこの問題をInfinite Agentic Loops (IALs)と呼んでいる。
IALはエージェントロジック、フレームワークセマンティクス、実行時の観察、終了メカニズム間の相互作用から生まれる。
本研究では,実世界のLLMエージェントプロジェクトにおけるALF検出のための静的解析ツールであるIAL-Scanを提案する。
論文 参考訳(メタデータ) (2026-07-02T03:14:27Z) - Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity? [54.701199583505144]
アプリケーション間アクセスは、ほとんど見落とされたプライバシーリスクを生み出す。
我々はAgentCIBenchを紹介します。これは、このリスクを決定論的に評価されたシナリオに変換する評価ハーネスです。
我々は15のフロンティアエージェントを評価し、驚くほど高い失敗率を見出す。
論文 参考訳(メタデータ) (2026-06-22T11:36:58Z) - LACUNA: Safe Agents as Recursive Program Holes [3.2613419151327343]
LLMエージェントはますますコードを記述することで振る舞うが、エージェントを駆動するランタイムとモデルが記述するコードの間には分割が持続する。
我々は、安全性を維持しながら、この分割を閉じるエージェントのためのプログラミングモデルであるLACUNAを紹介する。
我々のプリミティブは、通常の制御フローとしてReActループ、サブエージェント、スキル、並列分解、マルチモデル計画を表現する。
論文 参考訳(メタデータ) (2026-05-27T15:27:25Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Where LLM Agents Fail and How They can Learn From Failures [62.196870049524364]
大規模言語モデル(LLM)エージェントは、複雑なマルチステップタスクの解決において有望であることを示す。
単一ルート原因エラーがその後の決定を通じて伝播する、障害のカスケードに対する脆弱性を増幅する。
現在のシステムは、モジュール的で体系的な方法でエージェントエラーを包括的に理解できるフレームワークを欠いている。
AgentErrorTaxonomyは、メモリ、リフレクション、計画、アクション、システムレベルの操作にまたがる障害モードのモジュール分類である。
論文 参考訳(メタデータ) (2025-09-29T18:20:27Z) - Which Agent Causes Task Failures and When? On Automated Failure Attribution of LLM Multi-Agent Systems [50.29939179830491]
LLMマルチエージェントシステムにおける障害帰属は、まだ調査が過小評価されており、労働集約的である。
本稿では,3つの自動故障帰属手法の開発と評価を行い,その欠点と欠点を要約する。
最良の方法は、障害に応答するエージェントを特定する際に53.5%の精度を達成するが、故障の特定には14.2%しか役に立たない。
論文 参考訳(メタデータ) (2025-04-30T23:09:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。