論文の概要: MCP Error Messages Written for Developers Hurt the Most Capable Agents Most
- arxiv url: http://arxiv.org/abs/2609.35381v1
- Date: Mon, 28 Sep 2026 15:14:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.811634
- Title: MCP Error Messages Written for Developers Hurt the Most Capable Agents Most
- Title(参考訳): MCPのエラーメッセージは、最も有能なエージェントを扱いやすくする
- Abstract要約: 150の広く使われているMPPサーバでは、3,001のエラーメッセージのうち949が呼び出し元に次に何をすべきかを伝える。
私たちは5つのOpenAIモデルをテストしました。
- 参考スコア(独自算出の注目度): 1.6787220460106658
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Many Model Context Protocol (MCP) servers wrap web APIs built for human developers, and their error messages tell the reader to run a command, edit a configuration, open a web page or wait. Many agents that read them can only call the server's tools. In 150 widely used MCP servers, 949 of 3,001 error messages tell the caller what to do next, and half of these steps depend on something the server cannot see about the caller. On credential errors, 62 of 67 steps ask for a terminal command, a configuration change or a web page; on rate limits, 20 of 30 say to wait and retry without naming the call to repeat. We tested five OpenAI models that act only through the tools of Berkeley Function Calling Leaderboard tasks, and the agents did what the step said. On expired credentials, a terminal command in the step left 45% of tasks recovered, and the loss it caused grew from 18 points for GPT-5.5 to 69 for GPT-6 Astra. On a rate limit, GitHub's "Wait before retrying." left 6%. We tested two remedies. For MCP developers, naming a server tool in the step raised recovery on expired credentials to 84%, with the login tool in place of the command, and on a rate limit to 88%, with the call to repeat in place of the bare wait. For agent developers, deleting the step with a one-sentence prompt before the model reads it raised recovery on expired credentials to 82%.
- Abstract(参考訳): 多くのモデルコンテキストプロトコル(MCP)サーバは、人間の開発者のために構築されたWeb APIをラップし、エラーメッセージは、リーダーにコマンドを実行し、設定を編集し、Webページを開くか、待つように指示する。
それらを読むエージェントの多くは、サーバのツールを呼び出すだけでよい。
150の広く使われているMPPサーバでは、3,001のエラーメッセージのうち949が呼び出し元に次に何をすべきかを伝える。
クレデンシャルエラーでは、67ステップ中62ステップが端末コマンド、設定変更、Webページをリクエストする。
われわれは5つのOpenAIモデルをテストし、バークレー関数呼び出しリーダーボードタスクのツールでのみ動作させました。
期限切れの証明書では、ステップの端末コマンドが45%のタスクをリカバリし、その損失は GPT-5.5 の 18 ポイントから GPT-6 アストラの 69 ポイントに増加した。
レート制限では、GitHubの"リトライ前の待機"が6%に留まった。
私たちは2つの治療法を試した。
MCP開発者にとって、ステップ内のサーバツールの命名は、期限切れの認証情報のリカバリを84%に、ログインツールをコマンドの代わりに、レート制限を88%に引き上げた。
エージェント開発者にとっては、モデルを読み取る前に1文プロンプトでステップを削除することで、期限切れの資格情報のリカバリを82%に引き上げている。
関連論文リスト
- Agora: Git as Shared Memory for Collective AutoResearch [54.31992252587096]
別々のセッションで作業する調査エージェントは、他の人が試したことと、構築可能な結果を知る必要がある。
各コミットは結果、洞察、仮説、検証、報告を記録し、それを以前の作業とリンクする。
約12日間に渡り,13人の言語モデル労働者がアゴラを重み移動問題の解決に利用したことを報告した。
論文 参考訳(メタデータ) (2026-09-16T04:00:54Z) - Fabrication After Tool Failure: Tool-Augmented Agents Assert Values Their Tools Did Not Return [7.146717861821737]
ツール拡張言語モデルは、ツールの供給に失敗した時に正直に報告するかどうかではなく、正しい回答に達するかどうかで評価される。
16のシステムドメインと8つのツール障害タイプにまたがる1024項目のベンチマークで、この障害後の決定を分離する。
論文 参考訳(メタデータ) (2026-09-13T19:46:42Z) - SilentProbe: Measuring Silent Failure in Production APIs Used as Agent Tools [0.0]
機械チェック可能な制約は111例中111例において正直な誤りを示し, 61例中44例では散文のみの制約が無音に失敗した。
88回のうち88回は、その記述が単なる例示である語彙が欠落し、88回から91%が完全で書かれた語彙が正しく使用された。
論文 参考訳(メタデータ) (2026-08-29T07:07:28Z) - Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents [48.967927222079965]
Ledgerは、エージェントの完了したインタラクションを明示的な実行状態に蒸留するランタイム層である。
Ledgerはこの状態をオンライン実行台帳に保持し、各ステップの2つのバウンダリに適用される。
500のSWE-bench検証インスタンス全体で、LedgerはPass@1を56.2%から64.2%に、GPT-5 miniを75.8%から81.0%に、MiniMax M2.5を81.0%に引き上げている。
論文 参考訳(メタデータ) (2026-08-01T18:25:00Z) - AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents [83.37969790806069]
LLMエージェントのエラーは、エラーが表面化するステップが原因ではないことが多いため、デバッグが難しい。
Agent DebuggerXはオープンソースのフレームワークで、デバッグをDe Detect, Attribute, Recover, Rerunのクローズドループとして整理する。
コアとなるDeep Debuggerは、グローバルな軌跡理解を通じてマルチターン根本原因診断を行う。
論文 参考訳(メタデータ) (2026-07-21T06:21:13Z) - AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP [0.0]
AgentCheckは、実際のツールに対してエージェントを実行し、すべてのツール応答を記録し、その後、障害(12タイプ)インジェクタによって妨害されたレスポンスでエージェントを再実行します。
マッチングツールコールはキャッシュからリプレイされ、その後、エージェントが分岐した後にツールコールがライブになる。
開発者は緩和をトグルし、同じ障害に対して再実行し、障害が消滅するかどうかを確認する。
論文 参考訳(メタデータ) (2026-07-13T05:14:12Z) - WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation [88.10947115397971]
この研究でWildClawBenchは、6つのテーマのカテゴリにまたがる60の人間によるバイリンガルなマルチモーダルタスクのネイティブランタイムベンチマークである。
各タスクは、約8分間のウォールクロック時間と20以上のツールコールで実行されます。
グラディングはハイブリッドであり、決定論的ルールベースのチェック、副作用の環境状態監査、意味的検証のためのLLM/VLM判定を組み合わせている。
論文 参考訳(メタデータ) (2026-05-11T17:49:43Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。