論文の概要: MCP Pitfall Lab: Exposing Developer Pitfalls in MCP Tool Server Security under Multi-Vector Attacks
- arxiv url: http://arxiv.org/abs/2604.21477v1
- Date: Thu, 23 Apr 2026 09:39:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-24 14:40:06.416648
- Title: MCP Pitfall Lab: Exposing Developer Pitfalls in MCP Tool Server Security under Multi-Vector Attacks
- Title(参考訳): MCP Pitfall Lab:マルチベクタ攻撃によるMCPツールサーバセキュリティにおける開発者の落とし穴の公開
- Authors: Run Hao, Zhuoran Tan,
- Abstract要約: MCP Pitfall Labは,開発者の落とし穴を再現可能なシナリオとして運用するプロトコル対応のセキュリティテストフレームワークである。
Pitfall Labは,現実的なマルチベクタ条件下でのMPPツールサーバの実用的,エンドツーエンド評価と強化を可能にする。
- 参考スコア(独自算出の注目度): 0.7305019142196584
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Model Context Protocol (MCP) is increasingly adopted for tool-integrated LLM agents, but its multi-layer design and third-party server ecosystem expand risks across tool metadata, untrusted outputs, cross-tool flows, multimodal inputs, and supply-chain vectors. Existing MCP benchmarks largely measure robustness to malicious inputs but offer limited remediation guidance. We present MCP Pitfall Lab, a protocol-aware security testing framework that operationalizes developer pitfalls as reproducible scenarios and validates outcomes with MCP traces and objective validators (rather than agent self-report). We instantiate three workflow challenges (email, document, crypto) with six server variants (baseline and hardened) and model three attack families: tool-metadata poisoning, puppet servers, and multimodal image-to-tool chains, in a unified, trace-grounded evaluation. In Tier-1 static analysis over six variants (36 binary labels), our analyzer achieves F1 = 1.0 on four statically checkable pitfall classes (P1, P2, P5, P6) and flags cross-tool forwarding and image-to-tool leakage (P3, P4) as trace/dataflow-dependent. Applying recommended hardening eliminates all Tier-1 findings (29 to 0) and reduces the framework risk score (10.0 to 0.0) at a mean cost of 27 lines of code (LOC). Finally, in a preliminary 19-run corpus from the email system challenge (tool poisoning and puppet attacks), agent narratives diverge from trace evidence in 63.2% of runs and 100% of sink-action runs, motivating trace-based auditing and regression testing. Overall, Pitfall Lab enables practical, end-to-end assessment and hardening of MCP tool servers under realistic multi-vector conditions.
- Abstract(参考訳): Model Context Protocol (MCP) は、ツール統合 LLM エージェントにますます採用されているが、多層設計とサードパーティのサーバエコシステムは、ツールメタデータ、信頼できない出力、クロスツールフロー、マルチモーダル入力、サプライチェーンベクトルにまたがるリスクを拡大している。
既存のMPPベンチマークは主に悪意のある入力に対する堅牢性を測定するが、修正ガイダンスは限られている。
提案するMPP Pitfall Labは,開発者の落とし穴を再現可能なシナリオとして運用し,MCPトレースと客観的バリデータ(エージェントの自己報告ではなく)を用いて結果を検証する,プロトコル対応のセキュリティテストフレームワークである。
メール,ドキュメント,暗号の3つのワークフローを6つのサーバ変種(ベースラインと硬化)でインスタンス化し,ツール・メタタ中毒,パペットサーバ,マルチモーダルイメージ・ツー・ツールチェーンという3つの攻撃ファミリーを,統一的かつトレーサグラウンドで評価する。
静的チェック可能な4つの落とし穴クラス (P1, P2, P5, P6) とフラグのクロスツールフォワードとイメージツーツールリーク (P3, P4) をトレース/データフロー依存として達成した。
推奨硬化を適用することで、Tier-1のすべての結果(29~0)を排除し、フレームワークのリスクスコア(10.0~0.0)を平均27行のコード(LOC)で削減する。
最後に、電子メールシステムの挑戦(ツール中毒とパペット攻撃)から19回の予備的なコーパスで、エージェントの物語は63.2%のランと100%のシンクアクションランで痕跡証拠から分岐し、トレースベースの監査と回帰テストの動機となった。
全体として、Pitfall Labは現実的なマルチベクタ条件下でのMPPツールサーバの実用的でエンドツーエンドのアセスメントとハードニングを可能にする。
関連論文リスト
- Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - ShieldNet: Network-Level Guardrails against Emerging Supply-Chain Injections in Agentic Systems [56.613157564882925]
悪意のある行動は、一見良心的なツールに埋め込まれ、エージェントの実行を静かにハイジャックしたり、機密データをリークしたり、無許可のアクションをトリガーしたりする。
影響は拡大しているが、このような脅威を評価するための包括的なベンチマークは今のところ存在しない。
実ネットワークの相互作用を観測してサプライチェーン中毒を検出するネットワークレベルのガードレールフレームワークであるShieldNetを提案する。
論文 参考訳(メタデータ) (2026-04-06T05:15:00Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - MCPTox: A Benchmark for Tool Poisoning Attack on Real-World MCP Servers [12.669529656631937]
MCPToxは,現実的なMCP設定において,ツールポジショニングに対するエージェントの堅牢性を評価する最初のベンチマークである。
MCPToxは、数ショットの学習によって1312の悪意のあるテストケースの包括的なスイートを生成し、潜在的なリスクの10のカテゴリをカバーする。
評価の結果,o1-miniで72.8%の攻撃成功率を達成したツールポイジングの脆弱性が広く報告されている。
論文 参考訳(メタデータ) (2025-08-19T10:12:35Z) - LiveMCPBench: Can Agents Navigate an Ocean of MCP Tools? [50.60770039016318]
モデルコンテキストプロトコル(MCP)エージェントをベンチマークする最初の総合ベンチマークであるLiveMCPBenchを紹介する。
LiveMCPBenchは、MPPエコシステムに根ざした95の現実世界のタスクで構成されている。
評価は10の先行モデルを対象としており、最高の性能のモデルが78.95%の成功率に達した。
論文 参考訳(メタデータ) (2025-08-03T14:36:42Z) - Model Context Protocol (MCP) at First Glance: Studying the Security and Maintainability of MCP Servers [16.794115541448758]
Anthropicは2024年後半にこのツールエコシステムを標準化するためにModel Context Protocol (MCP)を導入した。
採用にもかかわらず、MPPのAI駆動の非決定論的制御フローは、持続可能性、セキュリティ、保守性に対する新たなリスクをもたらす。
我々は1,899のオープンソースMPPサーバを評価し,その健全性,セキュリティ,保守性を評価した。
論文 参考訳(メタデータ) (2025-06-16T14:26:37Z) - Backdoor Cleaning without External Guidance in MLLM Fine-tuning [76.82121084745785]
Believe Your Eyes (BYE)は、アテンションエントロピーパターンを自己教師信号として活用して、バックドアサンプルを特定してフィルタリングするデータフィルタリングフレームワークである。
クリーンタスクのパフォーマンスを維持しながら、ほぼゼロの攻撃成功率を達成する。
論文 参考訳(メタデータ) (2025-05-22T17:11:58Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。