論文の概要: FlowGuard: From Signals to Evidence for MCP Security Detection
- arxiv url: http://arxiv.org/abs/2607.14754v1
- Date: Thu, 16 Jul 2026 09:41:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.05492
- Title: FlowGuard: From Signals to Evidence for MCP Security Detection
- Title(参考訳): FlowGuard: MCPセキュリティ検出のシグナルから証拠へ
- Abstract要約: 既存の MCP セキュリティスキャナは、実際の実行動作よりも、疑わしいセマンティックな信号が原因である。
本稿では,エビデンスを基盤としたMPPセキュリティ検出システムであるFlowGuardを紹介する。
FlowGuardは、セマンティックリスクトリアージ、再誘導ペイロードの絞り込み、スキーマ検証プローブ生成、エビデンス判断、履歴ガイダンスの洗練を組み合わせている。
- 参考スコア(独自算出の注目度): 8.10377792151691
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: The Model Context Protocol (MCP) enables LLM agents to interact with external tools through metadata exchange, tool invocation, and response consumption. Existing MCP security scanners primarily reason about suspicious semantic signals rather than real execution behaviors, which can lead to unreliable risk assessment. For example, credential-like strings may simply be placeholders rather than actual leakage. This gap requires runtime evidence for execution-related risks and careful semantic analysis for risks carried in metadata or returned content. We present FlowGuard, an evidence-grounded MCP security detection system. FlowGuard combines semantic risk triage, recon-guided payload narrowing, schema-valid probe generation, evidence adjudication, and history-guided refinement. It verifies execution-related risks through runtime evidence and detects semantic risks in tool metadata and returned content. We evaluate FlowGuard on an executable benchmark containing 1,880 MCP cases across five vulnerability categories. FlowGuard achieves F1 scores of 0.879 and 0.942 on the execution-related Command Injection and File System Access categories, respectively. Compared with existing dynamic scanners, FlowGuard reduces end-to-end latency by up to 2.23x. In the real-world evaluation, FlowGuard reports 523 findings across 326 servers. These results show that evidence-grounded detection can assess both execution-related and semantic risks in MCP interactions.
- Abstract(参考訳): Model Context Protocol (MCP)は、LCMエージェントがメタデータ交換、ツール呼び出し、レスポンス消費を通じて外部ツールと対話できるようにする。
既存のMCPセキュリティスキャナは、実際の実行行動ではなく、疑わしいセマンティックシグナルを原因としており、信頼性の低いリスク評価につながる可能性がある。
例えば、クレデンシャルのような文字列は、実際のリークではなく、単にプレースホルダーである。
このギャップは、実行に関連するリスクのランタイムエビデンスと、メタデータや返却されたコンテンツで実行されるリスクの慎重なセマンティック分析を必要とする。
本稿では,エビデンスを基盤としたMPPセキュリティ検出システムであるFlowGuardを紹介する。
FlowGuardは、セマンティックリスクトリアージ、再誘導ペイロードの絞り込み、スキーマ検証プローブ生成、エビデンス判断、履歴ガイダンスの洗練を組み合わせている。
実行関連のリスクをランタイムエビデンスを通じて検証し、ツールメタデータと返却されたコンテンツのセマンティックリスクを検出する。
FlowGuardを5つの脆弱性カテゴリにまたがる1,880のMCPケースを含む実行可能なベンチマークで評価した。
FlowGuardは実行に関連するコマンドインジェクションとファイルシステムアクセスのカテゴリでそれぞれ0.879と0.942のF1スコアを達成している。
既存の動的スキャナと比較して、FlowGuardはエンドツーエンドのレイテンシを最大2.23倍に削減する。
実世界の評価では、FlowGuardが326サーバにわたる523の調査結果を報告している。
これらの結果は,MSP相互作用における実行関連リスクと意味的リスクの両方を評価することができることを示す。
関連論文リスト
- LMSM: LLM Security Framework Inspired by Linux Security Modules [56.93644694627783]
大規模言語モデル(LLM)は階層化されたディフェンスでデプロイされることが多いが、悪意のあるプロンプトはそれらをバイパスすることができる。
我々は,Language Model Security Modules (LMSM) という,Linux Security Modules (LSM) の背後にある分離を LLM サービスに適応させるセキュリティフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-26T12:13:05Z) - StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing [80.39644823192113]
StepGuardは、完了したエージェントの軌跡を監査し、実行前にツールアクションをチェックするステップレベルのガードモデルである。
StepGuardは、GPT-5.4に匹敵するパフォーマンスで、オープンウェイトガードモデルの中で最高の平均精度を達成した。
AgentDojoとAgentDynのエージェントを保護するために使用される場合、StepGuardは平均攻撃成功率を77.3%削減する。
論文 参考訳(メタデータ) (2026-08-25T16:17:27Z) - Token-Flow Firewall: Semantic Runtime Auditing for Persistent AI Agents [76.4694046738862]
TokenWallは、エージェントトークンフローのセマンティックファイアウォールとして機能するランタイム防衛フレームワークである。
TokenWallは攻撃成功率を12.5%に抑えつつ、97.4%の良質なパスレートを維持している。
論文 参考訳(メタデータ) (2026-07-09T12:18:40Z) - Unsafe by Flow: Uncovering Bidirectional Data-Flow Risks in MCP Ecosystem [8.214897650566494]
モデルコンテキストプロトコル(MCP)は、LCMエージェントと外部ツールのインターフェース層として急速に成長しています。
要求制御された引数は機密操作に伝播しうるが、信頼できない外部または機密な内部データが表面化する。
MCP-BiFlowは,MPP対応のエントリポイントリカバリ,プロトコル固有のテナントモデリング,および相互の伝搬解析を中心に構築された静的解析フレームワークである。
論文 参考訳(メタデータ) (2026-05-08T15:03:51Z) - AgentTrust: Runtime Safety Evaluation and Interception for AI Agent Tool Use [2.9991161518367875]
AgentTrustは実行前にエージェントツールコールをインターセプトし、構造化されたバリデーションを返す。
6つのリスクカテゴリにまたがる300-scenarioベンチマークと、630が独立して構築された現実世界の敵シナリオです。
パッチされたルールセットで評価された630秒のベンチマークでは、AgentTrustは96.7%の精度を達成している。
論文 参考訳(メタデータ) (2026-05-06T11:38:16Z) - TraceScope: Interactive URL Triage via Decoupled Checklist Adjudication [14.375064108289115]
私たちは、このワークフローを大規模に運用する、分離されたトリアージパイプラインであるTraceScopeを紹介します。
サンドボックス操作エージェントは、オブザーバ効果を防止し、安全性を確保するため、ページ動作を誘発する視覚的モチベーションによってガイドされた実際のGUIブラウザを駆動する。
MITRE ATT&CKチェックリストを検証するために要求の証拠を照会し、妥協の指標(IOC)を抽出した監査可読レポートを生成する。
我々の評価によると、TraceScopeは現実世界のシナリオでも優れた性能を示し、最先端の防御が特定できない高度なフィッシングの試みをうまく検出する。
論文 参考訳(メタデータ) (2026-04-23T16:31:42Z) - ShieldNet: Network-Level Guardrails against Emerging Supply-Chain Injections in Agentic Systems [56.613157564882925]
悪意のある行動は、一見良心的なツールに埋め込まれ、エージェントの実行を静かにハイジャックしたり、機密データをリークしたり、無許可のアクションをトリガーしたりする。
影響は拡大しているが、このような脅威を評価するための包括的なベンチマークは今のところ存在しない。
実ネットワークの相互作用を観測してサプライチェーン中毒を検出するネットワークレベルのガードレールフレームワークであるShieldNetを提案する。
論文 参考訳(メタデータ) (2026-04-06T05:15:00Z) - Agent Audit: A Security Analysis System for LLM Agent Applications [8.09697219899781]
Agent Auditは、LLMエージェントアプリケーションのセキュリティ分析システムである。
Pythonエージェントのコードとデプロイアーティファクトをエージェント認識パイプラインを通じて分析する。
6つの偽陽性を持つ40の脆弱性を検出し、一般的なSASTベースラインに対するリコールを大幅に改善する。
論文 参考訳(メタデータ) (2026-03-24T06:44:51Z) - Beyond Input Guardrails: Reconstructing Cross-Agent Semantic Flows for Execution-Aware Attack Detection [32.301679396929536]
静的な入力フィルタリングから実行対応分析へ、防御パラダイムをシフトするフレームワークであるSysNameを提案する。
SysNameは断片化された操作プリミティブを連続した行動軌跡に合成し、システムアクティビティの全体像を可能にする。
実証的な評価により、SysNameは10以上の異なる複合攻撃ベクトルを効果的に検出し、それぞれノードレベルとパスレベルのエンドツーエンド攻撃検出に対して85.3%と66.7%のF1スコアを達成した。
論文 参考訳(メタデータ) (2026-03-04T01:59:16Z) - Malice in Agentland: Down the Rabbit Hole of Backdoors in the AI Supply Chain [82.98626829232899]
自分自身のインタラクションからのデータに対する微調整のAIエージェントは、AIサプライチェーン内の重要なセキュリティ脆弱性を導入している。
敵は容易にデータ収集パイプラインに毒を盛り、検出しにくいバックドアを埋め込むことができる。
論文 参考訳(メタデータ) (2025-10-03T12:47:21Z) - BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks [58.959622170433725]
BlindGuardは、攻撃固有のラベルや悪意のある振る舞いに関する事前の知識を必要とせずに学習する、教師なしの防御方法である。
BlindGuardはマルチエージェントシステムにまたがる多様な攻撃タイプ(即時注入、メモリ中毒、ツール攻撃)を効果的に検出する。
論文 参考訳(メタデータ) (2025-08-11T16:04:47Z) - DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents [52.92354372596197]
大規模言語モデル(LLM)は、強力な推論と計画能力のため、エージェントシステムの中心となってきています。
この相互作用は、外部ソースからの悪意のある入力がエージェントの振る舞いを誤解させる可能性がある、インジェクション攻撃のリスクも引き起こす。
本稿では,信頼に値するエージェントシステムのための動的ルールベースの分離フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-13T05:01:09Z) - Defeating Prompt Injections by Design [79.00910871948787]
CaMeLは、Large Language Modelsを中心とした保護システムレイヤを作成する堅牢なディフェンスである。
CaMeLは、(信頼された)クエリから制御とデータフローを明示的に抽出する。
セキュリティをさらに改善するため、CaMeLは、権限のないデータフロー上のプライベートデータの流出を防止する機能の概念を使用している。
論文 参考訳(メタデータ) (2025-03-24T15:54:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。