論文の概要: COPEX: Benchmarking LLM Robustness to Adversarial Context Across Model Context Protocol Layers
- arxiv url: http://arxiv.org/abs/2610.04378v1
- Date: Sat, 03 Oct 2026 08:44:20 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:40:37.75657
- Title: COPEX: Benchmarking LLM Robustness to Adversarial Context Across Model Context Protocol Layers
- Title(参考訳): COPEX:モデルコンテキストプロトコル層間の逆コンテキストに対するLCMロバストネスのベンチマーク
- Abstract要約: 大規模言語モデルは、モデルコンテキストプロトコル(MCP)システムにおけるツールの使用をますます仲介する。
既存のベンチマークでは、デプロイされたエージェント、ガードレールによるモデルの感受性の混在、オーケストレーション、一般的なタスク能力を評価している。
周辺エージェントスタックを固定し,ツール選択モデルのみを変更することでモデルをMPPクライアントとして分離するベンチマークであるCOPEXを導入する。
- 参考スコア(独自算出の注目度): 2.933308760339497
- License:
- Abstract: Large language models increasingly mediate tool use in Model Context Protocol (MCP) systems, where adversarial influence may enter through user instructions, tool schemas, tool outputs, or protocol messages. Existing benchmarks often evaluate deployed agents, conflating model susceptibility with guardrails, orchestration, and general task capability. We introduce COPEX (COntext Provider EXploitation), a controlled benchmark that isolates the model as an MCP client by fixing the surrounding agent stack and varying only the tool-selecting model. COPEX covers 25 attack types instantiated as 125 scenarios across four entry surfaces: model/agent, client, server/tool, and transport. Across nine models and 3,375 trials, the mean attack success rate is 64.4%, with surface-level means ranging from 58.3% to 71.4%. Some client- and transport-level attacks succeed partly outside the model's observation or control, separating system exposure from model susceptibility. Combined input and context scanning reduces mean attack success by 49.6% on an eight-attack defense subset relative to the undefended setting. The benchmark is available at https://github.com/inspire-center/copex.
- Abstract(参考訳): 大規模言語モデルは、ユーザインストラクション、ツールスキーマ、ツールアウトプット、プロトコルメッセージを通じて敵の影響が入力されるモデルコンテキストプロトコル(MCP)システムにおいて、ツールの使用を仲介するようになっている。
既存のベンチマークでは、デプロイされたエージェントを評価し、ガードレールやオーケストレーション、一般的なタスク能力とモデルの感受性を混同することが多い。
COPEX(COntext Provider Exploitation)は,周辺エージェントスタックを固定し,ツール選択モデルのみを変更することでモデルをMCPクライアントとして分離する制御ベンチマークである。
COPEXは、モデル/エージェント、クライアント、サーバ/ツール、トランスポートの4つのエントリサーフェスで125のシナリオでインスタンス化された25の攻撃タイプをカバーする。
9つのモデルと3,375回の試験で、平均攻撃成功率は64.4%であり、表面レベルは58.3%から71.4%である。
クライアントレベルの攻撃やトランスポートレベルの攻撃は、部分的にモデルの監視や制御の外で成功し、システムの露出とモデルの感受性を分離する。
入力とコンテキストスキャンを組み合わせることで、無防備な設定に対する8攻撃の防衛サブセットにおいて平均攻撃成功率は49.6%削減される。
ベンチマークはhttps://github.com/inspire-center/copex.comで公開されている。
関連論文リスト
- Evaluating and Improving the Robustness of Large Language Models to Input Sequence Variations [0.0]
この論文は、逆入力シーケンスの変動に対するロバスト性の評価と改善のためのモデル、方法、アルゴリズムを開発する。
局所攻撃に対しては、V(h) = 1 - R_class(h) を証明し、ここで R_class(h) は、決定演算子 h がその決定を小さな摂動の下で保持する確率である。
非局所攻撃に対しては経験的モデルを提案する。
論文 参考訳(メタデータ) (2026-10-01T19:57:56Z) - A Large-Scale Benchmark and Risk Assessment of Traffic Analysis Attacks on Cloud LLM Services [3.8957143647621515]
クラウドベースの大規模言語モデルサービスは、暗号化にもかかわらずモデル、プロンプト、タスクの振る舞いを公開できるネットワークレベルのトラフィックサイドチャネルを作成する。
ユーザ間での暗号化トラフィックの統一計測と公開ベンチマークを,LLMとマルチエージェントで実施した。
論文 参考訳(メタデータ) (2026-09-25T18:13:58Z) - A2M: Trace-Optimized Agent Hijacking in the MCP Ecosystem [34.790079806241366]
MCPハイジャックエージェントのための2段階ブラックボックスフレームワークであるA2M(Attraction-to-Manipulation)を紹介する。
LiveMCPBenchでは、GLM-4.6で最適化され評価されたダイレクトアタックは、マクロ平均悪質なツール呼び出し率93.6%を達成する。
これらの知見は、MCPエコシステムにおけるより強力なツールベッティングと実行時の分離を動機付けている。
論文 参考訳(メタデータ) (2026-09-22T17:41:34Z) - AgentWeave: Routing Before Reasoning for Efficient Function Calling in Tool-Rich Language Models [0.0]
我々は,有界モデル可視アクション空間を構成する決定論的事前推論ルーティング層であるAgentWeaveを紹介する。
オールツールの露出とは対照的に、AgentWeaveは70.18%のツールを減らし、61.70%の入力トークンを減らし、平均的なローカルモデルのレイテンシを50.95%低下させる。
論文 参考訳(メタデータ) (2026-08-24T10:38:08Z) - ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents [61.184954205350984]
ClawArena-Teamは、41のマルチターン、マルチモーダル、マルチエージェントシナリオのベンチマークである。
全体的なスコア -- Subagent-Management Score (SMS) -- は、タスクの正しさを最小限のプライマリとモダリティのルーティング因子によって乗算する。
論文 参考訳(メタデータ) (2026-06-30T06:06:08Z) - TSCG: Deterministic Tool-Schema Compilation for Agentic LLM Deployments [0.0]
生産エージェントフレームワークは、言語モデルによる解釈ではなく、機械解析用に設計されたフォーマットであるMPPとしてツールスキーマを送信する。
小型モデル(4B-14B)では、このプロトコルのミスマッチが、本番サイズでのツール使用障害の大部分の原因となっている。
本稿では,このミスマッチをAPI境界で解決する決定論的ツールスキーマコンパイラTSCGを提案する。
論文 参考訳(メタデータ) (2026-05-04T15:35:45Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - Text Adversarial Attacks with Dynamic Outputs [63.25160580569707]
テキスト逆攻撃法は典型的には、固定数の出力ラベルと予め定義されたラベル空間を持つ静的シナリオのために設計される。
本稿では,クラスタリングに基づく代理モデルトレーニング手法を用いたテキスト動的出力攻撃(TDOA)手法を提案する。
テキスト毎の単一のクエリで、TDOAは最大攻撃成功率は50.81%に達する。
我々は TDOA を生成環境に拡張し,0.64 RDBLEU と 0.62 RDchrF の先行結果を上回った。
論文 参考訳(メタデータ) (2025-09-26T14:21:46Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z) - No Query, No Access [50.18709429731724]
被害者のテキストのみを使用して動作する textbfVictim Data-based Adrial Attack (VDBA) を導入する。
被害者モデルへのアクセスを防止するため、公開されている事前トレーニングモデルとクラスタリングメソッドを備えたシャドウデータセットを作成します。
EmotionとSST5データセットの実験によると、VDBAは最先端の手法より優れており、ASRの改善は52.08%である。
論文 参考訳(メタデータ) (2025-05-12T06:19:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。