論文の概要: Labels Are Not Endpoints: Treatment Leakage and Construct Validity in MCP Agent Security Evaluation
- arxiv url: http://arxiv.org/abs/2608.12880v1
- Date: Thu, 13 Aug 2026 06:44:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.415934
- Title: Labels Are Not Endpoints: Treatment Leakage and Construct Validity in MCP Agent Security Evaluation
- Title(参考訳): ラベルは終点ではない:MCPエージェントのセキュリティ評価における漏洩処理と妥当性構築
- Authors: Rana Muhammad Ahmed, Sabahat Abbas,
- Abstract要約: 10,200行の実行行を180のモデルバウンドリクエスト,45のセマンティックリクエスト,15の観測可能な刺激にトレースすることで,保存されたキャンペーンを監査する。
我々は、7リンクの積分チェインと、スコープ境界の終端積分linterをコントリビュートする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Security evaluations of tool-using agents often equate stored labels with behavioral facts. We audit a preserved campaign by tracing 10,200 execution rows to 180 model-bound requests, 45 semantic requests, and 15 observable stimuli. Two schema treatments were delivered, but the planned external payload-family corpus was not. The historical grader exhibited direct treatment leakage: treatment metadata gated the ATTACK_SUCCESS class, so fixed behavior could change class under treatment relabeling. A treatment-blind reconstruction corrects 58 historical ATTACK_SUCCESS or HIJACK_ATTEMPT labels to authorized benign completions while preserving three verified protected-data transfers and one separate unauthorized-forwarding case. The locked v2 census contains exactly zero ATTACK_SUCCESS records, while the forwarding case remains a HIJACK_ATTEMPT at a semantic boundary concerning objective completion. A dual-reviewer blinded concordance review of all 96 requests deemed structurally interpretable by locked v2 produced identical reviewer-consensus classes but differed from the locked codebook on four construct-boundary cases. We contribute a seven-link Integrity Chain and an executable, scope-bounded endpoint-integrity linter. The result is a campaign-bounded measurement audit, not a population attack-rate, model-ranking, defense-efficacy, or causal estimate.
- Abstract(参考訳): ツール使用エージェントのセキュリティ評価は、しばしば行動的事実と格納されたラベルを一致させる。
10,200行の実行行を180のモデルバウンドリクエスト,45のセマンティックリクエスト,15の観測可能な刺激にトレースすることで,保存されたキャンペーンを監査する。
2つのスキーマ処理が行われたが、計画された外部ペイロードファミリーコーパスは提供されなかった。
治療メタデータはATTACK_SUCCESSクラスをアクティベートするので、修正された振る舞いは治療の緩和の下でクラスを変更する可能性がある。
ATTACK_SUCCESSまたはHIJACK_ATTEMPTラベル58を、3つの認証された保護されたデータ転送と1つの別個の許可されていないフォワードケースを保持しながら、認証された良性補完に補正する。
ロックされたv2国勢調査は、正確にはATTACK_SUCCESSレコードを含まないが、フォワードケースは、目的の完了に関するセマンティック境界においてHIJACK_ATTEMPTのままである。
ロックされたv2によって構造的に解釈可能であると判断された96件の全ての要求に対して、デュアルリビューア・ブラインドされたコンコータンス・レビューは、同じレビュア・コンセンサス・クラスを生成するが、4つのコンストラクト境界ケースのロックされたコードブックとは異なる。
我々は、7リンクの積分チェインと、スコープ境界の終端積分linterをコントリビュートする。
結果は、集団攻撃率、モデルレベル、防衛効果、因果推定ではなく、キャンペーンバウンドで測定された監査である。
関連論文リスト
- Mind the Hook: Source-Level Auditing of Privacy Defenses in Retrieval-Augmented Generation [0.30586855806896046]
検索強化世代(RAG)のブラックボックスのプライバシスコアは、ディフェンスのアクティブパイプラインフックが不明でない限り、解釈が困難である。
提案するアクティブパス監査は,検索,検索,検索,生成に対するインベントリソースレベルのフック,各メトリックを観測するリークチャネルにマッピング,正確なマッチカナリアによる生成テキスト効果の検証である。
論文 参考訳(メタデータ) (2026-08-10T01:40:25Z) - What Can Be Enforced? A Theory of Certified Runtime Safety for Tool-Using Agents [0.0]
ガードレールは不可逆のツールコールの前に動作しますが、その保証は、どのポリシー状態が表現可能であるかによって異なります。
ピアソン表現攻撃はマージンを増すので、良性校正だけでは移動しない。
実験は静的診断、制御モデル列挙、表現書き直し、ペア化された閉ループ再実行を通じてこれらの区別を目標とする。
論文 参考訳(メタデータ) (2026-07-24T19:14:26Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Agent-Safety Evaluations as Load-Bearing Evidence: A Vendor-Neutral, Cross-Harness Reconstructability Metric [0.0]
ベンダーニュートラルでランナブルな計器は、評価妥当性の指標として再構成可能性を示すものはない。
本稿では,8つの意思決定クラスに対する特性レベルの再構成可能性指標を提案する。
論文 参考訳(メタデータ) (2026-07-14T07:54:37Z) - Beyond Attack-Success Rate: Action-Graded Severity Scale for Tool-Using AI Agents [0.0]
エージェントのレッドチームベンチマークは、インジェクトされたエージェントが単一ビットとして侵入されたかどうかを報告している。
このバイナリ・アタック・サクセス・レートは、ディフェンダーが最も必要とする情報、すなわち、結果として生じるアクションがどれほど有害であるかを破棄する。
本研究では,7段階の順序尺度(L0〜L6)でエージェントのツールコール軌跡をスコアし,実行された動作が可逆性であったか,他者への到達範囲を超えたか,特権を拡大したかに応じて,アクショングレード調和ルーリックを導入する。
論文 参考訳(メタデータ) (2026-07-08T14:38:01Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - The Misattribution Gap: When Memory Poisoning Looks Like Model Failure in Agentic AI Systems [1.0262304700896199]
EmphSemantic Norm Drift (SND) をエージェント不正行為の第3の経路として定式化する。
SNDでは、ポリシーフォーマットの文書が通常のアップロードを通じて共有ベクターストアに入り、その後、信頼されたシステムコンテキストとして再現れる。
偽合成検査は87.5%の精度と偽陽性のゼロの因果関係を識別する。
論文 参考訳(メタデータ) (2026-05-12T20:21:47Z) - TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning [60.68349524623048]
分解されたジェイルブレイクは、大きな言語モデルにとって重大な脅威となる。
我々はステートフルなデュアルエンコーダ防御フレームワークであるTwinGateを紹介する。
我々は、8600の異なる悪意のある意図にまたがる360万以上の命令の包括的なデータセットを構築した。
論文 参考訳(メタデータ) (2026-04-30T13:44:01Z) - INSURE-Dial: A Phase-Aware Conversational Dataset & Benchmark for Compliance Verification and Phase Detection [40.157413213893165]
年間約1兆米ドルの電話が米国の医療から排水されている。
我々は、コンプライアンス対応音声エージェントの開発と評価のための最初の公開ベンチマークであるINSURE-Dialを紹介する。
論文 参考訳(メタデータ) (2026-01-28T17:27:49Z) - Detecting Adversarial Fine-tuning with Auditing Agents [38.964973163076586]
本稿では, モデル展開前に有害な微調整を検知できることを実証し, 微調整監査エージェントの概念を紹介する。
文献からの8つの強力な微調整攻撃と5つの良質な微調整モデルに対する検出手法の評価を行った。
最も有望なのは、データセットの安全性評価とコンテンツモデレーションを回避する隠蔽暗号攻撃を検出することができることだ。
論文 参考訳(メタデータ) (2025-10-17T23:01:16Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。