論文の概要: Registry Descriptions Go Stale Unevenly: An 89-Day Measurement of Model Context Protocol Drift, and Why Drift-Ranked Re-Auditing Under-Covers It
- arxiv url: http://arxiv.org/abs/2608.00997v1
- Date: Sun, 02 Aug 2026 04:54:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.048495
- Title: Registry Descriptions Go Stale Unevenly: An 89-Day Measurement of Model Context Protocol Drift, and Why Drift-Ranked Re-Auditing Under-Covers It
- Title(参考訳): 89日間のモデルコンテキストプロトコルのドリフト測定と、なぜドリフトによる再監査を行うのか
- Abstract要約: Model Context Protocol (MCP)エコシステムのセキュリティ研究は、設計を共有している。
評価対象の監査がいつまで継続されているかは報告されていない。
我々は、公式MSPレジストリの120の観測を88.6日間にわたって再構築し、3,510から18,966に成長する19,099の異なるサーバをカバーした。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Security studies of the Model Context Protocol (MCP) ecosystem share a design: each audits a registry at a single point in time. None reports how long the registry descriptions those audits judged stay current - a necessary condition for any description-level finding to still apply, though not a sufficient one: we measure the shelf-life of the audited text, not the validity of a security finding itself (Sec. 7.1). We reconstruct 120 observations of the official MCP registry over 88.6 days, covering 19,099 distinct servers as it grew from 3,510 to 18,966. Our central result is a policy one: you cannot keep description-level findings current by re-auditing the servers that drift most. At a top-5% re-audit budget, ranking by prior drift catches only ~20% of the previously-seen servers whose description changes in a held-out window - versus ~27% for descriptor drift overall - and only ~10% of all description changers. The limit is not unpredictability: the ranking still buys ~4x lift. It is that the description surface is sparse - 8.6% of servers ever rewrite one, against 24.8% for descriptors - and that roughly half of all description changes land on new arrivals a history ranking cannot reach, so the same lift buys far less coverage. The control that fits is content-binding - revalidate the moment a description's hash moves - plus a sized periodic full-catalog sweep; a drift-history ranking is at best a partial, blind-to-new-arrivals control. This is scanner hygiene for a description-level auditor, not a runtime trust signal. Of servers observed across at least ten intervals, three-quarters never change, the most active 5% generate 61% of all change events, and only 11.9% of a cohort's descriptors change within 30 days; naive compounding predicts 35.8% at 30 days (73% at 89), a heavy-tail overestimate we use only as a diagnostic. We release the panel, figure generator, and analysis code.
- Abstract(参考訳): Model Context Protocol (MCP)エコシステムのセキュリティ研究は、設計を共有している。
記録されたテキストのシェルフライフを、セキュリティ発見自体の妥当性ではなく計測する(Sec.1)。
我々は、公式MSPレジストリの120の観測を88.6日間にわたって再構築し、3,510から18,966に成長する19,099の異なるサーバをカバーした。
私たちの中心的な成果はポリシーであり、最も漂流するサーバを再監査することで、説明レベルの発見を現在の状態に保つことはできません。
トップ5%の再監査予算では、事前のドリフトによるランク付けは、保持されたウィンドウに記述が変更されているサーバの約20%、ディスクリプタ全体の27%、すべての記述チェンジャの約10%しかキャッチできない。
限界は予測不可能ではなく、ランキングは依然として4倍ほど上昇している。
記述面はわずかであり、サーバの8.6%が書き直しを行い、ディスクリプタの24.8%が書き直された。
適合するコントロールはコンテントバインディング(content-binding) – 記述のハッシュが動く瞬間を無効にする – と、サイズの周期的なフルカタログスイープ – である。
これは、ランタイム信頼信号ではなく、記述レベルの監査者のためのスキャナ衛生である。
少なくとも10回の間隔で観測されたサーバのうち、3/4は変化せず、最もアクティブな5%は全変更イベントの61%を発生し、コホートのディスクリプタの11.9%は30日以内に変化する。
パネル、フィギュアジェネレータ、分析コードをリリースします。
関連論文リスト
- Same Name, Different Server: A Security Census of Silent Drift in the Model Context Protocol Ecosystem [0.0]
Model Context Protocol (MCP) は、大規模な言語モデルアプリケーションが外部ツールに到達するための共通インターフェースとなっている。
本稿は、その生態系の国勢調査を報告する。
論文 参考訳(メタデータ) (2026-09-12T19:47:32Z) - NovaFabric: Tamper-Evident, Replayable Evidence for Autonomous AI Agent Runs [0.0]
我々はNovaFabricを紹介し、監査グレードの実行証拠を作成している。
エージェントロジックを変更することなく実行中のエージェントを、ポータブルなRun Capsuleに記録する。
シードランは4モードのリプレイプロトコルで再実行可能である。
我々は8つの研究課題を測定範囲で評価した。
論文 参考訳(メタデータ) (2026-09-11T08:35:43Z) - When Agent Metrics Measure Different Things: An Evidence-Grounded Audit of the Praxa AI Pipeline [0.0]
本稿では,選択したPraxa AI実装ファイル,過去の評価アーティファクト,運用記録の振り返り評価を行う。
139ケースのオフラインルーティングレポートには、112回のパスと27回の障害が含まれている。
記録された99番目のパーセンタイルは2,147,483,647 msであり、サーバが保存したコールのうち38,118.31 msである。
論文 参考訳(メタデータ) (2026-09-10T07:55:12Z) - RobustSGPO: Search-Space Control for Agent Harness Evolution [56.722805974785125]
我々は、要求された編集、構成、パッチのチェックを指定し、既存のスナップショットまたは保持スナップショットからの検索を継続するRobustSGPOを紹介した。
我々は,120タスク,95ラン,7350の候補を用いて,AgentXブレインストーミングワークフローにおけるパーミッションスケジューリング,累積制御,タスクファミリー転送を評価した。
論文 参考訳(メタデータ) (2026-09-09T03:00:03Z) - CURA: Certified Runtime Alarms for Computer-Use Agents [6.896160570537455]
セルフレポートは、デプロイが持つ最も安価な監視チャネルであり、有能なコンピュータ使用エージェントでは、監視が重要な場所を正確に失敗する。
361 OSWorldでは、当社のパイプライン、読み取り専用実現ゲート、プランナー、エグゼキュータが、平均タスクスコア82.9に達し、72.4人の参照を上回ります。
71の障害のうち64件(90%)は成功の主張で終わるが、約9100回の呼び出しで明確な失敗の余裕がないことを認めている。
Alarm-gated Mid-execution oversightが障害70件中23件をリカバリし、38日にフロンティア監視機を使用
論文 参考訳(メタデータ) (2026-08-28T00:50:47Z) - ADeptS-Bench: Measuring the Trustworthiness of Computer Use Agents Across Devices [48.36933831982682]
我々はADEPTS機能フレームワークを基盤とした信頼性ベンチマークであるADeptS-Benchを紹介する。
Safetyストリームは、視覚インターフェースに埋め込まれた脅威を伴うペアの良心/悪意のあるタスクを提供する。
曖昧さストリームは、意図が曖昧である場合、エージェントが明確化を求めるかどうかを評価する。
論文 参考訳(メタデータ) (2026-08-25T23:21:57Z) - Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents [48.967927222079965]
Ledgerは、エージェントの完了したインタラクションを明示的な実行状態に蒸留するランタイム層である。
Ledgerはこの状態をオンライン実行台帳に保持し、各ステップの2つのバウンダリに適用される。
500のSWE-bench検証インスタンス全体で、LedgerはPass@1を56.2%から64.2%に、GPT-5 miniを75.8%から81.0%に、MiniMax M2.5を81.0%に引き上げている。
論文 参考訳(メタデータ) (2026-08-01T18:25:00Z) - DarwinX: Evolving Agent Harnesses Through Natural Selection [48.64258219266629]
ダーウィンXは自己進化を、モデルが凍結されたハーネスの集団の選択として扱う。
一般的なエージェント能力はベンチマーク固有のパッチではなく、タスク、検証、ベースモデルの変更を生き残る。
論文 参考訳(メタデータ) (2026-07-31T05:34:02Z) - Mean Time to Remediate Is Not a Fielding Model: A Cadence Audit for Enterprise Vulnerability Management [51.56484100374058]
本稿では,企業脆弱性管理のための改善ケイデンス監査について紹介する。
平均ラグ、放出期間、放出率、コホート幾何、緊急/ルーチン分割、非着地遅延、局所残留圧証拠、宣言されたレートシナリオを記録している。
論文 参考訳(メタデータ) (2026-07-05T21:23:26Z) - DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation [50.584834483403675]
新しい視覚概念を学習するか、望ましくないものを消去するか、事前学習したテキスト・画像拡散モデルに適応させることは、意図した効果だけで日常的に評価される。
適応が意味論的に無関係な概念を、構造的にメトリクスを集約することができない方法で体系的に損なうことを実証する。
DriftScopeは、任意の2つのモデルチェックポイントを取り込み、視覚的概念が最も移行したトークンのランクリストを返す、プロンプトレベルの診断ツールである。
論文 参考訳(メタデータ) (2026-06-30T20:57:51Z) - Auditing Generalization in AI-Generated Video Detection: A Six-Control Protocol and the VidAudit Toolkit [8.665845754660458]
AI生成ビデオ検出のGenVidBenchとAIGVDBenchが事実上のリーダーボードだ。
ほとんどの評価プロトコルは、報告された一般化を拡大できる制御されていない欠点を残している。
20紙の調査では、これをキャッチする標準的な6つのコントロールをすべて適用していない。
それらを監査プロトコルに組み合わせて、6つの代表的な特徴源に適用する。
論文 参考訳(メタデータ) (2026-06-30T00:29:53Z) - Self-Conditioned Positional HNSW for Overlap-Aware Retrieval in Chunked-Document RAG Systems: Method and Industrial Evidence-Quality Audit [0.0]
チャンク文書検索は、検索拡張生成システム(RAG)の一般的なコンポーネントである。
本稿では,低次元の位置符号をチャンク埋め込みに付加する軽量な修正法であるSelf-Conditioned Positional HNSWを提案する。
論文 参考訳(メタデータ) (2026-06-01T01:42:55Z) - Hierarchical Online Prompt Mutation with Dual-Loop Feedback for Guardrailed Evidence Document Generation: A Production-Evaluation Case Study [0.0]
HOPMは階層的なオンラインプロンプト突然変異フレームワークである。
本論文は、制御設定、サンプルサイズ、信頼区間、ペアテスト、プロンプトトークンカテゴリ、擬似コード、スキーマ、ルーリック、ガードレール分類、構築された例を含む。
論文 参考訳(メタデータ) (2026-05-31T22:17:44Z) - Reading Task Failure Off the Activations: A Sparse-Feature Audit of GPT-2 Small on Indirect Object Identification [0.0]
我々は, GPT-2小火器のスパースオートコーダ(SAE)機能について, 失敗した試験と成功した試験との違いを報告した。
300プロンプトでは、GPT-2小径の精度は79.7%に達し、Bloom (2024)の層8残流SAEリリースの24,576個の特徴のうち146個はホルム補正値の閾値をクリアしている。
17,491, d=+2.93, Neuronpedia label 'cryptographic key' は、プロンプトの転送されたオブジェクトが「キー」である場合を除いて、本質的に静かである。
論文 参考訳(メタデータ) (2026-05-21T16:55:27Z) - Code-Centric Detection of Vulnerability-Fixing Commits: A Unified Benchmark and Empirical Study [4.512751676075442]
本稿では,統合フレームワークによる言語モデルに基づくVFC検出の包括的評価を行う。
コードの変更だけで、モデルが転送可能なセキュリティ関連コードを理解する証拠は見つからない。
グループ階層評価は、ランダムスプリットに比べて約17%のパフォーマンス低下を露呈する。
論文 参考訳(メタデータ) (2026-05-13T08:05:14Z) - How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings [56.70440596502351]
昨年は20以上のオープンドキュメントパースモデルが見られたが、ベンチマークはほぼOmniDocBenchにのみ依存している。
HTML/CSSのドキュメントイメージをレンダリングするベンチマークであるPureDocBenchは、10のドメイン、66ページ、1,475ページをカバーしています。
論文 参考訳(メタデータ) (2026-05-08T09:30:31Z) - ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents [77.22389710754452]
マルチターンマルチデイタスクを中心に構築された同僚エージェントのベンチマークであるベンチを紹介する。
現在のリリースには、13のプロのシナリオにわたる100のタスクが含まれており、5つのステートフルなサンドボックスサービスに対して実行される。
最強のモデルは75.8の重み付きスコアに達するが、最も厳格なタスク成功率は20.0%に過ぎず、部分的な進歩が一般的であることを示している。
論文 参考訳(メタデータ) (2026-04-26T16:05:02Z) - ES-Net: Erasing Salient Parts to Learn More in Re-Identification [46.624740579314924]
画像中の有意領域を消去することで包括的特徴を学習するための新しいネットワーク「Easing-Salient Net (ES-Net)」を提案する。
ES-Netは3つのPerson re-IDベンチマークと2つのVine re-IDベンチマークで最先端の手法より優れています。
論文 参考訳(メタデータ) (2021-03-10T08:19:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。