論文の概要: Governing Dynamic Capabilities: Cryptographic Binding and Reproducibility Verification for AI Agent Tool Use
- arxiv url: http://arxiv.org/abs/2603.14332v1
- Date: Sun, 15 Mar 2026 11:46:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-17 16:19:35.753216
- Title: Governing Dynamic Capabilities: Cryptographic Binding and Reproducibility Verification for AI Agent Tool Use
- Title(参考訳): 動的機能の支配:AIエージェントツール使用のための暗号化バインディングと再現性検証
- Abstract要約: AIエージェントは、MPPとA2Aを介して実行時に機能を動的に取得する。
サイレントな能力エスカレーションを可能にし、EU AI Actトレーサビリティ要件に違反します。
能力バウンドエージェント証明書は、スキルマニフェストハッシュでX.509 v3を拡張する。
検証可能な相互作用台帳は、複数エージェントの法医学的再構築のためにハッシュリンクされた署名された記録を提供する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI agents dynamically acquire capabilities at runtime via MCP and A2A, yet no framework detects when capabilities change post-authorization. We term this the capability-identity gap}: it enables silent capability escalation and violates EU AI Act traceability requirements. We propose three mechanisms. Capability-bound agent certificates extend X.509 v3 with a skills manifest hash; any tool change invalidates the certificate. Reproducibility commitments leverage LLM inference near-determinism for post-hoc replay verification. A verifiable interaction ledger provides hash-linked, signed records for multi-agent forensic reconstruction. We formalize nine security properties and prove they hold under a realistic adversary model. Our Rust prototype achieves 97us certificate verification (<1ns capability binding overhead, ~1,200,000 faster than BAID's zkVM), 0.62ms total governance overhead per tool call (0.1--1.2% of typical latency), and 4.7X separation from cross-provider outputs (Cohen's d > 1.0 on all four metrics), with best classification at F_1=0.876 (Jaccard, θ=0.408); single-provider deployments achieve F_1=0.990 with 11.5 times separation. We evaluate 12 attack scenarios -- silent escalation, tool trojanization, phantom delegation, evidence tampering, collusion, and runtime behavioral attacks validated against NVIDIA's Nemotron-AIQ traces -- each detected with a traceable mechanism, while the MCP+OAuth 2.1 baseline detects none. An end-to-end evaluation over a 5-to-20-agent pipeline with real LLM calls confirms that full governance (G1--G3) adds ~10.8ms per pipeline run (0.12% overhead), scales sub-linearly per agent, and detects all five in-situ attacks with zero false positives.
- Abstract(参考訳): AIエージェントは、MPPとA2Aを介して実行時に機能を動的に取得する。
それはサイレントな能力のエスカレーションを可能にし、EU AI Actトレーサビリティ要件に違反します。
本稿では3つのメカニズムを提案する。
能力バウンドエージェント証明書は、スキルマニフェストハッシュでX.509 v3を拡張し、任意のツールの変更で証明書が無効になる。
再現性へのコミットメントは、ポストホックリプレイ検証にLLM推論をほぼ決定性に活用する。
検証可能な相互作用台帳は、複数エージェントの法医学的再構築のためにハッシュリンクされた署名された記録を提供する。
9つのセキュリティ特性を形式化し、それらが現実的な敵モデルの下で保持されていることを証明します。
我々のRustプロトタイプは97us認証の検証(BAIDのzkVMより約1,200,000高速)、ツールコール毎の総ガバナンスオーバーヘッド(典型的なレイテンシの0.1--1.2%)、クロスプロファイラ出力からの4.7X分離(すべての4つのメトリクスでCohen's d > 1.0)、F_1=0.876(Jaccard, θ=0.408)での最高の分類(Jaccard, θ=0.408)、単一プロファイラデプロイメントは11.5回の分離でF_1=0.990を達成する。
NVIDIAのNemotron-AIQトレースに対して検証された12の攻撃シナリオ – サイレントエスカレーション、ツールトロジャン化、ファントムデリゲーション、エビデンス改ざん、コラシエーション、実行時の動作攻撃 – をトレース可能なメカニズムで検出し、MPP+OAuth 2.1ベースラインは検出しない。
実際のLLMコールを備えた5対20エージェントパイプラインに対するエンドツーエンド評価では、完全なガバナンス(G1-G3)がパイプライン実行毎に10.8ms(オーバーヘッド0.12%)を追加し、エージェント毎にサブ線形にスケールし、偽陽性のない5つのインサイトアタックすべてを検出する。
関連論文リスト
- Zero-Knowledge Predicate Proofs Between AI Agents: A Measured, Cross-Protocol Gateway and the Source-Integrity Gap [0.0]
マルチエージェントAIプラットフォームは、ステージングからプロダクションへ素早く移行するが、エージェントが信頼を確立する方法はまだ初歩的だ。
提案から実行システムまで,エージェント間での検証可能なデータ最小化を行う。
32ビットのしきい値述語は6.2msで証明され、608バイトのBulletproofs証明で1.0msで検証される。
論文 参考訳(メタデータ) (2026-08-30T23:16:17Z) - ADeptS-Bench: Measuring the Trustworthiness of Computer Use Agents Across Devices [48.36933831982682]
我々はADEPTS機能フレームワークを基盤とした信頼性ベンチマークであるADeptS-Benchを紹介する。
Safetyストリームは、視覚インターフェースに埋め込まれた脅威を伴うペアの良心/悪意のあるタスクを提供する。
曖昧さストリームは、意図が曖昧である場合、エージェントが明確化を求めるかどうかを評価する。
論文 参考訳(メタデータ) (2026-08-25T23:21:57Z) - Formal Verification of Agentic Systems over Operational Data [59.98246281888422]
大規模言語モデル(LLM)によって駆動されるエージェントシステムは、永続的な運用データを扱う現実世界にますます展開されている。
既存のアプローチはそのようなシステムレベルの保証を提供していません。
本稿では, 1 つの LLM とツールオーケストレーションハーネスからなるエージェントシステムのリレーショナル操作データに対する検証について述べる。
論文 参考訳(メタデータ) (2026-08-04T13:01:30Z) - Adversarial Attacks in Multi-Agent LLM Pipelines: Unveiling Structural Vulnerabilities in Agentic AI Architectures [4.053243845971823]
マルチエージェントLLMパイプラインは、特殊な言語モデルエージェントを構造化し、中間出力をエージェント間で渡して複雑なタスクを解決する。
この設計では、単一のエージェント設定にないセキュリティギャップが導入されている。
この脆弱性は、エージェント間の境界を越える際に、データの明示的な検証を強制するセキュリティプリミティブである境界検証の欠如に起因している、と私たちは主張する。
論文 参考訳(メタデータ) (2026-08-01T15:35:58Z) - AgentRiskBOM: A Risk-Scoping Security Bill of Materials for Agentic AI Systems [0.519554837386174]
本稿ではリスクスコープツールを用いたAIエージェントのためのセキュリティBOMであるAgentRiskBOMを紹介する。
SBOM、AIBOM、MLBOM上の付加層であり、権威のための権威のあるランタイムフィールドを追加する場所を参照している。
カバレッジ分析により、AgentRiskBOMは16の能力範囲で14のネイティブ等価スコア、SBOMは1、AIBOMは1.5、MLBOMは2のスコアを得る。
論文 参考訳(メタデータ) (2026-06-20T04:38:41Z) - How to Interpret Agent Behavior [56.59836196946289]
本稿では,エージェントの動作を実行時に記述・解析するための分類法であるACT*ONOMYを紹介する。
共用語彙を提供することで、ACT*ONOMYは研究者、エージェントデザイナー、エンドユーザーがエージェントの振る舞いをより一貫して解釈するのに役立つ。
論文 参考訳(メタデータ) (2026-05-13T14:52:40Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - SentinelAgent: Intent-Verified Delegation Chains for Securing Federal Multi-Agent AI Systems [0.0]
本稿では、連邦政府のマルチエージェントAIシステムにおけるデリゲートチェーンの検証のための正式なフレームワークであるSentinelAgentを紹介する。
Delegation Chain Calculus (DCC) は7つの特性を定義している。6つの決定論的(権威の狭さ、ポリシーの保存、法的な再構築性、カスケードの封じ込め、スコープ-アクションの適合性、出力スキーマの適合性)と1つの確率的(インテリジェントな保存)である。
Intent-Preserving Delegation Protocol (I PDP)は、非LLM Delegation Authority Serviceを通じて実行時に7つのプロパティをすべて強制する。
論文 参考訳(メタデータ) (2026-04-03T06:25:18Z) - AEGIS: No Tool Call Left Unchecked -- A Pre-Execution Firewall and Audit Layer for AI Agents [4.963079926145645]
AEGISはAIエージェントのための事前実行ファイアウォールと監査層である。
ツール実行パスに介在し、3段階のパイプラインを適用する。
ハイリスクコールは、人間の承認のために行われ、すべての決定は、未確認の監査証跡に記録される。
論文 参考訳(メタデータ) (2026-03-13T03:49:12Z) - Tool Receipts, Not Zero-Knowledge Proofs: Practical Hallucination Detection for AI Agents [0.0]
NabaOSは対話型エージェントのための軽量な検証フレームワークである。
ソースによってAI応答内のすべてのクレームを分類する。
製造されたツールの実行の94.2%、誤り回数の87.6%、虚偽の欠席債権の78.4%を検知する。
論文 参考訳(メタデータ) (2026-03-09T20:45:41Z) - LDP: An Identity-Aware Protocol for Multi-Agent LLM Systems [0.0]
現在のプロトコルでは、モデルレベルのプロパティを第一級プリミティブとして公開していない。
5つのメカニズムを導入したAIネイティブ通信プロトコルであるLDM Delegate Protocol(LDP)を提案する。
アイデンティティを意識したルーティングは、デリゲートの特殊化によって、簡単なタスクの12倍のレイテンシを実現するが、小さなデリゲートプールの集約品質は向上しない。
論文 参考訳(メタデータ) (2026-03-09T19:13:17Z) - AgentDoG: A Diagnostic Guardrail Framework for AI Agent Safety and Security [126.49733412191416]
現在のガードレールモデルは、リスク診断におけるエージェント的リスク認識と透明性を欠いている。
エージェントリスクをソース(場所)、障害モード(方法)、結果(何)で分類する統合された3次元分類法を提案する。
AgentDoG(AgentDoG)のための,エージェント安全性ベンチマーク(ATBench)と診断ガードレールフレームワークを新たに導入する。
論文 参考訳(メタデータ) (2026-01-26T13:45:41Z) - Zer0n: An AI-Assisted Vulnerability Discovery and Blockchain-Backed Integrity Framework [0.0]
Zer0nは、Large Language Models(LLM)の推論能力をブロックチェーン技術の不変監査パスに固定するフレームワークである。
ロジックベースの脆弱性検出のためにGemini 2.0 ProとAvalanche C-Chainを統合した。
論文 参考訳(メタデータ) (2026-01-11T18:27:52Z) - Context Lineage Assurance for Non-Human Identities in Critical Multi-Agent Systems [0.08316523707191924]
本稿では,アタッチメントのみのメルクル木構造に固定された系統検証のための暗号的基盤機構を提案する。
従来のA2Aモデルとは異なり、本手法ではエージェントと外部検証器の両方が暗号的にマルチホップ前駆体を検証できる。
並行して、A2Aエージェントカードを拡張して、明示的な識別認証プリミティブを組み込むことにより、NHI表現の正当性を確認することができる。
論文 参考訳(メタデータ) (2025-09-22T20:59:51Z) - DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents [52.92354372596197]
大規模言語モデル(LLM)は、強力な推論と計画能力のため、エージェントシステムの中心となってきています。
この相互作用は、外部ソースからの悪意のある入力がエージェントの振る舞いを誤解させる可能性がある、インジェクション攻撃のリスクも引き起こす。
本稿では,信頼に値するエージェントシステムのための動的ルールベースの分離フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-13T05:01:09Z) - Defending against Indirect Prompt Injection by Instruction Detection [109.30156975159561]
InstructDetectorは、LLMの動作状態を利用して潜在的なIPI攻撃を特定する、新しい検出ベースのアプローチである。
InstructDetectorは、ドメイン内設定で99.60%、ドメイン外設定で96.90%の検出精度を達成し、攻撃成功率をBIPIAベンチマークで0.03%に下げる。
論文 参考訳(メタデータ) (2025-05-08T13:04:45Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z) - Malicious Agent Detection for Robust Multi-Agent Collaborative Perception [52.261231738242266]
多エージェント協調(MAC)知覚は、単エージェント認識よりも敵攻撃に対して脆弱である。
MAC知覚に特異的な反応防御であるMADE(Malicious Agent Detection)を提案する。
我々は、ベンチマーク3DデータセットV2X-simとリアルタイムデータセットDAIR-V2Xで包括的な評価を行う。
論文 参考訳(メタデータ) (2023-10-18T11:36:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。