論文の概要: ToolGuardian: Declarative Security for AI Agent-Tool Interactions
- arxiv url: http://arxiv.org/abs/2607.21835v1
- Date: Thu, 23 Jul 2026 21:53:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.004968
- Title: ToolGuardian: Declarative Security for AI Agent-Tool Interactions
- Title(参考訳): ToolGuardian: AIエージェントとツールのインタラクションの宣言的セキュリティ
- Abstract要約: 既存の防衛は、弱いメタデータ、崩壊特性、および政策判断に依存している。
本稿では,エージェントとツールのインタラクションをセキュアにするためのポリシー駆動型フレームワークであるToolGuardianを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM agents increasingly rely on external tools, expanding capability while creating a new security boundary: third-party tools may appear benign at the interface level while embedding unsafe behavior in implementation. Existing defenses rely on weak metadata, collapse characterization and policy judgment into a single decision, or use heuristic/LLM enforcement that lacks deterministic, auditable reasoning over task context and multi-tool composition. This paper presents ToolGuardian, a policy-driven framework for securing agent-tool interactions through pre-admission vetting and task-aware runtime authorization. ToolGuardian uses progressive characterization to convert evidence into structured facts: descriptions capture declared intent, system-call traces expose coarse behavior, mock execution reveals observed effects, and source analysis identifies latent behavior. ToolGuardian's core contribution is an Answer Set Programming (ASP)-based declarative policy layer that reasons explicitly over capabilities, effects, task context, and composition. We compare ASP against heuristic and LLM-based policy realizations using identical inputs and output contracts. We evaluate ToolGuardian on 16 MCP-style tools, including 8 malicious variants derived from real open-source tools, and 20 runtime scenarios. For vetting, ASP reaches a deny-class F1 of 0.86 and 88% accuracy using description, syscall, and observed-effect evidence. For runtime authorization, fully specified realizations classify all scenarios correctly, while ablations show that removing compositional and conformance rules substantially degrades performance.
- Abstract(参考訳): LLMエージェントは、外部ツールにますます依存し、新たなセキュリティバウンダリを作成しながら機能を拡張している。
既存の防御は、弱いメタデータ、崩壊特性、政策判断を単一の決定にするか、あるいは、タスクコンテキストとマルチツール構成に対する決定論的で監査可能な推論を欠くヒューリスティック/LLMの強制に頼っている。
提案するToolGuardianは,事前審査とタスク対応ランタイム認証を通じてエージェントとツールのインタラクションをセキュアにするための,ポリシー駆動型フレームワークである。
ToolGuardianは、エビデンスを構造化された事実に変換するために、プログレッシブなキャラクタリゼーションを使用しています。
ToolGuardianのコアコントリビューションは、Answer Set Programming(ASP)ベースの宣言型ポリシーレイヤである。
ASP とヒューリスティックおよび LLM ベースのポリシー実現を同一の入力と出力契約を用いて比較する。
我々は、実際のオープンソースツールから派生した8つの悪意ある変種、20のランタイムシナリオを含む16のMPPスタイルのツールでToolGuardianを評価した。
審査では、ASPは説明、サイスコール、観察された効果証拠を使用して、0.86の否定クラスF1と88%の精度に達する。
実行時の承認のために、完全に指定された実現はすべてのシナリオを正しく分類する。
関連論文リスト
- ActGuard: Pre-execution Action Auditing against Indirect Prompt Injection in LLM Agents [11.495797074855703]
本稿では,事前実行動作監査フレームワークであるActGuardを提案する。
外部コンテンツが本質的に疑わしいかどうかを判断する代わりに、ActGuardは現在のアクションが合理的な期待から逸脱するかどうかを評価する。
検証者はその後、局所化された証拠を調べ、マスクは悪意のあるものとのみ確認され、衛生化された文脈からアクションを再生する。
論文 参考訳(メタデータ) (2026-09-14T03:47:05Z) - ROPE: Routed Origin Policy Enforcement against Indirect Prompt Injection [61.4148196085256]
本稿では,信頼という構造概念に根ざしたROPE(Routed Origin Policy Enforcement)について述べる。
提案手法では,(1)軌道の各段階において,攻撃可能コンテンツのみを起点とする値が,原点保護パラメータに到達しない,(2)注入のリワードがない,という2つの保証が認められている。
論文 参考訳(メタデータ) (2026-08-27T01:22:14Z) - Think Twice Before You Act: Protecting LLM Agents Against Tool Description Poisoning via Isolated Planning [48.99783163807576]
クロスツール記述中毒は、エージェントの軌道を操縦するためにプランナー可視のツールメタデータを操作することができる。
重要な観察は、有毒な記述がステップを越えた計画コンテキストに留まり、その後のツール選択に対する継続的な影響を可能にすることである。
我々は,孤立計画と呼ばれる新しい概念に基づく新しいシステムレベルの防衛ツールであるTool-Guardを提案する。
論文 参考訳(メタデータ) (2026-06-18T20:31:08Z) - Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback [38.251599309409]
我々は,悪質なツールが探索中に合理的に振る舞う,異なる障害モード,認知的中毒について検討する。
ファイナルアクションリスクスコアリングのためのバックボーンに依存しないフレームワークであるVISTA-Guardを提案する。
論文 参考訳(メタデータ) (2026-05-17T13:51:34Z) - Securing LLM Agents Need Intent-to-Execution Integrity [49.490963596514185]
我々は, LLMエージェントの確保には, エージェントの実行がユーザの意図を忠実に反映した場合に規定するエンドツーエンドの正当性を定義する必要があると主張している。
LLMエージェントはコンパイラと構造的に類似しており、セキュリティ違反はユーザ意図を保存しない誤った実行に対応する。
emphTool整合性、emph命令整合性、emphJudgment整合性、emphData整合性。
論文 参考訳(メタデータ) (2026-05-16T12:53:31Z) - TRUSTDESC: Preventing Tool Poisoning in LLM Applications via Trusted Description Generation [16.85010496624083]
大きな言語モデル(LLM)は、時間に敏感なタスクや実世界のアクションを実行するための外部ツールに依存している。
攻撃者は、悪意のある命令(明示的なTPA)を埋め込んでツール記述を操作したり、(単純なTPA)クレームを誤解してモデル動作やツール選択に影響を与える。
実装から信頼できるツール記述を自動的に生成することにより、ツール中毒を防止するための最初のフレームワークであるTRUSTDESCを提案する。
論文 参考訳(メタデータ) (2026-04-08T19:18:11Z) - The Causal Impact of Tool Affordance on Safety Alignment in LLM Agents [0.3823356975862005]
本研究は,大規模言語モデル(LLM)の安全アライメントがいかに変化するかを実証的に検証する。
決定論的金融取引環境において、1500シナリオにわたる二元的安全制約を伴う実験を行う。
どちらのモデルも、テキストのみの設定では完全なコンプライアンスを維持しているが、ツールアクセスが導入されると、違反が大幅に増加する。
論文 参考訳(メタデータ) (2026-03-19T23:34:46Z) - PerfGuard: A Performance-Aware Agent for Visual Content Generation [53.591105729011595]
PerfGuardは、ビジュアルコンテンツ生成のためのパフォーマンス対応のエージェントフレームワークである。
ツールのパフォーマンス境界をタスク計画とスケジューリングに統合する。
ツール選択の正確性、実行の信頼性、ユーザの意図との整合性にメリットがあります。
論文 参考訳(メタデータ) (2026-01-30T05:12:19Z) - Sponge Tool Attack: Stealthy Denial-of-Efficiency against Tool-Augmented Agentic Reasoning [58.432996881401415]
最近の作業では、エージェント推論を可能にするために、外部ツールで大きな言語モデル(LLM)を拡張している。
本稿では,入力プロンプトを書き換えることのみでエージェント推論を妨害するスポンジツールアタック(STA)を提案する。
STAは、意味的忠実度の高い原文からの良心的な即興的な書き直しを生成する。
論文 参考訳(メタデータ) (2026-01-24T19:36:51Z) - ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and Feedback [53.2744585868162]
エージェントのデプロイには、ステップレベルのツールの実行動作をリアルタイムで監視することが不可欠だ。
LLMエージェントにおけるステップレベルツール起動安全検出のための新しいベンチマークであるTS-Benchを構築した。
次に,マルチタスク強化学習を用いたガードレールモデルTS-Guardを開発した。
論文 参考訳(メタデータ) (2026-01-15T07:54:32Z) - Securing the Model Context Protocol: Defending LLMs Against Tool Poisoning and Adversarial Attacks [8.419049623790618]
本研究は,MPP統合システムに対するセマンティックアタックの3つのクラスを分析する。
ディスクリプタの整合性を強制するためのRSAベースのマニフェスト署名、不審なツール定義を検出するためのLLM-on-LLMセマンティックベッティング、実行時に異常なツール動作をブロックする軽量ガードレールである。
提案手法は, モデル微調整や内部修正を伴わずに, 安全でないツール実行率を低減できることを示す。
論文 参考訳(メタデータ) (2025-12-06T20:07:58Z) - IPIGuard: A Novel Tool Dependency Graph-Based Defense Against Indirect Prompt Injection in LLM Agents [33.775221377823925]
大規模言語モデル(LLM)エージェントは現実世界のアプリケーションに広くデプロイされており、複雑なタスクのために外部データを検索し操作するためのツールを活用している。
信頼できないデータソースと対話する場合、ツールレスポンスには、エージェントの動作に秘密裏に影響を与え、悪意のある結果をもたらすインジェクションが含まれている可能性がある。
我々はIPIGuardと呼ばれる新しい防御タスク実行パラダイムを提案し、ソースにおける悪意あるツール呼び出しを防止する。
論文 参考訳(メタデータ) (2025-08-21T07:08:16Z) - Compromising Embodied Agents with Contextual Backdoor Attacks [69.71630408822767]
大型言語モデル(LLM)は、エンボディドインテリジェンスの発展に変化をもたらした。
本稿では,このプロセスにおけるバックドアセキュリティの重大な脅威を明らかにする。
ほんの少しの文脈的デモンストレーションを毒殺しただけで、攻撃者はブラックボックスLDMの文脈的環境を隠蔽することができる。
論文 参考訳(メタデータ) (2024-08-06T01:20:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。