論文の概要: ActGov: Governing LLM Agent Actions via Policy-Constrained Validation
- arxiv url: http://arxiv.org/abs/2609.24446v2
- Date: Tue, 22 Sep 2026 10:20:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:03.985393
- Title: ActGov: Governing LLM Agent Actions via Policy-Constrained Validation
- Title(参考訳): ActGov: LLMエージェントアクションをポリシー制約による検証を通じて統治する
- Abstract要約: ActGovは、外部効果を引き起こす前に、各ツールアクションを検証するランタイム実行フレームワークである。
ActGov-Policyコンポーネントは、認証、アクション、ランタイムコンテキスト、セキュリティ制約の統一的なセマンティックモデルに基づいて、ツール仕様から設定されたポリシーを反復的に構築する。
ActGov on the AgentDojoとAgentDynベンチマークを複数のモデルとアタック設定で評価する。
- 参考スコア(独自算出の注目度): 15.482980599813942
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) agents increasingly execute long-horizon workflows through external tools, allowing untrusted outputs to influence subsequent actions and exceed user authorization. Existing defenses isolate injected content or constrain execution with predefined plans and static policies, but these approaches are brittle under dynamic workflows and scale poorly across extensible tool ecosystems. In this work, we present ActGov, a runtime enforcement framework that validates each LLM-proposed tool action before it causes external effects. Built on a unified semantic model of authorization, actions, runtime context, and security constraints, the ActGov-Policy component iteratively constructs a policy set from tool specifications, benign tasks, and observed failure traces, with each update verified through SMT-based counterexample checking. At runtime, ActGov-Runtime abstracts each tool call into finite policy records and permits it only if it remains within the task-scoped authorization boundary and satisfies all applicable policies. This per-action enforcement preserves authorization throughout long-horizon, dynamically branching workflows. We evaluate ActGov on the AgentDojo and AgentDyn benchmarks across multiple models and attack configurations. It shows that ActGov consistently reduces the success rate of indirect prompt-injection attacks while preserving task utility, significantly outperforming existing defenses. These results demonstrate that ActGov can enforce fine-grained authorization over dynamic agent executions without relying on the underlying LLM to correctly identify malicious instructions.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、外部ツールを通じて長期のワークフローをますます実行し、信頼できないアウトプットがその後の行動に影響を与え、ユーザ認証を超えることを可能にしている。
既存のディフェンスは、事前に定義された計画と静的ポリシーで、注入されたコンテンツや制約実行を分離するが、これらのアプローチは動的ワークフローの下では不安定であり、拡張可能なツールエコシステム間でのスケールが不十分である。
本稿では、外部効果を引き起こす前に、それぞれのLDMが提案するツールアクションを検証するランタイム実行フレームワークであるActGovを紹介する。
ActGov-Policyコンポーネントは、認証、アクション、ランタイムコンテキスト、セキュリティ制約の統一的なセマンティックモデルに基づいて、ツール仕様、良質なタスク、観察された障害トレースから設定されたポリシーを反復的に構築する。
ActGov-Runtimeは実行時に、各ツール呼び出しを有限ポリシーレコードに抽象化し、タスクスコープされた認証境界内にある場合にのみ許可し、適用可能なすべてのポリシーを満たす。
この行動ごとの執行は、長期にわたる動的分岐ワークフローを通して認可を保存する。
ActGov on the AgentDojoとAgentDynベンチマークを複数のモデルとアタック設定で評価する。
ActGovは、タスクユーティリティを維持しながら間接的なプロンプトインジェクション攻撃の成功率を一貫して減少させ、既存の防御を著しく上回ることを示す。
これらの結果は、ActGovが、不正な命令を正しく識別するために基盤となるLLMに頼ることなく、動的エージェントの実行に対してきめ細かい認証を強制できることを実証している。
関連論文リスト
- ActGuard: Pre-execution Action Auditing against Indirect Prompt Injection in LLM Agents [11.495797074855703]
本稿では,事前実行動作監査フレームワークであるActGuardを提案する。
外部コンテンツが本質的に疑わしいかどうかを判断する代わりに、ActGuardは現在のアクションが合理的な期待から逸脱するかどうかを評価する。
検証者はその後、局所化された証拠を調べ、マスクは悪意のあるものとのみ確認され、衛生化された文脈からアクションを再生する。
論文 参考訳(メタデータ) (2026-09-14T03:47:05Z) - OpenAgentFlow: Enabling System-Wide Safety Boundaries for Heterogeneous AI Agent Fleets [30.42587289236515]
制御プレーン/アクションプレーンアーキテクチャであるOpenAgentFlowについて述べる。
GUI、API、ツール、LLM生成アクションは共通のAgentEventストリームに正規化され、共有事前実行ポリシー実行ポイントによって仲介される。
これにより、互換性のないエグゼクタ間で共通のガバナンス層が提供され、エージェント、プロンプト、モデル、実行パスを変更することなく、新しいポリシーが有効になる。
論文 参考訳(メタデータ) (2026-08-14T02:55:59Z) - FAVA: Formal Authorization for Verified Agents with Evidence-Backed Permission Graphs [11.447078130049512]
FAVAは、エージェントの実行を許可する認可フレームワークである。
OpenAgentSafety、OctoBench、ActPlaneのシナリオでFAVAを評価する。
論文 参考訳(メタデータ) (2026-07-29T09:41:07Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Governance by Construction for Generalist Agents [7.48004748585128]
このデモでは、CUGAのポリシ・アズ・コード・レイヤであるポリシ・アズ・コード・レイヤを紹介し、ジェネラリストエージェントと組み合わせて予測可能、監査可能、コンプライアンス対応の振る舞いを提供する。
実行の重要なすべての段階において、ポリシーの介入を強制するガバナンスアーキテクチャを提案する。
論文 参考訳(メタデータ) (2026-05-20T08:13:16Z) - Autonomous Adversary: Red-Teaming in the age of LLM [1.4302803674538154]
言語モデルエージェント(LMA)は、レッドチーム操作を増強するための強力なプリミティブとして現れている。
我々は、これらのエージェントが中核攻撃機能とどのように交わるかを分析し、現在の強度と限界を評価する。
制御された対向エミュレーション環境における2つの横移動シナリオのLMAをベンチマークする。
論文 参考訳(メタデータ) (2026-05-07T16:07:41Z) - ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and Feedback [53.2744585868162]
エージェントのデプロイには、ステップレベルのツールの実行動作をリアルタイムで監視することが不可欠だ。
LLMエージェントにおけるステップレベルツール起動安全検出のための新しいベンチマークであるTS-Benchを構築した。
次に,マルチタスク強化学習を用いたガードレールモデルTS-Guardを開発した。
論文 参考訳(メタデータ) (2026-01-15T07:54:32Z) - CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents [60.98294016925157]
AIエージェントは、悪意のあるコンテンツがエージェントの行動をハイジャックして認証情報を盗んだり、金銭的損失を引き起こすような、インジェクション攻撃に弱い。
CUAのためのシングルショットプランニングでは、信頼できるプランナーが、潜在的に悪意のあるコンテンツを観察する前に、条件付きブランチで完全な実行グラフを生成する。
このアーキテクチャ分離は命令インジェクションを効果的に防止するが、ブランチステアリング攻撃を防ぐには追加の対策が必要であることを示す。
論文 参考訳(メタデータ) (2026-01-14T23:06:35Z) - DynaSaur: Large Language Agents Beyond Predefined Actions [126.98162266986554]
既存のLLMエージェントシステムは、通常、各ステップで固定セットと事前定義されたセットからアクションを選択する。
動作を動的に生成・構成できるLLMエージェントフレームワークを提案する。
このフレームワークでは、汎用プログラミング言語で書かれたプログラムを生成し実行することで、エージェントが環境と対話する。
論文 参考訳(メタデータ) (2024-11-04T02:08:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。