論文の概要: If Agents Were Angels, No Governance Would Be Necessary: Out-of-Band Policy Enforcement at a Trusted Tool Boundary
- arxiv url: http://arxiv.org/abs/2608.27646v1
- Date: Thu, 27 Aug 2026 19:35:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.133805
- Title: If Agents Were Angels, No Governance Would Be Necessary: Out-of-Band Policy Enforcement at a Trusted Tool Boundary
- Title(参考訳): エージェントがエンジェルであるなら、ガバナンスは必要ない - 信頼されたツール境界におけるアウト・オブ・バンド政策の強化
- Abstract要約: Out-of-Band Policy Enforcement (OBPE)は、エージェント推論以外の信頼できる境界である。
OBPEは型付き操作とリソースを許可し、バックエンド呼び出しの前にクエリを絞り込み、それからレコードとフィールドをフィルタリングし、レスポンスの値にマスクを付ける。
- 参考スコア(独自算出の注目度): 0.07499722271664146
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Give an agent a human's credential and it inherits the person's reach without the judgment that limits its use. It can sweep every reachable record into model context, where hidden instructions steer its next call, and every request stays credential-valid while the agent exceeds its job or absorbs a secret. Prompts are a brittle guardrail: one fallible reasoner interprets the task and enforces its limits. We present Out-of-Band Policy Enforcement (OBPE), a trusted boundary outside agent reasoning. It authorizes the typed operation and resource, narrows the query before the backend call, then filters records and fields or masks values in the response. Semantic gating can deny or hold an authorized call on argument values or external state. A data policy owner sets the maximum grant; agent policy can only narrow it. We prove, under stated conditions, that the policy plan is order-independent and agent policy cannot widen the ceiling. Field removal covers one execution; masking and history rules claim less. We release an HTTP proxy prototype simplified from our production system, with conformance tests tying its typed Cedar policy core to the model. Against Jira and ServiceNow mocks, our benchmark compares prompted agents with and without OBPE on four models, including 20 adaptive red-team tasks. A trace failure means protected data entered agent context, an exact value appeared in the answer, or a forbidden effect completed. In 3,621 trials it fell from 57.6% to 0.2%, a cluster-weighted reduction of 41.2 points [95% CI: 27.7, 54.9]; fulfillment fell from 79.1% to 60.9%, while paired safe-useful completion rose 21.8 points [9.5, 35.2]. Some answers reconstructed a value that never entered context or used filtered row counts as an oracle: shaping one execution is not noninterference. Write controls, durable approval, and temporal and aggregate policies lie outside this evaluation.
- Abstract(参考訳): エージェントに人間の資格を与え、その使用を制限する判断なしにその人の手を継承する。
すべての到達可能なレコードをモデルコンテキストにまとめて、隠された命令がその次の呼び出しを操縦し、すべての要求はクレデンシャル無効のままであり、エージェントはそのジョブを超えたり、秘密を吸収する。
プロンプトは不安定なガードレールであり、ある誤った推論者がタスクを解釈し、その限界を強制する。
エージェント推論以外の信頼性のある境界線であるOBPE(Out-of-Band Policy Enforcement)を提示する。
型付けされた操作とリソースを認可し、バックエンド呼び出しの前にクエリを絞り込み、応答中のレコードやフィールドやマスクの値をフィルタリングする。
セマンティックゲーティングは、引数値や外部状態に対する承認された呼び出しを否定または保持することができる。
データポリシーのオーナは最大権限を設定します。
我々は、条件が明記されている場合、政策計画が秩序に依存しておらず、エージェントポリシーが天井を広げることができないことを証明します。
フィールド削除は1つの実行をカバーする。
私たちは本番システムから簡略化されたHTTPプロキシプロトタイプをリリースし、型付けされたCedarポリシーコアをモデルに結び付ける適合テストを実施しました。
JiraとServiceNowのモックに対して、私たちのベンチマークでは、エージェントがOBPEを使わずに4つのモデルで比較しています。
トレース障害とは、エージェントコンテキストに入力された保護されたデータ、回答に正確な値、または禁止効果である。
3,621回の試験では57.6%から0.2%に低下し、クラスタ重み付き41.2ポイント(95% CI: 27.7, 54.9]、充足は79.1%から60.9%に低下した。
いくつかの答えは、コンテキストに入らなかったり、フィルタされた行数を使ったりしない値をオラクルとして再構成した。
コントロールの記述、耐久性のある承認、時間的および集合的なポリシは、この評価の外にあります。
関連論文リスト
- Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems [67.04448659688579]
クエリ非依存の16エントリのコードブックを開発し、上位のデコード候補を1回のバッチフォワードパスでランク付けする。
反復検索がなく、テスト時にメッセージパッシングがないため、Codebook Agentは6つのベンチマークでもっとも正確な方法である。
論文 参考訳(メタデータ) (2026-09-02T08:10:22Z) - ROPE: Routed Origin Policy Enforcement against Indirect Prompt Injection [61.4148196085256]
本稿では,信頼という構造概念に根ざしたROPE(Routed Origin Policy Enforcement)について述べる。
提案手法では,(1)軌道の各段階において,攻撃可能コンテンツのみを起点とする値が,原点保護パラメータに到達しない,(2)注入のリワードがない,という2つの保証が認められている。
論文 参考訳(メタデータ) (2026-08-27T01:22:14Z) - AgentFlow: A Flow-Centric Policy Language and Framework for Securing LLM Agent Systems [7.734540679538682]
LLMエージェントはますます信頼できないコンテンツを読み、外部ツールを呼び出し、プライベートデータにアクセスし、他のエージェントに作業を委譲する。
本稿では,エージェントシステム内のデータ移動場所を特定するための,フロー中心のポリシー言語であるAgentFlowについて述べる。
論文 参考訳(メタデータ) (2026-08-24T06:56:00Z) - Task-Conditioned Least-Privilege Learning for Executable Terminal and MCP Agents [45.88028371034407]
ツールを使用する大規模言語モデルエージェントは、ユーザが許可しなかったり、タスクが不要であったりする権限を行使しながらタスクを完了することができる。
本研究では,6次元のリスクを伴って各行動が実行前および観測結果から監査される枠組みを提案する。
このフレームワークを1500以上のタスクでQwen3.5-4Bでトレーニングした後、選択された種子は2,896回の評価エピソードで98.48%の安全成功に達した。
論文 参考訳(メタデータ) (2026-08-18T22:07:23Z) - Governance at the Boundary: How Agent Decomposition Degrades Policy Compliance [6.411104724993454]
金融エージェントの統治可能性のベンチマークであるFiducia-benchを紹介します。
エージェントは、そのガバナンスを劣化させるのか?
あるコンポーネントによって発見されたポリシー関連事実は、それらに作用しなければならないコンポーネントに到達する前に、ハンドオフ境界で減衰される。
論文 参考訳(メタデータ) (2026-08-17T03:31:59Z) - The Recall Trap: A Recall-Maximizing Retriever Configuration Reduces Issue Resolution in Fixed-Budget Code Context [45.88028371034407]
コード修復における制御ケーススタディを報告し,新しい現象ではない。
私たちは、同じスタック上の1つのフラグ(1チャンク毎の重複)を切り替えます。
BM25(3.2pp、重要なパラダイム間相互作用)を逆転させる。
厳格な固定予算では、ファイルごとのハードダイドプリケートや、タスクに対するA/Bパッケージングポリシは、メトリックフラグを調整しないことが示されます。
論文 参考訳(メタデータ) (2026-08-14T19:22:50Z) - Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents [48.967927222079965]
Ledgerは、エージェントの完了したインタラクションを明示的な実行状態に蒸留するランタイム層である。
Ledgerはこの状態をオンライン実行台帳に保持し、各ステップの2つのバウンダリに適用される。
500のSWE-bench検証インスタンス全体で、LedgerはPass@1を56.2%から64.2%に、GPT-5 miniを75.8%から81.0%に、MiniMax M2.5を81.0%に引き上げている。
論文 参考訳(メタデータ) (2026-08-01T18:25:00Z) - Agent Security Needs Redefinition through a Holistic Framework [46.88917910966891]
被告は、命令が悪意あるように見えるかどうかを問う。ベンチマークは、エージェントが有害な鳴き声を行うかどうかを問う。
我々は,エージェントの軌道全体にわたって連続的に評価されなければならない4つの特性を通じて,コンテキストセキュリティを運用する。
論文 参考訳(メタデータ) (2026-07-24T06:43:09Z) - Reason Less, Verify More: Deterministic Gates Recover a Silent Policy-Violation Failure Mode in Tool-Using LLM Agents [1.6567880228735357]
ポリシーを許容する環境では、対応する状態遷移がドメインポリシーによって禁じられている場合であっても、ツールはよくできた呼び出しを実行できる。
我々は、この障害モードを2ドルの航空会社ドメインで研究する。
我々は、決定論的かつリードオンリーの事前実行ゲートという、軽量な介入を評価する。
論文 参考訳(メタデータ) (2026-07-08T13:38:54Z) - Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity? [54.701199583505144]
アプリケーション間アクセスは、ほとんど見落とされたプライバシーリスクを生み出す。
我々はAgentCIBenchを紹介します。これは、このリスクを決定論的に評価されたシナリオに変換する評価ハーネスです。
我々は15のフロンティアエージェントを評価し、驚くほど高い失敗率を見出す。
論文 参考訳(メタデータ) (2026-06-22T11:36:58Z) - Policy-Invisible Violations in LLM-Based Agents [10.660248467840821]
コンプライアンスがエンティティ属性、コンテキスト状態、あるいはエージェントの可視的コンテキストから欠落したセッション履歴に依存する場合。
PhantomPolicyは、8つの違反カテゴリにまたがるベンチマークで、バランスの取れた違反と安全管理のケースを示す。
本稿では,反ファクトグラフシミュレーションに基づく実施フレームワークであるSentinelを紹介する。
論文 参考訳(メタデータ) (2026-04-14T01:15:15Z) - Before the Tool Call: Deterministic Pre-Action Authorization for Autonomous AI Agents [0.0]
Open Agent Passport (OAP)は、実行前にツール呼び出しを同期的にインターセプトするオープン仕様とリファレンス実装である。
OAPは、53ms(N=1,000)の中央値で認可決定を強制する
セキュリティ制約を強制するのと同じインフラストラクチャでは,品質ゲートや運用契約,コンプライアンスコントロールも実施されている。
論文 参考訳(メタデータ) (2026-03-21T21:34:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。