論文の概要: CAGE-1: Control, Assurance, and Governance Evaluation for Enterprise Agentic AI
- arxiv url: http://arxiv.org/abs/2607.03510v1
- Date: Fri, 03 Jul 2026 17:37:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.63562
- Title: CAGE-1: Control, Assurance, and Governance Evaluation for Enterprise Agentic AI
- Title(参考訳): CAGE-1:エンタープライズエージェントAIの制御・保証・ガバナンス評価
- Abstract要約: 本稿ではCAGE-1: Control, Assurance, and Governance Evaluation for Enterprise Agentic AIを紹介する。
CAGE-1は、エンタープライズエージェントがデプロイの準備が整っているかどうかを決定するための評価フレームワークである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Enterprise artificial intelligence is moving from experimentation into operational workflows. Early programs focused on model access and retrieval-augmented generation, but enterprises are now beginning to deploy agents that plan, retrieve, remember, call tools, update systems, and coordinate work across applications. This changes the evaluation problem. Leaders are no longer asking only whether an answer is accurate or fluent. They need to know who authorized an action, which policy applied, whether evidence was current, whether memory was valid, whether a tool call was permitted, whether the decision can be replayed, and whether the agent can be stopped before it creates business impact. This paper introduces CAGE-1: Control, Assurance, and Governance Evaluation for Enterprise Agentic AI. CAGE-1 is an evaluation framework for deciding whether enterprise agents are ready for deployment. It evaluates authority, policy enforcement, retrieval quality, memory integrity, tool safety, auditability, human oversight, conflict handling, safe failure, Prebind Assurance, operational readiness, and business fitness. CAGE-1 introduces Prebind Assurance to describe the evaluated ability to prove that an agentic action is controlled before it becomes binding, effective, or operationally consequential. The framework tests whether a proposed action is admitted, held, narrowed, refused, escalated, quarantined, or made non-effective before protected consequence forms.
- Abstract(参考訳): エンタープライズ人工知能は、実験から運用ワークフローへと移行している。
初期のプログラムはモデルアクセスと検索強化世代に重点を置いていたが、今や企業は、計画、検索、記憶、コールツール、更新システム、アプリケーション間の作業のコーディネートを行うエージェントをデプロイし始めている。
これは評価の問題を変えます。
もはやリーダは,回答が正確か流動的であるかのみを問うことはありません。
どのポリシーが適用されたか、証拠が有効かどうか、ツールコールが許可されたかどうか、決定が再生可能かどうか、そしてそれがビジネスへの影響を引き起こす前にエージェントを止めることができるかどうかを知る必要がある。
本稿ではCAGE-1: Control, Assurance, and Governance Evaluation for Enterprise Agentic AIを紹介する。
CAGE-1は、エンタープライズエージェントがデプロイの準備が整っているかどうかを決定するための評価フレームワークである。
権限、政策執行、検索品質、記憶の完全性、ツールの安全性、監査性、人間の監視、紛争処理、安全障害、プレビンド保証、運用の準備、ビジネス適合性を評価する。
CAGE-1はPrebind Assuranceを導入し、エージェントアクションが結合、有効、または操作的に連続する前に制御されることを示す評価能力を記述する。
このフレームワークは、提案されたアクションが保護された結果形式の前に認められ、保持され、制限され、拒否され、エスカレートされ、隔離され、あるいは無効にされるかどうかをテストする。
関連論文リスト
- EMERGE-Policy: A Robot Mind Emerges Beyond a Single Policy [48.898967774856466]
EMERGE-Policyは機能呼び出しと情報交換の両方をコーディネートする。
Main Agentはアクティブなコンテキストウィンドウ内でタスクレベルの状態を保持する。
ロール固有のサブエージェント プロセスの認識、実行監視、検証、メモリ統合。
論文 参考訳(メタデータ) (2026-08-30T16:46:06Z) - Stop Shipping AI Agents on Faith: Capability Is Not Production Readiness [0.0]
本稿では,AIエージェントのガバナンス準備度指標であるProofAgent Index(PAI)を紹介する。
PAIは、評価、コンテキスト、コンプライアンス、ガバナンスの4つの側面を組み合わせたデプロイメントエビデンスです。
監査可能なAIエージェント評価とガバナンスのためのオープンソースのインフラストラクチャであるProofAgent Harness内に実装されている。
論文 参考訳(メタデータ) (2026-07-30T04:44:47Z) - Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels [53.63220028820581]
身体的知性は、学習した知覚と意思決定をリアルタイムの計算、制御、物理的相互作用と統合する。
我々は,信頼に値するインテリジェンスを,特定のタスクを確実に実行するための持続能力として定義する。
論文 参考訳(メタデータ) (2026-07-28T17:50:44Z) - Agent Security Needs Redefinition through a Holistic Framework [46.88917910966891]
被告は、命令が悪意あるように見えるかどうかを問う。ベンチマークは、エージェントが有害な鳴き声を行うかどうかを問う。
我々は,エージェントの軌道全体にわたって連続的に評価されなければならない4つの特性を通じて,コンテキストセキュリティを運用する。
論文 参考訳(メタデータ) (2026-07-24T06:43:09Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - AGL-1: The Enterprise AI Governance Layer as a Control Plane for Trusted Enterprise Intelligence [0.0]
本稿では,コントロールプレーンのベンダ中立参照モデルとして,エンタープライズAIガバナンス層であるAGL-1を紹介する。
アイデンティティを意識した検索、ポリシー執行、管理、メモリガバナンス、知識の整合性監視、エージェント実行制御、信頼性監視の7つのガバナンスドメインを定義している。
論文 参考訳(メタデータ) (2026-07-03T17:42:08Z) - The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development? [80.24951682268332]
本稿では,自律エージェント開発のためのフロンティアモデルのキャパシティをテストするための評価フレームワークであるMeta-Agent Challenge(MAC)を紹介する。
評価の整合性を確保するため、このフレームワークは報奨ハッキングに対する多層防御によって確保される。
メタエージェントは人間工学的な基本方針とほとんど一致せず、その一部はプロプライエタリなフロンティアモデルに支配されている。
論文 参考訳(メタデータ) (2026-06-03T04:58:17Z) - Proof-Carrying Agent Actions: Model-Agnostic Runtime Governance for Heterogeneous Agent Systems [0.6526824510982799]
本稿では,アクション証明書を中心としたランタイム中立ガバナンスモデルであるProof-Carrying Agent Actions (PCAA)を提案する。
PCAAは5つのチェックポイント(事前行動の許容、行動のオープン、仮定のキャプチャ、承認、結果のクロージャ)を統括する。
異種エージェント制御プレーンと開示バウンダリ評価プロトコルの参照実装を用いてモデルについて検討する。
論文 参考訳(メタデータ) (2026-06-02T18:10:35Z) - Large Language Models for Agentic NetOps and AIOps: Architectures, Evaluation, and Safety [14.195825134031795]
大規模言語モデルは、ネットワークオペレーション(NetOps)とITオペレーションのための人工知能(AIOps)をサポートするために、ますます使用されている。
NetOpsとAIOpsでは、このシフトがタスクの管理方法を変えています。
エージェントベースのオペレーションは、エビデンス収集からアクションの実施、パーミッション、ポリシー、チェックの追跡、必要に応じてロールバックオプションの提供に至るまで、管理されている。
論文 参考訳(メタデータ) (2026-05-12T20:31:41Z) - CORA: Conformal Risk-Controlled Agents for Safeguarded Mobile GUI Automation [68.53387633351484]
有害な行為に対する統計的保証を提供するポスト・ポリティクス・プレアクション保護フレームワークであるCORA(Conformal Risk-control GUI Agent)を提案する。
CORAは、安全を選択的行動実行として再定義する:我々は、提案されたステップごとに行動条件リスクを推定するためにガーディアンモデルを訓練する。
このパラダイムを厳格に評価するために、ステップレベルのハーモラベルを持つモバイル安全違反の新しいベンチマークであるPhone-Harmを紹介する。
論文 参考訳(メタデータ) (2026-04-10T09:41:21Z) - When Actions Go Off-Task: Detecting and Correcting Misaligned Actions in Computer-Use Agents [50.5814495434565]
この研究は、コンピュータ利用エージェント(CUA)における不整合検出を定義し、研究する最初の試みである。
実世界のCUAデプロイメントにおける3つの一般的なカテゴリを特定し、人間の注釈付きアクションレベルのアライメントラベルを用いたリアルな軌跡のベンチマークであるMisActBenchを構築した。
本稿では,実行前に不整合を検知し,構造化されたフィードバックによって繰り返し修正する,実用的で普遍的なガードレールであるDeActionを提案する。
論文 参考訳(メタデータ) (2026-02-09T18:41:15Z) - Aegis: Towards Governance, Integrity, and Security of AI Voice Agents [52.7512082818639]
音声エージェントのガバナンス,整合性,セキュリティのためのフレームワークであるAegisを提案する。
我々は,銀行コールセンタ,ITサポート,ロジスティクスにおけるケーススタディを通じて,この枠組みを評価する。
モデルファミリ間の系統的な差異を観察し,より感受性の高いオープンウェイトモデルを示した。
論文 参考訳(メタデータ) (2026-02-07T05:51:36Z) - AgentGuardian: Learning Access Control Policies to Govern AI Agent Behavior [20.817336331051752]
AgentGuardianは、コンテキスト対応アクセス制御ポリシーを強制することによって、AIエージェントの操作を統制し、保護する。
正常なエージェント機能を保持しながら、悪意のある入力や誤解を招く入力を効果的に検出する。
論文 参考訳(メタデータ) (2026-01-15T14:33:36Z) - AgentGuard: Runtime Verification of AI Agents [1.14219428942199]
AgentGuardは、エージェントAIシステムの実行時検証のためのフレームワークである。
動的確率保証(Dynamic Probabilistic Assurance)と呼ばれる新しいパラダイムを通じて、継続的な量的保証を提供する。
論文 参考訳(メタデータ) (2025-09-28T13:08:50Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z) - Safe Reinforcement Learning via Curriculum Induction [94.67835258431202]
安全クリティカルなアプリケーションでは、自律エージェントはミスが非常にコストがかかる環境で学ぶ必要がある。
既存の安全な強化学習手法は、エージェントが危険な状況を避けるために、事前にエージェントを頼りにしている。
本稿では,エージェントが自動インストラクターの指導の下で学習する,人間の指導にインスパイアされた代替手法を提案する。
論文 参考訳(メタデータ) (2020-06-22T10:48:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。