論文の概要: Democratizing Agent Deployment Safety: A Structural Monitoring Approach
- arxiv url: http://arxiv.org/abs/2607.14570v1
- Date: Thu, 16 Jul 2026 04:55:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.992673
- Title: Democratizing Agent Deployment Safety: A Structural Monitoring Approach
- Title(参考訳): 民主化エージェント配置安全 : 構造モニタリングアプローチ
- Abstract要約: AIソフトウェア開発エージェントは、インフラストラクチャとセキュリティクリティカルシステムの修正が可能になり、エージェントが割り当てられたタスクを完了し、保護を隠蔽的に弱めるリスクが生じる。
この問題を,ControlArenaのインフラストラクチャ・アズ・コード設定におけるタスク成功時のインフラストラクチャ・レベル・サボタージュとして検討する。
生コード差分とともに制御フローとデータフローグラフ差分を用いて構造的セキュリティの回帰を解析する情報フローグラフ(IFG)モニタを導入する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI software development agents are increasingly capable of modifying infrastructure and security critical systems, creating risks where an agent completes its assigned task while covertly weakening safeguards through actions such as broadening permissions, degrading logging, or introducing persistence mechanisms. While frontier laboratories may deploy sophisticated monitoring pipelines, many organizations and individual users adopting coding agents lack the resources and governance maturity required to maintain complex learned monitor ensembles. We study this problem as infrastructure level sabotage under task success in the infrastructure-as-code setting from ControlArena and compare trained and untrained monitors across synchronous and asynchronous deployment modes. We introduce an Information Flow Graph (IFG) monitor that analyzes structural security regressions using control-flow and data-flow graph diffs alongside raw code diffs. In asynchronous evaluation, an untrained git diff monitor misses 11.6% attacks at 1% false positive rate auditing budget, our untrained IFG monitor reduces this to 3.5%, and the trained Async RF monitor achieves below 1%. Unlike the trained Async RF monitor, IFG can also operate synchronously as a pre-deployment safeguard that blocks suspicious infrastructure changes before execution or merge. In synchronous mode, IFG realtime rollback reduces joint main task and covert task success from 74.4% to 0.0% with no measurable reduction in legitimate task completion. These results suggest that untrained structural monitors provide a practical and auditable path toward democratizing deployment safety for organizations seeking trustworthy adoption of advanced AI agents.
- Abstract(参考訳): AIソフトウェア開発エージェントは、インフラストラクチャとセキュリティクリティカルシステムの修正や、エージェントが割り当てられたタスクを完了し、権限の拡大やロギングの劣化、永続化メカニズムの導入といったアクションを通じて保護を隠蔽するリスクを発生させる能力がますます高まっている。
フロンティア研究所は高度な監視パイプラインをデプロイする可能性があるが、コーディングエージェントを採用する多くの組織や個々のユーザは、複雑な学習された監視アンサンブルを維持するために必要なリソースとガバナンスの成熟度に欠けている。
この問題を、ControlArenaのインフラストラクチャ・アズ・コード設定におけるタスク成功時のインフラストラクチャ・レベル・サボタージュとして検討し、同期および非同期配置モード間でトレーニング済みおよび未トレーニングのモニターを比較した。
生コード差分とともに制御フローとデータフローグラフ差分を用いて構造的セキュリティの回帰を解析する情報フローグラフ(IFG)モニタを導入する。
非同期評価では、トレーニングされていないgit diffモニターは、1%の偽陽性率監査予算での11.6%の攻撃を見逃し、トレーニングされていないIFGモニターは、これを3.5%に削減し、トレーニングされたAsync RFモニターは1%未満を達成する。
トレーニングされたAsync RFモニタとは異なり、IFGは、実行やマージ前に不審なインフラストラクチャ変更をブロックする事前デプロイ保護として同期的に動作することもできる。
同期モードでは、IFGリアルタイムロールバックは結合主タスクと秘密タスクの成功を74.4%から0.0%に削減する。
これらの結果は、トレーニングされていない構造モニターが、高度なAIエージェントの信頼性を追求する組織に対して、デプロイの安全性を民主化するための実践的で監査可能な道を提供することを示唆している。
関連論文リスト
- $D^2$-Monitor: Dynamic Safety Monitoring for Diffusion LLMs via Hesitation-Aware Routing [63.49501120848927]
大規模言語モデル(D-LLM)の安全性監視はほとんど未検討である。
D-LLMの2レベル安全モニタであるD2$-Monitorを提案する。
D2$-Monitorは、常にオンのモニターとして軽量プローブを採用して、ヒューズレーションを共同で見積もり、ベース分類を実行する。
論文 参考訳(メタデータ) (2026-05-25T14:22:21Z) - On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - Step-level Optimization for Efficient Computer-use Agents [51.29573359027217]
我々は、強力なコンピュータ利用エージェントは、実際は高価で遅いと論じている。
本稿では,コンピュータ利用エージェントのためのイベント駆動ステップレベルカスケードを提案する。
論文 参考訳(メタデータ) (2026-04-29T19:59:36Z) - Blockchain-Enabled Routing for Zero-Trust Low-Altitude Intelligent Networks [77.17664010626726]
低高度インテリジェントネットワーク(LAIN)における複数のUAVクラスタによるルーティングに焦点を当てる。
潜在的な脅威によるダメージを最小限に抑えるため,ソフトウェア定義の周辺技術とブロックチェーン技術を用いたゼロトラストアーキテクチャを提案する。
提案手法は,平均E2E遅延を59%削減し,TSRを29%改善することを示した。
論文 参考訳(メタデータ) (2026-02-27T04:30:35Z) - CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents [60.98294016925157]
AIエージェントは、悪意のあるコンテンツがエージェントの行動をハイジャックして認証情報を盗んだり、金銭的損失を引き起こすような、インジェクション攻撃に弱い。
CUAのためのシングルショットプランニングでは、信頼できるプランナーが、潜在的に悪意のあるコンテンツを観察する前に、条件付きブランチで完全な実行グラフを生成する。
このアーキテクチャ分離は命令インジェクションを効果的に防止するが、ブランチステアリング攻撃を防ぐには追加の対策が必要であることを示す。
論文 参考訳(メタデータ) (2026-01-14T23:06:35Z) - Agentic AI for Autonomous Defense in Software Supply Chain Security: Beyond Provenance to Vulnerability Mitigation [0.0]
本論文は,自律型ソフトウェアサプライチェーンセキュリティに基づくエージェント人工知能(AI)の例を含む。
大規模言語モデル(LLM)ベースの推論、強化学習(RL)、マルチエージェント調整を組み合わせている。
その結果、エージェントAIは、自己防衛的で積極的なソフトウェアサプライチェーンへの移行を促進することが示されている。
論文 参考訳(メタデータ) (2025-12-29T14:06:09Z) - Async Control: Stress-testing Asynchronous Control Measures for LLM Agents [2.7146936326590425]
非同期モニタリングにおいて,モニタリングシステムがエージェントの動作を後回しにレビューする手法について検討する。
同期監視とは異なり、このアプローチは実行時のレイテンシを課すことなく、不可逆的な害が起こる前に攻撃を妨害しようとする。
私たちは、モニター開発を、ブルーチーム(モニターを設計する)とレッドチーム(破壊エージェントを作成する)の敵対的なゲームとして扱う。
論文 参考訳(メタデータ) (2025-12-15T16:56:28Z) - Practical challenges of control monitoring in frontier AI deployments [15.281070904065613]
コントロールモニターは、私たちが完全に信頼していない高度なAIエージェントを監督する上で重要な役割を果たす可能性がある。
これまでの作業では、単純化された設定でのコントロール監視について検討されてきたが、実際のデプロイメントに対する監視のスケーリングには、さらなるダイナミクスが導入されている。
本稿では、これらの課題に対処するための設計選択を分析し、異なるレイテンシーセーフなトレードオフによる3種類のモニタリングに焦点を当てる。
論文 参考訳(メタデータ) (2025-12-15T15:54:36Z) - Towards a Multi-Layer Defence Framework for Securing Near-Real-Time Operations in Open RAN [4.240433132593161]
Open Radio Access Networks (Open RAN)における準リアルタイム(近RT)制御の安全性はますます重要になっている。
システムが運用されている間、新しいランタイム脅威は制御ループをターゲットとします。
本稿では,近RT RAN Intelligent Controller (RIC) 操作のセキュリティ向上を目的とした多層防御フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-01T12:13:32Z) - AdvEvo-MARL: Shaping Internalized Safety through Adversarial Co-Evolution in Multi-Agent Reinforcement Learning [78.5751183537704]
AdvEvo-MARLは、タスクエージェントに安全性を内部化する、共進化型マルチエージェント強化学習フレームワークである。
外部ガードに頼るのではなく、AdvEvo-MARLは攻撃者と防御者を共同で最適化する。
論文 参考訳(メタデータ) (2025-10-02T02:06:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。