論文の概要: Securing Computer-Use Agents Against Branch Steering Attacks
- arxiv url: http://arxiv.org/abs/2610.03089v1
- Date: Fri, 02 Oct 2026 10:08:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.319543
- Title: Securing Computer-Use Agents Against Branch Steering Attacks
- Title(参考訳): ブランチステアリング攻撃に対するコンピュータ利用エージェントの確保
- Abstract要約: Modern Computer Use Agents (CUA)は、グラフィカルなユーザインタフェースと直接対話し、サードパーティのWebツールを実行する。
これにより、レンダリングされたページとツールのレスポンスを間接的にインジェクションすることが可能になる。
我々は,信頼された分岐計画と事前機能制約を組み合わせたアーキテクチャであるCOBRAを提案する。
- 参考スコア(独自算出の注目度): 20.85256141905023
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern Computer Use Agents (CUAs) directly interact with graphical user interfaces and execute third-party web tools, exposing them to indirect prompt injection across every rendered page and tool response. While the Dual-LLM pattern is the primary system-level architecture offering formal security guarantees - using an isolated Planner LLM (P-LLM) to fix execution paths before processing untrusted inputs via a Quarantined LLM (Q-LLM) - these guarantees break down in graphical environments. Because CUA interaction is inherently dynamic, plans cannot remain data-independent; they must branch based on anticipated runtime web content - covering all possible cases the agent may encounter. This exposes agents to branch steering attacks, where an adversary crafts untrusted data to coerce a CUA down a hazardous, pre-approved branch without injecting explicit instructions. We systematically study branch steering attacks and introduce STEER-Bench (101 tasks across 9 domains), showing high attack success against both standard (94.4%) and vanilla Dual-LLM (89.5%) CUAs. We then propose COBRA, an architecture that pairs trusted branching plans with ahead-of-time capability constraints, strictly bounding the parameters and destinations each branch may execute. On STEER-Bench, COBRA reduces attack success to 0% while retaining 97% benign utility.
- Abstract(参考訳): Modern Computer Use Agents (CUA)はグラフィカルなユーザインタフェースと直接対話し、サードパーティのWebツールを実行する。
Dual-LLMパターンは、正式なセキュリティ保証を提供する主要なシステムレベルのアーキテクチャである - 隔離されたPlanner LLM(P-LLM)を使用して、Quarantined LLM(Q-LLM)を介して信頼できない入力を処理する前に、実行パスを修正する。
CUAのインタラクションは本質的に動的であるため、プランはデータに依存しない。
これはエージェントをブランチのステアリング攻撃に晒し、敵は信頼できないデータを使ってCUAを明示的な命令を注入することなく危険で承認されたブランチを強制する。
STEER-Bench(9ドメイン101タスク)を導入し,標準(94.4%)およびバニラDual-LLM(89.5%)のCUAに対して高い攻撃効果を示した。
次に、信頼された分岐計画と事前機能制約を組み合わせ、各ブランチの実行可能なパラメータと宛先を厳格に拘束するアーキテクチャであるCOBRAを提案する。
STEER-Benchでは、COBRAは攻撃成功率を0%まで削減し、良性ユーティリティは97%を維持している。
関連論文リスト
- Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens [65.53494487819053]
クローのようなAIエージェント(OpenClawなど)は、認証情報、ファイル、ツール、外部サービスへの永続的なアクセスを伴う、常にオンのプロセスである。
我々はClawのようなエージェントをエージェントコンピュータシステムとして扱い、そのゲートウェイランタイムがOSのような仲介の役割を担っている。
我々は、4つの攻撃面にわたる406の敵タスクのベンチマークであるSafeClawArenaを開発した。
論文 参考訳(メタデータ) (2026-06-29T18:00:45Z) - When Agents Handle Secrets: A Survey of Confidential Computing for Agentic AI [6.1511441479993225]
ツールを計画し、実行し、永続的なメモリを保持し、タスクをピアエージェントに委譲するエージェントAIシステムは、スタンドアロンのモデル推論と実質的に異なる脅威表面を導入する。
Trusted Execution Environments (TEEs)は、エージェントコードとデータを特権システムソフトウェアから分離する。
本調査は, 設計空間を, (i) 展開の役割と業績のトレードオフをカバーする6つのTEEプラットフォームの統合分類, (ii) 認知,計画,記憶,行動,調整層を対象とするエージェント中心の脅威モデル, (iii) CCの比較調査の4つの部分で要約する。
論文 参考訳(メタデータ) (2026-05-04T23:09:16Z) - Parallax: Why AI Agents That Think Must Never Act [0.0]
本稿では,4つの原則に基づく自律型AI実行のパラダイムであるParallaxを紹介する。
本稿では、Goのオープンソースリファレンス実装であるOpenParallaxを紹介し、Assume-Compromise Evaluationを用いて評価する。
9つの攻撃カテゴリにおける280件の敵の試験ケースのうち、パララックスは98.9%の攻撃をブロックし、デフォルト設定ではゼロの偽陽性、最大セキュリティ設定では100%の攻撃をブロックした。
論文 参考訳(メタデータ) (2026-04-14T17:20:48Z) - The Cognitive Firewall:Securing Browser Based AI Agents Against Indirect Prompt Injection Via Hybrid Edge Cloud Defense [0.0]
Cognitive Firewallは3段階の分割計算アーキテクチャで、クライアントとクラウドにセキュリティチェックを分散する。
システムは、ローカルビジュアルセンチネル、クラウドベースのDeep Planner、実行時ポリシーを強制する決定論的ガードで構成される。
論文 参考訳(メタデータ) (2026-03-24T23:49:15Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents [60.98294016925157]
AIエージェントは、悪意のあるコンテンツがエージェントの行動をハイジャックして認証情報を盗んだり、金銭的損失を引き起こすような、インジェクション攻撃に弱い。
CUAのためのシングルショットプランニングでは、信頼できるプランナーが、潜在的に悪意のあるコンテンツを観察する前に、条件付きブランチで完全な実行グラフを生成する。
このアーキテクチャ分離は命令インジェクションを効果的に防止するが、ブランチステアリング攻撃を防ぐには追加の対策が必要であることを示す。
論文 参考訳(メタデータ) (2026-01-14T23:06:35Z) - BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents [58.83028403414688]
大規模言語モデル(LLM)エージェントは、計画、メモリ、ツールの使用を組み合わせた多段階ワークフローを通じてタスクを実行する。
エージェントワークフローの特定のステージに注入されたバックドアトリガーは、複数の中間状態を通して持続し、下流出力に悪影響を及ぼす可能性がある。
LLMエージェントにおけるバックドア脅威を統一したエージェント中心のビューを提供するモジュールおよびステージアウェアフレームワークである textbfBackdoorAgent を提案する。
論文 参考訳(メタデータ) (2026-01-08T03:49:39Z) - DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents [52.92354372596197]
大規模言語モデル(LLM)は、強力な推論と計画能力のため、エージェントシステムの中心となってきています。
この相互作用は、外部ソースからの悪意のある入力がエージェントの振る舞いを誤解させる可能性がある、インジェクション攻撃のリスクも引き起こす。
本稿では,信頼に値するエージェントシステムのための動的ルールベースの分離フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-13T05:01:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。