論文の概要: SIR: Self-improving Red-teaming for Compute Use Agents
- arxiv url: http://arxiv.org/abs/2608.30207v1
- Date: Mon, 31 Aug 2026 03:39:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.213009
- Title: SIR: Self-improving Red-teaming for Compute Use Agents
- Title(参考訳): SIR: コンピュータ利用エージェントのための自己改善型レッドチーム
- Abstract要約: コンピュータ・ユース・エージェント(CUA、Computer use agent)は、マウス、キーボード、端末を通じて画面を認識し、実際のオペレーティングシステムに作用する視覚言語モデルである。
操作中に信頼できないコンテンツに晒されるため、間接的プロンプトインジェクション(IPI)に弱い。
SIRは,平易な言語で記述された再利用原則の小さなライブラリからステルスインジェクションを構成するブラックボックスIPIアタックである。
- 参考スコア(独自算出の注目度): 71.71987044117371
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Computer use agents (CUAs) are vision-language models that perceive a screen and act on a real operating system through mouse, keyboard, and terminal, and they are increasingly deployed to automate everyday digital tasks. Because they can be exposed to untrusted content while operating, they are vulnerable to indirect prompt injection (IPI), in which an adversary plants instructions in content the agent will read and redirects it toward actions that violate the user's intent. Existing CUA safety benchmarks evaluate fixed injections written by hand, which may underestimate the risk posed by an adaptive adversary. We present SIR, a black box IPI attack that (i) composes stealthy injections from a small library of reusable principles stated in plain language and (ii) wraps composition in an iterative feedback loop that diagnoses the victim's failed trajectories and distills the bypasses into new, named strategies that are reapplied across tasks. Unlike prior red teaming of web agents, we target CUAs at the operating system level and score attacks with a fully deterministic oracle, using checks on filesystem, service, and permission state rather than an LLM judge. On experiment, we evaluate three frontier CUAs. Composing principles with feedback raises the attack success rate over a baseline written by hand, for example from 4% to 24% on Claude Opus 4.8 and from 0% to 28% on Gemini 3.5 Flash, while the benign task still completes. Principles discovered against one model further transfer to a different architecture with no additional feedback.
- Abstract(参考訳): コンピュータ利用エージェント(CUA)は、画面を認識し、マウス、キーボード、端末を介して実際のオペレーティングシステムに作用する視覚言語モデルであり、日々のデジタルタスクを自動化するためにますますデプロイされている。
操作中に信頼できないコンテンツに晒すことができるため、間接的なプロンプトインジェクション(IPI)に弱いため、相手がコンテンツに命令を配置し、ユーザーの意図に反するアクションにリダイレクトする。
既存のCUA安全ベンチマークは、手書きの固定注入を評価し、適応的な敵によるリスクを過小評価する。
ブラックボックスのIPI攻撃であるSIRを提示する。
i) 平易な言語で記述された再利用原則の小さなライブラリからステルスインジェクションを構成すること
(ii) コンポジションを繰り返しフィードバックループでラップし、被害者の軌道が失敗したことを診断し、そのバイパスをタスクにまたがって再適用される新しい名前の戦略に蒸留する。
LLM審査員ではなくファイルシステム、サービス、パーミッション状態のチェックを用いて、オペレーティングシステムレベルでCUAをターゲットとし、完全な決定論的オラクルによる攻撃をスコアする。
実験では,3つのフロンティアCUAを評価した。
例えば、Claude Opus 4.8では4%から24%、Gemini 3.5 Flashでは0%から28%、良心的なタスクは依然として完了している。
あるモデルに対する原則は、追加のフィードバックなしで別のアーキテクチャにさらに移行することを発見した。
関連論文リスト
- Beyond the Payload: How User Invocation Shapes Coding Agent Vulnerability to Repository Poisoning [39.57248170050304]
コーディングエージェントは、サードパーティリポジトリからのプロジェクトのブートストラップなど、ソフトウェアエンジニアリングタスクにますます使用されている。
これらのユーザ側の選択をPrompt-Level設定(PLC)と呼び、CIPR(Coding In Poisoned Repos)を導入します。
CIPRは、20のリポジトリに1,920のインスタンス、4つのタスクタイプ、3つのソーシャルメディアベースのプロンプトスタイル、3つのスキル/ルール条件、そしてアタック成功率(ASR)とエージェントアラートレート(AR)を含む。
脆弱性は非常にコンテキスト依存的であり、タスクタイプはASRの4.5倍の違いをテストで生成する。
論文 参考訳(メタデータ) (2026-08-31T12:26:01Z) - Invisible Ink Threats: Adversarial Goals Behind Legitimate Tasks in Computer-Use Agents [10.553545687886928]
我々は、一見無害な敵タスクのコレクションであるII-Benchを提示する。
II-Benchは、3つのプラットフォームにわたる機密性および整合性攻撃をターゲットにした444の例で構成されている。
また,包括的対角テストフレームワークHITLCUAを構築した。
論文 参考訳(メタデータ) (2026-08-03T10:16:53Z) - Beyond Attack-Success Rate: Action-Graded Severity Scale for Tool-Using AI Agents [0.0]
エージェントのレッドチームベンチマークは、インジェクトされたエージェントが単一ビットとして侵入されたかどうかを報告している。
このバイナリ・アタック・サクセス・レートは、ディフェンダーが最も必要とする情報、すなわち、結果として生じるアクションがどれほど有害であるかを破棄する。
本研究では,7段階の順序尺度(L0〜L6)でエージェントのツールコール軌跡をスコアし,実行された動作が可逆性であったか,他者への到達範囲を超えたか,特権を拡大したかに応じて,アクショングレード調和ルーリックを導入する。
論文 参考訳(メタデータ) (2026-07-08T14:38:01Z) - Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents [93.19140872946842]
大規模言語モデル(LLM)によって駆動されるWebエージェントは、現実の環境にますますデプロイされる。
これにより、一見良質なコンテンツがエージェントの振る舞いを操作する敵の命令を埋め込む、プロンプト・インジェクション・アタックに対して脆弱になる。
実世界のWebエージェントシステムにおいて,損害を体系的に分類し,属性付けするベンチマークである textbfsysname を導入する。
論文 参考訳(メタデータ) (2026-06-11T14:12:43Z) - Trojan's Whisper: Stealthy Manipulation of OpenClaw through Injected Bootstrapped Guidance [23.059379933610163]
ガイダンスインジェクション(Guidance Injection)は、ブートストラップのガイダンスファイルに敵の運用ストーリーを埋め込むステルス攻撃ベクターである。
エクスプロイト,ワークスペース破壊,特権エスカレーション,持続的バックドア設置など,13の攻撃カテゴリにまたがる26の悪意あるスキルを構築した。
我々の攻撃は16.4%から64.2%の確率で成功し、悪意のある行動の大半はユーザーの確認なしに自律的に実行される。
論文 参考訳(メタデータ) (2026-03-20T14:17:56Z) - Measuring and Exploiting Confirmation Bias in LLM-Assisted Security Code Review [6.417595678110472]
ソフトウェアサプライチェーン攻撃において,確認バイアスがLSMベースの脆弱性検出に影響を及ぼすか,また,この障害モードを悪用できるかを検討する。
調査1では,5つのフレーミング条件下で4つの最先端モデルに対して評価された250個のCVE脆弱性/パッチペアに対する制御実験により,確認バイアスを定量化する。
調査2は、既知の脆弱性を再導入する敵のプルリクエストを模倣して、セキュリティの改善やプルリクエストメタデータによる緊急機能修正を実施可能であることを評価する。
論文 参考訳(メタデータ) (2026-03-19T10:40:27Z) - When Actions Go Off-Task: Detecting and Correcting Misaligned Actions in Computer-Use Agents [50.5814495434565]
この研究は、コンピュータ利用エージェント(CUA)における不整合検出を定義し、研究する最初の試みである。
実世界のCUAデプロイメントにおける3つの一般的なカテゴリを特定し、人間の注釈付きアクションレベルのアライメントラベルを用いたリアルな軌跡のベンチマークであるMisActBenchを構築した。
本稿では,実行前に不整合を検知し,構造化されたフィードバックによって繰り返し修正する,実用的で普遍的なガードレールであるDeActionを提案する。
論文 参考訳(メタデータ) (2026-02-09T18:41:15Z) - Poison Once, Control Anywhere: Clean-Text Visual Backdoors in VLM-based Mobile Agents [54.35629963816521]
この研究は、VLMベースのモバイルエージェントをターゲットにした最初のクリーンテキストバックドアアタックであるVIBMAを紹介する。
この攻撃は、視覚的な入力だけを変更することによって、悪意ある振る舞いをモデルに注入する。
クリーンタスクの動作を保ちながら高い成功率を達成できることを示す。
論文 参考訳(メタデータ) (2025-06-16T08:09:32Z) - AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases [73.04652687616286]
本稿では,RAG とRAG をベースとした LLM エージェントを標的とした最初のバックドア攻撃である AgentPoison を提案する。
従来のバックドア攻撃とは異なり、AgentPoisonは追加のモデルトレーニングや微調整を必要としない。
エージェントごとに、AgentPoisonは平均攻撃成功率を80%以上達成し、良質なパフォーマンスに最小限の影響を与える。
論文 参考訳(メタデータ) (2024-07-17T17:59:47Z) - Dissecting Adversarial Robustness of Multimodal LM Agents [70.2077308846307]
我々は、VisualWebArena上に現実的な脅威モデルを用いて、200の敵タスクと評価スクリプトを手動で作成する。
我々は,クロボックスフロンティアLMを用いた最新のエージェントを,リフレクションやツリーサーチを行うエージェントを含む,壊すことに成功している。
AREを使用して、新しいコンポーネントの追加に伴うロバスト性の変化を厳格に評価しています。
論文 参考訳(メタデータ) (2024-06-18T17:32:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。