論文の概要: Distributed Attacks in Persistent-State AI Control
- arxiv url: http://arxiv.org/abs/2607.02514v2
- Date: Wed, 08 Jul 2026 20:25:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 16:54:55.150226
- Title: Distributed Attacks in Persistent-State AI Control
- Title(参考訳): 永続型AI制御における分散攻撃
- Abstract要約: Iterative VibeCodingは、有能だが潜在的に信頼できないAIを安全にデプロイする研究である。
エベイジョンは、最先端のモニターモデルに対して高い水準を維持している。
本稿では,PR間の不審なビルドを追跡する,ステートフルなリンクトラッカーモニタを提案する。
- 参考スコア(独自算出の注目度): 0.8411355178908656
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As AI coding agents become more autonomous, they increasingly ship code iteratively, with the codebase persisting across sessions. This persistence creates a new attack surface: a misaligned or prompt-injected agent can distribute attacks across pull requests (PRs) and time its payload for the PR with the best natural cover. To study the resulting dynamics, we introduce Iterative VibeCoding, a setting for AI control, the study of safely deploying capable but potentially untrusted AI. In Iterative VibeCoding, a coding agent builds software over a sequence of PRs in a persistent codebase while pursuing a covert side task. Our benchmark includes two task families: CLI tools and Flask web services, across 20 total task variations. We use Claude Sonnet 4.5 as the attack agent and GPT-4o as the monitor. We compare gradual attacks, which distribute the side task across PRs, against non-gradual attacks concentrated in a single PR. No single monitor is robust to both: which strategy evades best (success while evading the monitor) depends on the monitor type, so a defender cannot close off both gradual and non-gradual attacks with any one monitor. High evasion (>= 65%) generalizes across model attack agent backends (Sonnet 4.5, Gemini 3.1 Pro, Kimi K2.5), confirming this is a property of the persistent-state attack surface rather than a single model's capability. Evasion also remains high across state-of-the-art monitor models and the gap between gradual and non-gradual evasion widens for more capable models. We introduce a stateful link-tracker monitor that tracks suspicious buildup across PRs. On both task families, it detects gradual attacks substantially better than diff monitors that merely see more accumulated history. Combining this stronger monitor with trajectory monitors in a four-monitor ensemble reduces gradual-attack evasion from 93% under the weakest standard diff monitor to 47%.
- Abstract(参考訳): AIコーディングエージェントがより自律的になると、コードベースがセッション間で持続するにつれて、コードを反復的に出荷するようになる。
ミスアライメントあるいはプロンプトインジェクトされたエージェントは、プルリクエスト(PR)にまたがって攻撃を分散し、PRのペイロードを最高の自然なカバーで処理することができる。
結果のダイナミクスを研究するために、AI制御のセッティングであるIterative VibeCodingを紹介します。
Iterative VibeCodingでは、コーディングエージェントが、秘密のサイドタスクを追求しながら、永続的なコードベース内の一連のPRの上にソフトウェアを構築する。
私たちのベンチマークには、CLIツールとFrask Webサービスという2つのタスクファミリが含まれています。
我々は攻撃剤としてClaude Sonnet 4.5、モニターとしてGPT-4oを使用する。
我々は,一方のPRに集中している非段階的攻撃に対して,側面タスクをPRに分散する段階的攻撃を比較した。
どの戦略が最良(モニターを避けながら)回避するかはモニタータイプに依存するため、ディフェンダーはいずれかのモニタで段階的な攻撃と非段階的な攻撃の両方を閉じることができない。
高回避(>=65%)は、モデル攻撃エージェントバックエンド(Sonnet 4.5、Gemini 3.1 Pro、Kim K2.5)をまたいだ一般化であり、これは単一のモデルの性能ではなく永続的な攻撃面の特性であることを確認した。
エベイジョンは、最先端のモニターモデルや、より有能なモデルに対する段階的および非段階的な回避幅のギャップにも高いままである。
本稿では,PR間の不審なビルドを追跡する,ステートフルなリンクトラッカーモニタを提案する。
どちらのタスクファミリでも、より蓄積した履歴を単に見る差分モニターよりも、徐々に攻撃を検知する。
この強力なモニターとトラジェクトリーモニターを4つのモニターアンサンブルに組み合わせることで、最も弱い標準差分モニターの下での段階的な攻撃回避を93%から47%に削減できる。
関連論文リスト
- ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D [11.818511808737037]
我々はResearchArenaを用いた自動AI研究開発のためのAI制御の評価を行った。
メインタスクと2種類の隠れサイドタスクをペアにします。
トレーニングデータに隠されたサボタージュは、最もキャッチが難しいのです。
論文 参考訳(メタデータ) (2026-07-21T17:41:12Z) - Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors [4.246803713067298]
我々は、複数のエージェントが悪質な目標を共同で狙う分散攻撃を形式化したマルチエージェントAI制御について研究する。
合成AIラボFakeLab(9つのサービス、86の良質なタスク、4つの攻撃目標)を開発した。
攻撃に協力するエージェントが増えるにつれて、エージェントごとの監視が攻撃者を捕まえる可能性が低下します。
論文 参考訳(メタデータ) (2026-07-08T13:03:25Z) - Stateful Online Monitoring Catches Distributed Agent Attacks [63.00394432922707]
我々は、リアルタイムクラスタリングを用いて、多くのエージェントの転写にまたがる弱い疑わしい信号を収集するオンラインステートフルモニターを開発した。
本研究の結果は,孤立したテキストではなく,ユーザグループを優先する,新たな安全モニタのクラスに向けられたものである。
論文 参考訳(メタデータ) (2026-05-29T17:57:00Z) - SLEIGHT-Bench: A Benchmark of Evasion Attacks Against Agent Monitors [3.989565392866092]
SLEIGHT-Bench (Subtle Low-itEration Insight-Guided Harmful Transcripts) は、11カテゴリにわたる40の攻撃を含む合成写本のベンチマークである。
40件中20件はOpus 4.6モニターで捕捉されず、10回の試験で1%の偽陽性率で思考を延長し、全体のキャッチレートは32%である。
論文 参考訳(メタデータ) (2026-05-15T20:46:46Z) - MonitoringBench: Semi-Automated Red-Teaming for Agent Monitoring [0.0]
我々は、監視エージェントに対するより困難な攻撃を露呈する、レッドチーム方式を導入する。
その結果、フロンティアモニターは不審な動作を検出することが多いが、説得のために倒れたり、不審な点を適切に校正できないことが判明した。
MonitoringBenchは、監視機能と障害モードを評価するための2,644のアタックトラジェクトリのベンチマークである。
論文 参考訳(メタデータ) (2026-05-10T18:04:31Z) - WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents [117.65855863464863]
Webエージェントはインジェクション攻撃に対して非常に脆弱である。
システム・プロンプト・ディフェンス(英語版)やエージェントの直接微調整を含む既存の防御は、効果が限られている。
本稿では,WebAgentGuardを導入し,インジェクション検出のためのマルチモーダルガードモデルを提案する。
論文 参考訳(メタデータ) (2026-04-14T04:50:35Z) - Async Control: Stress-testing Asynchronous Control Measures for LLM Agents [2.7146936326590425]
非同期モニタリングにおいて,モニタリングシステムがエージェントの動作を後回しにレビューする手法について検討する。
同期監視とは異なり、このアプローチは実行時のレイテンシを課すことなく、不可逆的な害が起こる前に攻撃を妨害しようとする。
私たちは、モニター開発を、ブルーチーム(モニターを設計する)とレッドチーム(破壊エージェントを作成する)の敵対的なゲームとして扱う。
論文 参考訳(メタデータ) (2025-12-15T16:56:28Z) - Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols [80.68060125494645]
プロトコルとモニタモデルを知っている信頼できないモデルによるアダプティブアタックについて検討する。
我々は、攻撃者がモデル出力に公知またはゼロショットプロンプトインジェクションを埋め込む単純な適応攻撃ベクトルをインスタンス化する。
論文 参考訳(メタデータ) (2025-10-10T15:12:44Z) - BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks [58.959622170433725]
BlindGuardは、攻撃固有のラベルや悪意のある振る舞いに関する事前の知識を必要とせずに学習する、教師なしの防御方法である。
BlindGuardはマルチエージェントシステムにまたがる多様な攻撃タイプ(即時注入、メモリ中毒、ツール攻撃)を効果的に検出する。
論文 参考訳(メタデータ) (2025-08-11T16:04:47Z) - Poison Once, Control Anywhere: Clean-Text Visual Backdoors in VLM-based Mobile Agents [54.35629963816521]
この研究は、VLMベースのモバイルエージェントをターゲットにした最初のクリーンテキストバックドアアタックであるVIBMAを紹介する。
この攻撃は、視覚的な入力だけを変更することによって、悪意ある振る舞いをモデルに注入する。
クリーンタスクの動作を保ちながら高い成功率を達成できることを示す。
論文 参考訳(メタデータ) (2025-06-16T08:09:32Z) - Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation [56.102976602468615]
エージェントコーディング環境における報酬ハッキングのために,OpenAI o3-miniのようなフロンティア推論モデルを監視することができることを示す。
最適化が多すぎると、エージェントは難解な報酬のハッキングを学び、その意図を思考の連鎖の中に隠してしまう。
論文 参考訳(メタデータ) (2025-03-14T23:50:34Z) - Dissecting Adversarial Robustness of Multimodal LM Agents [70.2077308846307]
我々は、VisualWebArena上に現実的な脅威モデルを用いて、200の敵タスクと評価スクリプトを手動で作成する。
我々は,クロボックスフロンティアLMを用いた最新のエージェントを,リフレクションやツリーサーチを行うエージェントを含む,壊すことに成功している。
AREを使用して、新しいコンポーネントの追加に伴うロバスト性の変化を厳格に評価しています。
論文 参考訳(メタデータ) (2024-06-18T17:32:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。