論文の概要: SynChain: Inducing Computer-Use Agent Systems to Construct Their Own Attack Chains
- arxiv url: http://arxiv.org/abs/2608.06862v1
- Date: Fri, 07 Aug 2026 06:39:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.37978
- Title: SynChain: Inducing Computer-Use Agent Systems to Construct Their Own Attack Chains
- Title(参考訳): SynChain: 独自のアタックチェーンを構築するためにコンピュータ利用エージェントシステムを導入する
- Authors: Fuyao Zhang, Jiaming Zhang, Che Wang, Boyang Chen, Yurong Hao, Xiongtao Sun, Guowei Guan, Blaise Delattre, Yang Cao, Wei Yang Bryan Lim,
- Abstract要約: 自律的に合成された人工物の構造的冗長性に、悪質な影響がいかに隠蔽されるかを示す。
永続性を考慮した微調整を利用した自己合成攻撃パラダイムであるSynChainを紹介する。
OpenClaw、Codex、Claude Codeの4つの防御設定による実験は、SynChainが高い攻撃成功を達成したことを示している。
- 参考スコア(独自算出の注目度): 17.198145080992962
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Computer-use agents~(CUAs) have transformed large language models into persistent execution systems capable of generating, storing, and reusing artifacts like skills and memory entries. However, existing security defenses largely treat attacks as externally triggered or temporally bounded, leaving a critical gap in addressing how compromise can propagate internally through an agent's own persistent state. We reveal that malicious influence can be covertly embedded into the structural redundancies of autonomously synthesized artifacts, allowing it to survive internal state updates and bypass standard vetting mechanisms. To formalize this threat, we introduce SynChain, a self-synthesized attack paradigm utilizing persistence-aware directed supervised fine-tuning to induce agents to create poisoned yet benign-looking artifacts. To systematically evaluate this propagation, we construct CUAChain, a dataset comprising 30 benign task chains and three attack objectives. SynChain enables dormant payloads to seamlessly reactivate in future workflows as trusted context, operating entirely without new malicious exogenous inputs. Extensive experiments on OpenClaw, Codex, and Claude Code under four defense settings demonstrate that SynChain achieves high attack success and outperforms adapted baselines, proving that securing CUAs requires provenance-aware reasoning over cross-task execution trajectories.
- Abstract(参考訳): コンピュータ利用エージェント~(CUA)は、大規模な言語モデルを、スキルやメモリエントリなどのアーティファクトの生成、保存、再利用が可能な永続的な実行システムに変換する。
しかし、既存のセキュリティ防衛は、攻撃を外部的に引き起こされたり、時間的に拘束されたものとして扱うことが多く、妥協がエージェント自身の永続状態を通じて内部的にどのように伝播するかに対処する上で重要なギャップを残している。
我々は、有害な影響が、自律的に合成されたアーティファクトの構造的冗長性に隠蔽され、内部状態の更新を乗り越え、標準ベッティングメカニズムをバイパスすることができることを明らかにした。
この脅威を形式化するために、SynChainを紹介します。これは、永続性を考慮した教師付き微調整を利用した自己合成攻撃パラダイムで、エージェントを誘導し、有毒で良質な人工物を作成する。
この伝播を系統的に評価するために,30のタスクチェーンと3つの攻撃目標からなるデータセットCUAChainを構築した。
SynChainは、将来のワークフローを信頼されたコンテキストとしてシームレスに再起動し、新しい悪意のある外因性入力なしで完全に動作するようにする。
OpenClaw、Codex、Claude Codeの4つの防御設定による大規模な実験は、SynChainが高い攻撃成功を達成し、適応されたベースラインを上回っていることを示している。
関連論文リスト
- The Chronos Vulnerability: A Taxonomy of Temporal Persistence and Memory-Based Deception in Agentic AI [0.0]
本研究では、永続性に基づく攻撃の脅威モデルと、ダイナミクス・ブラインドネスの脅威を定式化する。
人工知能におけるステートレス生成モデルからステートフルで自律的なエージェントへの移行は、アーキテクチャの進化を表している。
本研究では,GPUベースのTrusted Environments(TEEs)とZero-Trustメモリアーキテクチャによる,診断トラジェクトリガードレール(AgentDoG),形式的時間的検証(Agent-C),免疫学的メモリコンセンサス(A-MemGuard),ハードウェアアンコレッド信頼などの新興フレームワークを分類し,深層景観を合成する。
論文 参考訳(メタデータ) (2026-07-20T22:50:33Z) - Operational Hallucination and Safety Drift in AI Agents [0.3823356975862005]
ツール使用自律エージェントのプランナーとして機能する大規模言語モデル(LLM)は、マルチターン実行における動的信頼性のリスクを導入する。
本稿では,複数のLLM(Safety Drift)とOperational Hallucination(Operational Hallucination)の2つの障害モードを実証的に特徴付ける。
本稿では、インテント-アクション整合性チェック、状態追跡、強制終了プリミティブを組み込んだ、軽量でプラグ&プレイのアーキテクチャ青写真であるAction-Aware Supervision Layerを提案する。
論文 参考訳(メタデータ) (2026-07-20T17:01:50Z) - Provably Secure Agent Guardrail [89.79561918065122]
既存の防衛アーキテクチャは経験的セマンティックガードレールと確率論的大モデル調整器に依存している。
本稿では,論理的推論の基本的制約に基づくエージェントのための新しいセキュリティパラダイムを提案する。
論文 参考訳(メタデータ) (2026-05-28T02:12:41Z) - Exploiting LLM Agent Supply Chains via Payload-less Skills [10.141577783380281]
本稿では、自律的なコーディング環境をターゲットにしたペイロードレスサプライチェーンアタックであるSemantic Compliance Hijacking(SCH)を紹介する。
SCHアプローチは、悪意のある目標を、必要なコンプライアンスルールとしてフォーマットされた非構造化の自然言語命令に変換する。
この発見は、この脅威の広範性を示し、SCHは機密性侵害に対して77.67%の最高成功率を達成した。
論文 参考訳(メタデータ) (2026-05-14T06:55:47Z) - Agentic AI as a Cybersecurity Attack Surface: Threats, Exploits, and Defenses in Runtime Supply Chains [7.8562769948743965]
大規模言語モデル(LLM)上に構築されたエージェントシステムは、テキスト生成を超えて情報を自律的に取得し、ツールを呼び出す。
このランタイム実行モデルは、アタックサーフェスをビルド時のアーティファクトから推論時の依存性に変更し、信頼できないデータと確率論的能力解決を通じて操作するエージェントを公開します。
我々はこれらのリスクを統合ランタイムフレームワーク内で体系化し、脅威をデータサプライチェーン攻撃(過渡的コンテキスト注入と永続的メモリ中毒)に分類する。
また,ウイルスエージェントループは,コードレベルの欠陥を生かさずに自己増殖するワームのベクターとして機能する。
論文 参考訳(メタデータ) (2026-02-23T06:57:57Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents [60.98294016925157]
AIエージェントは、悪意のあるコンテンツがエージェントの行動をハイジャックして認証情報を盗んだり、金銭的損失を引き起こすような、インジェクション攻撃に弱い。
CUAのためのシングルショットプランニングでは、信頼できるプランナーが、潜在的に悪意のあるコンテンツを観察する前に、条件付きブランチで完全な実行グラフを生成する。
このアーキテクチャ分離は命令インジェクションを効果的に防止するが、ブランチステアリング攻撃を防ぐには追加の対策が必要であることを示す。
論文 参考訳(メタデータ) (2026-01-14T23:06:35Z) - Malice in Agentland: Down the Rabbit Hole of Backdoors in the AI Supply Chain [82.98626829232899]
自分自身のインタラクションからのデータに対する微調整のAIエージェントは、AIサプライチェーン内の重要なセキュリティ脆弱性を導入している。
敵は容易にデータ収集パイプラインに毒を盛り、検出しにくいバックドアを埋め込むことができる。
論文 参考訳(メタデータ) (2025-10-03T12:47:21Z) - Compromising Embodied Agents with Contextual Backdoor Attacks [69.71630408822767]
大型言語モデル(LLM)は、エンボディドインテリジェンスの発展に変化をもたらした。
本稿では,このプロセスにおけるバックドアセキュリティの重大な脅威を明らかにする。
ほんの少しの文脈的デモンストレーションを毒殺しただけで、攻撃者はブラックボックスLDMの文脈的環境を隠蔽することができる。
論文 参考訳(メタデータ) (2024-08-06T01:20:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。