論文の概要: Trust Me, Import This: Dependency Steering Attacks via Malicious Agent Skills
- arxiv url: http://arxiv.org/abs/2605.09594v1
- Date: Sun, 10 May 2026 15:13:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.324839
- Title: Trust Me, Import This: Dependency Steering Attacks via Malicious Agent Skills
- Title(参考訳): 信頼する、インポートする:悪質なエージェントスキルによる依存性のステアリング攻撃
- Authors: Yiyong Liu, Chia-Yi Hsu, Chun-Ying Huang, Michael Backes, Rui Wen, Chia-Mu Yu,
- Abstract要約: 本稿では、悪意あるSkillがコーディングエージェントを攻撃者制御パッケージにバイアスする攻撃パラダイムであるDependency Steeringを紹介する。
この結果から,永続的なエージェント命令がソフトウェアのサプライチェーンアタックサーフェスを形成することが明らかとなった。
- 参考スコア(独自算出の注目度): 25.627983175254958
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-powered coding agents increasingly make software supply chain decisions. They generate imports, recommend packages, and write installation commands. Prior work showed that these systems can hallucinate non-existent package names, which attackers may register as malicious packages. In this paper, we show that this risk is not only a passive model failure. It can be actively induced through the persistent Skill artifact. We introduce Dependency Steering, an attack paradigm in which a malicious Skill biases a coding agent toward an attacker-controlled package during benign coding tasks. The attack does not require modifying model weights, training data, or user prompts. To construct realistic attacks, we design a Skill-level optimization method that searches for localized semantic edits that preserve the apparent purpose of the original Skill while increasing targeted package generation. Across multiple coding-oriented LLMs and programming benchmarks, Dependency Steering achieves high targeted hallucination rates, transfers across models and task domains, and remains difficult for evaluated Skill scanners and LLM-based auditors to detect. Our results show that persistent agent instructions form an underexplored software supply chain attack surface.
- Abstract(参考訳): LLMベースのコーディングエージェントは、ソフトウェアサプライチェーンの決定をますます進めている。
インポートを生成し、パッケージを推奨し、インストールコマンドを書く。
以前の研究では、攻撃者が悪意のあるパッケージとして登録できる既存のパッケージ名を幻覚させることができた。
本稿では,このリスクは受動的モデル失敗だけではないことを示す。
永続的なスキルアーティファクトを通じて積極的に誘導することができる。
本稿では、悪意のあるSkillが、良質なコーディングタスク中に攻撃者が制御するパッケージに対して、コーディングエージェントをバイアスする攻撃パラダイムであるDependency Steeringを紹介する。
この攻撃では、モデルの重み付け、トレーニングデータ、ユーザープロンプトを変更する必要はない。
現実的な攻撃を構築するために,ターゲットパッケージ生成を増大させながら,本来のスキルの明確な目的を保った局所的な意味編集を探索するスキルレベルの最適化手法を設計する。
複数のコーディング指向のLLMとプログラミングベンチマークを通じて、Dependency Steeringは、高い目標の幻覚率、モデルとタスクドメイン間の転送を実現し、評価されたスキルスキャナやLLMベースの監査者が検出するのは難しいままである。
この結果から,永続的なエージェント命令がソフトウェアサプライチェーンアタックサーフェスを形成することが明らかとなった。
関連論文リスト
- SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - Adversarial Reinforcement Learning for Large Language Model Agent Safety [20.704989548285372]
大きな言語モデル(LLM)エージェントは、複雑なタスクを完了するためにGoogle Searchのようなツールを利用することができる。
現在の防衛戦略は、既知の攻撃のデータセットに精巧なLLMエージェントを頼っている。
対戦型強化学習(RL)を両プレイヤーゼロサムゲームとして定式化して活用する新しいフレームワークであるエージェント安全のための敵強化学習(ARLAS)を提案する。
論文 参考訳(メタデータ) (2025-10-06T23:09:18Z) - Cuckoo Attack: Stealthy and Persistent Attacks Against AI-IDE [64.47951172662745]
Cuckoo Attackは、悪意のあるペイロードを構成ファイルに埋め込むことで、ステルス性と永続的なコマンド実行を実現する新しい攻撃である。
攻撃パラダイムを初期感染と持続性という2つの段階に分類する。
当社は、ベンダーが製品のセキュリティを評価するために、実行可能な7つのチェックポイントを提供しています。
論文 参考訳(メタデータ) (2025-09-19T04:10:52Z) - AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents [54.29555239363013]
本稿では,間接的なインジェクション脆弱性を自動的に検出し,悪用するための汎用的なブラックボックスファジリングフレームワークであるAgentVigilを提案する。
我々はAgentVigilをAgentDojoとVWA-advの2つの公開ベンチマークで評価し、o3-miniとGPT-4oに基づくエージェントに対して71%と70%の成功率を達成した。
攻撃を現実世界の環境に適用し、悪質なサイトを含む任意のURLに誘導するエージェントをうまく誘導する。
論文 参考訳(メタデータ) (2025-05-09T07:40:17Z) - Importing Phantoms: Measuring LLM Package Hallucination Vulnerabilities [11.868859925111561]
大規模言語モデル(LLM)はプログラマのツールキットに不可欠なツールとなっている。
コードを幻覚させる傾向は、悪意あるアクターがソフトウェアサプライチェーンの広い範囲に脆弱性を導入するために利用することができる。
論文 参考訳(メタデータ) (2025-01-31T10:26:18Z) - ShadowCode: Towards (Automatic) External Prompt Injection Attack against Code LLMs [56.46702494338318]
本稿では,コード指向の大規模言語モデルに対する(自動)外部プロンプトインジェクションという,新たな攻撃パラダイムを紹介する。
コードシミュレーションに基づいて誘導摂動を自動生成する,シンプルで効果的な方法であるShadowCodeを提案する。
3つの人気のあるプログラミング言語にまたがる31の脅威ケースを発生させるため、13の異なる悪意のある目標に対して本手法を評価した。
論文 参考訳(メタデータ) (2024-07-12T10:59:32Z) - Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment [31.24530091590395]
本研究では,大規模言語モデルの活性化層にトロイの木馬ステアリングベクトルを注入する,Trojan Activation Attack (TA2) と呼ばれる攻撃シナリオについて検討する。
実験の結果,TA2は高効率であり,攻撃効率のオーバーヘッドがほとんどあるいは全くないことがわかった。
論文 参考訳(メタデータ) (2023-11-15T23:07:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。