論文の概要: Surviving the Router: Optimizing Skill Injections for Retrieval and Execution
- arxiv url: http://arxiv.org/abs/2610.08098v1
- Date: Tue, 06 Oct 2026 10:28:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.933599
- Title: Surviving the Router: Optimizing Skill Injections for Retrieval and Execution
- Title(参考訳): ルータの存続:検索と実行のためのスキルインジェクションの最適化
- Abstract要約: CORSAは、関連するタスクのクラスタ間での検索と実行の両方にスキルインジェクションを最適化するルータ対応の攻撃である。
実験の結果,CORSAは既存のスキルインジェクションよりも検索とエンド・ツー・エンド・アタックの成功を大幅に改善することがわかった。
- 参考スコア(独自算出の注目度): 10.392988089149467
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI agents increasingly rely on modular third-party "skills" that are dynamically selected by skill routers to execute complex tasks. While recent studies highlight the threat of prompt injections embedded in these skills, existing evaluations often assume settings where the malicious skill is already selected for execution. We show that this assumption can substantially overestimate attack success. In realistic multi-skill environments, injected skills must first compete for retrieval, reducing the effective attack success rate (ASR) of existing injections by 87-97%. To address this limitation, we introduce CORSA (Cluster Optimization for Router-Aware Skill Attacks), a router-aware attack that optimizes skill injections for both retrieval and execution across clusters of related tasks. We evaluate skill injection attacks under router-managed multi-skill settings by extending the benchmark introduced by SkillRouter with eight malicious payload categories. CORSA uses successive optimization stages to first improve retrieval and then optimize end-to-end attack success, while we evaluate user utility and injection naturalism separately. Our experiments show that CORSA substantially improves both retrieval and end-to-end attack success over existing skill injections while preserving user utility, and that the resulting attacks transfer across different router architectures and LLM backbones.
- Abstract(参考訳): AIエージェントは、複雑なタスクを実行するために、スキルルータによって動的に選択されるモジュール化されたサードパーティの“スキル”にますます依存している。
最近の研究では、これらのスキルに組み込まれたプロンプトインジェクションの脅威が強調されているが、既存の評価では、実行時に悪意のあるスキルがすでに選択されている設定を前提としていることが多い。
この仮定は攻撃の成功を著しく過大評価できることを示す。
現実的なマルチスキル環境では、インジェクションされたスキルはまず検索のために競争し、既存のインジェクションの効果的な攻撃成功率(ASR)を87-97%削減する必要がある。
この制限に対処するため、我々はCORSA(Cluster Optimization for Router-Aware Skill Attacks)を導入する。
我々は、SkillRouterが導入したベンチマークを8つの悪意のあるペイロードカテゴリで拡張することにより、ルータが管理するマルチスキル設定下でのスキルインジェクション攻撃を評価する。
CORSAは連続的な最適化段階を用いて、まず検索を改善し、次にエンド・ツー・エンドの攻撃成功を最適化し、ユーザの有用性とインジェクション・ナチュリズムを別々に評価する。
実験により,CORSAは既存スキルインジェクションの検索とエンド・ツー・エンドアタックの成功を,ユーザ・ユーティリティを保ちながら大幅に改善し,異なるルータ・アーキテクチャとLLMバックボーン間で攻撃が伝達されることが判明した。
関連論文リスト
- Self-Reflection Fine-Tuning: Enhancing Agent Security against Prompt Injection Attacks from Failure Experience [83.9792313419956]
Self-Reflection Fine-Tuning(SRFT)は、エージェントが自身の障害経験から学習することで堅牢性を向上させるためのトレーニングフレームワークである。
我々はこのフレームワークをLlama-3.1-8B-InstructとQwen3-8B上に構築したSR-Agentでインスタンス化し、静的および適応的なプロンプトインジェクションベンチマークで評価する。
論文 参考訳(メタデータ) (2026-10-03T03:45:44Z) - ECLIPSE: Self-Evolving Stealthy Prompt Injection Attack against Long-Horizon Agentic Systems [24.074758221000124]
大規模言語モデル(LLM)エージェントは、繰り返しツールコールによって長期タスクの計画と実行が可能になった。
本研究では, 長期エージェントシステムのための自己進化型, ステルス型プロンプトインジェクションフレームワーク ECLIPSE を提案する。
ECLIPSEは2つのコンポーネントを通じて直接ユーザプロンプトインジェクションと間接ツールサイドインジェクションを組み合わせる。
論文 参考訳(メタデータ) (2026-08-31T08:32:22Z) - Defending against Adaptive Prompt Injection Attacks via Reasoning-enabled Task Alignment [25.752599132396437]
間接的なプロンプトインジェクションは、エージェントがタスク実行中に検索するサードパーティデータに悪意のある命令を埋め込むことによって、LLMベースのエージェントをハイジャックする。
既存のディフェンスでは、静的なベンチマークでほぼゼロの攻撃成功率を報告しているが、最近のアダプティブ評価では、攻撃者がデプロイされたディフェンスに対して最適化を許せば、これらの結果は崩壊する。
本稿では,攻撃者が制御するデータではなく,ユーザタスクに対する防衛判断を基礎としたトレーニングベースのRETAを提案する。
論文 参考訳(メタデータ) (2026-06-13T19:15:44Z) - SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction [89.03272793385054]
エージェントスキルはエージェントワークフローにおける特権的な位置を占め、サードパーティスキルを脆弱な攻撃面にする。
我々はスキルベースアタックのベンチマークであるSkillHarmを紹介した。
攻撃成功率はFPPが86.3%、SMPが69.3%である。
論文 参考訳(メタデータ) (2026-06-01T17:45:39Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - Defense Against Indirect Prompt Injection via Tool Result Parsing [5.69701430275527]
LLMエージェントは間接的なプロンプトインジェクションからエスカレートする脅威に直面している。
この脆弱性は、エージェントが物理的な環境をより直接的に制御するようになると、重大なリスクをもたらす。
そこで本稿では,LLMに対してツール解析による正確なデータを提供するとともに,注入された悪意のあるコードを効果的にフィルタリングする手法を提案する。
論文 参考訳(メタデータ) (2026-01-08T10:21:56Z) - TopicAttack: An Indirect Prompt Injection Attack via Topic Transition [92.26240528996443]
大規模言語モデル(LLM)は間接的なインジェクション攻撃に対して脆弱である。
提案するTopicAttackは,LLMに生成した遷移プロンプトを生成し,徐々にトピックをインジェクション命令にシフトさせる。
提案手法は, インジェクトからオリジナルへのアテンション比が高く, 成功確率が高く, ベースライン法よりもはるかに高い比を達成できることがわかった。
論文 参考訳(メタデータ) (2025-07-18T06:23:31Z) - Raij\=u: Reinforcement Learning-Guided Post-Exploitation for Automating
Security Assessment of Network Systems [0.0]
Raij=uフレームワークは強化学習駆動の自動化アプローチである。
我々は2つのRLアルゴリズムを実装し、知的行動を行うことのできる特殊エージェントを訓練する。
エージェントは55段階未満の攻撃で84%以上の攻撃を成功させる。
論文 参考訳(メタデータ) (2023-09-27T09:36:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。