論文の概要: Beyond Direct Access: Resource Hijacking in LLM Agents
- arxiv url: http://arxiv.org/abs/2608.15108v1
- Date: Sat, 15 Aug 2026 08:16:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.200201
- Title: Beyond Direct Access: Resource Hijacking in LLM Agents
- Title(参考訳): 直接アクセスを超えて: LLMエージェントのリソースハイジャック
- Authors: Puyu Zeng, Qibing Ren,
- Abstract要約: エージェント・リソース・ハイジャックは、攻撃者がエージェントに、そのリソースや資格を得ることなく、自身の目的のために高価値リソースを呼び出し、消費し、転送し、制御するように誘導するセキュリティ・ブラインドスポットである。
ResourceHijackBenchと、リソースハイジャックケースを生成する自動パイプラインを紹介します。
エージェントがアクセス可能な高価値リソースは、重要かつ以前は見落とされたアタックサーフェスを形成する。
- 参考スコア(独自算出の注目度): 4.962896845063574
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model agents are increasingly connected to high-value resources such as computing infrastructure, credentials, usage budgets, identities, private knowledge, communication channels, and organizational workflows. Existing agent security research mainly studies attacks on instructions, data, and tool behaviors, while high-value resources accessible to agents have received much less attention as direct attack targets. We are the first to identify and systematically study agent resource hijacking, a security blind spot in which attackers induce agents to invoke, consume, transfer, or control high-value resources for their own goals without directly obtaining those resources or their credentials. To study this threat, we introduce ResourceHijackBench together with an automated pipeline for generating resource hijacking cases. We organize high-value agent resources into six categories and construct 300 attack scenarios with 900 attack prompts. Each case runs in an isolated local environment that records actual resource use, allowing attacks to be evaluated from agent behavior rather than text responses alone. Without additional defenses, OpenClaw reaches an average attack success rate of 84.06%. The attack remains effective across different model backends, with average success rates ranging from 69.98% to 89.58%. Existing defenses reduce part of the risk, but the strongest evaluated defense still leaves an average attack success rate of 55.11%. These results show that high-value resources accessible to agents form an important and previously overlooked attack surface, and that current agent defenses are not sufficient to protect them from resource hijacking.
- Abstract(参考訳): 大規模言語モデルエージェントは、コンピューティングインフラストラクチャ、資格情報、使用予算、アイデンティティ、プライベートナレッジ、コミュニケーションチャネル、組織ワークフローといった、価値の高いリソースとますます結びついています。
既存のエージェントセキュリティ研究は、主に指示、データ、ツールの動作に対する攻撃を研究するが、エージェントにアクセスできる高価値のリソースは直接攻撃対象としてはあまり注目されていない。
我々は、エージェントリソースのハイジャックを初めて同定し、体系的に研究する。攻撃者がエージェントに、そのリソースや資格を直接取得することなく、自身の目的のために高価値リソースを呼び出し、消費、転送、制御するように誘導するセキュリティ盲点である。
この脅威を研究するために、リソースハイジャックケースを生成するための自動パイプラインとともにResourceHijackBenchを紹介します。
我々は、高価値エージェントリソースを6つのカテゴリに分類し、900のアタックプロンプトで300のアタックシナリオを構築した。
各ケースは、実際のリソース使用を記録する独立したローカル環境で動作し、テキスト応答のみでなく、エージェントの動作から攻撃を評価することができる。
追加の防御がなければ、OpenClawの平均攻撃成功率は84.06%に達する。
この攻撃は様々なモデルのバックエンドで有効であり、平均的な成功率は69.98%から89.58%である。
既存の防御はリスクの一部を減少させるが、最も高い評価を受けた防御力は55.11%の攻撃成功率を残している。
これらの結果から, エージェントがアクセス可能な高価値資源は, 従来見過ごされていた重要な攻撃面を形成し, 現在のエージェント防御では, リソースのハイジャックから保護するには不十分であることが示唆された。
関連論文リスト
- Breadcrumbing Search Agents [118.20284823674382]
LLMベースの検索エージェントは情報検索タスクに広く利用されているが、外部ツールへの依存度は重大なセキュリティリスクをもたらす。
検索およびページ観察を行うチャネルは脆弱なセキュリティ境界であることを示す。
制約付きツール仲介脅威モデルの下では、クエリ毎に1つのコントロールされた結果のみを追加することで、攻撃の成功を大幅に増加させることができる。
論文 参考訳(メタデータ) (2026-08-05T07:57:27Z) - SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction [89.03272793385054]
エージェントスキルはエージェントワークフローにおける特権的な位置を占め、サードパーティスキルを脆弱な攻撃面にする。
我々はスキルベースアタックのベンチマークであるSkillHarmを紹介した。
攻撃成功率はFPPが86.3%、SMPが69.3%である。
論文 参考訳(メタデータ) (2026-06-01T17:45:39Z) - Black-Box Skill Stealing Attack from Proprietary LLM Agents: An Empirical Study [32.698841771877824]
大規模言語モデル(LLM)エージェントは、インストラクション、ツール、リソースを通じて再利用可能な機能をパッケージするスキルに依存している。
高品質なスキルは、専門家の知識、キュレーション、実行の制約をエージェントに埋め込む。
敵は公開エージェントインターフェースと対話して、隠されたプロプライエタリなスキルコンテンツを抽出できる。
論文 参考訳(メタデータ) (2026-04-23T16:18:47Z) - Malice in Agentland: Down the Rabbit Hole of Backdoors in the AI Supply Chain [82.98626829232899]
自分自身のインタラクションからのデータに対する微調整のAIエージェントは、AIサプライチェーン内の重要なセキュリティ脆弱性を導入している。
敵は容易にデータ収集パイプラインに毒を盛り、検出しにくいバックドアを埋め込むことができる。
論文 参考訳(メタデータ) (2025-10-03T12:47:21Z) - Security Challenges in AI Agent Deployment: Insights from a Large Scale Public Competition [101.86739402748995]
44の現実的なデプロイメントシナリオを対象とした,22のフロンティアAIエージェントを対象にしています。
Agent Red Teamingベンチマークを構築し、19の最先端モデルで評価します。
私たちの発見は、今日のAIエージェントの重要かつ永続的な脆弱性を浮き彫りにしたものです。
論文 参考訳(メタデータ) (2025-07-28T05:13:04Z) - The Dark Side of LLMs: Agent-based Attacks for Complete Computer Takeover [0.0]
大規模言語モデル(LLM)エージェントとマルチエージェントシステムは、従来のコンテンツ生成からシステムレベルの妥協まで及ぶセキュリティ脆弱性を導入している。
本稿では,自律エージェント内の推論エンジンとして使用されるLLMのセキュリティを総合的に評価する。
異なる攻撃面と信頼境界がどのように活用され、そのような乗っ取りを組織化できるかを示す。
論文 参考訳(メタデータ) (2025-07-09T13:54:58Z) - AdvAgent: Controllable Blackbox Red-teaming on Web Agents [22.682464365220916]
AdvAgentは、Webエージェントを攻撃するためのブラックボックスのレッドチームフレームワークである。
強化学習に基づくパイプラインを使用して、敵のプロンプトモデルをトレーニングする。
慎重な攻撃設計では、エージェントの弱点を効果的に活用し、ステルス性と制御性を維持する。
論文 参考訳(メタデータ) (2024-10-22T20:18:26Z) - AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases [73.04652687616286]
本稿では,RAG とRAG をベースとした LLM エージェントを標的とした最初のバックドア攻撃である AgentPoison を提案する。
従来のバックドア攻撃とは異なり、AgentPoisonは追加のモデルトレーニングや微調整を必要としない。
エージェントごとに、AgentPoisonは平均攻撃成功率を80%以上達成し、良質なパフォーマンスに最小限の影響を与える。
論文 参考訳(メタデータ) (2024-07-17T17:59:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。