論文の概要: Daydreaming: Stealing Hidden Agent Skills through Black-Box Task Interaction
- arxiv url: http://arxiv.org/abs/2608.26733v1
- Date: Thu, 27 Aug 2026 07:26:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.287641
- Title: Daydreaming: Stealing Hidden Agent Skills through Black-Box Task Interaction
- Title(参考訳): ダイドレミング:ブラックボックスのタスクインタラクションによる隠れエージェントスキルのステルス
- Authors: Yu-Lin Tsai, Yu-An Lu, Ci-Yang Tsai, Muxi Lyu, Raluca Ada Popa, Chia-Mu Yu,
- Abstract要約: 私たちは、ブラックボックスのタスクインタラクションを通じてマルチファイルスキルを盗む、実行専用アタックであるDaydreamingを紹介します。
被害者は、そのスキルを明らかにしたり、再建を格付けしたりすることはない。
個々の振る舞いをテストし、アタッカーがコントロールするシャドウエージェントを使用して設計を選択し、格納された犠牲者結果とローカル実行チェックを使用して各ファイルを完成させる。
- 参考スコア(独自算出の注目度): 15.608916622332368
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agent skills bundle instructions, reference data, and executable helpers that let a general agent perform specialized tasks. Hosted providers can keep these files secret while selling access to task results, making the skill itself a valuable target. Existing disclosure defenses can block requests that ask for the skill or reproduce its text, but they cannot block customers from submitting the ordinary tasks the service is built to complete. We present Daydreaming, an execution-only attack that steals a multi-file skill through black-box task interactions. The victim is never asked to reveal the skill or grade a reconstruction. Instead, Daydreaming adaptively creates crafted tasks whose results distinguish possible hidden behaviors. It tests individual behaviors, uses attacker-controlled shadow agents to choose a design, and completes each file using stored victim results and local execution checks. We formalize three nested threat levels of access as Differential, Trace, and Output, and focus on Output, where the attacker sees only the final response and returned files. Across 7 skills and 4 victim models, Daydreaming recovers 86.8% of the original skill's capability at Output, outperforming SigLeak by almost 4x. It produces installable skills using a median of 32 victim calls per skill even with disclosure defenses enabled. These results show that hiding skill files and filtering direct disclosure do not, by themselves, prevent functional reconstruction through normal use.
- Abstract(参考訳): エージェントスキルは、一般的なエージェントが特別なタスクを実行することを可能にする命令、参照データ、実行可能なヘルパーをバンドルする。
ホストされたプロバイダは、タスク結果へのアクセスを売っている間、これらのファイルを秘密にしておくことができる。
既存の開示防御は、スキルを要求するリクエストをブロックしたり、テキストを再生したりできるが、サービスは完成するために構築されている通常のタスクを顧客に送信するのをブロックすることはできない。
私たちは、ブラックボックスのタスクインタラクションを通じてマルチファイルスキルを盗む、実行専用アタックであるDaydreamingを紹介します。
被害者は、そのスキルを明らかにしたり、再建を格付けしたりすることはない。
代わりにDaydreamingは、隠れた振る舞いを区別するタスクを適応的に作成する。
個々の振る舞いをテストし、アタッカーがコントロールするシャドウエージェントを使用して設計を選択し、格納された犠牲者結果とローカル実行チェックを使用して各ファイルを完成させる。
我々は3つのネストされた脅威レベルを差分、トレース、アウトプットとして定式化し、攻撃者が最終応答のみを見て返送するアウトプットにフォーカスする。
7つのスキルと4つの犠牲者モデルで、デイドレミングはアウトプットにおける元のスキル能力の86.8%を回復し、SigLeakをほぼ4倍に上回った。
公開防御が有効であっても、スキル毎の32人の犠牲者コールを中央値で使用して、インストール可能なスキルを生成する。
これらの結果から,隠蔽スキルファイルや直接開示のフィルタリングは,通常の使用による機能的再構築を未然に防ぐことができないことがわかった。
関連論文リスト
- Behavioral Skill Reconstruction: Reconstructing Hidden Functionality from LLM Agent Skills [8.044145840544271]
本研究では,攻撃者が有効なタスク要求と観察された応答を用いて隠れたスキルの関数的クローンを構築する行動スキル再構築(BSR)について検討する。
SkillCloneは、その公開広告からインターフェース仮説を形成し、構造化された良性プローブを発行し、実行可能レプリカを作成し、被害者のスキルに対する差分検証によって繰り返し修復することで、ターゲットスキルをクローンするブラックボックスアタックである。
論文 参考訳(メタデータ) (2026-08-04T19:51:15Z) - Agent Skills Matter: Inferring Proprietary Skills from Execution Trajectories [28.506562107355652]
本稿では,エージェント動作におけるスキルシグネチャの繰り返しを利用するフレームワークであるSigLeakを紹介する。
多様な、意思決定に富んだ診断タスクを構築し、スキル対応とスキル障害のトラジェクトリとを対比し、分離されたパターンから再構築されたスキルを反復的に洗練する。
平均的なスキル障害参照よりも成功率を6.88ポイント引き上げ、総合スキルシムを達成している。
論文 参考訳(メタデータ) (2026-07-28T10:40:59Z) - SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - SkillComposer: Learning to Evolve Agent Skills for Specification and Generalization [99.18305770138677]
エージェントスキルは、エージェントの推論とアクションをガイドする再利用可能な戦略である。
現在の技術構築手法は、問題を一発抽出として扱う。
本稿では,スキル構築を3つの学習可能な操作に分解するフレームワークであるSkillComposerを紹介する。
論文 参考訳(メタデータ) (2026-06-04T12:16:08Z) - SkillGuard: A Permission Framework for Agent Skills [14.787581333168859]
我々はスキル中心のパーミッションフレームワークであるSkillGuardを紹介した。
SkillGuardを実世界の315のスキルとSkillInjectで評価した。
論文 参考訳(メタデータ) (2026-06-02T02:01:53Z) - COLLEAGUE.SKILL: Automated AI Skill Generation via Expert Knowledge Distillation [58.84646485020439]
人為的なAIスキルを生成するための自動トレース・ツー・スキル蒸留システムを提案する。
COLLEAGUE.SKILLは、実践、メンタルモデル、意思決定のための能力トラックと、コミュニケーションスタイル、インタラクションルール、修正履歴のための有界な行動トラックの2つのトラックを持つバージョン付きのスキルパッケージを生成する。
論文 参考訳(メタデータ) (2026-05-29T12:59:08Z) - Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry [49.83108591873481]
SKILL.md - エージェントスキルライフサイクルの3つのステージを対象とするアタックのみを調査する。
SKILL.mdは受動的ドキュメントではなく、サードパーティのエージェントが発見し、信頼し、使用する機能を形成する運用テキストであることを示す。
論文 参考訳(メタデータ) (2026-05-12T02:11:54Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - Malicious Agent Skills in the Wild: A Large-Scale Security Empirical Study [47.60135753021306]
サードパーティのエージェントスキルは、LLMベースのエージェントを拡張して、命令ファイルとユーザのマシン上で動作する実行可能なコードを生成する。
結果として生じる脅威を特徴づけるために、地中真実のデータセットは存在しない。
我々は,98,380のスキルを行動検証することで,悪質なエージェントスキルのラベル付きデータセットを構築した。
論文 参考訳(メタデータ) (2026-02-06T09:52:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。