論文の概要: OBLIVION: Workflow-Level Operational Skill Unlearning for Deployed Agents
- arxiv url: http://arxiv.org/abs/2608.08264v1
- Date: Sat, 08 Aug 2026 17:51:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.750748
- Title: OBLIVION: Workflow-Level Operational Skill Unlearning for Deployed Agents
- Title(参考訳): OBLIVION: デプロイエージェントのためのワークフローレベル操作スキルの学習
- Abstract要約: 大規模な言語モデルエージェントは、ファイル、メモリ、レジストリ、外部ツールの操作インターフェイスになりつつある。
本研究では,この課題を,パラメータレベルを忘れることではなく,デプロイされたエージェントが取り消しされたスキルを再構築するのを防ぐための,運用スキルの未学習として検討する。
我々は,リボッドスキル復活のためのベンチマークと防御ハーネスであるOBLIVIONを紹介する。
- 参考スコア(独自算出の注目度): 14.593344079812438
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model agents are becoming operational interfaces to files, memories, registries, and external tools. This deployment shift creates a new skill revocation problem: after a skill is removed from an explicit registry, an agent may still reconstruct it from residual carriers such as archives, transcripts, schemas, or memory entries. We study this problem as operational skill unlearning, where the goal is not parameter-level forgetting, but preventing a deployed agent from rebuilding a revoked skill through primitive tools. We introduce OBLIVION, a controlled benchmark and defense harness for revoked-skill resurrection. OBLIVION models each episode as a source-to-sink workflow, applies Cross-Surface Coherent Erasure to reduce residual carriers, and uses frozen workflow remediation near dangerous sinks. On the locked 88 attack episodes, the no-defense arm reaches formal attack success rate 1.0. OBLIVION reduces the rate to 0.114 and impact-weighted exposure to 0.115 while keeping locked utility at 1.0 and benign block rate at 0. In a separate skill-attack-derived sandbox, OBLIVION reduces attack success from 1.0 to 0.2 and impact-weighted exposure from 1.0 to 0.213 while preserving all utility controls. These results support workflow-level evaluation beyond checking explicit skill entries.
- Abstract(参考訳): 大規模な言語モデルエージェントは、ファイル、メモリ、レジストリ、外部ツールの操作インターフェイスになりつつある。
明示的なレジストリからスキルが削除された後も、エージェントは、アーカイブ、トランスクリプト、スキーマ、メモリエントリなどの残余のキャリアからそれを再構築することができる。
我々は,この問題を,パラメータレベルを忘れることではなく,デプロイされたエージェントがプリミティブツールを通じて取り消しスキルを再構築するのを防ぐための,運用スキルの未学習として研究する。
我々は,リボッドスキル復活のためのベンチマークと防御ハーネスであるOBLIVIONを紹介する。
OBLIVIONは、各エピソードをソース・ツー・シンクワークフローとしてモデル化し、残余のキャリアを減らすためにクロスサーフェス・コヒーレント・エミッションを適用し、危険なシンクの近くで冷凍ワークフローの修復を使用する。
ロックされた88回の攻撃では、無防備アームが正式な攻撃成功率1.0に達する。
OBLIVIONはロックユーティリティを1.0、良性ブロックレートを0。
スキルアタックから派生したサンドボックスでは、OBLIVIONは攻撃の成功を1.0から0.2に減らし、衝撃重み付き露光を1.0から0.213に減らし、すべてのユーティリティコントロールを保存する。
これらの結果は、明示的なスキルエントリのチェック以上のワークフローレベルの評価をサポートする。
関連論文リスト
- Defense-as-Skill: Evolving Runtime Guard Skill for Skill-Augmented Agents [30.77975669386977]
我々は、ランタイムガード自体をインストール可能で、検査可能で、編集可能なスキルとして実装する防衛パラダイムであるDefense-as-Skillを提案する。
私たちのガードであるSkillSonarは、ユーザのタスク境界に対するセンシティブなアクションをチェックし、各アクションを許容、再計画、確認決定にルーティングします。
論文 参考訳(メタデータ) (2026-09-01T16:19:31Z) - Reachability-Based Capability Confinement for LLM Agents under Indirect Prompt Injection [8.339789704552706]
SkillGuardは、汚染を汚染として扱い、結果として生じる状態をデプロイが定義した禁止状態から切り離す機能を制限するハーネスレベルの執行層である。
我々は、Gmini 2.5 FlashとLlama3.3-70Bの4つのAgentDojoスイート上で、LLMのみのNo Defenseベースラインと異なるシステム層での3つのディフェンスに対してSkillGuardを評価した。
論文 参考訳(メタデータ) (2026-08-30T20:57:47Z) - When Not to Imitate: Boundary-Aware Skill Memory for Reliable Tool-Use LLM Agents [62.10623192614306]
過去の成功からスキルを抽出することは、Large Language Model (LLM)エージェントの効率的な進化に不可欠である。
textbfBoundary-Aware Skill Memory (BASM)を提案する。
BASMは、成功度の高いスキルメモリベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-08-23T10:16:06Z) - SkillJack: Persistent Skill Backdoors in Self-Evolving Agents [5.713807329849712]
textbfSkillJackは、自己進化エージェントの体験からスキルへのパイプラインを利用する最初の攻撃である。
ランタイムコンテキストを直接操作する代わりに、SkillJackはエージェント自身の学習プロセスをハイジャックして、悪意のある振る舞いを再利用可能なスキルレパートリーに埋め込む。
以上の結果から,新たな攻撃面としてのスキル進化と,スキルライフサイクル保護のモチベーションが示された。
論文 参考訳(メタデータ) (2026-08-04T11:51:23Z) - SkillMutator: Benchmarking and Defending Language-and-Code Cross-modal Attacks on LLM Agent Skills [7.465256215885481]
大きな言語モデル(LLM)エージェントは、エージェントスキルをロードすることで、実行時にその機能を拡張する。
スキルの振る舞いは自然言語命令と実行可能コードの両方に依存しているため、その安全性を評価するにはクロスモーダル推論が必要である。
我々は、Agent Skillsに対する言語とコードのクロスモーダル攻撃をインストール時に検出する最初のベンチマークであるSkillMutatorを紹介した。
論文 参考訳(メタデータ) (2026-06-12T06:27:12Z) - What Should a Skill Remember? Quality--Cost Trade-offs in Cost-Aware Skill Rewriting for Language Model Agents [58.87681796862133]
我々は経済的なレンズを通してスキルの書き直しを勉強する。
我々のフレームワークは、情報保存戦略を用いて、スキル構造をプロファイルし、スキルを書き換える。
SkillsBenchの実験は、戦略間の異なる品質とコストのトレードオフを明らかにしている。
論文 参考訳(メタデータ) (2026-06-08T12:36:51Z) - SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction [89.03272793385054]
エージェントスキルはエージェントワークフローにおける特権的な位置を占め、サードパーティスキルを脆弱な攻撃面にする。
我々はスキルベースアタックのベンチマークであるSkillHarmを紹介した。
攻撃成功率はFPPが86.3%、SMPが69.3%である。
論文 参考訳(メタデータ) (2026-06-01T17:45:39Z) - BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning [34.60596020541521]
我々はBadSkillを紹介します。BadSkillは、モデル・イン・スキル脅威サーフェスをターゲットとするバックドア攻撃の定式化です。
BadSkillでは、敵が隠れペイロードをアクティベートするために、組み込まれたモデルがバックドアで調整された、一見良心的なスキルを公開している。
ベンチマークは8つのトリガータスクと5つの非トリガー制御スキルを含む13のスキルにまたがっており、主な評価セットは571の負のクラスクエリと396のトリガー整列クエリである。
BadSkillは8つのトリガースキルの平均攻撃成功率(ASR)を99.5%まで達成し、負のクラスのクエリに対して強い良識的な精度を維持している。
論文 参考訳(メタデータ) (2026-04-10T14:48:29Z) - The Autonomy Tax: Defense Training Breaks LLM Agents [5.990318568221089]
安全を改善するために設計された防衛訓練は、高度な攻撃を防ぐのに失敗しながら、エージェントの能力を体系的に破壊する。
我々は,97件のエージェントタスクと1,000件の敵のプロンプトにまたがる無防備なベースラインに対する防御モデルの評価を行った。
その結果,現在の防衛パラダイムは,マルチステップエージェントを基本的に信頼できないようにレンダリングしながら,シングルターンリフェールベンチマークに最適化されていることがわかった。
論文 参考訳(メタデータ) (2026-03-19T19:33:17Z) - Execution Is the New Attack Surface: Survivability-Aware Agentic Crypto Trading with OpenClaw-Style Local Executors [0.0]
Survivability-Aware Execution (SAE)は、OpenClawスタイルのシステムとスキル対応エージェントの実行層サバイバル標準である。
我々は、スコープ外ラベリングと再現可能なメトリクスを可能にするログ付きIntended Policy Specを通じて、デリゲーションギャップ(DG)を運用する。
SAEは、OpenClaw+skills時代の代理取引の安全性を再設定する: 上流の意図とスキルを信頼できないものとして扱い、アクションが副作用となる生存可能性を強化する。
論文 参考訳(メタデータ) (2026-03-10T15:54:01Z) - AI Security Beyond Core Domains: Resume Screening as a Case Study of Adversarial Vulnerabilities in Specialized LLM Applications [71.27518152526686]
大きな言語モデル(LLM)はテキストの理解と生成に優れており、コードレビューやコンテンツモデレーションといった自動タスクに最適である。
LLMは履歴書やコードなどの入力データに隠された「逆命令」で操作でき、意図したタスクから逸脱する。
本稿では,特定の攻撃タイプに対して80%以上の攻撃成功率を示すとともに,この脆弱性を再開スクリーニングで評価するためのベンチマークを提案する。
論文 参考訳(メタデータ) (2025-12-23T08:42:09Z) - Coward: Toward Practical Proactive Federated Backdoor Defense via Collision-based Watermark [90.94234374893287]
我々は、マルチバックドア衝突効果の発見に触発されて、Cowardと呼ばれる新しいプロアクティブディフェンスを導入する。
一般に,サーバから注入された,矛盾するグローバルな透かしが,保持されるのではなく,ローカルトレーニング中に消去されるかどうかを評価することで攻撃者を検出する。
論文 参考訳(メタデータ) (2025-08-04T06:51:33Z) - CleanerCLIP: Fine-grained Counterfactual Semantic Augmentation for Backdoor Defense in Contrastive Learning [53.766434746801366]
バックドアトリガの特徴的接続を遮断するための細粒な textbfText textbfAlignment textbfCleaner (TA-Cleaner) を提案する。
TA-Cleanerは、ファインタニングベースの防御技術の中で最先端の防御性を達成している。
論文 参考訳(メタデータ) (2024-09-26T07:35:23Z) - Dissecting Adversarial Robustness of Multimodal LM Agents [70.2077308846307]
我々は、VisualWebArena上に現実的な脅威モデルを用いて、200の敵タスクと評価スクリプトを手動で作成する。
我々は,クロボックスフロンティアLMを用いた最新のエージェントを,リフレクションやツリーサーチを行うエージェントを含む,壊すことに成功している。
AREを使用して、新しいコンポーネントの追加に伴うロバスト性の変化を厳格に評価しています。
論文 参考訳(メタデータ) (2024-06-18T17:32:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。