論文の概要: Beyond Handcrafted Security: Towards Self-Evolving Defense for LLM Agents
- arxiv url: http://arxiv.org/abs/2608.12977v1
- Date: Thu, 13 Aug 2026 08:57:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.456943
- Title: Beyond Handcrafted Security: Towards Self-Evolving Defense for LLM Agents
- Title(参考訳): 手作業によるセキュリティを超えて - LLMエージェントの自己進化型防御に向けて
- Abstract要約: 既存のランタイムディフェンスは手動で設計された介入に大きく依存しており、その構築とメンテナンスのための原則的なフレームワークが欠如している。
我々は、適切な介入戦略を自動的に識別し、観測された障害トレースに基づいて防御アーティファクトを反復的に改善する自己進化型ランタイム防衛フレームワークであるHARD(Autonomous Defense Evolution)を提案する。
本研究は, 自律防衛の進化を, エージェントが防御の弱点を識別し, 防御機構を継続的に改善するための, 新たなパラダイムとして強調するものである。
- 参考スコア(独自算出の注目度): 5.240154860822616
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The expanding operational capabilities of large language model (LLM) agents introduce sophisticated security threats. Runtime defenses have emerged as an effective approach to mitigating these risks by integrating security mechanisms into the agent execution loop. However, existing runtime defenses rely heavily on manually designed interventions and lack a principled framework for their construction and maintenance. In this work, we first develop a harness-level formulation of runtime defense that systematically characterizes how harness mechanisms enable defense construction and provides a unified view of existing runtime defense interventions from a harness perspective. Building on this formulation, we propose HARD (Harness-based Autonomous Runtime Defense Evolution), a self-evolving runtime defense framework that automatically identifies appropriate intervention strategies and iteratively improves defense artifacts based on observed failure traces. HARD transforms runtime defense development from manual engineering into an autonomous evolution process, and extensive experiments demonstrate that it improves security performance over existing handcrafted defenses while preserving benign task utility. Our findings highlight autonomous defense evolution as a promising new paradigm for securing deployed LLM agents, enabling agents to identify defense weaknesses and continuously improve their protection mechanisms.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントの運用能力の増大は、高度なセキュリティ脅威をもたらす。
ランタイム防御は、セキュリティメカニズムをエージェント実行ループに統合することで、これらのリスクを軽減する効果的なアプローチとして登場した。
しかし、既存のランタイムディフェンスは手動で設計した介入に大きく依存しており、その構築とメンテナンスのための原則的なフレームワークが欠如している。
本研究は、まず、ハーネス機構が防御構築を可能にする方法を体系的に特徴付けるランタイムディフェンスのハーネスレベルの定式化を開発し、ハーネスの観点から既存のランタイムディフェンス介入の統一ビューを提供する。
この定式化に基づいてHARD(Harness-based Autonomous Runtime Defense Evolution)を提案する。これは自己進化型ランタイム防衛フレームワークで、適切な介入戦略を自動的に識別し、観測された障害トレースに基づいて防御アーティファクトを反復的に改善する。
HARDは、実行時防衛の開発を手動のエンジニアリングから自律的な進化プロセスに転換し、良質なタスクユーティリティを維持しながら、既存の手作りの防御よりもセキュリティ性能を向上させることを広範な実験で実証した。
我々の研究は、自律防衛の進化を、展開されたLLMエージェントを保護するための有望な新しいパラダイムとして強調し、エージェントが防御の弱点を識別し、その保護メカニズムを継続的に改善することを可能にする。
関連論文リスト
- On the Vulnerability of Parameter-Level Defenses to Model Merging [75.62810606927121]
我々は,既存の安全対策を回避するため,アンカー誘導攻撃(AGA)を提案する。
AGAは、現実的な防衛非依存シナリオの下で、個々の防衛と複合防衛の両方を一貫してバイパスする。
我々は、AGAが活用するアンカーの優位性を軽減するために、アンカー推進ファインチューニング(ARF)を提供する。
論文 参考訳(メタデータ) (2026-06-29T14:26:13Z) - Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay [19.431152130507648]
大規模言語モデル(LLM)は目覚ましい能力を達成したが、敵のジェイルブレイク攻撃に弱いままである。
本稿では、アタッカー(ジェイルブレイクの発生)とディフェンダー(有害な要求を拒否)の両方として機能するシステムであるセーフティセルフプレイ(SSP)を紹介する。
SSPは、堅牢な防御能力を自律的に進化させ、静的な敵対的データセットでトレーニングされたベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2026-01-15T17:00:16Z) - Cognitive Control Architecture (CCA): A Lifecycle Supervision Framework for Robustly Aligned AI Agents [1.014002853673217]
LLMエージェントはIPI(Indirect Prompt Injection)攻撃に対して脆弱である。
IPIは外部情報ソースを汚染することでハイジャックエージェントの動作を攻撃している。
本稿では,全ライフサイクルの認知管理を実現するための総合的な枠組みである認知制御アーキテクチャ(CCA)を提案する。
論文 参考訳(メタデータ) (2025-12-07T08:11:19Z) - SAID: Empowering Large Language Models with Self-Activating Internal Defense [23.654016424365906]
我々は,新たな非訓練型防衛パラダイム,自走型内国防衛(SAID)を導入する。
SAIDは、防衛タスクを外部修正から内部機能アクティベーションにリフレームする。
それは、有害な出力を減らすために最先端の防御を著しく上回っている。
論文 参考訳(メタデータ) (2025-10-23T02:07:54Z) - Secure Tug-of-War (SecTOW): Iterative Defense-Attack Training with Reinforcement Learning for Multimodal Model Security [63.41350337821108]
マルチモーダル大規模言語モデル(MLLM)のセキュリティを高めるために,Secure Tug-of-War(SecTOW)を提案する。
SecTOWは2つのモジュールで構成される:ディフェンダーと補助攻撃者。どちらも強化学習(GRPO)を使用して反復的に訓練される。
SecTOWは、一般的な性能を維持しながら、セキュリティを大幅に改善することを示す。
論文 参考訳(メタデータ) (2025-07-29T17:39:48Z) - MISLEADER: Defending against Model Extraction with Ensembles of Distilled Models [56.09354775405601]
モデル抽出攻撃は、クエリアクセスを通じてブラックボックスモデルの機能を複製することを目的としている。
既存のディフェンスでは、アタッカークエリにはオフ・オブ・ディストリビューション(OOD)サンプルがあることを前提としており、不審な入力を検出し破壊することができる。
OOD仮定に依存しない新しい防衛戦略であるMISLEADERを提案する。
論文 参考訳(メタデータ) (2025-06-03T01:37:09Z) - ADA: Automated Moving Target Defense for AI Workloads via Ephemeral Infrastructure-Native Rotation in Kubernetes [0.0]
ADAは、これらのワークロードをインフラストラクチャレベルで継続的に、かつ自動的に回転させることで運用する。
この定期的な管理されたチャーンは攻撃者の仮定を無効にし、潜在的なキルチェーンを妨害する。
AMTDに対するADAの新たなアプローチは、AIサービスに対してより堅牢で、アジャイルで、運用的に効率的なゼロトラストモデルを提供します。
論文 参考訳(メタデータ) (2025-05-27T02:24:45Z) - LLM Security: Vulnerabilities, Attacks, Defenses, and Countermeasures [49.1574468325115]
本調査は,大規模言語モデル(LLM)を対象とした各種攻撃を定義し,分類することを目的とする。
これらの攻撃を徹底的に分析し、そのような脅威を軽減するために設計された防御機構を探索する。
論文 参考訳(メタデータ) (2025-05-02T10:35:26Z) - Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense [90.71884758066042]
大きな視覚言語モデル(LVLM)は、視覚入力による悪意のある攻撃に対する感受性という、ユニークな脆弱性を導入している。
本稿では,脆弱性発生源からアクティブ防衛機構へ視覚空間を変換するための新しい手法であるESIIIを提案する。
論文 参考訳(メタデータ) (2025-03-14T17:39:45Z) - The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense [56.32083100401117]
Vision Large Language Models(VLLMs)のジェイルブレイク攻撃に対する脆弱性は、驚くにあたらない。
これらの攻撃に対する最近の防御機構は、ベンチマーク評価においてほぼ飽和状態に達している。
論文 参考訳(メタデータ) (2024-11-13T07:57:19Z) - Randomness in ML Defenses Helps Persistent Attackers and Hinders
Evaluators [49.52538232104449]
堅牢なMLディフェンスを設計することがますます重要になっている。
近年の研究では、当初最先端の攻撃に抵抗する多くの防衛は、適応的な敵によって破壊される可能性があることが判明している。
我々は、防御設計をシンプルにし、ホワイトボックスの防御は可能な限りランダム性を損なうべきだと論じる。
論文 参考訳(メタデータ) (2023-02-27T01:33:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。