論文の概要: Agent Harness Distillation: Inference-Time Harness Extraction and Exploitation in Autonomous Multi-Agent Systems
- arxiv url: http://arxiv.org/abs/2607.28147v1
- Date: Thu, 30 Jul 2026 12:54:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.56944
- Title: Agent Harness Distillation: Inference-Time Harness Extraction and Exploitation in Autonomous Multi-Agent Systems
- Title(参考訳): エージェントハーネス蒸留:自律マルチエージェントシステムにおける推論時間ハーネス抽出と爆発
- Abstract要約: 推論時ハーネスは貴重な知的財産(IP)である
エージェントハーネス蒸留(エージェントハーネス蒸留、AHD)は、推論時ハーネス抽出から生じるセキュリティリスクを研究するためのフレームワークである。
本稿では,保護剤の有効性を保ちつつ,利用効率を低下させる偽造型防御法を提案する。
- 参考スコア(独自算出の注目度): 7.065185502069209
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous multi-agent systems (AMAS) built on large language models (LLMs), such as Hermes, increasingly rely on inference-time harnesses to coordinate reasoning and action. Constructing these harnesses requires substantial engineering effort and computational resources, as they are iteratively optimized over a combinatorial search space while co-evolving with the underlying LLM. Inference-time harnesses therefore constitute valuable intellectual property (IP). Although prior work has investigated IP leakage in static multi-agent systems with pre-configured architectures, it remains unclear whether similar risks arise in AMAS, where harness behavior emerges dynamically during inference. To address this gap, we introduce Agent Harness Distillation (AHD), a framework for studying the security risks arising from inference-time harness extraction in AMAS. We formalize harness extraction as a new security problem and develop an evaluation framework for quantifying such risks. AHD extracts inference-time harness capabilities from a target agent through black-box interactions and consists of two stages. In the pre-distillation stage, AHD infers inference-time harness behaviors from the responses of the target agent and constructs an initial harness. In the post-distillation stage, AHD iteratively refines the initial harness to align with the behavioral patterns of the target agent. Experiments on real-world AMAS across multiple backbone LLMs demonstrate the effectiveness of AHD and reveal substantial IP leakage risks. We further propose a deception-based defense that reduces harness extraction effectiveness while preserving the utility of the protected agent. Our findings uncover a previously underexplored security threat to AMAS.
- Abstract(参考訳): Hermesのような大規模言語モデル(LLM)上に構築された自律型マルチエージェントシステム(AMAS)は、推論と行動を調整するために推論時ハーネスに依存している。
これらのハーネスを構築するには、基礎となるLLMと共進化しながら、組合せ探索空間上で反復的に最適化されるため、かなりのエンジニアリング作業と計算資源が必要である。
したがって、推論時ハーネスは価値ある知的財産(IP)を構成する。
事前設定されたアーキテクチャを持つ静的マルチエージェントシステムのIPリークを調査してきたが、AMASで同様のリスクが発生しているかどうかは不明であり、推論中に利用行動が動的に発生する。
このギャップに対処するため,エージェントハーネス蒸留(AHD)を導入し,AMASにおける推論時ハーネス抽出によるセキュリティリスクについて検討する。
我々は、新しいセキュリティ問題としてハーネス抽出を形式化し、そのようなリスクを定量化する評価フレームワークを開発する。
AHDは、ブラックボックス相互作用を通じてターゲットエージェントから推論時ハーネス機能を抽出し、2段階からなる。
予蒸留段階では、AHDはターゲットエージェントの応答から推論時ハーネスの挙動を推測し、初期ハーネスを構築する。
蒸留後の段階では、AHDは初期ハーネスを反復的に洗練し、標的剤の挙動パターンと整合させる。
複数のバックボーンLLMをまたいだ実世界のAMAS実験は、AHDの有効性を示し、IP漏洩のリスクを明らかにしている。
さらに,保護剤の有効性を保ちつつ,利用効率を低下させる偽造型防御法を提案する。
AMASに対する未発見のセキュリティ脅威が発見されました。
関連論文リスト
- AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent [53.82005364479556]
大規模言語モデル(LLM)に基づく符号化エージェントは、驚くべき自律性を示す。
既存の安全機構は主に外部ガードレールに依存している。
我々は,ランタイムの安全性検出と表現レベルの緩和を行う,ホワイトボックスの防御フレームワークであるAgentLensを提案する。
論文 参考訳(メタデータ) (2026-06-21T21:13:55Z) - Your Agent is More Brittle Than You Think: Uncovering Indirect Injection Vulnerabilities in Agentic LLMs [32.38053469964495]
システム間インタラクションを含む拡張されたアクションスペースは、深刻なセキュリティ上の問題を引き起こす。
悪意のある命令をサードパーティのコンテンツ内に隠蔽するIPIは、データ流出などの不正なアクションをトリガーする。
9個のLPMバックボーンにまたがる4つの高度なIPI攻撃ベクトルに対する6つの防御戦略を評価した。
論文 参考訳(メタデータ) (2026-04-04T21:27:04Z) - ICON: Indirect Prompt Injection Defense for Agents based on Inference-Time Correction [24.416258744287166]
ICONは、タスクの連続性を維持しながら攻撃を中和する、調査と軽減のためのフレームワークである。
ICONは競争力のある0.4%のASRを達成し、商業グレード検出器と一致し、50%以上のタスクユーティリティーゲインを得る。
論文 参考訳(メタデータ) (2026-02-24T09:13:05Z) - Leveraging the Power of Ensemble Learning for Secure Low Altitude Economy [64.39232788946173]
低高度経済(LAE)は社会福祉の強化と経済成長の推進に大きく貢献している。
本稿では,セキュアなLAEのためのアンサンブル学習,研究の焦点,解決策,ケーススタディについて検討する。
論文 参考訳(メタデータ) (2026-02-07T23:15:58Z) - Agentic Uncertainty Quantification [76.94013626702183]
本稿では,言語化された不確実性をアクティブな双方向制御信号に変換する統合されたデュアルプロセスエージェントUQ(AUQ)フレームワークを提案する。
システム1(Uncertainty-Aware Memory, UAM)とシステム2(Uncertainty-Aware Reflection, UAR)は、これらの説明を合理的な手段として利用し、必要な時にのみターゲットの推論時間解決をトリガーする。
論文 参考訳(メタデータ) (2026-01-22T07:16:26Z) - How Brittle is Agent Safety? Rethinking Agent Risk under Intent Concealment and Task Complexity [55.441602598245744]
LLM駆動エージェントの現在の安全性評価は、主に原子害に焦点を当てており、悪意のある意図が複雑なタスクで隠されたり希釈されたりする高度な脅威に対処できなかった。
このギャップを,意図隠蔽とタスク複雑性の圧力下でのエージェントの安全性の脆さを二次元的に解析することで解決する。
目的が明確になるにつれて、安全アライメントは急激かつ予測的に低下し、「複雑パラドックス」が出現する。
論文 参考訳(メタデータ) (2025-11-11T17:27:27Z) - DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models [50.21378052667732]
我々は、ステップ内およびステップ間ダイナミクスという2つの異なる次元にわたるジェイルブレイク攻撃に対して、dLLM脆弱性の詳細な分析を行う。
デュアルステージアプローチによる脆弱性に対処する,トレーニング不要な防御フレームワークであるDiffuGuardを提案する。
論文 参考訳(メタデータ) (2025-09-29T05:17:10Z) - Who's the Mole? Modeling and Detecting Intention-Hiding Malicious Agents in LLM-Based Multi-Agent Systems [25.6233463223145]
大規模言語モデル(LLM-MAS)を用いたマルチエージェントシステムにおける意図隠蔽脅威について検討する。
高いステルス性を維持しながらタスク完了を微妙に妨害する4つの代表的な攻撃パラダイムを設計する。
これらの脅威に対処するために,心理学に着想を得た検出フレームワークであるAgentXposedを提案する。
論文 参考訳(メタデータ) (2025-07-07T07:34:34Z) - GUARDIAN: Safeguarding LLM Multi-Agent Collaborations with Temporal Graph Modeling [5.798273384241793]
大規模言語モデル (LLM) は、複雑な対話や多ターン対話を行えるインテリジェントエージェントの開発を可能にする。
GUARDIANは、GUARDing Intelligent Agent ColllaboratioNsにおいて、複数の安全上の懸念を検出し緩和する方法である。
論文 参考訳(メタデータ) (2025-05-25T17:15:55Z) - EARBench: Towards Evaluating Physical Risk Awareness for Task Planning of Foundation Model-based Embodied AI Agents [53.717918131568936]
EAI(Embodied AI)は、高度なAIモデルを現実世界のインタラクションのための物理的なエンティティに統合する。
高レベルのタスク計画のためのEAIエージェントの"脳"としてのファンデーションモデルは、有望な結果を示している。
しかし、これらのエージェントの物理的環境への展開は、重大な安全性上の課題を呈している。
本研究では,EAIシナリオにおける身体的リスクの自動評価のための新しいフレームワークEARBenchを紹介する。
論文 参考訳(メタデータ) (2024-08-08T13:19:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。