論文の概要: CONTRA: Red-Teaming Configurations of Personalizable Agents
- arxiv url: http://arxiv.org/abs/2607.03220v1
- Date: Fri, 03 Jul 2026 11:34:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.561656
- Title: CONTRA: Red-Teaming Configurations of Personalizable Agents
- Title(参考訳): CONTRA: パーソナライズ可能なエージェントのレッドチーム構成
- Authors: Jonathan Nöther, Adish Singla, Goran Radanovic,
- Abstract要約: エージェント構成と、明示的な指示なしに危険な行動を実行するリスクの相互作用について検討する。
LLM支援木探索アルゴリズムであるconfiguration Tree-search for Red-teaming Agents (CONTRA)を提案する。
大規模な分析では、75.1%のスキルが少なくとも1つの構成を持つため、悪意のあるアクションが実行される。
- 参考スコア(独自算出の注目度): 31.01865239234458
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent tools such as OpenClaw have extended the capabilities of LLM-based agents from simple dialog-based systems to fully autonomous agents. These systems allow personalization of the agent through modifiable internal files and the installation of skills. While this enables deployment in a wide range of settings and the automation of diverse tasks, greater capability and autonomy increases the risk of malicious actions being executed unintentionally. In this work, we explore the interplay between agent configuration and the risk of executing dangerous actions without explicit instruction. To this end, we propose CONfiguration Tree-search for Red-teaming Agents (CONTRA), an LLM-assisted tree-search algorithm that discovers agent configurations resulting in the execution of malicious actions. CONTRA works by reasoning about benign yet dangerous configurations and evaluating them in a simulated environment. We construct a dataset of the 473 most popular skills from a public repository, along with 2-5 corresponding malicious target actions per skill. In a large-scale analysis, we find that 75.1% of skills have at least one configuration resulting in the execution of a malicious action, most of which have not been detected as containing malicious content by existing scans. Overall, CONTRA successfully identifies a configuration leading to the execution of the target action in 39.2% of all tested cases. Our findings demonstrate that current agents provide insufficient safety with respect to personalization.
- Abstract(参考訳): OpenClawのような最近のツールは、シンプルなダイアログベースのシステムから完全に自律的なエージェントまで、LLMベースのエージェントの機能を拡張している。
これらのシステムは、内部ファイルの変更とスキルのインストールを通じてエージェントのパーソナライズを可能にする。
これにより、幅広い設定でのデプロイメントや、さまざまなタスクの自動化が可能になるが、能力と自律性の向上により、悪意のあるアクションが意図せずに実行されるリスクが増大する。
本研究では,エージェント構成間の相互作用と,明示的な指示を伴わずに危険な行動を実行するリスクについて検討する。
そこで本研究では,LLM支援木探索アルゴリズムであるConfiguration Tree-search for Red-teaming Agents (CONTRA)を提案する。
CONTRAは、良質で危険な構成を推論し、シミュレートされた環境で評価することで機能する。
パブリックリポジトリから473の最も人気のあるスキルのデータセットを構築し、それに対応する2~5の悪意のあるターゲットアクションを出力する。
大規模な分析では、75.1%のスキルが少なくとも1つの構成を持ち、それによって悪意のあるアクションが実行されることが判明した。
全体として、CONTRAは、すべてのテストケースの39.2%でターゲットアクションの実行につながる設定をうまく識別する。
以上の結果から,現在のエージェントはパーソナライゼーションに関して,安全性が不十分であることが示唆された。
関連論文リスト
- Trojan's Whisper: Stealthy Manipulation of OpenClaw through Injected Bootstrapped Guidance [23.059379933610163]
ガイダンスインジェクション(Guidance Injection)は、ブートストラップのガイダンスファイルに敵の運用ストーリーを埋め込むステルス攻撃ベクターである。
エクスプロイト,ワークスペース破壊,特権エスカレーション,持続的バックドア設置など,13の攻撃カテゴリにまたがる26の悪意あるスキルを構築した。
我々の攻撃は16.4%から64.2%の確率で成功し、悪意のある行動の大半はユーザーの確認なしに自律的に実行される。
論文 参考訳(メタデータ) (2026-03-20T14:17:56Z) - AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification [25.817251923574286]
大規模言語モデル(LLM)エージェントのための新しい推論時間検出・緩和フレームワークを提案する。
AgentSentryは、時間的因果的テイクオーバーとしてマルチターンIPIをモデル化する最初の推論時防御である。
我々は, textscAgentDojo ベンチマークにおいて, 4つのタスクスイート, 3つの IPI 攻撃ファミリー, 複数のブラックボックス LLM に対する AgentSentry の評価を行った。
論文 参考訳(メタデータ) (2026-02-26T07:59:10Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - RedCodeAgent: Automatic Red-teaming Agent against Diverse Code Agents [70.24175620901538]
コードエージェントは、強力なコード生成機能とコードインタプリタとの統合により、広く採用されている。
現在の静的安全性ベンチマークとレッドチームツールは、出現する現実世界のリスクシナリオを特定するのに不十分である。
我々はRedCodeAgentを提案する。RedCodeAgentは、多様なコードエージェントの脆弱性を体系的に発見するように設計された、最初の自動リピートエージェントである。
論文 参考訳(メタデータ) (2025-10-02T22:59:06Z) - OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety [58.201189860217724]
OpenAgentSafetyは,8つの危機リスクカテゴリにまたがるエージェントの動作を評価する包括的なフレームワークである。
従来の作業とは異なり、我々のフレームワークは、Webブラウザ、コード実行環境、ファイルシステム、bashシェル、メッセージングプラットフォームなど、実際のツールと対話するエージェントを評価します。
ルールベースの分析とLSM-as-judgeアセスメントを組み合わせることで、過度な行動と微妙な不安全行動の両方を検出する。
論文 参考訳(メタデータ) (2025-07-08T16:18:54Z) - AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents [54.29555239363013]
本稿では,間接的なインジェクション脆弱性を自動的に検出し,悪用するための汎用的なブラックボックスファジリングフレームワークであるAgentVigilを提案する。
我々はAgentVigilをAgentDojoとVWA-advの2つの公開ベンチマークで評価し、o3-miniとGPT-4oに基づくエージェントに対して71%と70%の成功率を達成した。
攻撃を現実世界の環境に適用し、悪質なサイトを含む任意のURLに誘導するエージェントをうまく誘導する。
論文 参考訳(メタデータ) (2025-05-09T07:40:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。