論文の概要: Agent Hacks Agent: Autoresearch for Production-Agent Red-Teaming
- arxiv url: http://arxiv.org/abs/2607.11698v1
- Date: Mon, 13 Jul 2026 15:31:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.534992
- Title: Agent Hacks Agent: Autoresearch for Production-Agent Red-Teaming
- Title(参考訳): Agent Hacks Agent: プロダクションベースのレッドチームのための自動検索
- Abstract要約: 本研究では, 1 つのエージェント研究環境を用いて, 生産用 LLM エージェントの自動リピートについて検討した。
脆弱性仮説を提案し、ファルシファイアを構築し、有効な攻撃をインスタンス化し、サンドボックス化されたハーネスで実行し、検証された結果をVulnerability Concept Graph(VCG)にプロモートする。
直接および間接的な攻撃をカバーする3つのシナリオに関するClude CodeとCodexの裏側で、発見された概念は、モデルとエージェント間で再利用可能な脆弱性コアを明らかにしている。
- 参考スコア(独自算出の注目度): 8.592488240217625
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Production LLM agents such as Claude Code and Codex operate over untrusted content, files, commands, and workspace state, making safety failures directly actionable. Red-teaming must therefore keep pace with evolving models and tools. Existing approaches mainly optimize attack success and preserve artifacts such as benchmarks, payloads, or attack programs, which record where attacks succeed but not the enabling conditions behind unsafe agent behavior. We study automated red-teaming for production LLM agents using one agentic research environment to discover reusable vulnerability knowledge about another. We present AHA, a falsifiable discovery loop that proposes a vulnerability hypothesis, constructs a falsifier, instantiates a valid attack, executes it in a sandboxed harness, reflects on the trajectory, and promotes confirmed findings into a Vulnerability Concept Graph (VCG). Each concept links an attacker-facing surface to an unsafe trajectory through a claim, enabling condition, falsifier, transfer prediction, and supporting evidence. Across Claude Code and Codex on three scenarios covering direct and indirect attacks, the discovered concepts reveal a reusable vulnerability core across models and agents. A frozen VCG requires no further search and outperforms the strongest frozen discovery baseline by 14.2 percentage points under the same single-shot protocol, while transferring across scenarios and attack channels. The resulting VCG provides an auditable artifact for production safety teams to inspect vulnerabilities, validate patches, and accumulate reusable safety knowledge. Our code is available at https://github.com/henrymao2004/Auto-research-red-teaming-in-sleep.
- Abstract(参考訳): Claude CodeやCodexのようなLLMエージェントは、信頼できないコンテンツ、ファイル、コマンド、ワークスペース状態を操作し、安全上の障害を直接実行可能にする。
そのため、レッドチームでは、進化するモデルやツールに追随しなければなりません。
既存のアプローチは主に攻撃の成功を最適化し、ベンチマークやペイロード、攻撃プログラムなどのアーティファクトを保存する。
本研究では, 1 つのエージェント研究環境を用いて, 生産用 LLM エージェントの自動リピートを行い, 再利用可能な脆弱性の発見を行う。
本稿では、脆弱性仮説を提案し、ファルシファイアを構築し、有効な攻撃をインスタンス化し、サンドボックス化されたハーネスで実行し、軌道を反映し、確認された結果を脆弱性概念グラフ(VCG)にプロモートするファルシブルな発見ループAHAを提案する。
それぞれの概念は、攻撃者の顔の表面をクレームを通じて安全でない軌道にリンクし、条件、ファルシファイア、転送予測、証拠の支持を可能にする。
直接および間接的な攻撃をカバーする3つのシナリオに関するClude CodeとCodexの裏側で、発見された概念は、モデルとエージェント間で再利用可能な脆弱性コアを明らかにしている。
凍結されたVCGは、さらなる探索を必要とせず、同じシングルショットプロトコルで14.2ポイント、シナリオとアタックチャネルをまたいで転送しながら、最強の凍結された発見ベースラインを上回ります。
結果として得られたVCGは、製品安全チームが脆弱性を検査し、パッチを検証し、再利用可能な安全知識を蓄積するための監査可能なアーティファクトを提供する。
私たちのコードはhttps://github.com/henrymao2004/Auto-research-red-teaming-in-sleepで公開されています。
関連論文リスト
- CyberLLM: A Multi-Agent LLM Framework for Autonomous Detection and Guarded Response in Automotive Cybersecurity [22.68559728326395]
CyberLLMは、脆弱性を自律的に検出し、正式なランタイム安全ガードの下で修正を実行するフレームワークである。
決定エージェントは発見を集約し、人間中心のアセット分類でタグ付けし、タイレッド応答を選択する。
対称攻撃パイプラインはエクスプロイトを生成し再生し、両方のサイドを同じシナリオで実行することができる。
論文 参考訳(メタデータ) (2026-08-06T23:39:13Z) - SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response [38.89333299127352]
我々は、インシデント-レスポンス後のワークフローにおいて、LLM(Large Language Model)エージェントを評価するための最初のベンチマークであるSecRespondを紹介する。
私たちはこのタスクを10のサイバー範囲でインスタンス化します。
実験の結果, 現行のエージェントは警報が発する問題を確実に発見できるが, サイレント侵入の円盤を積極的に調査することは困難であることがわかった。
論文 参考訳(メタデータ) (2026-07-29T11:32:23Z) - From Prompt Injection to Persistent Control: Defending Agentic Harness Against Trojan Backdoors [89.92617739143846]
ローカルエージェントハーネスにおけるマルチステップトロイの木馬攻撃を識別するベンチマークであるClawTrojanを紹介する。
そこで我々は,DASGuardを提案する。DASGuardは,コントロールライクなテキストをセンシティブなローカルファイルでスキャンし,その起源を辿り,信頼されたソースから派生しないコントロールコンテンツを除去する。
この結果から, DASGuardは, 実行時の攻撃ブロックと作業空間への衛生的コミットを組み合わせることで, 強力な動的防御を実現することがわかった。
論文 参考訳(メタデータ) (2026-05-29T09:19:07Z) - The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search [58.8834056209347]
大規模言語モデル(LLM)は、有害な出力を誘導するために安全ガードレールをバイパスするジェイルブレイク攻撃に弱いままである。
CKA-Agent(Correlated Knowledge Attack Agent)は、ターゲットモデルの知識基盤の適応的木構造探索としてジェイルブレイクを再構成する動的フレームワークである。
論文 参考訳(メタデータ) (2025-12-01T07:05:23Z) - Malice in Agentland: Down the Rabbit Hole of Backdoors in the AI Supply Chain [82.98626829232899]
自分自身のインタラクションからのデータに対する微調整のAIエージェントは、AIサプライチェーン内の重要なセキュリティ脆弱性を導入している。
敵は容易にデータ収集パイプラインに毒を盛り、検出しにくいバックドアを埋め込むことができる。
論文 参考訳(メタデータ) (2025-10-03T12:47:21Z) - RedCodeAgent: Automatic Red-teaming Agent against Diverse Code Agents [70.24175620901538]
コードエージェントは、強力なコード生成機能とコードインタプリタとの統合により、広く採用されている。
現在の静的安全性ベンチマークとレッドチームツールは、出現する現実世界のリスクシナリオを特定するのに不十分である。
我々はRedCodeAgentを提案する。RedCodeAgentは、多様なコードエージェントの脆弱性を体系的に発見するように設計された、最初の自動リピートエージェントである。
論文 参考訳(メタデータ) (2025-10-02T22:59:06Z) - Cuckoo Attack: Stealthy and Persistent Attacks Against AI-IDE [64.47951172662745]
Cuckoo Attackは、悪意のあるペイロードを構成ファイルに埋め込むことで、ステルス性と永続的なコマンド実行を実現する新しい攻撃である。
攻撃パラダイムを初期感染と持続性という2つの段階に分類する。
当社は、ベンダーが製品のセキュリティを評価するために、実行可能な7つのチェックポイントを提供しています。
論文 参考訳(メタデータ) (2025-09-19T04:10:52Z) - BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks [58.959622170433725]
BlindGuardは、攻撃固有のラベルや悪意のある振る舞いに関する事前の知識を必要とせずに学習する、教師なしの防御方法である。
BlindGuardはマルチエージェントシステムにまたがる多様な攻撃タイプ(即時注入、メモリ中毒、ツール攻撃)を効果的に検出する。
論文 参考訳(メタデータ) (2025-08-11T16:04:47Z) - An LLM-Assisted Easy-to-Trigger Backdoor Attack on Code Completion Models: Injecting Disguised Vulnerabilities against Strong Detection [17.948513691133037]
我々は,コード補完モデルに基づくLLM支援バックドアアタックフレームワークであるCodeBreakerを紹介した。
悪意のあるペイロードを最小限の変換でソースコードに直接統合することで、CodeBreakerは現在のセキュリティ対策に挑戦する。
論文 参考訳(メタデータ) (2024-06-10T22:10:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。