論文の概要: TreeTeaming: Autonomous Red-Teaming of Vision-Language Models via Hierarchical Strategy Exploration
- arxiv url: http://arxiv.org/abs/2603.22882v1
- Date: Tue, 24 Mar 2026 07:31:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.356856
- Title: TreeTeaming: Autonomous Red-Teaming of Vision-Language Models via Hierarchical Strategy Exploration
- Title(参考訳): Tree Teaming: 階層的戦略探索によるビジョンランゲージモデルの自律的再チーム化
- Authors: Chunxiao Li, Lijun Li, Jing Shao,
- Abstract要約: TreeTeamingは、静的テストから動的で進化的な発見プロセスへの戦略探索を再構成する、自動化された赤いチーム編成フレームワークです。
TreeTeamingは11台のモデルで最先端の攻撃成功率を達成し、既存の手法を上回り、GPT-4oで87.60%に達する。
- 参考スコア(独自算出の注目度): 36.14792121366007
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The rapid advancement of Vision-Language Models (VLMs) has brought their safety vulnerabilities into sharp focus. However, existing red teaming methods are fundamentally constrained by an inherent linear exploration paradigm, confining them to optimizing within a predefined strategy set and preventing the discovery of novel, diverse exploits. To transcend this limitation, we introduce TreeTeaming, an automated red teaming framework that reframes strategy exploration from static testing to a dynamic, evolutionary discovery process. At its core lies a strategic Orchestrator, powered by a Large Language Model (LLM), which autonomously decides whether to evolve promising attack paths or explore diverse strategic branches, thereby dynamically constructing and expanding a strategy tree. A multimodal actuator is then tasked with executing these complex strategies. In the experiments across 12 prominent VLMs, TreeTeaming achieves state-of-the-art attack success rates on 11 models, outperforming existing methods and reaching up to 87.60\% on GPT-4o. The framework also demonstrates superior strategic diversity over the union of previously public jailbreak strategies. Furthermore, the generated attacks exhibit an average toxicity reduction of 23.09\%, showcasing their stealth and subtlety. Our work introduces a new paradigm for automated vulnerability discovery, underscoring the necessity of proactive exploration beyond static heuristics to secure frontier AI models.
- Abstract(参考訳): VLM(Vision-Language Models)の急速な進歩は、その安全性の脆弱性を鋭い焦点にしている。
しかしながら、既存のレッドチーム方式は、本質的に線形探索パラダイムによって制約されており、事前に定義された戦略セット内で最適化し、新しい多様なエクスプロイトの発見を防いでいる。
この制限を超越するために、静的テストから動的な進化的発見プロセスへの戦略探索を再構築する、自動化されたレッドチームフレームワークであるTreeTeamingを紹介します。
コアとなる戦略オーケストレータはLLM(Large Language Model)をベースとして,将来的な攻撃パスを進化させるか,あるいはさまざまな戦略ブランチを探索するかを自律的に決定することで,戦略ツリーを動的に構築および拡張する。
マルチモーダルアクチュエータは、これらの複雑な戦略を実行することをタスクされる。
12の有名なVLMを対象とした実験では、TreeTeamingは11のモデルで最先端の攻撃成功率を達成し、既存のメソッドを上回り、GPT-4oで87.60\%に達する。
この枠組みは、以前の公的なジェイルブレイク戦略の統一よりも優れた戦略的多様性を示す。
さらに、生成された攻撃は、平均的な毒性の23.09\%の低下を示し、その盗みと微妙さを示している。
我々の研究は、自動脆弱性発見のための新しいパラダイムを導入し、フロンティアAIモデルを保護するための静的ヒューリスティックを越えて、積極的な探索の必要性を強調しています。
関連論文リスト
- RunawayEvil: Jailbreaking the Image-to-Video Generative Models [59.21761412103083]
イメージ・トゥ・ビデオ(I2V)生成は、画像とテキスト入力から動的視覚コンテンツを合成し、創造的なコントロールを提供する。
本稿では,動的進化機能を備えたI2VモデルのマルチモーダルジェイルブレイクフレームワークであるRunawayEvilを提案する。
RunawayEvil は Open-Sora 2.0 や CogVideoX などの商用 I2V モデルに対して,最先端の攻撃成功率を実現している。
論文 参考訳(メタデータ) (2025-12-07T06:14:52Z) - Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization [51.12422886183246]
大規模言語モデル(LLM)は、Webサービスにおいて急速に発展し、社会的リスクを増幅しつつ、前例のない能力を提供してきた。
既存の作業は、分離されたジェイルブレイク攻撃または静的防御に重点を置いており、現実世界のWebコンテキストにおける進化する脅威とセーフガードの間の動的な相互作用を無視している。
ACE-Safetyは、2つの重要な革新的手順をシームレスに統合することにより、攻撃と防御モデルを協調的に最適化する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-11-24T15:23:41Z) - Genesis: Evolving Attack Strategies for LLM Web Agent Red-Teaming [45.95972813586392]
既存のレッドチーム方式は、主にオフラインでトレーニングされた手作業による攻撃戦略や静的モデルに依存している。
我々は,アタッカー,スコラー,ストラテジストの3つのモジュールからなる新しいエージェントフレームワークであるGenesisを提案する。
我々のフレームワークは、新しい戦略を発見し、既存の攻撃ベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2025-10-21T05:49:37Z) - Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks [63.803415430308114]
現在の大規模言語モデルは、マルチターンインタラクション設定における敵攻撃に対して脆弱である。
本研究では,木探索と統合したオンライン強化学習フレームワークであるDialTree-RPOを提案する。
提案手法は,従来の最先端手法と比較して,10のターゲットモデルに対して25.9%以上のASRを実現している。
論文 参考訳(メタデータ) (2025-10-02T17:57:05Z) - Automatic LLM Red Teaming [18.044879441434432]
我々は、AIを戦略的に破壊するように訓練する、新しいパラダイムを提案する。
生成エージェントは、きめ細かいトークンレベルのハーネス報酬を通じて、コヒーレントで多ターン攻撃戦略を学習する。
このアプローチは、ダイナミックな軌道ベースのプロセスとして、新しい最先端、根本的にリフレーミングなレッドチームを設定する。
論文 参考訳(メタデータ) (2025-08-06T13:52:00Z) - Strategize Globally, Adapt Locally: A Multi-Turn Red Teaming Agent with Dual-Level Learning [39.931442440365444]
AlgNameは、補完的な学習次元を通じて高度な人間の攻撃者をエミュレートする、新しい赤チームエージェントである。
AlgNameは、エージェントが新しいジェイルブレイク戦術を特定し、ゴールベースの戦術選択フレームワークを開発し、選択した戦術の迅速な定式化を洗練できるようにする。
JailbreakBenchに関する実証的な評価は、我々のフレームワークの優れた性能を示し、GPT-3.5-Turbo と Llama-3.1-70B に対する攻撃成功率の90%以上を、5つの会話ターンで達成した。
論文 参考訳(メタデータ) (2025-04-02T01:06:19Z) - Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models [62.12822290276912]
Auto-RTは、複雑な攻撃戦略を探索し最適化する強化学習フレームワークである。
探索効率を大幅に改善し、攻撃戦略を自動的に最適化することにより、Auto-RTはボーダの脆弱性範囲を検出し、検出速度が速く、既存の方法と比較して16.63%高い成功率を達成する。
論文 参考訳(メタデータ) (2025-01-03T14:30:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。