論文の概要: STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red Teaming
- arxiv url: http://arxiv.org/abs/2604.18976v1
- Date: Tue, 21 Apr 2026 01:58:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-22 22:41:49.570875
- Title: STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red Teaming
- Title(参考訳): STAR-Teaming: LLM Red Teamingにおける戦略応答型マルチプレックスネットワークアプローチ
- Authors: MinJae Jung, YongTaek Lim, Chaeyun Kim, Junghwan Kim, Kihyun Kim, Minwoo Kim,
- Abstract要約: 大きな言語モデル(LLM)は、有害または不適切な応答を誘発するジェイルブレイクプロンプトに影響を受けやすい。
本稿では,自動レッドチームのための新しいブラックボックスフレームワークSTAR-Teamingを紹介する。
- 参考スコア(独自算出の注目度): 10.305783997912508
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: While Large Language Models (LLMs) are widely used, they remain susceptible to jailbreak prompts that can elicit harmful or inappropriate responses. This paper introduces STAR-Teaming, a novel black-box framework for automated red teaming that effectively generates such prompts. STAR-Teaming integrates a Multi-Agent System (MAS) with a Strategy-Response Multiplex Network and employs network-driven optimization to sample effective attack strategies. This network-based approach recasts the intractable high-dimensional embedding space into a tractable structure, yielding two key advantages: it enhances the interpretability of the LLM's strategic vulnerabilities, and it streamlines the search for effective strategies by organizing the search space into semantic communities, thereby preventing redundant exploration. Empirical results demonstrate that STAR-Teaming significantly surpasses existing methods, achieving a higher attack success rate (ASR) at a lower computational cost. Extensive experiments validate the effectiveness and explainability of the Multiplex Network. The code is available at https://github.com/selectstar-ai/STAR-Teaming-paper.
- Abstract(参考訳): LLM(Large Language Models)は広く使われているが、有害または不適切な応答を誘発するジェイルブレイクプロンプトの影響を受けやすい。
本稿では,このようなプロンプトを効果的に生成する自動レッドチームのための新しいブラックボックスフレームワークSTAR-Teamingを紹介する。
STAR-Teamingは、Multi-Agent System (MAS)とStrategy-Response Multiplex Networkを統合し、効果的な攻撃戦略のサンプリングにネットワーク駆動最適化を利用する。
このネットワークベースのアプローチは、難解な高次元埋め込み空間をトラクタブルな構造に再キャストし、LSMの戦略的脆弱性の解釈可能性を高め、検索空間をセマンティックなコミュニティに整理することで効果的な戦略の探索を効率化し、冗長な探索を防止できるという2つの大きな利点をもたらす。
実験の結果、STAR-Teamingは既存の手法をはるかに上回り、より少ない計算コストでより高い攻撃成功率(ASR)を達成することが示された。
大規模な実験は、多重ネットワークの有効性と説明可能性を検証する。
コードはhttps://github.com/selectstar-ai/STAR-Teaming-paperで公開されている。
関連論文リスト
- Enhancing Network Intrusion Detection Systems: A Multi-Layer Ensemble Approach to Mitigate Adversarial Attacks [10.849171172103198]
敵対的な例は、機械学習(ML)アルゴリズムに対する深刻な脅威を表している。
本研究では,ネットワーク侵入検知システムのロバスト性を高めることにより,そのようなリスクを軽減することを目的とする。
論文 参考訳(メタデータ) (2026-03-11T04:53:48Z) - Automatic LLM Red Teaming [18.044879441434432]
我々は、AIを戦略的に破壊するように訓練する、新しいパラダイムを提案する。
生成エージェントは、きめ細かいトークンレベルのハーネス報酬を通じて、コヒーレントで多ターン攻撃戦略を学習する。
このアプローチは、ダイナミックな軌道ベースのプロセスとして、新しい最先端、根本的にリフレーミングなレッドチームを設定する。
論文 参考訳(メタデータ) (2025-08-06T13:52:00Z) - CoP: Agentic Red-teaming for Large Language Models using Composition of Principles [68.73212422583548]
本稿では,Large Language Models (LLM) のリピートプロセスを自動化するエージェントワークフローを提案する。
ヒューマンユーザは、AIエージェントへの指示として、効果的な赤チーム戦略を自動オーケストレーションし、ジェイルブレイクプロンプトを生成する、一連の赤チームの原則を提供する。
先進的なLLMに対して試験すると、CoPは新しいジェイルブレイクプロンプトを見つけ、最もよく知られているシングルターン攻撃の成功率を19.0倍に改善することで、前例のない安全リスクを明らかにしている。
論文 参考訳(メタデータ) (2025-06-01T02:18:41Z) - A Trustworthy Multi-LLM Network: Challenges,Solutions, and A Use Case [59.58213261128626]
複数の大規模言語モデル(LLM)を信頼性のあるマルチLLMネットワーク(MultiLLMN)に接続するブロックチェーン対応協調フレームワークを提案する。
このアーキテクチャは、複雑なネットワーク最適化問題に対する最も信頼性が高く高品質な応答の協調評価と選択を可能にする。
論文 参考訳(メタデータ) (2025-05-06T05:32:46Z) - Building Safe GenAI Applications: An End-to-End Overview of Red Teaming for Large Language Models [1.9574002186090496]
LLM(Large Language Models)の急速な成長は、プライバシー、セキュリティ、倫理上の懸念を生じさせる。
研究者は最近、レッドチームによる攻撃的なアプローチでこれらの取り組みを補完した。
本稿では,LLMレッド・チームリング文学の簡潔かつ実践的な概要について述べる。
論文 参考訳(メタデータ) (2025-03-03T17:04:22Z) - Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models [62.12822290276912]
Auto-RTは、複雑な攻撃戦略を探索し最適化する強化学習フレームワークである。
探索効率を大幅に改善し、攻撃戦略を自動的に最適化することにより、Auto-RTはボーダの脆弱性範囲を検出し、検出速度が速く、既存の方法と比較して16.63%高い成功率を達成する。
論文 参考訳(メタデータ) (2025-01-03T14:30:14Z) - Learning diverse attacks on large language models for robust red-teaming and safety tuning [126.32539952157083]
レッドチーム、あるいは有害な応答を誘発するプロンプトの特定は、大きな言語モデルの安全なデプロイを保証するための重要なステップである。
新規性と多様性を優先する明確な規則化であっても、既存のアプローチはモード崩壊または効果的な攻撃を発生させることができないことを示す。
我々は,GFlowNetの微調整と二次平滑化フェーズを用いて,多種多様な効果的な攻撃プロンプトを生成するために攻撃モデルを訓練することを提案する。
論文 参考訳(メタデータ) (2024-05-28T19:16:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。