論文の概要: Distributed Quality-Diversity Search for Toxicity in Large Language Models
- arxiv url: http://arxiv.org/abs/2606.24166v1
- Date: Tue, 23 Jun 2026 05:40:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 22:16:48.794514
- Title: Distributed Quality-Diversity Search for Toxicity in Large Language Models
- Title(参考訳): 大規模言語モデルにおける毒性の分散品質多様性探索
- Authors: Onkar Shelar, Travis Desell,
- Abstract要約: ToxSearch-Sは毒性に焦点を当てた進化的プロンプトサーチの拡張である。
ToxSearch-Sは、ToxSearchとRainbowPlusの両方と競合するピーク毒性を持つ。
MPIディストリビューションは、約1.8タイムで2人の労働者が3.2タイムで4人の労働者が3.2タイムで、Best@Bは統計的にシーケンシャルな実行と区別できない。
- 参考スコア(独自算出の注目度): 3.2729350470429783
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models remain vulnerable to adversarial prompts that elicit harmful responses, and scaling red-teaming to cover a broad range of failure modes is constrained by the cost of text generation and evaluation. We present \emph{ToxSearch-S}, a speciated extension of toxicity-focused evolutionary prompt search with incremental, embedding-driven niche maintenance, together with an MPI master-worker realization that centralizes population and species bookkeeping on rank~0 while offloading prompt evolution and evaluation to $n_w$ parallel workers. Under a common budget, ToxSearch-S attains peak toxicity competitive with both ToxSearch and RainbowPlus while following a measurably less toxic best-so-far trajectory, indicating lower cumulative search pressure. Diversity is non-uni-dimensional: RainbowPlus yields greater embedding-level spread, whereas ToxSearch-S partitions high-toxicity prompts into more localized behavioral pockets, reflected by a higher DBSCAN cluster count. MPI distribution delivers substantial wall-clock gains, approximately $1.8\times$ with two workers and $3.2\times$ with four, while leaving Best@B statistically indistinguishable from sequential execution. Four-worker runs also produce significantly larger final species cardinality and more toxicity-bearing species, without a reliable gain in global peak toxicity. These results position incremental speciation as a practical quality-diversity mechanism for AI Safety and MPI as an effective means of compressing time-to-result while preserving measured search outcomes.
- Abstract(参考訳): 大規模な言語モデルは、有害な応答を誘発する敵のプロンプトに対して脆弱なままであり、幅広い障害モードをカバーするためにレッドチームのスケーリングは、テキスト生成と評価のコストによって制限される。
我々は, 毒性に着目した進化的急激な探索を, 漸進的, 埋め込み型ニッチな保守により拡張した「emph{ToxSearch-S}」と, 集団と種帳のランクを0~0に集中させ, 即時進化と評価を$n_w$並列作業員にオフロードするMPIマスターワークの実現について述べる。
共通の予算の下では、ToxSearch-SはToxSearchとRainbowPlusの双方と最高毒性を競い合う一方で、最も毒性の低い最遠軌跡を辿り、累積的な探索圧力が低いことを示す。
一方、ToxSearch-Sパーティショニングは、高いDBSCANクラスタ数によって反映される、より局所的な行動ポケットに高毒性を誘導する。
MPIディストリビューションは、約1.8\times$2人の労働者と3.2\times$4のウォールタイムゲインを提供し、Best@Bはシーケンシャルな実行とは統計的に区別できないままである。
4人の作業員は、地球規模のピーク毒性が確実に上昇することなく、より大きな最終種濃度とより有毒な種を生産する。
これらの結果から,AIセーフティとMPIの実用的な品質多様性メカニズムとしてインクリメンタル・スペクタライゼーションが位置づけられ,検索結果の保存に要する時間を圧縮する有効な手段となった。
関連論文リスト
- Measuring and Mitigating Toxicity in Large Language Models: A Comprehensive Replication Study [0.0]
Webスケールコーパスでトレーニングされた大規模言語モデル(LLM)は、本質的にトレーニングデータから有害なパターンを吸収する。
復号時間エキスパート(Decoding-time Experts, DExperts)は、モデルの再訓練を必要とせずに生成を行う推論時間緩和手法である。
この研究は、明示的な毒性軽減と暗黙的な毒性軽減のギャップを強調することで、AI安全性に関する研究の活発化に寄与する。
論文 参考訳(メタデータ) (2026-05-13T20:12:30Z) - Exposing Long-Tail Safety Failures in Large Language Models through Efficient Diverse Response Sampling [16.855507865785345]
本研究は, 各種応答生成(アウトプット空間探索)によって安全障害を系統的に暴露し, 固定された安全クリティカルプロンプトを提案する。
本稿では,トークンレベルのサンプリングと多様性を意識した選択を組み合わせたプログレッシブ・ディバース・ポピュレーション・サンプリングを提案する。
大規模IIDサンプリングに匹敵する攻撃成功率を実現し、計算コストの8%から29%しか使用していない。
論文 参考訳(メタデータ) (2026-03-15T12:45:29Z) - Unveiling Covert Toxicity in Multimodal Data via Toxicity Association Graphs: A Graph-Based Metric and Interpretable Detection Framework [58.01529356381494]
Toxicity Association Graphs (TAG) に基づく新しい検出フレームワークを提案する。
隠れ毒性の定量化のための最初の指標であるMTC(Multimodal Toxicity Covertness)を紹介する。
本手法は,意思決定プロセスの完全解釈可能性を維持しつつ,隠蔽毒性の正確な同定を可能にする。
論文 参考訳(メタデータ) (2026-02-03T08:54:25Z) - Diversifying Toxicity Search in Large Language Models Through Speciation [3.2729350470429783]
ToxSearchは、大きな言語モデル(LLM)をレッドチーム化する実用的なブラックボックスアプローチである。
ToxSearchの特定品質多様性(QD)拡張について述べる。
論文 参考訳(メタデータ) (2026-01-28T19:29:54Z) - Evolving Prompts for Toxicity Search in Large Language Models [3.2729350470429783]
ToxSearchは、安定的なループ内でプロンプトを進化させることで、モデルの安全性をテストする進化的フレームワークである。
実用的には有意だが減衰したクロスモデル転送を観察し,ほとんどの標的に対してほぼ半分の毒性を示す。
これらの結果から, 小型で制御可能な摂動は, 系統的な赤チーム構築に有効であることが示唆された。
論文 参考訳(メタデータ) (2025-11-16T07:47:31Z) - Rethinking Toxicity Evaluation in Large Language Models: A Multi-Label Perspective [104.09817371557476]
大規模言語モデル(LLM)は、様々な自然言語処理タスクにおいて印象的な結果を得た。
有害なコンテンツを生み出す可能性には、深刻な安全上の懸念が浮かび上がっている。
毒性検出のための3つの新しいマルチラベルベンチマークを導入する。
論文 参考訳(メタデータ) (2025-10-16T06:50:33Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Detoxifying Large Language Models via Autoregressive Reward Guided Representation Editing [77.75609817898035]
大規模言語モデル(LLM)は、様々なタスクにわたって印象的なパフォーマンスを示してきたが、有害なコンテンツの生成には弱いままである。
textscAutoregressive textscReward textscGuided textscRe presentation textscEditing (ARGRE)を提案する。
ARGREは遅延表現空間内の毒性遷移を明示的にモデル化し、安定かつ正確な報酬誘導編集を可能にする。
論文 参考訳(メタデータ) (2025-09-24T03:40:32Z) - ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs [72.8646625127485]
マルチモーダルな暗黙の毒性は、社会プラットフォームにおける形式的なステートメントとしてだけでなく、有害なダイアログにつながる可能性がある。
単調なテキストや画像のモデレーションの成功にもかかわらず、多モーダルな内容、特に多モーダルな暗黙的な毒性に対する毒性の検出は未発見のままである。
マルチモーダルな暗黙的毒性の検出を促進するために,多モーダルな文,プロンプト,ダイアログにおける暗黙的な毒性を認識するモデルであるShieldVLMを構築した。
論文 参考訳(メタデータ) (2025-05-20T07:31:17Z) - RedDiffuser: Red Teaming Vision-Language Models for Toxic Continuation via Reinforced Stable Diffusion [27.68654681867373]
VLM(Vision-Language Models)は、ジェイルブレイク攻撃に対して脆弱である。
本研究では, 有害な連続性という, この脅威の近親相姦変異について検討する。
有害な連続を誘発する自然界の逆画像を生成するRedDiffuserを提案する。
論文 参考訳(メタデータ) (2025-03-08T13:51:40Z) - Modeling the Q-Diversity in a Min-max Play Game for Robust Optimization [61.39201891894024]
群分布的ロバスト最適化(群 DRO)は、事前定義された群に対する最悪の損失を最小限にすることができる。
グループDROフレームワークをQ-Diversityを提案して再構築する。
インタラクティブなトレーニングモードによって特徴付けられるQ-Diversityは、アノテーションからグループ識別を緩和し、直接パラメータ化を行う。
論文 参考訳(メタデータ) (2023-05-20T07:02:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。