論文の概要: Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation
- arxiv url: http://arxiv.org/abs/2607.14256v1
- Date: Wed, 15 Jul 2026 18:13:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.883418
- Title: Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation
- Title(参考訳): マルチレベルエージェントデータキュレーションによるハードサンプルの自動合成
- Abstract要約: MLLM(Multimodal Large Language Models)は、コンテンツ安全性とモデレーションタスクのために、ますます多くデプロイされている。
従来のアクティブな学習と手動のアノテーションは、新しいマルチモーダル脅威の複雑さとボリュームに対してスケールできない。
難解な例を体系的に合成する自動エージェント型レッドチームフレームワークを提案する。
- 参考スコア(独自算出の注目度): 6.991910357381941
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal Large Language Models (MLLMs) are increasingly deployed for nuanced content safety and moderation tasks, yet they remain vulnerable to adversarial attacks and out-of-distribution edge cases. Traditional active learning and manual annotation fail to scale against the complexity and volume of novel multimodal threats. In this paper, we propose an automated, agentic red-teaming framework that systematically synthesizes difficult examples using an iterative strategy that proposes novel hypotheses as well as mutating on past attempts. Leveraging a multi-agent architecture that consists of a high-reasoning Architect agent, an advanced image generator, and a multi-level verification committee of LLM raters, our system autonomously uncovers boundary-pushing violations and ambiguous policy edge cases without any human intervention. By employing these carefully synthesized adversarial examples as in-context demonstrations via test-time Retrieval, we substantially improve the target model's robustness, reducing the False Negative Rate (FNR) from 41.2% to 24.5% in a public image safety benchmark without relying on any human labeling.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、コンテンツ安全性とモデレーションタスクのためにますます多くデプロイされているが、敵の攻撃やアウト・オブ・ディストリビューションのエッジケースに弱いままである。
従来のアクティブな学習と手動のアノテーションは、新しいマルチモーダル脅威の複雑さとボリュームに対してスケールできない。
本稿では,新しい仮説を提案し,過去の試みを変異させる反復的戦略を用いて,難解な事例を体系的に合成する自動エージェント型レッドチームフレームワークを提案する。
高レベルなアーキテクトエージェント、先進的なイメージジェネレータ、LLMレーダのマルチレベル検証委員会で構成されるマルチエージェントアーキテクチャを活用して、我々のシステムは、人的介入なしに境界破れやあいまいなポリシーエッジケースを自律的に発見する。
これらの厳密に合成された逆数例をテスト時間検索によるインコンテキストデモとして採用することにより、ターゲットモデルのロバスト性を大幅に改善し、FNR(False Negative Rate)を41.2%から24.5%に削減した。
関連論文リスト
- Generating Attacks for LLMs with GFlowNets [1.5749416770494706]
本研究は,既存のベンチマークと比較して,より効果的な英語の敵攻撃を生成することを目的としている。
文学への新たな貢献として、トルコ語で攻撃入力を生成できるモデルを導入する。
論文 参考訳(メタデータ) (2026-08-10T19:39:10Z) - Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks [56.45762972211923]
マルチターン攻撃に対するLDMの安全性を確保するためのプロアクティブ・ディフェンス・フレームワークを提案する。
特殊なエージェントが補完的な防衛戦略を実行するような、協調的なマルチエージェントアーキテクチャを採用している。
マルチターン攻撃における進化戦略をシミュレートするEMRAデータセットを提案する。
論文 参考訳(メタデータ) (2026-07-31T14:04:49Z) - Reasoning as an Attack Surface: Adaptive Evolutionary CoT Jailbreaks for LLMs [56.53007443197966]
大規模推論モデル(LRM)は推論および生成タスクにおいて顕著な機能を示した。
彼らの明確なチェーン・オブ・シント(CoT)メカニズムは、新しいセキュリティリスクをもたらし、特にジェイルブレイク攻撃に対して脆弱である。
AE-CoTと呼ばれる適応的な進化的CoTジェイルブレイクフレームワークを提案し、これらの制限を克服する。
論文 参考訳(メタデータ) (2026-05-23T10:11:32Z) - Transient Turn Injection: Exposing Stateless Multi-Turn Vulnerabilities in Large Language Models [0.0]
本稿では,新しいマルチターン攻撃技術であるTransient Turn Injection (TTI)を紹介する。
TTIは、孤立した相互作用に反する意図を分散することで、ステートレスなモデレーションを利用する。
本研究は, 包括的, 文脈対応型防衛の必要性を浮き彫りにしている。
論文 参考訳(メタデータ) (2026-04-23T16:56:14Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming [64.48633529149579]
本稿では,VLA(Vision-Language-Action)モデルの言語的変異に対する脆弱性を明らかにするための新しいフレームワークを提案する。
本手法は, ストレス試験用VLAエージェントへのスケーラブルなアプローチを示すため, 平均作業成功率を93.33%から5.85%に下げる。
論文 参考訳(メタデータ) (2026-04-07T08:43:36Z) - Multi-Paradigm Collaborative Adversarial Attack Against Multi-Modal Large Language Models [67.45032003041399]
本稿では,MLLMに対する敵例の転送可能性を高めるために,MPCAttack(Multi-Paradigm Collaborative Attack)フレームワークを提案する。
MPCOは異なるパラダイム表現の重要性を適応的にバランスさせ、グローバルな最適化を導く。
我々のソリューションは、オープンソースおよびクローズドソースMLLMに対する標的および未ターゲットの攻撃において、常に最先端の手法よりも優れています。
論文 参考訳(メタデータ) (2026-03-05T06:01:26Z) - OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMs [36.57820295876294]
MLLMの安全性評価のための統一的,モジュール型,高スループットのRed-teamingフレームワークであるOpenRTを紹介した。
OpenRTのコアとなるのは,5次元にわたるモジュール分離を可能にする対角カーネルを導入することで,自動化された再チームのパラダイムシフトだ。
このフレームワークは、ホワイトボックス勾配、マルチモーダル摂動、高度なマルチエージェント進化戦略など、37の多様な攻撃手法を統合している。
論文 参考訳(メタデータ) (2026-01-04T16:41:33Z) - Unvalidated Trust: Cross-Stage Vulnerabilities in Large Language Model Architectures [0.0]
本稿では,商業用言語モデルにおける41の繰り返しリスクパターンのメカニズム中心の分類法を提案する。
これらの動作がアーキテクチャ上の障害モードを構成し、文字列レベルのフィルタリングだけでは不十分である、と我々は主張する。
論文 参考訳(メタデータ) (2025-10-30T09:38:45Z) - AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models [0.0]
大規模言語モデル(LLM)は、ジェイルブレイク攻撃の脆弱性を示し続けている。
本稿では,敵対的即時生成を自動化する新しいフレームワークであるAutoAdvを紹介する。
我々の攻撃は、有害なコンテンツ生成に対して最大86%のジェイルブレイク成功率を達成したことを示す。
論文 参考訳(メタデータ) (2025-04-18T08:38:56Z) - Benchmarking Adversarial Robustness to Bias Elicitation in Large Language Models: Scalable Automated Assessment with LLM-as-a-Judge [1.1666234644810893]
小さなモデルは安全性においてより大きなモデルよりも優れており、トレーニングとアーキテクチャがスケール以上の意味を持つ可能性があることを示唆している。
低リソース言語を使ったジェイルブレイク攻撃や拒否抑制が効果的であるなど、敵の誘惑に対して完全に堅牢なモデルはない。
論文 参考訳(メタデータ) (2025-04-10T16:00:59Z) - MIRAGE: Multimodal Immersive Reasoning and Guided Exploration for Red-Team Jailbreak Attacks [85.3303135160762]
MIRAGEは、物語駆動型コンテキストとロール没入を利用して、マルチモーダル大規模言語モデルにおける安全性メカニズムを回避する新しいフレームワークである。
最先端のパフォーマンスを達成し、最高のベースラインよりも攻撃成功率を最大17.5%向上させる。
役割の浸漬と構造的セマンティック再構築は、モデル固有のバイアスを活性化し、モデルが倫理的保護に自発的に違反することを実証する。
論文 参考訳(メタデータ) (2025-03-24T20:38:42Z) - Tiny Refinements Elicit Resilience: Toward Efficient Prefix-Model Against LLM Red-Teaming [37.32997502058661]
本稿では,数個のトークンで入力プロンプトを再構築するプラグイン・アンド・プレイプレフィックスモジュールとしてtextbfsentinel モデルを提案する。
センチネルモデルは、微調整された大きなターゲットモデルに対するテキストパラメータ非効率性とテキスト制限モデルアクセシビリティを自然に克服する。
テキスト・ツー・テキスト・ツー・イメージを用いた実験により,有害な出力を緩和する手法の有効性が示された。
論文 参考訳(メタデータ) (2024-05-21T08:57:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。