論文の概要: AI Security Leaderboard: Methodology, Results and Minimal Standard
- arxiv url: http://arxiv.org/abs/2608.03070v1
- Date: Tue, 04 Aug 2026 03:32:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.019728
- Title: AI Security Leaderboard: Methodology, Results and Minimal Standard
- Title(参考訳): AIセキュリティリーダボード - 方法論,結果,最小限の標準
- Abstract要約: 最前線のAIモデル開発者は、破滅的な誤用を防ぐために階層化されたセーフガードをますます頼りにしている。
FAR.AI Minimal Standard for Safeguards, Version 1.0: 67の分類法である。
我々は、360度攻撃目標の合計2つのデータセットに対して、Claude Fable 5, GPT-5.6 Sol, Gemini 3.1 Pro, Grok 4.5を評価した。
- 参考スコア(独自算出の注目度): 25.993692415303553
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Frontier AI model developers increasingly rely on layered safeguards to prevent catastrophic misuse, but little public evidence exists on how much protection these safeguards provide, or how consistently across developers. We introduce the FAR.AI Minimal Standard for Safeguards, Version 1.0: a taxonomy of 67 readily accessible static jailbreak techniques, a method for composing them into a very large attack space, and a benchmark of flagship models against a sample of it. We evaluate Claude Fable 5, GPT-5.6 Sol, Gemini 3.1 Pro, and Grok 4.5 on two complementary datasets totalling 360 attacker goals spanning chemical, biological, radiological/nuclear and explosive (CBRNE) threats and offensive cyber, using a three-stage funnel to identify universal jailbreaks: single prompt templates that elicit operationally compliant responses on over 75% of a domain's goals. We also introduce a cost-to-jailbreak metric that models attacker spend directly, with right-censored lower bounds where no universal jailbreak was found. Robustness is highly uneven: the cost to break these models varies over a hundredfold. Random search over our technique pool found 63 universal jailbreaks against Grok 4.5 and 18 against Gemini 3.1 Pro, at an average cost of roughly $58 and $278 per jailbreak found; expert-guided composition raised these to 385 and 231. Neither Claude Fable 5 nor GPT-5.6 Sol yielded any universal jailbreak under either strategy. Because meeting the Minimal Standard requires only defenses already publicly described and deployed in production elsewhere, these gaps appear closable with current techniques. We recommend defense-in-depth combining reasoning, activation, and input/output monitoring. Results are maintained at leaderboard.far.ai.
- Abstract(参考訳): 最前線のAIモデル開発者は、破滅的な誤用を防ぐために階層化されたセーフガードをますます頼りにしている。
我々は、FAR.AI Minimal Standard for Safeguards、Version 1.0:67の分類法、アクセスしやすい静的ジェイルブレイク技術、非常に大きな攻撃空間にそれらを構成する方法、およびそのサンプルに対する旗艦モデルのベンチマークを紹介する。
我々は,Claude Fable 5, GPT-5.6 Sol, Gemini 3.1 Pro, Grok 4.5を,化学・生物・放射線・核・爆発(CBRNE)脅威と攻撃サイバーにまたがる2つの相補的データセット上で評価した。
また、モデル攻撃者が直接使うコスト対ジェイルブレイクの指標も導入しています。
ロバスト性は非常に不均一で、これらのモデルを壊すコストは100倍を超える。
我々のテクニックプールのランダム検索では、Grok 4.5と18対Gemini 3.1 Proで63の普遍的ジェイルブレイクが発見され、平均費用は5,8ドルから278ドルだった。
クロード・ファブル 5 も GPT-5.6 もソルはいずれの戦略も普遍的ジェイルブレイクは行わなかった。
最小基準を満たすためには、既に公に説明され、他の場所で運用されている防衛のみを必要とするため、これらのギャップは現在の技術で閉じることが可能である。
我々は、推論、アクティベーション、入出力監視を組み合わせたディフェンス・イン・ディペンデンスを推奨する。
結果はLeadboard.far.aiで維持される。
関連論文リスト
- Multi-Turn Jailbreaks Are Simpler Than They Seem [3.6010884750431438]
マルチターンジェイルブレイク攻撃は、シングルターン保護に最適化されたモデルに対して、70%以上の成功率を達成する。
この結果は,AIの安全性評価やジェイルブレイク耐性システムの設計に重要な意味を持つ。
論文 参考訳(メタデータ) (2025-08-11T05:57:41Z) - Jailbreak-Tuning: Models Efficiently Learn Jailbreak Susceptibility [9.430622637895011]
本稿では、オープンウェイトやクローズドファインチューニングAPIを経由したファインチューニングが、セーフガードを破壊した有用なモデルを生成することを実証する。
OpenAI、Google、およびAnthropicモデルはCBRNの支援、サイバー攻撃の実行、その他の犯罪活動の要求に完全に準拠する。
論文 参考訳(メタデータ) (2025-07-15T18:10:29Z) - One Model Transfer to All: On Robust Jailbreak Prompts Generation against LLMs [13.54228868302755]
ArrAttackは、防衛された大規模言語モデル(LLM)をターゲットにした攻撃方法である。
ArrAttackは、様々な防御措置をバイパスできる堅牢なジェイルブレイクプロンプトを自動的に生成する。
私たちの仕事は、ジェイルブレイク攻撃と防衛のギャップを埋め、堅牢なジェイルブレイクプロンプトを生成するための新たな視点を提供します。
論文 参考訳(メタデータ) (2025-05-23T08:02:38Z) - Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense [55.77152277982117]
私たちは、jailbreak攻撃から防御するために設計された方法であるLayer-AdvPatcherを紹介します。
私たちは、自己拡張データセットを通じて、大規模言語モデル内の特定のレイヤにパッチを適用するために、未学習の戦略を使用します。
我々の枠組みは、脱獄攻撃の有害性と攻撃の成功率を減らす。
論文 参考訳(メタデータ) (2025-01-05T19:06:03Z) - PrisonBreak: Jailbreaking Large Language Models with at Most Twenty-Five Targeted Bit-flips [10.157041060731006]
商業規模の安全対応型大規模言語モデル(LLM)の新たな脆弱性について検討する。
有害な応答を生成することの拒否は、モデルパラメータのほんの数ビットだけを反転させることによって破られる可能性がある。
私たちは5ビットフリップから25ビットフリップのジェイルブレイク言語モデルを作りました。
論文 参考訳(メタデータ) (2024-12-10T05:00:01Z) - Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment [97.38766396447369]
訓練時安全アライメントにもかかわらず、Multimodal Large Language Models (MLLM) はジェイルブレイク攻撃に対して脆弱である。
我々は,ジェイルブレイク攻撃に対する防御のために,制御復号化による安全な報酬モデルを活用する推論時防御フレームワークImmuneを提案する。
論文 参考訳(メタデータ) (2024-11-27T19:00:10Z) - IDEATOR: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves [70.43466586161345]
IDEATORは、ブラックボックスジェイルブレイク攻撃のための悪意のある画像テキストペアを自律的に生成する新しいジェイルブレイク手法である。
最近リリースされたVLM11のベンチマーク結果から,安全性の整合性に大きなギャップがあることが判明した。
例えば、我々はASRをGPT-4oで46.31%、Claude-3.5-Sonnetで19.65%と設定した。
論文 参考訳(メタデータ) (2024-10-29T07:15:56Z) - PAPILLON: Efficient and Stealthy Fuzz Testing-Powered Jailbreaks for LLMs [33.87649859430635]
大規模言語モデル(LLM)は様々なタスクに優れていますが、それでも脱獄攻撃に対して脆弱です。
PAPILLONは自動ブラックボックスジェイルブレイク攻撃フレームワークである。
ブラックボックスのファジテストアプローチを、一連のカスタマイズされた設計で適用する。
論文 参考訳(メタデータ) (2024-09-23T10:03:09Z) - EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models [53.87416566981008]
本稿では,大規模言語モデル(LLM)に対するジェイルブレイク攻撃の構築と評価を容易にする統合フレームワークであるEasyJailbreakを紹介する。
Selector、Mutator、Constraint、Evaluatorの4つのコンポーネントを使ってJailbreak攻撃を構築する。
10の異なるLSMで検証した結果、さまざまなジェイルブレイク攻撃で平均60%の侵入確率で重大な脆弱性が判明した。
論文 参考訳(メタデータ) (2024-03-18T18:39:53Z) - Weak-to-Strong Jailbreaking on Large Language Models [92.52448762164926]
大規模言語モデル(LLM)は、ジェイルブレイク攻撃に対して脆弱である。
既存のジェイルブレイク法は計算コストがかかる。
我々は、弱々しく強固な脱獄攻撃を提案する。
論文 参考訳(メタデータ) (2024-01-30T18:48:37Z) - Jailbroken: How Does LLM Safety Training Fail? [92.8748773632051]
ChatGPTの初期リリースに対する"jailbreak"攻撃は、望ましくない振る舞いを引き起こす。
このような攻撃がなぜ成功し、どのように発生できるかを考察する。
障害モードを利用した新たな攻撃は、安全でない要求の収集において、すべてのプロンプトで成功します。
論文 参考訳(メタデータ) (2023-07-05T17:58:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。