論文の概要: When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs
- arxiv url: http://arxiv.org/abs/2607.24392v1
- Date: Mon, 27 Jul 2026 13:07:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.423174
- Title: When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs
- Title(参考訳): LLMがバックファイアを防衛する時:安全、パフォーマンス、コストのトレードオフを特徴付ける
- Abstract要約: 大規模言語モデル(LLM)の保護には脱獄防御が不可欠である
本研究では,これらの防衛トレードオフを,性能への影響,良性入力に対する過剰な拒絶,推論コストの3つの側面に沿って検討する。
防衛は下流の能力を改善することはめったにないが、その代わりに、ユーザビリティと効率性に対する安全性の利益の取引方法が異なる。
- 参考スコア(独自算出の注目度): 15.115024090532117
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Jailbreak defenses are essential for protecting large language models (LLMs), but they can also introduce secondary costs that weaken model utility. We present a systematic study of these defense trade-offs along three dimensions: performance impact, over-refusal on benign inputs, and inference cost. Rather than treating defenses as a single class, we organize them by operational strategy and examine how different strategies correlate with different side-effect profiles. Across state-of-the-art defense methods, widely used benchmark datasets, and representative open-source LLMs, we find that defenses rarely improve downstream capability, but instead vary in how they trade safety gains against usability and efficiency. In particular, rule-based defenses best preserve task performance, highly conservative self-reflective defenses often increase over-refusal, and multi-round defenses incur the largest runtime overhead. These results provide both a benchmark for evaluating defense side effects and practical guidance for selecting defenses under deployment constraints.
- Abstract(参考訳): 大規模な言語モデル(LLM)を保護するには、脱獄防御が不可欠だが、モデルユーティリティを弱める二次コストを導入することもできる。
本稿では,これら3次元の防御トレードオフについて,性能への影響,良性入力に対する過剰な拒絶,推論コストの3つの側面に沿って体系的に検討する。
防衛を単一クラスとして扱うのではなく、運用戦略によってそれらを整理し、異なる戦略が異なる副作用プロファイルとどのように相関するかを検討する。
最先端の防衛方法,広く使用されているベンチマークデータセット,およびオープンソース LLM の代表的な例では,防衛が下流の能力を改善することはめったにないが,その代わりに,ユーザビリティと効率性に対する安全性の取引方法が異なる。
特に、ルールベースの防御はタスク性能を最善に保ち、高度に保守的な自己反射防御はしばしば過剰な拒絶を増大させ、複数ラウンド防衛は最大のランタイムオーバーヘッドを発生させる。
これらの結果は,防衛効果を評価するためのベンチマークと,配備制約下での防衛選択のための実践的ガイダンスの両方を提供する。
関連論文リスト
- What Does It Mean to Break a Distillation Defense? [33.607700445538136]
ブラックボックスのLSMは蒸留攻撃に弱いので、攻撃者がモデルに問い合わせて、その出力で生徒を訓練する。
本稿では,クエリ予算,データ予算,インターフェースプロファイルという,攻撃者の3つの側面を記述した脅威モデルフレームワークを提案する。
蒸留防衛の今後の取り組みは、それらの周辺に構築されたガバナンスや政策の枠組みとともに、明示的に特定し、ストレステストのアタッカーの能力をテストすべきである、と我々は主張する。
論文 参考訳(メタデータ) (2026-06-23T18:13:02Z) - Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations [0.9732319879728966]
大きな言語モデル(LLM)は、安全フィルタを回避し、有害または非倫理的な振る舞いを誘発するジェイルブレイクの悪用に影響を受けやすいままである。
この研究は、即時レベル、モデルレベル、トレーニングタイムの介入にまたがって、既存のジェイルブレイク防御の体系的な分類を提示している。
論文 参考訳(メタデータ) (2025-11-24T09:38:11Z) - Benchmarking Misuse Mitigation Against Covert Adversaries [80.74502950627736]
既存の言語モデルの安全性評価は、オーバースト攻撃と低レベルのタスクに重点を置いている。
我々は、隠蔽攻撃と対応する防御の評価を自動化するデータ生成パイプラインである、ステートフルディフェンスのためのベンチマーク(BSD)を開発した。
評価の結果,分解攻撃は有効な誤用防止剤であり,その対策としてステートフルディフェンスを強調した。
論文 参考訳(メタデータ) (2025-06-06T17:33:33Z) - MISLEADER: Defending against Model Extraction with Ensembles of Distilled Models [56.09354775405601]
モデル抽出攻撃は、クエリアクセスを通じてブラックボックスモデルの機能を複製することを目的としている。
既存のディフェンスでは、アタッカークエリにはオフ・オブ・ディストリビューション(OOD)サンプルがあることを前提としており、不審な入力を検出し破壊することができる。
OOD仮定に依存しない新しい防衛戦略であるMISLEADERを提案する。
論文 参考訳(メタデータ) (2025-06-03T01:37:09Z) - RAID: An In-Training Defense against Attribute Inference Attacks in Recommender Systems [20.165247039993574]
RAIDは、レコメンデーションシステムにおける属性推論攻撃に対する訓練中の防御手法である。
推奨目的に加えて,保護属性の分布がクラスラベルから独立することを保証するための防衛目的を定義する。
論文 参考訳(メタデータ) (2025-04-15T10:24:37Z) - You Can't Eat Your Cake and Have It Too: The Performance Degradation of LLMs with Jailbreak Defense [34.023473699165315]
脱獄防御戦略によるLCMの実用性低下, 安全性向上, 過大に安全なエスカレーションについて検討した。
主流のジェイルブレイク防御は、安全性とパフォーマンスの両方を同時に確保できないことに気付きました。
論文 参考訳(メタデータ) (2025-01-21T15:24:29Z) - Baseline Defenses for Adversarial Attacks Against Aligned Language
Models [109.75753454188705]
最近の研究は、テキストのモデレーションが防御をバイパスするジェイルブレイクのプロンプトを生み出すことを示している。
検出(複雑度に基づく)、入力前処理(言い換えと再帰化)、対人訓練の3種類の防衛について検討する。
テキストに対する既存の離散化の弱点と比較的高いコストの最適化が組み合わさって、標準適応攻撃をより困難にしていることがわかった。
論文 参考訳(メタデータ) (2023-09-01T17:59:44Z) - Avoid Adversarial Adaption in Federated Learning by Multi-Metric
Investigations [55.2480439325792]
Federated Learning(FL)は、分散機械学習モデルのトレーニング、データのプライバシの保護、通信コストの低減、多様化したデータソースによるモデルパフォーマンスの向上を支援する。
FLは、中毒攻撃、標的外のパフォーマンス劣化とターゲットのバックドア攻撃の両方でモデルの整合性を損なうような脆弱性に直面している。
我々は、複数の目的に同時に適応できる、強い適応的敵の概念を新たに定義する。
MESASは、実際のデータシナリオで有効であり、平均オーバーヘッドは24.37秒である。
論文 参考訳(メタデータ) (2023-06-06T11:44:42Z) - Randomness in ML Defenses Helps Persistent Attackers and Hinders
Evaluators [49.52538232104449]
堅牢なMLディフェンスを設計することがますます重要になっている。
近年の研究では、当初最先端の攻撃に抵抗する多くの防衛は、適応的な敵によって破壊される可能性があることが判明している。
我々は、防御設計をシンプルにし、ホワイトボックスの防御は可能な限りランダム性を損なうべきだと論じる。
論文 参考訳(メタデータ) (2023-02-27T01:33:31Z) - Guided Adversarial Attack for Evaluating and Enhancing Adversarial
Defenses [59.58128343334556]
我々は、より適切な勾配方向を見つけ、攻撃効果を高め、より効率的な対人訓練をもたらす標準損失に緩和項を導入する。
本稿では, クリーン画像の関数マッピングを用いて, 敵生成を誘導するGAMA ( Guided Adversarial Margin Attack) を提案する。
また,一段防衛における最先端性能を実現するためのGAT ( Guided Adversarial Training) を提案する。
論文 参考訳(メタデータ) (2020-11-30T16:39:39Z) - MAD-VAE: Manifold Awareness Defense Variational Autoencoder [0.0]
本稿では,防衛モデルの堅牢性を改善するためのいくつかの手法を紹介する。
MNISTデータセットに関する広範な実験により,本アルゴリズムの有効性を実証した。
また,既存の逆潜時空間攻撃の適用可能性についても論じる。
論文 参考訳(メタデータ) (2020-10-31T09:04:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。