論文の概要: Information Theoretic Adversarial Training of Large Language Models
- arxiv url: http://arxiv.org/abs/2605.05415v1
- Date: Wed, 06 May 2026 20:20:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.404309
- Title: Information Theoretic Adversarial Training of Large Language Models
- Title(参考訳): 大規模言語モデルの情報理論対応学習
- Abstract要約: WARDENは、大規模言語モデルのための、分散的に堅牢な敵対的トレーニングフレームワークである。
経験的トレーニング分布を中心に設定されたf分割あいまいさを通じて、敵の例を動的に重み付けする。
これは、CAT-、CAPO-、MixATベースのベースラインに匹敵する計算およびユーティリティコストによる攻撃成功率を大幅に削減する。
- 参考スコア(独自算出の注目度): 26.056920129810294
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Large language models (LLMs) remain vulnerable to adversarial prompting despite advances in alignment and safety, often exhibiting harmful behaviors under novel attack strategies. While adversarial training can improve robustness, existing approaches are computationally expensive and difficult to scale. Recent continuous adversarial training methods, such as Continuous adversarial training (CAT) and Continuous Adversarial Preference Optimization (CAPO), address this challenge by leveraging gradient-based perturbations in the embedding space, enabling more efficient and expressive attacks. Building on this paradigm, we propose WARDEN, a distributionally robust adversarial training framework for LLMs that dynamically reweights adversarial examples through an f -divergence ambiguity set around the empirical training distribution. Our method optimizes the worst-case adversarial loss within a divergence ball around the empirical data distribution, automatically emphasizing harder adversarial examples. Using the convex dual formulation, the objective reduces to a log-sum-exp form under the KL divergence, with a dynamical parameter controlling the strength of reweighting. This study leads to a new class of information-theoretic objectives that significantly reduce attack success rates while maintaining model utility. Across multiple LLMs and attack settings, WARDEN substantially reduces attack success rates with computational and utility costs comparable to CAT-, CAPO-, and MixAT-based baselines, making it a practical approach for scalable robust alignment.
- Abstract(参考訳): 大規模言語モデル(LLM)は、アライメントと安全性の進歩にもかかわらず、敵の攻撃に弱いままであり、しばしば新しい攻撃戦略の下で有害な行動を示す。
対戦型トレーニングは堅牢性を改善することができるが、既存のアプローチは計算コストが高く、スケールが難しい。
CAT(Continuous Adversarial Training)やCAPO(Continuous Adversarial Preference Optimization)といった最近の継続的な逆行訓練手法は、埋め込み空間における勾配に基づく摂動を利用して、より効率的で表現力のある攻撃を可能にすることで、この問題に対処している。
このパラダイムを基礎として,実験的学習分布に設定されたf分割あいまいさを生かして,動的に敵例を重み付けするLLMの分散的堅牢な敵訓練フレームワークであるWARDENを提案する。
本手法は, 実験データ分布の周囲に分散する球体内の最悪の対向損失を最適化し, より難しい対向例を自動的に強調する。
凸双対定式化を用いて、この目的はKL分散の下で対数-sum-exp形式に還元され、動的パラメータは再重み付けの強度を制御する。
本研究は, モデル実用性を維持しつつ, 攻撃成功率を大幅に低減する情報理論の新たなクラスを導出する。
複数のLLMとアタック設定で、WARDENはCAT-、CAPO-、MixATベースのベースラインに匹敵する計算とユーティリティコストで攻撃成功率を大幅に削減し、スケーラブルなロバストアライメントのための実用的なアプローチである。
関連論文リスト
- Low Rank Adaptation for Adversarial Perturbation [50.24377354110586]
Low-Rank Adaptation (LoRA) はLarge Language Models (LLM) のトレーニング効率を大幅に改善した。
逆方向の例の生成はモデルトレーニングに類似した最適化プロセスであるため、これは自然に疑問を提起する: 逆方向の摂動は同様の低ランク構造を示すか?
本稿では, 種々の攻撃手法, モデルアーキテクチャ, およびデータセットに関する理論的解析および広範な実証的研究を行い, 対向摂動が実際に低ランク構造を持つことを示す。
論文 参考訳(メタデータ) (2026-04-30T06:38:28Z) - Closing the Distribution Gap in Adversarial Training for LLMs [50.33186122381395]
LLMの対抗訓練は、敵に対する堅牢性を確実に改善する最も有望な方法の1つである。
現在の対人訓練アルゴリズムは、トレーニングセットにおける敵の損失を最小限に抑えるが、データ分布を不十分にカバーし、一見単純な攻撃の脆弱性をもたらすと我々は主張する。
そこで我々は,プロンプトと応答の真の結合分布を近似するために,DAT(Distributal Adversarial Training)を提案する。
論文 参考訳(メタデータ) (2026-02-16T22:34:52Z) - Deep Leakage with Generative Flow Matching Denoiser [54.05993847488204]
再建プロセスに先立って生成フローマッチング(FM)を組み込んだ新しい深部リーク攻撃(DL)を導入する。
当社のアプローチは、ピクセルレベル、知覚的、特徴に基づく類似度測定において、最先端の攻撃よりも一貫して優れています。
論文 参考訳(メタデータ) (2026-01-21T14:51:01Z) - Adversarial Defence without Adversarial Defence: Enhancing Language Model Robustness via Instance-level Principal Component Removal [28.588188876688037]
プレトレーニング言語モデル(PLM)は、自然言語処理の大幅な進歩を導いてきたが、敵の攻撃に弱いままである。
PLMの対角的堅牢性を向上する,シンプルで効果的なアドオンモジュールを提案する。
論文 参考訳(メタデータ) (2025-07-29T12:31:26Z) - Adversarial Training in Low-Label Regimes with Margin-Based Interpolation [8.585017175426023]
敵の攻撃に抵抗する堅牢なニューラルネットワークモデルをトレーニングするための効果的なアプローチとして、敵のトレーニングが登場した。
本稿では,頑健性と自然な精度を両立させる,新たな半教師付き対人訓練手法を提案する。
論文 参考訳(メタデータ) (2024-11-27T00:35:13Z) - Efficient Adversarial Training in LLMs with Continuous Attacks [99.5882845458567]
大規模言語モデル(LLM)は、安全ガードレールをバイパスできる敵攻撃に対して脆弱である。
本稿では,2つの損失からなる高速対向訓練アルゴリズム(C-AdvUL)を提案する。
C-AdvIPOは、対向的に堅牢なアライメントのためのユーティリティデータを必要としない、対向型のIPOである。
論文 参考訳(メタデータ) (2024-05-24T14:20:09Z) - Doubly Robust Instance-Reweighted Adversarial Training [107.40683655362285]
本稿では,2重のインスタンス再重み付き対向フレームワークを提案する。
KL偏差正規化損失関数の最適化により重みを求める。
提案手法は, 平均ロバスト性能において, 最先端のベースライン法よりも優れた性能を示す。
論文 参考訳(メタデータ) (2023-08-01T06:16:18Z) - On the Generalization Properties of Adversarial Training [21.79888306754263]
本稿では,汎用的対数学習アルゴリズムの一般化性能について検討する。
滑らかさとL1のペナル化がモデルの対向的堅牢性をどのように改善するかを示すために、一連の数値的研究が行われた。
論文 参考訳(メタデータ) (2020-08-15T02:32:09Z) - Adversarial Distributional Training for Robust Deep Learning [53.300984501078126]
逆行訓練(AT)は、逆行例によるトレーニングデータを増やすことにより、モデルロバスト性を改善する最も効果的な手法の一つである。
既存のAT手法の多くは、敵の例を作らせるために特定の攻撃を採用しており、他の目に見えない攻撃に対する信頼性の低い堅牢性につながっている。
本稿では,ロバストモデル学習のための新しいフレームワークであるADTを紹介する。
論文 参考訳(メタデータ) (2020-02-14T12:36:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。