論文の概要: SDM: A Powerful Tool for Evaluating Model Robustness
- arxiv url: http://arxiv.org/abs/2605.20308v1
- Date: Tue, 19 May 2026 16:10:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-21 19:19:56.289079
- Title: SDM: A Powerful Tool for Evaluating Model Robustness
- Title(参考訳): SDM: モデルロバスト性を評価する強力なツール
- Authors: Xinlei Liu, Tao Hu, Jichao Xie, Peng Yi, Hailong Ma, Baolin Li,
- Abstract要約: 逐次差分最大化(SDM)という,新規で強力な勾配に基づく攻撃手法を提案する。
SDMはより強力な攻撃性能を達成し、より優れたコスト効率を示す。
- 参考スコア(独自算出の注目度): 7.8217298436598846
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Gradient-based attacks are important methods for evaluating model robustness. However, since the proposal of APGD, it has been difficult for such methods to achieve significant breakthroughs. To achieve such an effect, we first analyze the issue of "high-loss non-adversarial examples" that degrades attack performance in previous methods, and prove that this issue arises from inappropriate objectives for adversarial example generation. Subsequently, we reconstruct the objective as "maximizing the difference between the non-ground-truth label probability upper bound and the ground-truth label probability", and proposes a novel and powerful gradient-based attack method named Sequential Difference Maximization (SDM). SDM establishes a three-layer optimization framework of "cycle-stage-step". It adopts the negative probability loss function and the Directional Probability Difference Ratio (DPDR) loss function in the initial and subsequent optimization stages, respectively, and approaches the ideal objective of adversarial example generation via stage-wise sequential optimization. Experiments demonstrate that compared with previous state-of-the-art methods, SDM not only achieves stronger attack performance but also exhibits superior cost-effectiveness. The code is available at https://github.com/X-L-Liu/ICML-SDM.
- Abstract(参考訳): グラディエントベースの攻撃は、モデルの堅牢性を評価する重要な方法である。
しかし、APGDの提案以来、このような手法が大きなブレークスルーを達成することは困難である。
このような効果を達成するために、我々はまず、従来の手法で攻撃性能を低下させる「高損失非敵例」の問題を分析し、敵例生成の不適切な目的からこの問題が生じることを証明した。
続いて, 目的を「非構造的ラベル確率上限と基底構造的ラベル確率の差分を最大化する」として再構築し, 逐次差分最大化(SDM)という, 新規で強力な勾配に基づく攻撃手法を提案する。
SDMは、"cycle-stage-step"という3層最適化フレームワークを確立する。
初期およびその後の最適化段階においてそれぞれ負の確率損失関数と指向性確率差比(DPDR)損失関数を採用し、段階的に逐次最適化することで、逆例生成の理想的な目的にアプローチする。
実験により、従来の最先端手法と比較して、SDMは攻撃性能を向上するだけでなく、コスト効率も優れていることが示された。
コードはhttps://github.com/X-L-Liu/ICML-SDMで入手できる。
関連論文リスト
- The Power of Decaying Steps: Enhancing Attack Stability and Transferability for Sign-based Optimizers [9.020853139493239]
非収束性と不安定性の1つの原因は、非遅延的なステップサイズスケジューリングである、と我々は主張する。
そこで本研究では,信号ベース対角線における一律的なステップサイズ決定を強制する,新たな攻撃アルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-02-22T08:37:06Z) - Enhancing Adversarial Transferability by Balancing Exploration and Exploitation with Gradient-Guided Sampling [82.52485740425321]
アドリアックは、ディープニューラルネットワークの堅牢性にとって重要な課題である。
敵攻撃の伝達性は、爆発(最大攻撃能力)と探索(クロスモデル一般化の促進)のジレンマに直面している
論文 参考訳(メタデータ) (2025-11-01T05:43:47Z) - Exploring Semantic-constrained Adversarial Example with Instruction Uncertainty Reduction [51.50282796099369]
本稿では,多次元命令の不確実性低減フレームワークを開発し,意味論的に制約された逆の例を生成する。
言語誘導サンプリングプロセスの予測により、設計したResAdv-DDIMサンプルにより最適化プロセスが安定化される。
セマンティック制約付き3次元逆数例の参照フリー生成を初めて実現した。
論文 参考訳(メタデータ) (2025-10-27T04:02:52Z) - Sequential Difference Maximization: Generating Adversarial Examples via Multi-Stage Optimization [6.225208440906177]
逐次差分最大化(SDM)と呼ばれる勾配に基づく攻撃手法を提案する。
SDMは「サイクルステージ段階」の3層最適化フレームワークを確立する
実験により、SDMはより強力な攻撃性能を示すだけでなく、より高い攻撃コスト効果が得られることが示された。
論文 参考訳(メタデータ) (2025-08-31T12:52:49Z) - A Principled Loss Function for Direct Language Model Alignment [0.0]
本稿では,RLHF最適条件から直接導出した新しい損失関数を提案する。
提案した損失は,その差ではなく,基礎となる報酬によって規定される,ロジットの特定の有限値を対象としている。
この固有の安定性は、報酬のハッキングを防ぎ、より効果的なアライメントをもたらす。
論文 参考訳(メタデータ) (2025-08-10T01:56:58Z) - Transferable Adversarial Attacks on SAM and Its Downstream Models [87.23908485521439]
本稿では,セグメント・アプライス・モデル(SAM)から微調整した様々な下流モデルに対する敵攻撃の可能性について検討する。
未知のデータセットを微調整したモデルに対する敵攻撃の有効性を高めるために,ユニバーサルメタ初期化(UMI)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-10-26T15:04:04Z) - Alternating Objectives Generates Stronger PGD-Based Adversarial Attacks [78.2700757742992]
Projected Gradient Descent (PGD) は、そのような敵を生成するための最も効果的で概念的にシンプルなアルゴリズムの1つである。
この主張を合成データの例で実験的に検証し、提案手法を25の$ell_infty$-robustモデルと3つのデータセットで評価した。
私たちの最強の敵攻撃は、AutoAttackアンサンブルのすべてのホワイトボックスコンポーネントより優れています。
論文 参考訳(メタデータ) (2022-12-15T17:44:31Z) - Adversarial Distributional Training for Robust Deep Learning [53.300984501078126]
逆行訓練(AT)は、逆行例によるトレーニングデータを増やすことにより、モデルロバスト性を改善する最も効果的な手法の一つである。
既存のAT手法の多くは、敵の例を作らせるために特定の攻撃を採用しており、他の目に見えない攻撃に対する信頼性の低い堅牢性につながっている。
本稿では,ロバストモデル学習のための新しいフレームワークであるADTを紹介する。
論文 参考訳(メタデータ) (2020-02-14T12:36:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。