論文の概要: FlipGuard: Defending Large Language Models Against Quantization-Conditioned Backdoor Attacks
- arxiv url: http://arxiv.org/abs/2606.28962v1
- Date: Sat, 27 Jun 2026 15:02:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.741232
- Title: FlipGuard: Defending Large Language Models Against Quantization-Conditioned Backdoor Attacks
- Title(参考訳): FlipGuard: 量子化を前提としたバックドア攻撃に対して,大規模な言語モデルを守る
- Abstract要約: 量子化に先立ってモデル重みを選択的に摂動するプロアクティブディフェンスフレームワークであるFlipGuardを紹介する。
ウェイトパターンと量子化境界の間の敵の正確なアライメントを壊すことで、FlipGuardはトレーニングデータへのアクセスやサンプルのトリガを必要とせずに、バックドアのアクティベーションを抑える。
- 参考スコア(独自算出の注目度): 11.27557330957057
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Model quantization is essential for the efficient deployment of Large Language Models (LLMs), but introduces a critical vulnerability: Quantization-Conditioned Backdoor (QCB) attacks. In these attacks, malicious behaviors remain dormant in full-precision models and activate only after specific quantization distortions, bypassing standard security audits. To mitigate this, we introduce FlipGuard, a proactive defense framework that selectively perturbs model weights prior to quantization. By breaking the adversary's precise alignment between weight patterns and quantization boundaries, FlipGuard suppresses backdoor activation without requiring access to training data or trigger samples. We further propose the Defense Effectiveness Ratio (DER), a unified metric to jointly evaluate security gains, utility preservation, and computational cost. Extensive experiments across seven LLMs (including StarCoder and LLaMA-family models) and three quantization schemes (INT8, FP4, NF4) demonstrate that FlipGuard effectively neutralizes QCBs across three scenarios, i.e., vulnerable code generation, content injection, and over-refusal, achieving high security with negligible performance degradation.
- Abstract(参考訳): モデル量子化は、LLM(Large Language Models)の効率的なデプロイには不可欠だが、重大な脆弱性が導入されている。
これらの攻撃では、悪意のある行動は完全な精度のモデルでは休眠状態のままであり、特定の量子化歪みの後にのみ活性化し、標準的なセキュリティ監査を回避している。
これを軽減するために、量子化に先立ってモデル重みを選択的に摂動するプロアクティブディフェンスフレームワークであるFlipGuardを紹介する。
ウェイトパターンと量子化境界の間の敵の正確なアライメントを壊すことで、FlipGuardはトレーニングデータへのアクセスやサンプルのトリガを必要とせずに、バックドアのアクティベーションを抑える。
さらに,防衛効果率(Defense Effectiveness Ratio,DER)を提案する。
7つのLLM(StarCoderとLLaMAファミリーモデルを含む)と3つの量子化スキーム(INT8、FP4、NF4)にわたる大規模な実験により、FlipGuardは3つのシナリオ(脆弱性のあるコード生成、コンテンツインジェクション、オーバーリフレクション)でQCBを効果的に中和し、無視できない性能劣化で高いセキュリティを達成することを示した。
関連論文リスト
- AGENTQ: Quantization-Conditioned Backdoor Attacks on LLM Agents [3.994114606137195]
AgentQは、レイヤバンドのLoRAインジェクションと、マルチコードブックの量子化等価クラスに対する部分PGD修復を組み合わせたアタックフレームワークである。
AgentQは、良質なユーティリティの損失を最小限に抑えて、100%ポスト量子化攻撃の成功率に達する。
論文 参考訳(メタデータ) (2026-09-12T17:17:59Z) - Breaking the Rounding Trap: Securing LLMs against Quantization-Conditioned Backdoors [11.27557330957057]
モデル量子化は、大規模言語モデルを実際にデプロイする際のストレージと推論コストを削減するための重要なテクニックである。
近年の研究では、量子化によって引き起こされる離散化と丸め誤差を敵に利用して、量子化条件付きバックドアアタックを構築することが示されている。
本手法では,有意なラウンドリング動作を微妙に制御するために,誤差誘導型ラウンドリングの反転制約,出力分布の整合性,および重み付き正規化を組み合わせたラウンドリング制御変数を導入する。
論文 参考訳(メタデータ) (2026-06-28T07:06:46Z) - Can Quantum Federated Learning Withstand Circuit-Level Backdoors? [1.4470144741753357]
量子フェデレーション学習(QFL)は、フェデレーション最適化のコア脆弱性を悪意のあるクライアントに継承する。
この研究は、4つのステルス攻撃を形式化する新しいCircUit-Level Backdoor Threat(CULT)モデルを提案する。
論文 参考訳(メタデータ) (2026-05-18T12:36:36Z) - Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors [48.881343993730844]
安全性に整合した大規模言語モデル(LLM)は、現実世界のパイプラインにますますデプロイされている。
敵は通常の評価では動作しないバックドアのチェックポイントを配布することができる。
最近のポストホック重み付け法は、そのようなバックドアを注入するための効率的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-14T06:48:33Z) - TraceGuard: Process-Guided Firewall against Reasoning Backdoors in Large Language Models [19.148124494194317]
我々は,小規模モデルを堅牢な推論ファイアウォールに変換するプロセス誘導型セキュリティフレームワークであるTraceGuardを提案する。
提案手法は,推理トレースを信頼できないペイロードとして扱い,詳細な防衛戦略を確立する。
グレーボックス設定における適応的敵に対する堅牢性を実証し、TraceGuardを実用的で低レイテンシなセキュリティプリミティブとして確立する。
論文 参考訳(メタデータ) (2026-03-02T22:19:13Z) - DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models [50.21378052667732]
我々は、ステップ内およびステップ間ダイナミクスという2つの異なる次元にわたるジェイルブレイク攻撃に対して、dLLM脆弱性の詳細な分析を行う。
デュアルステージアプローチによる脆弱性に対処する,トレーニング不要な防御フレームワークであるDiffuGuardを提案する。
論文 参考訳(メタデータ) (2025-09-29T05:17:10Z) - Secure Tug-of-War (SecTOW): Iterative Defense-Attack Training with Reinforcement Learning for Multimodal Model Security [63.41350337821108]
マルチモーダル大規模言語モデル(MLLM)のセキュリティを高めるために,Secure Tug-of-War(SecTOW)を提案する。
SecTOWは2つのモジュールで構成される:ディフェンダーと補助攻撃者。どちらも強化学習(GRPO)を使用して反復的に訓練される。
SecTOWは、一般的な性能を維持しながら、セキュリティを大幅に改善することを示す。
論文 参考訳(メタデータ) (2025-07-29T17:39:48Z) - Robust Anti-Backdoor Instruction Tuning in LVLMs [53.766434746801366]
大規模視覚言語モデル(LVLM)のための軽量で認証に依存しない防御フレームワークについて紹介する。
私たちのフレームワークは、命令チューニングの下で、アダプタモジュールとテキスト埋め込み層のみを微調整します。
Flickr30kとMSCOCOに対する7つの攻撃に対する実験は、我々の攻撃の成功率をほぼゼロに低下させることを示した。
論文 参考訳(メタデータ) (2025-06-04T01:23:35Z) - Mind the Gap: A Practical Attack on GGUF Quantization [6.506984021742173]
本稿では,学習後量子化手法のGGUFファミリーに対する最初の攻撃について紹介する。
我々は、量子化誤差に基づいて重みを拘束しながら、ターゲットの悪意あるLSMを訓練する攻撃を開発する。
我々の攻撃は、最も広く使われている訓練後の量子化法が、敵の干渉の影響を受けやすいことを強調している。
論文 参考訳(メタデータ) (2025-05-24T16:30:37Z) - Backdoor Cleaning without External Guidance in MLLM Fine-tuning [76.82121084745785]
Believe Your Eyes (BYE)は、アテンションエントロピーパターンを自己教師信号として活用して、バックドアサンプルを特定してフィルタリングするデータフィルタリングフレームワークである。
クリーンタスクのパフォーマンスを維持しながら、ほぼゼロの攻撃成功率を達成する。
論文 参考訳(メタデータ) (2025-05-22T17:11:58Z) - Neural Antidote: Class-Wise Prompt Tuning for Purifying Backdoors in CLIP [51.04452017089568]
CBPT(Class-wise Backdoor Prompt Tuning)は、テキストプロンプトでCLIPを間接的に浄化する効率的な防御機構である。
CBPTは、モデルユーティリティを保持しながら、バックドアの脅威を著しく軽減する。
論文 参考訳(メタデータ) (2025-02-26T16:25:15Z) - G$^2$uardFL: Safeguarding Federated Learning Against Backdoor Attacks
through Attributed Client Graph Clustering [116.4277292854053]
Federated Learning (FL)は、データ共有なしで協調的なモデルトレーニングを提供する。
FLはバックドア攻撃に弱いため、有害なモデル重みがシステムの整合性を損なう。
本稿では、悪意のあるクライアントの識別を属性グラフクラスタリング問題として再解釈する保護フレームワークであるG$2$uardFLを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:15:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。