論文の概要: Breaking the Rounding Trap: Securing LLMs against Quantization-Conditioned Backdoors
- arxiv url: http://arxiv.org/abs/2606.29239v1
- Date: Sun, 28 Jun 2026 07:06:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.842547
- Title: Breaking the Rounding Trap: Securing LLMs against Quantization-Conditioned Backdoors
- Title(参考訳): ラウンドトリップを打破する - 量子化を前提としたバックドアに対するLLMの確保
- Abstract要約: モデル量子化は、大規模言語モデルを実際にデプロイする際のストレージと推論コストを削減するための重要なテクニックである。
近年の研究では、量子化によって引き起こされる離散化と丸め誤差を敵に利用して、量子化条件付きバックドアアタックを構築することが示されている。
本手法では,有意なラウンドリング動作を微妙に制御するために,誤差誘導型ラウンドリングの反転制約,出力分布の整合性,および重み付き正規化を組み合わせたラウンドリング制御変数を導入する。
- 参考スコア(独自算出の注目度): 11.27557330957057
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Model quantization is a key technique for reducing storage and inference costs when deploying large language models in practice. However, recent studies show that the discretization and rounding errors introduced by quantization can be exploited by adversaries to construct quantization-conditioned backdoor (QCB) attacks. Under such attacks, malicious behaviors remain dormant in the full-precision stage and are activated only after quantized deployment, thereby bypassing conventional security auditing and detection mechanisms. To address this threat, we propose a proactive pre-quantization defense method, QuantGuard. Our method introduces differentiable rounding control variables and combines error-guided rounding reversal constraints, output-distribution consistency, and weight-distance regularization to finely regulate critical rounding behaviors. Crucially, QuantGuard utilizes only a small calibration dataset and does not modify existing quantization algorithms. This design breaks the precise alignment between attacker-crafted weight patterns and quantization boundaries, effectively suppressing the post-quantization backdoor activation pathway while preserving the model's original functionality and performance. We conduct systematic experiments on six mainstream LLMs (including the LLaMA-3 and Qwen2.5-Coder) using three quantization precisions (INT8, FP4, and NF4) across three representative scenarios: vulnerable code generation, content injection, and over-refusal. The results show that QuantGuard consistently mitigates QCB attacks, reducing the attack success rate to a level comparable to the clean model while largely preserving performance on general capability benchmarks. With low computational overhead, our method offers an effective, practical solution for secure quantized LLM deployment.
- Abstract(参考訳): モデル量子化は、大規模言語モデルを実際にデプロイする際のストレージと推論コストを削減するための重要なテクニックである。
しかし,近年の研究では,量子化による離散化と丸め誤差を敵に利用して量子化条件付バックドア(QCB)攻撃を構築できることが示されている。
このような攻撃下では、悪意のある行動は完全な精度の段階で休眠状態のままであり、定量化デプロイ後にのみ活性化され、従来のセキュリティ監査と検出メカニズムをバイパスする。
本報告では,この脅威に対処するために,能動的前量子化防御手法であるQuantGuardを提案する。
本手法では,異なるラウンドリング制御変数を導入し,誤差誘導ラウンドリング制約,出力分布の整合性,および重み距離正規化を組み合わせ,重要なラウンドリング動作を微調整する。
重要なことは、QuantGuardは小さなキャリブレーションデータセットのみを使用し、既存の量子化アルゴリズムを変更しない。
この設計は、攻撃者が生成した重みパターンと量子化境界との正確な整合性を破り、モデルの本来の機能と性能を保ちながら、量子化後のバックドア活性化経路を効果的に抑制する。
3つの量子化精度(INT8、FP4、NF4)を用いて、LLaMA-3、Qwen2.5-Coderを含む6つの主要なLCMに対して、脆弱なコード生成、コンテンツインジェクション、過剰拒否の3つのシナリオで系統的な実験を行う。
結果は、QuantGuardが継続的にQCB攻撃を軽減し、攻撃成功率をクリーンモデルに匹敵するレベルまで低減し、一般的な性能ベンチマークのパフォーマンスを保っていることを示している。
計算オーバーヘッドが低いため,本手法はセキュアな量子化LDM配置のための効果的で実用的なソリューションを提供する。
関連論文リスト
- AGENTQ: Quantization-Conditioned Backdoor Attacks on LLM Agents [3.994114606137195]
AgentQは、レイヤバンドのLoRAインジェクションと、マルチコードブックの量子化等価クラスに対する部分PGD修復を組み合わせたアタックフレームワークである。
AgentQは、良質なユーティリティの損失を最小限に抑えて、100%ポスト量子化攻撃の成功率に達する。
論文 参考訳(メタデータ) (2026-09-12T17:17:59Z) - Quantization-Triggered Backdoors in Language Models: Cross-Quantizer Transferability and the Validation--Deployment Gap [0.0]
学習後の量子化はしばしば、大規模言語モデルのエッジ展開に対する意味的に中立な最適化として扱われる。
バックドア翻訳モデルは、修復されたFP16におけるゼロの友情の腐敗から、量子化後の最大85.02%の逆転へと移行していることを示す。
我々は、量子化行動等価クラス(QBEC)を通してこのギャップを形式化し、QBECのメンバーシップが振る舞い等価性を含まないことを証明した。
論文 参考訳(メタデータ) (2026-08-27T08:34:10Z) - FlipGuard: Defending Large Language Models Against Quantization-Conditioned Backdoor Attacks [11.27557330957057]
量子化に先立ってモデル重みを選択的に摂動するプロアクティブディフェンスフレームワークであるFlipGuardを紹介する。
ウェイトパターンと量子化境界の間の敵の正確なアライメントを壊すことで、FlipGuardはトレーニングデータへのアクセスやサンプルのトリガを必要とせずに、バックドアのアクティベーションを抑える。
論文 参考訳(メタデータ) (2026-06-27T15:02:42Z) - Widening the Gap: Exploiting LLM Quantization via Outlier Injection [16.503478819196115]
悪意のある振る舞いを継続的に引き起こす最初の量子化条件攻撃を導入する。
我々の攻撃は、多くの現代的な量子化法で共有される単純な性質を利用する。
我々の攻撃は、前回の攻撃が失敗する広範囲の量子化手法に対して高い成功率を達成することを示す。
論文 参考訳(メタデータ) (2026-05-14T17:50:39Z) - Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors [48.881343993730844]
安全性に整合した大規模言語モデル(LLM)は、現実世界のパイプラインにますますデプロイされている。
敵は通常の評価では動作しないバックドアのチェックポイントを配布することができる。
最近のポストホック重み付け法は、そのようなバックドアを注入するための効率的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-14T06:48:33Z) - Mind the Gap: A Practical Attack on GGUF Quantization [6.506984021742173]
本稿では,学習後量子化手法のGGUFファミリーに対する最初の攻撃について紹介する。
我々は、量子化誤差に基づいて重みを拘束しながら、ターゲットの悪意あるLSMを訓練する攻撃を開発する。
我々の攻撃は、最も広く使われている訓練後の量子化法が、敵の干渉の影響を受けやすいことを強調している。
論文 参考訳(メタデータ) (2025-05-24T16:30:37Z) - Backdoor Cleaning without External Guidance in MLLM Fine-tuning [76.82121084745785]
Believe Your Eyes (BYE)は、アテンションエントロピーパターンを自己教師信号として活用して、バックドアサンプルを特定してフィルタリングするデータフィルタリングフレームワークである。
クリーンタスクのパフォーマンスを維持しながら、ほぼゼロの攻撃成功率を達成する。
論文 参考訳(メタデータ) (2025-05-22T17:11:58Z) - RoSTE: An Efficient Quantization-Aware Supervised Fine-Tuning Approach for Large Language Models [53.571195477043496]
本稿では,RoSTE (Rotated Straight-Through-Estimator) というアルゴリズムを提案する。
RoSTEは、量子化を意識した微調整(QA-SFT)と適応的な回転戦略を組み合わせることで、アクティベーションアウトリーを減少させる。
その結果, 予測誤差は収束重みの量子化誤差と直接比例し, 最適化された回転構成により効果的に管理できることが判明した。
論文 参考訳(メタデータ) (2025-02-13T06:44:33Z) - GAQAT: gradient-adaptive quantization-aware training for domain generalization [54.31450550793485]
そこで本研究では,DGのためのGAQAT(Gradient-Adaptive Quantization-Aware Training)フレームワークを提案する。
我々のアプローチは、低精度量子化におけるスケール・グラディエント・コンフリクト問題を特定することから始まる。
GAQATフレームワークの有効性を実験により検証した。
論文 参考訳(メタデータ) (2024-12-07T06:07:21Z) - CBQ: Cross-Block Quantization for Large Language Models [66.82132832702895]
ポストトレーニング量子化(PTQ)は、超低コストで大規模言語モデル(LLM)を圧縮する上で重要な役割を果たしている。
LLMのためのクロスブロック再構成に基づくPTQ手法CBQを提案する。
CBQはリコンストラクションスキームを使用してクロスブロック依存関係を採用し、エラーの蓄積を最小限に抑えるために複数のブロックにまたがる長距離依存関係を確立する。
論文 参考訳(メタデータ) (2023-12-13T07:56:27Z) - PreQuant: A Task-agnostic Quantization Approach for Pre-trained Language
Models [52.09865918265002]
ファインチューニングのフレームワークPreQuantに先立って,新しい量子化を提案する。
PreQuantは様々な量子化戦略と互換性があり、インダクションされた量子化誤差を修正するために、アウタリア対応の微調整が組み込まれている。
BERT,RoBERTa,T5を用いたGLUEベンチマークにおけるPreQuantの有効性を示す。
論文 参考訳(メタデータ) (2023-05-30T08:41:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。