論文の概要: On the Vulnerability of Parameter-Level Defenses to Model Merging
- arxiv url: http://arxiv.org/abs/2606.30360v1
- Date: Mon, 29 Jun 2026 14:26:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.279462
- Title: On the Vulnerability of Parameter-Level Defenses to Model Merging
- Title(参考訳): モデルマージにおけるパラメータレベルディフェンスの脆弱性について
- Authors: Kuangpu Guo, Qingyan Zheng, Jian Liang, Yongcan Yu, Zilei Wang, Ran He, Tieniu Tan,
- Abstract要約: 我々は,既存の安全対策を回避するため,アンカー誘導攻撃(AGA)を提案する。
AGAは、現実的な防衛非依存シナリオの下で、個々の防衛と複合防衛の両方を一貫してバイパスする。
我々は、AGAが活用するアンカーの優位性を軽減するために、アンカー推進ファインチューニング(ARF)を提供する。
- 参考スコア(独自算出の注目度): 75.62810606927121
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The training-free integration of expert models via model merging has exposed significant security risks, enabling free-riders to combine specialized models without authorization. Recent works propose parameter-level defenses that employ linear parameter transformations to neutralize this threat. In this paper, we systematically analyze such defenses and reveal that their protected task vectors are inherently small in magnitude. Consequently, the protected weights remain overwhelmingly dominated by the pretrained model. Based on this observation, we designate the pretrained model as a static reference anchor and propose the Anchor-Guided Attack (AGA) to circumvent existing safeguards. Specifically, AGA aligns the protected model with this anchor to recover the transformation matrix analytically. Extensive evaluations validate that AGA consistently bypasses both individual and composite defenses under realistic defense-agnostic scenarios. Furthermore, we provide Anchor-Repulsive Fine-tuning (ARF), a defense method to mitigate the anchor dominance leveraged by AGA. Empirical results confirm that ARF effectively defeats the proposed attack. Our code is available at https://github.com/krumpguo/secure-merge-attack.
- Abstract(参考訳): モデルマージによるエキスパートモデルのトレーニング不要の統合により、セキュリティ上の大きなリスクが明らかになり、フリーライダーは許可なく特別なモデルを組み合わせられるようになった。
近年の研究では、この脅威を中和するために線形パラメータ変換を用いるパラメータレベルディフェンスが提案されている。
本稿では,このような防御を体系的に解析し,その保護されたタスクベクトルが本質的に小さいことを明らかにする。
その結果、保護された重量は、事前訓練されたモデルによって圧倒的に支配されている。
本研究は, 既訓練モデルを静的基準アンカーとして指定し, 既存の安全対策を回避するためのアンカー誘導攻撃(AGA)を提案する。
具体的には、AGAは保護されたモデルをこのアンカーと整列させ、変換行列を解析的に復元する。
広範囲な評価は、AGAが現実的な防衛非依存シナリオの下で、個々の防衛と複合防衛の両方を一貫してバイパスしていることを検証する。
さらに,AGAが活用するアンカー支配を緩和する防御手法であるアンカー・リパルスファインチューニング(ARF)を提案する。
実験の結果、ARFが提案された攻撃を効果的に打ち負かすことが確認された。
私たちのコードはhttps://github.com/krumpguo/secure-merge- attackで利用可能です。
関連論文リスト
- What Does It Mean to Break a Distillation Defense? [33.607700445538136]
ブラックボックスのLSMは蒸留攻撃に弱いので、攻撃者がモデルに問い合わせて、その出力で生徒を訓練する。
本稿では,クエリ予算,データ予算,インターフェースプロファイルという,攻撃者の3つの側面を記述した脅威モデルフレームワークを提案する。
蒸留防衛の今後の取り組みは、それらの周辺に構築されたガバナンスや政策の枠組みとともに、明示的に特定し、ストレステストのアタッカーの能力をテストすべきである、と我々は主張する。
論文 参考訳(メタデータ) (2026-06-23T18:13:02Z) - Dashed Line Defense: Plug-And-Play Defense Against Adaptive Score-Based Query Attacks [3.206339985805037]
ダッシュラインディフェンス(Dashed Line Defense, DLD)は、適応的なクエリ戦略に対処するために設計された、プラグアンドプレイのポストプロセッシング手法である。
DLDは、観測された損失がどのように真の敵の強さを反映しているかの曖昧さを導入することで、攻撃者がクエリを確実に分析し、適応することを防ぐ。
我々は,DLDの防御能力を理論的に保証し,ImageNetの実験を通じてその有効性を検証する。
論文 参考訳(メタデータ) (2026-02-09T14:02:32Z) - MARS: A Malignity-Aware Backdoor Defense in Federated Learning [51.77354308287098]
最近提案されたSOTA攻撃(3DFed)は、ディフェンダーがバックドアモデルを受け入れたかどうかを判断するためにインジケータ機構を使用する。
本稿では,各ニューロンの有害な範囲を示すためにバックドアエネルギーを利用するMARS(Maignity-Aware backdooR defenSe)を提案する。
実験により、MARSはSOTAのバックドア攻撃に対して防御でき、既存の防御を著しく上回っていることが示された。
論文 参考訳(メタデータ) (2025-09-21T14:50:02Z) - Benchmarking Misuse Mitigation Against Covert Adversaries [80.74502950627736]
既存の言語モデルの安全性評価は、オーバースト攻撃と低レベルのタスクに重点を置いている。
我々は、隠蔽攻撃と対応する防御の評価を自動化するデータ生成パイプラインである、ステートフルディフェンスのためのベンチマーク(BSD)を開発した。
評価の結果,分解攻撃は有効な誤用防止剤であり,その対策としてステートフルディフェンスを強調した。
論文 参考訳(メタデータ) (2025-06-06T17:33:33Z) - MISLEADER: Defending against Model Extraction with Ensembles of Distilled Models [56.09354775405601]
モデル抽出攻撃は、クエリアクセスを通じてブラックボックスモデルの機能を複製することを目的としている。
既存のディフェンスでは、アタッカークエリにはオフ・オブ・ディストリビューション(OOD)サンプルがあることを前提としており、不審な入力を検出し破壊することができる。
OOD仮定に依存しない新しい防衛戦略であるMISLEADERを提案する。
論文 参考訳(メタデータ) (2025-06-03T01:37:09Z) - Learn from the Past: A Proxy Guided Adversarial Defense Framework with
Self Distillation Regularization [53.04697800214848]
敵対的訓練(AT)は、ディープラーニングモデルの堅牢性を固める上で重要な要素である。
AT方式は、目標モデルの防御のために直接反復的な更新を頼りにしており、不安定な訓練や破滅的なオーバーフィッティングといった障害に頻繁に遭遇する。
汎用プロキシガイド型防衛フレームワークLAST(bf Pbf astから学ぶ)を提案する。
論文 参考訳(メタデータ) (2023-10-19T13:13:41Z) - Adaptive Feature Alignment for Adversarial Training [56.17654691470554]
CNNは通常、敵攻撃に対して脆弱であり、セキュリティに敏感なアプリケーションに脅威をもたらす。
任意の攻撃強度の特徴を生成するための適応的特徴アライメント(AFA)を提案する。
本手法は任意の攻撃強度の特徴を自動的に整列するように訓練されている。
論文 参考訳(メタデータ) (2021-05-31T17:01:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。