論文の概要: TriShield: Zero-Utility-Loss Defense Against Privacy Backdoors in Federated Language Model Fine-Tuning via Orthogonal Gradient Projection and Optimizer State Entanglement
- arxiv url: http://arxiv.org/abs/2607.27940v2
- Date: Fri, 31 Jul 2026 04:21:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.331927
- Title: TriShield: Zero-Utility-Loss Defense Against Privacy Backdoors in Federated Language Model Fine-Tuning via Orthogonal Gradient Projection and Optimizer State Entanglement
- Title(参考訳): TriShield: 直交勾配投影と最適化状態の絡み合いによるフェデレーション言語モデルファインチューニングにおけるプライバシーバックドアに対するゼロユーティ-ロス防御
- Abstract要約: 最近の攻撃であるNeuroImprintは、悪意のあるパラメータサーバがPEFTアダプタをプライバシーバックドアに悪用できることを示した。
既存の防御 - ローカルディファレンシャルプライバシ(LDP)や勾配クリッピングを含む - は、この攻撃に失敗するか、受け入れがたいユーティリティ劣化を課す。
我々は,NuroImprintスタイルの再構築を完全に防止する3層ディフェンスである textbfTriShield を提案する。
- 参考スコア(独自算出の注目度): 1.7797590529777372
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Federated fine-tuning of large language models (LLMs) enables collaborative training without exposing raw data. However, a recent attack, NeuroImprint, demonstrates that a malicious parameter server can corrupt a PEFT adapter into a privacy backdoor: by assigning a dedicated memorization neuron to each training sample and ensuring each neuron updates at most once, the server can analytically reconstruct 59%--79% of client training data with high semantic fidelity. Existing defenses---including local differential privacy (LDP) and gradient clipping---either fail against this attack or impose unacceptable utility degradation. We present \textbf{TriShield}, a three-layer deterministic defense that completely prevents NeuroImprint-style reconstruction with zero model utility loss and no additional communication rounds. TriShield consists of: (1) a Parameter Artifact Detector that identifies memory-neuron signatures in distributed model parameters before local training begins; (2) a Stateful Virtual Iteration} mechanism that forces Adam/AdamW's momentum state to irreversibly entangle gradients across virtual steps, invalidating NeuroImprint's closed-form inversion; and (3) a Zero-Utility Orthogonal Projection operator that projects all local gradient updates onto the main-task semantic subspace computed via SVD, physically eliminating any gradient components that carry private memorization. We prove theoretically that after Layers 2 and 3, the mutual information between the uploaded gradient and any individual training sample is zero. Experiments on GPT-2 (117M) and Llama-Guard-3-1B verify that TriShield reduces NeuroImprint reconstruction rate to 0% across all tested attack variants, while maintaining or improving training accuracy, with less than 5% additional GPU computation overhead.
- Abstract(参考訳): 大型言語モデル(LLM)のファインチューニングにより、生データを公開せずに協調的なトレーニングが可能になる。
しかし、最近の攻撃であるNeuroImprintは、悪意のあるパラメータサーバがPEFTアダプタをプライバシバックドアに破損させることができることを実証している。各トレーニングサンプルに専用の記憶ニューロンを割り当て、最大1回のトレーニングでニューロンのアップデートを確実にすることで、サーバは、高いセマンティックフィリリティでクライアントトレーニングデータの59%~79%を解析的に再構築することができる。既存の防御--含みローカルディファレンシャルプライバシ(LDP)と勾配クリッピング--は、この攻撃に失敗するか、非許容のユーティリティ劣化を課す。
本稿では,NuroImprintスタイルの再構築を完全に防止し,モデルユーティリティ損失をゼロとし,追加の通信ラウンドを伴わない3層決定的防御法である‘textbf{TriShield} を提案する。
TriShieldは,(1)ローカルトレーニング開始前の分散モデルパラメータのメモリ-ニューロンシグネチャを識別するパラメータArtifact Detector,(2)Adam/AdamWの運動量状態を不可逆的にエンタングル勾配に強制するStateful Virtual Iteration}機構,(3)NuroImprintのクローズドフォームインバージョンを無効にするZero-Utility Orthogonal Projection演算子,(3)SVD経由で計算されたメインタスクセマンティックサブスペースへのローカル勾配更新を投影するZero-Utility Orthogonal Projection演算子,などで構成されている。
理論的には、レイヤー2と3の後、アップロードされた勾配と個々のトレーニングサンプルとの相互情報はゼロであることが証明される。
GPT-2 (117M) と Llama-Guard-3-1B の実験では、TriShield は試験されたすべての攻撃変種でニューロインプリントの再構築率を 0% 削減し、トレーニング精度を維持または改善し、GPU の計算オーバーヘッドを5%以下に抑えた。
関連論文リスト
- SCRUB-FL: Sanitizing and Cleansing Representations via Unlearning of Backdoors [9.273743530407977]
Federated Learning (FL)は、生データを共有せずに協調的なモデルトレーニングを可能にする。
悪意のあるクライアントがモデル予測を操作するために、ローカルのトレーニングデータに隠れたトリガーを埋め込むバックドア攻撃に対して脆弱である。
SCRUB-FL, SCRUB-FLを提案する。
論文 参考訳(メタデータ) (2026-06-21T22:34:34Z) - From Efficiency to Leakage -- Privacy Backdoor in Federated Language Model Fine-Tuning [37.29543339490437]
フェデレートラーニング(FL)は、複数のパーティが、生データを共有することなく、ドメイン固有のタスクに対して、協調的にきめ細やかな言語モデルを構築することを可能にする。
FLクライアントではフルモデルファインチューニングが禁止されることが多いため、パラメータ効率のファインチューニング(PEFT)が事実上のアプローチとなっている。
悪意のあるパラメータサーバは、PEFTアダプタを秘密裏に悪用し、クライアントのトレーニングサンプルを暗黙的に記憶する。
論文 参考訳(メタデータ) (2026-06-18T17:58:25Z) - Robust Dreamer: Deviation-Aware Latent Gaussian Memory for Action-Controlled AR Video Generation [89.70897512515477]
アクション制御された画像対ビデオ生成は、インタラクティブな世界シミュレーションにおいて有望なパラダイムであり、各制御信号が即時視覚応答を誘発する。
長時間の自己回帰的なロールアウトに対する視覚的忠実さと3D一貫性を維持することは依然として難しい。
既存の3D認識手法は、textitLatent--RGB Cyclingからの情報損失と、textiterror-free仮説によって引き起こされるトレーニング-推論ギャップという2つの障害により、破滅的なドリフトに悩まされることが多い。
textbfRobust Dreamerという,メモリ拡張フレームワークについて紹介する。
論文 参考訳(メタデータ) (2026-05-29T05:21:33Z) - SSA3D: Text-Conditioned Assisted Self-Supervised Framework for Automatic Dental Abutment Design [52.57094737117145]
本稿では、再構成ブランチと回帰ブランチを備えたデュアルブランチアーキテクチャを用いた自己教師付き自動支台築造設計フレームワーク(SS$A3$D)を提案する。
回帰分岐は、教師付き学習下での分配パラメータを予測し、個別の事前学習と微調整のプロセスを排除します。
また、他の手法と比較して最先端性能を実現し、自動当接設計の精度と効率を大幅に向上させる。
論文 参考訳(メタデータ) (2025-12-12T12:08:05Z) - Teleportation-Based Defenses for Privacy in Approximate Machine Unlearning [8.735490611482364]
近似マシンアンラーニングは、訓練されたモデルから特定のデータポイントの影響を効率的に除去することを目的としている。
事前学習モデルと後学習モデルにアクセスできる敵は、メンバーシップ推論やデータ再構成に彼らの違いを利用することができる。
これらの脆弱性は2つの要因から生じることが示される: 忘れられたサンプルの大きな勾配ノルムと、未学習パラメータが元のモデルに近づいたこと。
論文 参考訳(メタデータ) (2025-11-29T01:50:33Z) - ZORRO: Zero-Knowledge Robustness and Privacy for Split Learning (Full Version) [58.595691399741646]
Split Learning(SL)は、リソース制約のあるクライアントがディープニューラルネットワーク(DNN)を協調的にトレーニングすることを可能にする分散学習アプローチである。
このセットアップにより、SLはデータを共有せずにサーバの能力を活用することができ、機密データを扱うリソース制約のある環境で非常に効果的になる。
我々は、プライベートで検証可能な、堅牢なSL防御スキームであるZORROを提示する。
論文 参考訳(メタデータ) (2025-09-11T18:44:09Z) - Robust Anti-Backdoor Instruction Tuning in LVLMs [53.766434746801366]
大規模視覚言語モデル(LVLM)のための軽量で認証に依存しない防御フレームワークについて紹介する。
私たちのフレームワークは、命令チューニングの下で、アダプタモジュールとテキスト埋め込み層のみを微調整します。
Flickr30kとMSCOCOに対する7つの攻撃に対する実験は、我々の攻撃の成功率をほぼゼロに低下させることを示した。
論文 参考訳(メタデータ) (2025-06-04T01:23:35Z) - Shadow defense against gradient inversion attack in federated learning [6.708306069847227]
フェデレートラーニング(FL)は、プライバシ保護分散トレーニングのための変革的フレームワークとして登場した。
グラディエント・アタック(GIA)は、訓練画像のトレーニングと再構築に使用される勾配を近似し、患者のプライバシーを盗む。
これらの課題に対処するフレームワークを導入し、機密性の高い領域を特定するために、解釈可能性を備えたシャドウモデルを活用する。
論文 参考訳(メタデータ) (2025-05-30T17:58:57Z) - Neural Antidote: Class-Wise Prompt Tuning for Purifying Backdoors in CLIP [51.04452017089568]
CBPT(Class-wise Backdoor Prompt Tuning)は、テキストプロンプトでCLIPを間接的に浄化する効率的な防御機構である。
CBPTは、モデルユーティリティを保持しながら、バックドアの脅威を著しく軽減する。
論文 参考訳(メタデータ) (2025-02-26T16:25:15Z) - CENSOR: Defense Against Gradient Inversion via Orthogonal Subspace Bayesian Sampling [63.07948989346385]
フェデレーション学習は、グローバルサーバ上でニューラルネットワークを協調的にトレーニングする。
各ローカルクライアントは、現在のグローバルモデルウェイトを受信し、そのローカルプライベートデータに基づいてパラメータ更新(グラディエント)を返送する。
既存の勾配反転攻撃は、クライアントの勾配ベクトルからプライベートトレーニングインスタンスを復元するためにこの脆弱性を利用することができる。
本稿では,大規模ニューラルネットワークモデルに適した新しい防衛手法を提案する。
論文 参考訳(メタデータ) (2025-01-27T01:06:23Z) - Mitigating Adversarial Attacks in Federated Learning with Trusted
Execution Environments [1.8240624028534085]
画像ベースアプリケーションでは、敵対的な例は、局所モデルによって誤って分類される人間の目に対してわずかに摂動した画像で構成されている。
PeltaはTrusted Execution Environments(TEEs)を利用した新しい遮蔽機構で、攻撃者が敵のサンプルを作る能力を減らす。
Peltaは6つのホワイトボックスの対人攻撃を緩和する効果を示した。
論文 参考訳(メタデータ) (2023-09-13T14:19:29Z) - Few-shot Backdoor Defense Using Shapley Estimation [123.56934991060788]
我々は、深層ニューラルネットワークに対するバックドア攻撃を軽減するために、Shapley Pruningと呼ばれる新しいアプローチを開発した。
ShapPruningは、感染した数少ないニューロン(全ニューロンの1%以下)を特定し、モデルの構造と正確性を保護する。
様々な攻撃やタスクに対して,本手法の有効性とロバスト性を示す実験を行った。
論文 参考訳(メタデータ) (2021-12-30T02:27:03Z) - Red Alarm for Pre-trained Models: Universal Vulnerability to
Neuron-Level Backdoor Attacks [98.15243373574518]
事前訓練されたモデル(PTM)は、下流の様々なタスクで広く使われている。
本研究では,バックドアアタックによって微調整されたPTMを容易に制御できるPTMの普遍的脆弱性を実証する。
論文 参考訳(メタデータ) (2021-01-18T10:18:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。