論文の概要: On the (In-)Security of the Shuffling Defense in the Transformer Secure Inference
- arxiv url: http://arxiv.org/abs/2605.04901v1
- Date: Wed, 06 May 2026 13:31:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.839249
- Title: On the (In-)Security of the Shuffling Defense in the Transformer Secure Inference
- Title(参考訳): 変圧器セキュア推論におけるシャッフル防御の安全性について
- Authors: Zhengyi Li, Yakai Wang, Kang Yang, Yu Yu, Jiaping Gui, Yu Feng, Ning Liu, Minyi Guo, Jingwen Leng,
- Abstract要約: シャッフルされた活性化を共通の置換に整列させ、モデル重みを抽出する攻撃を提案する。
Pythia-70mとGPT-2の実験では、提案された攻撃はシャッフルされたアクティベーションと平均2乗誤差を10-9$から10-6$に調整できることを示した。
クエリコストは約1ドルで、L1-norm差が10-4$から10-2$のモデルウェイトを回収することができる。
- 参考スコア(独自算出の注目度): 28.863461307044435
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: For Transformer models, cryptographically secure inference ensures that the client learns only the final output, while the server learns nothing about the client's input. However, securely computing nonlinear layers remains a major efficiency bottleneck due to the substantial communication rounds and data transmission required. To address this issue, prior works reveal intermediate activations to the client, allowing nonlinear operations to be computed in plaintext. Although this approach significantly improves efficiency, exposing activations enables adversaries to extract model weights. To mitigate this risk, existing works employ a shuffling defense that reveals only randomly permuted activations to the client. In this work, we show that the shuffling defense is not as robust as previously claimed. We propose an attack that aligns differently shuffled activations to a common permutation and subsequently exploits them to extract model weights. Experiments on Pythia-70m and GPT-2 demonstrate that the proposed attack can align shuffled activations with mean squared errors ranging from $10^{-9}$ to $10^{-6}$. With a query cost of approximately \$1, the adversary can recover model weights with L1-norm differences ranging from $10^{-4}$ to $10^{-2}$ compared to the oracle weights.
- Abstract(参考訳): Transformerモデルでは、暗号的にセキュアな推論により、クライアントが最終的な出力のみを学習し、サーバはクライアントの入力について何も学ばない。
しかし、重要な通信ラウンドやデータ転送が必要なため、非線形層を安全に計算することは、依然として大きな効率のボトルネックとなっている。
この問題に対処するため、事前の作業はクライアントに中間的なアクティベーションを明らかにし、非線形操作を平文で計算することを可能にする。
このアプローチは効率を大幅に改善するが、アクティベーションを露出させることで、敵はモデルの重みを抽出することができる。
このリスクを軽減するため、既存の作業ではシャッフルディフェンスを使用して、ランダムに置換されたアクティベーションのみをクライアントに公開している。
本研究では,シャッフル防御が従来主張したほど堅牢ではないことを示す。
本研究では、異なるシャッフルされた活性化を共通の置換に整列させ、その後モデル重みを抽出するためにそれらを利用する攻撃を提案する。
Pythia-70m と GPT-2 の実験により、提案された攻撃はシャッフルされたアクティベーションと平均2乗誤差が 10^{-9}$ から 10^{-6}$ に一致することを示した。
クエリコストが約1ドルであれば、敵はオラクルの重量と比較してL1-ノルム差が10^{-4}$から10^{-2}$のモデルウェイトを回収することができる。
関連論文リスト
- Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors [48.881343993730844]
安全性に整合した大規模言語モデル(LLM)は、現実世界のパイプラインにますますデプロイされている。
敵は通常の評価では動作しないバックドアのチェックポイントを配布することができる。
最近のポストホック重み付け法は、そのようなバックドアを注入するための効率的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-14T06:48:33Z) - ZORRO: Zero-Knowledge Robustness and Privacy for Split Learning (Full Version) [58.595691399741646]
Split Learning(SL)は、リソース制約のあるクライアントがディープニューラルネットワーク(DNN)を協調的にトレーニングすることを可能にする分散学習アプローチである。
このセットアップにより、SLはデータを共有せずにサーバの能力を活用することができ、機密データを扱うリソース制約のある環境で非常に効果的になる。
我々は、プライベートで検証可能な、堅牢なSL防御スキームであるZORROを提示する。
論文 参考訳(メタデータ) (2025-09-11T18:44:09Z) - BitHydra: Towards Bit-flip Inference Cost Attack against Large Language Models [22.695878922889715]
モデル重みを直接修正し,漏洩したLLMの全ユーザに対して持続的オーバーヘッドを誘発する,最初のビットフリップ推論コスト攻撃を導入する。
この攻撃パラダイムをBitHydraでインスタンス化し、(1)シーケンス終端トークン(EOS)を抑制する損失を最小限に抑え、(2)EOS埋め込みベクトルに焦点をあてた効率的かつ効果的なクリティカルビット探索を利用する。
論文 参考訳(メタデータ) (2025-05-22T13:36:00Z) - FLTG: Byzantine-Robust Federated Learning via Angle-Based Defense and Non-IID-Aware Weighting [2.4568855903094815]
ビザンティン攻撃は、悪意のあるクライアントの更新を操作することで、トレーニングの完全性を脅かす。
既存の手法は、高い悪意のあるクライアント比率と非I.D.データに対する感度の下で、限られたロバスト性に苦しむ。
角度に基づくディフェンスと動的参照選択を統合した新しいアグリゲーションアルゴリズムFLTGを提案する。
論文 参考訳(メタデータ) (2025-05-19T08:39:07Z) - FL-PLAS: Federated Learning with Partial Layer Aggregation for Backdoor Defense Against High-Ratio Malicious Clients [7.1383449614815415]
フェデレートラーニング(FL)は、新たなコラボレーティブ機械学習アプローチとして注目を集めている。
FLの基本アルゴリズムであるFederated Averaging (FedAvg)は、バックドア攻撃の影響を受けやすい。
バックドア攻撃からローカルモデルを効果的に保護できる新しい防御アルゴリズムFL-PLASを提案する。
論文 参考訳(メタデータ) (2025-05-17T14:16:47Z) - Towards Model Resistant to Transferable Adversarial Examples via Trigger Activation [95.3977252782181]
知覚不能な摂動によって特徴づけられる敵対的な例は、彼らの予測を誤解させることで、ディープニューラルネットワークに重大な脅威をもたらす。
本稿では,移動可能な敵例(TAE)に対して,より効率的かつ効果的に堅牢性を高めることを目的とした,新たなトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2025-04-20T09:07:10Z) - Pareto-Secure Machine Learning (PSML): Fingerprinting and Securing
Inference Serving Systems [0.0]
既存のブラックボックス攻撃では、推論要求を行うために単一のモデルを繰り返し選択できると仮定している。
そこで本研究では,攻撃者が希望するモデルを連続的にトリガーできるように,クエリ効率のよいフィンガープリントアルゴリズムを提案する。
我々は,特定の性能指標にノイズを加えることで,指紋認証を阻止するノイズベースの防御機構を用いて,提案攻撃を阻止する。
論文 参考訳(メタデータ) (2023-07-03T18:53:47Z) - G$^2$uardFL: Safeguarding Federated Learning Against Backdoor Attacks
through Attributed Client Graph Clustering [116.4277292854053]
Federated Learning (FL)は、データ共有なしで協調的なモデルトレーニングを提供する。
FLはバックドア攻撃に弱いため、有害なモデル重みがシステムの整合性を損なう。
本稿では、悪意のあるクライアントの識別を属性グラフクラスタリング問題として再解釈する保護フレームワークであるG$2$uardFLを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:15:04Z) - Hindering Adversarial Attacks with Implicit Neural Representations [25.422201099331637]
Lossy Implicit Network Activation Coding (LINAC) の防衛は、いくつかの共通の敵攻撃を妨害する。
鍵ベース防衛のためのパラメトリックバイパス近似(PBA)攻撃戦略を考案し,このカテゴリにおける既存手法の無効化に成功した。
論文 参考訳(メタデータ) (2022-10-22T13:10:24Z) - Weight Poisoning Attacks on Pre-trained Models [103.19413805873585]
本研究は, バックドアを微調整した後に, バックドアを露出する脆弱性を伴って, 事前訓練した重量を注入した場合に, 重量中毒を発生させることが可能であることを示す。
感情分類,毒性検出,スパム検出に関する実験により,この攻撃は広く適用可能であり,深刻な脅威となることが示された。
論文 参考訳(メタデータ) (2020-04-14T16:51:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。