論文の概要: From Prompts to Responses: Dual-Sided Data Leakage and Defense in Split Large Language Models
- arxiv url: http://arxiv.org/abs/2606.14210v1
- Date: Fri, 12 Jun 2026 07:46:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-15 16:00:42.806266
- Title: From Prompts to Responses: Dual-Sided Data Leakage and Defense in Split Large Language Models
- Title(参考訳): プロンプトから応答へ:大規模言語モデルにおける2次元データ漏洩と防御
- Authors: Zixuan Gu, Xiaojun Ye, Yang Liu,
- Abstract要約: 大規模言語モデル(LLM)のための有望なパラダイムとして、スプリットラーニングが登場した。
Dual-Sided Initialization (PIDI) を用いたパッチモデルインバージョンにより, Split-LLM の新たな脆弱性を明らかにした。
双方の脅威に対処するために,相互情報防衛(ADMI)を用いたアダプタベースのDualGuardを提案する。
- 参考スコア(独自算出の注目度): 4.941682005405552
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly deployed in privacy-sensitive domains, where users must balance the risk of data exposure through external APIs against the high computational cost of local deployment. Split learning has therefore emerged as a promising paradigm for LLM fine-tuning and inference under limited local resources. However, it introduces new privacy risks. Prior work primarily studies leakage of private input prompts, typically via inversion attacks on intermediate representations, while the potential for sensitive information leakage through generative response outputs remains largely unexplored. In this work, we unveil novel vulnerabilities of Split-LLM by presenting Patched Model Inversion with Dual-Sided Initialization (PIDI), a two-stage attack that simultaneously targets both private input prompts and output responses in Split-LLM settings. It combines dual-sided initialization with a patched inversion strategy to tackle long sequences, substantially outperforming prior inversion methods. To counter threats from both sides, we further propose the Adapter-based DualGuard with Mutual Information Defense (ADMI), which integrates an adapter-based local warmup strategy and mutual information regularization to provide a strong empirical privacy protection with minimal impact on task performance. Extensive experiments across diverse tasks and models demonstrate that ADMI effectively defends against PIDI and other state-of-the-art inversion attacks. Our code is publicly available at https://github.com/FLAIR-THU/VFLAIR-LLM.
- Abstract(参考訳): 大きな言語モデル(LLM)は、プライバシに敏感なドメインにますますデプロイされ、ユーザは外部APIによるデータ露出のリスクと、ローカルデプロイメントの計算コストとのバランスを取る必要がある。
そのため、限定的なローカルリソースの下でのLLMの微調整と推論において、スプリットラーニングは有望なパラダイムとして現れてきた。
しかし、新たなプライバシーリスクがもたらされる。
従来の研究は主にプライベートな入力プロンプトのリークについて研究しており、通常は中間表現に対する逆攻撃によって行われるが、生成的応答出力による機密情報リークの可能性はほとんど解明されていない。
本研究では,Split-LLM設定におけるプライベート入力プロンプトと出力応答の両方を同時にターゲットとする2段階攻撃であるPatched Model Inversion with Dual-Sided Initialization (PIDI)を提案することで,Split-LLMの新たな脆弱性を明らかにする。
両面の初期化とパッチ付き逆転戦略を組み合わせることで、長いシーケンスに対処し、以前の逆転法よりも大幅に優れている。
さらに,アダプタをベースとしたDualGuard with Mutual Information Defense(ADMI)を提案し,アダプタをベースとしたローカルウォームアップ戦略と相互情報正規化を統合し,タスクパフォーマンスへの影響を最小限に抑えた強力な経験的プライバシ保護を実現する。
多様なタスクやモデルにわたる大規模な実験は、ADMIがPIDIや他の最先端の逆攻撃に対して効果的に防御していることを示している。
私たちのコードはhttps://github.com/FLAIR-THU/VFLAIR-LLM.comで公開されています。
関連論文リスト
- Defense Against Prompt Inversion Attacks: An Information-Theoretic Approach for LLM Collaborative Inference [5.218013327284395]
協調的なエッジクラウド推論により、リソース制約のあるデバイスは、クラウドサーバに部分計算をオフロードすることで、大きな言語モデル(LLM)を活用することができる。
中間的アクティベーションの送信は、インバージョンアタックを誘導する機密性の高いユーザープロンプトを公開する。
協調LLM推論におけるインバージョンを迅速に行うための情報理論防衛フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-10T02:36:26Z) - The Sum Leaks More Than Its Parts: Compositional Privacy Risks and Mitigations in Multi-Agent Collaboration [72.33801123508145]
大規模言語モデル(LLM)はマルチエージェントシステムに不可欠なものである。
プライバシーリスクは、暗記、直接推論、シングルターン評価を超えて現れる。
特に、相互作用によって構成される一見無害な反応は、敵が機密情報の回復を累積的に行うことができる。
論文 参考訳(メタデータ) (2025-09-16T16:57:25Z) - Searching for Privacy Risks in LLM Agents via Simulation [61.229785851581504]
本稿では,プライバシクリティカルなエージェントインタラクションのシミュレーションを通じて,攻撃と防御戦略の改善を交互に行う検索ベースのフレームワークを提案する。
攻撃戦略は、直接の要求から、不正行為や同意偽造といった高度な戦術へとエスカレートする。
発見された攻撃と防御は、さまざまなシナリオやバックボーンモデルにまたがって伝達され、プライバシーに配慮したエージェントを構築するための強力な実用性を示している。
論文 参考訳(メタデータ) (2025-08-14T17:49:09Z) - Depth Gives a False Sense of Privacy: LLM Internal States Inversion [17.639108495452785]
大きな言語モデル(LLM)は、日々のルーチンにますます統合されていますが、プライバシと安全性の懸念を生じさせています。
近年の研究では、データの局所性を確保するために、初期層推論をアウトソースする協調推論が提案されている。
逆入力の意味的類似性とトークンマッチング率を大幅に向上させる4つの逆攻撃を提案する。
論文 参考訳(メタデータ) (2025-07-22T09:15:11Z) - MrM: Black-Box Membership Inference Attacks against Multimodal RAG Systems [31.53306157650065]
マルチモーダル検索拡張生成(RAG)システムは、クロスモーダル知識を統合することで、大きな視覚言語モデルを強化する。
これらの知識データベースには、プライバシー保護を必要とする機密情報が含まれている可能性がある。
MrMはマルチモーダルRAGシステムを対象とした最初のブラックボックスMIAフレームワークである。
論文 参考訳(メタデータ) (2025-06-09T03:48:50Z) - Defending against Indirect Prompt Injection by Instruction Detection [109.30156975159561]
InstructDetectorは、LLMの動作状態を利用して潜在的なIPI攻撃を特定する、新しい検出ベースのアプローチである。
InstructDetectorは、ドメイン内設定で99.60%、ドメイン外設定で96.90%の検出精度を達成し、攻撃成功率をBIPIAベンチマークで0.03%に下げる。
論文 参考訳(メタデータ) (2025-05-08T13:04:45Z) - Dual Defense: Enhancing Privacy and Mitigating Poisoning Attacks in Federated Learning [10.102889257118145]
フェデレート・ラーニング(FL)は、本質的にプライバシー侵害や毒殺攻撃の影響を受けやすい。
本稿では,DDF(Dual Defense Federated Learning)フレームワークを紹介する。
DDFedは、新たな参加者の役割を導入したり、既存のFLトポロジを破壊したりすることなく、プライバシー保護を強化し、毒殺攻撃を緩和する。
論文 参考訳(メタデータ) (2025-02-08T12:28:20Z) - Model Inversion in Split Learning for Personalized LLMs: New Insights from Information Bottleneck Theory [11.83473842859642]
この研究は、パーソナライズされたLLMのための分割学習フレームワークにおいて、モデル反転攻撃を識別する最初のものである。
本稿では,第1部が埋め込み空間に表現を投影する2段階攻撃システムを提案し,第2部は生成モデルを用いて埋め込み空間からテキストを復元する。
論文 参考訳(メタデータ) (2025-01-10T13:47:13Z) - Avoid Adversarial Adaption in Federated Learning by Multi-Metric
Investigations [55.2480439325792]
Federated Learning(FL)は、分散機械学習モデルのトレーニング、データのプライバシの保護、通信コストの低減、多様化したデータソースによるモデルパフォーマンスの向上を支援する。
FLは、中毒攻撃、標的外のパフォーマンス劣化とターゲットのバックドア攻撃の両方でモデルの整合性を損なうような脆弱性に直面している。
我々は、複数の目的に同時に適応できる、強い適応的敵の概念を新たに定義する。
MESASは、実際のデータシナリオで有効であり、平均オーバーヘッドは24.37秒である。
論文 参考訳(メタデータ) (2023-06-06T11:44:42Z) - Bilateral Dependency Optimization: Defending Against Model-inversion
Attacks [61.78426165008083]
本稿では,モデル反転攻撃に対する二元的依存性最適化(BiDO)戦略を提案する。
BiDOは、さまざまなデータセット、分類器、MI攻撃に対する最先端の防御性能を達成する。
論文 参考訳(メタデータ) (2022-06-11T10:07:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。