論文の概要: Privacy-Preserving Split Learning for Federated LLM Fine-Tuning
- arxiv url: http://arxiv.org/abs/2609.09794v1
- Date: Wed, 09 Sep 2026 06:48:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.922773
- Title: Privacy-Preserving Split Learning for Federated LLM Fine-Tuning
- Title(参考訳): フェデレーションLDMファインチューニングのためのプライバシ保護スプリット学習
- Abstract要約: ダウンストリーム適応には、ドメイン固有データ上での微調整大型言語モデル(LLM)が不可欠である。
多くのデプロイメントにおいて、参加者は完全なモデルをローカルに保持することはできない。スプリットラーニング(SL)は、モデルを参加者とサーバの間で分割することで、少数の部分だけがローカルに実行されるようにすることで、この問題に対処する。
フェデレートラーニング(FL)は、生データの代わりにモデル更新のみを共有することで、参加者間の共同トレーニングを可能にする。
- 参考スコア(独自算出の注目度): 12.651705155064102
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Fine-tuning large language models (LLMs) on domain-specific data is essential for downstream adaptation. In many deployments, a participant cannot hold the complete model locally. This happens because the model owner keeps the full model proprietary, or because the participant lacks sufficient compute resources. Split Learning (SL) addresses this by partitioning the model between the participant and a server so that only a small portion runs locally. When the underlying data is additionally distributed across multiple institutions with privacy requirements, Federated Learning (FL) further enables collaborative training across participants by sharing only model updates instead of raw data. In this combined setting, each client transmits intermediate activations to the server, and for LLM fine-tuning, this exchange poses an inherent privacy paradox. The autoregressive nature of LLMs causes the transmitted activations to leak the input, and existing perturbation-based defenses are fundamentally ineffective in this setting. We address this leakage through a learned obfuscate-and-recover scheme that protects participants' private datasets while still allowing an independently deployable model to be trained on the server side. Experiments demonstrate that our approach achieves strong privacy protection with modest utility loss and system overhead, making split-based federated LLM fine-tuning practically viable.
- Abstract(参考訳): ダウンストリーム適応には、ドメイン固有データ上での微調整大型言語モデル(LLM)が不可欠である。
多くのデプロイメントでは、参加者は完全なモデルをローカルに保持することはできない。
これは、モデルオーナが完全なモデルをプロプライエタリに保持しているためか、あるいは、参加者が十分な計算リソースを欠いているためである。
Split Learning (SL) は参加者とサーバの間でモデルを分割することでこの問題に対処する。
基礎となるデータがプライバシ要件を持つ複数の機関に分散されている場合、フェデレートラーニング(FL)はさらに、生データの代わりにモデル更新のみを共有することで、参加者間の協調的なトレーニングを可能にする。
この組み合わせ設定では、各クライアントはサーバに中間的なアクティベーションを送信し、LLMの微調整のために、この交換は固有のプライバシーパラドックスを発生させる。
LLMの自己回帰性は、送信されたアクティベーションが入力を漏れさせ、既存の摂動に基づく防御は、この設定では基本的には効果がない。
参加者のプライベートデータセットを保護すると同時に、独立してデプロイ可能なモデルをサーバ側でトレーニング可能にする、学習された難読化とリカバリのスキームを通じて、このリークに対処する。
実験により,本手法はユーティリティ損失やシステムオーバヘッドを最小限に抑えた強力なプライバシ保護を実現し,スプリットベースフェデレーションLLMファインチューニングを現実的に実現可能であることが示された。
関連論文リスト
- The Art of Mixology: Mixup-based Obfuscation for Privacy-Preserving Split Learning in Large Language Models [25.91253902620787]
MIXGUARDは、大規模言語モデルのためのプライバシー保護のための分割学習フレームワークである。
トークンレベルの難読化、表現レベルの難読化、適応的な勾配化機構は、有用な学習信号を保持するために共同で動作する。
我々は,複数のLLMファミリ,モデルサイズ,アーキテクチャ,微調整戦略の4つの分類タスクと4つのテキスト生成タスクについて実験を行った。
論文 参考訳(メタデータ) (2026-06-15T14:42:06Z) - Can Federated Learning Safeguard Private Data in LLM Training? Vulnerabilities, Attacks, and Defense Evaluation [20.37072541084284]
フェデレートラーニング(FL)により、クライアントは、コラボレーティブトレーニングのためのモデルパラメータのみを共有しながら、ローカルデータを保持できる。
攻撃者は、簡単な生成方法を用いても、グローバルモデルからトレーニングデータを抽出できることを示す。
FLに合わせた攻撃戦略を導入し、トレーニング中にグローバルモデルのアップデートを追跡し、プライバシーの漏洩を強化する。
論文 参考訳(メタデータ) (2025-09-25T02:28:08Z) - PC-MoE: Memory-Efficient and Privacy-Preserving Collaborative Training for Mixture-of-Experts LLMs [56.04036826558497]
プライバシー保護型コラボレーション・オブ・エクササイズ(PC-MoE)を紹介する。
設計上、PC-MoEは分散計算の強みと強い機密性の保証を相乗的に組み合わせている。
完全に集中したモデルのパフォーマンスと収束率とほぼ一致(時には超える)し、70%近いピークのGPURAMの削減を享受し、再構築攻撃に対して完全に堅牢である。
論文 参考訳(メタデータ) (2025-06-03T15:00:18Z) - FedBiOT: LLM Local Fine-tuning in Federated Learning without Full Model [48.33280660752336]
大規模言語モデル(LLM)は、適切なデータで微調整した後、多くのドメイン固有のタスクで素晴らしいパフォーマンスを示す。
多くのドメイン固有のデータは、プライベートに複数の所有者に分散される。
我々は,フェデレート学習のための資源効率の高いLLM微調整手法であるFedBiOTを紹介する。
論文 参考訳(メタデータ) (2024-06-25T16:45:47Z) - Safely Learning with Private Data: A Federated Learning Framework for Large Language Model [3.1077263218029105]
フェデレートラーニング(FL)は、分散プライベートデータを用いたモデルのトレーニングに理想的なソリューションである。
FedAvgのような従来のフレームワークは、大きな言語モデル(LLM)には適さない
本稿では,サーバサイド攻撃とピアクライアント攻撃の両方によるデータ漏洩を防止するFL-GLMを提案する。
論文 参考訳(メタデータ) (2024-06-21T06:43:15Z) - Differentially Private Low-Rank Adaptation of Large Language Model Using Federated Learning [32.52811740662061]
本稿では,大規模言語モデル(LLM)に適した新しいフェデレーション学習アルゴリズムDP-LoRAを紹介する。
DP-LoRAは、重み付け更新のノイズを追加し、データプライバシを個別に維持しつつ、協調的なモデルトレーニングを容易にするガウス機構を使用することで、データのプライバシを保存する。
論文 参考訳(メタデータ) (2023-12-29T06:50:38Z) - Tunable Soft Prompts are Messengers in Federated Learning [55.924749085481544]
フェデレートラーニング(FL)は、複数の参加者が分散データソースを使用して機械学習モデルを協調的にトレーニングすることを可能にする。
FLにおけるモデルプライバシ保護の欠如は無視できない課題となっている。
そこで本研究では,ソフトプロンプトによって参加者間の情報交換を実現する新しいFLトレーニング手法を提案する。
論文 参考訳(メタデータ) (2023-11-12T11:01:10Z) - Towards More Suitable Personalization in Federated Learning via
Decentralized Partial Model Training [67.67045085186797]
既存のシステムのほとんどは、中央のFLサーバが失敗した場合、大きな通信負荷に直面しなければならない。
共有パラメータと個人パラメータを交互に更新することで、ディープモデルの「右」をパーソナライズする。
共有パラメータアグリゲーションプロセスをさらに促進するために、ローカルシャープネス最小化を統合するDFedを提案する。
論文 参考訳(メタデータ) (2023-05-24T13:52:18Z) - Client-specific Property Inference against Secure Aggregation in
Federated Learning [52.8564467292226]
フェデレートラーニングは、さまざまな参加者の間で共通のモデルを協調的に訓練するための、広く使われているパラダイムとなっている。
多くの攻撃は、メンバーシップ、資産、または参加者データの完全な再構築のような機密情報を推測することは依然として可能であることを示した。
単純な線形モデルでは、集約されたモデル更新からクライアント固有のプロパティを効果的にキャプチャできることが示される。
論文 参考訳(メタデータ) (2023-03-07T14:11:01Z) - Subspace based Federated Unlearning [75.90552823500633]
フェデレート・アンラーニング(FL)は、ユーザが忘れられる権利を満たすために、特定のターゲットクライアントのFLへの貢献を取り除くことを目的としている。
既存のフェデレートされた未学習アルゴリズムでは、パラメータの更新履歴をサーバに格納する必要がある。
そこで我々は,SFUと呼ばれる,単純なyet効率のサブスペースに基づくフェデレーションアンラーニング手法を提案する。
論文 参考訳(メタデータ) (2023-02-24T04:29:44Z) - Scalable Collaborative Learning via Representation Sharing [53.047460465980144]
フェデレートラーニング(FL)とスプリットラーニング(SL)は、データを(デバイス上で)プライベートにしながら協調学習を可能にする2つのフレームワークである。
FLでは、各データ保持者がモデルをローカルにトレーニングし、集約のために中央サーバにリリースする。
SLでは、クライアントは個々のカット層アクティベーション(スマッシュされたデータ)をサーバにリリースし、そのレスポンス(推論とバックの伝搬の両方)を待つ必要があります。
本研究では, クライアントがオンライン知識蒸留を通じて, 対照的な損失を生かして協調する, プライバシ保護機械学習の新しいアプローチを提案する。
論文 参考訳(メタデータ) (2022-11-20T10:49:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。