論文の概要: Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions
- arxiv url: http://arxiv.org/abs/2605.25073v1
- Date: Sun, 24 May 2026 13:34:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:18.746105
- Title: Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions
- Title(参考訳): 大規模言語モデルの細調整ライフサイクルにおけるセキュリティ:脅威,防衛,評価,今後の方向性
- Authors: Wenjuan Li, Yitao Liu, Runze Chen, Rajkumar Buyya,
- Abstract要約: 本稿では,大規模言語モデルの微調整セキュリティに関する体系的な調査を行う。
攻撃と防御を比較するライフサイクルベースのフレームワークを確立する。
我々は、重要なオープンな問題(構成ロバスト防衛、異相防衛構成、行動仮定を超えた埋め込み空間攻撃)を特定し、具体的な今後の研究方向性を提案する。
- 参考スコア(独自算出の注目度): 21.047807094226986
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Background: Fine-tuning is central to adapting pre-trained Large Language Models (LLMs) to downstream tasks, but its reliance on training data, parameter updates, and reusable components opens entry points for attackers. Threats have evolved from data poisoning and weight tampering to agent manipulation and interface exploitation, yet existing reviews lack a unified framework spanning the full fine-tuning lifecycle. Objective: This paper presents a systematic survey of LLM fine-tuning security and establishes a lifecycle-based framework for comparing attacks and defenses, complemented by unified empirical evaluation. Methods: We divide attack and defense mechanisms into three phases by intervention timing: pre-tuning, during-tuning, and post-tuning. Within each phase, strategies are reviewed and contrasted to expose their evolution and limitations. Representative methods are then evaluated under a unified model, hardware, and protocol setup, with cross-phase experiments pairing attacks and defenses from different phases. Results: Attack effectiveness is highly model-dependent and non-monotonic with scale: weight-editing attacks effective on earlier models lose impact on modern open-source LLMs; cross-lingual backdoor transfer, reported as near-perfect at larger scales, fails entirely on tested 1B-4B models; and purely benign samples can compromise safety alignment in instruction-tuned models. Single-phase defenses rarely generalize across phases, and defense effectiveness depends jointly on model architecture and alignment state. Conclusion: We identify key open problems (configuration-robust defense, cross-phase defense composition, and embedding-space attacks beyond behavioral assumptions) and propose concrete future research directions.
- Abstract(参考訳): 背景: ファインチューニングは、トレーニング済みの大規模言語モデル(LLM)を下流タスクに適応させる上で中心であるが、トレーニングデータ、パラメータ更新、再利用可能なコンポーネントに依存しているため、攻撃者のエントリポイントが開放される。
脅威は、データ中毒やウェイト改ざんからエージェント操作やインターフェースのエクスプロイトまで進化してきたが、既存のレビューでは、完全な微調整ライフサイクルにまたがる統一されたフレームワークが欠如している。
目的: 本論文では, LLMの微調整セキュリティに関する体系的な調査を行い, 統合された経験的評価によって補完された, 攻撃と防御を比較するライフサイクルベースのフレームワークを確立する。
方法: 介入タイミングにより, 攻撃・防御機構を3段階に分割する。
各フェーズにおいて、戦略はレビューされ、その進化と限界を明らかにするために対比される。
代表的手法は統合モデル、ハードウェア、プロトコルのセットアップで評価され、異なるフェーズからのペアリング攻撃と防御を交互に実験する。
結果: 攻撃の有効性は、モデルに依存しており、スケールでは非モノトニックである: 以前のモデルに有効な重み付け攻撃は、現代のオープンソース LLM への影響を失う; より大きなスケールでほぼ完全であると報告された言語間バックドア転送は、テストされた1B-4B モデルで完全に失敗する; 純粋に良質なサンプルは、命令調整されたモデルにおける安全アライメントを損なう。
単相防御は相をまたいで一般化することはめったになく、防御効果はモデルアーキテクチャとアライメント状態に大きく依存する。
結論: 鍵となるオープンな問題(構成・ロバスト防衛, 異相防衛構成, 埋め込み空間攻撃)を特定し, 具体的な今後の研究方向を提案する。
関連論文リスト
- MISLEADER: Defending against Model Extraction with Ensembles of Distilled Models [56.09354775405601]
モデル抽出攻撃は、クエリアクセスを通じてブラックボックスモデルの機能を複製することを目的としている。
既存のディフェンスでは、アタッカークエリにはオフ・オブ・ディストリビューション(OOD)サンプルがあることを前提としており、不審な入力を検出し破壊することができる。
OOD仮定に依存しない新しい防衛戦略であるMISLEADERを提案する。
論文 参考訳(メタデータ) (2025-06-03T01:37:09Z) - Evaluating Robustness of Large Audio Language Models to Audio Injection: An Empirical Study [5.843063647136238]
本研究は4つの攻撃シナリオにまたがる5つのLALMを系統的に評価する。
単一のモデルはすべての攻撃タイプで他のモデルより一貫して優れています。
命令追従能力とロバスト性の間の負の相関は、命令に厳密に固執するモデルはより感受性が高いことを示唆している。
論文 参考訳(メタデータ) (2025-05-26T07:08:38Z) - Two Heads Are Better than One: Model-Weight and Latent-Space Analysis for Federated Learning on Non-iid Data against Poisoning Attacks [12.325216357472137]
Federated Learning(FL)は、リモートクライアントが生データを共有せずにグローバルモデルを共同でトレーニングできる一般的なパラダイムである。
FLは、その分散した性質のため、モデル中毒攻撃に対して脆弱であることが示されている。
我々は,GeminiGuardを軽量で汎用的で教師なしで,そのような防御を配備する実践的な要件に適合するように提案する。
論文 参考訳(メタデータ) (2025-03-30T02:56:05Z) - Learn from the Past: A Proxy Guided Adversarial Defense Framework with
Self Distillation Regularization [53.04697800214848]
敵対的訓練(AT)は、ディープラーニングモデルの堅牢性を固める上で重要な要素である。
AT方式は、目標モデルの防御のために直接反復的な更新を頼りにしており、不安定な訓練や破滅的なオーバーフィッティングといった障害に頻繁に遭遇する。
汎用プロキシガイド型防衛フレームワークLAST(bf Pbf astから学ぶ)を提案する。
論文 参考訳(メタデータ) (2023-10-19T13:13:41Z) - Avoid Adversarial Adaption in Federated Learning by Multi-Metric
Investigations [55.2480439325792]
Federated Learning(FL)は、分散機械学習モデルのトレーニング、データのプライバシの保護、通信コストの低減、多様化したデータソースによるモデルパフォーマンスの向上を支援する。
FLは、中毒攻撃、標的外のパフォーマンス劣化とターゲットのバックドア攻撃の両方でモデルの整合性を損なうような脆弱性に直面している。
我々は、複数の目的に同時に適応できる、強い適応的敵の概念を新たに定義する。
MESASは、実際のデータシナリオで有効であり、平均オーバーヘッドは24.37秒である。
論文 参考訳(メタデータ) (2023-06-06T11:44:42Z) - A Unified Evaluation of Textual Backdoor Learning: Frameworks and
Benchmarks [72.7373468905418]
我々は,テキストバックドア学習の実装と評価を促進するオープンソースツールキットOpenBackdoorを開発した。
また,単純なクラスタリングに基づく防御ベースラインであるCUBEを提案する。
論文 参考訳(メタデータ) (2022-06-17T02:29:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。