論文の概要: SafeLM: Unified Privacy-Aware Optimization for Trustworthy Federated Large Language Models
- arxiv url: http://arxiv.org/abs/2604.16606v1
- Date: Fri, 17 Apr 2026 18:00:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.100679
- Title: SafeLM: Unified Privacy-Aware Optimization for Trustworthy Federated Large Language Models
- Title(参考訳): SafeLM: 信頼できるフェデレートされた大規模言語モデルのための統一されたプライバシ・アウェア最適化
- Abstract要約: SafeLMは、プライバシー、セキュリティ、誤情報、および敵対的堅牢性に共同で対処するフレームワークである。
SafeLMは98.0%の有害なコンテンツ検出精度を実現し、通信を96.9%削減し、PSNRを31.7dBから15.1dBに下げる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly deployed in high-stakes domains, yet a unified treatment of their overlapping safety challenges remains lacking. We present SafeLM, a framework that jointly addresses four pillars of LLM safety: privacy, security, misinformation, and adversarial robustness. SafeLM combines federated training with gradient smartification and Paillier encryption for privacy, integrates defenses against training and inference-time attacks, employs contrastive grounding with calibrated decoding to reduce hallucinations, and introduces alignment-aware binarized aggregation to enhance robustness while maintaining bounded reconstruction quality. Across benchmarks on factuality, toxicity, and membership inference, SafeLM achieves 98.0% harmful content detection accuracy, reduces communication by 96.9%, and lowers gradient inversion PSNR from 31.7 dB to 15.1 dB. Ablations show that each component contributes independently, whereas their integration yields a strong privacy utility efficiency trade-off for deploying trustworthy LLMs.
- Abstract(参考訳): 大規模言語モデル(LLMs)は、ハイテイクなドメインにますますデプロイされているが、重複する安全性の課題に対する統一的な処理は、依然として不足している。
SafeLMは,LLMの安全性の4つの柱,すなわちプライバシ,セキュリティ,誤情報,敵の堅牢性に共同で対処するフレームワークである。
SafeLMは、グラディッシュなスマート化とプライバシのためのPaillier暗号化を組み合わせたフェデレーショントレーニング、トレーニングと推論時間攻撃に対する防御の統合、幻覚の軽減のために校正された復号化と対照的な基盤の活用、アライメントを意識したバイナライズアグリゲーションの導入により、バウンドされた再構築品質を維持しながらロバスト性の向上を実現している。
事実性、毒性、およびメンバーシップ推定のベンチマークで、SafeLMは98.0%の有害なコンテンツ検出精度を達成し、通信を96.9%削減し、勾配インバージョンPSNRを31.7dBから15.1dBに下げる。
アブレーションは、各コンポーネントが独立して貢献することを示しているが、それらの統合は、信頼できるLCMをデプロイするための強力なプライバシーユーティリティ効率のトレードオフをもたらす。
関連論文リスト
- aiXamine: Unified Black-Box Evaluation of Cross-Dimensional Trade-offs in LLM Safety, Security, and Privacy [6.323488051975665]
AiXamineは、セキュリティ、セキュリティ、プライバシを相互依存プロパティとして評価する統合ブラックボックスプラットフォームである。
AiXamineは、自動化されたリチームパイプラインを通じて、9つのサービスにわたる46のテストをオーケストレーションする。
我々は,これまでで最大規模の共同安全性,セキュリティ,プライバシ調査を行い,単一軸評価で見えない3次元の現象を明らかにした。
論文 参考訳(メタデータ) (2026-08-20T20:33:35Z) - Toward Efficient Membership Inference Attacks against Federated Large Language Models: A Projection Residual Approach [44.738736515079346]
Federated Large Language Models (FedLLMs) は、複数のパーティが生データを共有することなく、協調的にLLMを微調整することができる。
FedLLMsの特異な性質、すなわち、巨大なパラメータスケール、急速な収束、スパースな非直交勾配は、既存のMIAsを非効率にする。
提案するProjResは,FedLLMsに適したプロジェクション残差型受動MIAである。
論文 参考訳(メタデータ) (2026-04-23T01:44:04Z) - Robust Multimodal Safety via Conditional Decoding [52.92816441364308]
マルチモーダル大規模言語モデル(MLLM)は、有害なクエリが相互モーダル相互作用を悪用した場合、しばしば安全性の低下を経験する。
本稿では,MLLMの内部表現を利用して応答生成前の二項安全トークンを予測する,シンプルな条件付きデコード戦略であるCASAを提案する。
論文 参考訳(メタデータ) (2026-03-31T23:19:50Z) - Byzantine-Robust and Differentially Private Federated Optimization under Weaker Assumptions [89.52532304099522]
フェデレートラーニング(FL)は、クライアントが生データを集中せずに共有モデルを共同でトレーニングすることを可能にし、固有のプライバシーレベルを提供する。
グラデーションとモデル更新は機密情報を漏洩する可能性があるが、悪意のあるサーバはビザンティン操作のような敵攻撃をマウントする可能性がある。
これらの脆弱性は、統合されたフレームワーク内の差分プライバシー(DP)とビザンチンの堅牢性に対処する必要性を強調している。
Byz-Clip21-SGD2Mを提案する。
論文 参考訳(メタデータ) (2026-03-24T17:39:09Z) - Security Assessment and Mitigation Strategies for Large Language Models: A Comprehensive Defensive Framework [0.6015898117103067]
大規模言語モデルは、医療から金融への重要なインフラをますます力づけていますが、敵の操作に対する脆弱性は、システムの完全性とユーザの安全を脅かしています。
本研究は、標準化された脆弱性評価フレームワークを確立し、特定された脅威から保護するための多層防御システムを開発することで、このギャップに対処する。
論文 参考訳(メタデータ) (2026-03-17T20:32:06Z) - Coding-Enforced Resilient and Secure Aggregation for Hierarchical Federated Learning [30.254515308020512]
階層的連合学習(HFL)は、クライアントとサーバ間のリンク品質を高める効果的なパラダイムとして登場した。
本稿では,構造化アグリゲーションを強制するための符号化戦略を統合するH-SecCoGCという,堅牢な階層型セキュアアグリゲーション手法を提案する。
論文 参考訳(メタデータ) (2026-01-25T21:07:22Z) - FedMentor: Domain-Aware Differential Privacy for Heterogeneous Federated LLMs in Mental Health [0.0]
FedMentorは、機密ドメインにおける大規模言語モデルのプライバシ保護適応のための微調整フレームワークである。
Low-Rank Adaptation (LoRA)とDomain-Aware Differential Privacy (DP)を統合して、パフォーマンスを維持しながらドメイン単位のプライバシ予算を満たす。
3つのメンタルヘルスデータセットの実験では、FedMentorはプライバシのない標準フェデレートラーニング(FL)よりも安全性を向上させる。
論文 参考訳(メタデータ) (2025-09-16T07:08:36Z) - Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models [43.88239953205896]
Omni-SafetyBenchは、OLLMの安全性評価のための最初の総合的な並列ベンチマークである。
複雑なオムニモーダル入力によるOLLMの理解課題を考慮し,条件付き攻撃成功率(C-ASR)と拒絶率(C-RR)に基づく安全スコアを提案する。
Omni-SafetyBenchを用いて、既存の安全アライメントアルゴリズムを評価し、OLLMの安全性アライメントにおける重要な課題を特定した。
論文 参考訳(メタデータ) (2025-08-10T04:15:16Z) - Federated Learning-Enabled Hybrid Language Models for Communication-Efficient Token Transmission [87.68447072141402]
ハイブリッド言語モデル(HLM)は、エッジデバイス上でのSLM(Small Language Model)の低レイテンシ効率と、集中型サーバ上でのLLM(Large Language Model)の高精度を組み合わせたものである。
我々は、不確実性を考慮した推論とフェデレートラーニング(FL)を統合する通信効率の高いHLMフレームワークであるFedHLMを提案する。
論文 参考訳(メタデータ) (2025-06-30T02:56:11Z) - Reshaping Representation Space to Balance the Safety and Over-rejection in Large Audio Language Models [50.89022445197919]
Large Audio Language Models (LALM) は、Large Language Models (LLM) の機能を拡張した。
近年の研究では、LALMは安全調整が不十分なため、有害なクエリに対して脆弱であることが明らかになっている。
論文 参考訳(メタデータ) (2025-05-26T08:25:25Z) - PriFFT: Privacy-preserving Federated Fine-tuning of Large Language Models via Hybrid Secret Sharing [20.148411915688175]
微調整された大規模言語モデル(LLM)は、機密性のあるトレーニングデータを公開するリスクにより、プライバシ上の懸念を提起する。
近年の研究では、敵は今でもFLで個人情報を推測できることが示されている。
プライバシ保護フェデレーションファインチューニング機構であるPriFFTを提案する。
論文 参考訳(メタデータ) (2025-03-05T03:41:57Z) - CoCA: Regaining Safety-awareness of Multimodal Large Language Models with Constitutional Calibration [90.36429361299807]
マルチモーダルな大言語モデル (MLLM) は、視覚的な入力を含む会話への関与において顕著な成功を収めている。
視覚的モダリティの統合は、MLLMが悪意のある視覚的入力に影響を受けやすいという、ユニークな脆弱性を導入している。
本稿では,出力分布を校正することでMLLMの安全性を向上するCoCA技術を紹介する。
論文 参考訳(メタデータ) (2024-09-17T17:14:41Z) - Towards Comprehensive Post Safety Alignment of Large Language Models via Safety Patching [74.62818936088065]
textscSafePatchingは包括的なPSAのための新しいフレームワークである。
textscSafePatchingはベースラインメソッドよりも包括的なPSAを実現する。
textscSafePatchingは、連続的なPSAシナリオにおいて、その優位性を示している。
論文 参考訳(メタデータ) (2024-05-22T16:51:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。