論文の概要: Balancing Privacy, Utility, and Safety in LLM Alignment through Preference Optimization
- arxiv url: http://arxiv.org/abs/2608.30141v1
- Date: Mon, 31 Aug 2026 01:46:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.195026
- Title: Balancing Privacy, Utility, and Safety in LLM Alignment through Preference Optimization
- Title(参考訳): 優先最適化によるLLMアライメントにおけるプライバシ、ユーティリティ、安全性のバランス
- Abstract要約: 本稿では,プライバシー設定データの量を変えつつ,利便性と無害性嗜好データを固定したデータ合成プロトコルを提案する。
全体として、プライバシとプライバシの混合は、両方のモデル設定の平均的な接尾辞ログのようなプロキシ値に関連付けられている。
- 参考スコア(独自算出の注目度): 5.043178298481473
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Preference optimization is widely used to align large language models with human preferences, but preference-data composition may also influence privacy-relevant memorization. We examine whether adding synthetic privacy-preference pairs to Direct Preference Optimization (DPO) is associated with lower canary-based memorization signals without modifying the objective or introducing a formal privacy mechanism. We propose Privacy-Pressure Preference Mixing (P3M), a data-composition protocol that varies the amount of privacy-preference data while keeping helpfulness and harmlessness preference data fixed. We evaluate a non-privacy Baseline and privacy-mixing ratios of 0.5, 1.0, and 2.0 using Gemma 3 270M-IT across five random seeds and validate the same four conditions using 4-bit-quantized Gemma 2 2B-IT across three seeds. Overall, under the tested conditions, privacy-preference mixing is associated with lower mean canary suffix log-likelihood proxy values across both model settings and lower aggregate membership-inference attack performance relative to the Baseline in the mixed-source 2B evaluation. Specifically, across the privacy-aware 2B configurations, the mean area under the receiver operating characteristic curve (AUROC) ranges from 0.596 to 0.629, and the mean area under the precision-recall curve (AUPRC) ranges from 0.541 to 0.575, compared with 0.804 and 0.790, respectively, for the Baseline. However, the reduction in membership distinguishability does not hold uniformly across data sources. Moreover, the relationship between the privacy ratio and harmlessness preference accuracy varies by model setting, whereas helpfulness preference accuracy remains broadly stable. These findings suggest that P3M should be viewed as a lightweight empirical protocol for examining privacy-utility-safety trade-offs rather than as a formal privacy guarantee or a defense against extraction attacks.
- Abstract(参考訳): 嗜好最適化は大規模言語モデルと人間の嗜好の整合に広く用いられているが、嗜好データの構成はプライバシ関連記憶に影響を及ぼす可能性がある。
直接選好最適化(DPO)に合成プライバシ-参照ペアを追加すると、目的を変更したり、正式なプライバシ機構を導入することなく、より低いカナリアベースの記憶信号に関連付けられるかどうかを検討する。
本稿では,プライバシ・プレッシャ・プレッシャ・ミキシング(P3M)を提案する。プライバシ・プレッシャ・プレッシャ・ミキシング(P3M)は,プライバシ・プライバシ・プレッシャ・データの量を変えつつ,無害なプライバシ・プライバシ・プレッシャ・ミキシング(P3M)を固定したデータ構成プロトコルである。
ランダムシード5種に対してGemma 3 270M-ITを用いて0.5, 1.0, 2.0の非プライバシベースラインとプライバシ混合比を評価し,4ビット量子化Gemma 2 2B-ITを3種で比較した。
概ね,テスト条件下でのプライバシ-参照混合は,モデル設定の双方にわたる平均接尾辞ログのようなプロキシ値の平均値と,混合ソース2B評価のベースラインに対する下位集合メンバシップ-推論攻撃性能に関連付けられている。
具体的には、プライバシを意識した2B構成において、受信機動作特性曲線(AUROC)の平均面積は0.596から0.629の範囲であり、精度・リコール曲線(AUPRC)の平均面積は0.541から0.575の範囲であり、ベースラインでは0.804と0.790である。
しかし、メンバーシップの識別可能性の低下は、データソース間で均一に維持されない。
さらに、プライバシ比と無害優先精度の関係はモデル設定によって異なるが、有用性優先精度は広範に安定している。
これらの結果は、P3Mは、正式なプライバシー保証や抽出攻撃に対する防御ではなく、プライバシ・ユーティリティ・セーフティのトレードオフを調べるための軽量な実証的プロトコルとして見なされるべきであることを示している。
関連論文リスト
- Private Direct Preference Optimization for LLM Alignment [77.56374641532715]
直接選好最適化(DPO)は、人間の選好データを用いて大規模言語モデル(LLM)を調整するための標準手法である。
本稿では、DPOのためのラベルDPスタイルのプライバシー概念である嗜好プライバシを定式化する。
次に、大規模LLMトレーニングと互換性を維持しながら、好みのプライバシを強制するDPOの派生であるPrivDPOを設計する。
論文 参考訳(メタデータ) (2026-08-05T16:51:02Z) - Communication-Efficient and Privacy-Adaptable Mechanism for Federated Learning [54.20871516148981]
通信効率・プライバシー適応メカニズム(CEPAM)について紹介する。
CEPAMは通信効率とプライバシー保護を同時に達成する。
我々は、CEPAMのプライバシー保証を理論的に分析し、CEPAMのユーザプライバシと正確性の間のトレードオフを調査する。
論文 参考訳(メタデータ) (2025-01-21T11:16:05Z) - Privacy-Preserving Dynamic Assortment Selection [4.399892832075127]
本稿では,マルチノミアルロジット(MNL)バンドレートモデルを用いて,プライバシ保護のための動的アソシエーション選択のための新しいフレームワークを提案する。
弊社のアプローチでは、ノイズをユーザユーティリティ推定に統合し、探索とエクスプロイトのバランスを保ちつつ、堅牢なプライバシー保護を確保している。
論文 参考訳(メタデータ) (2024-10-29T19:28:01Z) - Enhancing Feature-Specific Data Protection via Bayesian Coordinate Differential Privacy [55.357715095623554]
ローカル微分プライバシー(LDP)は、ユーザーが外部の関係者を信頼することなく、強力なプライバシー保証を提供する。
本稿では,ベイジアン・フレームワークであるベイジアン・コーディネート・ディファレンシャル・プライバシ(BCDP)を提案する。
論文 参考訳(メタデータ) (2024-10-24T03:39:55Z) - Bayes-Nash Generative Privacy Against Membership Inference Attacks [24.330984323956173]
本稿では, プライバシ保護をゲーム理論でモデル化する枠組みを, ディフェンダーとアタッカーのベイズゲームとして提案する。
戦略的複雑さに対処するため、私たちは、プライベートデータセットを公開表現にマッピングするニューラルネットワークジェネレータとして、ディフェンダーの混合戦略を表現します。
当社のアプローチは,より強力な攻撃を発生させ,より優れたプライバシ・ユーティリティ・トレードオフを実現することによって,最先端の手法を著しく上回ります。
論文 参考訳(メタデータ) (2024-10-09T20:29:04Z) - Optimal Federated Learning for Nonparametric Regression with Heterogeneous Distributed Differential Privacy Constraints [5.3595271893779906]
本研究では,異なるサーバにまたがる分散サンプルのコンテキストにおける非パラメトリック回帰のためのフェデレーション学習について検討した。
統計の正確さとプライバシーの保護のトレードオフに光を当てている。
論文 参考訳(メタデータ) (2024-06-10T19:34:07Z) - Theoretically Principled Federated Learning for Balancing Privacy and
Utility [61.03993520243198]
モデルパラメータを歪ませることでプライバシを保護する保護機構の一般学習フレームワークを提案する。
フェデレートされた学習における各コミュニケーションラウンドにおいて、各クライアント上の各モデルパラメータに対して、パーソナライズされたユーティリティプライバシトレードオフを実現することができる。
論文 参考訳(メタデータ) (2023-05-24T13:44:02Z) - Decentralized Matrix Factorization with Heterogeneous Differential
Privacy [2.4743508801114444]
信頼できないリコメンデータに対して, 異種差分行列分解アルゴリズム(HDPMF)を提案する。
我々のフレームワークは、プライバシと精度のトレードオフを改善するために、革新的な再スケーリングスキームを備えた拡張ストレッチ機構を使用している。
論文 参考訳(メタデータ) (2022-12-01T06:48:18Z) - Privacy Preserving Recalibration under Domain Shift [119.21243107946555]
本稿では,差分プライバシー制約下での校正問題の性質を抽象化する枠組みを提案する。
また、新しいリカレーションアルゴリズム、精度温度スケーリングを設計し、プライベートデータセットの事前処理より優れています。
論文 参考訳(メタデータ) (2020-08-21T18:43:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。