論文の概要: Differentially Private Preference Data Synthesis for Large Language Model Alignment
- arxiv url: http://arxiv.org/abs/2605.30808v1
- Date: Fri, 29 May 2026 03:53:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.374915
- Title: Differentially Private Preference Data Synthesis for Large Language Model Alignment
- Title(参考訳): 大規模言語モデルアライメントのための微分プライベートな選好データ合成
- Authors: Fengyu Gao, Jing Yang,
- Abstract要約: DPPrefSynは、差分プライベート(DP)合成嗜好データを生成するアルゴリズムである。
クラスタ単位の報酬モデルの共有線形構造を利用して、プライベートデータセットで異質な人間の嗜好をキャプチャする。
- 参考スコア(独自算出の注目度): 6.989255131957306
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Preference alignment is a crucial post-training step for large language models (LLMs) to ensure their outputs align with human values. However, post-training on real human preference data raises privacy concerns, as these datasets often contain sensitive user prompts and human judgments. To address this, we propose DPPrefSyn, a novel algorithm for generating differentially private (DP) synthetic preference data to enable privacy-preserving preference alignment. DPPrefSyn is a principled framework grounded in the Bradley-Terry preference model and the intrinsic geometric structure of pairwise human preference data. It first learns an underlying preference model from private data with formal differential privacy guarantees, and then leverages the learned model together with public prompts to synthesize high-quality preference data. It exploits the shared linear structure of per-cluster reward models to effectively capture heterogeneous human preferences in private datasets, and leverages DP Principal Component Analysis (DP-PCA) to improve learning accuracy. Extensive experimental results demonstrate that DPPrefSyn achieves competitive alignment performance under strong DP guarantees. These findings highlight the potential of synthetic preference data as a practical alternative for privacy-preserving preference alignment across a broad range of applications. To the best of our knowledge, this is the first work to generate DP synthetic preference data for LLM alignment. Our code is available at https://github.com/gfengyu/Differentially-Private-Preference-Data-Synthesis.
- Abstract(参考訳): 優先度アライメントは、アウトプットが人間の値と一致することを保証するために、大規模言語モデル(LLM)にとって、トレーニング後の重要なステップである。
しかし、実際の人間の嗜好データによるポストトレーニングはプライバシー上の懸念を生じさせ、これらのデータセットには機密性の高いユーザープロンプトや人間の判断が含まれることが多い。
これを解決するために,DPPrefSynを提案する。DPPrefSynは,プライバシ保存による嗜好アライメントを実現するために,差分プライベート(DP)合成選好データを生成する新しいアルゴリズムである。
DPPrefSynは、Bradley-Terry選好モデルと、ペアワイズ人間の選好データの固有幾何学構造を基盤とした、原則化されたフレームワークである。
まず、正式な差分プライバシー保証を持つプライベートデータから基礎となる選好モデルを学習し、その後、学習したモデルと公開プロンプトを併用して高品質な選好データを合成する。
クラスタ単位の報酬モデルの共有線形構造を利用して、プライベートデータセットにおける異種人の嗜好を効果的にキャプチャし、DP主成分分析(DP-PCA)を活用して学習精度を向上させる。
DPPrefSynは、強いDP保証の下で、競争力のあるアライメント性能を達成することを実証した。
これらの知見は、幅広いアプリケーションにまたがって、プライバシ保存された嗜好アライメントの実用的な代替手段として、合成選好データの可能性を強調している。
LLMアライメントのためのDP合成選好データを生成するのはこれが初めてである。
私たちのコードはhttps://github.com/gfengyu/differentially-Private-Preference-Data-Synthesisで利用可能です。
関連論文リスト
- DP-RFT: Learning to Generate Synthetic Text via Differentially Private Reinforcement Fine-Tuning [51.35628297101575]
差分的プライベート(DP)合成データ生成は,個人データ上での大規模言語モデル(LLM)の開発において重要な役割を担っている。
LLMを用いた合成データ生成のためのオンライン強化学習アルゴリズムDP-RFTを導入する。
DP-RFTは,ニュース記事や会議録,医療記事の要約など,長文およびドメイン固有の合成データ生成に有用である。
論文 参考訳(メタデータ) (2026-02-20T22:03:56Z) - Hybrid Preferences: Learning to Route Instances for Human vs. AI Feedback [87.37721254914476]
我々はHyPERを紹介した。HyPERは、人間または言語モデル(LM)にアノテーションを付与するハイブリッド推論ルータである。
その結果,HyPERを用いた人工選好と直接選好の混合は,RewardBenchでは7-13%しか使用せず,RM性能が向上していることがわかった。
また、HyPERの機能を分析した結果、安全上の懸念や複雑さが人間のフィードバックから最も恩恵を受けていることがわかりました。
論文 参考訳(メタデータ) (2024-10-24T20:04:15Z) - Differentially Private Non Parametric Copulas: Generating synthetic data with non parametric copulas under privacy guarantees [0.0]
本研究は、差分プライバシーを取り入れた非パラメトリックコプラベース合成データ生成モデルDPNPCの強化に焦点を当てる。
DPNPCと他の3つのモデル(PrivBayes、DP-Copula、DP-Histogram)を比較し、プライバシ、ユーティリティ、実行時間を評価する。
論文 参考訳(メタデータ) (2024-09-27T10:18:14Z) - Private prediction for large-scale synthetic text generation [28.488459921169905]
大規模言語モデル(LLM)を用いた微分プライベートテキスト生成手法を提案する。
プライベートな予測フレームワークでは、差分プライバシー保証を満たすために出力された合成データのみを必要とする。
論文 参考訳(メタデータ) (2024-07-16T18:28:40Z) - Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment [72.99676237703099]
大規模言語モデルと人間の嗜好の整合性を高める新しいフレームワークを提案する。
私たちのキーとなるアイデアは、小さな(種)データの中で人間の事前知識を活用することです。
本稿では,ノイズ認識型選好学習アルゴリズムを導入し,生成した選好データにおける品質低下のリスクを軽減する。
論文 参考訳(メタデータ) (2024-06-06T18:01:02Z) - Comparing Bad Apples to Good Oranges: Aligning Large Language Models via Joint Preference Optimization [105.3612692153615]
命令応答対に対して協調的に好みを抽出する新しい軸を提案する。
命令と応答ペアを併用することで、大きな言語モデルのアライメントを大幅に向上させることができる。
論文 参考訳(メタデータ) (2024-03-31T02:05:40Z) - Harnessing large-language models to generate private synthetic text [18.863579044812703]
DP-SGDのような異なるプライベートトレーニングアルゴリズムは、トレーニングされたモデルがプライベート情報を公開しないことを保証することで、センシティブなトレーニングデータを保護する。
本稿では、原データに対して差分的にプライベートな合成データを生成し、その合成データに基づいてモデルを非プライベートに訓練する代替手法について検討する。
プライベートな合成データを作るのは プライベートなモデルを訓練するより はるかに難しい
論文 参考訳(メタデータ) (2023-06-02T16:59:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。