論文の概要: Private Direct Preference Optimization for LLM Alignment
- arxiv url: http://arxiv.org/abs/2608.05040v1
- Date: Wed, 05 Aug 2026 16:51:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.999906
- Title: Private Direct Preference Optimization for LLM Alignment
- Title(参考訳): LLMアライメントのプライベートダイレクト参照最適化
- Authors: Yangfan Jiang, Fei Wei, Ergute Bao, Xiaokui Xiao, Yaliang Li, Bolin Ding,
- Abstract要約: 直接選好最適化(DPO)は、人間の選好データを用いて大規模言語モデル(LLM)を調整するための標準手法である。
本稿では、DPOのためのラベルDPスタイルのプライバシー概念である嗜好プライバシを定式化する。
次に、大規模LLMトレーニングと互換性を維持しながら、好みのプライバシを強制するDPOの派生であるPrivDPOを設計する。
- 参考スコア(独自算出の注目度): 77.56374641532715
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Direct preference optimization (DPO) is now a standard method for aligning large language models (LLMs) using human preference data. Each DPO example contains a prompt and a pair of candidate model responses. While prompts and responses are often public or model-generated, the relative preference between responses reflects subjective judgments and can reveal sensitive attributes of annotators or end users. Off-the-shelf privacy-preserving approaches are not well matched to this structure, leading to unnecessary noise injection and biased updates in training. In this paper, we formalize preference privacy, a label-DP-style privacy notion for DPO that protects only the relative preference between candidate responses, assuming an adversary who already knows the prompt and responses. We then design PrivDPO, a DPO variant that enforces preference privacy while remaining compatible with large-scale LLM training. Our main observation is that, for neighboring examples differing only in their preference signal, the gradient difference lies on a one-dimensional preference axis determined solely by the text; all preference information flows through this axis. PrivDPO adds calibrated randomness only along this axis via an unbiased randomized rescaling of the DPO objective, avoiding per-example gradient operations. Our experiments on three alignment benchmarks and three LLM families show that PrivDPO consistently achieves strong privacy-utility trade-offs compared with privacy-preserving baselines.
- Abstract(参考訳): 直接選好最適化(DPO)は、人間の選好データを用いて大規模言語モデル(LLM)を調整するための標準手法である。
各DPO例はプロンプトと候補モデル応答のペアを含む。
プロンプトと応答はしばしば公開またはモデル生成されるが、反応間の相対的な選好は主観的な判断を反映し、アノテータやエンドユーザの繊細な属性を明らかにすることができる。
オフザシェルフのプライバシ保存アプローチは、この構造にはあまりマッチしないため、不要なノイズ注入やトレーニングのバイアスのある更新につながります。
本稿では,DPOのラベル型プライバシー概念である選好プライバシを定式化し,すでにそのプロンプトや応答を知っている相手を前提として,候補応答間の相対的な選好だけを保護する。
次に、大規模LLMトレーニングと互換性を維持しながら、好みのプライバシを強制するDPOの派生であるPrivDPOを設計する。
我々の主な観察は、隣り合う例において、勾配差はテキストのみによって決定される1次元の選好軸上にあり、全ての選好情報がこの軸を通って流れることである。
PrivDPOは、DPOの目的を非バイアスでランダムに再スケーリングすることで、この軸に沿って調整されたランダム性を追加する。
3つのアライメントベンチマークと3つのLLMファミリーに関する実験により、PrivDPOは、プライバシー保護ベースラインと比較して、常に強力なプライバシユーティリティトレードオフを実現していることが示された。
関連論文リスト
- Mult-DPO: Multinomial Direct Preference Optimization for Recommender Systems [72.27018654934386]
直接選好最適化(DPO)は、ペアの選好に基づく大規模言語モデル(LLM)の簡易かつ効果的なアライメント戦略である。
しかし、レコメンデーションシステムでは、ユーザからのフィードバックがペアワイズであることは滅多にない。
提案するMult-DPOは,LLMベースのレコメンデータシステムのユーザ嗜好アライメントのための,設定された選好イベントに対するトラクタブルな多項サロゲート確率である。
論文 参考訳(メタデータ) (2026-06-08T18:53:45Z) - Differentially Private Preference Data Synthesis for Large Language Model Alignment [6.989255131957306]
DPPrefSynは、差分プライベート(DP)合成嗜好データを生成するアルゴリズムである。
クラスタ単位の報酬モデルの共有線形構造を利用して、プライベートデータセットで異質な人間の嗜好をキャプチャする。
論文 参考訳(メタデータ) (2026-05-29T03:53:12Z) - wDPO: Winsorized Direct Preference Optimization for Robust LLM Alignment [48.487557157323664]
実際には、好みのデータはしばしばうるさい。
既存のDPOの頑健な派生型は、主に一様の客観的な修正や大域的な再重み付けに依存している。
目的の介入によって異なるノイズタイプに対処することで、ロバストな選好アライメントの利点が示される。
論文 参考訳(メタデータ) (2026-03-07T13:30:53Z) - PROPS: Progressively Private Self-alignment of Large Language Models [16.049154157152177]
この研究は、優先順位レベルのプライバシとLLM(Large Language Models)の整合性に焦点を当てている。
本稿では,多段階のプライバシ保護アライメントフレームワークであるPROPS(PROgressively Private Self-alignment)を提案する。
同じプライバシー予算では、PROPSによるアライメントはDP-SGDに比べて最大3倍、Randomized Response (RR)ベースのアライメントに比べて2.5倍高いアライメントを達成することができる。
論文 参考訳(メタデータ) (2025-08-09T02:17:47Z) - Exposing Privacy Gaps: Membership Inference Attack on Preference Data for LLM Alignment [7.577032515701217]
DPOとPPOの2つの手法を併用した大規模言語モデルのメンバシップ推論攻撃(MIAs)に対する脆弱性について検討する。
PreMIA(ulinePreference data ulineMIA)と呼ばれる嗜好データを解析するための新しい参照ベースアタックフレームワークを提案する。
論文 参考訳(メタデータ) (2024-07-08T22:53:23Z) - Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment [72.99676237703099]
大規模言語モデルと人間の嗜好の整合性を高める新しいフレームワークを提案する。
私たちのキーとなるアイデアは、小さな(種)データの中で人間の事前知識を活用することです。
本稿では,ノイズ認識型選好学習アルゴリズムを導入し,生成した選好データにおける品質低下のリスクを軽減する。
論文 参考訳(メタデータ) (2024-06-06T18:01:02Z) - Comparing Bad Apples to Good Oranges: Aligning Large Language Models via Joint Preference Optimization [105.3612692153615]
命令応答対に対して協調的に好みを抽出する新しい軸を提案する。
命令と応答ペアを併用することで、大きな言語モデルのアライメントを大幅に向上させることができる。
論文 参考訳(メタデータ) (2024-03-31T02:05:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。