論文の概要: Privacy-Preserving Reinforcement Learning from Human Feedback via Decoupled Reward Modeling
- arxiv url: http://arxiv.org/abs/2603.22563v1
- Date: Mon, 23 Mar 2026 20:45:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.185127
- Title: Privacy-Preserving Reinforcement Learning from Human Feedback via Decoupled Reward Modeling
- Title(参考訳): 疎結合リワードモデリングによる人のフィードバックからのプライバシー保護強化学習
- Authors: Young Hyun Cho, Will Wei Sun,
- Abstract要約: 報酬学習のみに差分プライバシーを課すプライバシー保護フレームワークを提案する。
プライバシーは、通常の非私的統計誤差を超える付加的な用語に寄与していることを示す。
人為的HH-RLHFデータセットの実験は、既存の微分プライベートベースライン法よりも強いプライベートアライメント性能を示す。
- 参考スコア(独自算出の注目度): 2.805986764620217
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Preference-based fine-tuning has become an important component in training large language models, and the data used at this stage may contain sensitive user information. A central question is how to design a differentially private pipeline that is well suited to the distinct structure of reinforcement learning from human feedback. We propose a privacy-preserving framework that imposes differential privacy only on reward learning and derives the final policy from the resulting private reward model. Theoretically, we study the suboptimality gap and show that privacy contributes an additional additive term beyond the usual non-private statistical error. We also establish a minimax lower bound and show that the dominant term changes with sample size and privacy level, which in turn characterizes regimes in which the upper bound is rate-optimal up to logarithmic factors. Empirically, synthetic experiments confirm the scaling predicted by the theory, and experiments on the Anthropic HH-RLHF dataset using the Gemma-2B-IT model show stronger private alignment performance than existing differentially private baseline methods across privacy budgets.
- Abstract(参考訳): 優先度に基づく微調整は、大規模言語モデルのトレーニングにおいて重要な要素となり、この段階で使用されるデータは、センシティブなユーザ情報を含む可能性がある。
中心的な疑問は、人間のフィードバックからの強化学習の異なる構造によく適合する、微分プライベートパイプラインをどのように設計するかである。
本稿では、報酬学習のみに差分プライバシーを課すプライバシー保護フレームワークを提案し、その結果の個人報酬モデルから最終方針を導出する。
理論的には、最適度以下の差について検討し、プライバシーが通常の非プライベートな統計誤差を超える付加的な項に寄与していることを示す。
また、最小限の上限を定め、サンプルサイズとプライバシレベルによって支配的な項が変化することを示す。
Gemma-2B-ITモデルを用いた人為的HH-RLHFデータセットの実験は、プライバシー予算を越えて既存の微分プライベートベースライン法よりも強いプライベートアライメント性能を示す。
関連論文リスト
- On the MIA Vulnerability Gap Between Private GANs and Diffusion Models [51.53790101362898]
GAN(Generative Adversarial Networks)と拡散モデルが高品質な画像合成のための主要なアプローチとして登場している。
差分自己生成モデルが直面するプライバシーリスクの統一的および実証的分析について述べる。
論文 参考訳(メタデータ) (2025-09-03T14:18:22Z) - Model Agnostic Differentially Private Causal Inference [16.50501378936487]
観察データから因果効果を推定することは、医学、経済学、社会科学において不可欠である。
本稿では,平均治療効果を個人で評価するための一般的なモデルに依存しないフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-26T07:00:37Z) - Multi-Objective Optimization for Privacy-Utility Balance in Differentially Private Federated Learning [12.278668095136098]
フェデレートラーニング(FL)は、生データを共有せずに、分散クライアント間で協調的なモデルトレーニングを可能にする。
本稿では,多目的最適化フレームワークを用いて動的にクリッピング規範を調整する適応型クリッピング機構を提案する。
以上の結果から,適応的クリッピングは固定クリッピングベースラインを一貫して上回り,同一のプライバシー制約下での精度の向上を実現している。
論文 参考訳(メタデータ) (2025-03-27T04:57:05Z) - Differentially Private Random Feature Model [47.35176457481132]
プライバシを保存するカーネルマシンに対して,差分的にプライベートな特徴モデルを作成する。
本手法は,プライバシを保護し,一般化誤差を導出する。
論文 参考訳(メタデータ) (2024-12-06T05:31:08Z) - Initialization Matters: Privacy-Utility Analysis of Overparameterized
Neural Networks [72.51255282371805]
我々は、最悪の近傍データセット上でのモデル分布間のKLばらつきのプライバシー境界を証明した。
このKLプライバシー境界は、トレーニング中にモデルパラメータに対して期待される2乗勾配ノルムによって決定される。
論文 参考訳(メタデータ) (2023-10-31T16:13:22Z) - On the Statistical Complexity of Estimation and Testing under Privacy Constraints [17.04261371990489]
差分プライバシー下での統計的テストのパワーをプラグアンドプレイ方式で特徴付ける方法を示す。
プライバシ保護のレベルが非常に高い場合にのみ、プライバシの維持が顕著なパフォーマンス低下をもたらすことを示す。
最後に,プライベート凸解法であるDP-SGLDアルゴリズムを高信頼度で最大推定できることを示した。
論文 参考訳(メタデータ) (2022-10-05T12:55:53Z) - Don't Generate Me: Training Differentially Private Generative Models
with Sinkhorn Divergence [73.14373832423156]
そこで我々はDP-Sinkhornを提案する。DP-Sinkhornは個人データからデータ分布を差分プライバシで学習するための新しいトランスポートベース生成手法である。
差分的にプライベートな生成モデルを訓練するための既存のアプローチとは異なり、我々は敵の目的に頼らない。
論文 参考訳(メタデータ) (2021-11-01T18:10:21Z) - PEARL: Data Synthesis via Private Embeddings and Adversarial
Reconstruction Learning [1.8692254863855962]
本稿では, 深層生成モデルを用いたデータ・フレームワークを, 差分的にプライベートな方法で提案する。
当社のフレームワークでは、センシティブなデータは、厳格なプライバシ保証をワンショットで行うことで衛生化されています。
提案手法は理論的に性能が保証され,複数のデータセットに対する経験的評価により,提案手法が適切なプライバシーレベルで他の手法よりも優れていることが示された。
論文 参考訳(メタデータ) (2021-06-08T18:00:01Z) - Robustness Threats of Differential Privacy [70.818129585404]
我々は、いくつかの設定で差分プライバシーをトレーニングしたネットワークが、非プライベートバージョンに比べてさらに脆弱であることを実験的に実証した。
本研究では,勾配クリッピングや雑音付加などのニューラルネットワークトレーニングの主成分が,モデルの堅牢性に与える影響について検討する。
論文 参考訳(メタデータ) (2020-12-14T18:59:24Z) - Differentially Private Federated Learning with Laplacian Smoothing [72.85272874099644]
フェデレートラーニングは、ユーザ間でプライベートデータを共有せずに、協調的にモデルを学習することで、データのプライバシを保護することを目的としている。
敵は、リリースしたモデルを攻撃することによって、プライベートトレーニングデータを推測することができる。
差別化プライバシは、トレーニングされたモデルの正確性や実用性を著しく低下させる価格で、このような攻撃に対する統計的保護を提供する。
論文 参考訳(メタデータ) (2020-05-01T04:28:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。