論文の概要: Unbiased Alignment for Large Language Models with Noisy Preferences
- arxiv url: http://arxiv.org/abs/2607.03248v1
- Date: Fri, 03 Jul 2026 12:04:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.565533
- Title: Unbiased Alignment for Large Language Models with Noisy Preferences
- Title(参考訳): 雑音を考慮した大規模言語モデルの曖昧なアライメント
- Authors: Jialiang Wang, Xianming Liu, Xiong Zhou, Hui Liu, Haoliang Li,
- Abstract要約: 本稿では,Unbiased Reward Model(URM)損失とUnbiased Direct Preference Optimization(UDPO)損失を導入した非バイアスアライメントの理論的枠組みを提案する。
好み雑音によって引き起こされる歪みを数学的に補正することにより、我々の新しい目的はノイズの多いデータセットから直接バイアスのないモデルトレーニングを可能にする。
- 参考スコア(独自算出の注目度): 74.69408994904965
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The alignment of large language models with human preferences is commonly achieved through Reinforcement Learning from Human Feedback or Direct Preference Optimization. However, these methods are vulnerable to the significant noise prevalent in real-world preference datasets. To address this critical issue, we present a theoretical framework for unbiased alignment, introducing the Unbiased Reward Model (URM) loss and the Unbiased Direct Preference Optimization (UDPO) loss. By mathematically correcting the distortion induced by preference noise, our novel objectives enable unbiased model training directly from noisy datasets, without requiring clean ground-truth supervision. We provide rigorous theoretical analyses demonstrating that our methods are noise-tolerant, parameter downward compatible, and classification-calibrated. Comprehensive experiments across diverse datasets demonstrate that our approaches outperform state-of-the-art baselines. Code available at: https://github.com/cswjl/unbiased-alignment.
- Abstract(参考訳): 大規模言語モデルと人間の嗜好の整合性は、人間のフィードバックからの強化学習や直接選好最適化によって一般的に達成される。
しかし、これらの手法は、実世界の嗜好データセットでよく見られる大きなノイズに対して脆弱である。
この重要な問題に対処するために、不偏性回帰モデル(URM)の損失と不偏性直接選好最適化(UDPO)の損失を導入し、不偏性アライメントの理論的枠組みを提案する。
好み雑音によって引き起こされる歪みを数学的に補正することにより、我々の新しい目的は、クリーンな地道的監督を必要とせず、ノイズの多いデータセットから直接バイアスのないモデルトレーニングを可能にする。
我々は,本手法が耐雑音性,パラメータの下位互換性,分類校正性を示す厳密な理論的解析を行った。
多様なデータセットにわたる総合的な実験は、我々のアプローチが最先端のベースラインを上回っていることを示している。
コードは、https://github.com/cswjl/unbiased-alignment.comで入手できる。
関連論文リスト
- Optimal Transport for LLM Reward Modeling from Noisy Preference [21.518348751984433]
最適輸送を基盤としたフレームワークであるSelectiveRMを提案する。
まず、モデル予測の分布と嗜好データとを一致させるために、整合性差分法を考案する。
次に、部分輸送による質量緩和機構を組み込む。
これにより、意味的一貫性に矛盾するノイズの多い選好を持つサンプルを自律的に排除することができる。
論文 参考訳(メタデータ) (2026-05-07T11:26:04Z) - How Sampling Shapes LLM Alignment: From One-Shot Optima to Iterative Dynamics [65.67654005892469]
適切なインスタンス依存サンプリングは、より強力なランキング保証を得られる一方で、スキュードオン政治サンプリングは、構造化された嗜好の下で過剰な濃度を誘導できることを示す。
次に、学習したポリシーが将来のサンプリングおよび参照ポリシーにフィードバックする反復的なアライメントダイナミクスを分析する。
我々の理論的な洞察は直接選好最適化にまで拡張され、我々が捉えた現象はより広範な選好アライメント手法に共通していることを示している。
論文 参考訳(メタデータ) (2026-02-12T17:11:08Z) - How Well Can Preference Optimization Generalize Under Noisy Feedback? [7.374590753074647]
優先最適化は、人間のフィードバックに基づいて、好ましくない応答と好ましくない応答を区別するモデルを訓練する。
既存の研究の多くはノイズのないフィードバックを前提としているが、これは人間の判断に固有の誤りや矛盾のため非現実的である。
本稿では,雑音フィードバックが優先最適化に与える影響を考察し,これらの条件下での一般化保証を提供する。
論文 参考訳(メタデータ) (2025-10-01T20:56:31Z) - Latent Collective Preference Optimization: A General Framework for Robust LLM Alignment [7.1259212876994695]
雑音データから潜在集団コンセンサスを学習するためにLCPO(Latent Collective Preference Optimization)を導入する。
本実験はLCPOの汎用フレームワークとしての有効性を実証し、4つの最先端アライメントアルゴリズムを一貫して強化した。
Mistral と Llama 3 モデルに適用すると、LCPO を拡張した手法は AlpacaEval 2 と Arena-Hard でかなりの利得を達成し、両方のベンチマークで最大 7.0 % 改善した。
論文 参考訳(メタデータ) (2025-09-29T01:17:49Z) - On Symmetric Losses for Robust Policy Optimization with Noisy Preferences [55.8615920580824]
この研究は、人間からのフィードバックから強化学習のコアコンポーネントである報酬モデリングに焦点を当てている。
本稿では, 騒音条件下でのロバストな政策最適化のための基本的枠組みを提案する。
対称的損失は,ノイズラベルの下でも政策最適化を成功させることができることを証明した。
論文 参考訳(メタデータ) (2025-05-30T15:30:43Z) - Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization [31.741110625305186]
本稿では、優先最適化のパラダイムを用いて、モダリティバイアス問題を解決することを提案する。
具体的には、まず摂動を導入し、特定のモダリティの情報量を減らすことでデータセットを構築する。
自動構築したデータにおける避けられないノイズに対処するために、ノイズロバストな平均絶対誤差と直接選好最適化における二項交叉エントロピーを組み合わせる。
論文 参考訳(メタデータ) (2025-03-23T04:00:11Z) - Preference Learning Algorithms Do Not Learn Preference Rankings [62.335733662381884]
選好学習は、好ましくない出力よりも、好ましくない出力により高い確率を割り当てるようにモデルを訓練する、という従来の知恵を考察する。
多くの最先端の選好調整モデルでは、一般的な選好データセットでは60%未満のランキング精度が得られている。
論文 参考訳(メタデータ) (2024-05-29T21:29:44Z) - Marginal Debiased Network for Fair Visual Recognition [59.05212866862219]
本稿では,デバイアス表現を学習するための新しい限界脱バイアスネットワーク(MDN)を提案する。
我々のMDNは、表現不足のサンプルに対して顕著な性能を達成できる。
論文 参考訳(メタデータ) (2024-01-04T08:57:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。