論文の概要: Reliability-Aware LLM Alignment from Inconsistent Human Feedback
- arxiv url: http://arxiv.org/abs/2607.20515v1
- Date: Tue, 07 Jul 2026 20:13:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.927424
- Title: Reliability-Aware LLM Alignment from Inconsistent Human Feedback
- Title(参考訳): 信頼度を考慮した不整合フィードバックからのLLMアライメント
- Abstract要約: 本稿では、不整合性フィードバックの影響を軽減するために、信頼性誘導型優先度最適化(RGPO)を提案する。
RGPOはアノテータの信頼性を推定し、ノイズの多い人間のフィードバックから潜在する真実ラベルを推定し、ロバストな嗜好を特定する。
実験により、RGPOはトレーニングデータにおける矛盾やノイズを効果的に低減し、広く採用されているRLHFベースラインと比較して優れた性能を実現する。
- 参考スコア(独自算出の注目度): 8.848575171204729
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement Learning from Human Feedback (RLHF) is critical for aligning Large Language Models (LLMs) with human preferences. However, its efficacy is often compromised by the inherent inconsistency and subjectivity of human annotations. Existing preference optimization frameworks, such as Direct Preference Optimization (DPO), typically treat ambiguous pairs with high annotator disagreement identically to those with unanimous consensus, forcing models to overfit to inconsistent supervision signals and leading to suboptimal alignment. In this work, we propose Reliability-Guided Preference Optimization (RGPO), a robust framework designed to mitigate the impact of inconsistent human feedback. RGPO estimates annotator reliability and infers latent ground truth labels from noisy human feedback to identify robust preferences. Furthermore, we introduce a reliability-aware consistency optimization that dynamically modulates the training objective based on the consensus level of annotations, ensuring the model prioritizes high-consensus supervision signals. Extensive experiments on LLM alignment benchmarks demonstrate that RGPO effectively reduces inconsistency and noise in training data and achieves superior performance compared to widely adopted RLHF baselines. Our code and configurations are available at https://github.com/GenieHuang/RGPO.
- Abstract(参考訳): RLHF(Reinforcement Learning from Human Feedback)は、Large Language Models(LLM)を人間の好みに合わせるために重要である。
しかし、その効力はしばしば人間のアノテーションの固有の矛盾と主観性によって損なわれている。
直接選好最適化(DPO)のような既存の選好最適化フレームワークは、通常、一意的なコンセンサスを持つものと同一に高いアノテータの不一致を持つあいまいなペアを扱い、モデルに一貫性のない監視信号に過度に適合させ、準最適アライメントをもたらす。
本研究では,不整合性フィードバックの影響を緩和する頑健なフレームワークである信頼性誘導型優先度最適化(RGPO)を提案する。
RGPOはアノテータの信頼性を推定し、ノイズの多い人間のフィードバックから潜在する真実ラベルを推定し、ロバストな嗜好を特定する。
さらに,アノテーションのコンセンサスレベルに基づいてトレーニング目標を動的に調整し,高コンセンサス監視信号の優先順位付けを行う信頼性に配慮した整合性最適化を提案する。
LLMアライメントベンチマークの大規模な実験により、RGPOはトレーニングデータにおける矛盾やノイズを効果的に低減し、広く採用されているRLHFベースラインよりも優れた性能を実現することが示された。
私たちのコードと設定はhttps://github.com/GenieHuang/RGPO.orgで公開されています。
関連論文リスト
- Unbiased Alignment for Large Language Models with Noisy Preferences [74.69408994904965]
本稿では,Unbiased Reward Model(URM)損失とUnbiased Direct Preference Optimization(UDPO)損失を導入した非バイアスアライメントの理論的枠組みを提案する。
好み雑音によって引き起こされる歪みを数学的に補正することにより、我々の新しい目的はノイズの多いデータセットから直接バイアスのないモデルトレーニングを可能にする。
論文 参考訳(メタデータ) (2026-07-03T12:04:43Z) - Distributed Direct Preference Optimization [3.0957695592556007]
直接選好最適化(DPO)は、明示的な報酬モデリングを避けるが、連合的および分散的なトレーニングの下での収束保証が欠如している。
分散環境におけるDPOの最初の収束解析と時間複雑度解析を行う。
連合DPOでは、クライアントのドリフト、通信周波数、嗜好の不均一性の影響を定量化する収束率を導出する。
分散DPOでは、一般的な通信グラフに対する収束を確立し、スペクトル接続が最適化速度とコンセンサスをどのように支配するかを示す。
論文 参考訳(メタデータ) (2026-05-20T04:49:13Z) - Not All Preferences Are Created Equal: Stability-Aware and Gradient-Efficient Alignment for Reasoning Models [52.48582333951919]
ポリシー更新の信号対雑音比を最大化することにより、アライメントの信頼性を高めるために設計された動的フレームワークを提案する。
SAGE(Stability-Aware Gradient Efficiency)は、モデル能力に基づいて候補プールをリフレッシュする粗いきめ細かいカリキュラムメカニズムを統合する。
複数の数学的推論ベンチマークの実験により、SAGEは収束を著しく加速し、静的ベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2026-02-01T12:56:10Z) - Conformal Feedback Alignment: Quantifying Answer-Level Reliability for Robust LLM Alignment [5.556653374703646]
コンフォーマルフィードバックアライメント(Conformal Feedback Alignment, CFA)は、コンフォーマル予測(CP)の統計的保証における優先重み付けを基礎とするフレームワークである。
CFAは、制御可能なカバレッジを持つ共形予測セットを構築し、これらの信頼度をDPOおよびPPOスタイルのトレーニングのための原則化された重みに集約することで、回答レベルの信頼性を定量化する。
論文 参考訳(メタデータ) (2026-01-24T06:23:18Z) - On Symmetric Losses for Robust Policy Optimization with Noisy Preferences [55.8615920580824]
この研究は、人間からのフィードバックから強化学習のコアコンポーネントである報酬モデリングに焦点を当てている。
本稿では, 騒音条件下でのロバストな政策最適化のための基本的枠組みを提案する。
対称的損失は,ノイズラベルの下でも政策最適化を成功させることができることを証明した。
論文 参考訳(メタデータ) (2025-05-30T15:30:43Z) - Leveraging Robust Optimization for LLM Alignment under Distribution Shifts [51.74394601039711]
人間の値に整合した出力を生成するために、大規模言語モデルを操る上で、優先順位アライメント手法はますます重要になっている。
このようなシフトに拘わらず、好みのアライメントを改善する新しい分布対応最適化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-08T09:14:38Z) - Permutative Preference Alignment from Listwise Ranking of Human Judgments [40.23480751285947]
我々はNDCGを異なる代理損失で近似することで、エンドツーエンドのアライメントアルゴリズムを開発する。
我々は,NDCGに基づく手法により,B-T法よりも効率よくランキング精度を向上させることを示す。
論文 参考訳(メタデータ) (2024-10-06T03:49:28Z) - Self-Evolutionary Large Language Models through Uncertainty-Enhanced Preference Optimization [9.618391485742968]
反復的選好最適化は、最近、大規模言語モデル(LLM)のデファクトトレーニングパラダイムの1つになっている。
我々は、信頼性の高いフィードバックでLLMを自己進化させる不確実性のあるtextbfPreference textbfOptimizationフレームワークを提案する。
筆者らのフレームワークは,ノイズ問題を大幅に軽減し,反復的選好最適化の性能を向上させる。
論文 参考訳(メタデータ) (2024-09-17T14:05:58Z) - Bridging and Modeling Correlations in Pairwise Data for Direct Preference Optimization [75.1240295759264]
本稿では,BMC という名前のペアデータにおけるブリッジ・アンド・モデリングの効果的なフレームワークを提案する。
目的の修正によって、ペアの選好信号の一貫性と情報性が向上する。
DPOだけではこれらの相関をモデル化し、ニュアンス付き変動を捉えるには不十分である。
論文 参考訳(メタデータ) (2024-08-14T11:29:47Z) - Direct Preference Optimization: Your Language Model is Secretly a Reward Model [119.65409513119963]
本稿では,RLHFにおける報酬モデルの新たなパラメータ化について紹介する。
DPO(Direct Preference Optimization)と呼ばれる結果のアルゴリズムは、安定的で、性能が高く、計算的にも軽量である。
我々の実験は、DPOが人間の好みに合わせて微調整できるだけでなく、既存の方法よりも優れていることを示す。
論文 参考訳(メタデータ) (2023-05-29T17:57:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。