論文の概要: Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels
- arxiv url: http://arxiv.org/abs/2607.09796v1
- Date: Thu, 09 Jul 2026 09:20:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.197793
- Title: Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels
- Title(参考訳): 雑音優先ラベルに基づくメタデータフリーなメタリフレクテッド直接選好最適化
- Authors: Hua Qu, Yifan Li, Xiaodong Yuan,
- Abstract要約: 両レベル最適化フレームワークを提案し、ある仮定の下では、クリーンデータの下でDPO最適化を回復可能であることを証明した。
高品質なメタデータを得るのが難しいことを考慮し,タスクに依存しないメタ知識駆動手法を提案する。
TL;DR要約とHH単ターン対話実験により,提案手法は異なる雑音速度下で複数のDPOベースライン上でのトレーニング性能を向上させることを示した。
- 参考スコア(独自算出の注目度): 4.826561433595647
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Direct Preference Optimization (DPO) has become an important method for aligning large language models (LLMs) with human preferences because it removes the need for explicit reward modeling and reinforcement learning optimization. However, its performance depends heavily on the quality of preference data, and noisy preference data in real-world settings can weaken alignment performance. To address this issue, we propose a bilevel optimization framework and prove, under certain assumptions, that this framework can recover the DPO optimum under clean data. We further derive a prior form for the learnable weighting function under asymmetric label-flipping noise. Considering that high-quality metadata may be difficult to obtain, we propose a task-agnostic meta-knowledge-driven method that enables meta-learning even when metadata is completely unavailable. To reduce the high cost of higher-order gradients in LLM meta-learning, we combine central-difference approximation with LoRA fine-tuning and develop a scalable training scheme. Experiments on TL;DR summarization and Anthropic HH single-turn dialogue show that the proposed method improves training performance over multiple DPO baselines under different noise rates.
- Abstract(参考訳): 直接選好最適化(DPO)は,大規模言語モデル(LLM)を人間の嗜好と整合させる重要な手法となっている。
しかし、その性能は好みデータの品質に大きく依存しており、実環境におけるノイズの多い好みデータはアライメント性能を低下させる可能性がある。
この問題に対処するため、我々は二段階最適化フレームワークを提案し、特定の仮定の下で、クリーンデータの下でDPO最適化を復元できることを証明した。
さらに、非対称なラベルフリップ雑音下で学習可能な重み付け関数の事前形式を導出する。
高品質なメタデータは入手が困難である可能性があることを考慮し,メタデータが完全に利用できない場合でもメタ学習を可能にするタスク非依存メタ知識駆動方式を提案する。
LLMメタラーニングにおける高次勾配の高コスト化のために、中央差分近似とLoRA微調整を併用し、スケーラブルなトレーニングスキームを開発する。
TL;DR要約とHH単ターン対話実験により,提案手法は異なる雑音速度下で複数のDPOベースライン上でのトレーニング性能を向上させることを示した。
関連論文リスト
- Unbiased Alignment for Large Language Models with Noisy Preferences [74.69408994904965]
本稿では,Unbiased Reward Model(URM)損失とUnbiased Direct Preference Optimization(UDPO)損失を導入した非バイアスアライメントの理論的枠組みを提案する。
好み雑音によって引き起こされる歪みを数学的に補正することにより、我々の新しい目的はノイズの多いデータセットから直接バイアスのないモデルトレーニングを可能にする。
論文 参考訳(メタデータ) (2026-07-03T12:04:43Z) - When Data is the Algorithm: A Systematic Study and Curation of Preference Optimization Datasets [29.94723846950853]
本稿では,オープンソースDPOコーパスの包括的データ中心分析について紹介する。
Magpieフレームワークを利用して、各サンプルにタスクカテゴリ、入力品質、好みの報酬をアノテートします。
これにより、データセット間の好みの質をスケーラブルできめ細かい検査が可能になり、報酬マージンの構造的および質的な相違が明らかになる。
論文 参考訳(メタデータ) (2025-11-14T06:12:16Z) - Margin Adaptive DPO: Leveraging Reward Model for Granular Control in Preference Optimization [0.0]
Margin-Adaptive Direct Preference Optimizationは、安定的で、データ保存、インスタンスレベルのソリューションを提供する。
我々は、MADPOが優れた最適化環境を持っていることを証明し、包括的な理論的解析を行う。
ハイクオリティデータでは+33.3%、低クオリティデータでは+10.5%というパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2025-10-06T20:09:37Z) - Alignment through Meta-Weighted Online Sampling: Bridging the Gap between Data Generation and Preference Optimization [32.84452172765487]
大きな言語モデルと人間の価値観と意図を整合させるためには、優先度最適化が不可欠である。
既存の手法では、静的または分離されたオンラインサンプリング戦略を用いて、このギャップを減らそうとしている。
モデル学習とデータ生成を動的に結合する新しいフレームワークMetaAPO(Meta-Weighted Adaptive Preference Optimization)を提案する。
論文 参考訳(メタデータ) (2025-09-27T15:38:24Z) - Beyond Single: A Data Selection Principle for LLM Alignment via Fine-Grained Preference Signals [46.58760908162995]
本研究では,大規模言語モデルのための新しい理論的基盤データ選択法を提案する。
直接選好最適化目標の損失境界を解析することにより,この戦略の最適性を証明する。
我々の戦略は、標準的な全体主義的嗜好とより強い託宣の両方に対して、10%以上の相対的な改善を達成する。
論文 参考訳(メタデータ) (2025-08-11T05:43:02Z) - On Symmetric Losses for Robust Policy Optimization with Noisy Preferences [55.8615920580824]
この研究は、人間からのフィードバックから強化学習のコアコンポーネントである報酬モデリングに焦点を当てている。
本稿では, 騒音条件下でのロバストな政策最適化のための基本的枠組みを提案する。
対称的損失は,ノイズラベルの下でも政策最適化を成功させることができることを証明した。
論文 参考訳(メタデータ) (2025-05-30T15:30:43Z) - Less is More: Improving LLM Alignment via Preference Data Selection [46.9163802899686]
DPO(Direct Preference Optimization)は,大規模言語モデルと人間の嗜好を整合させる,有望なアプローチである。
DPOトレーニングにおけるデータセットキュレーションのための新たなマージン最大化原理を提案する。
提案手法は反復的DPOにシームレスに拡張され,約3%の改善が達成され,25%のオンラインデータが得られた。
論文 参考訳(メタデータ) (2025-02-20T13:45:17Z) - Reward-Augmented Data Enhances Direct Preference Alignment of LLMs [63.32585910975191]
報奨条件付き大言語モデル(LLM)を導入し、データセット内の応答品質のスペクトル全体から学習する。
当社のアプローチは,DPOをかなりのマージンで継続的に向上させることを示す。
本手法は,嗜好データの有用性を最大化するだけでなく,未学習の問題も軽減し,データ拡張を超えてその広範な効果を実証する。
論文 参考訳(メタデータ) (2024-10-10T16:01:51Z) - Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment [104.18002641195442]
既存のペアデータを必要としない、効果的でスケーラブルなトレーニングパラダイムである自己拡張型優先度最適化(SAPO)を導入する。
負の反応を自律的に生成するセルフプレイの概念に基づいて、我々はさらに、データ探索とエクスプロイトを強化するために、非政治的な学習パイプラインを組み込む。
論文 参考訳(メタデータ) (2024-05-31T14:21:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。