論文の概要: Transitivity Meets Cyclicity: Explicit Preference Decomposition for Dynamic Large Language Model Alignment
- arxiv url: http://arxiv.org/abs/2605.17342v1
- Date: Sun, 17 May 2026 09:27:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:47.909188
- Title: Transitivity Meets Cyclicity: Explicit Preference Decomposition for Dynamic Large Language Model Alignment
- Title(参考訳): Transitivity Meets Cyclicity: 動的大規模言語モデルアライメントのための明示的な予測分解
- Authors: Yucong Huang, Xiucheng Li, Kaiqi Zhao, Jing Li,
- Abstract要約: 一般選好モデル(GPM)は階層構造を周期性で絡み合わせるが、支配的な解決策を保証できない。
本稿では,好みをベクトルに明示的に切り離すハイブリッド・リワード・シクリックモデルを提案する。
DSPPOはアライメントを時間変化ゲームとして扱い、ナッシュ均衡に向けて政策を導く。
- 参考スコア(独自算出の注目度): 11.867500058299939
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Standard RLHF relies on transitive scalar rewards, failing to capture the cyclic nature of human preferences. While some approaches like the General Preference Model (GPM) address this, we identify a theoretical limitation: their implicit formulation entangles hierarchy with cyclicity, failing to guarantee dominant solutions. To address this, we propose the Hybrid Reward-Cyclic (HRC) model, which utilizes game-theoretic decomposition to explicitly disentangle preferences into orthogonal transitive (scalar) and cyclic (vector) components. Complementing this, we introduce Dynamic Self-Play Preference Optimization (DSPPO), which treats alignment as a time-varying game to progressively guide the policy toward the Nash equilibrium. Synthetic data experiments further validate HRC's structural superiority in mixed transitive--cyclic settings, where HRC converges faster and achieves higher accuracy than GPM. Experiments on RewardBench 2 demonstrate that HRC consistently improves over both BT and GPM baselines (e.g., +1.23% on Gemma-2B-it). In particular, its superior performance in the Ties domain empirically validates the model's robustness in handling complex, non-strict preferences. Extensive downstream evaluations on AlpacaEval 2.0, Arena-Hard-v0.1, and MT-Bench confirm the efficacy of our framework. Notably, when using Gemma-2B-it as the base preference model, HRC+DSPPO achieves a peak length-controlled win-rate of 44.75% on AlpacaEval 2.0 and 46.8% on Arena-Hard-v0.1, significantly outperforming SPPO baselines trained with BT or GPM. Our code is publicly available at https://github.com/lab-klc/Hybrid-Reward-Cyclic.
- Abstract(参考訳): 標準的なRLHFは過渡的なスカラー報酬に依存しており、人間の嗜好の循環的な性質を捉えていない。
一般選好モデル (GPM) のようないくつかのアプローチではこの問題に対処するが、理論的な制限を識別する: その暗黙の定式化は階層を巡回性で絡み、支配的な解を保証できない。
そこで本研究では,ゲーム理論の分解を利用したHybrid Reward-Cyclic(HRC)モデルを提案する。
これに補完して,動的自己再生選好最適化(DSPPO)を導入し,アライメントを時間変化ゲームとして扱い,ナッシュ均衡に向けて政策を段階的に導く。
合成データ実験は、HRCがより速く収束し、GPMよりも高い精度を達成する混合遷移周期設定において、HRCの構造上の優位性をさらに検証する。
RewardBench 2 の実験では、HRC はBT と GPM のベースライン(Gemma-2B-it では +1.23% )を一貫して改善することを示した。
特に、Tiesドメインにおける優れたパフォーマンスは、複雑で非制限的な選好を扱う際のモデルの堅牢性を実証的に検証する。
AlpacaEval 2.0,Arena-Hard-v0.1,MT-Benchの下流での大規模な評価により,本フレームワークの有効性が確認された。
特に、Gemma-2B-itをベースプライオリティモデルとして使用する場合、HRC+DSPPOはAlpacaEval 2.0で44.75%、Arena-Hard-v0.1で46.8%というピーク長制御のウィンドレートを達成し、BTやGPMでトレーニングされたSPPOベースラインを著しく上回っている。
私たちのコードはhttps://github.com/lab-klc/Hybrid-Reward-Cyclic.comで公開されています。
関連論文リスト
- When Right Meets Wrong: Bilateral Context Conditioning with Reward-Confidence Correction for GRPO [18.988527161000203]
グループ相対政策最適化(GRPO)は、推論モデルを訓練するための効果的な方法として登場した。
本稿では,GRPOの目的が正解率と正解率とのマージンを暗黙的に最大化することを示す。
本稿では,モデルが相互参照を成功させる機構であるバイラテラルコンテキストコンディショニング(BICC)を提案する。
論文 参考訳(メタデータ) (2026-03-13T16:25:02Z) - Latent Collective Preference Optimization: A General Framework for Robust LLM Alignment [7.1259212876994695]
雑音データから潜在集団コンセンサスを学習するためにLCPO(Latent Collective Preference Optimization)を導入する。
本実験はLCPOの汎用フレームワークとしての有効性を実証し、4つの最先端アライメントアルゴリズムを一貫して強化した。
Mistral と Llama 3 モデルに適用すると、LCPO を拡張した手法は AlpacaEval 2 と Arena-Hard でかなりの利得を達成し、両方のベンチマークで最大 7.0 % 改善した。
論文 参考訳(メタデータ) (2025-09-29T01:17:49Z) - Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment [51.14207112118503]
我々は、優先順位を効率的に捉えるために、応答を潜在空間に埋め込むアプローチである選好埋め込みを導入する。
また、人間からのフィードバックから報酬に基づく強化学習を一般化する嗜好スコアに基づく一般選好最適化(GPO)を提案する。
提案手法は,基礎モデルの微妙な人的価値との整合性を高めることができる。
論文 参考訳(メタデータ) (2024-10-03T04:22:55Z) - Self-Play Preference Optimization for Language Model Alignment [75.83359213697854]
近年の進歩は、嗜好の確率で直接作業することで、人間の嗜好をより正確に反映できることを示している。
本稿では,言語モデルアライメントのためのセルフプレイ方式を提案する。
我々の手法はSPPO(Self-Play Preference Optimization)と呼ばれ、繰り返しポリシー更新を利用してナッシュ均衡を確実に近似する。
論文 参考訳(メタデータ) (2024-05-01T17:59:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。