論文の概要: Transitivity Meets Cyclicity: Explicit Preference Decomposition for Dynamic Large Language Model Alignment
- arxiv url: http://arxiv.org/abs/2605.17342v1
- Date: Sun, 17 May 2026 09:27:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:47.909188
- Title: Transitivity Meets Cyclicity: Explicit Preference Decomposition for Dynamic Large Language Model Alignment
- Title(参考訳): Transitivity Meets Cyclicity: 動的大規模言語モデルアライメントのための明示的な予測分解
- Abstract要約: 一般選好モデル(GPM)は階層構造を周期性で絡み合わせるが、支配的な解決策を保証できない。
本稿では,好みをベクトルに明示的に切り離すハイブリッド・リワード・シクリックモデルを提案する。
DSPPOはアライメントを時間変化ゲームとして扱い、ナッシュ均衡に向けて政策を導く。
- 参考スコア(独自算出の注目度): 11.867500058299939
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Standard RLHF relies on transitive scalar rewards, failing to capture the cyclic nature of human preferences. While some approaches like the General Preference Model (GPM) address this, we identify a theoretical limitation: their implicit formulation entangles hierarchy with cyclicity, failing to guarantee dominant solutions. To address this, we propose the Hybrid Reward-Cyclic (HRC) model, which utilizes game-theoretic decomposition to explicitly disentangle preferences into orthogonal transitive (scalar) and cyclic (vector) components. Complementing this, we introduce Dynamic Self-Play Preference Optimization (DSPPO), which treats alignment as a time-varying game to progressively guide the policy toward the Nash equilibrium. Synthetic data experiments further validate HRC's structural superiority in mixed transitive--cyclic settings, where HRC converges faster and achieves higher accuracy than GPM. Experiments on RewardBench 2 demonstrate that HRC consistently improves over both BT and GPM baselines (e.g., +1.23% on Gemma-2B-it). In particular, its superior performance in the Ties domain empirically validates the model's robustness in handling complex, non-strict preferences. Extensive downstream evaluations on AlpacaEval 2.0, Arena-Hard-v0.1, and MT-Bench confirm the efficacy of our framework. Notably, when using Gemma-2B-it as the base preference model, HRC+DSPPO achieves a peak length-controlled win-rate of 44.75% on AlpacaEval 2.0 and 46.8% on Arena-Hard-v0.1, significantly outperforming SPPO baselines trained with BT or GPM. Our code is publicly available at https://github.com/lab-klc/Hybrid-Reward-Cyclic.
- Abstract(参考訳): 標準的なRLHFは過渡的なスカラー報酬に依存しており、人間の嗜好の循環的な性質を捉えていない。
一般選好モデル (GPM) のようないくつかのアプローチではこの問題に対処するが、理論的な制限を識別する: その暗黙の定式化は階層を巡回性で絡み、支配的な解を保証できない。
そこで本研究では,ゲーム理論の分解を利用したHybrid Reward-Cyclic(HRC)モデルを提案する。
これに補完して,動的自己再生選好最適化(DSPPO)を導入し,アライメントを時間変化ゲームとして扱い,ナッシュ均衡に向けて政策を段階的に導く。
合成データ実験は、HRCがより速く収束し、GPMよりも高い精度を達成する混合遷移周期設定において、HRCの構造上の優位性をさらに検証する。
RewardBench 2 の実験では、HRC はBT と GPM のベースライン(Gemma-2B-it では +1.23% )を一貫して改善することを示した。
特に、Tiesドメインにおける優れたパフォーマンスは、複雑で非制限的な選好を扱う際のモデルの堅牢性を実証的に検証する。
AlpacaEval 2.0,Arena-Hard-v0.1,MT-Benchの下流での大規模な評価により,本フレームワークの有効性が確認された。
特に、Gemma-2B-itをベースプライオリティモデルとして使用する場合、HRC+DSPPOはAlpacaEval 2.0で44.75%、Arena-Hard-v0.1で46.8%というピーク長制御のウィンドレートを達成し、BTやGPMでトレーニングされたSPPOベースラインを著しく上回っている。
私たちのコードはhttps://github.com/lab-klc/Hybrid-Reward-Cyclic.comで公開されています。
関連論文リスト
- Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation [13.272542054938258]
非効率な勾配でトレーニングバッチの割合を定量化する最初の指標であるAdvantage Collapse Rate (ACR)を導入する。
次に、仮想報酬サンプルを注入するGRPOの軽量拡張であるAdaptive Virtual Sample Policy Optimization (AVSPO)を提案する。
AVSPOはGRPOに対して58~63%の利害崩壊を減少させ、すべてのモデルスケールで4~6ポイントの一貫した精度向上をもたらす。
論文 参考訳(メタデータ) (2026-05-20T12:57:37Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - Beyond Importance Sampling: Rejection-Gated Policy Optimization [8.321518227956323]
本稿では,重要サンプリング率r_thetaを置き換えるRejection-Gated Policy Optimization (RGPO)を紹介する。
RGPOは最適化原則への拒絶を高め、ゲートは計算に直接参加し、ポリシーとともに暗黙的に更新される。
RGPO は有界かつ制御可能なバイアスのみを発生し,TRPO に類似した近似単調な政策改善が保証されることを示す。
論文 参考訳(メタデータ) (2026-04-16T11:39:11Z) - When Right Meets Wrong: Bilateral Context Conditioning with Reward-Confidence Correction for GRPO [18.988527161000203]
グループ相対政策最適化(GRPO)は、推論モデルを訓練するための効果的な方法として登場した。
本稿では,GRPOの目的が正解率と正解率とのマージンを暗黙的に最大化することを示す。
本稿では,モデルが相互参照を成功させる機構であるバイラテラルコンテキストコンディショニング(BICC)を提案する。
論文 参考訳(メタデータ) (2026-03-13T16:25:02Z) - ProAct: Agentic Lookahead in Interactive Environments [56.50613398808361]
ProActは、2段階のトレーニングパラダイムを通じて、エージェントが正確なルックアヘッド推論を内部化することを可能にするフレームワークである。
そこでは,環境に基づく探索から得られたトラジェクトリの微調整をエージェントが行うGLAD(Grounded LookAhead Distillation)を紹介する。
また,政策段階のアルゴリズムを改良する補助値推定器であるモンテカルロ批判(MC-Critic)を提案する。
論文 参考訳(メタデータ) (2026-02-05T05:45:16Z) - Latent Collective Preference Optimization: A General Framework for Robust LLM Alignment [7.1259212876994695]
雑音データから潜在集団コンセンサスを学習するためにLCPO(Latent Collective Preference Optimization)を導入する。
本実験はLCPOの汎用フレームワークとしての有効性を実証し、4つの最先端アライメントアルゴリズムを一貫して強化した。
Mistral と Llama 3 モデルに適用すると、LCPO を拡張した手法は AlpacaEval 2 と Arena-Hard でかなりの利得を達成し、両方のベンチマークで最大 7.0 % 改善した。
論文 参考訳(メタデータ) (2025-09-29T01:17:49Z) - Finding the Sweet Spot: Preference Data Construction for Scaling Preference Optimization [66.67988187816185]
本研究の目的は、繰り返しランダムサンプリングにより、オンラインサンプルの数を増大させ、アライメント性能を向上させることである。
実験の結果,サンプルサイズが大きくなるにつれて,この戦略がエフェデクリンの性能向上につながることが明らかとなった。
サンプルの規模が大きくなるにつれてモデル性能を継続的に向上するスケーラブルな嗜好データ構築戦略を導入する。
論文 参考訳(メタデータ) (2025-02-24T04:22:57Z) - Earlier Tokens Contribute More: Learning Direct Preference Optimization From Temporal Decay Perspective [22.248134630764497]
ガンマパラメータによって制御される時間減衰係数を組み込んだ改良された選好最適化法を提案する。
我々のアプローチは、過度な適合を減らし、人間の好みの進化に反応し続けます。
論文 参考訳(メタデータ) (2025-02-20T07:53:11Z) - Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment [51.14207112118503]
我々は、優先順位を効率的に捉えるために、応答を潜在空間に埋め込むアプローチである選好埋め込みを導入する。
また、人間からのフィードバックから報酬に基づく強化学習を一般化する嗜好スコアに基づく一般選好最適化(GPO)を提案する。
提案手法は,基礎モデルの微妙な人的価値との整合性を高めることができる。
論文 参考訳(メタデータ) (2024-10-03T04:22:55Z) - Self-Play Preference Optimization for Language Model Alignment [75.83359213697854]
近年の進歩は、嗜好の確率で直接作業することで、人間の嗜好をより正確に反映できることを示している。
本稿では,言語モデルアライメントのためのセルフプレイ方式を提案する。
我々の手法はSPPO(Self-Play Preference Optimization)と呼ばれ、繰り返しポリシー更新を利用してナッシュ均衡を確実に近似する。
論文 参考訳(メタデータ) (2024-05-01T17:59:20Z) - REBEL: Reinforcement Learning via Regressing Relative Rewards [59.68420022466047]
生成モデルの時代における最小限のRLアルゴリズムであるREBELを提案する。
理論的には、自然ポリシーグラディエントのような基本的なRLアルゴリズムはREBELの変種と見なすことができる。
我々はREBELが言語モデリングと画像生成に一貫したアプローチを提供し、PPOやDPOとより強くあるいは類似した性能を実現することを発見した。
論文 参考訳(メタデータ) (2024-04-25T17:20:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。