論文の概要: Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization
- arxiv url: http://arxiv.org/abs/2608.09568v1
- Date: Mon, 10 Aug 2026 13:05:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.28045
- Title: Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization
- Title(参考訳): Se-DPO: 直接参照最適化のための自己進化型トークンクレジット
- Abstract要約: トークンクレジットを導入し、各トークンのKL正規化を、優先結果への貢献に基づいて調整する。
本稿では,DPOトレーニング中に,モデル自身の内部信号からトークンクレジットを導出するライブメカニズムであるSe-DPOを提案する。
実験によると、Se-DPOはAlpacaEval2で9.8ポイント、Arena-Hardで12.2ポイント改善している。
- 参考スコア(独自算出の注目度): 41.53342772346055
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Direct Preference Optimization (DPO) aggregates token-level log-probability ratios via uniform summation, implicitly treating all tokens as contributing equally to the preference signal. However, the contribution of individual tokens to the preference signal varies. We introduce token credit, which modulates each token's KL regularization based on its contribution to the preference outcome. We derive that effective token credit is proportional to the magnitude of each token's implicit reward, and observe that this quantity evolves substantially during training. This implies that static token credit becomes increasingly misaligned as training progresses. In this work, we propose Se-DPO (Self-Evolving Token Credit for DPO), a live mechanism that derives token credit from the model's own evolving internal signals during DPO training. Since the reward signal varies in reliability across positions, Se-DPO calibrates token credit based on both the strength and the confidence of each token's contribution. Se-DPO requires no external models, adding only a lightweight calibration network with minimal computational overhead. Experiments show that Se-DPO improves over DPO by up to 9.8 points on AlpacaEval~2 and 12.2 points on Arena-Hard.
- Abstract(参考訳): 直接選好最適化(DPO)はトークンレベルの対数確率比を一様和で集約し、すべてのトークンを優先信号に等しく寄与するものとして暗黙的に扱う。
しかし、選好信号に対する個々のトークンの寄与は様々である。
トークンクレジットを導入し、各トークンのKL正規化を、優先結果への貢献に基づいて調整する。
有効トークンクレジットは各トークンの暗黙の報酬の大きさに比例し、トレーニング中にこの量が実質的に進化するのを観察する。
これは、静的トークンクレジットが、トレーニングが進むにつれて、ますます誤解されることを意味する。
本研究では,DPOトレーニング中に,モデル自身の内部信号からトークンクレジットを導出する,Se-DPO(Self-Evolving Token Credit for DPO)を提案する。
報酬信号は位置によって信頼性が異なるため、Se-DPOはトークンの強さと各トークンの貢献の信頼性の両方に基づいてトークンクレジットを校正する。
Se-DPOは外部モデルを必要としないため、計算オーバーヘッドが最小限である軽量キャリブレーションネットワークのみを追加する。
実験の結果、Se-DPOはAlpacaEval~2で最大9.8ポイント、Arena-Hardで12.2ポイント改善している。
関連論文リスト
- ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy [45.28312869386833]
モードローカル・サロゲート・エントロピーに基づくトークンレベルの信用割当フレームワークを提案する。
ACPOは、成功したロールアウトにおける不確実な決定と失敗したロールアウトにおける過信トークンを強調して、ポリシー更新を非対称に調整する。
AIME 2025やHumanEvalProなどの数学的推論とコーディングベンチマークの実験は、ACPOが強いRLベースラインよりも一貫して改善していることを示している。
論文 参考訳(メタデータ) (2026-07-03T09:14:27Z) - STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability [78.63876433996107]
GRPOの下でトークンレベルのエントロピーダイナミクスの1次勾配解析を行う。
本稿では,バッチ内部量子化によるエントロピークリティカルトークンのサブセットを識別するSTAREを提案する。
AIME24とAIME25では、STAREはDAPOや他の競争ベースラインを平均精度で4%-8%上回っている。
論文 参考訳(メタデータ) (2026-06-17T16:13:42Z) - Token-weighted Direct Preference Optimization with Attention [17.569206072311157]
本稿ではトークン重み付きRLとアテンションPOに基づく新しいトレーニング目標を提案する。
AttentionPO は LLM 自体からの注意を使ってトークンの重みを推定する。
実験の結果,アテンションPOはAlpacaEval,MT-Bench,ArenaHardの性能を著しく向上することがわかった。
論文 参考訳(メタデータ) (2026-05-21T01:43:09Z) - OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning [17.98540130851038]
検証可能な報酬を伴う強化学習は、LSM推論を改善するための標準的なレシピとなっている。
しかし、支配的なアルゴリズム GRPO は全てのトークンに対して単一の軌道レベルの利点を割り当てる。
我々は,Oracle-Prompted Policy Optimization (OPPO)を提案する。
論文 参考訳(メタデータ) (2026-05-21T00:55:13Z) - CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization [50.59956036193097]
検証可能な報酬(RLVR)を用いた強化学習における正しい解を生成するモデル
各トークンは、決定的な推論ステップであれ、文法的なフィラーであれ、同じ報酬信号を受信する。
コントラストエビデンスポリシー最適化(CEPO)を提案する。
CEPOは、全てのトークンに対してよりシャープな質問をする:「正しい答えは、このトークンを好むか?」が、「正しい答えは、正しい答えは、それを好む一方で、間違った答えはそれを好まないか?」。
論文 参考訳(メタデータ) (2026-05-19T06:46:19Z) - Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy [64.72195169444738]
ポリシー・グラディエント・メソッドは、各トークンを同じ軌道で扱い、均一なクレジット割り当てにつながる。
このような均一なクレジット割り当てはトークンレベルのトレーニングシグナルをほとんど誤配置していることを示す。
本稿では,トークン再重み付け手法であるActFocusを提案する。
論文 参考訳(メタデータ) (2026-05-14T08:33:02Z) - Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization [74.91418266859297]
インプシットプロセス報酬モデル(PRM)は、推論プロセスに沿ってきめ細かな報酬信号を提供する。
トレーニングはシーケンスレベルの集約のみを制限しますが、推論はローカルステップの品質を反映するためにトークンレベルのスコアが必要です。
本稿では,予測精度を推定するプレフィックス条件付き値関数を直接学習する新しいインプリシット・プレフィックス・バリュー・リワード・モデル(IPVRM)を提案する。
また,サンプルトークンと高確率候補トークンの両方に対してTDの利点を演算する分散レベルRL(DistRL)を提案する。
論文 参考訳(メタデータ) (2026-04-14T18:19:54Z) - TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization [73.16975077770765]
近年の強化学習の進歩は、きめ細かいトークンレベルの報酬モデルを利用することで、PPO(Pximal Policy Optimization)の性能を大幅に向上させることができることを示している。
直接選好最適化(DPO)のガイダンスとしてこのようなトークンレベルの報酬を活用することは困難である。
この研究は、PPOをトークンレベルのポリシー最適化問題列に分解し、トークンレベルの報酬ガイダンスでトークンレベルのPPOの問題をフレーム化する。
論文 参考訳(メタデータ) (2025-06-17T14:30:06Z) - AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization [45.46582930202524]
$alpha$-DPOは、大規模言語モデルの適応的優先最適化アルゴリズムである。
ポリシーモデルと参照モデルのバランスを取り、パーソナライズされた報酬マージンを達成する。
さまざまなモデル設定でDPOとSimPOを一貫して上回ります。
論文 参考訳(メタデータ) (2024-10-14T04:29:57Z) - Token-level Direct Preference Optimization [8.249403373337024]
微調整された事前訓練された大規模言語モデルは、それらを人間の価値観や意図と整合させるのに不可欠である。
トークンレベルでポリシーを最適化することにより,LLMと人間の嗜好を一致させる新しいアプローチである,トークンレベルの直接選好最適化(TDPO)を導入する。
論文 参考訳(メタデータ) (2024-04-18T08:49:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。