論文の概要: Beyond Token-Local Imitation: Reward-Compatible Temporal Credit Assignment for On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2609.16937v1
- Date: Tue, 15 Sep 2026 10:12:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.444435
- Title: Beyond Token-Local Imitation: Reward-Compatible Temporal Credit Assignment for On-Policy Distillation
- Title(参考訳): Token-Local Imitation:On-Policy DistillationのためのReward-Compatible Temporal Credit Assignment
- Abstract要約: オンライン蒸留(OPD)は,大規模言語モデルのポストトレーニングに有効な手法である。
我々は、長期監督と最適化の安定性のバランスをとるために、ディスカウントされた時間的クレジット割当を利用する$OPDを提案する。
我々は,$mathrmOPD$に対する報酬互換な有界混合機構を開発し,検証結果のフィードバックと割引OPDの利点のバランスをとる。
- 参考スコア(独自算出の注目度): 31.594936994611043
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: On-policy distillation (OPD) has emerged as an effective approach for large language model post-training, yet existing objectives face a trade-off between objective fidelity and optimization stability. Token-level OPD provides stable but local supervision, whereas sequence-level OPD captures future credit at the cost of horizon-dependent variance. We establish a unified temporal-credit view of these formulations, showing that practical token-level OPD can be interpreted as a temporal approximation to the sequence-level reverse-KL gradient. Building on this connection, we propose $γ$OPD, which uses discounted temporal credit assignment to balance long-horizon supervision and optimization stability, while admitting a horizon-independent variance bound. We further develop a reward-compatible bounded mixing (RBM) mechanism for $γ\mathrm{OPD}$ that balances verifiable outcome feedback with the discounted OPD advantage to move beyond purely teacher-dependent optimization. Experiments on mathematical and code reasoning demonstrate consistent improvements over existing OPD methods across vanilla, size-mismatched, and multi-teacher distillation settings.
- Abstract(参考訳): オンライン蒸留(OPD)は、大規模言語モデルのポストトレーニングに有効なアプローチとして登場したが、既存の目的は、客観的忠実性と最適化安定性のトレードオフに直面している。
トークンレベルOPDは安定したが局所的な監視を提供するが、シーケンスレベルPDは地平線依存分散のコストで将来の信用を捉えている。
我々はこれらの定式化の時間差を統一的に把握し、実際のトークンレベルのOPDをシーケンシャルレベルの逆KL勾配に対する時間近似として解釈できることを示す。
この接続上に構築した$γ$OPDは、時間的クレジット割当を割引して、水平方向に依存しない分散を許容しつつ、長期の監督と最適化の安定性のバランスをとる。
我々はさらに、$γ\mathrm{OPD}$に対する報酬互換な有界混合(RBM)機構を開発し、検証可能な結果フィードバックと割引されたOPDの利点をバランスさせ、純粋に教師依存の最適化を超えていく。
数理的およびコード推論の実験は、バニラ、サイズミスマッチ、マルチティーチンガー蒸留設定にまたがる既存のPD法よりも一貫した改善を示している。
関連論文リスト
- Momentum as Residual-Driven Multiplier Correction for Deep Learning Optimization [16.249904972534114]
我々は残高変動分割に基づく$textbfA$DMM-$textbfI$nspired $textbfM$omentum (AIM) フレームワークを開発する。
AIMはADMMスタイルの乗算器更新から乗算器更新の指数的な移動平均を回復する。
我々は、更新方向と運動量推定を改善するために、$textbfA$ccelerated $textbfR$esidual (RADAR)を提案する。
論文 参考訳(メタデータ) (2026-08-13T08:04:38Z) - $β$-OPSD: Deriving with Policy Optimization, Training with Self-Distillation [85.07190808882523]
オンライン自己蒸留は推論言語モデルを改善するための有望なアプローチである。
我々は,$-OPSDがバニラOPSDを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-07-30T17:41:16Z) - Ratio-Variance Regularized Policy Optimization [64.95520246570446]
ポリシ比の分散を明示的に制約することは、信頼領域の制約に対する原則的な局所近似をもたらすことを示す。
本稿では,この制約を実装したR2bf VPO$(Ratio-Variance Regularized Policy Optimization)を紹介する。
論文 参考訳(メタデータ) (2026-05-26T09:53:42Z) - $\boldsymbol{f}$-OPD: Stabilizing Long-Horizon On-Policy Distillation with Freshness-Aware Control [10.758424473099055]
システム効率には非同期実行が必要ですが、理想のオン政治目標から構造的に逸脱します。
本稿では,古いサンプルの影響を適応的に制御し,政策ドリフトを制約する新しいフレームワークであるf-OPDを提案する。
以上の結果から,OPDにおけるパフォーマンス効率トレードオフを実現するための最初のレシピが確立された。
論文 参考訳(メタデータ) (2026-05-18T05:14:18Z) - Holder Policy Optimisation [26.521180498291717]
textbfHlderPOは、一般的なポリシー最適化フレームワークである。
トークンレベルの確率アグリゲーションをHlder平均を介して統一する。
複数の数学ベンチマークにおいて、最先端の平均精度は54.9%である。
論文 参考訳(メタデータ) (2026-05-12T12:45:03Z) - Reducing Credit Assignment Variance via Counterfactual Reasoning Paths [11.514388061694268]
大規模言語モデル(LLM)を用いた多段階推論のための強化学習は、しばしばスパース端末報酬に依存する。
本稿では,複数の推論軌跡を同一の入力でサンプリングする,対実的比較に基づく信用割当フレームワークを提案する。
我々は、スパース端末報酬をステップセンシティブな学習信号に変換する暗黙のプロセスレベル優位推定器を構築する。
論文 参考訳(メタデータ) (2026-04-20T13:33:54Z) - Diffusion Controller: Framework, Algorithms and Parameterization [54.82539154511621]
本稿では,逆拡散サンプリングを(一般化された)線形解法マルコフ決定過程における状態のみの制御として活用する統一的な制御理論的視点を提案する。
このフレームワークでは、制御はトレーニング済みのリバースタイムのトランジションカーネルを再重み付けし、端末の目的と$f$分割コストのバランスをとる。
安定拡散v1.4の実験では、選好調整の勝利率が一貫した上昇を示し、品質効率のトレードオフを改善した。
論文 参考訳(メタデータ) (2026-03-07T01:49:59Z) - Stabilizing Policy Optimization via Logits Convexity [59.242732612484474]
モデルロジットに対する教師付き微調整損失の凸性は、安定したトレーニングを可能にする上で重要な役割を担っていることを示す。
そこで本研究では,ロジッツ・コンベックス最適化(Logits Convex Optimization, LCO)を提案する。
論文 参考訳(メタデータ) (2026-03-01T07:40:12Z) - Unifying Stable Optimization and Reference Regularization in RLHF [64.16830602324345]
本稿では、報酬ハッキングの防止と安定したポリシー更新の維持を目標とする統一正規化手法を提案する。
我々の単純で原則化されたアライメント目的は、監督された微調整の損失を軽減し、優れたトレードオフをもたらし、アライメント結果と実装の複雑さの両方を明らかに改善する。
論文 参考訳(メタデータ) (2026-02-12T03:31:19Z) - Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models [7.316631310935769]
VLA(Vision-Language-Action)モデルは、大規模なデモンストレーションを活用することで、強力な一般化を示している。
本研究では,FPOアルゴリズムを提案する。FPOアルゴリズムは,条件付きフローマッチングの目的に対して,サンプルごとの変化を生かして,重要サンプリングを再構築する。
LIBEROベンチマークのFPOとALOHAシミュレーションタスクを、教師付き、嗜好的、拡散的、自己回帰的オンラインRLに対して評価する。
論文 参考訳(メタデータ) (2025-10-11T03:11:18Z) - Provable Guarantees for Generative Behavior Cloning: Bridging Low-Level
Stability and High-Level Behavior [51.60683890503293]
生成モデルを用いた複雑な専門家による実演の行動クローニングに関する理論的枠組みを提案する。
任意の専門的軌跡の時間ごとのステップ分布に一致するトラジェクトリを生成することができることを示す。
論文 参考訳(メタデータ) (2023-07-27T04:27:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。