論文の概要: TV-Regulated OPD: Direction Matters in On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2609.08341v1
- Date: Tue, 08 Sep 2026 07:14:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.604173
- Title: TV-Regulated OPD: Direction Matters in On-Policy Distillation
- Title(参考訳): テレビ規制PD: オンライン蒸留における方向性
- Abstract要約: On-Policy Distillation (OPD)は、大規模言語モデル(LLM)の訓練後の段階において、ドメインエキスパートから学生への知識の伝達を促進する
本研究では,トレーニング中の不安定性の背後にあるパフォーマンスと基本的なメカニズムについて検討した。
トークンレベルのアドバンテージのサインのみを保持することは、標準的なPDに匹敵するパフォーマンスを達成するのに十分であることがわかった。
- 参考スコア(独自算出の注目度): 11.725526469578433
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-Policy Distillation (OPD) facilitates the transfer of knowledge from domain expert to student in the post-training phase of Large Language Models (LLMs). However, the supervision signals in mainstream OPD methods suffer from high variance and noise which is generally instable during training. In this work, we systematically investigated what really matters to the performance and the fundamental mechanisms behind the instability during training. We found that retaining only the sign of token-level advantages is sufficient to achieve the performance comparable to standard OPD. Meanwhile, smoother and bounded advantages can stabilize the training process without sacrificing its performance. These motivated us to shape the advantages using the Total Variation (TV) and propose a robust TV regulated On-Policy Distillation (TV-OPD) method. Benefiting from the bounded and diminished advantages, TV-OPD exhibits stable training dynamics and steady late-stage performance. We conducted comprehensive experiments and found that, across various settings, TV-OPD consistently achieved better performance and lower variance in the late-stage of training.
- Abstract(参考訳): On-Policy Distillation (OPD) は、Large Language Models (LLMs) の訓練後の段階において、ドメインエキスパートから学生への知識の伝達を促進する。
しかし、主流のPD法における監視信号は、訓練中に一般的に不安定な高ばらつきとノイズに悩まされる。
本研究では,トレーニング中の不安定性の背後にある性能と基本的なメカニズムについて,系統的に検討した。
トークンレベルのアドバンテージのサインのみを保持することは、標準的なPDに匹敵するパフォーマンスを達成するのに十分であることがわかった。
一方、よりスムーズで有界な利点は、その性能を犠牲にすることなくトレーニングプロセスを安定させることができる。
これらの結果から,TV(Total Variation)の利点を生かし,TV-OPD(On-Policy Distillation)法を提案することができた。
TV-OPDは、バウンドと低下したアドバンテージから恩恵を受け、安定したトレーニングダイナミックスと安定した後期パフォーマンスを示す。
総合的な実験を行ったところ,TV-OPDは訓練後期に常に優れた性能と低分散を実現していることがわかった。
関連論文リスト
- Are Full Rollouts Necessary for On-Policy Distillation? [63.18243901591995]
オンライン蒸留(OPD)は、学生が生み出すロールアウトに沿って密集した教師のフィードバックを提供する。
我々は、ロールアウトの地平線を、トレーニング効率に大きく影響を及ぼすOPDの重要なボトルネックとみなす。
本稿では,トレーニング中に徐々にロールアウト地平線を拡大するプログレッシブPDと,信頼性の高い切り抜きロールアウトで恒久的に蒸留を行うTrncated OPDの2つの簡単な水平制御戦略を提案する。
論文 参考訳(メタデータ) (2026-05-29T16:12:54Z) - A Systematic Post-Train Framework for Video Generation [76.26555417456773]
大規模ビデオ拡散モデルでは、高解像度でセマンティックにリッチなコンテンツを生成できることが顕著に示されている。
迅速な感度、時間的不整合、禁止的推論コストといった重要な問題のために、事前訓練されたパフォーマンスと実際のデプロイメント要件の間には、大きなギャップが残っている。
本研究では,事前学習されたモデルとユーザの意図を4つの相乗的段階を通して体系的に整合させる総合的なポストトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-28T09:34:51Z) - VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation [14.33516456804297]
On-Policy VLA Distillation (VLA-OPD)は、オンライン強化学習(RL)の効率をオフライン監視ファインチューニング(SFT)の堅牢性でブリッジするフレームワークである。
論文 参考訳(メタデータ) (2026-03-27T17:59:33Z) - Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation [29.755136665244805]
時間的ビデオグラウンディング(TVG)の原則的ポストトレーニングパラダイムとして強化学習が登場している。
我々は,近年のオンライン蒸留の進歩に触発されたTVGのための効率的なポストトレーニングフレームワークであるVideo-OPDを提案する。
論文 参考訳(メタデータ) (2026-02-03T02:05:48Z) - Stabilizing Reinforcement Learning with LLMs: Formulation and Practices [61.361819972410046]
本稿では,REINFORCEなどの政策勾配法において,真のシーケンスレベルの報酬を代用トークンレベルの目的によって最適化できる理由と条件を示す。
この洞察は、RLトレーニングの安定化において、広く採用されているいくつかのテクニックの重要な役割について、原則化された説明を提供する。
論文 参考訳(メタデータ) (2025-12-01T07:45:39Z) - Average of Pruning: Improving Performance and Stability of
Out-of-Distribution Detection [37.43981354073841]
OOD検出の性能はトレーニング中の過度な適合と不安定性に悩まされている。
モデル平均化とプルーニングからなるAoP(Average of Pruning)を提案し,不安定な挙動を緩和する。
論文 参考訳(メタデータ) (2023-03-02T12:34:38Z) - Empirical Evaluation of Supervision Signals for Style Transfer Models [44.39622949370144]
本研究は,トレーニング中に指導信号を提供する支配的な最適化パラダイムを実証的に比較する。
バックトランスレーションにはモデル固有の制限があり、トレーニングスタイルのトランスファーモデルを阻害する。
また、私たちの知識では、スタイル転送のタスクで経験的に評価されていない機械翻訳コミュニティで人気のあるテクニックである最小リスクトレーニングを実験しています。
論文 参考訳(メタデータ) (2021-01-15T15:33:30Z) - Training Generative Adversarial Networks by Solving Ordinary
Differential Equations [54.23691425062034]
GANトレーニングによって引き起こされる連続時間ダイナミクスについて検討する。
この観点から、GANのトレーニングにおける不安定性は積分誤差から生じると仮定する。
本研究では,有名なODEソルバ(Runge-Kutta など)がトレーニングを安定化できるかどうかを実験的に検証する。
論文 参考訳(メタデータ) (2020-10-28T15:23:49Z) - Efficient Empowerment Estimation for Unsupervised Stabilization [75.32013242448151]
エンパワーメント原理は 直立位置での 力学系の教師なし安定化を可能にする
本稿では,ガウスチャネルとして動的システムのトレーニング可能な表現に基づく代替解を提案する。
提案手法は, サンプルの複雑さが低く, 訓練時より安定であり, エンパワーメント機能の本質的特性を有し, 画像からエンパワーメントを推定できることを示す。
論文 参考訳(メタデータ) (2020-07-14T21:10:16Z) - Understanding the Difficulty of Training Transformers [120.99980924577787]
バランスの取れない勾配がトレーニングの不安定性の根本原因ではないことを示す。
我々は,早期段階のトレーニングを安定させ,後期段階においてその潜在能力を最大限に活用するためのアドミンを提案する。
論文 参考訳(メタデータ) (2020-04-17T13:59:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。