論文の概要: Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
- arxiv url: http://arxiv.org/abs/2608.26872v2
- Date: Sun, 30 Aug 2026 16:02:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 15:47:04.287522
- Title: Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
- Title(参考訳): Self-OPD:教師なしのフローマッチングモデルのためのオンポリシィ蒸留
- Abstract要約: フローマッチングモデルのための教師なしOPDフレームワークである textbfSelf-OPD を紹介する。
Self-OPDは決定論的次状態予測を$K$SDE候補に分割し、ODEサンプルとロールアウトして、決定論的自己参照ベースラインと比較する。
単品と混合報酬のベンチマーク実験により、セルフOPDはタスク固有の教師を伴わずに、以前のRLとOPDメソッドよりも優れていた。
- 参考スコア(独自算出の注目度): 36.07614733558147
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy distillation (OPD), which leverages a pre-trained, specialized teacher model to provide dense supervisory signals, has achieved significant success in Large Language Models (LLMs) and has recently been adapted to flow matching models. However, this paradigm suffers from two major issues: First, training a separate, task-specific teacher for every new objective incurs high computational costs. Second, the discrepancy between teacher and student distributions often leads to compounding errors along the generation trajectory. In this paper, we introduce \textbf{Self-OPD}, a teacher-free OPD framework for flow matching models that turns the student's own self-exploration into step-wise supervision. At each timestep, Self-OPD branches the deterministic next-state prediction into $K$ stochastic SDE candidates, rolls them out with the ODE sampler, and compares their rewards against a deterministic self-reference baseline to obtain normalized advantages. The velocity field is optimized with an all-branch pull-push objective, where high-advantage branches attract the student and low-advantage branches repel it under direction-aware attenuation and SDE-variance normalization. For multi-objective alignment, Self-OPD fuses normalized scores at the reward level, avoiding direct gradient conflict. Experiments on single and mixed reward benchmarks show that Self-OPD outperforms prior RL and OPD methods without task-specific teachers.
- Abstract(参考訳): 大規模言語モデル(LLM)において,事前訓練された専門教師モデルを利用して高密度の監視信号を提供するオンライン蒸留(OPD)が成功し,近年,フローマッチングモデルに適応している。
しかし、このパラダイムは2つの大きな問題に悩まされる: まず、新しい目的に対して個別のタスク固有の教師を訓練すると、高い計算コストが発生する。
第二に、教師と生徒の分布の相違は、しばしば世代軌道に沿って複合的なエラーを引き起こす。
本稿では,学習者の自己探索を段階的に監督する,フローマッチングモデルのための教師なしOPDフレームワークである「textbf{Self-OPD}」を紹介する。
それぞれのタイミングで、Self-OPDは決定論的次状態予測を$K$確率的SDE候補に分割し、ODEサンプルとロールアウトし、その報酬を決定論的自己参照ベースラインと比較し、正規化された利点を得る。
速度場は全分岐プルプッシュ目標で最適化され、高アドバンテージブランチは学生を引き寄せ、低アドバンテージブランチは方向対応減衰とSDE分散正規化の下でこれを撃退する。
多目的アライメントのために、セルフOPDは報酬レベルで正規化されたスコアを融合させ、直接的な勾配の衝突を避ける。
単品と混合報酬のベンチマーク実験により、セルフOPDはタスク固有の教師を伴わずに、以前のRLとOPDメソッドよりも優れていた。
関連論文リスト
- When Teacher Guidance Misleads: Reward-Aligned On-Policy Distillation [21.86522736658343]
本稿では, 教師指導の誤りを軽減するために, Reward-Aligned On-Policy Distillation (RA-OPD)を提案する。
RA-OPDは、さらなる計算コストを必要とせずに、より信頼性の高い軌道を選択し、生徒モデルの性能を向上させる。
我々は,Qwen3ファミリーとDeepSeek-R1ファミリーのモデルを用いて,数学とコードベンチマークのRA-OPDを評価する。
論文 参考訳(メタデータ) (2026-08-28T06:05:50Z) - DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models [11.299607850340607]
DreOPDは、フローマッチングモデルのための分解参照補間OPD法である。
DreOPD は OPD とマルチタスク RL のベースラインを平均性能で上回ることを示す。
論文 参考訳(メタデータ) (2026-08-10T07:55:57Z) - Contrastive On-Policy Distillation [36.47487086937924]
対照的なオンライン蒸留フレームワークである COPD を提案する。
COPDは生徒モデルに直接、より簡潔で効率的な推論戦略を学ぶよう促す。
論文 参考訳(メタデータ) (2026-07-21T12:35:04Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - dOPSD: On-Policy Self-Distillation for Diffusion Language Models [52.60302464420127]
拡散大言語モデルは、マスキングシーケンスを反復的に復調することでテキストを生成する。
監督された微調整は非政治的であり、露出バイアスに悩まされる一方、強化学習はわずかにシーケンスレベルの報酬しか与えない。
On-policy Self-distillation (OPSD)は、学生と教師の両方に1つのモデルを用いて、有望な代替手段を提供する。
論文 参考訳(メタデータ) (2026-07-05T17:47:29Z) - DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models [55.01951088768769]
DiffusionOPDはオンライン政策蒸留(OPD)に基づく拡散モデルのための新しいマルチタスクトレーニングパラダイムである
本研究では,DiffusionOPDがトレーニング効率と最終性能において,マルチリワードRLとカスケードRLのベースラインを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-14T16:49:09Z) - Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models [65.89572755202245]
拡散言語モデル(DLM)は、より強力なグローバル認識と高い並列生成を提供する。
標準負のエビデンス下界(NELBO)に基づく教師付き微調整後のDLMは非効率である。
そこで本研究では,学習を推論の容易かつハードな構造に整合させる,自己蒸留軌道に基づくポストトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-12T09:39:06Z) - Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation [57.524909883706556]
オンライン蒸留(OPD)は、学生のパフォーマンス向上に強い経験的利益をもたらしている。
この研究は、フレキシブルな参照モデルと報酬項の相対重みをKL正規化に対して制御する報酬スケーリング係数を導入している。
特に、同じ学生モデルにドメイン固有RLを適用して得られた異なるドメインエキスパートの知識をマージする環境では、ExOPDは生徒が教師のパフォーマンス境界を越えられるようにします。
論文 参考訳(メタデータ) (2026-02-12T16:14:29Z) - Stable On-Policy Distillation through Adaptive Target Reformulation [7.361248172930405]
ベト (Veto) は、ロジット空間に幾何学的ブリッジを構築する客観的なレベルの再構成である。
ベトは監督された微調整と既存の政治のベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-01-12T02:57:39Z) - Delving into Identify-Emphasize Paradigm for Combating Unknown Bias [52.76758938921129]
同定精度を高めるため,有効バイアス強調スコアリング法(ECS)を提案する。
また, マイニングされたバイアスアライメントとバイアスコンプリケート試料のコントリビューションのバランスをとるために, 勾配アライメント(GA)を提案する。
様々な環境で複数のデータセットで実験を行い、提案されたソリューションが未知のバイアスの影響を軽減することを実証した。
論文 参考訳(メタデータ) (2023-02-22T14:50:24Z) - Distributionally Robust Models with Parametric Likelihood Ratios [123.05074253513935]
3つの単純なアイデアにより、より広いパラメトリックな確率比のクラスを用いてDROでモデルを訓練することができる。
パラメトリック逆数を用いてトレーニングしたモデルは、他のDROアプローチと比較して、サブポピュレーションシフトに対して一貫して頑健であることがわかった。
論文 参考訳(メタデータ) (2022-04-13T12:43:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。