論文の概要: ResOPD: Tail Residualization for Sparse On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2610.04882v1
- Date: Sun, 04 Oct 2026 02:43:39 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:38:42.938179
- Title: ResOPD: Tail Residualization for Sparse On-Policy Distillation
- Title(参考訳): ResOPD : 軽度オンポーシィ蒸留のための土壌残留化
- Abstract要約: オンライン蒸留は学生モデルを自己生成軌道上で訓練する。
教師の密集した分布を 長い推論の痕跡に伝達すると 通信の禁止と 記憶のボトルネックが生じる
本稿では,非バイアス付き完全語彙逆KL勾配推定を行うResOPD(On-Policy Distillation with Tail Residualization)を提案する。
- 参考スコア(独自算出の注目度): 25.123322898662565
- License:
- Abstract: On-policy distillation (OPD) trains a student model on self-generated trajectories, but transmitting dense teacher distributions across long reasoning traces creates prohibitive communication and memory bottlenecks. Practical systems therefore rely on sparse teacher interfaces, typically transmitting either the sampled-token score or a small Top-$k$ distribution. However, this sparse setting faces a fundamental dilemma: sampled-token estimators are unbiased but suffer from severe gradient variance, whereas directly optimizing Top-$k$ objectives introduces systematic bias. To improve this trade-off, we propose ResOPD (On-Policy Distillation with Tail Residualization), which provides unbiased full-vocabulary reverse KL gradient estimation under on-policy sampling, with substantial variance reduction under the same sparse payload in the evaluated settings. ResOPD aggregates the unobserved vocabulary into an observable coarse tail event, computes its exact aggregate gradient, and samples only the fine-grained within-tail residual, which requires no additional teacher queries or forward passes. Extensive experiments demonstrate that ResOPD substantially reduces gradient variance, stabilizes online training dynamics, and improves downstream performance across the evaluated settings. These results establish ResOPD as an efficient, plug-and-play variance reduction primitive for sparse on-policy distillation.
- Abstract(参考訳): オンライン蒸留(OPD)は、学生モデルを自己生成軌道上で訓練するが、長い理由の痕跡にまたがる密集した教師分布を伝達することは、禁断的なコミュニケーションとメモリボトルネックを生み出す。
したがって、実際のシステムはスパースな教師インタフェースに依存しており、典型的にはサンプルトーケンスコアまたは小さなTop-$k$分布を伝達する。
しかし、このスパース設定は基本的なジレンマに直面している: サンプルトーケン推定器はバイアスがなく、厳密な勾配のばらつきに悩まされているが、Top-$k$の目的を直接最適化することは、体系的なバイアスをもたらす。
このトレードオフを改善するために,提案するResOPD(On-Policy Distillation with Tail Residualization)を提案する。
ResOPDは、観測不能な語彙を粗い尾のイベントに集約し、その正確な集約勾配を計算し、さらに教師のクエリやフォワードパスを必要としない、きめ細かな内尾の残余のみをサンプリングする。
大規模な実験では、ResOPDは勾配のばらつきを大幅に低減し、オンライントレーニングのダイナミクスを安定化し、評価された設定の下流性能を改善する。
これらの結果から,ResOPDはスパースオンポリス蒸留における効率的なプラグアンドプレイ分散低減プリミティブとして確立された。
関連論文リスト
- Schrödinger--Föllmer Actor--Critic: Diffusion Policy Improvement with Finite-Sample Analysis [16.115903198836694]
拡散ポリシは、マルチモーダルなアクション分布を表すが、アドバンテージ重み付けされた更新では、結果のターゲット分布からサンプルする方法を規定していない。
我々は,KL(Kulback--Leibler)のオフライン-オンライン強化学習(RL)手法であるSchrdinger-Fllmer Actor-Critic (SFAC)を提案する。
適切な条件下では、評価評価、神経ドリフト回帰、有限サンプルSNIS、拡散離散化、およびアクターエラーが期待される平均的政策最適性に与える影響を分離する有限サンプル境界を導出する。
論文 参考訳(メタデータ) (2026-09-27T05:27:34Z) - KL for a KL: On-Policy Distillation with Control Variate Baseline [13.281263788199219]
On-Policy Distillation (OPD) は、大規模言語モデルのトレーニング後の主要なパラダイムとして登場した。
本稿では,OPDを政策段階RLとするvOPDを提案する。
VOPDはバニラOPDより一貫して優れており,最も高価な全語彙ベースラインと一致している。
論文 参考訳(メタデータ) (2026-05-08T15:24:51Z) - From Noisy Traces to Stable Gradients: Bias-Variance Optimized Preference Optimization for Aligning Large Reasoning Models [90.45197506653341]
大規模推論モデルは最終回答を生成する前に中間的推論トレースを生成する。
LRMと人間の好みの整合性は、モデルデプロイメントにとって重要な前提条件であり、まだ過小評価されていない。
共通の回避策は1つのサンプル軌道を最適化し、トレースサンプリングからかなり勾配のばらつきをもたらす。
論文 参考訳(メタデータ) (2025-10-06T17:58:01Z) - Half-order Fine-Tuning for Diffusion Model: A Recursive Likelihood Ratio Optimizer [16.103949557802988]
確率拡散モデル(DM)は、連鎖構造を通して推論することで内容を生成する。
現代の手法は強化学習 (RL) と切り離されたバックプロパゲーション (BP) に基づいている
DMのためのRLR(Recursive Likelihood Ratio)ファインチューニングパラダイムを提案する。
論文 参考訳(メタデータ) (2025-02-02T03:00:26Z) - Uncertainty-Penalized Direct Preference Optimization [52.387088396044206]
我々は、優先不確実性ペナル化スキームを導入し、DPOの悲観的な枠組みを開発する。
ペナル化は、不確実なサンプルの損失勾配を減衰させる損失の補正として機能する。
我々は,バニラDPOと比較して全体的な性能が向上し,高い不確実性選択/拒絶反応によるプロンプトの完成度も向上した。
論文 参考訳(メタデータ) (2024-10-26T14:24:37Z) - Rejection via Learning Density Ratios [50.91522897152437]
拒絶による分類は、モデルを予測しないことを許容する学習パラダイムとして現れます。
そこで我々は,事前学習したモデルの性能を最大化する理想的なデータ分布を求める。
私たちのフレームワークは、クリーンでノイズの多いデータセットで実証的にテストされます。
論文 参考訳(メタデータ) (2024-05-29T01:32:17Z) - Proposal Distribution Calibration for Few-Shot Object Detection [65.19808035019031]
few-shot object detection (FSOD)では、重度のサンプル不均衡を軽減するために、2段階の訓練パラダイムが広く採用されている。
残念ながら、極端なデータ不足は、提案の分布バイアスを増大させ、RoIヘッドが新しいクラスに進化するのを妨げます。
本稿では,RoIヘッドのローカライゼーションと分類能力を高めるために,単純かつ効果的な提案分布キャリブレーション(PDC)手法を提案する。
論文 参考訳(メタデータ) (2022-12-15T05:09:11Z) - SIMPLE: A Gradient Estimator for $k$-Subset Sampling [42.38652558807518]
この作業では、フォワードパスの離散$k$-subsetサンプリングに戻ります。
勾配推定器 SIMPLE は, 最先端推定器と比較して, バイアスやばらつきが低いことを示す。
実験結果から,線形回帰を説明・スパースする学習性能が向上した。
論文 参考訳(メタデータ) (2022-10-04T22:33:16Z) - Training Discrete Deep Generative Models via Gapped Straight-Through
Estimator [72.71398034617607]
再サンプリングのオーバーヘッドを伴わずに分散を低減するため, GST (Gapped Straight-Through) 推定器を提案する。
この推定子は、Straight-Through Gumbel-Softmaxの本質的な性質に着想を得たものである。
実験により,提案したGST推定器は,2つの離散的な深部生成モデリングタスクの強いベースラインと比較して,優れた性能を享受できることが示された。
論文 参考訳(メタデータ) (2022-06-15T01:46:05Z) - Unbiased Risk Estimators Can Mislead: A Case Study of Learning with
Complementary Labels [92.98756432746482]
我々は,補完ラベルを用いた学習という,弱教師付き問題を研究する。
勾配推定の品質はリスク最小化においてより重要であることを示す。
本稿では,ゼロバイアスと分散の低減を両立させる新しい補助的相補的損失(SCL)フレームワークを提案する。
論文 参考訳(メタデータ) (2020-07-05T04:19:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。