論文の概要: Distillation as Probability Transport: Routed On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2609.08337v1
- Date: Tue, 08 Sep 2026 07:07:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.601866
- Title: Distillation as Probability Transport: Routed On-Policy Distillation
- Title(参考訳): 確率輸送としての蒸留 : 経路付きオンライン蒸留
- Abstract要約: RouteOPD (Routed On-Policy Distillation) は、地元の教師を分解する。
教師の4つの設定と4つの数学的推論のベンチマークによる実験は、RouteOPDがサンプル化された逆KL OPDより一貫して優れていることを示した。
- 参考スコア(独自算出の注目度): 29.500694918719166
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy distillation (OPD) transfers teacher knowledge on student-generated trajectories, but efficient sampled objectives reduce the teacher distribution to scalar credit on individual tokens. Such credit indicates whether a token should gain or lose probability, yet leaves the corresponding redistribution unspecified. We recast OPD as teacher-guided probability transport and propose RouteOPD (Routed On-Policy Distillation), which decomposes local teacher--student disagreement into student-excess sources and teacher-deficit destinations and couples them into explicit transport pairs. RouteOPD optimizes pairwise log-odds toward jointly realizable targets obtained from a bounded teacher potential, while adapting the transport budget to the concentration of teacher demand. This formulation directs updates toward teacher-preferred destinations and controls their magnitude within a single transport operator. Experiments across four teacher--student settings and four mathematical-reasoning benchmarks demonstrate that RouteOPD consistently outperforms sampled reverse-KL OPD, with improvements accompanied by higher routing fidelity and lower background leakage. These results demonstrate the effectiveness of explicitly modeling probability transport in on-policy distillation.
- Abstract(参考訳): オンライン蒸留(OPD)は、学生が生み出す軌跡に関する教師の知識を伝達するが、効率的なサンプリング目的により、個々のトークンに対するスカラークレジットへの教師の分布を減少させる。
このようなクレジットは、トークンが確率を得るかどうかを示すが、対応する再配布は未特定のままである。
我々は,OPDを教師誘導型確率輸送として再考し,現地教師の不一致を学生過剰ソースと教師不足目的地に分解したRouteOPD(Routed On-Policy Distillation)を提案する。
RouteOPDは、輸送予算を教師需要の集中に適応させながら、有界教師ポテンシャルから得られる共同実現可能な目標に向けて、対向対数最適化を行う。
この定式化は教師が優先する目的地への更新を指示し、単一の輸送事業者内でその規模を制御する。
4つの教師設定と4つの数学的推論ベンチマークによる実験により、RouteOPDは、より高いルーティング忠実度と低いバックグラウンドリークを伴って、サンプル化された逆KL OPDを一貫して上回っていることが示された。
これらの結果から, オンライン蒸留における確率輸送のモデル化の有効性が示唆された。
関連論文リスト
- PAST: Privileged Adaptation from Complete Student Trajectories for On-Policy Self-Distillation [1.1440940588722308]
On-policy Self-distillation (OPSD) は、特権教師を用いて、自身のロールアウトからサンプリングされたプレフィックスの推論モデルを監督する。
PAST(Privleged Adaptation from Students Trajectories)を紹介する。
PASTは、学生の蒸留プレフィックスをそのまま残しながら、各学生軌跡をOPSD教師に追加の特権情報として扱う。
論文 参考訳(メタデータ) (2026-08-09T14:20:12Z) - Simple-OPD: Demystifying Warm-up for On-policy Distillation [51.693357695326846]
オンライン蒸留(On-policy distillation、OPD)は、教師モデルからトークンレベルの監督を受け、生徒を自身のロールアウトで訓練する。
データとトレーニングの両方の観点から、OPDのウォームアップをデミスティフィケートします。
論文 参考訳(メタデータ) (2026-08-07T04:47:38Z) - SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation [28.886137823815826]
Sparse Probing and Outcome-calibrated Targets OPD (SPOT)を紹介する。
SPOTは、取得-探索-探索-探索手順を通じて、どこで調査し、何を蒸留するかという2つの複合的な決定に対処する。
複数の学生モデルと推論ベンチマークによる実験は、SPOTの有効性を実証している。
論文 参考訳(メタデータ) (2026-08-05T03:59:24Z) - Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models [23.382646724389545]
オンライン蒸留(OPD)は、現在の学生政策の軌跡をサンプリングし、学生と教師の次点分布のトークンレベルのばらつきを最小限にする。
本稿では,ローカルで実現可能な教師の訂正のみを蒸留するemphFisher-Projected On-Policy Distillation (FP-OPD)を提案する。
論文 参考訳(メタデータ) (2026-08-02T14:16:14Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - SAGE-OPD: Selective Agent-Guided Intervention for Multi-Turn On-Policy Distillation [25.25989941933095]
マルチターンOPD用に設計された検証不要な選択的介入フレームワークであるSAGE-OPDを提案する。
SAGE-OPDは、教師の監督を全ターンで均一に行うのではなく、まず環境フィードバックを観察し、各生徒の反応をスキップするか介入するかを決定するために教師の判断を使用する。
エージェントタスクの実験では、SAGE-OPDはベースラインよりも一貫して改善され、ALFWorldの13.3%の相対的な改善を実現している。
論文 参考訳(メタデータ) (2026-06-17T23:58:14Z) - On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents [50.78688247330029]
オン・ポリシィ蒸留(On-Policy Distillation、OPD)は、小規模の学生にその能力を伝達するための自然なレシピである。
本稿では,教師と生徒が生成するターンを各ロールアウトに混在させるシンプルなアルゴリズムであるGuided-OPD(Guided-OPD)を提案する。
Guided-OPDは、平均してバニラOPDよりも21.1%、成功率25.5%向上している。
論文 参考訳(メタデータ) (2026-06-14T16:41:45Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z) - Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning [66.52232008796294]
Prune-OPDはトレーニング予算と監督品質を動的に調整する。
トレーニング時間を37.6%減らし-68.0%削減すると同時に、しばしば改善され、挑戦的なベンチマークのパフォーマンスが向上する。
論文 参考訳(メタデータ) (2026-05-08T14:38:53Z) - Which Reasoning Trajectories Teach Students to Reason Better? A Simple Metric of Informative Alignment [82.00769536768509]
Rank-Surprisal Ratioは、推論軌道の適合性を評価するためにアライメントとインフォメーションの両方をキャプチャする単純な計量である。
軌道選択と教師選択の両方において,その実用性を実証する。
論文 参考訳(メタデータ) (2026-01-20T18:58:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。