論文の概要: What Does Privileged Information Add to On-Policy Self-Distillation?
- arxiv url: http://arxiv.org/abs/2609.20612v2
- Date: Fri, 18 Sep 2026 15:43:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:16.722884
- Title: What Does Privileged Information Add to On-Policy Self-Distillation?
- Title(参考訳): プリビリード・インフォメーションはオンデマンドの自己蒸留にどんな影響を及ぼすか?
- Abstract要約: オンラインの自己蒸留(On-policy self-distillation)により、言語モデルは、答や解決方法を見る、自分自身の凍結したコピーから学ぶことができる。
AMPLE-Mathは、5,319の数学的問題からなる再利用可能なスイートで、同じ答えを6つの推論ビューで共有する。
直接応答型ロールアウトを監督する思考能力のある教師によって、Qwen3-1.7Bの改良の大部分は参照レス蒸留によるものである。
- 参考スコア(独自算出の注目度): 57.872246350931306
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy self-distillation (OPSD) lets a language model learn from a frozen copy of itself that sees an answer or a worked solution. Giving the teacher this extra information seems to offer the student more to learn, but how much does it add beyond distillation itself? To isolate that contribution, we construct AMPLE-Math, a reusable suite of 5,319 mathematical problems with six reasoning views that share the same answer, and compare each view with matched reference-free distillation. With a thinking-enabled teacher supervising direct-response rollouts, reference-free distillation accounts for much of Qwen3-1.7B's improvement under thinking-enabled evaluation, both in domain and on external benchmarks. Evidence for an additional reference benefit is modest in Qwen, strongest for a polished solution, whereas complete traces add two percentage points in SmolLM3-3B at step 50. These benefits depend on the student being trained. At the same checkpoint, replacing short direct-response rollouts with long thinking-enabled rollouts turns gains into losses in both families while the problems, references, and evaluation stay fixed. Teacher profiles and matched loss interventions in Qwen further show that changing token-level supervision can leave student behavior largely unchanged. Together, these findings suggest that OPSD can improve access to existing reasoning capabilities through parameters shared by direct-response and thinking-enabled inference. The value of a privileged reference is what it adds to this cross-mode transfer, not how much of the solution it reveals.
- Abstract(参考訳): On-policy Self-distillation (OPSD) は、言語モデルが自身のフリーズコピーから学ぶことができる。
教師にこの余分な情報を与えることで、学生にもっと学ぶことができるように思えるが、蒸留そのものを超えて、どれくらい追加されるのか?
AMPLE-Mathは、5,319の数学的問題からなる再利用可能なスイートであり、同じ回答を共有する6つの推論ビューを持ち、各ビューを一致した参照フリー蒸留と比較する。
直接応答型ロールアウトを監督する思考可能な教師によって、Qwen3-1.7Bは、ドメインおよび外部ベンチマークの両方において、思考可能な評価の下で改善された。
追加の参照利益の証拠はQwenにおいて控えめであり、精製された溶液では最強である一方、完全なトレースはステップ50でSmolLM3-3Bに2ポイント加算される。
これらの利点は、訓練を受けている学生に依存します。
同じチェックポイントでは、短い直接応答ロールアウトを長い思考可能なロールアウトに置き換えると、問題、参照、評価が固定されている間、両方の家族で損失が生じる。
Qwenにおける教師のプロファイルと一致した損失介入は、トークンレベルの監督の変更が学生の行動を大きく変化させる可能性があることを示している。
これらの結果から,OPSDは直接応答と思考可能な推論によって共有されるパラメータを通じて,既存の推論能力へのアクセスを改善することが示唆された。
特権付き参照の値が、このクロスモード転送に追加するものであって、そのソリューションの量ではない。
関連論文リスト
- Self-Supervised Visual On-Policy Distillation [63.83705343579541]
視覚的オンライン蒸留は情報的教師-学生非対称性に大きく依存する。
S$2$VOPD(Self-Supervised Visual On-Policy Distillation)を紹介する。
S$2$VOPDは、オリジナルのイメージに条件付けられた教師の分布を、同じイメージの強く強化されたビューで条件付けられた学生の分布に蒸留する。
論文 参考訳(メタデータ) (2026-08-14T09:52:01Z) - Visual Contrastive Self-Distillation [61.298159957622886]
本稿では,視覚的コントラスト自己蒸留法を提案する。
これと対照的に,本研究では,教師の具体的イメージ分布の明確化を図り,その結果のフルディストリビューション目標を学生に蒸留する。
論文 参考訳(メタデータ) (2026-07-23T17:37:37Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - What Drives Interactive Improvement from Feedback? [0.7330217643497284]
本研究では,繰り返し試みだけで得られる利得を超えて,自然言語フィードバックがいつ改善をもたらすかを検討する。
マルチターン言語エージェントの設定では、より高い最終的な精度は有用なフィードバックを反映することができるが、再サンプリング、フォーマット修正、追加のテスト時間計算から生じることもある。
我々は,Omni-MATH,Codeforces,BBEH Linguini,ARC-AGI1にまたがる学生教育プロトコルを提案する。
論文 参考訳(メタデータ) (2026-06-29T18:06:36Z) - Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation [60.55792673956761]
我々は, ルブリックを構造化, きめ細かいフィードバックとして組み込んだフレームワークであるtextbfRubric-Conditioned Self-Distillationを提案する。
その結果, ルーリック条件の自己蒸留は, ルーリックレベルの基準をトークンレベルのガイダンスに効果的に変換することを示した。
論文 参考訳(メタデータ) (2026-06-17T17:54:04Z) - ViCuR: Visual Cues as Recoverable Privilege for Multimodal On-Policy Distillation [5.131753844398592]
ViCuRは視覚的に接地された特権型蒸留フレームワークである。
答え側の特権を視覚的手がかりに置き換える。
答えに基づく自己蒸留よりも継続的に改善される。
論文 参考訳(メタデータ) (2026-06-04T05:18:13Z) - Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation [81.10000755917712]
オンライン蒸留は,教師からのトークンレベルのフィードバックを用いて,学生モデルを自作の軌道上で訓練することにより,推論能力を伝達する。
生徒が生成した接頭辞が長くなるにつれて、教師の次点の分布は自信を減らし、差別性が低下する。
SFDを緩和するため, textbfLookahead Group Reward (ours) を導入する。
論文 参考訳(メタデータ) (2026-05-29T04:39:20Z) - Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information [22.436966302243565]
本稿では,学生と教師の相違を増す反自己蒸留法を提案する。
AntiSDはGRPOベースラインの精度を2倍から10倍にし、最終精度を最大11.5ポイント向上させる。
論文 参考訳(メタデータ) (2026-05-12T06:40:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。