論文の概要: When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
- arxiv url: http://arxiv.org/abs/2605.21606v1
- Date: Wed, 20 May 2026 18:14:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 16:35:41.950731
- Title: When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
- Title(参考訳): 教師はいつ token を信頼できるのか? : 自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自給自
- Authors: Xiaogeng Liu, Xinyan Wang, Yingzi Ma, Yechao Zhang, Chaowei Xiao,
- Abstract要約: On-policy Self-distillation (OPSD) は、特権教師を使って生徒を自身のロールアウトで訓練する。
既存のエントロピーに基づくPD手法は、教師エントロピーによるトークンレベルの監督を調節することで、この一様性を緩和する。
そこで我々は,PW-OPSD(Pight-Weighted On-Policy Self-Distillation)を提案する。
- 参考スコア(独自算出の注目度): 45.79647925282674
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy self-distillation (OPSD) trains a student on its own rollouts using a privileged teacher, but its standard objective weights all generated tokens equally, implicitly treating the privileged teacher target as equally reliable at every student-visited prefix. Existing entropy-based OPD methods relax this uniformity by modulating token-level supervision with teacher entropy, but high teacher entropy in reasoning has an ambiguous reliability meaning: it can reflect either non-viable uncertainty or benign solution diversity. To identify this phenomenon, we introduce a branch-viability diagnostic. Specifically, we record next-token alternatives from the privileged-answer teacher prompt, force each alternative after the student prompt plus its on-policy spine prefix, and test whether the resulting student-template continuation recovers the correct answer. On Qwen3-4B, we find that an oriented within-sequence position score is the strongest tested predictor of teacher-token reliability, reaching an area-under-ROC-curve (AUROC) of 0.83; local uncertainty scores are at most 0.57. Motivated by this trajectory-level structure, we propose Position-Weighted On-Policy Self-Distillation (PW-OPSD), which applies an increasing position weight while keeping the same student rollout, privileged teacher pass, and clipped forward-KL target as OPSD. In our comprehensive evaluations with different random seeds, the diagnostic-derived PW-OPSD improves AIME 2024 and AIME 2025 Avg@12 by +1.0 and +1.1 points, and a generalization evaluation on two larger-scale models from different families, DeepSeek-R1-Distill-Llama-8B and Olmo-3-7B-Think, also demonstrates consistent aggregate Avg@12 improvements. These results show that teacher-token reliability in reasoning distillation is trajectory-structured and can be utilized without additional teacher computation.
- Abstract(参考訳): On-policy Self-distillation (OPSD) は、特権教師を使って生徒を自身のロールアウトで訓練するが、その標準的目的は全ての生成されたトークンを均等に重み付け、特権教師の標的を学生が訪問する全てのプレフィックスで同様に信頼できるものとして暗黙的に扱う。
既存のエントロピーに基づくPD法は、トークンレベルの監督を教師エントロピーと調整することで、この一様性を緩和するが、推論における高い教師エントロピーは曖昧な信頼性を持つ。
この現象を特定するために,我々は分岐可視性診断を導入する。
具体的には,受験指導要領から次の学習指導要領を抽出し,学生の指導要領の後に各選択肢を強制的に実施し,その結果の学習継続が正しい回答を回復させるかどうかを検証する。
Qwen3-4Bでは,教師の信頼度を最大に評価し,約0.83のエリアアンダーROC曲線(AUROC)に達した。
この軌道レベルの構造を動機として,PW-OPSD(Pight-Weighted On-Policy Self-Distillation)を提案する。
AIME 2024 と AIME 2025 Avg@12 を +1.0 と +1.1 で改善し、DeepSeek-R1-Distill-Llama-8B と Olmo-3-7B-Think の2つの大モデルに対する一般化評価を行った。
これらの結果から, 蒸留の推理における教師の信頼度は, トラジェクティブ構造であり, 追加の教師計算を使わずに利用できることが示唆された。
関連論文リスト
- Tailoring Teaching to Aptitude: Direction-Adaptive Self-Distillation for LLM Reasoning [41.384652481442735]
我々は,一様教師模倣からエントロピー制御された指向性監視へと特権的な自己蒸留を再構成するtextbfDirection-Adaptive Self-Distillation (textbfDASD)を提案する。
6つの数学的推論ベンチマークで、DASDは強力なRLVRと自己蒸留ベースラインよりも優れたマクロAvg@16を達成する。
論文 参考訳(メタデータ) (2026-05-21T10:07:46Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z) - Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning [43.9367673156851]
オンライン自己蒸留は、教師が密集したトークンレベルの監督を提供する間、独自のロールアウトで推論モデルを訓練する。
トークンレベルの更新を3つの信号で統一するEGRSD(Entropy-Guided Reinforced Self-Distillation)を提案する。
CL-EGRSDは、持続する高エントロピースパンと過渡的な高エントロピー位置を区別する因果関係の変種である。
論文 参考訳(メタデータ) (2026-05-13T09:38:20Z) - Teacher-Guided Policy Optimization for LLM Distillation [90.49982387646861]
Teacher-Guided Policy Optimization (TGPO) は、生徒のロールアウトに条件付き教師予測を活用することで、高密度な方向性誘導を取り入れたオンラインアルゴリズムである。
複雑な推論ベンチマークの実験では、TGPOは標準ベースラインを著しく上回り、異なる教師にとって堅牢であることが示されている。
論文 参考訳(メタデータ) (2026-05-13T09:20:03Z) - OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning [19.98950359294245]
本研究は,教師の特権分布を自己の自給自足軌道に沿って蒸留することにより,言語モデルによる推論能力の向上を図ることを目的とする。
OPSDの性能向上にもかかわらず,教師と生徒の反応のミスマッチがよく見過ごされがちである。
論文 参考訳(メタデータ) (2026-05-12T17:00:53Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z) - Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning [66.52232008796294]
Prune-OPDはトレーニング予算と監督品質を動的に調整する。
トレーニング時間を37.6%減らし-68.0%削減すると同時に、しばしば改善され、挑戦的なベンチマークのパフォーマンスが向上する。
論文 参考訳(メタデータ) (2026-05-08T14:38:53Z) - Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization [18.027254451537342]
既存の自己蒸留法は、文脈拡張型教師モデルに向けた学習をKLマッチングに大きく還元する。
textbfPreference-textbfBased textbfSelf-textbfDistillation (textbfPBSD)を提案する。
論文 参考訳(メタデータ) (2026-05-06T15:31:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。