論文の概要: Adaptive Supervised Anchoring for On-Policy Self-Distillation
- arxiv url: http://arxiv.org/abs/2608.07935v2
- Date: Tue, 11 Aug 2026 08:28:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 16:08:30.52442
- Title: Adaptive Supervised Anchoring for On-Policy Self-Distillation
- Title(参考訳): オンデマンド自己蒸留における適応的監視アンカリング
- Abstract要約: オンライン自己蒸留は、学生から採取した軌道上の凍結教師からの指導を蒸留することにより、言語モデルに適応する。
本研究は,学生が目標軌跡から遠ざかると,教師の目標外接頭辞の条件がタスク関連監督を著しく弱めることを示す。
本稿では,2つの補完的な指導経路を分離する統合トレーニングフレームワークを提案する。
- 参考スコア(独自算出の注目度): 15.445625053566244
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy self-distillation (OPSD) adapts a language model by distilling guidance from a frozen teacher on trajectories sampled from the student. Its effectiveness, however, depends critically on the quality of those trajectories. We show that when student rollouts drift from target trajectories, conditioning the teacher on off-target prefixes substantially weakens its task-relevant supervision. Controlled prefix-corruption experiments expose this failure mode, which we term rollout-conditioned signal degradation. To address this problem, we propose a unified training framework that separates two complementary supervision pathways. The first retains rollout-conditioned distribution matching, providing guidance on states the student actually visits. The second applies supervised cross-entropy on canonical ground-truth contexts, avoiding the incompatibility of imposing target tokens on erroneous rollout prefixes. Token-level rollout-target alignment is used to adapt the strength of the canonical-context anchor, emphasizing it during cold start and relaxing it as rollout quality improves. Experiments across multiple model scales, two task families, and general-reasoning benchmarks show that the proposed approach improves task acquisition over OPSD while preserving general capabilities, resulting in a more favorable empirical plasticity-stability trade-off. These findings identify context quality as a central bottleneck in on-policy self-distillation and demonstrate the value of separating rollout-conditioned guidance from canonical supervision.
- Abstract(参考訳): On-policy Self-distillation (OPSD) は、学生から採取した軌道上の凍結教師の指導を蒸留することにより、言語モデルに適応する。
しかし、その効果はこれらの軌道の質に大きく依存する。
本研究は,学生が目標軌跡から遠ざかると,教師の目標外接頭辞の条件がタスク関連監督を著しく弱めることを示す。
制御されたプレフィックス破壊実験は、この障害モードを公開し、ロールアウト条件付き信号劣化と呼ぶ。
この問題に対処するために,2つの補完的な指導経路を分離する統合トレーニングフレームワークを提案する。
1つ目はロールアウト条件付き配布マッチングを保持し、学生が実際に訪れている状態に関するガイダンスを提供する。
第二に、教師付きクロスエントロピーを標準的接地真実の文脈に適用し、不正なロールアウトプレフィックスにターゲットトークンを挿入する非互換性を回避する。
トークンレベルのロールアウトターゲットアライメントは、標準コンテキストアンカーの強度に適応するために使用され、冷間開始時にそれを強調し、ロールアウト品質が向上するにつれて緩和する。
複数のモデルスケール、2つのタスクファミリ、一般推論ベンチマークによる実験により、提案手法は汎用性を保ちながらOPSDによるタスク獲得を改善し、より好ましい経験的可塑性-安定性トレードオフをもたらすことが示された。
これらの結果から, 環境の質は, 政治的自己蒸留における中心的なボトルネックとして認識され, ロールアウト条件付きガイダンスを標準監督から分離する価値が示された。
関連論文リスト
- Purified OPSD: On-Policy Self-Distillation Without Losing How to Think [52.879387744920415]
オンライン自己蒸留(OPSD)は長いチェーン・オブ・ソート(Long-CoT)推論モデルでは一貫して失敗する。
まず,教師が指導信号の非伝達可能成分を分離するために,参照のみの教師を構築する。
第2に、この残差をよく形成されたPMIターゲット分布に変換するメカニズムとして、ポイントワイズ相互情報(PMI)を用いる。
論文 参考訳(メタデータ) (2026-07-02T14:33:07Z) - Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation [60.55792673956761]
我々は, ルブリックを構造化, きめ細かいフィードバックとして組み込んだフレームワークであるtextbfRubric-Conditioned Self-Distillationを提案する。
その結果, ルーリック条件の自己蒸留は, ルーリックレベルの基準をトークンレベルのガイダンスに効果的に変換することを示した。
論文 参考訳(メタデータ) (2026-06-17T17:54:04Z) - HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation [50.53459634301361]
HEROは、次の環境観測を局所的に整列したフィードバックとして利用する、後向きの自己蒸留フレームワークである。
HEROはタスク成功を改善し、環境フィードバックのみの自己蒸留とGRPOに対する不要なターンを減らす。
論文 参考訳(メタデータ) (2026-06-10T01:35:34Z) - When In-Distribution Gains Fail: Evaluating Weak-to-Strong Reward Models under Preference Shift [72.0686608132772]
ゼロショット分布シフト下でのW2S選好学習について検討した。
弱い選好ラベルで訓練された強い学生は、選好データセットを移動できなくとも、流通に成功していることがわかった。
本稿では、事前訓練された強モデルの表現空間からの過剰なドリフトを制約する単純で効果的な正規化器であるRepresentation Anchoring(Anchor)を提案する。
論文 参考訳(メタデータ) (2026-05-25T09:30:49Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z) - OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning [19.98950359294245]
本研究は,教師の特権分布を自己の自給自足軌道に沿って蒸留することにより,言語モデルによる推論能力の向上を図ることを目的とする。
OPSDの性能向上にもかかわらず,教師と生徒の反応のミスマッチがよく見過ごされがちである。
論文 参考訳(メタデータ) (2026-05-12T17:00:53Z) - The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation [67.26315138466312]
モデルロールアウトから経験的信頼性を推定するキャリブレーション対応のOPDフレームワークであるCaOPDを提案する。
本研究は, 能力蒸留が信頼性を示唆するものではないこと, 信頼性をポストトレーニングの本質的な目的として扱うべきであることを明らかにする。
論文 参考訳(メタデータ) (2026-04-18T04:43:40Z) - SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting [17.504616835765617]
両経路適応型学習フレームワークを提案する。
SCOPEは、Avg@32で11.42%、Pass@32で7.30%の平均相対的な改善を実現している。
論文 参考訳(メタデータ) (2026-04-12T15:26:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。