論文の概要: Rethinking Privileged Information in On-Policy Self-Distillation
- arxiv url: http://arxiv.org/abs/2608.18271v1
- Date: Tue, 18 Aug 2026 19:42:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.198034
- Title: Rethinking Privileged Information in On-Policy Self-Distillation
- Title(参考訳): オンデマンド自己蒸留におけるプリビリード情報の再考
- Abstract要約: On-policy Self-distillation (OPSD)は、特権的参照情報に基づく同じモデルからトークンレベルの監督を使用して、学生に独自の反応を訓練する。
本研究は,OPSDによる性能向上が,学習者が参照中の情報を学習したことを示すか,あるいはベースモデルにすでに存在する推論行動の回復を反映しているかを検討する。
- 参考スコア(独自算出の注目度): 45.88028371034407
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy self-distillation (OPSD) trains a student on its own responses using token-level supervision from the same model conditioned on privileged reference information. We investigate whether performance gains from OPSD show that the student learned the information in the reference or instead reflect recovery of reasoning behavior already present in the base model. We perform OPSD experiments on science and mathematics datasets using Qwen3 models ranging from 1.7B to 8B. Our analysis framework separates the supervision induced by the reference from the supervision provided by the teacher without the reference and measures how each aligns with changes in the student's predictions. The correct reference does not provide a consistent performance benefit across teacher generation modes, model sizes, and training datasets. Students can improve without the correct reference, and a solution from another problem can outperform the correct solution on several mathematical reasoning benchmarks. The student's predictions align more strongly with the base model's thinking behavior than with the supervision induced by the reference, but controls constructed from other problems reproduce much of both alignments. Moreover, stronger alignment attributable to the correct reference does not reliably coincide with a greater performance benefit from the reference. Performance gains and distributional alignment alone therefore cannot determine how privileged reference information contributes to student learning in OPSD.
- Abstract(参考訳): On-policy Self-distillation (OPSD)は、特権的参照情報に基づく同じモデルからトークンレベルの監督を使用して、学生に独自の反応を訓練する。
本研究は,OPSDによる性能向上が,学習者が参照中の情報を学習したことを示すか,あるいはベースモデルにすでに存在する推論行動の回復を反映しているかを検討する。
我々は1.7Bから8BまでのQwen3モデルを用いて科学と数学のデータセット上でOPSD実験を行う。
分析フレームワークは,教師が指導する指導と,教師が指導する指導とを分離し,生徒の予測の変化とどのように一致しているかを計測する。
正しい参照は、教師生成モード、モデルサイズ、トレーニングデータセット間で一貫したパフォーマンス上のメリットを提供しない。
生徒は正しい基準なしで改善できるし、別の問題からの解はいくつかの数学的推論ベンチマークで正しい解より優れている。
学生の予測は、基準によって誘導される監督よりも基礎モデルの思考行動に強く一致するが、他の問題から構築された制御は、両方のアライメントの多くを再現する。
さらに、正しい参照に起因する強いアライメントは、参照によるパフォーマンス上のメリットと確実に一致しない。
したがって、性能向上と分布的アライメントだけでは、OPSDにおける生徒の学習にどの程度の特権的参照情報が寄与するかは決定できない。
関連論文リスト
- ADOPD: Reference-Privileged On-Policy Distillation for MLLM-Based Industrial Anomaly Detection [15.5664235470661]
産業的異常検出には、正常な視覚パターンから微細な偏差を識別する必要がある。
トレーニング中の参照へのアクセスは、参照対応の教師がクエリのみの学生を監督することを可能にする。
そこで我々は, 基準民営型オンライン蒸留フレームワークであるADOPDを提案する。
論文 参考訳(メタデータ) (2026-08-10T16:12:39Z) - Is More Privileged Information Better? From Solution Traces to Problem-Solving Structure in Self-Distilled Reasoning [17.645367206348222]
オンライン自己蒸留は、参照ソリューションに条件付けられたモデルの特権ビューを使用して、質問のみを観察する学生の視点を監督することにより、推論を改善する。
本稿では,初期状態,目標条件,制約条件,選択された状態遷移経路を記述したトラジェクトリ・グラウンドのガイダンスで,完全な解法を置き換えた問題空間誘導OPSD(PS-OPSD)を提案する。
論文 参考訳(メタデータ) (2026-08-03T01:47:25Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - Purified OPSD: On-Policy Self-Distillation Without Losing How to Think [52.879387744920415]
オンライン自己蒸留(OPSD)は長いチェーン・オブ・ソート(Long-CoT)推論モデルでは一貫して失敗する。
まず,教師が指導信号の非伝達可能成分を分離するために,参照のみの教師を構築する。
第2に、この残差をよく形成されたPMIターゲット分布に変換するメカニズムとして、ポイントワイズ相互情報(PMI)を用いる。
論文 参考訳(メタデータ) (2026-07-02T14:33:07Z) - Teach-to-Reason: Competition-Guided Reasoning with a Self-Improving Teacher [18.162030833167385]
胸部X線視覚質問応答(CXR VQA)は、正しい回答を予測するだけでなく、信頼できる医学的推論を生成するためにモデルを必要とする。
CoT最適化に比較に基づく監視を導入するフレームワークであるtext-to-Reason (T2R)を提案する。
論文 参考訳(メタデータ) (2026-06-24T05:07:41Z) - Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation [60.55792673956761]
我々は, ルブリックを構造化, きめ細かいフィードバックとして組み込んだフレームワークであるtextbfRubric-Conditioned Self-Distillationを提案する。
その結果, ルーリック条件の自己蒸留は, ルーリックレベルの基準をトークンレベルのガイダンスに効果的に変換することを示した。
論文 参考訳(メタデータ) (2026-06-17T17:54:04Z) - AVSD: Adaptive-View Self-Distillation by Balancing Consensus and Teacher-Specific Privileged Signals [65.71225905458182]
自己蒸留は、生徒と教師の両方と同じモデルを用いて、言語モデルが自身の軌道から政治学を学ぶことを可能にする。
このセットアップは、別の外部モデルに頼ることなく、密集したトークンレベルのフィードバックを提供する。
複数の特権情報ビューを持つ自己蒸留法であるAVSDを紹介する。
論文 参考訳(メタデータ) (2026-05-20T03:06:36Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z) - Teacher-Guided Policy Optimization for LLM Distillation [90.49982387646861]
Teacher-Guided Policy Optimization (TGPO) は、生徒のロールアウトに条件付き教師予測を活用することで、高密度な方向性誘導を取り入れたオンラインアルゴリズムである。
複雑な推論ベンチマークの実験では、TGPOは標準ベースラインを著しく上回り、異なる教師にとって堅牢であることが示されている。
論文 参考訳(メタデータ) (2026-05-13T09:20:03Z) - OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning [19.98950359294245]
本研究は,教師の特権分布を自己の自給自足軌道に沿って蒸留することにより,言語モデルによる推論能力の向上を図ることを目的とする。
OPSDの性能向上にもかかわらず,教師と生徒の反応のミスマッチがよく見過ごされがちである。
論文 参考訳(メタデータ) (2026-05-12T17:00:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。