論文の概要: Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models
- arxiv url: http://arxiv.org/abs/2608.16647v2
- Date: Sun, 23 Aug 2026 15:08:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 18:24:36.8851
- Title: Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models
- Title(参考訳): すべてのコインには2つの側面がある:大規模言語モデルのオンライン蒸留における一般化の双対性について
- Abstract要約: オンライン蒸留は、生徒自身の方針からサンプリングされた軌跡を監督することによって、教師の能力を伝達する。
OPDは,特定の問題に対する回答よりも,教師の推論行動を伝達することがわかった。
- 参考スコア(独自算出の注目度): 68.52262705081098
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy distillation (OPD) transfers teacher capabilities by supervising trajectories sampled from the student's own policy, yet its generalization behavior remains poorly understood, as most studies evaluate OPD on a single domain and on benchmarks close to the training data. We present a controlled study that varies one generalization factor at a time, from in-domain distribution shifts to cross-domain transfer and the multi-teacher setting. We find that OPD transfers a teacher's reasoning behavior rather than its answers to particular problems: training difficulty barely matters, and even problems the teacher never solves are useful. Transfer depends strongly on the origin relationship between teacher and student: same-origin pairs bring the student close to the teacher across languages, reasoning horizons, and even other domains, whereas cross-origin pairs mostly fit the trained distribution. This broad reach is a double-edged sword: since routing prompts to domain experts cannot confine each teacher's influence, combining them yields a mixture-dependent seesaw among their capabilities. These results clarify when OPD generalizes and offer a useful perspective for diagnosing multi-teacher OPD.
- Abstract(参考訳): オンライン蒸留(OPD)は、学生自身の方針からサンプリングされた軌跡を監督することによって教師の能力を伝達するが、ほとんどの研究は単一ドメインとトレーニングデータに近いベンチマークでOPDを評価するため、その一般化行動は理解されていない。
本稿では,ドメイン内分布シフトからクロスドメイン転送,マルチ教師設定に至るまで,1つの一般化係数を一度に変化させる制御された研究を提案する。
OPDは,教師の推論行動から,特定の問題への回答よりも,学習の困難さや,教師が解決しない問題までも,教師の推論行動を伝達する。
転校は教師と生徒の原点関係に強く依存しており、同じオリジンペアは生徒を言語、推論地平線、さらには他の領域に近づけるが、クロスオリジンペアは主として訓練された分布に適合する。
この広い範囲は二重刃の剣であり、ドメインの専門家へのルーティングプロンプトは各教師の影響を抑えることはできないため、それらを組み合わせることで、その能力の中で混合依存のシーソーが得られる。
これらの結果から,OPDが一般化し,多教師OPDの診断に有用な視点が得られた。
関連論文リスト
- Beyond the Best Teacher: Expanding and Compressing the Reasoning Solution Manifold [4.090731563364332]
我々は、強化学習ポリシーをマルチベース推論解多様体の局所的なプローブと見なすべきであると主張する。
本稿では,教師が多教師政策の蒸留で構築する拡張型圧縮フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-30T07:05:37Z) - OPOD: On-Policy Omni Distillation [55.440058537827134]
プール化されたマルチモーダルデータ上で単一のモデルをトレーニングすることは、個々のモダリティに特化したモデルにマッチしないことが多い。
本報告では,オムニ蒸留法(Omni Distillation,OPD)について述べる。
OPDは各スケールで最高のスコアを獲得し、70.8、51.7、46.2に達した。
論文 参考訳(メタデータ) (2026-07-23T04:55:04Z) - DemoPSD: Disagreement-Modulated Policy Self-Distillation [49.30809363804017]
大規模言語モデルを訓練するための実践的な方法として、オンデマンド自己蒸留が登場している。
DemoPSDは、教師と生徒の分布の重み付けされた幾何学的組み合わせに向けて学生を操縦する。
論文 参考訳(メタデータ) (2026-07-02T17:58:29Z) - H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation [31.41588745047352]
H-OPDはマルチモーダル推論のための信頼度を考慮したヘテロジニアスマルチテラーPDフレームワークとして提案されている。
同じ推論プロセスで異種教員の相補性を検証することにより、H-OPDはタスクやサンプルレベルの教師ルーティングを置き換える。
H-OPDは、テキストのみの教師が重要な視覚的意味論にアクセスできるようにするために、視覚から言語への記述転送を利用する。
論文 参考訳(メタデータ) (2026-07-01T07:37:10Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z) - Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation [57.524909883706556]
オンライン蒸留(OPD)は、学生のパフォーマンス向上に強い経験的利益をもたらしている。
この研究は、フレキシブルな参照モデルと報酬項の相対重みをKL正規化に対して制御する報酬スケーリング係数を導入している。
特に、同じ学生モデルにドメイン固有RLを適用して得られた異なるドメインエキスパートの知識をマージする環境では、ExOPDは生徒が教師のパフォーマンス境界を越えられるようにします。
論文 参考訳(メタデータ) (2026-02-12T16:14:29Z) - "The Whole Is Greater Than the Sum of Its Parts": A Compatibility-Aware Multi-Teacher CoT Distillation Framework [16.96094045628127]
CoT(Chain-of-Thought)推論は、大きな言語モデル(LLM)に優れた能力を与えるが、通常は禁止的なパラメータスケールを必要とする。
CoT蒸留は、推論技術をコンパクトな学生モデル(SLM)に伝達するための有望なパラダイムとして登場した。
我々は,教師の勾配を動的に重み付けすることで,教師の指導を適応的に融合させるフレームワークCompactを紹介する。
論文 参考訳(メタデータ) (2026-01-20T14:05:19Z) - Distilling Reasoning into Student LLMs: Local Naturalness for Selecting Teacher Data [18.97748910748554]
そこで本研究では,局所自然度(Local Naturalness)について紹介する。
多くの教師の回答を混ぜ合わせると、Local Naturalnessは32Bの学生の数学のベンチマークの精度を、グローバルセレクションよりも9.4pp向上させる。
これらの結果は, ローカライズされたデータ品質評価とデータ混合により, より効果的に蒸留できることを示すものである。
論文 参考訳(メタデータ) (2025-10-05T01:15:32Z) - Merge-of-Thought Distillation [23.53356244978525]
マージ・オブ・ソート蒸留(Merge-of-Thought Distillation、MoT)は、教師固有の教師付き微調整ブランチと、結果として生じる生徒の変種をマージする重み空間を代替する軽量フレームワークである。
競合数学のベンチマークでは、Qwen3-14Bの学生にMoTを適用すると、Deepseek-R1、Qwen3-32B、OpenAI-O1といった強力なモデルを超える。
MoTは、最高の単教師蒸留よりも優れており、数学以外の一般的な推論を改善し、分散シフトとピアレベルの教師に対して堅牢性を示している。
論文 参考訳(メタデータ) (2025-09-10T17:46:57Z) - Learning from Diverse Reasoning Paths with Routing and Collaboration [65.77515749498575]
経路品質フィルタリング,条件付きルーティング,ピアラーニングを組み合わせたQR-Distill(Quality-filtered Routing with Cooperative Distillation)を提案する。
従来のシングルパス蒸留法やマルチパス蒸留法よりもQR-ディスティルが優れていることを示す実験がある。
論文 参考訳(メタデータ) (2025-08-23T01:15:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。