論文の概要: Beyond the Best Teacher: Expanding and Compressing the Reasoning Solution Manifold
- arxiv url: http://arxiv.org/abs/2607.27770v1
- Date: Thu, 30 Jul 2026 07:05:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.4303
- Title: Beyond the Best Teacher: Expanding and Compressing the Reasoning Solution Manifold
- Title(参考訳): 最高の教師を超えて:推論ソリューションを拡大し、圧縮する
- Authors: Songshuo Lu, Zhi Chen, Yaohua Tang,
- Abstract要約: 我々は、強化学習ポリシーをマルチベース推論解多様体の局所的なプローブと見なすべきであると主張する。
本稿では,教師が多教師政策の蒸留で構築する拡張型圧縮フレームワークを提案する。
- 参考スコア(独自算出の注目度): 4.090731563364332
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: A single reinforcement-learning run can produce a strong reasoner yet an incomplete teacher: it often amplifies only a subset of the valid solution modes. We argue that reinforcement learning (RL)-trained policies should therefore be viewed as local probes of a multi-basin reasoning solution manifold, rather than as globally reliable supervisors. Based on this view, we propose an expand-then-compress framework that couples teacher construction with multi-teacher policy distillation. In the expansion stage, Residual Group Relative Policy Optimization (RGRPO) trains a sequence of teachers from a common initialization and redirects each later round toward examples not yet covered by the accumulated teacher union. In the compression stage, reliability-gated Teacher-Union On-policy Distillation (TU-OPD) lets the student learn from its own response prefixes. For each example, only reliable teachers contribute, and their sampled-token OPD losses are weighted by their per-example quality. We further introduce Consensus-Residual Decomposition, which preserves a winner teacher's excess token preferences over its reliable peers, preventing specialist behavior from being suppressed during teacher aggregation. Experiments on mathematical reasoning, code generation, and instruction following show that the resulting Qwen3-1.7B student consistently outperforms the strongest individual teacher across all three domains, yielding relative improvements of 2.0%, 8.3%, and 6.9%, respectively, while retaining single-model inference. These results establish a simple but powerful principle: stronger students can be obtained not by selecting a single better teacher, but by deliberately constructing and compressing a complementary teacher union.
- Abstract(参考訳): 単一の強化学習実行は、強力な推論を生成できるが、不完全な教師を生み出す。
したがって、強化学習(RL)によって訓練されたポリシーは、グローバルに信頼できる監督者としてではなく、マルチベース推論解多様体の局所的なプローブと見なされるべきである。
この観点から,教師が多教師政策蒸留を併用する拡張型圧縮フレームワークを提案する。
拡張段階において、Residual Group Relative Policy Optimization (RGRPO)は、共通の初期化から教師の連続を訓練し、蓄積された教師組合がまだカバーしていない例に向けて、各後期ラウンドをリダイレクトする。
圧縮段階では、信頼性を付与した教師-市民オン・ポリティィ蒸留(TU-OPD)により、生徒は自身の応答プレフィックスから学習することができる。
それぞれの例において、信頼できる教師のみが貢献し、サンプルトーケンのPD損失は、サンプルごとの品質によって重み付けされる。
さらに,教師の信頼度が高い友人に対するトークンの過剰な嗜好を保ち,教師の集合中に専門家の行動が抑制されるのを防ぐConsensus-Residual Decompositionを紹介した。
Qwen3-1.7Bの学生は3つの領域で、それぞれ2.0%、8.3%、および6.9%の相対的な改善を達成し、シングルモデル推論を維持している。
これらの結果は、より優れた教師を選ぶのではなく、補完的な教師組合を意図的に構築し、圧縮することによって、より強力な学生が得られるという、シンプルで強力な原則を確立している。
関連論文リスト
- Weak-to-Strong On-Policy Distillation [41.42511447546225]
Weak-to-Strong On-Policy Distillation (W2S-OPD)を導入した。
4つの数学と3つのコードベンチマークで、W2S-OPDはOPDを上回り、学生がドメイン教師を超越し、監督源が弱くなっても改善を続けることができる。
論文 参考訳(メタデータ) (2026-07-28T20:31:48Z) - OPOD: On-Policy Omni Distillation [55.440058537827134]
プール化されたマルチモーダルデータ上で単一のモデルをトレーニングすることは、個々のモダリティに特化したモデルにマッチしないことが多い。
本報告では,オムニ蒸留法(Omni Distillation,OPD)について述べる。
OPDは各スケールで最高のスコアを獲得し、70.8、51.7、46.2に達した。
論文 参考訳(メタデータ) (2026-07-23T04:55:04Z) - Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients [89.89504265663057]
近親政策最適化ゾーン(ZPPO)は、ヴィゴツキーの近親開発ゾーンに触発されたものである。
ZPPOは1つの正しい教師の反応と1つの間違った学生の反応を、生徒が識別しなければならない匿名候補としてペアリングする。
プロンプト再生バッファは、生徒の平均ロールアウト精度が半分に達するか、FIFOが削除されるまで、各難問を再循環する。
論文 参考訳(メタデータ) (2026-06-16T17:46:02Z) - On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents [50.78688247330029]
オン・ポリシィ蒸留(On-Policy Distillation、OPD)は、小規模の学生にその能力を伝達するための自然なレシピである。
本稿では,教師と生徒が生成するターンを各ロールアウトに混在させるシンプルなアルゴリズムであるGuided-OPD(Guided-OPD)を提案する。
Guided-OPDは、平均してバニラOPDよりも21.1%、成功率25.5%向上している。
論文 参考訳(メタデータ) (2026-06-14T16:41:45Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z) - Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation [57.524909883706556]
オンライン蒸留(OPD)は、学生のパフォーマンス向上に強い経験的利益をもたらしている。
この研究は、フレキシブルな参照モデルと報酬項の相対重みをKL正規化に対して制御する報酬スケーリング係数を導入している。
特に、同じ学生モデルにドメイン固有RLを適用して得られた異なるドメインエキスパートの知識をマージする環境では、ExOPDは生徒が教師のパフォーマンス境界を越えられるようにします。
論文 参考訳(メタデータ) (2026-02-12T16:14:29Z) - Merge-of-Thought Distillation [23.53356244978525]
マージ・オブ・ソート蒸留(Merge-of-Thought Distillation、MoT)は、教師固有の教師付き微調整ブランチと、結果として生じる生徒の変種をマージする重み空間を代替する軽量フレームワークである。
競合数学のベンチマークでは、Qwen3-14Bの学生にMoTを適用すると、Deepseek-R1、Qwen3-32B、OpenAI-O1といった強力なモデルを超える。
MoTは、最高の単教師蒸留よりも優れており、数学以外の一般的な推論を改善し、分散シフトとピアレベルの教師に対して堅牢性を示している。
論文 参考訳(メタデータ) (2025-09-10T17:46:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。