論文の概要: Learning to Revise Reasoning with Segment-wise On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2610.02703v1
- Date: Fri, 02 Oct 2026 02:40:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.168499
- Title: Learning to Revise Reasoning with Segment-wise On-Policy Distillation
- Title(参考訳): セグメンションワイズオン・ポリシィ蒸留による推論の修正
- Abstract要約: オンライン蒸留は、教師から密集したトークン・ワイド・インフォメーションで生徒を自身のロールアウトで訓練することで、大きな言語モデル推論を改善する。
そこで我々は,不確実性尺度に基づいて学生セグメントを選択し,それに対応する教師の再教育を行うセグメンション・ワイド・オン・ポリシィ蒸留(Seg-OPD)を提案する。
数学的推論と競争的プログラミングタスクの実験は、Seg-OPDを訓練した学生がベースラインよりも高いリビジョン成功率を達成することを示している。
- 参考スコア(独自算出の注目度): 10.15202680899589
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy distillation (OPD) improves large language model reasoning by training students on their own rollouts with dense token-wise supervision from the teacher. However, token-wise OPD does not explicitly provide a coherent alternative reasoning step showing how the student's step could be revised to improve subsequent reasoning. Furthermore, this paradigm can become less effective when the student produces a degenerate reasoning prefix, as subsequent teacher supervision remains conditioned on that prefix and may reinforce poor reasoning patterns. In this work, we focus on learning reasoning revision with segment-wise OPD to rework intermediate reasoning steps and better support subsequent reasoning. Through controlled reasoning interventions, we find that replacing student segments with teacher redrafts improves subsequent reasoning accuracy. Therefore, we address the problem of turning teacher redrafts into explicit supervision for learning to revise reasoning. We propose Segment-wise On-Policy Distillation (Seg-OPD), which selects student segments based on an uncertainty metric and obtains corresponding teacher redrafts. Seg-OPD trains the student to prefer teacher redrafts over their paired student segments while retaining dense token-wise OPD supervision. Extensive experiments on mathematical reasoning and competitive programming tasks show that Seg-OPD-trained students achieve higher revision success rates than baselines. Seg-OPD consistently outperforms the compared state-of-the-art baselines in reasoning accuracy with an average relative improvement of 5.22% across diverse models and tasks. Code is available at https://anonymous.4open.science/r/Seg-OPD.
- Abstract(参考訳): オンライン蒸留(OPD)は、教師から密集したトークン・ワイド・インフォメーションで学生を自身のロールアウトで訓練することで、大きな言語モデル推論を改善する。
しかし、トークン単位のOPDは、学生のステップをどのように修正してその後の推論を改善するかを示す、一貫性のある代替推論ステップを明示的に提供していない。
さらに、このパラダイムは、学生が退行推論プレフィックスを生成すると効果が低下し、その後の教師監督がそのプレフィックスに条件付きのままであり、貧弱な推論パターンを補強する可能性がある。
本研究は,中間的推論ステップを再構築し,その後の推論を支援するために,セグメントワイズOPDによる推論リビジョンの学習に重点を置いている。
制御された推論の介入により、学生セグメントを教師の再描画に置き換えることで、その後の推論精度が向上することがわかった。
そこで本研究では,教師の再学習を明示的な指導に転換し,推論を改訂する問題に対処する。
そこで我々は,不確実性尺度に基づいて学生セグメントを選択し,それに対応する教師の再教育を行うセグメンション・ワイド・オン・ポリシィ蒸留(Seg-OPD)を提案する。
Seg-OPDは、密集したトークン単位のPD監督を維持しながら、ペアの学生セグメントよりも教師のリラフトを好むように学生に訓練する。
数学推論と競合プログラミングタスクに関する大規模な実験により、Seg-OPDを訓練した学生はベースラインよりも高いリビジョン成功率を達成することが示された。
Seg-OPDは、様々なモデルやタスクの平均相対的改善率5.22%と、比較した最先端のベースラインを一貫して上回っている。
コードはhttps://anonymous.4open.science/r/Seg-OPDで公開されている。
関連論文リスト
- Is Better Teacher Supervision Enough? Unlocking Student-side Learning in Multimodal On-Policy Distillation [38.496745535296945]
オンライン蒸留(OPD)は、学生自身の軌道上の教師からトークンレベルの監督を提供することにより、推論を改善する。
S-OPDは,学生の知覚学習を明示的に強化するシンプルなマルチモーダルオンライン蒸留フレームワークである。
我々のメソッドは既存のOPDフレームワークにシームレスにプラグインすることができ、追加のデータアノテーション、モデルパラメータ、推論操作を必要としない。
論文 参考訳(メタデータ) (2026-09-30T06:55:48Z) - TeacherGRPO: Closing the Capacity Gap in Reasoning Distillation via Teacher Alignment [70.40748464576045]
強力な教師モデルから小さな学生への蒸留はギャップカースに面している。
教師がより高度に成長するにつれて、複雑な分布は生徒が近似できるものから多様化し、パフォーマンスが低下する。
本研究では,教師がデータを捨てたり,推論品質を劣化させたりすることなく,直接生徒の分布に適応する教師アライメントを提案する。
論文 参考訳(メタデータ) (2026-09-27T10:13:54Z) - Dense Is Not Enough: Hierarchical Supervision Allocation for Long-Horizon On-Policy Distillation [18.000801125017357]
生産的なガイダンスは将来のユーティリティと現在の学習可能性の交差点にあると我々は主張する。
本稿では,LENS-OPDを提案する。LENS-OPDは,ロケート,リファイン,内在化による監視を組織する粗大なフレームワークである。
以上の結果から, 有効長期蒸留には, 適切な深さ, 正しい決定, 正しいトークンの指導が必要であることが示唆された。
論文 参考訳(メタデータ) (2026-09-27T09:44:55Z) - Teacher Should Think Ahead: Adaptive Continuations for Reliable On-Policy Distillation [29.726128117466956]
不完全または低品質の学生接頭辞を条件にした場合,教師の指導は信頼できないことを示す。
本稿では,教師の継続を伴って学生のロールアウトに伴う情報伝達状態を増強する適応継続オン・ポリティ蒸留(AC-OPD)を提案する。
論文 参考訳(メタデータ) (2026-09-06T07:08:41Z) - SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning [54.402550664505576]
オンライン蒸留(OPD)は、より強力な教師モデルから短文の学生に推論能力を伝達する有望な方法を提供する。
長文推論モデル SU-01 から短文学習者モデルへの証明推論能力の移譲により,この設定について検討する。
Qwen3, Qwen3.5, Intern-S2, GLM-4.7, Gemma-4を含む同族および異族の両方の実験は、数学的推論において一貫した利得を示している。
論文 参考訳(メタデータ) (2026-08-14T12:57:02Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z) - Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning [66.52232008796294]
Prune-OPDはトレーニング予算と監督品質を動的に調整する。
トレーニング時間を37.6%減らし-68.0%削減すると同時に、しばしば改善され、挑戦的なベンチマークのパフォーマンスが向上する。
論文 参考訳(メタデータ) (2026-05-08T14:38:53Z) - Long-Chain Reasoning Distillation via Adaptive Prefix Alignment [57.130176131042965]
本稿では,教師のCoTを適応的接頭辞アライメントによる蒸留に活用するフレームワークを提案する。
P-ALIGNは、残りの接尾辞が簡潔かどうかを判断することで、教師生成の推論軌道を適応的に切り離す。
複数の数学的推論ベンチマークの実験では、P-ALIGNはすべてのベースラインを3%以上上回っている。
論文 参考訳(メタデータ) (2026-01-15T04:40:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。