論文の概要: H$^2$SD: Hybrid Hindsight Self-Distillation
- arxiv url: http://arxiv.org/abs/2607.18955v4
- Date: Mon, 27 Jul 2026 08:18:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 14:56:47.011086
- Title: H$^2$SD: Hybrid Hindsight Self-Distillation
- Title(参考訳): H$^2$SD:ハイブリッドハイビジョン自己蒸留
- Authors: Qiye Cai, Yichuan Ma, Peiji Li, Yongkang Chen, Qipeng Guo, Yicheng Zou, Linyang Li, Xiaocheng Feng, Bing Qin,
- Abstract要約: 検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
- 参考スコア(独自算出の注目度): 61.71131241473028
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) provides reliable outcome supervision for language model reasoning, but a scalar trajectory reward offers limited token-level guidance. Existing self-distillation methods add a privileged teacher but typically assign it a fixed role: direct distribution matching may destabilize successful behavior, while magnitude-only modulation offers little corrective guidance after failure. We observe that successful and failed trajectories require different forms of hindsight supervision. A successful response already contains a valid student-generated reasoning path and can therefore serve as privileged context rather than being replaced by an external rationale. A failed response, however, requires corrective reference information. We introduce Hybrid Hindsight Self-Distillation ($\mathrm{H}^{2}\mathrm{SD}$), which jointly adapts teacher context and update strategy to trajectory correctness. For successful trajectories, we construct the teacher context from the verified response and a rephrasing instruction, and use the teacher only to re-evaluate the original response tokens. The resulting probabilities refine token credit assignment without changing the direction determined by the reward. For failed trajectories, a verified reference hint provides corrective guidance through reverse-KL distillation. Experiments on challenging reasoning benchmarks show that H$^2$SD achieves the strongest overall performance among representative RLVR and self-distillation baselines, with stable optimization and a favorable accuracy-efficiency trade-off.
- Abstract(参考訳): 検証可能な報酬付き強化学習(RLVR)は、言語モデル推論の信頼性の高い結果管理を提供するが、スカラー軌道報酬はトークンレベルのガイダンスに制限を与える。
既存の自己蒸留法は特権的な教師を付加するが、通常はそれを固定的な役割に割り当てる: 直接分布マッチングは、成功した振る舞いを不安定にするが、マグニチュードのみの変調は、失敗後の修正ガイダンスをほとんど提供しない。
我々は、成功し、失敗した軌道は、異なる形態の後見監督を必要とすることを観察する。
成功した応答には、有効な学生生成推論パスが含まれており、それゆえ、外部の論理に置き換えられるのではなく、特権的な文脈として機能することができる。
しかし、失敗した応答は、修正参照情報を必要とする。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(\mathrm{H}^{2}\mathrm{SD}$)を紹介する。
評価された応答と言い換え命令から教師の文脈を構築し,教師は元の応答トークンを再評価するのみに使用する。
結果として得られる確率は、報酬によって決定される方向を変更することなくトークンクレジットの割り当てを洗練させる。
失敗した軌道に対して、検証された基準ヒントは、逆KL蒸留による補正ガイダンスを提供する。
試行錯誤試験の結果,H$^2$SDはRLVRと自己蒸留ベースラインの中で最も高い総合性能を示し,安定な最適化と良好な精度・効率のトレードオフが得られた。
関連論文リスト
- Trajectory-Refined Distillation [25.346810464266497]
トラジェクトリ精製蒸留(Trjectory-Refined Distillation, TRD)は、教師指導下で生徒のロールアウトをオンライン支援中に修正するトラジェクトリレベルの補正法である。
TRDは、特権情報に規定された学生モデルを教師として使用するパラメータ共有型である、オンライン自己蒸留(OPSD)にも適用することができる。
論文 参考訳(メタデータ) (2026-06-07T03:17:25Z) - OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning [19.98950359294245]
本研究は,教師の特権分布を自己の自給自足軌道に沿って蒸留することにより,言語モデルによる推論能力の向上を図ることを目的とする。
OPSDの性能向上にもかかわらず,教師と生徒の反応のミスマッチがよく見過ごされがちである。
論文 参考訳(メタデータ) (2026-05-12T17:00:53Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z) - Self-Distilled RLVR [57.37526213765131]
特権教師からのみ派生した学習信号が,情報漏洩と不安定な長期学習をもたらすことを示す。
textbfSelf-textbfDistillationを用いたtextbfRLSD(textbfRLVR)を提案する。
これにより、RSSDはRLVRとOPSDの両方の強度を同時に利用でき、高い収束天井と優れたトレーニング安定性を実現することができる。
論文 参考訳(メタデータ) (2026-04-03T15:50:07Z) - Reinforcement-aware Knowledge Distillation for LLM Reasoning [63.53679456364683]
強化学習(Reinforcement Learning, RL)ポストトレーニングは、最近、大型言語モデル(LLM)の長いチェーン・オブ・プリーティングにおいて、進歩をもたらした。
既存の知識蒸留法の多くは、教師による微調整(SFT)のために設計されており、固定された教師のトレースや教師の学生であるKulback-Leibler(KL)の発散に基づく正規化に依存している。
本稿では,RLにおける選択的な模倣を行うRL-aware distillation (RLAD)を提案する。
論文 参考訳(メタデータ) (2026-02-26T00:20:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。