論文の概要: H$^2$SD: Hybrid Hindsight Self-Distillation
- arxiv url: http://arxiv.org/abs/2607.18955v2
- Date: Wed, 22 Jul 2026 13:50:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 16:42:31.67379
- Title: H$^2$SD: Hybrid Hindsight Self-Distillation
- Title(参考訳): H$^2$SD:ハイブリッドハイビジョン自己蒸留
- Abstract要約: Hybrid Hindsight Self-Distillation (MathrmH2mathrmSD$)は、教師のコンテキストに適応し、トラジェクティブの正確性に対処する。
軌道を成功させるために,確認された応答と言い換え命令から教師の文脈を構築する。
失敗した軌道に対して、検証者確認基準ヒントは、逆KL蒸留による補正ガイダンスを提供する。
- 参考スコア(独自算出の注目度): 61.71131241473028
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) provides reliable outcome supervision for language model reasoning, but a scalar trajectory reward offers limited token-level guidance. Existing self-distillation methods add a privileged teacher but typically assign it a fixed role: direct distribution matching may destabilize successful behavior, while magnitude-only modulation offers little corrective guidance after failure. We observe that successful and failed trajectories require different forms of hindsight supervision. A successful response already contains a valid student-generated reasoning path and can therefore serve as privileged context rather than being replaced by an external rationale. A failed response, however, requires corrective reference information. We introduce Hybrid Hindsight Self-Distillation ($\mathrm{H}^{2}\mathrm{SD}$), which jointly adapts teacher context and update strategy to trajectory correctness. For successful trajectories, we construct the teacher context from the verified response and a rephrasing instruction, and use the teacher only to re-evaluate the original response tokens. This emphasizes essential deductions over redundant content and refines magnitude-based credit assignment without changing the reward direction. For failed trajectories, a verifier-confirmed reference hint provides corrective guidance through reverse-KL distillation. Controlled ablations show that the gains depend on outcome-conditioned routing and the rephrasing instruction. Experiments on challenging reasoning benchmarks show that H$^2$SD achieves the strongest overall performance among representative RLVR and self-distillation baselines, with stable optimization and a favorable accuracy-efficiency trade-off.
- Abstract(参考訳): 検証可能な報酬付き強化学習(RLVR)は、言語モデル推論の信頼性の高い結果管理を提供するが、スカラー軌道報酬はトークンレベルのガイダンスに制限を与える。
既存の自己蒸留法は特権的な教師を付加するが、通常はそれを固定的な役割に割り当てる: 直接分布マッチングは、成功した振る舞いを不安定にするが、マグニチュードのみの変調は、失敗後の修正ガイダンスをほとんど提供しない。
我々は、成功し、失敗した軌道は、異なる形態の後見監督を必要とすることを観察する。
成功した応答には、有効な学生生成推論パスが含まれており、それゆえ、外部の論理に置き換えられるのではなく、特権的な文脈として機能することができる。
しかし、失敗した応答は、修正参照情報を必要とする。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(\mathrm{H}^{2}\mathrm{SD}$)を紹介する。
評価された応答と言い換え命令から教師の文脈を構築し,教師は元の応答トークンを再評価するのみに使用する。
これは、冗長なコンテンツよりも重要な控除を強調し、報酬の方向を変えることなく、マグニチュードベースのクレジット割り当てを洗練させる。
失敗した軌道に対して、検証者確認基準ヒントは、逆KL蒸留による補正ガイダンスを提供する。
制御された短縮は、ゲインが結果条件付きルーティングとリフレージング命令に依存することを示している。
試行錯誤試験の結果,H$^2$SDはRLVRと自己蒸留ベースラインの中で最も高い総合性能を示し,安定な最適化と良好な精度・効率のトレードオフが得られた。
関連論文リスト
- Cliff: Learning Process Rewards from the First Mistake [7.768568604200271]
検証可能な報酬(RLVR)による強化学習は,大規模言語モデル(LLM)のポストトレーニングの強力なパラダイムとして登場した。
市販のLCMを教師として活用し,各ロールアウトにおける最初のミスを識別する報酬形成戦略であるCliffを提案する。
論文 参考訳(メタデータ) (2026-09-02T17:03:42Z) - When Teacher Guidance Misleads: Reward-Aligned On-Policy Distillation [21.86522736658343]
本稿では, 教師指導の誤りを軽減するために, Reward-Aligned On-Policy Distillation (RA-OPD)を提案する。
RA-OPDは、さらなる計算コストを必要とせずに、より信頼性の高い軌道を選択し、生徒モデルの性能を向上させる。
我々は,Qwen3ファミリーとDeepSeek-R1ファミリーのモデルを用いて,数学とコードベンチマークのRA-OPDを評価する。
論文 参考訳(メタデータ) (2026-08-28T06:05:50Z) - Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance [50.77757355236912]
本稿では,RSTG(Recovering Learning Signals via Adaptive Teacher Guidance)を提案する。
RSTGは数学では+4.02%、コードでは+3.05%の速さでGRPO+OPDを大幅に上回ることを示した。
論文 参考訳(メタデータ) (2026-08-01T17:29:14Z) - Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation [60.55792673956761]
我々は, ルブリックを構造化, きめ細かいフィードバックとして組み込んだフレームワークであるtextbfRubric-Conditioned Self-Distillationを提案する。
その結果, ルーリック条件の自己蒸留は, ルーリックレベルの基準をトークンレベルのガイダンスに効果的に変換することを示した。
論文 参考訳(メタデータ) (2026-06-17T17:54:04Z) - Localizing Credit at the Divergence: Path-Conditioned Self-Distillation for LLM Reasoning [12.363923974156636]
検証可能な報酬からの強化学習は、ロールアウト毎に1つのスカラーを割り当てる。
オンラインの自己蒸留は、特権情報に基づいて同じモデルを教師として振る舞うことでこの問題に対処する。
本研究では,教師がピアロールアウトに成功したことを条件に,HSD(Hindsight Self-Distillation)を提案する。
論文 参考訳(メタデータ) (2026-06-14T03:37:27Z) - Trajectory-Refined Distillation [25.346810464266497]
トラジェクトリ精製蒸留(Trjectory-Refined Distillation, TRD)は、教師指導下で生徒のロールアウトをオンライン支援中に修正するトラジェクトリレベルの補正法である。
TRDは、特権情報に規定された学生モデルを教師として使用するパラメータ共有型である、オンライン自己蒸留(OPSD)にも適用することができる。
論文 参考訳(メタデータ) (2026-06-07T03:17:25Z) - CAST: Non-Privileged Clipped Asymmetric Self-Teaching with Advantage Flipping for GRPO [9.443660785229719]
検証可能な報酬付き強化学習(RLVR)は、大規模言語モデルの推論を改善するために広く用いられている。
本研究は,GRPO型RLVRに対する無回答自己蒸留法であるCASTを提案する。
論文 参考訳(メタデータ) (2026-05-29T13:21:30Z) - OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning [19.98950359294245]
本研究は,教師の特権分布を自己の自給自足軌道に沿って蒸留することにより,言語モデルによる推論能力の向上を図ることを目的とする。
OPSDの性能向上にもかかわらず,教師と生徒の反応のミスマッチがよく見過ごされがちである。
論文 参考訳(メタデータ) (2026-05-12T17:00:53Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z) - The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation [67.26315138466312]
モデルロールアウトから経験的信頼性を推定するキャリブレーション対応のOPDフレームワークであるCaOPDを提案する。
本研究は, 能力蒸留が信頼性を示唆するものではないこと, 信頼性をポストトレーニングの本質的な目的として扱うべきであることを明らかにする。
論文 参考訳(メタデータ) (2026-04-18T04:43:40Z) - Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization [74.91418266859297]
インプシットプロセス報酬モデル(PRM)は、推論プロセスに沿ってきめ細かな報酬信号を提供する。
トレーニングはシーケンスレベルの集約のみを制限しますが、推論はローカルステップの品質を反映するためにトークンレベルのスコアが必要です。
本稿では,予測精度を推定するプレフィックス条件付き値関数を直接学習する新しいインプリシット・プレフィックス・バリュー・リワード・モデル(IPVRM)を提案する。
また,サンプルトークンと高確率候補トークンの両方に対してTDの利点を演算する分散レベルRL(DistRL)を提案する。
論文 参考訳(メタデータ) (2026-04-14T18:19:54Z) - Self-Distilled RLVR [57.37526213765131]
特権教師からのみ派生した学習信号が,情報漏洩と不安定な長期学習をもたらすことを示す。
textbfSelf-textbfDistillationを用いたtextbfRLSD(textbfRLVR)を提案する。
これにより、RSSDはRLVRとOPSDの両方の強度を同時に利用でき、高い収束天井と優れたトレーニング安定性を実現することができる。
論文 参考訳(メタデータ) (2026-04-03T15:50:07Z) - Reinforcement-aware Knowledge Distillation for LLM Reasoning [63.53679456364683]
強化学習(Reinforcement Learning, RL)ポストトレーニングは、最近、大型言語モデル(LLM)の長いチェーン・オブ・プリーティングにおいて、進歩をもたらした。
既存の知識蒸留法の多くは、教師による微調整(SFT)のために設計されており、固定された教師のトレースや教師の学生であるKulback-Leibler(KL)の発散に基づく正規化に依存している。
本稿では,RLにおける選択的な模倣を行うRL-aware distillation (RLAD)を提案する。
論文 参考訳(メタデータ) (2026-02-26T00:20:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。