論文の概要: Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
- arxiv url: http://arxiv.org/abs/2605.11609v1
- Date: Tue, 12 May 2026 06:40:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.635975
- Title: Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
- Title(参考訳): ポイントワイド相互情報によるRLの反自己蒸留
- Authors: Guobin Shen, Xiang Cheng, Chenxiao Zhao, Lei Huang, Jindong Li, Dongcheng Zhao, Xing Yu,
- Abstract要約: 本稿では,学生と教師の相違を増す反自己蒸留法を提案する。
AntiSDはGRPOベースラインの精度を2倍から10倍にし、最終精度を最大11.5ポイント向上させる。
- 参考スコア(独自算出の注目度): 22.436966302243565
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy self-distillation, where a student is pulled toward a copy of itself conditioned on privileged context (e.g., a verified solution or feedback), offers a promising direction for advancing reasoning capability without a stronger external teacher. Yet in math reasoning the gains are inconsistent, even when the same approach succeeds elsewhere. A pointwise mutual information analysis traces the failure to the privileged context itself: it inflates the teacher's confidence on tokens already implied by the solution (structural connectives, verifiable claims) and deflates it on deliberation tokens ("Wait", "Let", "Maybe") that drive multi-step search. We propose Anti-Self-Distillation (AntiSD), which ascends a divergence between student and teacher rather than descending it: this reverses the per-token sign and yields a naturally bounded advantage in one step. An entropy-triggered gate disables the term once the teacher entropy collapses, completing a drop-in replacement for default self-distillation. Across five models from 4B to 30B parameters on math reasoning benchmarks, AntiSD reaches the GRPO baseline's accuracy in 2 to 10x fewer training steps and improves final accuracy by up to 11.5 points. AntiSD opens a path to scalable self-improvement, where a language model bootstraps its own reasoning through its training signal.
- Abstract(参考訳): 学生が特権的文脈(例えば、検証された解決策やフィードバック)で条件付けされた自分自身のコピーに向かって引っ張られるオン政治自己蒸留は、より強力な外部教師を伴わずに推論能力を向上させるための有望な方向を提供する。
しかし、数学の推論では、同じアプローチが他の場所で成功したとしても、利得は矛盾する。
ポイントワイドな相互情報分析は、特権付きコンテキスト自体の失敗をトレースする:それは、ソリューション(構造的接続性、検証可能なクレーム)によって既に示唆されているトークンに対する教師の信頼を膨らませ、マルチステップ探索を駆動する議論トークン("Wait", "Let", "Maybe")でそれを宣言する。
本稿では,学生と教師の相違を解消するアンチ・セルフ・蒸留(AntiSD)を提案し,これを逆転させて1ステップで自然に有界な優位性をもたらす。
エントロピートリガーゲートは教師のエントロピーが崩壊するとこの用語を無効にし、デフォルトの自己蒸留の代わりにドロップインで置き換える。
数学推論ベンチマークの4Bから30Bパラメータの5つのモデルにまたがって、AntiSDはGRPOベースラインの精度を2から10倍のトレーニングステップで達成し、最終的な精度を最大11.5ポイント向上させる。
AntiSDはスケーラブルな自己改善への道を開き、そこでは言語モデルがトレーニング信号を通じて独自の推論をブートストラップする。
関連論文リスト
- OPSD Compresses What RLVR Teaches: A Post-RL Compaction Stage for Reasoning Models [12.17078443900398]
RLVR(Reinforcement Learning with Verifiable Rewards)の代替として,オンライン自己蒸留(On-Policy Self-Distillation, OPSD)が最近登場した。
考察可能な数学的推論では、OPSDは補正機構よりも圧縮機構として最も確実に振る舞う。
論文 参考訳(メタデータ) (2026-05-07T13:04:34Z) - Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision [50.61441331643804]
強化学習(Reinforcement Learning、RLVR)は、広く適用可能で強力であるが、訓練中に緩やかな監督しか提供しない二進的な報酬に依存している。
蒸留は、一般的に外部の教師や高品質なデモンストレーションを使って得られる、密集したトークンレベルの監督を提供する。
自己蒸留ゼロ(SD-Zero)は,RLよりもかなり訓練効率が高く,外部教師や高品質な実演を必要としない手法である。
論文 参考訳(メタデータ) (2026-04-13T19:46:55Z) - A Survey of On-Policy Distillation for Large Language Models [19.95776080082138]
この調査は、大規模言語モデル(LLM)のオン・ポリシィ蒸留に関する最初の包括的概要を提供する。
オンラインのサンプルに対して$f$-divergenceフレームワークを導入し,emphfeedbackシグナル(ログベース,結果ベース,自己プレイ),emphteacherアクセス(ホワイトボックス,ブラックボックス,教師フリー),emphloss最小化(トケンレベル,シーケンスレベル,ハイブリッド)の3つの次元に沿ってランドスケープを整理する。
論文 参考訳(メタデータ) (2026-04-01T08:32:34Z) - Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes [31.95045602299568]
オンライン蒸留(OPD)は,教師の学習履歴ではなく,学生が生み出すロールアウトに対するフィードバックを評価するため,大規模言語モデル(LLM)のポストトレーニングにアピールしている。
推定器と実装側からOPDを再検討する。
不均衡な1-token信号、学生が生成した接頭辞に対する教師の信頼できない指導、トークン化器や特殊-tokenミスマッチによる歪みの3つの失敗モードを同定する。
論文 参考訳(メタデータ) (2026-03-26T15:35:59Z) - Entropy-Aware On-Policy Distillation of Language Models [36.60992451188347]
エントロピーを意識したオン・ポリシィ蒸留について紹介する。
我々のキーとなる考え方は、教師のエントロピーが高い場合、標準逆KL目標を前方KLに増強することである。
モデム探索精度とモデム探索精度のバランスを保ち、モデムの訓練効率を犠牲にしない。
論文 参考訳(メタデータ) (2026-03-07T07:26:18Z) - GATES: Self-Distillation under Privileged Context with Consensus Gating [89.62339954332248]
我々は、監督が信頼できない環境で自己蒸留を研究する。
非対称な文脈で回答する文書に焦点をあてる。
複数の文書ベース推論トレースをサンプリングすることにより、教師のコンセンサスからオンラインでの監督を導出する。
論文 参考訳(メタデータ) (2026-02-24T05:56:20Z) - Incorporating Self-Rewriting into Large Language Model Reasoning Reinforcement [54.63337314382886]
自己書き起こしフレームワークを導入し、モデルが独自の推論テキストを書き直し、その後、書き直し推論から学習し、内部思考プロセスの品質を向上させる。
アルゴリズム設計において、モデルの一貫した正当性によって定義される「単純な」サンプルのみを書き換える選択的な書き換え手法を提案する。
モデルサイズが異なる多様なタスクの実験は、自己書き換えの有効性を検証する。
論文 参考訳(メタデータ) (2025-11-20T13:10:52Z) - In-Token Rationality Optimization: Towards Accurate and Concise LLM Reasoning via Self-Feedback [38.915062716409686]
InTROはトークンレベルの探索と,正確かつ簡潔な推論のための自己フィードバックを可能にする,新たなフレームワークである。
InTROは他のベースラインを一貫して上回り、ベースモデルと比較して解の精度を最大20%向上させる。
その思考の連鎖は明らかに簡潔であり、冗長性が低下している。
論文 参考訳(メタデータ) (2025-11-13T01:47:06Z) - Distilling the Implicit Multi-Branch Structure in LLMs' Reasoning via Reinforcement Learning [63.888013006686364]
教師による微調整(SFT)による教師から生徒への推論経路の蒸留は、大規模言語モデル(LLM)の推論能力を向上させるショートカットを提供する。
GSRM(Generative Structure Reward Model)による強化学習に基づく蒸留フレームワークRLKDを提案する。
GSRMは、推論パスを複数のメタ推論解決ステップに変換し、報酬を計算して、学生と教師の推論の構造的アライメントを測定する。
論文 参考訳(メタデータ) (2025-05-22T02:36:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。