論文の概要: Teach Yourself Where to Look: On-Policy Attention Self-Distillation for Reasoning
- arxiv url: http://arxiv.org/abs/2609.33200v2
- Date: Tue, 29 Sep 2026 05:03:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.650008
- Title: Teach Yourself Where to Look: On-Policy Attention Self-Distillation for Reasoning
- Title(参考訳): どこに見るべきかを教える: 推論のための自己蒸留法
- Abstract要約: 自衛隊の自衛隊は、認証されたソリューションにアクセス可能な特権教師からの密集したトークン配布指導を用いて、自衛隊の自衛隊のモデルを推論する。
我々は, トークンレベルの監視と, 溶液条件の注意蒸留を補完する, OPASD(On-Policy Attention Self-Distillation)を導入する。
OPASDはトークンのみのOPSDを一貫して上回り、平均精度は4.98から8.40ポイント向上した。
- 参考スコア(独自算出の注目度): 5.87050475730812
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy self-distillation trains reasoning models on their own trajectories using dense token distribution guidance from a privileged teacher with access to a verified solution. This supervision transfers what the teacher predicts without directly transferring where it attends within the preceding context. We introduce On-Policy Attention Self-Distillation (OPASD), which complements token-level supervision with solution-conditioned attention distillation. Because the privileged teacher can attend to verified solution tokens unavailable to the student, OPASD projects teacher attention onto student-visible positions and renormalizes the resulting distribution before alignment. Across three model sizes and four competition-level mathematics benchmarks, OPASD consistently outperforms token-only OPSD, improving average accuracy by 4.98 to 8.40 percentage points. OPASD also avoids the response-length inflation and performance degradation observed with token-only distillation, reducing generated rollout tokens by 73.9% and estimated model compute by 72.6% while training 1.53x faster. These results show that solution-conditioned attention provides a complementary supervision signal that makes on-policy self-distillation more accurate, stable, and compute-efficient.
- Abstract(参考訳): 自衛隊の自衛隊は、認証されたソリューションにアクセス可能な特権教師からの密集したトークン配布指導を用いて、自衛隊の自衛隊のモデルを推論する。
この監督は、教師が予測した内容を、前回のコンテキスト内で直接、どこに出席するかを移すことなく転送する。
我々は, トークンレベルの監視と, 溶液条件の注意蒸留を補完する, OPASD(On-Policy Attention Self-Distillation)を導入する。
特権を持つ教師は、生徒が利用できない検証済みのソリューショントークンに出席することができるため、OPASDは教師の注意を学生の視認可能な位置に向け、その結果の分布をアライメント前に再正規化する。
3つのモデルサイズと4つの競合レベルの数学ベンチマークで、OPSDはトークンのみのOPSDを一貫して上回り、平均精度は4.98から8.40ポイント向上した。
OPASDはまた、トークンのみの蒸留で観測される応答長のインフレーションと性能劣化を回避し、生成されたロールアウトトークンを73.9%削減し、モデル計算を72.6%削減し、1.53倍高速なトレーニングを行う。
これらの結果から, 解決条件付き注意は, 政治上の自己蒸留をより正確で, 安定で, 計算効率を向上する補完的な監視信号を提供することが示された。
関連論文リスト
- TISD: On-Policy Self-Distillation with Trajectory Intervention [13.94224055378737]
On-policy Self-distillation (OPSD) は、高密度の教師ターゲットを提供するが、学生サンプルのロールアウトに沿ってのみ評価する。
単純な分岐再生蒸留アルゴリズムであるトラジェクトリ・インターベンション・セルフ蒸留(TISD)を導入する。
TISDは教師が選択したブランチアクションを強制し、サフィックス生成を生徒に返却し、特権条件付き教師の下で完全な軌跡を蒸留する。
論文 参考訳(メタデータ) (2026-09-25T06:37:02Z) - CA-OPD: Confidence-Aware On-Policy Distillation for Structured Visual Prediction [12.346416465825627]
信頼できるオン・ポリシィ蒸留(CA-OPD)は、信頼性の高いロールアウト構築と適応的な監視を結合するフレームワークである。
GUIグラウンディングと光学文字認識のためのマルチ教師設定で評価され、CA-OPDはQwen3.5-0.8Bベースラインを大幅に改善する。
論文 参考訳(メタデータ) (2026-09-02T10:11:59Z) - On-Policy Self-Distillation in Diffusion Models [89.32656931795293]
強化学習は、拡散モデルと人間の好みやタスク固有の目的とを一致させることができるが、エンドポイント報酬は、中間的偏見予測をどのように変更すべきかを規定していない。
そこで我々は、DiffusionOPSDを、画像レベルの報酬誘導を明示的なターゲットに変換して、サンプルクエリにおけるクリーンな出力予測を行うオンライン自己蒸留フレームワークとして導入する。
SD 3.5-Mとステップ蒸留したZ-Image-Turboを用いて、2つのバックボーンと10個の評価器で20の報酬マッチング設定のうち19のファイナルホールトアウトスコアを達成した。
論文 参考訳(メタデータ) (2026-08-25T14:55:24Z) - Visual Contrastive Self-Distillation [61.298159957622886]
本稿では,視覚的コントラスト自己蒸留法を提案する。
これと対照的に,本研究では,教師の具体的イメージ分布の明確化を図り,その結果のフルディストリビューション目標を学生に蒸留する。
論文 参考訳(メタデータ) (2026-07-23T17:37:37Z) - DemoPSD: Disagreement-Modulated Policy Self-Distillation [49.30809363804017]
大規模言語モデルを訓練するための実践的な方法として、オンデマンド自己蒸留が登場している。
DemoPSDは、教師と生徒の分布の重み付けされた幾何学的組み合わせに向けて学生を操縦する。
論文 参考訳(メタデータ) (2026-07-02T17:58:29Z) - Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation [81.10000755917712]
オンライン蒸留は,教師からのトークンレベルのフィードバックを用いて,学生モデルを自作の軌道上で訓練することにより,推論能力を伝達する。
生徒が生成した接頭辞が長くなるにつれて、教師の次点の分布は自信を減らし、差別性が低下する。
SFDを緩和するため, textbfLookahead Group Reward (ours) を導入する。
論文 参考訳(メタデータ) (2026-05-29T04:39:20Z) - When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning [45.79647925282674]
On-policy Self-distillation (OPSD) は、特権教師を使って生徒を自身のロールアウトで訓練する。
既存のエントロピーに基づくPD手法は、教師エントロピーによるトークンレベルの監督を調節することで、この一様性を緩和する。
そこで我々は,PW-OPSD(Pight-Weighted On-Policy Self-Distillation)を提案する。
論文 参考訳(メタデータ) (2026-05-20T18:14:03Z) - AVSD: Adaptive-View Self-Distillation by Balancing Consensus and Teacher-Specific Privileged Signals [65.71225905458182]
自己蒸留は、生徒と教師の両方と同じモデルを用いて、言語モデルが自身の軌道から政治学を学ぶことを可能にする。
このセットアップは、別の外部モデルに頼ることなく、密集したトークンレベルのフィードバックを提供する。
複数の特権情報ビューを持つ自己蒸留法であるAVSDを紹介する。
論文 参考訳(メタデータ) (2026-05-20T03:06:36Z) - SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting [17.504616835765617]
両経路適応型学習フレームワークを提案する。
SCOPEは、Avg@32で11.42%、Pass@32で7.30%の平均相対的な改善を実現している。
論文 参考訳(メタデータ) (2026-04-12T15:26:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。