論文の概要: SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2608.04419v1
- Date: Wed, 05 Aug 2026 03:59:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.70512
- Title: SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation
- Title(参考訳): SPOT: オンライン蒸留におけるスパースプローブとアウトカム校正
- Authors: Zikun Qu, Min Zhang, Mingze Kong, Zhiwei Shang, Yikun Ban, Shuang Qiu, Zhongxiang Dai,
- Abstract要約: Sparse Probing and Outcome-calibrated Targets OPD (SPOT)を紹介する。
SPOTは、取得-探索-探索-探索手順を通じて、どこで調査し、何を蒸留するかという2つの複合的な決定に対処する。
複数の学生モデルと推論ベンチマークによる実験は、SPOTの有効性を実証している。
- 参考スコア(独自算出の注目度): 28.886137823815826
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy distillation (OPD) provides dense teacher supervision on student-generated trajectories, but standard reverse-KL training can assign insufficient probability to other plausible continuations. Teacher entropy alone does not reveal whether uncertainty is concentrated among a few plausible next tokens or dispersed over a long probability tail, nor whether the student already represents those candidates well. Moreover, local teacher probabilities may not predict downstream success. We introduce Sparse Probing and Outcome-calibrated Targets OPD (SPOT), which addresses two coupled decisions, where to probe and what to distill, through an acquisition--exploration--exploitation procedure. During acquisition, a position-level score combines normalized teacher entropy, the probability mass captured by a small top-$k$ candidate set, and student--teacher mismatch to allocate a limited probing budget. During exploration, SPOT evaluates teacher-proposed candidates through verifier-scored student continuations. During exploitation, these outcomes produce a closed-form, KL-regularized target that favors candidates with better downstream outcomes while remaining anchored to the teacher distribution. Extensive experiments across multiple student models and reasoning benchmarks demonstrate the effectiveness of SPOT in improving reasoning performance while balancing solution quality and coverage.
- Abstract(参考訳): オンライン蒸留(OPD)は、学生が生み出す軌跡を教師に密に監督するが、標準的な逆KL訓練は、他のもっともらしい継続に不十分な確率を割り当てることができる。
教師のエントロピーだけでは、いくつかの確実な次のトークンに不確実性が集中しているか、長い確率の尾に分散しているか、あるいは学生が既にそれらの候補をうまく表現しているかは明らかになっていない。
さらに、教師の確率は下流の成功を予測できない。
Sparse Probing と Outcome-calibrated Targets OPD (SPOT) を導入し, 抽出-探索-探索-探索-探索の方法を用いて, 探索と蒸留の2つの組み合わせの決定に対処する。
取得中、ポジションレベルのスコアは、正規化された教師のエントロピー、小さなトップ$k$の候補者セットによって取得された確率質量と、限られた予算を割り当てるために生徒-教師のミスマッチを組み合わせる。
探索中、SPOTは検証済みの学生継続を通して教師が提案する候補者を評価する。
搾取中、これらの成果は教師の分布に留まりながら、より良い下流結果の候補者を優先する、クローズドなKL規則化されたターゲットを生成する。
複数の学生モデルと推論ベンチマークにわたる大規模な実験は、ソリューションの品質とカバレッジのバランスを保ちながら、推論性能を改善するためにSPOTの有効性を示す。
関連論文リスト
- Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models [23.382646724389545]
オンライン蒸留(OPD)は、現在の学生政策の軌跡をサンプリングし、学生と教師の次点分布のトークンレベルのばらつきを最小限にする。
本稿では,ローカルで実現可能な教師の訂正のみを蒸留するemphFisher-Projected On-Policy Distillation (FP-OPD)を提案する。
論文 参考訳(メタデータ) (2026-08-02T14:16:14Z) - DemoPSD: Disagreement-Modulated Policy Self-Distillation [49.30809363804017]
大規模言語モデルを訓練するための実践的な方法として、オンデマンド自己蒸留が登場している。
DemoPSDは、教師と生徒の分布の重み付けされた幾何学的組み合わせに向けて学生を操縦する。
論文 参考訳(メタデータ) (2026-07-02T17:58:29Z) - SAGE-OPD: Selective Agent-Guided Intervention for Multi-Turn On-Policy Distillation [25.25989941933095]
マルチターンOPD用に設計された検証不要な選択的介入フレームワークであるSAGE-OPDを提案する。
SAGE-OPDは、教師の監督を全ターンで均一に行うのではなく、まず環境フィードバックを観察し、各生徒の反応をスキップするか介入するかを決定するために教師の判断を使用する。
エージェントタスクの実験では、SAGE-OPDはベースラインよりも一貫して改善され、ALFWorldの13.3%の相対的な改善を実現している。
論文 参考訳(メタデータ) (2026-06-17T23:58:14Z) - On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents [50.78688247330029]
オン・ポリシィ蒸留(On-Policy Distillation、OPD)は、小規模の学生にその能力を伝達するための自然なレシピである。
本稿では,教師と生徒が生成するターンを各ロールアウトに混在させるシンプルなアルゴリズムであるGuided-OPD(Guided-OPD)を提案する。
Guided-OPDは、平均してバニラOPDよりも21.1%、成功率25.5%向上している。
論文 参考訳(メタデータ) (2026-06-14T16:41:45Z) - When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning [45.79647925282674]
On-policy Self-distillation (OPSD) は、特権教師を使って生徒を自身のロールアウトで訓練する。
既存のエントロピーに基づくPD手法は、教師エントロピーによるトークンレベルの監督を調節することで、この一様性を緩和する。
そこで我々は,PW-OPSD(Pight-Weighted On-Policy Self-Distillation)を提案する。
論文 参考訳(メタデータ) (2026-05-20T18:14:03Z) - Multi-Rollout On-Policy Distillation via Peer Successes and Failures [31.731266689209914]
大規模な言語モデルは、しばしばスパース検証器の報酬で訓練後、サンプルの軌道が成功するかどうかを示すが、推論が成功するか失敗するかについての限られたガイダンスを提供する。
オンライン蒸留(OPD)は、学生が生み出す軌跡の訓練により、より密集したトークンレベルの監督を提供する。
我々は,学生のローカルロールアウトグループを用いて,より情報のある教師信号を構築する,ピアコンディショニング蒸留フレームワークであるMulti-Rollout On-Policy Distillation (MOPD)を紹介した。
論文 参考訳(メタデータ) (2026-05-12T18:57:44Z) - The Many Faces of On-Policy Distillation: Pitfalls, Mechanisms, and Fixes [10.319573084070578]
オンライン蒸留(OPD)とオンライン自己蒸留(OPSD)は,大規模言語モデルのための有望なポストトレーニング手法として出現している。
我々は、OPDとOPSDがいつ機能するか、いつ機能しないのか、なぜ機能しないのかについて、総合的な実証的研究を行った。
論文 参考訳(メタデータ) (2026-05-11T19:44:59Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z) - Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning [66.52232008796294]
Prune-OPDはトレーニング予算と監督品質を動的に調整する。
トレーニング時間を37.6%減らし-68.0%削減すると同時に、しばしば改善され、挑戦的なベンチマークのパフォーマンスが向上する。
論文 参考訳(メタデータ) (2026-05-08T14:38:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。