論文の概要: On-Policy Self-Distillation without Any Supervision
- arxiv url: http://arxiv.org/abs/2608.06296v2
- Date: Sun, 09 Aug 2026 12:07:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 13:55:18.738425
- Title: On-Policy Self-Distillation without Any Supervision
- Title(参考訳): スーパービジョンなしでのオン・ポリシィ自己蒸留
- Abstract要約: 我々は、内部整合性を通して、モデル自身の世代のみを用いて、政治上の自己蒸留を実現することができることを示す。
教師なしの政治自己蒸留(U-OPSD)を提案する。
- 参考スコア(独自算出の注目度): 47.315224514076334
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy (Self-)Distillation (OPD / OPSD) has shown strong potential for post-training large language models (LLMs). However, existing methods still rely heavily on external supervision, including ground-truth signals, environmental feedback, or guidance from larger models, and therefore fall short of genuine "self"-distillation. In this study, we show that on-policy self-distillation can be achieved using only a model's own generations via internal consistency. We propose unsupervised on-policy self-distillation (U-OPSD). U-OPSD first samples multiple rollouts and constructs a pseudo solution by majority vote under a self-consistency threshold. It then conditions the model's distribution on the pseudo-solution and distills itself on the disagreeing completions, allowing the model to correct itself precisely where it is confidently wrong. Across diverse benchmarks, base models, and training settings, U-OPSD consistently improves over the base models and matches or surpasses supervised methods with ground truth (GT) such as OPSD and GRPO. On five mathematical reasoning benchmarks, i.e., AIME24, AIME25, HMMT25, MATH500, and AMC23, U-OPSD improves over the base model by 8.5% and 10.7% on Qwen3 non-thinking mode at 4B and 8B scales, and outperforms OPSD by 3.2% and 2.3% on average, respectively. In thinking mode, U-OPSD stays on par with OPSD, ahead by 0.9% at 4B and level at 8B and surpassing GRPO by 0.7% and 1.1%, respectively. Code is available at [https://github.com/williamium3000/u-opsd](https://github.com/williamium3000/u-opsd).
- Abstract(参考訳): On-policy (Self-) Distillation (OPD / OPSD) は、大規模言語モデル (LLM) の訓練後において強力な可能性を示している。
しかし、既存の手法は、地上の信号、環境フィードバック、大型モデルからのガイダンスなど、外部の監督に大きく依存しているため、真の「自己」蒸留に欠ける。
本研究では, 内的整合性を通じて, モデル自体の世代のみを用いて, 政治上の自己蒸留を実現できることを示す。
政治自己蒸留(U-OPSD)について検討する。
U-OPSDはまず複数のロールアウトをサンプリングし、自己一貫性しきい値の下で多数決で擬似ソリューションを構築する。
その後、擬解に対してモデルの分布を定め、不一致の完了を蒸留し、モデルが確実に間違っている場所を正確に修正する。
多様なベンチマーク、ベースモデル、トレーニング設定の他、U-OPSDはベースモデルよりも一貫して改善され、OPSDやGRPOのような接地真理(GT)と一致するか、あるいは超える。
AIME24、AIME25、HMMT25、MATH500、AMC23の5つの数学的推論ベンチマークでは、U-OPSDはQwen3の4Bスケールと8Bスケールで平均8.5%、Qwen3では10.7%、OPSDは平均3.2%、OPSDは2.3%向上している。
シンキングモードでは、U-OPSDはOPSDと同等であり、4Bでは0.9%、レベル8BではGRPOを0.7%、レベル1.1%上回る。
コードは[https://github.com/williamium3000/u-opsd](https://github.com/williamium3000/u-opsd]で入手できる。
関連論文リスト
- ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - Distribution-First Population Simulation: Collapse, Calibration, and Recall in Non-WEIRD LLM Persona Modeling [0.0]
合成親和性ツールは、独立大規模言語モデル(LLM)エージェントとして各個人を動作させる。
このパラダイムには基本的な障害モードがあることを示し、分散優先の修正をそれに対して設定する。
論文 参考訳(メタデータ) (2026-07-17T15:45:57Z) - Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline [56.53954182896384]
大規模言語モデルのための簡単な訓練後改良アルゴリズムである自己検証蒸留を提案する。
自己検証蒸留(Self-Verified Distillation)は、未ラベルの種問に対する候補解を生成する。
プロンプトベースの自己検証を使用してフィルタリングし、結果の自己計算データセットをトレーニングする。
トレーニングデータ構築中に、より多くの候補世代をサンプリングし、より大きな検証予算を使用することで、高品質な自己計算データが得られることがわかった。
論文 参考訳(メタデータ) (2026-05-20T17:26:10Z) - Beyond Mode Collapse: Distribution Matching for Diverse Reasoning [69.88237286885065]
GRPOのようなオンライン強化学習手法はモード崩壊に悩まされる。
このことは、逆KL最小化のモード探索行動に由来することを示す。
KL最小化の原理的近似によりモード崩壊を防止するDMPOを提案する。
論文 参考訳(メタデータ) (2026-05-19T07:13:00Z) - Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents [0.4666493857924357]
複雑なマルチステップ環境において,推論時足場のみに追加のトレーニング計算を使わずに,小さなモデルの性能を向上させることができるかどうかを検討した。
我々は,AppWorldベンチマークのQwen3-8Bを,完全精度と4ビット量子化構成の両方で評価した。
本格的な推測では、私たちの足場付き8Bモデルは、オリジナルのAppWorld評価からDeepSeek-Coder 33Bインストラクション(7.1%)を上回っています。
論文 参考訳(メタデータ) (2026-04-13T13:40:33Z) - Epistemic Observability in Language Models [0.0]
製造時に高い信頼性を報告できるモデルがあることがわかりました。
正式な仮定では、これは能力ギャップではなく観察的なギャップである。
我々は,計算副産物を輸出することで不合理性から逃れるテンソルインタフェースを構築した。
論文 参考訳(メタデータ) (2026-03-20T21:59:34Z) - Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model [56.92219181993453]
本稿では,PPOやGRPOなどのオンラインRFT手法をオフ・ポリティクスデータに活用するために,Reincarnating Mix-policy Proximal Policy Gradient (ReMix)を提案する。
ReMix は,(1) 効率的なトレーニングのための更新データ(UTD)比が増大した混成政策勾配,(2) 安定性と柔軟性のトレードオフのバランスをとるためのKL-Convex 政策制約,(3) 効率的な早期学習から安定した改善へのシームレスな移行を実現するための政策再編成の3つの主要な構成要素から構成される。
論文 参考訳(メタデータ) (2025-07-09T14:29:45Z) - daDPO: Distribution-Aware DPO for Distilling Conversational Abilities [48.745922491268004]
本稿では, 優先最適化と分散蒸留を統一したdaDPO (Distribution-Aware DPO) を提案する。
そこで,daDPOは,刈り取られたモデルの性能回復と,より小型のLCMモデルの改良において,既存の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-06-03T03:39:29Z) - Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs [54.05511925104712]
本稿では,Step-DPOと呼ばれるシンプルで効果的でデータ効率のよい手法を提案する。
Step-DPOは、個々の推論ステップを、論理的に回答を評価するのではなく、優先最適化の単位として扱う。
以上の結果から,70B パラメータ以上のモデルでは,10K の選好データペアと500 Step-DPO トレーニングステップ以下では,MATH の精度が約3%向上する可能性が示唆された。
論文 参考訳(メタデータ) (2024-06-26T17:43:06Z) - Self-Play Preference Optimization for Language Model Alignment [75.83359213697854]
近年の進歩は、嗜好の確率で直接作業することで、人間の嗜好をより正確に反映できることを示している。
本稿では,言語モデルアライメントのためのセルフプレイ方式を提案する。
我々の手法はSPPO(Self-Play Preference Optimization)と呼ばれ、繰り返しポリシー更新を利用してナッシュ均衡を確実に近似する。
論文 参考訳(メタデータ) (2024-05-01T17:59:20Z) - Run-Off Election: Improved Provable Defense against Data Poisoning
Attacks [43.10561893357565]
データ中毒攻撃では、相手はトレーニングデータ中のサンプルの追加、修正、削除によってモデルの予測を変更しようとする。
アンサンブル防衛における多数決を考慮すれば,有効に利用可能な情報を活用できないため,無駄であることを示す。
ベースモデル間の2ラウンドの選挙に基づく新しい集計手法であるRun-Off Election (ROE)を提案する。
論文 参考訳(メタデータ) (2023-02-05T04:48:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。