論文の概要: Extremely Sparse Supervision Incentivizes Reasoning Ability
- arxiv url: http://arxiv.org/abs/2609.04565v1
- Date: Thu, 03 Sep 2026 23:38:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.863915
- Title: Extremely Sparse Supervision Incentivizes Reasoning Ability
- Title(参考訳): 極端にスパースなスーパービジョンは推論能力にインセンティブを与える
- Abstract要約: 大規模な言語モデルは、効果的なポストトレーニングを通じて、ますます強力な推論能力を示す。
トレーニング後の一般的な方法は大量のトークンを最適化し、効果的な学習はトークン集約であるべきだと暗黙的に仮定する。
推論は、非常に少数の生成トークンによって効果的にインセンティブを与えることができる。
- 参考スコア(独自算出の注目度): 13.22207761303279
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models demonstrate increasingly strong reasoning capabilities through effective post-training. Yet, prevailing post-training methods optimize over massive numbers of tokens, implicitly assuming that effective learning must be token-intensive. We revisit this assumption in the on-policy distillation (OPD) setting, which naturally admits dense teacher supervision at every generated token. Using the Qwen3 family, we discover a counter-intuitive phenomenon: reasoning can be effectively incentivized by an extremely small fraction of generated tokens--as few as one or two tokens per reasoning trajectory, corresponding to only 0.05% of all tokens. Surprisingly, this sparse supervision in most cases matches or surpasses full-token training in improving reasoning ability, despite excluding the vast majority of generated tokens from the training objective. This phenomenon is consistently observed across nine teacher--student configurations spanning different model scales on mathematical reasoning tasks, and is further validated on coding reasoning, Llama models and Proximal Policy Optimization (PPO)-based reinforcement learning with verifiable reward (RLVR). Interestingly, such extremely sparse supervision may be closer to the natural learning process: rather than correcting every step word by word, one reflects on a few critical reasoning steps, updates prior understanding, and continues the trial-and-error, avoiding micro-level corrections while remaining remarkably effective. Overall, our results challenge the assumption that effective post-training must be token-intensive and point to a new direction for understanding and designing more efficient post-training algorithms.
- Abstract(参考訳): 大規模な言語モデルは、効果的なポストトレーニングを通じて、ますます強力な推論能力を示す。
しかし、一般的なポストトレーニング手法は大量のトークンを最適化し、効果的な学習はトークン集約であるべきだと暗黙的に仮定する。
我々は,この仮定をオンライン蒸留(OPD)の設定で再考する。
Qwen3族を用いると、反直観的な現象が発見される: 推論は、生成したトークンの極端に小さな分数で効果的にインセンティブを得ることができ、推論軌跡の1つまたは2つのトークンとして、全てのトークンの0.05%に相当する。
驚くべきことに、ほとんどの場合、このまばらな監督は、トレーニング目標から生成されたトークンの大半を除いたにもかかわらず、推論能力を改善するための完全な訓練と一致または超えている。
この現象は、数学的推論タスク上で異なるモデルスケールにまたがる9つの教師学生構成において一貫して観察され、さらに符号化推論、Llamaモデル、PPOに基づく強化学習(RLVR)で検証される。
興味深いことに、このような極めてまばらな監督は、自然言語の学習プロセスに近いかもしれない。全てのステップワードを単語ごとに修正するのではなく、いくつかの重要な推論ステップを反映し、事前理解を更新し、試行錯誤を継続し、極端に効果的でありながらマイクロレベルの修正を避けている。
全体として、効果的なポストトレーニングはトークン集約的でなければならないという仮定に挑戦し、より効率的なポストトレーニングアルゴリズムを理解し設計するための新たな方向性を示す。
関連論文リスト
- PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping [5.89473045822308]
RLVR(Reinforcement Learning with Verifiable Rewards)は、LVLM(Large Vision-Language Models)の推論能力向上に有効なパラダイムとなっている。
既存のRLVR法は、全ての生成されたトークンに対して同一の学習信号を割り当てる軌道レベルの結果報酬に依存している。
本稿では,重要な知覚トークンを明確に識別し,強化するトークンレベルの強化学習フレームワークである知覚強化政策最適化(PRPO)を提案する。
論文 参考訳(メタデータ) (2026-06-07T16:06:29Z) - Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy [64.72195169444738]
ポリシー・グラディエント・メソッドは、各トークンを同じ軌道で扱い、均一なクレジット割り当てにつながる。
このような均一なクレジット割り当てはトークンレベルのトレーニングシグナルをほとんど誤配置していることを示す。
本稿では,トークン再重み付け手法であるActFocusを提案する。
論文 参考訳(メタデータ) (2026-05-14T08:33:02Z) - Cornerstones or Stumbling Blocks? Deciphering the Rock Tokens in On-Policy Distillation [4.624042537090342]
On-Policy DistillationのKL目標に基づく学生と教師のミスマッチの最も直接的なシグナルとして,トークンタイプの高損失トークンについて検討する。
これらのトークンは、モデルの実際の推論性能に無視可能な機能的貢献を提供する。
論文 参考訳(メタデータ) (2026-05-10T01:41:43Z) - Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning [18.477056077256233]
RLVRによる強化学習は大規模言語モデル(LLM)の推論能力を大幅に向上させる
現在のRLVRアプローチは、通常、生成されたトークンをまたいでトレーニングを行うが、どのトークン(例えばプレフィックストークン)が実際に推論に寄与するかを調査することは無視される。
本稿では,POP(Progressive Prefix-token Policy Optimization)と呼ばれる新しいRLVR手法を提案する。
論文 参考訳(メタデータ) (2025-12-17T10:26:11Z) - In-Token Rationality Optimization: Towards Accurate and Concise LLM Reasoning via Self-Feedback [38.915062716409686]
InTROはトークンレベルの探索と,正確かつ簡潔な推論のための自己フィードバックを可能にする,新たなフレームワークである。
InTROは他のベースラインを一貫して上回り、ベースモデルと比較して解の精度を最大20%向上させる。
その思考の連鎖は明らかに簡潔であり、冗長性が低下している。
論文 参考訳(メタデータ) (2025-11-13T01:47:06Z) - Provable Benefit of Curriculum in Transformer Tree-Reasoning Post-Training [76.12556589212666]
学習後のカリキュラムは指数関数的複雑性のボトルネックを回避していることを示す。
結果のみの報酬信号の下では、強化学習の微調整は、サンプルの複雑さを高い精度で達成する。
カリキュラムを意識したクエリにより、報奨託書の呼び出しとサンプリングコストの両方を指数関数的に削減するテストタイムスケーリングの保証を確立する。
論文 参考訳(メタデータ) (2025-11-10T18:29:54Z) - Learning a Dense Reasoning Reward Model from Expert Demonstration via Inverse Reinforcement Learning [50.20267980386502]
我々は、専門家によるデモンストレーションから直接、プロセスの監督のための密集したトークンレベルの報酬モデルを学びます。
学習された推論報酬は、2つの補完的な役割を果たす: (i)訓練中の推論ポリシーを最適化するためのステップレベルのフィードバックを提供する。
論文 参考訳(メタデータ) (2025-10-02T09:55:26Z) - Fast Thinking for Large Language Models [67.7238685892317]
我々は、訓練中にのみ簡潔なCoTスケッチを使用して個別戦略事前のコードブックを学習するフレームワークであるLatent Codebooks for Fast Thinkingを紹介した。
推論では、コードブックから抽出した少数の連続的思考スイッチのモデル条件を1パスにすることで、明確な推論トークンを生成することなく、戦略レベルのガイダンスを可能にする。
論文 参考訳(メタデータ) (2025-09-28T04:19:48Z) - Learning to Focus: Causal Attention Distillation via Gradient-Guided Token Pruning [62.23671919314693]
大規模言語モデル (LLM) は文脈理解において著しく改善されている。
しかし、長いコンテキストの推論と生成の間に真に重要な情報に出席する能力は、まだペースの遅れています。
本稿では,2段階のフレームワークであるLearning to Focus(LeaF)を導入し,コンバウンディング要因を緩和する。
論文 参考訳(メタデータ) (2025-06-09T15:16:39Z) - The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models [69.798277882245]
大規模言語モデルの推論効率を向上させるために,Unsupervised Prefix Fine-Tuning (UPFT)を導入した。
UPFTはラベル付きデータや徹底的なサンプリングの必要性を取り除く。
実験の結果,UPFTは教師付き手法の性能と一致していることがわかった。
論文 参考訳(メタデータ) (2025-03-04T18:56:03Z) - Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability [53.51560766150442]
臨界トークンは推論軌道内の要素であり、誤った結果に大きな影響を及ぼす。
本稿では,これらのトークンをロールアウトサンプリングによって識別する新しいフレームワークを提案する。
クリティカルトークンの識別と置換がモデル精度を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2024-11-29T18:58:22Z) - Token-Supervised Value Models for Enhancing Mathematical Problem-Solving Capabilities of Large Language Models [56.32800938317095]
既存の検証器はテスト時の木探索技術に準最適である。
トークン制御値モデル(TVM)を提案する。
TVMは各トークンに、正しい最終回答に達する確率を反映した確率を割り当てる。
論文 参考訳(メタデータ) (2024-07-12T13:16:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。