論文の概要: Distilling LLM Feedback for Lean Theorem Proving
- arxiv url: http://arxiv.org/abs/2605.30861v1
- Date: Fri, 29 May 2026 05:35:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.405237
- Title: Distilling LLM Feedback for Lean Theorem Proving
- Title(参考訳): リーン定理証明のためのLLMフィードバックの蒸留
- Authors: Gaetan Narozniak, Gérard Biau, Rémi Munos, Ahmad Rammal, Pierre Marion,
- Abstract要約: 推論モデルのポストトレーニングは通常、教師付き微調整と、検証可能な報酬からの強化学習を組み合わせる。
このアルゴリズムはスパース報酬、限られた探索、モード崩壊に悩まされている。
本稿では,モデルがトークンレベルで,特権フィードバックを条件とした独自の分布に適合するように訓練されたトレーニング手法であるフィードバック蒸留を提案する。
- 参考スコア(独自算出の注目度): 20.86168010460303
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Post-training for reasoning models typically combines supervised fine-tuning with reinforcement learning from verifiable rewards, most commonly with GRPO. However, this algorithm suffers from sparse rewards, limited exploration, and mode collapse. Building upon recent works on self-distillation, we propose Feedback Distillation, a training method where the model is trained to match, at the token level, its own distribution conditioned on privileged feedback produced by a language model. Feedback Distillation offers token-level supervision and can inject external knowledge. Evaluating our method for Lean4 theorem-proving, we find that Feedback Distillation maintains greater diversity in generated trajectories than GRPO, yielding higher policy entropy and better pass@k scaling. The two methods are complementary: initializing GRPO from a Feedback Distillation checkpoint outperforms either method alone. All in all, our results suggest a promising avenue to improve post-training for complex reasoning.
- Abstract(参考訳): 推論モデルのポストトレーニングは通常、教師付き微調整と検証可能な報酬からの強化学習を組み合わせ、最も一般的にGRPOと組み合わせる。
しかし、このアルゴリズムはスパース報酬、限られた探索、モード崩壊に悩まされている。
本稿では, 自己蒸留に関する最近の研究に基づいて, 言語モデルによる特権的フィードバックに基づいて, トークンレベルで, モデルが一致するように訓練された訓練手法であるフィードバック蒸留を提案する。
フィードバック蒸留はトークンレベルの監視を提供し、外部知識を注入する。
提案手法をLean4の定理証明により評価した結果,フィードバック蒸留はGRPOよりも生成トラジェクトリの多様性を高く保ち,より高いポリシエントロピーとpass@kスケーリングを実現していることがわかった。
フィードバック蒸留チェックポイントからGRPOを初期化すると、どちらのメソッドよりも優れている。
全体としては、複雑な推論のためのポストトレーニングを改善するための有望な道が提案されている。
関連論文リスト
- From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding [35.008790179255136]
本稿では,ハードケースにおける学習を促進するグループ・リビジョン最適化パラダイムを提案する。
報酬形成にインスパイアされ,初期試行よりも各候補者の改善を定量化する統合プロセスを導入する。
提案手法は,従来のGRPOモデルと比較して,参照と推論のセグメンテーション,REC,およびカウントのベンチマークで一貫したゲインを実現する。
論文 参考訳(メタデータ) (2026-05-15T13:41:41Z) - Coupled Variational Reinforcement Learning for Language Model General Reasoning [83.82392089177841]
変分推論と強化学習を橋渡しするために,textitbCoupled bVari bReinforcement bLearning (CoVRL)を提案する。
CoVRLはベースモデルよりも12.4%向上し、最先端の検証不要なRLベースラインよりも2.3%向上した。
論文 参考訳(メタデータ) (2025-12-14T07:03:51Z) - Can GRPO Help LLMs Transcend Their Pretraining Origin? [42.200901132315636]
グループ相対政策最適化は、大規模言語モデル(LLM)の推論能力を高めるための主要なアプローチである
広く採用されているにもかかわらず、GRPOの利益はしばしば矛盾している。
GRPOはどの条件で推論を改善し、アウト・オブ・ディストリビューション(OOD)を一般化するのか?
まず、GRPOは基本モデルの分布に縛られ、完全に新しい解を見つけることができない保守的な再重み付けスキームであることを理論的に証明する。
論文 参考訳(メタデータ) (2025-10-14T00:37:52Z) - Learning a Dense Reasoning Reward Model from Expert Demonstration via Inverse Reinforcement Learning [50.20267980386502]
我々は、専門家によるデモンストレーションから直接、プロセスの監督のための密集したトークンレベルの報酬モデルを学びます。
学習された推論報酬は、2つの補完的な役割を果たす: (i)訓練中の推論ポリシーを最適化するためのステップレベルのフィードバックを提供する。
論文 参考訳(メタデータ) (2025-10-02T09:55:26Z) - ExPO: Unlocking Hard Reasoning with Self-Explanation-Guided Reinforcement Learning [12.83211408922535]
強化学習スタイルのポストトレーニングは、報酬や選好信号に基づいてモデル出力を最適化することで推論を改善する。
GRPOスタイルのアプローチでは、結果ベースの検証によってラベル付けされた自己生成サンプルを使用することでこれを実装している。
提案手法は, 基本的回答を条件に, 単純でモジュール化されたフレームワークである。
論文 参考訳(メタデータ) (2025-07-03T17:44:55Z) - Intra-Trajectory Consistency for Reward Modeling [67.84522106537274]
軌道内整合性正則化を開発し、より高い次トーケン生成確率を持つプロセスがより一貫した報酬を維持することを強制する。
提案した正規化でトレーニングした報酬モデルにより、より優れたDPO整合ポリシーが導出され、より優れたベスト・オブ・N(BON)検証結果が得られることを示す。
論文 参考訳(メタデータ) (2025-06-10T12:59:14Z) - A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce [68.99924691391048]
我々はGRPOを強化的なアルゴリズムの観点から再検討し、そのコアコンポーネントを分析する。
単純な拒絶サンプリングベースラインであるRAFTは,GRPOやPPOよりも競争性能が高いことがわかった。
この知見に触発されて、完全に正しくないサンプルと完全に正しいサンプルの両方をフィルタリングするポリシー勾配の最小限の拡張であるReinforce-Rejを提案する。
論文 参考訳(メタデータ) (2025-04-15T16:15:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。