論文の概要: Power Distribution Bridges Sampling, Self-Reward RL, and Self-Distillation
- arxiv url: http://arxiv.org/abs/2605.04542v1
- Date: Wed, 06 May 2026 06:42:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.676148
- Title: Power Distribution Bridges Sampling, Self-Reward RL, and Self-Distillation
- Title(参考訳): 配電橋のサンプリング, 自己逆RL, 自己蒸留
- Abstract要約: 我々は,電力分布,電力サンプリングの目標分布に着目し,電力分布ブリッジがサンプリング,自己逆KL規則化RL,自己蒸留を行うことを示す。
パワーサンプリングは自己回帰と整合性に依存し、パワー自己蒸留はより低い推論コストでパワーサンプリングの性能と一致または超過することができる。
- 参考スコア(独自算出の注目度): 34.08435990347253
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent analyses question whether reinforcement learning (RL) is responsible for strong reasoning in large language models (LLMs). At the same time, distillation and inference-time sampling, including power sampling, have emerged as effective ways to improve LLM performance. However, the relationship among RL, distillation, and sampling remains unclear. In this study, we focus on the power distribution, the target distribution of power sampling, and show that the power distribution bridges sampling, self-reward KL-regularized RL, and self-distillation. From the sampling perspective, we show that inexpensive local approximations cannot reproduce sequence-level power without information about possible suffixes. From the RL perspective, the power distribution is the closed-form optimizer of KL-regularized RL when the model's sequence-level log-probabilities are used as the reward. This identification leads to power self-distillation, an offline distillation surrogate that shares the same target distribution and amortizes the cost of power sampling into supervised training on teacher samples. We further show that power self-distillation can achieve self-reward sharpening, while improvement in a downstream true reward is governed by the covariance between true reward and self-reward under the power distribution. Experiments on reasoning tasks support our analysis: power sampling raises self-reward, true-reward gains depend on alignment with self-reward, and power self-distillation can match or exceed the performance of power sampling at much lower inference cost.
- Abstract(参考訳): 近年,大規模言語モデル (LLM) において強化学習 (RL) が強い推論に寄与するかどうかが疑問視されている。
同時に, LLMの性能向上に有効な方法として, パワーサンプリングを含む蒸留および推定時間サンプリングが出現している。
しかし, RL, 蒸留, サンプリングの関係は明らかになっていない。
本研究では、電力分布、電力サンプリングの目標分布に着目し、電力分布ブリッジがサンプリング、自己逆KL規則化RL、自己蒸留を行うことを示す。
サンプリングの観点からは,サフィックスの情報なしでは,安価な局所近似ではシーケンスレベルの電力を再現できないことを示す。
RLの観点からは、モデルのシーケンスレベルのログ確率が報酬として使用されるとき、電力分布はKL正規化RLの閉形式最適化器である。
この識別は、教師のサンプルの教師によるトレーニングに電力をサンプリングするコストを減らし、同じ目標分布を共有するオフライン蒸留シュロゲートである、電力自蒸留につながる。
さらに、電力自己蒸留は自己回帰のシャープ化を達成でき、一方、下流の真の報酬の改善は、電力分布の下での真の報酬と自己回帰の共分散によって制御されることを示す。
電力サンプリングは自己回帰を上昇させ, 真逆利得は自己回帰との整合性に依存し, 電力自己蒸留はより低い推論コストで電力サンプリングの性能に適合または超過することができる。
関連論文リスト
- More Correct Mass, Worse Answers: Why Power Sampling Can Fail and How to Fix It [1.8910307051284583]
パワーサンプリングは、より高い確率質量を正しい軌道に向けて駆動し、下流の予測を劣化させる。
自己整合性を代表例として、モデルと推論ベンチマークの間で最大18.5ポイントの精度低下を観測する。
我々は、一様軌跡指数を変形制御型、支持保存型パワーターゲットに置き換え、問題ごとのシャープニングを校正する。
論文 参考訳(メタデータ) (2026-08-14T16:01:10Z) - On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity [5.35852583397955]
On-policy self-distillationは,教師と学生の両方に単一モデルを使用することで,強力なパス@1精度を実現する。
ロールアウトの多様性が低下し、pass@k曲線がフラットになるのです。
論文 参考訳(メタデータ) (2026-06-24T17:59:02Z) - DISA: Offline Importance Sampling for Distribution-Matching LLM-RL [56.9445657766829]
本稿では、このキャリブレーション問題をRLループの外に移動させるdisAを紹介する。
DISAは提案トラジェクトリをオフラインに描画し、重要サンプリングによってパーティション関数を推定し、結果として発生するパーティション関数の推定を凍結する。
6つの数学と3つのコードベンチマークにまたがる2つのオープンウェイトなバックボーンでは、DisdisAはオンラインに結合した分散マッチングベースラインフローにマッチするか、超えている。
論文 参考訳(メタデータ) (2026-05-17T07:14:44Z) - Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision [50.61441331643804]
強化学習(Reinforcement Learning、RLVR)は、広く適用可能で強力であるが、訓練中に緩やかな監督しか提供しない二進的な報酬に依存している。
蒸留は、一般的に外部の教師や高品質なデモンストレーションを使って得られる、密集したトークンレベルの監督を提供する。
自己蒸留ゼロ(SD-Zero)は,RLよりもかなり訓練効率が高く,外部教師や高品質な実演を必要としない手法である。
論文 参考訳(メタデータ) (2026-04-13T19:46:55Z) - Self-Distilled RLVR [57.37526213765131]
特権教師からのみ派生した学習信号が,情報漏洩と不安定な長期学習をもたらすことを示す。
textbfSelf-textbfDistillationを用いたtextbfRLSD(textbfRLVR)を提案する。
これにより、RSSDはRLVRとOPSDの両方の強度を同時に利用でき、高い収束天井と優れたトレーニング安定性を実現することができる。
論文 参考訳(メタデータ) (2026-04-03T15:50:07Z) - PowerFlow: Unlocking the Dual Nature of LLMs via Principled Distribution Matching [34.44050784146993]
PowerFlowは、教師なしの微調整を分散マッチング問題として再構成する、原則化されたフレームワークである。
$$-powerディストリビューションをターゲットとすることで、PowerFlowは、大規模言語モデルの2つの性質の方向性を引き出すことができる。
論文 参考訳(メタデータ) (2026-03-19T00:00:36Z) - Reinforcement-aware Knowledge Distillation for LLM Reasoning [63.53679456364683]
強化学習(Reinforcement Learning, RL)ポストトレーニングは、最近、大型言語モデル(LLM)の長いチェーン・オブ・プリーティングにおいて、進歩をもたらした。
既存の知識蒸留法の多くは、教師による微調整(SFT)のために設計されており、固定された教師のトレースや教師の学生であるKulback-Leibler(KL)の発散に基づく正規化に依存している。
本稿では,RLにおける選択的な模倣を行うRL-aware distillation (RLAD)を提案する。
論文 参考訳(メタデータ) (2026-02-26T00:20:39Z) - Don't Ignore the Tail: Decoupling top-K Probabilities for Efficient Language Model Distillation [50.19746127327559]
教師モデルのトップK予測確率と低確率予測確率の寄与を分離する新しいテールアウェア分岐を提案する。
実験により, 改良蒸留法は, デコーダモデルの事前学習と教師付き蒸留の両方において, 競争性能を発揮することが示された。
論文 参考訳(メタデータ) (2026-02-24T11:54:06Z) - Scalable Power Sampling: Unlocking Efficient, Training-Free Reasoning for LLMs via Distribution Sharpening [14.647624238539777]
本稿では,ベースモデルの自己回帰的生成分布を高速化する,学習不要かつ検証不要なアルゴリズムを提案する。
提案手法は,外部の報酬に頼らずに1ショットのGRPOに適合または超過し,推論遅延を10倍以上削減する。
論文 参考訳(メタデータ) (2026-01-29T12:01:53Z) - GDRO: Group-level Reward Post-training Suitable for Diffusion Models [55.948229011478304]
グループレベルの報酬は、モデルを目標とする報酬と整合させるのに成功します。
Group-level Direct Reward Optimization (GDRO)は、グループレベルの報酬アライメントのための新しいトレーニング後のパラダイムである。
GDROは完全なオフライントレーニングをサポートし、画像ロールアウトサンプリングの大幅なコスト削減を実現する。
これは拡散サンプラー非依存であり、取得性に対するODE-to-SDE近似の必要性を排除している。
論文 参考訳(メタデータ) (2026-01-05T11:47:18Z) - LaSeR: Reinforcement Learning with Last-Token Self-Rewarding [54.72617309922891]
RLVR(Reinforcement Learning with Verifiable Rewards)は、Large Language Models(LLM)の推論能力を高めるためのコアパラダイムとして登場した。
従来、LLMは2つの異なるプロンプトテンプレートを使用してソリューションと自己検証をシーケンシャルに生成し、効率を大幅に低下させる必要があった。
本稿では,従来のRLVR損失をMSE損失で増大させるアルゴリズムであるLaSeR(Reinforcement Learning with Last-Token Self-Rewarding)を提案する。
論文 参考訳(メタデータ) (2025-10-16T17:55:11Z) - Delayed Rewards Calibration via Reward Empirical Sufficiency [11.089718301262433]
分類の観点から着想を得た遅延報酬キャリブレーションパラダイムを提案する。
我々は、分布内の状態ベクトルがエージェントに信号を報奨する経験的な十分な分布を定義します。
純度訓練された分類器は、分布を取得し、校正された報酬を生成するように設計されている。
論文 参考訳(メタデータ) (2021-02-21T06:42:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。