論文の概要: Truncate Bad, Upweight Good: BoN-Style Distillation via Rank-Based Classification
- arxiv url: http://arxiv.org/abs/2608.19748v1
- Date: Thu, 20 Aug 2026 07:49:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.487219
- Title: Truncate Bad, Upweight Good: BoN-Style Distillation via Rank-Based Classification
- Title(参考訳): トルネート・バッド・アップウェイト・グッド:ランクベース分類によるBoN-スタイル蒸留
- Abstract要約: Best-of-Nのような推論時間選択手法は、候補のプールをサンプリングし、報酬モデルに従ってトップランクの完了を選択することにより、生成を改善する。
提案するTUP(Truncate-bad, Upweight-good Policy)は, サポーターから低ランクの完了を除去し, リウェイトを調整可能なシャープネスで保持した上尾のみをリウェイトする。
- 参考スコア(独自算出の注目度): 20.002861239367704
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Inference-time selection methods, such as Best-of-N, improve generation by sampling a pool of candidates and selecting the top-ranked completion according to a reward model. Distillation seeks to amortize this procedure into a single policy by replacing raw rewards with in-pool ranks and learning a policy that upweights higher-ranked completions. However, existing rank-based policies typically use smooth full-support reweighting, so low-ranked completions receive less mass but remain in the target support. Although a sharper reweighting reduces lower-tail mass, it also increases reliance on brittle ranking at the top made by a single reward model. We propose TUP: a Truncate-bad, Upweight-good Policy that removes low-ranked completions from the support and reweights only the retained upper tail with a tunable sharpness. TUP admits a closed-form, prompt-independent normalization and can be trained fully offline via binary cross-entropy, using shifted-truncated win-rates as soft labels and distilled-to-reference log-likelihood ratios as logits. Theoretically, under certain assumptions, we show that for any unknown oracle reward, the best monotone rank-reweighting can be matched by a lower-tail truncation rule, providing formal support for removing the lower tail rather than merely downweighting it. Empirically, we show that TUP is competitive with strong offline alignment baselines.
- Abstract(参考訳): Best-of-Nのような推論時間選択手法は、候補のプールをサンプリングし、報酬モデルに従ってトップランクの完了を選択することにより、生成を改善する。
蒸留は、生の報酬をインプールのランクに置き換えて、上位の完成度を高める政策を学ぶことで、この手続きを一つの政策に戻すことを目指している。
しかし、既存のランクベースのポリシーは通常、スムーズなフルサポートリウェイトを使用するため、低いランクの完成度はより少ないが、ターゲットの支持に留まる。
よりシャープな再重み付けはローテール質量を減少させるが、単一の報酬モデルによって作られたトップでの脆度ランキングに依存する。
提案するTUP(Truncate-bad, Upweight-good Policy)は, サポーターから低ランクの完了を除去し, リウェイトを調整可能なシャープネスで保持した上尾のみをリウェイトする。
TUPはクローズド形式でプロンプト非依存な正規化を認め、2進クロスエントロピーで完全にオフラインでトレーニングすることができる。
理論的には、特定の仮定の下では、未知のオラクル報酬に対して、最高の単調階位再重み付けは、単に重み付けを下降させるのではなく、下尾を除去するための公式なサポートを提供する、下尾トランケーション規則によって一致させることができる。
実証的に、TUPは強力なオフラインアライメントベースラインと競合することを示している。
関連論文リスト
- Tail-Likelihood Reinforcement Learning [63.90013981311359]
Tail-Likelihood Reinforcement Learning (TailRL)は、ランダムに選択された報酬閾値を超える対数確率を最大化する。
TailRLは、利点関数に簡単な修正しか必要とせず、既存の強化学習パイプラインと互換性がある。
論文 参考訳(メタデータ) (2026-09-02T14:54:45Z) - ReNFT: Repairing Mode Collapse in Reward Post-Training via Internal Probability-Mass Recalibration [84.10540890311843]
再学習後、必然的に確率質量をいくつかの報奨モード、即時多様性を消去するモード崩壊に集中させる。
本稿では、内部の確率質量再校正により、高逆低ダイバーシティアダプタを修復するReNFTを提案する。
PickScoreとGenEvalでは、ReNFTはNFTの報酬の98.9%と99.0%を保持し、DreamSim-Divは58.8%、55.0%改善している。
論文 参考訳(メタデータ) (2026-08-30T14:13:50Z) - SocraticPO: Policy Optimization via Interactive Guidance [64.7524628699057]
大規模言語モデルのための強化学習(RL)は通常、二項正当性のようなスカラー結果の報酬を伴う推論を監督する。
我々は、ソクラティックスタイルの自然言語ガイダンスでRLロールアウトを強化する政策最適化フレームワークであるtextbf SocraticPO(Socratic Policy Optimization)を提案する。
論文 参考訳(メタデータ) (2026-06-03T09:08:29Z) - Reward Bias Substitution: Single-Axis Bias Mitigations Redirect Optimization Pressure [23.021647176206972]
報酬モデルバイアスの単一軸緩和は、最適化圧力をそれを取り除くのではなく、相関したプロキシに回転させることができる。
この障害は、監査と政策によって引き起こされる分布の計測と最適化のギャップによって実現される。
我々は緩和の結果を制度分類に定式化し、緩和、偏見置換、過補正が同じ観測結果を生み出すことを証明した。
論文 参考訳(メタデータ) (2026-05-27T05:40:22Z) - One-Way Policy Optimization for Self-Evolving LLMs [63.8638342097375]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLMs)の推論能力を拡張するための,有望なパラダイムとなっている。
本稿では,最適化方向を更新等級から切り離す手法である1-Way Policy Optimization (OWPO)を提案する。
実験の結果,OWPOはDAPO,OPD,MOPDなどの強いベースラインより優れていた。
論文 参考訳(メタデータ) (2026-05-21T08:25:27Z) - Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward [69.99652051809737]
本研究では,検証自由な内在性勾配項再帰(VIGOR)を提案する。
VIGORはポリシーモデルのみを使用する単純な報酬です。
数学データのみに基づいてトレーニングされた場合、コードベンチマークへのクロスドメイン転送を示す。
論文 参考訳(メタデータ) (2026-05-11T03:15:37Z) - MARBLE: Multi-Aspect Reward Balance for Diffusion RL [71.6241143519038]
強化学習は、拡散モデルと人間の嗜好を整合させる主要なアプローチとなっている。
既存のプラクティスは、報酬ごとに1つのスペシャリストモデルをトレーニングすることで、複数の報酬を処理します。
我々は,各報酬に対する独立な優位推定器を維持する勾配空間最適化フレームワークMARBLEを提案する。
論文 参考訳(メタデータ) (2026-05-07T16:20:42Z) - Learning to Hint for Reinforcement Learning [51.46328710610512]
グループ相対政策最適化(GRPO)は、検証可能な報酬を伴う強化学習に広く用いられている。
GRPOは、グループ内のすべてのロールアウトが同じ報酬を受けると、しばしば有利な崩壊に苦しむ。
Hint Learning for Reinforcement Learning (HiLL)を提案する。
論文 参考訳(メタデータ) (2026-04-01T09:58:08Z) - Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training [39.36546278921025]
強化微調整 (Reinforcement fine-tuning, RFT) は、ポリシーモデルが報酬信号をハックして高いスコアを得るという、過度な最適化に悩まされることが多い。
我々の理論的分析は、高いリワードテールにおける報酬の誤特定に鍵がかかっていることを示している。
政治以外の見習いは入手し易いが、彼らのナイーティブな訓練は、私たちが調整しようとしている政策に対して、不明確な報酬を与える。
論文 参考訳(メタデータ) (2025-09-25T19:57:39Z) - Rewarding the Unlikely: Lifting GRPO Beyond Distribution Sharpening [36.81125165911328]
強化学習は、言語モデルの推論能力を改善する主要な要因として現れています。
本稿では,現在の強化学習アルゴリズムが,すでに解いている問題に関するベースモデルの分布を単に研ぎ澄ましているだけかどうかを考察する。
差分報酬はランクバイアスを緩和し、合成定理と実定理の両方の証明設定において、多種多様な$N$でpass@N$を改善することを示す。
論文 参考訳(メタデータ) (2025-06-03T01:15:15Z) - Where is the Grass Greener? Revisiting Generalized Policy Iteration for
Offline Reinforcement Learning [81.15016852963676]
オフラインRL体制における最先端のベースラインを、公正で統一的で高分解能なフレームワークの下で再実装する。
与えられたベースラインが、スペクトルの一方の端で競合する相手よりも優れている場合、他方の端では決してしないことを示す。
論文 参考訳(メタデータ) (2021-07-03T11:00:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。