論文の概要: CARM: Cancellation-Aware Response Masking for LLM Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2610.02039v1
- Date: Thu, 01 Oct 2026 16:51:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.312927
- Title: CARM: Cancellation-Aware Response Masking for LLM Reinforcement Learning
- Title(参考訳): CARM: LLM強化学習のためのキャンセル対応マスキング
- Abstract要約: ポリシーの更新と、ロールアウトとトレーニングエンジンの違いは、政界外でサンプルレスポンスを作成できる。
シーケンスレベルのマスキングは、レスポンス全体が最適化に寄与するかどうかを決定することで、このミスマッチに対処する。
平均化前に各トークンログ比の絶対値を取るシーケンスレベルのマスクであるemphCancellation-Aware Response Masking (CARM)を提案する。
- 参考スコア(独自算出の注目度): 9.238413536829048
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Recent years have witnessed the rapid adoption of reinforcement learning (RL) in large language model (LLM) post-training, with substantial gains in mathematical reasoning and code generation. In practical systems, however, policy updates and differences between rollout and training engines can make sampled responses off-policy. Sequence-level masking addresses this mismatch by deciding whether an entire response should contribute to optimization. A common masking rule uses the length-normalized geometric mean of sampled token probability ratios. Its signed log-ratios can cancel across positions, concealing substantial bidirectional policy drift. We propose \emph{Cancellation-Aware Response Masking} (CARM), a sequence-level mask that takes the absolute value of each token log-ratio before averaging, preventing opposing probability changes from canceling. We prove that accepted responses satisfy a joint bound on the fraction of sampled-token ratios outside a prescribed band and their mean log-distance beyond its boundaries. Experiments on mathematical reasoning and code generation show that CARM improves mean@16 averaged over AIME 2024/2025/2026 and BeyondAIME by up to $3.13$ percentage points over geometric-mean masking, and increases average pass@1 across four code benchmarks by $2.88$ points over the strongest evaluated baseline. These findings support CARM as a theoretically grounded and effective method for response-level off-policy control in LLM reinforcement learning.
- Abstract(参考訳): 近年、大規模言語モデル(LLM)における強化学習(RL)が急速に普及し、数学的推論やコード生成が大幅に増加した。
しかし、実際のシステムでは、ポリシーの更新とロールアウトとトレーニングエンジンの違いにより、サンプリングされたレスポンスは政治から外れる可能性がある。
シーケンスレベルのマスキングは、レスポンス全体が最適化に寄与するかどうかを決定することで、このミスマッチに対処する。
一般的なマスキング規則では、サンプリングされたトークン確率比の長さ正規化幾何平均を用いる。
サインされたログ比は、位置をまたいでキャンセルすることができ、実質的な双方向ポリシーのドリフトを隠蔽する。
平均化前に各トークンログ比の絶対値を取るシーケンスレベルのマスクであるemph{Cancellation-Aware Response Masking} (CARM)を提案する。
受理応答は、所定の帯域外におけるサンプル-トークン比の分断と、その境界を超える平均対数距離で結合境界を満たすことを証明した。
数学的推論とコード生成の実験によると、CARMは平均@16をAIME 2024/2025/2026とBeyondAIMEで平均3.13ドルまで改善し、4つのベンチマークで平均パス@1を2.88ドルまで高めている。
これらの知見は、LCM強化学習における応答レベルのオフポリチ制御の理論的基礎と効果的な方法として、CARMを支持する。
関連論文リスト
- Verifier-Induced Support Reshaping in On-Policy Optimization [27.782412748608255]
検証可能な報酬(RLVR)によるオンライン強化学習は、現在の目標を改善できる一方で、後の目標に対する行動の成功は、サンプリングや強化が極めて稀であることを示す。
我々は、この検証者によるサポートの再構築と呼び、有効な報奨支援を、固定されたロールアウト予算内で到達可能な軌道として定義する。
論文 参考訳(メタデータ) (2026-07-31T19:05:43Z) - Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment [15.319597516845695]
Selective Importance Smpling (SIS) は拒絶サンプリングにインスパイアされている。
SISは、オフポリシーモデルを提案配布と見なして実装し、トークンレベルの拒否テストを実装する。
SISは、すべての目的を継続的に改善し、非政治データの下では、より強力な堅牢性を提供します。
論文 参考訳(メタデータ) (2026-07-06T06:59:44Z) - Stochastic MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent [53.828537014796574]
オンラインの非政治強化学習(RL)は、ポリシークラスと更新ルールの2つの選択肢によって構成されている。
我々は、MeanFlow変換を通じてノイズをアクションにマッピングする一段階生成ポリシークラスであるMeanFlow Policiesを提案する。
7つのMuJoCoベンチマークで、Sは1ステップの推論効率を維持しながら、ガウスおよび生成ベースラインを改善する。
論文 参考訳(メタデータ) (2026-05-20T15:14:14Z) - Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward [69.99652051809737]
本研究では,検証自由な内在性勾配項再帰(VIGOR)を提案する。
VIGORはポリシーモデルのみを使用する単純な報酬です。
数学データのみに基づいてトレーニングされた場合、コードベンチマークへのクロスドメイン転送を示す。
論文 参考訳(メタデータ) (2026-05-11T03:15:37Z) - Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective [22.848847562976633]
トークンレベルのIS比は、PPOとGRPOが採用しているように、プレフィックス状態の分布ミスマッチを無視してバイアスを導入する。
我々は、累積トークンIS比と、累積対数比の自然な$sqrtt$成長に応じて、対数空間のクリップ境界を拡大する位置適応クリッピングを組み合わせたCTPOを提案する。
論文 参考訳(メタデータ) (2026-05-08T06:35:02Z) - $\nabla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space [71.23672814629448]
$nabla$-Reasonerは、トークンログに対する差別化可能な最適化をデコードループに統合する反復生成フレームワークである。
$nabla$-Reasonerは、挑戦的な数学的推論ベンチマークで20%以上の精度の向上を実現している。
論文 参考訳(メタデータ) (2026-03-05T08:42:54Z) - Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning [17.384089089363382]
既存の手法が見落としている根本原因を同定する。
現在のアプローチでは、グループ内のすべての誤ったロールアウトを同一に扱う。
非対称信頼度を考慮した誤り罰(ACE)を提案する。
論文 参考訳(メタデータ) (2026-02-24T22:46:43Z) - Fast Controlled Generation from Language Models with Adaptive Weighted Rejection Sampling [90.86991492288487]
トークンの制約を評価するのは 違法にコストがかかる
LCDは文字列上のグローバル分布を歪め、ローカル情報のみに基づいてトークンをサンプリングすることができる。
我々のアプローチは最先端のベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2025-04-07T18:30:18Z) - Improving Self-supervised Pre-training via a Fully-Explored Masked
Language Model [57.77981008219654]
Masked Language Model (MLM)フレームワークは、自己教師型言語事前学習に広く採用されている。
そこで本研究では,テキストシーケンスを複数の非重複セグメントに分割するマスキング手法を提案する。
論文 参考訳(メタデータ) (2020-10-12T21:28:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。