論文の概要: Entropy-Regularized Rank-Masked Policy Optimization for Test-Time Reinforcement Learning in Code Generation
- arxiv url: http://arxiv.org/abs/2609.09135v1
- Date: Tue, 08 Sep 2026 17:54:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.71197
- Title: Entropy-Regularized Rank-Masked Policy Optimization for Test-Time Reinforcement Learning in Code Generation
- Title(参考訳): コード生成におけるテスト時間強化学習のためのエントロピー規則付きランクメイクポリシー最適化
- Abstract要約: テストタイム強化学習(TTRL)の既存の方法は、正準解を用いた未ラベルテストタイムタスクに対する回答レベルの自己投票から報奨を得る。
問題文から出力不要なプローブ入力を構築し,これらのプローブ上で候補プログラムを実行するプローブ駆動型TTRLを提案し,その結果の行動合意からプローブ・コンセンサス・リワード(PCR)を定義する。
PCRはオープン・ボキャブラリ・プログラムのための行動訓練信号を提供するが、完全に信頼性のある検証装置ではないため、急激なコンセンサスを通じてハッキングに報いる可能性がある。
- 参考スコア(独自算出の注目度): 18.470572796807094
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing methods for test-time reinforcement learning (TTRL) derive rewards from answer-level self-voting on unlabeled test-time tasks with canonical answers, but this breaks down for code generation because programs cannot be compared by surface form and therefore do not directly provide a usable training signal. To make TTRL applicable to code generation, we propose probe-driven TTRL, which constructs output-free probe inputs from the problem statement, executes candidate programs on these probes, and defines a Probe Consensus Reward (PCR) from the resulting behavioral agreement. PCR provides a behavioral training signal for open-vocabulary programs, but it is not a fully reliable verifier and remains susceptible to reward hacking through spurious consensus. We therefore introduce Entropy-Regularized Rank-Masked Policy Optimization (ERPO), which converts low PCR into conservative negative updates through rank masking and controls policy drift with an entropy ceiling. On coding benchmarks, ERPO substantially improves pass@1 and pass@k in both in-domain adaptation and zero-shot transfer.
- Abstract(参考訳): 既存のテスト時間強化学習(TTRL)の方法は、正準応答を持つ未ラベルテスト時間タスクに対する回答レベルの自己投票から報奨を得るが、プログラムを表面形式で比較できないため、コード生成では分解されるため、直接トレーニング信号は提供されない。
本稿では,TTRLをコード生成に適用するために,問題文から出力不要なプローブ入力を構築し,これらのプローブ上で候補プログラムを実行するプローブ駆動型TTRLを提案し,その結果の行動合意からプローブ・コンセンサス・リワード(PCR)を定義する。
PCRはオープン・ボキャブラリ・プログラムのための行動訓練信号を提供するが、完全に信頼性のある検証装置ではないため、急激なコンセンサスを通じてハッキングに報いる可能性がある。
そこで,Entropy-Regularized Rank-Masked Policy Optimization (ERPO)を導入した。
コーディングベンチマークでは、ERPOはドメイン内適応とゼロショット転送の両方においてpass@1とpass@kを大幅に改善する。
関連論文リスト
- Latent Reward Registers for Diffusion Preference Alignment [46.49072106092868]
本稿では,中間雑音の遅延から端末の好みを推定するメカニズムであるLatent Reward Registersを提案する。
この独立した読み出し機構は、発電機の隠された状態や速度場を変えることなく、潜伏した報酬証拠を抽出する。
トレーニングのために、Reward-Gradient On-Policy Distillation (RG-OPD) は、標準的な政策勾配の計算的に高価なロールアウトを回避し、報酬誘導された更新をオンライン軌道に沿って蒸留する。
推論のためには、Reward-Guided Sampling (RGS) はパラメータ更新なしで大小マッチングされた報酬勾配を経由する。
論文 参考訳(メタデータ) (2026-08-04T17:00:52Z) - LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL [64.4276583943816]
検証不能な指導のための強化学習は、報酬信号としてプロンプト固有のルーリックを持つ裁判官に依存している。
最近の手法は、トレーニング中にこれらのルーリックを進化するポリシーに適応させるが、トレーニングのプロンプト自体は静的のままである。
この静的なアプローチは、しばしば急激な困難と政策能力の間に重大なミスアライメントをもたらし、裁判官は差別的な報酬信号を取り戻すことができない。
論文 参考訳(メタデータ) (2026-07-05T17:05:13Z) - Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning [50.738952715864116]
表現的連続制御ポリシは、シミュレーションされた実ロボット制御のための模倣学習のスケーリングにおける進歩のバックボーンを形成する。
テスト時に完全にポリシー最適化を行うRLアルゴリズムであるQGF(Q-Guided Flow)を提案する。
実証的には、QGFはシングルタスクおよびゴール条件のオフラインRLベンチマークにおいて、以前のテスト時間RLメソッドよりも優れている。
論文 参考訳(メタデータ) (2026-06-09T16:45:57Z) - Return-to-Go Is More Than a Number: Q-Guided Alignment for Return-Conditioned Supervised Learning [18.76637029534068]
条件付きシーケンスモデル(CSM)は、RTG(Return-to-go)を制御信号として扱うことでポリシーを学習する。
このアライメントを強制するフレームワークであるQ-ALIGN DTを提案する。
本稿では,Q-ALIGN DTが所望のポリシーを効率的に学習し,ほぼ最適に出力できることを示す。
論文 参考訳(メタデータ) (2026-05-27T19:24:35Z) - Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward [69.99652051809737]
本研究では,検証自由な内在性勾配項再帰(VIGOR)を提案する。
VIGORはポリシーモデルのみを使用する単純な報酬です。
数学データのみに基づいてトレーニングされた場合、コードベンチマークへのクロスドメイン転送を示す。
論文 参考訳(メタデータ) (2026-05-11T03:15:37Z) - What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time [57.533031432715084]
TTRL(Test-Time Reinforcement Learning)は、Large Language Models(LLM)が、ラベルのないテストストリームの推論能力を向上することを可能にする。
既存のTTRL法は、正の擬似ラベル戦略にのみ依存している。
本研究では,ラベル雑音増幅を効果的に緩和する堅牢なテスト時間強化学習フレームワークであるSCRLを提案する。
論文 参考訳(メタデータ) (2026-03-20T11:47:12Z) - Testing Stationarity and Change Point Detection in Reinforcement Learning [9.468399367975984]
予め収集した履歴データに基づいて最適なQ-関数の非定常性をテストする一貫した手順を開発する。
さらに、非定常環境における政策最適化のための既存の最先端RL手法と自然に結合可能な逐次変化点検出法を開発した。
論文 参考訳(メタデータ) (2022-03-03T13:30:28Z) - Pessimistic Bootstrapping for Uncertainty-Driven Offline Reinforcement
Learning [125.8224674893018]
オフライン強化学習(RL)は、環境を探索することなく、以前に収集したデータセットからポリシーを学ぶことを目的としている。
オフポリシーアルゴリズムをオフラインRLに適用することは、通常、オフ・オブ・ディストリビューション(OOD)アクションによって引き起こされる外挿エラーによって失敗する。
本稿では,PBRL(Pepsimistic Bootstrapping for offline RL)を提案する。
論文 参考訳(メタデータ) (2022-02-23T15:27:16Z) - Supervised Advantage Actor-Critic for Recommender Systems [76.7066594130961]
本稿では、RL成分を学習するための負のサンプリング戦略を提案し、それを教師付き逐次学習と組み合わせる。
サンプル化された(負の)作用 (items) に基づいて、平均ケース上での正の作用の「アドバンテージ」を計算することができる。
SNQNとSA2Cを4つのシーケンシャルレコメンデーションモデルでインスタンス化し、2つの実世界のデータセットで実験を行う。
論文 参考訳(メタデータ) (2021-11-05T12:51:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。