論文の概要: Right in the Right Way: LM Training with Verifiable Rewards and Human Demonstrations
- arxiv url: http://arxiv.org/abs/2607.01181v1
- Date: Wed, 01 Jul 2026 17:13:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:08.001942
- Title: Right in the Right Way: LM Training with Verifiable Rewards and Human Demonstrations
- Title(参考訳): 正しい道のり:検証可能なリワードと人間のデモによるLMトレーニング
- Abstract要約: 本稿では,人間による実演からの学習信号を用いて,検証可能な報酬を増大させる逆生成・差別化フレームワークを提案する。
提案手法は,RLVRの精度向上を保ちながら,不検証特性を常に改善する。
バグ修正では,RLVRベースラインに比べて編集距離が大幅に低い。
- 参考スコア(独自算出の注目度): 46.90253276172931
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: RL with verifiable rewards (RLVR) has emerged as a powerful paradigm for training LMs on tasks with well-defined success metrics, such as code generation and mathematical reasoning. However, current RLVR methods optimize only what can be objectively scored, often neglecting subjective, non-verifiable aspects of human-like outputs, such as style and structure. This limitation leads to well-documented failure modes such as diversity collapse, unnatural-sounding responses, and reward hacking. We propose an adversarial generator-discriminator framework that augments verifiable rewards with a learned signal from human demonstrations. A generator model is trained using RL to maximize both task accuracy and an adversarial reward derived from a discriminator. The discriminator, trained alongside the generator policy, learns to distinguish human-written outputs from model-generated ones. The discriminator serves as a learned proxy for the human output distribution, providing feedback on aspects of generation that are difficult to formalize as scalar rewards. Across diverse domains, including bug fixing and open-ended generation, our approach consistently improves non-verifiable properties while preserving the accuracy gains of RLVR. In bug fixing, our method produces solutions with significantly lower edit distance compared to RLVR baselines while matching end performance. In story generation, our method significantly improves win rate while producing stories that are diverse and more human-like. And in a simple reward hacking benchmark, our method nearly eliminates model misbehavior while maintaining high benchmark scores. Together, these results show that our approach bridges RL and SFT, offering a scalable path toward jointly optimizing the verifiable and non-verifiable properties of a task.
- Abstract(参考訳): 検証可能な報酬(RLVR)を持つRLは、コード生成や数学的推論など、明確に定義された成功指標を持つタスクにおいて、LMをトレーニングするための強力なパラダイムとして登場した。
しかし、現在のRLVR手法は、客観的に得られるものだけを最適化し、しばしば、スタイルや構造など、人間のようなアウトプットの主観的で検証不可能な側面を無視している。
この制限は、多様性の崩壊、不自然に聞こえる応答、報酬のハッキングなど、文書化された障害モードにつながる。
本稿では,人間による実演からの学習信号を用いて,検証可能な報酬を増大させる逆生成・差別化フレームワークを提案する。
ジェネレータモデルは、RLを用いて訓練され、タスク精度と判別器から導出される対角報酬の両方を最大化する。
ジェネレータポリシーと共に訓練された判別器は、人書き出力とモデル生成出力を区別することを学ぶ。
判別器は人間の出力分布の学習プロキシとして機能し、スカラー報酬として形式化が難しい生成の側面に対するフィードバックを提供する。
バグ修正やオープンエンド生成など,さまざまな領域において,RLVRの精度向上を保ちながら,検証不能な特性を一貫して改善する。
バグ修正では,RLVRベースラインに比べて編集距離が大幅に小さく,最終性能が一致した。
ストーリー生成において,本手法は多種多様で人間的に近いストーリーを生成しながら,勝利率を大幅に向上させる。
そして、単純な報奨ハッキングベンチマークでは、高いベンチマークスコアを維持しながらモデルの誤動作をほぼ排除する。
これらの結果は、我々のアプローチがRLとSFTを橋渡しし、タスクの検証可能かつ検証不能な特性を協調的に最適化するためのスケーラブルな経路を提供することを示している。
関連論文リスト
- Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL [55.05743310621117]
Co-RLは、パラメータを共有しない複数の分離されたモデルを、仲間から派生した報酬を使ってRLを通じて同時に最適化するフレームワークである。
我々は,コホート多様性の増大が,自己強化フィードバックループを駆動する相関誤差を減少させることを示す。
論文 参考訳(メタデータ) (2026-08-18T01:16:02Z) - When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study [77.64957118012423]
検証可能な報酬(RLVR)による強化学習は、大規模言語モデル推論において大きな進歩をもたらした。
最近の研究は、多数決や信頼に基づくスコアなど、モデル自身の信号から報酬を導き出すことによって、この問題に対処している。
本稿では,コード生成における本質的な報酬手法の体系的研究について述べる。
論文 参考訳(メタデータ) (2026-06-18T19:15:50Z) - Improving Small Language Models for Code Generation with Reinforcement Learning from Verification Feedback [0.0]
検証可能な(RLVR)言語モデルを用いた強化学習は、単体テスト結果を用いて訓練する。
MBPPベンチマークを用いたPythonコード生成のためのRLVRの実証的研究を行った。
その結果、コード生成におけるRLVRの有効性は、設計と最適化に非常に敏感であることがわかった。
論文 参考訳(メタデータ) (2026-05-28T18:50:00Z) - Every Question Has Its Own Value: Reinforcement Learning with Explicit Human Values [53.72318444646282]
RLEV(Reinforcement Learning with Explicit Human Values)を提案する。
RLEVは、Large Language Model (LLM) 最適化を直接、定量化された人間の値信号と整合させる。
RLEVは、複数のRLアルゴリズムとモデルスケールで、精度のみのベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2025-10-23T04:15:22Z) - ConfClip: Confidence-Weighted and Clipped Reward for Reinforcement Learning in LLMs [32.13266235550995]
強化学習(RL)は、大規模言語モデル(LLM)の標準化の標準パラダイムとなっている。
人間の学習から得られた観察から着想を得て、検証可能な結果とモデル自身の信頼度推定を統合するRL手法を導入する。
論文 参考訳(メタデータ) (2025-09-22T13:00:35Z) - Writing-Zero: Bridge the Gap Between Non-verifiable Tasks and Verifiable Rewards [11.149294285483782]
我々は、検証不可能なタスクと検証可能な報酬のギャップを埋める統一的なRLVRベースのトレーニングパラダイムを提案する。
本稿では,GenRMとBootstrapped Relative Policy Optimization (BRPO)アルゴリズムを提案する。
提案手法は,LLMが微調整を監督せずに堅牢な書込み機能を開発する上で有効である。
論文 参考訳(メタデータ) (2025-05-30T14:34:57Z) - Learning to Reason without External Rewards [100.27210579418562]
RLVR(Reinforcement Learning with Verifiable Rewards)による複雑な推論のための大規模言語モデル(LLM)の訓練は、費用がかかるドメイン固有の監督に依存して効果的であるが制限されている。
内部フィードバックからの強化学習(Reinforcement Learning from Internal Feedback, RLIF)は、LLMが外部の報酬やラベル付きデータなしで本質的な信号から学習できるフレームワークである。
本稿では,モデル自身の信頼度を利用したRLIF手法であるIntuitorについて,その唯一の報奨信号として自己確実性(self-certainty)を提案する。
論文 参考訳(メタデータ) (2025-05-26T07:01:06Z) - REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback [61.54791065013767]
報酬関数と人間の嗜好の相違は、現実世界で破滅的な結果をもたらす可能性がある。
近年の手法は、人間の嗜好から報酬関数を学習することで、不適応を緩和することを目的としている。
本稿では,ロボットRLHFフレームワークにおける報酬正規化の新たな概念を提案する。
論文 参考訳(メタデータ) (2023-12-22T04:56:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。