論文の概要: Tandem Reinforcement Learning with Verifiable Rewards
- arxiv url: http://arxiv.org/abs/2606.28166v1
- Date: Fri, 26 Jun 2026 15:00:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.527712
- Title: Tandem Reinforcement Learning with Verifiable Rewards
- Title(参考訳): 検証可能なリワードを用いたタンデム強化学習
- Authors: Difan Jiao, Raghav Singhal, Robert West, Ashton Anderson,
- Abstract要約: 検証可能な報酬付き強化学習(RLVR)は,大規模言語モデルの推論能力を大幅に向上させた。
本稿では,タンデム学習パラダイムをRLVRに導入したタンデム強化学習(TRL)を提案する。
この結果から,マルチモデル通信と人間との互換性を両立させたRLVRの実現が期待できることを示す。
- 参考スコア(独自算出の注目度): 18.804612732694576
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) has significantly improved the reasoning capability of large language models, reaching expert or even superhuman performance in domains such as competition math. However, whether weaker agents and humans can actually harness this capability is far less certain, with RLVR documented to drift reasoning toward idiosyncratic patterns such as poor readability and language mixing. Tandem training is a recently introduced paradigm that targets this compatibility problem: a trained, stronger senior co-generates each rollout with a frozen, weaker junior, and the two are rewarded as a team, so the senior is pushed to reason in ways the junior can follow. Yet this paradigm has so far been demonstrated only in proof-of-concept settings, leaving open whether it scales to the long chains of thought of the modern RLVR pipeline. In this work, we propose Tandem Reinforcement Learning (TRL), which carries the tandem training paradigm into RLVR. In TRL, the senior and a frozen junior alternate stochastically to co-generate the reasoning, the resulting generation is rewarded, and the standard GRPO loss is applied to the senior. Training Qwen3-4B-Instruct on competition math, we find that TRL matches vanilla GRPO on solo reasoning capability while three properties emerge together from the same rollout structure: stronger handoff robustness with the junior, reduced distributional drift from the junior, and a chain-of-thought more legible to the junior. Our results demonstrate a promising route for RLVR with practical payoffs in multi-model communication and human compatibility.
- Abstract(参考訳): 検証可能な報酬付き強化学習(RLVR)は、大きな言語モデルの推論能力を大幅に向上させ、競争数学のような分野のエキスパートや超人的パフォーマンスにまで達した。
しかし、弱いエージェントや人間が実際にこの能力を利用することができるかどうかについては、RLVRは可読性や言語混合などの慣用的なパターンへの推論をドリフトするために文書化されているため、かなり確実ではない。
トレーニングされたより強いシニアは、凍結したより弱いジュニアで各ロールアウトを共同生成し、2人はチームとして報酬を受けます。
しかし、このパラダイムは概念実証の設定でのみ実証されており、現在のRLVRパイプラインの長いチェーンにスケールするかは、未解決のままである。
本稿では,タンデム学習パラダイムをRLVRに導入したタンデム強化学習(TRL)を提案する。
TRLでは、上と凍結後年が確率的に交互に推論を共生成し、結果として生じる生成に報酬を与え、標準のGRPO損失を上に適用する。
Qwen3-4B-Instruct on competition math, we found that TRL match vanilla GRPO on solo reasoning capabilities while three properties emerge together from the same rollout structure: strong handoff robustness with theJunior, reduce distributional drift from theJunior, and a chain of Thought more legible to theJunior。
この結果から,マルチモデル通信と人間との互換性を両立させたRLVRの実現が期待できることを示す。
関連論文リスト
- GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero [15.236247092411164]
ポストトレーニングは、大きな言語モデルの能力をアンロックするための重要なステップになっている。
オープンエンド環境における小さな相互作用の集合からスクラッチから学習したRLHFの一般化能力について検討した。
提案手法は,数学的推論やコード生成といった下流タスクに暗黙的に移行できるかどうかを考察する。
論文 参考訳(メタデータ) (2026-05-14T23:05:23Z) - Context Bootstrapped Reinforcement Learning [51.213972559315486]
Reinforcement Learning from Verifiable Rewards (RLVR) は、探索の非効率さに悩まされている。
我々は,数発のデモをトレーニングプロンプトに先立ってRLVRトレーニングを増強するContextped Bootstrapped Reinforcement Learning (CBRL)を提案する。
CBRLは、成功率を一貫して改善し、探索効率を向上し、アルゴリズムに依存しない。
論文 参考訳(メタデータ) (2026-03-19T14:23:59Z) - On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models [73.10315509190623]
最近の強化学習技術は、言語モデルにおいて顕著な推論改善をもたらした。
ポストトレーニングが、事前トレーニング中に取得したものを超えて、モデルの推論能力を真に拡張するかどうかは不明だ。
プレトレーニング,ミッドトレーニング,およびRLベースのポストトレーニングの因果的貢献を分離する,完全に制御された実験フレームワークを開発した。
論文 参考訳(メタデータ) (2025-12-08T18:12:10Z) - Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL [19.659532349434418]
強化学習(Reinforcement Learning, RL)は、近年、大規模言語モデルの推論能力を強化する主要なパラダイムとなっている。
しかし、数学やプログラミングのベンチマークで一般的に使われるルールベースの報酬関数は、応答形式と正しさのみを評価する。
本稿では,報酬と有利な信号の両方を再生するプラグイン・アンド・プレイのRL報酬フレームワークであるDynamic Reasoning Efficiency Reward (DRER)を提案する。
論文 参考訳(メタデータ) (2025-09-07T11:52:18Z) - Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models [56.055015597319674]
検証可能な報酬(RLVR)を用いた強化学習は,大規模言語モデル(LLM)の推論能力の向上に有効である
近年の自己回帰法は LLM の推論能力を解き放つためのラベルフリーな代替手段について検討している。
我々は、他の視点から補完的な監督を求めることにより、トレーニングの安定性を向上させる新しい自己監督型RLフレームワークであるtextitCo-rewardingを提案する。
論文 参考訳(メタデータ) (2025-08-01T08:09:14Z) - OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling [29.818409458662344]
LlamaやQwenのような異なる言語モデルファミリーは、強化学習(RL)による後訓練中に異なる行動を示す
本研究では,MegaMath-Web-Proのような高品質な数学的コーパスがベースモデルとRL性能の両方を著しく改善することを明らかにする。
2段階の中間訓練戦略であるStable-then-Decayを導入し、ベースモデルを学習率を一定とした200Bトークンでトレーニングし、その後CoTに着目した3つのブランチで20Bトークンを学習速度を劣化させた。
論文 参考訳(メタデータ) (2025-06-25T14:58:13Z) - Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning [87.7836502955847]
本稿では,Large Language Model (LLM)推論を強化するための,自己回帰型強化学習フレームワークを提案する。
私たちのキーとなる洞察は、正しい応答はモデルの可能性の観点から一貫した軌道パターンを示すことが多いということです。
本稿では,安定度とボラティリティを,頑健なベクトル空間集約戦略を通じて統合する,本質的な報酬機構であるCoVoを紹介する。
論文 参考訳(メタデータ) (2025-06-10T12:40:39Z) - Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models [50.4652276723694]
Think-RMは、高度な機能をサポートするフレキシブルで自己誘導的な推論トレースを生成する。
Think-RM は RM-Bench 上で最先端の結果を達成し,BT RM と GenRM の垂直スケールを8% 上回った。
論文 参考訳(メタデータ) (2025-05-22T05:56:11Z) - GTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-based VLM Agent Training [62.536191233049614]
検証結果報酬(RLVR)を用いた強化学習は、大規模言語モデル(LLM)におけるチェーン・オブ・ソート(CoT)推論を効果的にスケールアップした。
本研究は、24点やALFWorldの具体化タスクなど、複雑なカードゲームに関する広範な実験を通じてこの問題を調査する。
報酬が行動結果にのみ基づく場合、RLはVLMにおけるCoT推論の動機付けに失敗し、代わりに思考崩壊と呼ばれる現象が生じる。
論文 参考訳(メタデータ) (2025-03-11T15:17:02Z) - Robust Reinforcement Learning as a Stackelberg Game via
Adaptively-Regularized Adversarial Training [43.97565851415018]
ロバスト強化学習(RL)は、モデルエラーや敵攻撃によるパフォーマンス向上に重点を置いている。
既存の文献の多くは、解の概念としてナッシュ平衡を伴うゼロサム同時ゲームとして RARL をモデル化している。
RRL-Stackと呼ばれる一般のStackelbergゲームモデルである、ロバストなRLの階層的な新しい定式化を導入する。
論文 参考訳(メタデータ) (2022-02-19T03:44:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。