論文の概要: RL Post-Training Builds Compositional Reasoning Strategies
- arxiv url: http://arxiv.org/abs/2607.07646v1
- Date: Wed, 08 Jul 2026 17:04:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.471201
- Title: RL Post-Training Builds Compositional Reasoning Strategies
- Title(参考訳): RLポストトレーニングが構成推論戦略を採用
- Abstract要約: トレース分析により、RLは相合成機構を通じて原始的な能力を再編成することが示された。
RFTは多くのショートカットライクな書き換えを生成するが、その多くが無効であり、RLは有効な再利用可能な構造への探索に集中している。
- 参考スコア(独自算出の注目度): 1.7205106391379026
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Does RL post-training merely amplify primitive skills already latent in a base model, or can it compose primitive skills into new higher-level strategies? We study this question in a fully observable rewrite-grammar environment where the pretraining distribution is known and every generated rewrite can be audited. A Transformer is pretrained on primitive symbol-rewrite chains and post-trained on a Trace-based reasoning task with only a binary final-answer reward. RL solves held-out problems that remain rarely solved by the pretrained model even under much larger sampling budgets, while rejection fine-tuning improves early but plateaus. Trace analysis shows that RL reorganizes primitive competence through a phased compositional mechanism: it first strengthens primitive reductions, then discovers valid composed procedures. These include sequential compositions, which collapse ordered chains of primitive contractions, and parallel compositions, which combine independent primitive contractions in a single step. The composed procedures are not isolated samples; they are reused and consolidated into a stable repertoire. Comparing RL with rejection fine-tuning shows that the key difference is not exploration volume but selectivity: RFT produces many shortcut-like rewrites, much of them invalid, whereas RL concentrates exploration into valid reusable structure. Pretraining ablations show that the emergence of compositional strategies is gated not by primitive exposure alone, but by whether pretraining organizes primitive competence into reduction procedures that RL can later compress. The base model provides weak procedural ingredients; RL builds them into reliable higher-level strategies.
- Abstract(参考訳): RLポストトレーニングは、単にベースモデルにすでに潜んでいるプリミティブスキルを増幅するだけなのか、それとも、新しいハイレベル戦略にプリミティブスキルを組み込むことができるのか?
本研究では、事前学習した分布が知られ、生成した書き直しを監査できる完全観測可能な書き直し文法環境において、この問題を考察する。
Transformerはプリミティブなシンボルリライトチェーンで事前トレーニングされ、Traceベースの推論タスクで後トレーニングされる。
RLは、より大規模なサンプリング予算の下でも、事前訓練されたモデルによってほとんど解決されないホールドアウト問題を解決し、拒絶微調整は早期に改善するが、高原は改善する。
トレース分析により、RLは段階的な構成機構によってプリミティブな能力を再編成し、まずプリミティブな還元を強化し、次に有効なコンポジションの手順を発見する。
これらには、原始収縮の順序連鎖を崩壊させる逐次合成や、独立した原始収縮を一つのステップで結合する平行合成が含まれる。
合成された手順は、分離されたサンプルではなく、再利用され、安定したレパートリーに統合される。
RL と拒否微調整を比較すると、重要な違いは探索量ではなく選択性である: RFT は多くのショートカットライクな書き直しを生成し、その多くが無効であり、RL は有効な再利用可能な構造への探索に集中している。
事前訓練は、構成戦略の出現は、原始的な露光だけでなく、事前訓練がRLが後に圧縮できる縮小手順に原始的な能力の組織化を図っているかどうかによって促進されることを示している。
ベースモデルは、弱い手続き的要素を提供し、RLはそれらを信頼性の高い高レベル戦略に構築する。
関連論文リスト
- ExpRL: Exploratory RL for LLM Mid-Training [40.4311030968937]
スパース報酬強化学習(RL)はLLM推論を改善するための標準ツールとなっている。
より自動化されたアプローチについて検討する: emphRL に基づく中級訓練において、人間による質問応答データの大規模なコーパスを用いて検討する。
参照はポリシーから隠され、問題固有のグレーディングルーブを構築するためにのみ使用される。
論文 参考訳(メタデータ) (2026-06-15T17:50:44Z) - Does RL Expand the Capability Boundary of LLM Agents? A PASS@(k,T) Analysis [16.739617199649615]
効率改善から機能拡張を分離する指標であるPASS@(k,T)を紹介する。
我々の主な発見は、静的推論結果とは対照的に、ツール利用RLは機能境界を真に拡大するということです。
一致したトレーニングデータの下では、教師付き微調整は、同じ構成上の境界を回帰させ、因果因子として自己指向的な探索を分離する。
論文 参考訳(メタデータ) (2026-04-16T11:06:19Z) - What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time [57.533031432715084]
TTRL(Test-Time Reinforcement Learning)は、Large Language Models(LLM)が、ラベルのないテストストリームの推論能力を向上することを可能にする。
既存のTTRL法は、正の擬似ラベル戦略にのみ依存している。
本研究では,ラベル雑音増幅を効果的に緩和する堅牢なテスト時間強化学習フレームワークであるSCRLを提案する。
論文 参考訳(メタデータ) (2026-03-20T11:47:12Z) - On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models [73.10315509190623]
最近の強化学習技術は、言語モデルにおいて顕著な推論改善をもたらした。
ポストトレーニングが、事前トレーニング中に取得したものを超えて、モデルの推論能力を真に拡張するかどうかは不明だ。
プレトレーニング,ミッドトレーニング,およびRLベースのポストトレーニングの因果的貢献を分離する,完全に制御された実験フレームワークを開発した。
論文 参考訳(メタデータ) (2025-12-08T18:12:10Z) - From Atomic to Composite: Reinforcement Learning Enables Generalization in Complementary Reasoning [83.94543243783285]
本研究では、内部パラメトリック知識と外部コンテキスト情報の統合を必要とする複雑なタスクである補完的推論について検討する。
RLは確率増幅器ではなく推論合成器として機能する。
論文 参考訳(メタデータ) (2025-12-01T18:27:25Z) - RLoop: An Self-Improving Framework for Reinforcement Learning with Iterative Policy Initialization [65.23034604711489]
大規模な推論モデルをトレーニングするための自己改善フレームワークであるRLoopを紹介します。
RLoopはまず、RLを使用して所定のポリシからソリューション空間を探索し、成功したトラジェクトリをフィルタリングしてエキスパートデータセットを作成する。
実験の結果、RLoopsは一般化を忘れて大幅に改善し、平均精度は9%、pass@32はバニラRLに比べて15%以上向上した。
論文 参考訳(メタデータ) (2025-11-06T11:27:16Z) - Cog-Rethinker: Hierarchical Metacognitive Reinforcement Learning for LLM Reasoning [14.57256913655025]
LLM推論のための新しい階層的メタ認知的RLフレームワークであるCog-Rethinkerを提案する。
我々のCog-Rethinkerは主にRLトレーニングのロールアウト手順に焦点を当てています。
問題解決において人間の認識を活用することにより、ゼロ精度の問題をサブプロブレムに分解するようポリシーに促す。
論文 参考訳(メタデータ) (2025-10-13T08:16:21Z) - A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce [68.99924691391048]
我々はGRPOを強化的なアルゴリズムの観点から再検討し、そのコアコンポーネントを分析する。
単純な拒絶サンプリングベースラインであるRAFTは,GRPOやPPOよりも競争性能が高いことがわかった。
この知見に触発されて、完全に正しくないサンプルと完全に正しいサンプルの両方をフィルタリングするポリシー勾配の最小限の拡張であるReinforce-Rejを提案する。
論文 参考訳(メタデータ) (2025-04-15T16:15:02Z) - REBEL: Reinforcement Learning via Regressing Relative Rewards [59.68420022466047]
生成モデルの時代における最小限のRLアルゴリズムであるREBELを提案する。
理論的には、自然ポリシーグラディエントのような基本的なRLアルゴリズムはREBELの変種と見なすことができる。
我々はREBELが言語モデリングと画像生成に一貫したアプローチを提供し、PPOやDPOとより強くあるいは類似した性能を実現することを発見した。
論文 参考訳(メタデータ) (2024-04-25T17:20:45Z) - When Learning Is Out of Reach, Reset: Generalization in Autonomous
Visuomotor Reinforcement Learning [10.469509984098705]
エピソードトレーニング(英: Episodic training)とは、エージェントの環境が成功や失敗の度にリセットされ、強化学習(RL)エージェントを訓練する際のデファクトスタンダードである。
この研究では、視覚エージェントを構築しながら、リセットを完全に排除するのではなく、最小限にしたいと考えています。
提案手法は, 先行のエピソード, リセットフリー, リセット最小化アプローチよりも高い成功率を達成することができる。
論文 参考訳(メタデータ) (2023-03-30T17:59:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。