論文の概要: Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2605.02073v2
- Date: Fri, 08 May 2026 17:11:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-11 16:31:22.63795
- Title: Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning
- Title(参考訳): 探索駆動強化学習による逆関数最適化によるLLM推論の強化
- Abstract要約: 本稿では,報酬仕様自体を最適化の対象として扱う検索駆動型フレームワークを提案する。
最高のアンサンブルは F1 = 0.795 95% ブートストラップ CI [0.756, 0.832]) と精度 0.660 [0.635, 0.686] を達成する。
- 参考スコア(独自算出の注目度): 0.4285416351982749
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mathematical reasoning is a key benchmark for large language models. Reinforcement learning is a standard post-training mechanism for improving the reasoning capabilities of large language models, yet performance remains sensitive to the design of the reward function that drives policy optimization. This paper introduces a search-driven framework that treats the reward specification itself as an object of optimization. The setting of interest is one in which the base model is held fixed and the reward specification is the primary remaining design lever. Candidate reward functions are generated by a frontier language model, validated automatically, screened through 500-step Group Relative Policy Optimization (GRPO) training runs on a Llama-3.2-3B-Instruct base model with Low-Rank Adaptation (LoRA), and ranked by F1 on the GSM8K test set. Ranked summaries from prior rounds are then fed back into the next round of generation. Over five rounds, the search produces 50 candidate rewards. The mean F1 rises from 0.596 in Round 1 to 0.632 in Round 5, and the top individual reward reaches F1 = 0.787. Seven ensemble configurations of top-ranked rewards are evaluated. The best ensemble achieves F1 = 0.795 (95% bootstrap CI [0.756, 0.832]) and accuracy 0.660 [0.635, 0.686], a 0.19 absolute F1 gain over a base-rewards-only GRPO baseline (F1 = 0.609). Pairwise McNemar tests with Bonferroni correction show all five-or-more-reward configurations are statistically indistinguishable at α = 0.05/21. A three-seed re-training of the best ensemble yields F1 of 0.785. A randomly drawn 5-reward control collapses to F1 = 0.047, which shows that the ranked-feedback loop, not the additive signal of having more rewards, drives the gain.
- Abstract(参考訳): 数学的推論は、大きな言語モデルにとって重要なベンチマークである。
強化学習(Reinforcement learning)は、大規模言語モデルの推論能力を改善するための標準的なポストトレーニングメカニズムであるが、性能は政策最適化を駆動する報酬関数の設計に敏感である。
本稿では,報酬仕様自体を最適化の対象として扱う検索駆動型フレームワークを提案する。
関心の設定は、ベースモデルを固定し、報酬仕様を主要な設計レバーとするものである。
候補報酬関数はフロンティア言語モデルによって生成され、自動検証され、500ステップのグループ相対ポリシー最適化(GRPO)トレーニングによってLlama-3.2-3B-Instruct base model with Low-Rank Adaptation (LoRA)上で実行され、GSM8KテストセットでF1でランク付けされる。
前のラウンドのランク付けされたサマリーは次のラウンドに返される。
5回以上のラウンドで、検索は50の候補報酬を生み出す。
F1の平均はラウンド1の0.596からラウンド5の0.632に上昇し、トップ個人報酬はF1 = 0.787に達する。
トップランクの報酬のアンサンブル構成を7つ評価した。
最高のアンサンブルは、F1 = 0.795 (95%ブートストラップCI [0.756, 0.832]) と精度 0.660 [0.635, 0.686] を達成する。
Pairwise McNemar test with Bonferroni corrects shows all five-or-more-reward configurations are statistically undistingishible at α = 0.05/21。
ベストアンサンブルの3シード再訓練により、F1は0.785となる。
ランダムに引き出された5逆制御はF1 = 0.047に崩壊し、より多くの報酬を持つ付加信号ではなく、ランク付けされたフィードバックループがゲインを駆動することを示す。
関連論文リスト
- Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization [60.89431018071735]
グループ相対的な優位性を持つ強化学習は、訓練後の言語モデル推論のデファクトスタンダードとなっている。
異なる報酬プロファイルを持つロールアウトは、同じ利点を享受でき、現在の飽和度に関わらず、全ての目的が固定相対重みで最適化されることを示す。
本研究では,各報酬目標を独立に標準化し,目標飽和度をバッチレベルで推定した値に従って貢献を適応的に割引する飽和度認識再重み付けを導入する。
論文 参考訳(メタデータ) (2026-08-17T04:07:50Z) - Models for minimalist RAG: B1ade 335M Embedding and 1B Parameter Small Language Models [2.1665689529884697]
本稿では,コンパクトな埋め込みモデルと汎用SLMの2つのコンポーネントからなる効率的なRAGアーキテクチャであるB1adeについて述べる。
5つの事前訓練エンコーダのパラメータフリー融合により構築された335Mパラメータ検索モデルであるB1ade-embedは、追加トレーニングをゼロとした500M未満モデルの上位MTEBスコアを達成する。
B1ade-1Bは42.4%の反応で回収された通路を引用し、トレーニング分布の寄与率を5.5ポイント上回っている。
論文 参考訳(メタデータ) (2026-07-29T22:41:25Z) - CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents [1.4298580363875282]
結果のみの強化学習によるマルチターンエビデンス読解エージェントのトレーニングは、中間旋回が直接クレジットをほとんど受け取らないため不安定である。
Qwen2.5-3B-InstructによるHotpotQA実験では、GRPOは最初(標準F1 0.430)改善されたが、その後100%フォーマット違反の出力に崩壊する。
本研究では,各ターン当たりの報酬を中間的エビデンス読解ターンに割り当てることで,グループ報酬分布が1つの値に崩壊するのを防ぐ,分散テキスト戦略を提案する。
論文 参考訳(メタデータ) (2026-06-26T11:50:29Z) - Consolidating Rewarded Perturbations for LLM Post-Training [18.379594820233173]
CoRPは、報酬重み付けアグリゲーション、互換性を意識した再重み付け、ホールドアウトバリデーションゲートを組み合わせた、勾配のない演算子である。
我々は、CoRPがシングル推論のRandOptを6.5ポイント超え、50パスの多数投票アンサンブルの利得の半分以上を回復することを示した。
論文 参考訳(メタデータ) (2026-05-29T16:16:13Z) - REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge [83.2858110368572]
回帰報酬を最適化するための原則的RLフレームワークである textbfREAL (underlineREgression-underlineAware Reinforcement underlineLThought) を提案する。
我々は,REALがレグレッション対応SFTベースラインと標準RL法の両方を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-03-17T21:19:08Z) - iGRPO: Self-Feedback-Driven LLM Reasoning [88.83313431248473]
大規模言語モデル(LLM)は複雑な数学的問題を解く上で有望であるが、正確で一貫したソリューションを生み出すには至っていない。
IGRPO(Iterative Group Relative Policy Optimization)は、モデル生成ドラフトを通じて動的自己条件を追加するGRPOの2段階拡張である。
一致するロールアウト予算の下では、iGRPOはGRPOをベースモデルで一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-09T18:45:11Z) - GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization [133.27496265096445]
我々は,グループ相対的政策最適化を,その適合性を検討することなく,マルチリワード設定で適用する方法を示す。
次に、これらの問題を解決するための新しい政策最適化手法であるグループ報酬分離正規化政策最適化(GDPO)を紹介する。
GDPOはGRPOを一貫して上回り、マルチリワード強化学習最適化の有効性と一般化性を示す。
論文 参考訳(メタデータ) (2026-01-08T18:59:24Z) - VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks [49.0793012627959]
本稿では,価値に基づくパラダイム内での推論モデルに適した新しいフレームワークVAPOを提案する。
VAPOは最先端のスコアが$mathbf60.4$に達する。
同じ実験条件下で直接比較すると、VAPOはDeepSeek-R1-Zero-Qwen-32BとDAPOの結果を10点以上上回っている。
論文 参考訳(メタデータ) (2025-04-07T14:21:11Z) - CrowdVLM-R1: Expanding R1 Ability to Vision Language Model for Crowd Counting using Fuzzy Group Relative Policy Reward [9.498518612326322]
Fuzzy Group Relative Policy Reward (FGRPR)
本稿では,グループ相対政策最適化とファジィ報酬関数を統合し,学習効率を向上させる新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-31T03:57:16Z) - UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning [31.796328505473305]
UI-R1は、ルールベースのRLがGUIアクション予測タスクのためのマルチモーダル大言語モデル(MLLM)の推論能力をどのように向上するかを探求する最初のフレームワークである。
具体的には、UI-R1が新しいルールベースのアクション報酬を導入し、グループ相対ポリシー最適化(GRPO)のようなポリシーベースのアルゴリズムによるモデル最適化を可能にする。
効率的なトレーニングのために、モバイルデバイス上で5つの一般的なアクションタイプを含む136の課題タスクからなる、小さくて高品質なデータセットをキュレートする。
論文 参考訳(メタデータ) (2025-03-27T15:39:30Z) - Advancing LLM Reasoning Generalists with Preference Trees [119.57169648859707]
推論に最適化された大規模言語モデル(LLM)のスイートであるEulusを紹介する。
Eurusモデルは、様々なベンチマークでオープンソースのモデルの間で最先端の結果を得る。
論文 参考訳(メタデータ) (2024-04-02T16:25:30Z) - Gestalt: a Stacking Ensemble for SQuAD2.0 [0.0]
本稿では,文脈文中の質問に対する正しい回答を見つけ出し,提示する深層学習システムを提案する。
我々のゴールは、各アンサンブルで最高のモデルを上回る異種SQuAD2.0モデルのアンサンブルを学習することである。
論文 参考訳(メタデータ) (2020-04-02T08:09:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。