論文の概要: RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.09123v1
- Date: Mon, 10 Aug 2026 05:02:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.086679
- Title: RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning
- Title(参考訳): RISE-RL:オープンエンディング強化学習のためのルーブリック型選択探索
- Abstract要約: 我々は、繰り返し欠落したルーブリック基準を用いて特権トラジェクトリを誘導する、$textbfRISE-RL$(Rubric-Informed Selective Exploration)を提案する。
RISE-RLは、完全なルーブリックな報酬が自然なロールアウトの平均的な報酬を超える軌道のみを保持する。
4Bスケールで1.3ポイント、14Bスケールで$textbf3.3ポイント、CreativeWriting-V3で$textbf6.0-point$ゲインを含む平均スコアを改善する。
- 参考スコア(独自算出の注目度): 31.35146691876858
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Aligning Large Language Models (LLMs) for open-ended tasks is challenging because responses must satisfy multidimensional criteria without following a single correct generation trajectory. Existing rubric-based reinforcement learning (RL) methods compress fine-grained criterion-level feedback into scalar rewards, making persistent capability gaps difficult to target under limited on-policy exploration. We propose $\textbf{RISE-RL}$ (Rubric-Informed Selective Exploration), which uses repeatedly missed rubric criteria to elicit privileged trajectories that are difficult to discover through unguided exploration alone. RISE-RL retains only trajectories whose complete-rubric reward exceeds the mean reward of natural rollouts, and then re-evaluates them under the original prompt to emphasize behaviors that remain weakly supported by the natural policy. The resulting guidance signal is optimized through a separate auxiliary objective and removed once its additional benefit diminishes. Experiments with 4B and 14B models across writing, chat, health, and science show that RISE-RL achieves the highest mean score on every evaluated benchmark under guidance-free evaluation. Compared with standard Rubric-RL, it improves the average score by 1.3 points at the 4B scale and $\textbf{3.3 points at the 14B scale}$, including a $\textbf{6.0-point}$ gain on CreativeWriting-V3. It also improves creative-writing diversity and yields gains on objectively scored medical and scientific benchmarks. These results indicate that selective internalization through reward filtering and policy support shaping is effective for open-ended reinforcement learning.
- Abstract(参考訳): オープンエンドタスクのための大規模言語モデル(LLM)の調整は、応答は1つの正しい生成軌跡に従うことなく多次元の基準を満たす必要があるため困難である。
既存のルーリック型強化学習 (RL) 法では, 細粒度レベルのフィードバックをスカラー報酬に圧縮し, 限定的なオン・ポリティクス探査において, 目標とする能力ギャップの持続化を困難にしている。
本稿では,無誘導探索だけでは見つからない特権的軌跡を抽出するために,繰り返し欠落したルーブリック基準を用いて,$\textbf{RISE-RL}$(Rubric-Informed Selective Exploration)を提案する。
RISE-RLは、完全なルーブリックな報酬が自然のロールアウトの平均的な報酬を超える軌道のみを保持し、その後、自然政策によって弱く支えられている行動を強調するために、元のプロンプトの下でそれらを再評価する。
得られた誘導信号は別個の補助目標によって最適化され、追加の利益が減少すると除去される。
書き込み、チャット、健康、科学にまたがる4Bモデルと14Bモデルによる実験では、RISE-RLはガイダンスなし評価の下で評価されたベンチマークで最高の平均スコアを達成している。
通常の Rubric-RL と比較すると、平均スコアは 4B スケールで 1.3 ポイント、14B スケールで $\textbf{3.3 ポイント、CreativeWriting-V3 で $\textbf{6.0-point}$ ゲインを含む。
また、創造的な筆記の多様性を改善し、客観的に評価された医学的および科学的なベンチマークで利益を得る。
これらの結果から,報酬フィルタリングと政策支援形成による選択的内部化が,オープンエンド強化学習に有効であることが示唆された。
関連論文リスト
- ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning [74.19730275669227]
ARISE-RLは、オープンエンドエージェントをトレーニングするための新しいフルサイクルの自己進化フレームワークである。
Reward-Gated Self-Evolution Distillation (RG-SED)を提案する。
ECR-Benchは,シングルツールディープリサーチとマルチツールトラベルプランニングを対象とする,専門家校正型ルーリックベンチマークスイートである。
論文 参考訳(メタデータ) (2026-09-01T10:54:13Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - VeriGate: Verifier-Gated Step-Level Supervision for GRPO [51.26100506256885]
グループ相対政策最適化は、検証者に基づく結果報酬を伴う推論モデルをトレーニングするための効果的なレシピである。
GRPO の検証子付き拡張である VeriGate を提案し,これらの制限を3つの設計選択で解決する。
We show that VeriGate improves average accuracy around 20% and 12% for 1.5B and 7B models respectively。
論文 参考訳(メタデータ) (2026-05-28T18:20:32Z) - Reinforcement Learning with Robust Rubric Rewards [30.826907231502663]
本稿では,ロバスト・リワードによる強化学習(textRLR3$)を提案し,RLVRをタスクレベルの検証から基準レベルの検証まで拡張する。
$textRLR3$は2つの実行パスを通してインスタンス固有のルーリックをルーティングする。
textRLR3$はRLVRを一貫して上回り、ベースモデルよりも4.7ポイント向上し、公式のインストラクション・ツー・シンキングモデルギャップを超えた。
論文 参考訳(メタデータ) (2026-05-28T17:11:03Z) - Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR [53.27792011950384]
検証可能な報酬付き強化学習(RLVR)は、大規模言語モデルの推論能力を改善するためのスケーラブルなパラダイムとして登場した。
我々は、RLVRにおける構造化及び多様性駆動探索のためのフレームワークであるNudgeRLを提案する。
当社のアプローチでは,各ロールアウトを,軽量で戦略レベルのコンテキストに設定するストラテジーナッジを導入しています。
論文 参考訳(メタデータ) (2026-05-15T08:22:59Z) - Bootstrapping Exploration with Group-Level Natural Language Feedback in Reinforcement Learning [56.29188272643489]
GOLFは,グループレベルの言語フィードバックを利用して探索を誘導するRLフレームワークである。
GOLFは、エラーを特定したり、目標とする修正を提案したりする外部批判を集約し、代替部分的なアイデアと多様な障害パターンを提供するグループ内の試みを行う。
検証可能なベンチマークと検証できないベンチマークの両方の実験は、GOLFが優れた性能と探索効率を達成することを示している。
論文 参考訳(メタデータ) (2026-03-04T20:53:17Z) - Deep Dense Exploration for LLM Reinforcement Learning via Pivot-Driven Resampling [13.584783462913535]
Deep Dense Exploration (DDE) は、$textitpivots$-deep、リカバリ可能な状態を軌道上で探索する戦略である。
我々の手法はGRPOや木に基づく手法、その他の強力なベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2026-02-15T14:44:15Z) - R$^3$L: Reflect-then-Retry Reinforcement Learning with Language-Guided Exploration, Pivotal Credit, and Positive Amplification [44.99719889905381]
強化学習は推論とエージェント能力の最近の進歩を促進するが、現在のアプローチは探索と搾取の両方で苦労している。
本稿では,R$3$L,Reflection-then-Retry Reinforcement Learning with Language-Guided Exploration,Pivotal Credit,Positive Amplificationを提案する。
エージェントおよび推論タスクの実験は、トレーニング安定性を維持しながら、ベースラインよりも5%から52%改善したことを示している。
論文 参考訳(メタデータ) (2026-01-07T09:04:52Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - Learning to Reason without External Rewards [100.27210579418562]
RLVR(Reinforcement Learning with Verifiable Rewards)による複雑な推論のための大規模言語モデル(LLM)の訓練は、費用がかかるドメイン固有の監督に依存して効果的であるが制限されている。
内部フィードバックからの強化学習(Reinforcement Learning from Internal Feedback, RLIF)は、LLMが外部の報酬やラベル付きデータなしで本質的な信号から学習できるフレームワークである。
本稿では,モデル自身の信頼度を利用したRLIF手法であるIntuitorについて,その唯一の報奨信号として自己確実性(self-certainty)を提案する。
論文 参考訳(メタデータ) (2025-05-26T07:01:06Z) - Navigate the Unknown: Enhancing LLM Reasoning with Intrinsic Motivation Guided Exploration [39.460202867967006]
そこで,本研究では,高密度報酬を付与し,RLに基づくパラダイムにおける探索を増幅するために,固有モチベーションギルド探索比N meThOd foR LLM推論(i-MENTOR)を提案する。
4つの公開データセットにわたる実験は、i-MENTORの有効性を示し、AIME 2024で22.23%改善した。
論文 参考訳(メタデータ) (2025-05-23T08:30:28Z) - Random Latent Exploration for Deep Reinforcement Learning [71.88709402926415]
RLE(Random Latent Exploration)は、強化学習における単純かつ効果的な探索戦略である。
RLEは、エージェントの行動を混乱させるノイズベースの手法と、新しい行動を試みるエージェントに報酬を与えるボーナスベースの探索を平均的に上回る。
RLEはノイズベースの手法と同じくらい単純であり、複雑なボーナス計算は避けるが、ボーナスベースの手法の深い探索の利点を保っている。
論文 参考訳(メタデータ) (2024-07-18T17:55:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。