論文の概要: Mitigating Exploration Bias in RL for Multi-Instruction Following
- arxiv url: http://arxiv.org/abs/2608.23830v1
- Date: Mon, 24 Aug 2026 21:19:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.604258
- Title: Mitigating Exploration Bias in RL for Multi-Instruction Following
- Title(参考訳): マルチインストラクション後のRLにおける探索バイアスの緩和
- Abstract要約: 既存のトレーニングレシピは、トレーニングデータが複数の命令をインプロンプトで持つと、簡単な命令に対する探索バイアスに悩まされる。
このバイアスは、1) 厳密な指示を満たすポリシーモデルの初期の能力が低すぎるため、RLトレーニング中に探索を成功させることができないため、最適化は簡単な指示に偏っている。
本稿では,探索バイアスを測定するための2つの指標を提案し,それを緩和する2段階のフレームワークを提案する。
- 参考スコア(独自算出の注目度): 45.91710862879366
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: RL has emerged as a powerful paradigm for enhancing the instruction following capabilities of LLMs. While existing training recipes achieve substantial gains, we find that they suffer from exploration bias towards easy instructions when the training data has multiple instructions in a prompt. This bias is caused by two main reasons: 1) the policy model's initial ability to satisfy hard instructions is too low to trigger successful exploration during RL training, so the optimization is biased towards easy instructions; and 2) canonical RL training recipes typically employ a cumulative reward (the number of instructions fulfilled), treating all instructions equally, which biases the policy model towards fulfilling easy instructions to obtain the same amount of reward. To address these issues, we first propose two metrics to measure the exploration bias in instruction following and then introduce a two-stage framework to alleviate it: 1) Behavioral Bootstrapping, a lightweight rejection sampling fine-tuning stage before RL to activate hard instructions; and 2) Scarcity-Aware Rewards, a new RL reward function that assigns rewards to instructions based on their empirical scarcity. Experiments show that the proposed metrics are highly correlated with model performance, and our methods unleash the potential of RL training: our best models outperform the baselines by a significant margin across three verifiable instruction following benchmarks. We release codes at https://github.com/mianzhang/MulIF.
- Abstract(参考訳): RL は LLM の命令に従う能力を向上させるための強力なパラダイムとして登場した。
既存のトレーニングレシピは大幅に向上するが、トレーニングデータが複数の命令をインプロンプトで持つと、簡単な命令に対する探索バイアスに悩まされる。
このバイアスは2つの主な理由によって引き起こされる。
1) 厳密な指示を満足する政策モデルの初期能力は低すぎて、RL訓練中に探索を成功させることができないため、最適化は簡単な指示に偏っている。
2) 標準的RLトレーニングレシピは一般に累積報酬(達成された命令数)を用い,全ての命令を平等に扱う。
これらの問題に対処するために、まず、指示に従う際の探索バイアスを測定するための2つの指標を提案し、それを緩和するための2段階のフレームワークを紹介します。
1)行動ブートストレッピング(RL前におけるハードインストラクションの活性化のための軽量拒絶サンプリング微調整段階)
2) Scarcity-Aware Rewards – 経験的不足に基づいて報酬を命令に割り当てる新しいRL報酬関数。
実験の結果,提案手法はモデル性能と高い相関性を示し,RLトレーニングの可能性を解き明かした。
私たちはhttps://github.com/mianzhang/MulIF.comでコードをリリースします。
関連論文リスト
- Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following [42.05102776289243]
強化学習(RL)は、様々な制約で命令に従うために、LLM(Large Language Models)を調整することを約束している。
タスク追従のための新しいサンプル効率のRLフレームワークであるHindsight instruction Replay (HiR)を提案する。
論文 参考訳(メタデータ) (2025-12-29T13:31:08Z) - CodeBoost: Boosting Code LLMs by Squeezing Knowledge from Code Snippets with RL [28.43882967593511]
コード大言語モデル(LLM)は、効率的で自動化されたコーディングパイプラインを構築するのに欠かせないツールになっている。
既存のモデルは、「ヒューマンインストラクション-ファイナル応答」ペアを用いて汎用LLMから強化学習(RL)を用いて後訓練されるのが一般的である。
我々は,コードスニペットからLLMを純粋に拡張するフレームワークであるCodeBoostを提案する。
論文 参考訳(メタデータ) (2025-08-07T10:31:24Z) - Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning [93.00629872970364]
強化学習(Reinforcement Learning, RL)は, 複雑な推論タスクにおいて, 言語モデルの性能向上のための主要なパラダイムとなっている。
SPARKLE(SPARKLE)は、3つの重要な次元にわたるRLの効果を詳細に解析するフレームワークである。
我々は、RL信号と混合品質の推論トレースを産出しない難題が、依然としてトレーニングに有効であるかどうかを調査する。
論文 参考訳(メタデータ) (2025-06-05T07:53:59Z) - SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data [65.56911325914582]
限られた初期データを用いたLarge Language Models (LLM) トレーニングのブートストラップとして,SeRL(Se-play Reinforcement Learning)を提案する。
提案したSeRLは、その結果よりも優れ、検証可能な報酬を持つ高品質なデータと同等の性能が得られる。
論文 参考訳(メタデータ) (2025-05-25T13:28:04Z) - AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning [50.02117478165099]
大規模強化学習は, 強大・中小モデルの推論能力を大幅に向上させることができることを示す。
まずは算数のみのプロンプト、次にコードのみのプロンプトのトレーニングを行う。
論文 参考訳(メタデータ) (2025-05-22T08:50:47Z) - On the Emergence of Thinking in LLMs I: Searching for the Right Intuition [34.32871896067864]
自己学習による強化学習(RLSP)というポストトレーニングフレームワークを提案する。
RLSPは、推論プロセスの人間または合成的なデモンストレーションによる微調整、多種多様な効率的な推論行動を促進するための探索報酬信号の使用、報酬ハッキングを予防しながら正当性を確保するための結果検証器によるRLトレーニングの3段階を含む。
数学領域における実証的研究は、RLSPが推論を改善することを示している。
論文 参考訳(メタデータ) (2025-02-10T18:52:04Z) - Supervised Advantage Actor-Critic for Recommender Systems [76.7066594130961]
本稿では、RL成分を学習するための負のサンプリング戦略を提案し、それを教師付き逐次学習と組み合わせる。
サンプル化された(負の)作用 (items) に基づいて、平均ケース上での正の作用の「アドバンテージ」を計算することができる。
SNQNとSA2Cを4つのシーケンシャルレコメンデーションモデルでインスタンス化し、2つの実世界のデータセットで実験を行う。
論文 参考訳(メタデータ) (2021-11-05T12:51:15Z) - URLB: Unsupervised Reinforcement Learning Benchmark [82.36060735454647]
教師なし強化学習ベンチマーク(URLB)を紹介する。
URLBは2つのフェーズで構成されている。
評価のために3つのドメインから12の連続制御タスクを提供し、8つの主要な教師なしRLメソッドに対してオープンソースコードを提供する。
論文 参考訳(メタデータ) (2021-10-28T15:07:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。