論文の概要: Reinforcement Learning with Verifiable Rewards for Small Search Agents
- arxiv url: http://arxiv.org/abs/2609.28765v1
- Date: Wed, 23 Sep 2026 20:21:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.544134
- Title: Reinforcement Learning with Verifiable Rewards for Small Search Agents
- Title(参考訳): スモールサーチエージェントのための検証可能なリワードを用いた強化学習
- Abstract要約: 因果探索のレシピは、RLVRをオープンドメインの質問応答に適用する。
グループ相対政策最適化を用いてQwen3.5-0.8Bを訓練する。
我々は,7ベンチマーク問合せスイートのすべてのチェックポイントを評価した。
- 参考スコア(独自算出の注目度): 0.9802224811027896
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement Learning with Verifiable Rewards (RLVR) performs well on problems with clear rewards, such as mathematics and coding, but whether it also works where the reward is less clear remains open. The reason-over-search recipe applies RLVR to open-domain question answering, where retrieval grounds the answer and a match against the reference supplies the reward. So far it has been demonstrated on large models, and below one billion parameters only with distillation from a larger teacher. We test the recipe on a small model. We train Qwen3.5-0.8B with Group Relative Policy Optimization (GRPO) and an interleaved Wikipedia-search tool on MuSiQue, varying only the reward across three shapes over three seeds each, and we evaluate every checkpoint held-out on a seven-benchmark question-answering suite. The recipe works: the best run reaches 0.352 average exact match against a 0.092 untrained floor, a 3.8-fold gain, with no distillation step in the training loop. The reward shape also matters. The Search-R1-faithful exact-match-only reward is the worst of the three at every seed at the matched training horizon, and it is worst even on exact match, the metric it directly optimises. We conclude that the sparse exact-match reward, RLVR's default in mathematics and code, is the wrong starting point for models of this size. The reason-over-search setting can supply a suitable reward for RLVR on small models, but small-model RLVR needs its own reward-design study rather than a scaled-down copy of a large-model recipe.
- Abstract(参考訳): Reinforcement Learning with Verifiable Rewards (RLVR) は、数学やコーディングなどの明確な報酬を持つ問題でもうまく機能するが、報酬があまり明確でないところでも機能するかどうかは未定である。
検索レシピは、RLVRをオープンドメインの質問応答に適用し、検索が回答を根拠とし、参照に対するマッチが報酬を提供する。
これまでのところ、大規模なモデルで実証されており、10億のパラメータ以下は、より大きな教師からの蒸留によってのみ実証されている。
私たちはそのレシピを小さなモデルでテストする。
Qwen3.5-0.8Bにグループ相対ポリシー最適化(GRPO)と、MuSiQueでウィキペディア検索ツールをトレーニングし、それぞれ3つの種に分けて報酬を3つに分けて評価する。
レシピは、最高のランが0.092の未トレーニングフロアと平均0.352の正確なマッチに達し、3.8倍のゲインとなり、トレーニングループの蒸留工程は行われない。
報酬の形も重要だ。
Search-R1-faithful exact-match-only rewardは、マッチしたトレーニングの地平線で各シードの3つの中で最悪のものであり、正確なマッチでも、それが直接最適化する指標である。
数学とコードにおけるRLVRの既定値であるスパース正確なマッチング報酬は、このサイズのモデルにとって間違った出発点である、と結論付けている。
しかし、小型モデルのRLVRには、大型モデルのレシピのスケールダウンコピーではなく、独自の報酬設計の学習が必要だ。
関連論文リスト
- PoEM: Predicting RL Outcomes from Existing Policies [36.763606838043096]
我々は,すでに他の報酬に対してトレーニング済みのモデルセットを用いて,新たな報酬関数上でRLの出力を予測するフレームワークであるPoEMを紹介する。
我々は、テキストと画像のモダリティにまたがって、合成と実の報酬にまたがるアプローチを実験的に検証した。
論文 参考訳(メタデータ) (2026-09-24T17:50:25Z) - LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards [51.45138356629732]
我々は,疎解報酬を高密度で検証可能な文脈報酬で増強するためにLongRLVRを導入する。
この補助信号は、正しい接地情報を選択するためのモデルを直接インセンティブ化する。
LongRLVRは、すべてのモデルとベンチマークで標準のRLVRよりも一貫して、大幅に優れています。
論文 参考訳(メタデータ) (2026-03-02T18:07:53Z) - Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards [45.83885805939434]
一般的な問題は報酬ハックであり、ポリシーは報酬の不正確さを利用して意図しない振る舞いを学ぶ。
これまでのほとんどの作業では、参照モデルに対するKullback-Leiblerペナルティによるポリシー更新を制限することで、この問題に対処している。
報酬がより正確である地域に対して、ポリシー更新をバイアスする方法でLMを訓練する。
論文 参考訳(メタデータ) (2026-02-20T07:32:22Z) - SPARK: Synergistic Policy And Reward Co-Evolving Framework [84.22494672256894]
我々は、RLVR上に構築された効率的でオン・ポリティクス、安定した手法であるSPARK(Synergistic Policy and Reward Co-Evolving Framework)を紹介する。
ロールアウトと正確性データを捨てる代わりに、SPARKはこの貴重な情報をリサイクルし、生成的報酬モデルとしてモデル自体をトレーニングする。
SPARK は複数の LLM モデルと LVLM モデル,および複数の推論,報酬モデル,一般ベンチマークにおいて,大幅な性能向上を実現していることを示す。
論文 参考訳(メタデータ) (2025-09-26T17:50:12Z) - Spurious Rewards: Rethinking Training Signals in RLVR [130.3484456088909]
検証可能な報酬(RLVR)を用いた強化学習は,特定のモデルにおいて強い数学的推論を導出できることを示す。
例えば、RLVRはQwen2.5-Math-7BのMATH-500の性能を21.4%向上させた。
コード推論 -- 実際のコード実行なしにコードで考える -- は、RLVR以降、はるかに頻繁になる、独特なQwen2.5-Mathの振る舞いである。
論文 参考訳(メタデータ) (2025-06-12T17:49:55Z) - Reinforcement Learning for Reasoning in Large Language Models with One Training Example [117.86853102104256]
1つのトレーニング例(1ショットRLVR)を用いた強化学習は,大規模言語モデル(LLM)の算数推論能力の向上に有効であることを示す。
1ショットRLVRにおける興味深い現象として、クロスカテゴリの一般化、自己回帰の頻度の増加、テスト性能の向上の持続などを挙げる。
論文 参考訳(メタデータ) (2025-04-29T09:24:30Z) - Reward Shaping to Mitigate Reward Hacking in RLHF [47.71454266800376]
Preference As Reward (PAR) は、報酬モデルに埋め込まれた潜在的嗜好を強化学習の信号として活用する新しいアプローチである。
AlpacaEval 2.0ベンチマークでは、PARは競合するアプローチよりも少なくとも5パーセント高い勝利率を達成する。
論文 参考訳(メタデータ) (2025-02-26T02:57:59Z) - Is RLHF More Difficult than Standard RL? [31.972393805014903]
ヒューマンフィードバック(RLHF)からの強化学習は優先信号から学習し、標準強化学習(RL)は報酬信号から直接学習する。
理論的には、幅広い選好モデルに対して、我々は、報酬に基づくRLのアルゴリズムと技法を直接的に解き、少ないか、余分なコストで解決できることを証明している。
論文 参考訳(メタデータ) (2023-06-25T03:18:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。