論文の概要: The Invisible Leash: Why RLVR May or May Not Escape Its Origin
- arxiv url: http://arxiv.org/abs/2507.14843v2
- Date: Fri, 26 Sep 2025 04:52:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-09-29 14:23:57.529538
- Title: The Invisible Leash: Why RLVR May or May Not Escape Its Origin
- Title(参考訳): RLVRが起源を隠さない理由
- Abstract要約: RLVRの現在の実践がモデルの推論境界を真に拡張するかどうかは不明である。
現在の訓練条件下では、RLVRはサポート制約付き最適化メカニズムとして動作することができる。
RLVRは精度を確実に向上させるが、探索は徐々に狭くなり、正しく表現されていない解を見落としてしまう可能性がある。
- 参考スコア(独自算出の注目度): 47.488691410579925
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in LLMs highlight RLVR as a promising method for enhancing AI's capabilities, particularly in solving complex logical tasks. However, it remains unclear whether the current practice of RLVR truly expands a model's reasoning boundary or mainly amplifies high-reward outputs that the base model already knows for improved precision. This study presents an empirical investigation that provides fresh insights into the potential limits of the common practice of RLVR. We examine how, under current training conditions, RLVR can operate as a support-constrained optimization mechanism that may restrict the discovery of entirely original solutions, remaining constrained by the base model's initial distribution. We also identify an entropy-reward trade-off: while the current RLVR recipe reliably enhances precision, it may progressively narrow exploration and potentially overlook correct yet underrepresented solutions. Extensive empirical experiments validate that while the current RLVR recipe consistently improves pass@1, the shrinkage of empirical support generally outweighs the expansion of empirical support under larger sampling budgets, failing to recover correct answers that were previously accessible to the base model. Interestingly, we also observe that while RLVR sometimes increases token-level entropy - resulting in greater uncertainty at each generation step - answer-level entropy declines, indicating that these seemingly more uncertain paths ultimately converge onto a smaller set of distinct answers. Taken together, these findings reveal potential limits of the current RLVR recipe in extending reasoning horizons. Breaking this invisible leash may require future algorithmic innovations such as explicit exploration mechanisms or hybrid strategies that seed probability mass into underrepresented solution regions.
- Abstract(参考訳): LLMの最近の進歩は、特に複雑な論理的タスクの解決において、AI能力を向上するための有望な方法としてRLVRを強調している。
しかし、現在のRLVRの実践がモデルの推論境界を真に拡張するか、あるいはベースモデルが既に精度の向上のために知っている高逆出力を主に増幅するかは、まだ不明である。
本研究は、RLVRの一般的な実践の潜在的な限界について、新たな知見を提供する実証的研究である。
現状の訓練条件下では,RLVRがサポート制約付き最適化機構として動作し,ベースモデルの初期分布に制約された完全オリジナル解の発見を制限することができるかを検討する。
現行のRLVRレシピは精度を確実に向上させるが、徐々に探索が狭くなり、正しく表現されていないソリューションを見落としてしまう可能性がある。
大規模な実証実験では、現在のRLVRレシピはパス@1を継続的に改善するが、経験的サポートの縮小は一般的に、より大きなサンプリング予算の下での経験的サポートの拡大を上回り、これまでベースモデルでアクセス可能であった正しい回答の回収に失敗する。
興味深いことに、RLVRは時々トークンレベルのエントロピーを増加させるが、それぞれの生成ステップにおいて大きな不確実性をもたらす。
これらの知見を総合すると、推論の地平線を延ばす際に現在のRLVRレシピの潜在的な限界が明らかになる。
この目に見えない鎖を破るには、明示的な探索機構や、未表現の解領域に確率質量をシードするハイブリッド戦略のような、将来のアルゴリズム的な革新が必要になるかもしれない。
関連論文リスト
- Boosting LLM Exploration via Weak-Model Guidance in RLVR [36.33733929880283]
RLVRにおけるLLMの生成的多様性を維持するための,単純かつ効果的なアプローチを提案する。
内部探索のみに頼るのではなく、より小さく弱い言語モデルによって生成される部分的推論軌道に基づいて、ターゲットモデルに回答を強制する。
提案手法は, SFT, 複雑な報酬設計, 複雑なプロンプトを必要とすることなく, エントロピー崩壊を効果的に軽減する。
論文 参考訳(メタデータ) (2026-08-27T17:45:50Z) - BODHI: Do LLMs Branch Out and Discover Heterogeneous Inferences? [5.571635164072802]
検証可能な報酬付き強化学習(RLVR)は、様々な推論タスクにわたる大規模言語モデル(LLM)の性能を改善した。
我々は,RLVR学習LLMにおける試験時間探索の性質を,制御された迷路解法実験を用いて,数学的推論トレースから木構造を抽出することによって検討した。
以上の結果から,RLVRモデルにおけるポリシエントロピー崩壊は,単に統語的ではなく,意味的分岐エントロピーの大幅な減少を伴っていることが明らかとなった。
論文 参考訳(メタデータ) (2026-08-03T20:37:54Z) - Understanding Diversity Collapse in RLVR via the Lens of Overtraining [78.37408098404312]
検証可能な報酬付き強化学習(RLVR)は,大規模言語モデルの推論能力を高めるための重要なアプローチとなっている。
我々は、この多様性の崩壊をエンフェーバートレーニングのレンズを通してフォーマルに定式化する
本稿では,各問題の限界寄与を推論境界に推定することにより,オーバートレーニングから最適化をリダイレクトするemphBayesian boundary Gating (BBG)を提案する。
論文 参考訳(メタデータ) (2026-06-13T20:13:37Z) - SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs [55.46289074417954]
検証可能な報酬(RLVR)による強化学習は、推論タスクのpass@1を確実に改善するが、pass@kでは同等の利得を得られないことが多い。
中心的な構造的制約は、トレーニングを安定させるが、本質的には基準分布にポリシーを固定する逆-KL正規化から生じる。
我々は,逆KLアンカー分布自体を再構成することで,制御可能な経験的サポート拡張を可能にする,原則化されたフレームワークであるSAGEを提案する。
論文 参考訳(メタデータ) (2026-05-15T07:42:21Z) - Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning [88.42566960813438]
CalibRLは、制御可能な探索と専門家のガイダンスをサポートするハイブリッド政治RLVRフレームワークである。
CalibRLは政策エントロピーを誘導的に増加させ、目標分布を明らかにする。
ドメイン内設定とドメイン外設定の両方を含む8つのベンチマークの実験は、一貫した改善を示している。
論文 参考訳(メタデータ) (2026-02-22T07:23:36Z) - New Skills or Sharper Primitives? A Probabilistic Perspective on the Emergence of Reasoning in RLVR [44.98294610511283]
本稿では,インスタンスレベルの可解性によって能力が定義される確率的フレームワークを提案する。
シングルステップ操作のみにモデルをトレーニングし、目に見えないマルチステップタスクのパフォーマンスを評価する。
我々の研究は、RLVRにおける創発的能力の新たな説明を提供し、解決不可能な問題の反復的最適化により、モデルが以前に解決不可能なシナリオに対処する能力を開発することができることを示唆している。
論文 参考訳(メタデータ) (2026-02-09T05:23:13Z) - Generalization of RLVR Using Causal Reasoning as a Testbed [20.97376329817835]
検証可能な報酬付き強化学習(RLVR)は、大規模言語モデルの訓練後において有望なパラダイムとして登場した。
本稿では,因果モデルに対する確率的推論の設定におけるRLVR一般化の実証的研究について述べる。
論文 参考訳(メタデータ) (2025-12-23T20:45:31Z) - Limits of Generalization in RLVR: Two Case Studies in Mathematical Reasoning [3.437656066916039]
Reinforcement with Verifiable Rewards (RLVR)は、そのような機能を強化するための有望なアプローチとして登場した。
完全検証解の2つの問題についてRLVRについて検討する。
RLVRは評価基準を改善するが、しばしば新たな推論戦略を得るよりも、表層学習指標を強化することで改善する。
論文 参考訳(メタデータ) (2025-10-30T23:16:02Z) - Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration [8.839121572048018]
より広範に焦点を絞った探索を促進するアルゴリズムであるRAPOを提案する。
8K SimpleRL-Zeroデータセット上で,RAPOを用いてQwen2.5-3Bと7Bモデルをトレーニングする。
その結果,RAPOは一貫して問題解決性能を向上することがわかった。
論文 参考訳(メタデータ) (2025-10-04T16:22:19Z) - CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models [85.315711639214]
モデル固有の好奇心を利用して探索をガイドするフレームワークであるCuriosity-Driven Exploration (CDE)を紹介した。
アクターに対しては、生成された応答に対してパープレキシティを使用し、批判に対しては、マルチヘッドアーキテクチャからの値推定のばらつきを利用する。
理論的分析により,アクターのボーナスは本質的に過度に信頼された誤りを罰し,正しい反応の多様性を促進することが示唆された。
論文 参考訳(メタデータ) (2025-09-11T17:59:17Z) - The Choice of Divergence: A Neglected Key to Mitigating Diversity Collapse in Reinforcement Learning with Verifiable Reward [57.56453588632619]
Reinforcement Learning with Verifiable Reward (RLVR) を用いた細調整大型言語モデル(LLM)における中心的パラドックスは、多目的性能の頻繁な劣化である。
これはしばしば破滅的な忘れが伴い、モデルが以前獲得したスキルを失う。
我々は,標準RLVR目標には知識保持のための重要なメカニズムが欠如していると主張している。
論文 参考訳(メタデータ) (2025-09-09T06:34:32Z) - RLPR: Extrapolating RLVR to General Domains without Verifiers [103.14103272635893]
本稿では,RLVRを汎用ドメインに外挿するシンプルな検証不要なフレームワークであるRLPRを提案する。
このノイズの多い確率報酬の高分散に対処することが、それを機能させるためには不可欠である。
RLPRはGemma、Llama、Qwenベースのモデルの両方の領域における推論機能の改善を一貫して行っている。
論文 参考訳(メタデータ) (2025-06-23T02:56:36Z) - Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs [32.99709073885827]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLM)の推論能力向上のための,有望なパラダイムとして登場した。
しかしながら、RLVRで調整されたモデルは、ソリューションフィリングのための$Pass@K$メトリックでベースモデルよりもパフォーマンスが低いことが多い。
より正確な評価基準である$CoT$-$Pass@K$を導入する。
論文 参考訳(メタデータ) (2025-06-17T07:06:56Z) - On the Mechanism of Reasoning Pattern Selection in Reinforcement Learning for Language Models [17.36077163968198]
検証リワード(RLVR)を用いた強化学習の体系的研究について述べる。
RLVR学習モデルでは,高精度推論パターンが優先的に採用されている。
我々はRLVRの収束とトレーニングのダイナミクスに関する理論的解析を開発する。
論文 参考訳(メタデータ) (2025-06-05T07:17:04Z) - Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model? [67.30809748319486]
RLVR(Reinforcement Learning with Verifiable Rewards)は近年,大規模言語モデル(LLM)の推論性能の向上に成功している。
本研究はRLVRの現状を批判的に考察する。
現在のトレーニング設定では、根本的な新しい推論パターンが生まれていないことが分かりました。
論文 参考訳(メタデータ) (2025-04-18T17:59:56Z) - Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains [92.36624674516553]
検証可能な報酬付き強化学習(RLVR)は、大規模言語モデル(LLM)の数学的推論と符号化性能の向上に成功している。
本稿では,医学,化学,心理学,経済学,教育など,さまざまな現実世界領域におけるRLVRの有効性と拡張性について検討する。
我々は,2値検証による制限を克服するために,ソフトなモデルに基づく報酬信号を生成する生成的スコアリング手法を利用する。
論文 参考訳(メタデータ) (2025-03-31T08:22:49Z) - Med-RLVR: Emerging Medical Reasoning from a 3B base model via reinforcement Learning [19.064630697040055]
検証可能な報酬 (RLVR) からの強化学習は, 明確な推論監督なしに, ベース言語モデルから自己進化推論を引き出す能力に注目が集まっている。
医療領域におけるRLVRの初期研究として,MCQA(Med-RLVR)データを検証ラベルとして活用したMed-RLVRを紹介した。
以上の結果から,RLVRは数学やコーディングに有効であるだけでなく,医学的質問応答にも有効であることが示された。
論文 参考訳(メタデータ) (2025-02-27T00:54:38Z) - Understanding, Predicting and Better Resolving Q-Value Divergence in
Offline-RL [86.0987896274354]
まず、オフラインRLにおけるQ値推定のばらつきの主な原因として、基本パターン、自己励起を同定する。
そこで本研究では,Q-network の学習における進化特性を測定するために,SEEM(Self-Excite Eigen Value Measure)尺度を提案する。
われわれの理論では、訓練が早期に発散するかどうかを確実に決定できる。
論文 参考訳(メタデータ) (2023-10-06T17:57:44Z) - Principled Knowledge Extrapolation with GANs [92.62635018136476]
我々は,知識外挿の新たな視点から,対実合成を研究する。
本稿では, 知識外挿問題に対処するために, クローズド形式判別器を用いた対角ゲームが利用可能であることを示す。
提案手法は,多くのシナリオにおいて,エレガントな理論的保証と優れた性能の両方を享受する。
論文 参考訳(メタデータ) (2022-05-21T08:39:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。