論文の概要: BODHI: Do LLMs Branch Out and Discover Heterogeneous Inferences?
- arxiv url: http://arxiv.org/abs/2608.02867v1
- Date: Mon, 03 Aug 2026 20:37:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.942678
- Title: BODHI: Do LLMs Branch Out and Discover Heterogeneous Inferences?
- Title(参考訳): BODHI:LLMは分岐して不均一な推論を発見できるのか?
- Abstract要約: 検証可能な報酬付き強化学習(RLVR)は、様々な推論タスクにわたる大規模言語モデル(LLM)の性能を改善した。
我々は,RLVR学習LLMにおける試験時間探索の性質を,制御された迷路解法実験を用いて,数学的推論トレースから木構造を抽出することによって検討した。
以上の結果から,RLVRモデルにおけるポリシエントロピー崩壊は,単に統語的ではなく,意味的分岐エントロピーの大幅な減少を伴っていることが明らかとなった。
- 参考スコア(独自算出の注目度): 5.571635164072802
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Although reinforcement learning with verifiable rewards (RLVR) has improved the performance of large language models (LLMs) across a variety of reasoning tasks, there is significant debate as to whether RLVR expands the reasoning capability boundary, or just improves sampling efficiency. In this paper, we investigate the nature of test-time exploration in RLVR-trained LLMs by employing controlled maze-solving experiments and extracting a tree structure from mathematical reasoning traces (BODHI-Trees) based on semantic equivalence. This helps us delineate between entropy arising from stylistic variations and genuine inferential branching. Our findings demonstrate that the policy entropy collapse observed in RLVR models is not merely syntactic, and is accompanied by a significant reduction in semantic branching entropy. While RLVR improves adherence to environmental constraints and backtracking capabilities, it constricts the space of continuations; we provide evidence suggesting that this might be responsible for the sample efficiency gains of RLVR, albeit at the cost of genuine rollout diversity.
- Abstract(参考訳): 検証可能な報奨(RLVR)による強化学習は,様々な推論タスクにわたる大規模言語モデル(LLM)の性能向上を図っているが,RLVRが推論能力境界を拡張するのか,それともサンプリング効率を向上しただけなのかについては,大きな議論がある。
本稿では,RLVR学習LLMにおける試験時間探索の性質について,制御された迷路解法実験を用いて,意味的等価性に基づく数学的推論トレース(BODHI-Trees)から木構造を抽出することによって検討する。
これにより、スタイリスティックなバリエーションから生じるエントロピーと真に推論された分岐を区別するのに役立つ。
以上の結果から,RLVRモデルにおけるポリシエントロピー崩壊は,単に統語的ではなく,意味的分岐エントロピーの大幅な減少を伴っていることが明らかとなった。
RLVRは、環境制約やバックトラック能力の遵守性を改善するが、継続の空間を制限し、真のロールアウト多様性を犠牲にして、RLVRのサンプル効率向上に寄与する可能性があることを示す証拠を提供する。
関連論文リスト
- Boosting LLM Exploration via Weak-Model Guidance in RLVR [36.33733929880283]
RLVRにおけるLLMの生成的多様性を維持するための,単純かつ効果的なアプローチを提案する。
内部探索のみに頼るのではなく、より小さく弱い言語モデルによって生成される部分的推論軌道に基づいて、ターゲットモデルに回答を強制する。
提案手法は, SFT, 複雑な報酬設計, 複雑なプロンプトを必要とすることなく, エントロピー崩壊を効果的に軽減する。
論文 参考訳(メタデータ) (2026-08-27T17:45:50Z) - What are Key Factors for Updates in RL for LLM Reasoning? [41.37684066124904]
本研究では,ロールアウト毎の勾配ステップ数によって決定される非政治的度合いの違いが,重要サンプリング率の分布とクリッピング挙動に大きく影響していることを示す。
これらの結果から, トークン群間の境界を, 重要サンプリング比の実験的分散に応じてクリッピングする適応クリップポリシー最適化 (ACPO) を提案する。
論文 参考訳(メタデータ) (2026-06-21T16:14:46Z) - Sparsity Curse: Understanding RLVR Model Parameter Space from Model Merging [35.66009296523317]
RLVR(Reinforcement Learning with Verifiable Reward)は、スーパーバイザード・ファインチューニング(SFT)を超える強力なポストトレーニングパラダイムとして登場した。
近年の研究では、RLVRはSFTと比較してスパースおよびオフプリンシパルパラメータの更新を誘導している。
本稿では,RLVRパラメータ空間のユニークな構造に適したマージレシピであるSAR-Merging(Sensitivity-Aware Resolving Merging)を提案する。
論文 参考訳(メタデータ) (2026-06-16T22:22:40Z) - CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment [32.29376299423774]
検証可能な報酬付き強化学習(RLVR)は、大規模言語モデルの推論能力を引き出すことに成功した。
既存の手法は主に、推論の痕跡の視覚的カバレッジの改善と視覚幻覚の緩和に重点を置いているが、推論プロセスと最終的な答えのセマンティックな矛盾を過小評価している。
本稿では,簡易なプラグアンドプレイ整合性報酬モデルを用いて,RLVRに思考・問合せのセマンティック一貫性を導入するConsistency-Oriented Reasoning Alignment (CORA)を提案する。
論文 参考訳(メタデータ) (2026-06-12T17:54:59Z) - SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs [55.46289074417954]
検証可能な報酬(RLVR)による強化学習は、推論タスクのpass@1を確実に改善するが、pass@kでは同等の利得を得られないことが多い。
中心的な構造的制約は、トレーニングを安定させるが、本質的には基準分布にポリシーを固定する逆-KL正規化から生じる。
我々は,逆KLアンカー分布自体を再構成することで,制御可能な経験的サポート拡張を可能にする,原則化されたフレームワークであるSAGEを提案する。
論文 参考訳(メタデータ) (2026-05-15T07:42:21Z) - ReSyn: Autonomously Scaling Synthetic Environments for Reasoning Models [18.359969463106644]
検証可能な報酬付き強化学習(RLVR)は、推論言語モデル(RLM)を訓練するための有望なアプローチとして登場した。
本研究では、インスタンスジェネレータと検証器を備えた多様な推論環境を生成するパイプラインであるReSynを導入することにより、RLVRをスケールする。
論文 参考訳(メタデータ) (2026-02-23T18:34:29Z) - Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning [88.42566960813438]
CalibRLは、制御可能な探索と専門家のガイダンスをサポートするハイブリッド政治RLVRフレームワークである。
CalibRLは政策エントロピーを誘導的に増加させ、目標分布を明らかにする。
ドメイン内設定とドメイン外設定の両方を含む8つのベンチマークの実験は、一貫した改善を示している。
論文 参考訳(メタデータ) (2026-02-22T07:23:36Z) - Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards [69.74686029941881]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論能力を改善するための効果的なパラダイムである。
トレーニングを通して高価値ロールアウトを適応的に選択する統合型ニューラルネットワークスケジューリングフレームワークを提案する。
6つの数学的推論ベンチマークの実験では、複数のRLVR最適化手法で性能と訓練効率が一貫した向上を示した。
論文 参考訳(メタデータ) (2026-02-09T10:51:58Z) - Reinforced Efficient Reasoning via Semantically Diverse Exploration [73.41112984160992]
検証可能な報酬(RLVR)による強化学習は,大規模言語モデル(LLM)の推論の強化に有効であることが証明された。
本研究では,LLMのための意味的多様性探索,すなわちROSEによる効率的な推論手法を提案する。
本手法は,意味エントロピーに基づく分岐戦略と$varepsilon$-exploration機構を組み込んだものである。
論文 参考訳(メタデータ) (2026-01-08T15:56:44Z) - Revisiting Entropy in Reinforcement Learning for Large Reasoning Models [54.96908589622163]
検証可能な報酬(RLVR)を用いた強化学習で訓練した大規模言語モデルのエントロピーダイナミクスについて検討する。
以上の結果から,RLVRでトレーニングしたLDMのエントロピーに影響を及ぼす重要な要因として,非政治的更新数,トレーニングデータの多様性,最適化目標におけるクリッピング閾値が示唆された。
論文 参考訳(メタデータ) (2025-11-08T12:50:41Z) - CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models [85.315711639214]
モデル固有の好奇心を利用して探索をガイドするフレームワークであるCuriosity-Driven Exploration (CDE)を紹介した。
アクターに対しては、生成された応答に対してパープレキシティを使用し、批判に対しては、マルチヘッドアーキテクチャからの値推定のばらつきを利用する。
理論的分析により,アクターのボーナスは本質的に過度に信頼された誤りを罰し,正しい反応の多様性を促進することが示唆された。
論文 参考訳(メタデータ) (2025-09-11T17:59:17Z) - RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization [111.1749164063616]
大規模言語モデル(LLM)のための新しいハイブリッド政治最適化手法RL-PLUSを提案する。
RL-PLUSは、外部データと内部エクスプロイトを相乗化して、より強力な推論能力を達成し、ベースモデルのバウンダリを超える。
提案手法の優位性と一般化性を示すため,理論解析と広範な実験を行った。
論文 参考訳(メタデータ) (2025-07-31T23:55:29Z) - Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs [35.27561531876348]
本稿では,LLVRを用いた強化学習が大規模言語モデル(LLM)に及ぼす影響を体系的に検討する。
RLVRは数学的タスクとコーディングタスクの両方の推論境界を拡張可能であることを示す。
本稿では,RLVRのインセンティブメカニズムを説明する理論的枠組みについて述べる。
論文 参考訳(メタデータ) (2025-06-17T07:06:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。