論文の概要: ERR+: Sequential Entropy Resolution for Efficient and Decisive LLM Reasoning
- arxiv url: http://arxiv.org/abs/2608.28771v1
- Date: Fri, 28 Aug 2026 18:28:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.740767
- Title: ERR+: Sequential Entropy Resolution for Efficient and Decisive LLM Reasoning
- Title(参考訳): ERR+: 効率よく決定的なLDM推論のための逐次エントロピー分解能
- Abstract要約: 大規模推論モデルのための2相RLVRフレームワークを提案する。
第1段階はエントロピー・リリーフ・リワード (ERR) で、累積トークンレベル・エントロピー・ドロップに比例するボーナスを思考フェーズで行う。
第2フェーズでは、ロバスト相対効率逆転(Robust Relative efficiency Reward)を導入し、それぞれが生成したピアに対してレスポンスの長さをスコアする。
- 参考スコア(独自算出の注目度): 13.033342249823022
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large reasoning models achieve strong performance on complex tasks by generating extended chain-of-thought (CoT) traces via reinforcement learning with verifiable rewards (RLVR). While current RLVR methods have achieved strong results with correctness-based reward signals, they provide limited guidance on the quality of the reasoning process itself, leaving the internal reasoning structure largely unoptimized. Through empirical analysis across multiple model families, we identify a consistent pattern: correct reasoning trac es exhibit more frequent and larger token-level entropy drops within the thinking phase than incorrect ones. We propose ERR+, a two-phase RLVR framework grounded in this observation. The first phase trains with the Entropy Relief Reward (ERR), a bonus proportional to cumulative token-level entropy drops in the thinking phase, log-normalized by response length. Unlike prior methods that suppress entropy, ERR rewards the resolution of uncertainty while leaving exploratory high-entropy states unconstrained. The second phase introduces the Robust Relative Efficiency Reward, which scores each response's length against co-generated peers via a $\tanh$-transformed within-group $z$-score. We provide a formal analysis showing that joint optimization of the two objectives induces gradient conflict in early training, motivating the sequential design . Experiments on five datasets demonstrate consistent improvements in both accuracy and response conciseness across model backbones. Our code is available at https://github.com/XrkArul/err_response
- Abstract(参考訳): 大きな推論モデルは、検証可能な報酬(RLVR)による強化学習を通じて、拡張チェーン・オブ・シント(CoT)トレースを生成することで、複雑なタスク上で強力なパフォーマンスを達成する。
現在のRLVR法は、正当性に基づく報酬信号で強力な結果を得ているが、推論プロセス自体の品質に関する限られたガイダンスを提供しており、内部の推論構造はほとんど最適化されていない。
複数のモデルファミリにまたがる経験的分析により、整合性パターンを同定する: 正しい推論 trac es は、誤ったものよりも、思考フェーズ内でより頻繁により大きいトークンレベルのエントロピーの低下を示す。
本稿では,この観測を基盤とした2相RLVRフレームワークであるERR+を提案する。
第1フェーズは、累積トークンレベルエントロピードロップに比例するボーナスであるエントロピーリリーフリワード (ERR) を思考フェーズで訓練し、応答長によって対数正規化される。
エントロピーを抑制する従来の方法とは異なり、ERRは探索的な高エントロピー状態を残しながら不確実性の解決に報いる。
第2フェーズでは、ロバスト相対効率逆転(Robust Relative efficiency Reward)を導入し、これは、各応答の長さを、$\tanh$-transformed in-group $z$-scoreを通じて、共生成ピアに対してスコアする。
本研究は,2つの目的の協調最適化が早期訓練における勾配競合を誘発し,逐次設計を動機付けることを示す形式解析である。
5つのデータセットの実験では、モデルバックボーン間の精度と応答精度の両面で一貫した改善が示されている。
私たちのコードはhttps://github.com/XrkArul/err_responseで利用可能です。
関連論文リスト
- Taming the Thinker: Conditional Entropy Shaping for Adaptive LLM Reasoning [63.36243250685778]
Conditional Entropy Shaping (CES)はトークンレベルの応答エントロピーを動的に制御するフレームワークである。
CESは、DAPOに対する応答長を減少させながら、平均精度を継続的に改善する。
論文 参考訳(メタデータ) (2026-05-19T04:41:51Z) - Recursive Think-Answer Process for LLMs and VLMs [54.52289112197118]
R-TAP(Recursive Think-Answer Process)を提案する。
R-TAPにより、モデルは反復的推論サイクルに参加し、より正確な答えを生成することができる。
R-TAP強化モデルが従来のシングルパス法より一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-03-02T17:20:10Z) - APR: Penalizing Structural Redundancy in Large Reasoning Models via Anchor-based Process Rewards [61.52322047892064]
テスト時間スケーリング(TTS)は、Large Reasoning Models(LRM)の機能を大幅に強化した。
我々は, LRM が推論過程において最終回答を得た後も, 再検討なしに反復的自己検証を頻繁に行うことを観察した。
本稿では,Anchor-based Process Reward (APR)を提案する。
論文 参考訳(メタデータ) (2026-01-31T14:53:20Z) - ProRAG: Process-Supervised Reinforcement Learning for Retrieval-Augmented Generation [54.071574153853994]
ProRAGは、学習段階の監視をオンライン最適化ループに統合するために設計されたプロセス教師付き強化学習フレームワークである。
本フレームワークは,(1)構造化推論形式でモデルを初期化するための監視されたポリシーワームアップ,(2)中間推論品質を定量化するためのMCTSベースのプロセスリワードモデル(PRM)の構築,(3)細粒度プロセスの好みに合わせてポリシーを調整するためのPRM誘導推論リファインメント,(4)プロセススーパービジョン強化学習と2つのグラニュラリティー・アドバンテージ・メカニズムの4段階から構成される。
論文 参考訳(メタデータ) (2026-01-29T16:04:59Z) - Beyond High-Entropy Exploration: Correctness-Aware Low-Entropy Segment-Based Advantage Shaping for Reasoning LLMs [6.948242693954442]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論能力向上のための中心的なアプローチとなっている。
低エントロピーセグメントに対してきめ細かな優位変調を行う,正当性を考慮した強化フレームワークであるLESSを提案する。
論文 参考訳(メタデータ) (2025-11-30T14:19:36Z) - DeCoRL: Decoupling Reasoning Chains via Parallel Sub-Step Generation and Cascaded Reinforcement for Interpretable and Scalable RLHF [11.39724102247425]
DeCoRL(Decoupled Reasoning Chains via Coordinated Reinforcement Learning)は、シーケンシャルな処理から協調的なモジュールオーケストレーションへと推論を変換する新しいフレームワークである。
DeCoRLは軽量な特殊モデルを訓練して推論サブステップを同時に生成し、並列処理によるシーケンシャルなボトルネックを排除している。
包括的評価は、RM-Bench、RMB、RewardBenchにまたがる最先端の結果を示し、大規模モデルを含む既存の手法よりも優れている。
論文 参考訳(メタデータ) (2025-11-11T07:52:39Z) - PEAR: Phase Entropy Aware Reward for Efficient Reasoning [23.381346604897246]
本稿では,位相依存型エントロピーを報酬設計に組み込んだ報酬機構であるPEARを紹介する。
4つのベンチマーク実験により、PEARはモデルスケール間の競争精度を維持しながら、応答長を一貫して減少させることが示された。
論文 参考訳(メタデータ) (2025-10-09T10:04:31Z) - CURE: Critical-Token-Guided Re-Concatenation for Entropy-Collapse Prevention [24.71056659948577]
本稿では,探索と利用のバランスをとる2段階フレームワークCURE(Critical-token-gUided Re Concatenation for Entropy-collapse Prevention)を紹介する。
CUREは6つのベンチマークで5%のパフォーマンス向上を実現し、エントロピーと精度の両方で最先端のパフォーマンスを確立する。
論文 参考訳(メタデータ) (2025-08-14T18:40:34Z) - Intra-Trajectory Consistency for Reward Modeling [67.84522106537274]
軌道内整合性正則化を開発し、より高い次トーケン生成確率を持つプロセスがより一貫した報酬を維持することを強制する。
提案した正規化でトレーニングした報酬モデルにより、より優れたDPO整合ポリシーが導出され、より優れたベスト・オブ・N(BON)検証結果が得られることを示す。
論文 参考訳(メタデータ) (2025-06-10T12:59:14Z) - Fractured Chain-of-Thought Reasoning [61.647243580650446]
完全CoTと解のみのサンプリングを補間する統合推論時間戦略であるフラクチャードサンプリングを導入する。
フラクチャードサンプリングは、Pass@kとトークンの予算に対して、急激なログ線形スケーリングゲインをもたらすため、優れた精度とコストのトレードオフを一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-05-19T11:30:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。