論文の概要: Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs
- arxiv url: http://arxiv.org/abs/2605.08905v1
- Date: Sat, 09 May 2026 11:57:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.964348
- Title: Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs
- Title(参考訳): Forge:LLMにおけるNP-Hard最適化のための品質意識強化学習
- Abstract要約: OPT-BENCHは,大規模言語モデル(LLM)を学習・評価するための最初の総合的なフレームワークである。
OPT-BENCHは3つの重要なコンポーネントを提供している。インスタンスジェネレータによるスケーラブルなトレーニングインフラストラクチャ、品質検証、10タスクにわたる最適なベースライン、成功率で測定された1,000インスタンスの厳格なベンチマーク、品質比で測定された品質、バイナリの正確性を超えた継続的改善を可能にする品質認識報酬だ。
我々の分析によると、品質意識の報酬はバイナリ報酬よりも28.8%改善し、タスクの多様性はデータ量よりも一般化を促進し、複雑な推論のためのRLVRスケーリングに関する洞察を提供する。
- 参考スコア(独自算出の注目度): 37.25886192772028
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) have achieved remarkable success on reasoning benchmarks through Reinforcement Learning with Verifiable Rewards (RLVR), excelling at tasks such as math, coding, logic, and puzzles. However, existing benchmarks evaluate only correctness, while overlooking optimality, namely the ability to find the best solutions under constraints. We propose OPT-BENCH, the first comprehensive framework for training and evaluating LLMs on NP-hard optimization problems through quality-aware RLVR. OPT-BENCH provides three key components: a scalable training infrastructure with instance generators, quality verifiers, and optimal baselines across 10 tasks; a rigorous benchmark with 1,000 instances evaluating both feasibility, measured by Success Rate, and quality, measured by Quality Ratio; and quality-aware rewards that enable continuous improvement beyond binary correctness. Training on Qwen2.5-7B-Instruct-1M with 15K examples achieves 93.1% SR and 46.6% QR, significantly outperforming GPT-4o, which achieves 29.6% SR and 14.6% QR. Beyond optimization, training on OPT-BENCH transfers to diverse tasks, including mathematics (+2.2%), logic (+1.2%), knowledge (+4.1%), and instruction following (+6.1%). Our analysis reveals that quality-aware rewards improve solutions by 28.8% over binary rewards, and that task diversity drives generalization more than data quantity, offering insights into RLVR scaling for complex reasoning.
- Abstract(参考訳): 大規模言語モデル(LLM)は、RLVR(Reinforcement Learning with Verifiable Rewards)を通じて、数学、コーディング、論理学、パズルなどのタスクに優れており、推論ベンチマークにおいて顕著な成功を収めている。
しかし、既存のベンチマークは、最適性、すなわち制約の下で最良の解を見つける能力を見越しながら、正確性のみを評価する。
我々は,NPハード最適化問題に対して,品質を意識したRLVRによるLLMのトレーニングと評価を行う,初の総合的なフレームワークであるOPT-BENCHを提案する。
OPT-BENCHは3つの重要なコンポーネントを提供している。インスタンスジェネレータによるスケーラブルなトレーニングインフラストラクチャ、品質検証、10タスクにわたる最適なベースライン、成功率で測定された1,000インスタンスの厳格なベンチマーク、品質比で測定された品質、バイナリの正確性を超えた継続的改善を可能にする品質認識報酬だ。
15K例のQwen2.5-7B-Instruct-1Mのトレーニングでは、93.1%のSRと46.6%のQRが達成され、GPT-4oは29.6%のSRと14.6%のQRを達成している。
最適化以外にも、OPT-BENCHのトレーニングは数学(+2.2%)、論理(+1.2%)、知識(+4.1%)、指示(+6.1%)など様々なタスクに移行している。
分析の結果、品質に配慮した報酬はバイナリ報酬よりも28.8%改善し、タスクの多様性はデータ量よりも一般化を促進し、複雑な推論のためのRLVRスケーリングに関する洞察を提供することがわかった。
関連論文リスト
- Reinforcement Learning without Ground-Truth Solutions can Improve LLMs [47.0243847990524]
LLMを訓練するための検証可能な報酬(RLVR)による強化学習は、典型的には報酬を割り当てるために根底からの回答に依存している。
我々は,スコアベース最適化タスクにLLMをトレーニングするtextbfRanking-textbf誘発のtextbfverible framework (RiVER)を導入する。
論文 参考訳(メタデータ) (2026-06-25T17:59:36Z) - ComplexConstraints and Beyond: Expert Rubrics for RLVR [1.173565897471208]
代替パラダイムとして,専門家によるルーリック評価を体系的に分析する。
われわれはまず,高品質なルーブリックを構築するための5つの設計原則を述べる。
これらのルーリックは, 優れた評価機器であるだけでなく, 極めて効果的な訓練信号であることを示す。
論文 参考訳(メタデータ) (2026-06-08T07:11:56Z) - Test-time Recursive Thinking: Self-Improvement without External Feedback [120.80790108733942]
TRT(Test-time Recursive Thinking)は、反復的な自己改善フレームワークである。
オープンソースモデルはAIME-25/24で100%精度に達し、LiveCodeBenchの最も難しい問題では、クローズドソースモデルは外部からのフィードバックなしで10.4-14.8ポイント改善されている。
論文 参考訳(メタデータ) (2026-02-03T04:37:37Z) - CVeDRL: An Efficient Code Verifier via Difficulty-aware Reinforcement Learning [57.24524263804788]
コード検証は、LLMベースのコード生成の検証後において重要な役割を果たす。
既存の教師付き微調整手法は、データの不足、高い失敗率、推論効率の低下に悩まされている。
機能的な報酬しか持たない単純RLは、難しいブランチやサンプルに対して効果的な単体テストを生成することができないことを示す。
論文 参考訳(メタデータ) (2026-01-30T10:33:29Z) - What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study [59.44848132298657]
ポストトレーニング量子化(PTQ)は通常、特に低ビット設定でのタスクの推論において、大きな精度低下のコストが伴う。
本研究では,推論モデルに対する量子化認識学習(QAT)の体系的研究について述べる。
論文 参考訳(メタデータ) (2026-01-21T11:22:29Z) - CUARewardBench: A Benchmark for Evaluating Reward Models on Computer-using Agent [46.41047559759938]
CUA(Computer-using Agent)は、オペレーティングシステムやソフトウェアインターフェースとの自然なインタラクションを通じてタスクの完了を可能にするエージェントである。
Reward モデルは有望な代替手段を提供するが、CUA 評価におけるその有効性はほとんど未検討である。
CUARewardBenchは4つの重要なコントリビューションから構成される。
論文 参考訳(メタデータ) (2025-10-21T12:53:40Z) - Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains [97.5573252172065]
自動推論評価器(FARE)のファミリーを,簡易な反復的リジェクションサンプリング制御による微調整手法で訓練する。
FARE-8Bはより大型のRL訓練評価器に挑戦し、FARE-20Bはオープンソース評価器の新しい標準となる。
推論時リランカとして、FARE-20BはMATH上でのニアオークル性能を達成する。
論文 参考訳(メタデータ) (2025-10-20T17:52:06Z) - Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback [59.078756231841574]
Critique-GRPOは、自然言語と数値フィードバックを統合して効果的なポリシー最適化を行うオンラインRLフレームワークである。
批判-GRPOは、教師付き学習とRLに基づく微調整法を8つの難解な数学、STEM、一般的な推論タスクで一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2025-06-03T17:39:02Z) - J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning [54.85131761693927]
意思決定前にLLM審査員に思考を教えるための強化学習フレームワークであるJ1を紹介する。
私たちのコアコントリビューションは、検証不可能で検証可能なプロンプトのすべての判断タスクを、検証可能な報酬を持った統一フォーマットに変換することです。
次に、RLを用いて8B、32B、70Bのスケールで思考判断を訓練し、彼らが最先端のパフォーマンスを得ることを示す。
論文 参考訳(メタデータ) (2025-05-15T14:05:15Z) - Reinforcement Learning from Automatic Feedback for High-Quality Unit Test Generation [12.503002900186997]
大規模言語モデル(LLM)は、テストケースの自動生成を含むコード生成で人気を集めている。
LLMは、多くの場合、大量の公開コードでトレーニングされ、ベストプラクティスに従わないテストケースを含む。
RLSQM(Reinforcement Learning from Static Quality Metrics)と呼ばれる新しい手法を提案する。
論文 参考訳(メタデータ) (2023-10-03T18:48:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。