論文の概要: DHRCL:Training Code LLMs with Dense Hierarchical Rewards and Curriculum Learning
- arxiv url: http://arxiv.org/abs/2607.26457v1
- Date: Wed, 29 Jul 2026 04:16:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.536477
- Title: DHRCL:Training Code LLMs with Dense Hierarchical Rewards and Curriculum Learning
- Title(参考訳): DHRCL:Dense Hierarchical Rewards and Curriculum LearningによるコードLLMの学習
- Authors: Shuhang Wang, Ziming Li, Hui Cheng,
- Abstract要約: Dense Hierarchical Rewards and Curriculum Learning を用いた強化学習フレームワーク DHRCL を提案する。
DHRCLは、構文検証、実行の成功、単体テストのパスレート、ASTベースの構造的類似性にフィードバックを分解する。
我々は,Qwen3-4B,Qwen3-8B,Qwen3-14BのバックボーンにおけるDHRCLの評価を行った。
- 参考スコア(独自算出の注目度): 15.421698703970167
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning is a natural post-training paradigm for code-oriented large language models because generated programs can be evaluated through parsing, execution, unit tests, and structural analysis.However, existing methods often rely on sparse outcome rewards or statically combine heterogeneous dense signals, even though syntax validity, executability, functional correctness, and structural organization describe different and progressively dependent programming capabilities. We propose DHRCL, a reinforcement learning framework with Dense Hierarchical Rewards and Curriculum Learning. DHRCL decomposes feedback into syntax validation, execution success, unit-test pass rate, and AST-based structural similarity, and organizes these signals through a three-stage Syntax, Execution, Pass & Structural curriculum. Stage duration is determined automatically from recent validation trends rather than manually specified capability thresholds. We further introduce stage-aware probability-based token credit redistribution. The mechanism follows a consolidation-to-refinement principle: it emphasizes established token patterns during syntax-oriented optimization, applies uniform propagation for non-local execution feedback, and allocates more credit or blame to less-established token decisions during final functional optimization. Under a unified Qwen3-8B and KodCode protocol, the experiments compare DHRCL with binary, pass-rate, reward-model-based, and verifiable dense-reward baselines. We further evaluate DHRCL across Qwen3-4B, Qwen3-8B, and Qwen3-14B backbones, showing that its advantage remains consistent as model capacity increases.
- Abstract(参考訳): 強化学習(Reinforcement learning)は、コード指向の大規模言語モデルのための自然な訓練後のパラダイムであり、生成されたプログラムは解析、実行、単体テスト、構造解析を通じて評価することができる。
Dense Hierarchical Rewards and Curriculum Learning を用いた強化学習フレームワーク DHRCL を提案する。
DHRCLは、構文検証、実行成功、単体テストパスレート、ASTベースの構造的類似性にフィードバックを分解し、3段階のSyntax, Execution, Pass & Structureのカリキュラムを通じてこれらの信号を整理する。
ステージ期間は、手動で指定した能力閾値ではなく、最近の検証トレンドから自動的に決定される。
さらに、ステージアウェアの確率に基づくトークンクレジット再分配を導入する。
このメカニズムは、構文指向の最適化中に確立されたトークンパターンを強調し、非局所的な実行フィードバックに均一な伝搬を適用し、最終的な機能最適化中に確立されていないトークン決定により多くのクレジットや責任を割り当てる。
統一されたQwen3-8BとKodCodeプロトコルの下で、実験はDHRCLをバイナリ、パスレート、報酬モデルベース、検証可能な高密度リワードベースラインと比較した。
さらに,Qwen3-4B,Qwen3-8B,Qwen3-14BのバックボーンにおけるDHRCLの評価を行った。
関連論文リスト
- Weave of Formal Thought [51.56484100374058]
WoFT(Weave of Formal Thought)は、厳密な構文的検証と学習された構造的表現を結合したパラダイムである。
本稿では,非終端文法記号を直接生成にインターリーブするために,言語モデルを訓練する潜時可変微調整法を提案する。
Pythonでは、RWS目的のStarCoder2-3Bを微調整することで、テキストのみのSFTベースラインと比較して、トーケン毎のクロスエントロピーが14.3%削減される。
論文 参考訳(メタデータ) (2026-06-24T15:58:11Z) - From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape [79.30826980815927]
ルーブリックは、複雑な品質判断を構造化され、実行可能な標準に変換する明示的な基準セットです。
我々は,既存のルーリックデザインを体系的に整理し,その構築と最適化を検証し,評価と訓練をまたいだ役割を解析する。
論文 参考訳(メタデータ) (2026-06-07T13:34:55Z) - Prism: Efficient Test-Time Scaling via Hierarchical Search and Self-Verification for Discrete Diffusion Language Models [96.0074341403456]
LLM推論を改善するための実用的な方法として、推論時計算が再導入されている。
テスト時間スケーリング(TTS)アルゴリズムの多くは、自動回帰デコーディングに依存している。
そこで我々は,dLLM のための効率的な TTS フレームワーク Prism を提案する。
論文 参考訳(メタデータ) (2026-02-02T09:14:51Z) - Graph Reasoning Paradigm: Structured and Symbolic Reasoning with Topology-Aware Reinforcement Learning for Large Language Models [45.28250076657801]
Long Chain-of-Thought (LCoT) は,Large Language Models (LLM) の推論能力の向上に有効であることが証明されている。
RLVRベースの最適化にもかかわらず、既存の手法はいまだに粗大な監督、報酬のハッキング、高いトレーニングコスト、一般化の欠如に悩まされている。
ステップレベルの認知ラベルを持つグラフ構造化表現を用いて,構造化および記号的推論を実現するグラフ推論パラダイム(GRP)を提案する。
論文 参考訳(メタデータ) (2026-01-19T12:23:00Z) - SCRIBE: Structured Mid-Level Supervision for Tool-Using Language Models [10.04930078540686]
SCRIBEは、新しい中間レベルの抽象化に介入する強化学習フレームワークである。
さまざまな推論とツール使用ベンチマークで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-01-07T03:49:48Z) - BRIDGE: Building Representations In Domain Guided Program Verification [67.36686119518441]
BRIDGEは、検証をコード、仕様、証明の3つの相互接続ドメインに分解する。
提案手法は, 標準誤差フィードバック法よりも精度と効率を著しく向上することを示す。
論文 参考訳(メタデータ) (2025-11-26T06:39:19Z) - CoT Referring: Improving Referring Expression Tasks with Grounded Reasoning [67.18702329644526]
CoT Referringは、構造化されたチェーン・オブ・シークレット・トレーニングデータ構造を通じて、モデル推論をモダリティにわたって強化する。
トレーニングデータを再構築して、新たな出力フォームを実行し、既存のデータセットに新たなアノテーションを提供します。
また、検出とセグメント化機能を統合MLLMフレームワークに統合し、新しい適応重み付き損失で学習して性能を最適化する。
論文 参考訳(メタデータ) (2025-10-03T08:50:21Z) - Post-Completion Learning for Language Models [20.589364712188015]
現在の言語モデルトレーニングパラダイムは、エンド・オブ・シーケンス(eos>)トークンに到達して学習を終了する。
モデル出力完了後のシーケンス空間を体系的に活用する新しい学習フレームワークであるポストコンプリート学習(PCL)を提案する。
PCLは、学習中の自己評価と報奨予測を継続し、完了点に停止することで効率的な推論を維持する。
論文 参考訳(メタデータ) (2025-07-27T12:47:26Z) - SCOUT: Teaching Pre-trained Language Models to Enhance Reasoning via Flow Chain-of-Thought [37.53215651690168]
思考の連鎖(CoT)は、ステップ思考を奨励することで、大きな言語モデル(LLM)の推論性能を向上させる。
有望ではあるが、CoTベースのアプローチは、しばしばコストのかかる事前トレーニングを必要とし、推論の進化に関する原則的なフレームワークを欠いている。
プリトレーニングを必要とせずにFlow CoTスタイルの推論を可能にする軽量な微調整フレームワークSCOUTを提案する。
論文 参考訳(メタデータ) (2025-05-30T03:43:24Z) - Scalable Learning of Latent Language Structure With Logical Offline
Cycle Consistency [71.42261918225773]
概念的には、LOCCOは、トレーニング対象のセマンティクスを使用してラベルなしテキストのアノテーションを生成する、自己学習の一形態と見なすことができる。
追加ボーナスとして、LOCCOによって生成されたアノテーションは、神経テキスト生成モデルをトレーニングするために自明に再利用することができる。
論文 参考訳(メタデータ) (2023-05-31T16:47:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。