論文の概要: Beyond Execution: Static-Analysis Rewards and Hint-Conditioned Diffusion RL for Code Generation
- arxiv url: http://arxiv.org/abs/2605.17174v1
- Date: Sat, 16 May 2026 22:18:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:47.721616
- Title: Beyond Execution: Static-Analysis Rewards and Hint-Conditioned Diffusion RL for Code Generation
- Title(参考訳): コード生成のための静的解析リワードとHint-Conditioned Diffusion RL
- Authors: Shuyin Ouyang, Zhaozhi Qian, Faroq AL-Tam, Muhammad AL-Qurishi, Jie M. Zhang,
- Abstract要約: 強化学習(Reinforcement Learning, RL)は、拡散言語モデル(DLM)をコード生成における機能的正当性に整合させる重要なパラダイムである。
本稿では,拡散型コード生成のためのRLポストトレーニングについて,報酬設計,ヒント条件付きサンプリング,タスク難易度という3つの軸に沿って,体系的な実証的研究を行った。
- 参考スコア(独自算出の注目度): 24.22868671819538
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement Learning (RL) is an important paradigm for aligning Diffusion Language Models (DLMs) toward functional correctness in code generation. However, these models often encounter a ``capability cliff'' on complex tasks, where execution-based semantic rewards become too low to provide a viable learning signal. In this paper, we present a systematic empirical study of RL post-training for diffusion-based code generation along three axes: reward design, hint-conditioned sampling, and task difficulty. We investigate the effectiveness of execution-free rewards as alternatives to traditional unit-test execution, the role of training-time hint-conditioned diffusion sampling in mitigating exploration bottlenecks, and the impact of these design choices varies across tasks with different difficulty levels. Across HumanEval, MBPP, and LiveCodeBench, we find that static checking is the strongest overall standalone execution-free reward in our setting, especially improving DiffuCoder from 53.9 to 67.1 on HumanEval and from 14.9 to 15.5 on LiveCodeBench while reducing rollout time by 9.4\%. We further find that moderate AST-based hinting is most useful on harder benchmarks, while the best reward design depends strongly on task difficulty: similarity-based rewards are more effective on easier subsets, whereas static checking is more reliable on harder subsets where execution rewards are low. These findings suggest that reward design and training guidance substantially affect diffusion RL performance in our evaluated code-generation setting.
- Abstract(参考訳): 強化学習(Reinforcement Learning, RL)は、拡散言語モデル(DLM)をコード生成における機能的正当性に整合させる重要なパラダイムである。
しかしながら、これらのモデルは、実行ベースのセマンティック報酬が低すぎると、実行可能な学習信号を提供するような複雑なタスクで '能力の崖' に遭遇することが多い。
本稿では,報酬設計,ヒント条件付きサンプリング,タスク困難という3つの軸に沿った拡散型コード生成のためのRLポストトレーニングの系統的研究について述べる。
本研究では,従来の単体テスト実行の代替として実行自由報酬の有効性,探索ボトルネック緩和における訓練時間ヒント条件拡散サンプリングの役割,およびこれらの設計選択の影響について検討する。
HumanEval、MBPP、LiveCodeBench全体では、静的チェックは、我々の設定において最も強力な独立した実行自由報酬であり、特にHumanEvalのDiffuCoderを53.9から67.1に改善し、LiveCodeBenchの14.9から15.5に改善し、ロールアウト時間を9.4\%削減している。
さらに、中程度のASTベースのヒントはより難しいベンチマークで最も有用であるのに対して、最高の報酬設計はタスクの難易度に強く依存している。
これらの結果から,報奨設計とトレーニング指導が,評価符号生成における拡散RL性能に大きく影響することが示唆された。
関連論文リスト
- Chain of Uncertain Rewards with Large Language Models for Reinforcement Learning [52.48243762705385]
Chain of Uncertain Rewards (CoUR)は、大きな言語モデル(LLM)を統合して報酬関数の設計と評価を効率化する新しいフレームワークである。
我々は、CoURがより良い性能を実現し、報酬評価のコストを大幅に削減できることを示します。
論文 参考訳(メタデータ) (2026-04-15T05:44:14Z) - Train at Moving Edge: Online-Verified Prompt Selection for Efficient RL Training of Large Reasoning Model [12.851049183155482]
HIVEは、データ効率の強化学習のためのデュアルステージフレームワークである。
我々は,HIVEが性能を損なうことなく,ロールアウト効率を著しく向上することを示す。
論文 参考訳(メタデータ) (2026-03-26T08:52:35Z) - CVeDRL: An Efficient Code Verifier via Difficulty-aware Reinforcement Learning [57.24524263804788]
コード検証は、LLMベースのコード生成の検証後において重要な役割を果たす。
既存の教師付き微調整手法は、データの不足、高い失敗率、推論効率の低下に悩まされている。
機能的な報酬しか持たない単純RLは、難しいブランチやサンプルに対して効果的な単体テストを生成することができないことを示す。
論文 参考訳(メタデータ) (2026-01-30T10:33:29Z) - GDRO: Group-level Reward Post-training Suitable for Diffusion Models [55.948229011478304]
グループレベルの報酬は、モデルを目標とする報酬と整合させるのに成功します。
Group-level Direct Reward Optimization (GDRO)は、グループレベルの報酬アライメントのための新しいトレーニング後のパラダイムである。
GDROは完全なオフライントレーニングをサポートし、画像ロールアウトサンプリングの大幅なコスト削減を実現する。
これは拡散サンプラー非依存であり、取得性に対するODE-to-SDE近似の必要性を排除している。
論文 参考訳(メタデータ) (2026-01-05T11:47:18Z) - Data-regularized Reinforcement Learning for Diffusion Models at Scale [99.01056178660538]
データ正規化拡散強化学習(Data-regularized Diffusion Reinforcement Learning, DDRL)は, フォワードKLの分散を利用して, 政策を非政治データ分布に固定する新しいフレームワークである。
100万時間以上のGPU実験と1万回の二重盲検評価により、DDRLは、RLで見られる報酬ハックを緩和しながら、報酬を大幅に改善することを示した。
論文 参考訳(メタデータ) (2025-12-03T23:45:07Z) - HINT: Helping Ineffective Rollouts Navigate Towards Effectiveness [49.72591739116668]
強化学習(RL)は、大規模言語モデル(LLM)の長いチェーン・オブ・シント(CoT)推論能力を高めるための重要な要因となっている。
しかし、GRPOのような一般的な手法は、タスクの難しさがモデルの能力を超えると失敗し、スパーシリティと非効率なトレーニングに報いる。
我々は、適応的なヒントフレームワークであるHINT: Helping In Effective Rollouts Navigate Towards Effectiveを提案する。
論文 参考訳(メタデータ) (2025-10-10T13:42:03Z) - Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL [19.659532349434418]
強化学習(Reinforcement Learning, RL)は、近年、大規模言語モデルの推論能力を強化する主要なパラダイムとなっている。
しかし、数学やプログラミングのベンチマークで一般的に使われるルールベースの報酬関数は、応答形式と正しさのみを評価する。
本稿では,報酬と有利な信号の両方を再生するプラグイン・アンド・プレイのRL報酬フレームワークであるDynamic Reasoning Efficiency Reward (DRER)を提案する。
論文 参考訳(メタデータ) (2025-09-07T11:52:18Z) - Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment [51.10604883057508]
DR-IRL(逆強化学習によるリワードの動的調整)を提案する。
まず、IRLを介して7つの有害なカテゴリをカバーするバランスの取れた安全データセットを用いて、カテゴリ固有の報酬モデルを訓練する。
次に,テキストエンコーダのコサイン類似性によるデータレベルの硬さ,報酬ギャップによるモデルレベルの応答性など,タスク難易度による報酬を導入することにより,グループ相対政策最適化(GRPO)を強化する。
論文 参考訳(メタデータ) (2025-03-23T16:40:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。