論文の概要: LEAP: Lean Environment-Feedback via Adaptive Pruning for Code RL in GPU Kernel Generation
- arxiv url: http://arxiv.org/abs/2608.01804v1
- Date: Mon, 03 Aug 2026 07:12:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.369661
- Title: LEAP: Lean Environment-Feedback via Adaptive Pruning for Code RL in GPU Kernel Generation
- Title(参考訳): LEAP: GPUカーネル生成におけるコードRLのアダプティブプルーニングによるリーン環境フィードバック
- Abstract要約: 強化学習(RL)による学習後の大規模言語モデル(LLM)は、コード生成能力が大幅に向上している。
現在の最先端フレームワークは、ルールベースの検証サンドボックスに結びついたグループ相対ポリシー最適化(GRPO)のような、批判のないパラダイムを活用している。
低レベルのハードウェアアクセラレータアライメントに最適化されたスケーラブルで計算効率の良いマルチターンフレームワークであるAdaptive PruningによるLEAPLean Environment-Feedbackを紹介する。
- 参考スコア(独自算出の注目度): 3.4535054007206636
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post-training large language models (LLMs) via reinforcement learning (RL) has significantly advanced code generation capabilities. To bypass the heavy memory footprint of critic networks, current state-of-the-art frameworks leverage critic-free paradigms like Group Relative Policy Optimization (GRPO) tied to rule-based verification sandboxes. However, applying these frameworks to low-level systems programming, such as CUDA kernel generation-presents severe challenges: binary pass/fail rewards introduce severe signal sparsity, while multi-turn environmental feedback loops suffer from prohibitive compilation latencies and reward dilution across trajectories. In this work, we introduce LEAP (Lean Environment-Feedback via Adaptive Pruning), a scalable and computationally efficient multi-turn RL framework optimized for low-level hardware accelerator alignment. LEAP features Difficulty-Conditioned Pruning (DCP), a dynamic gating mechanism that adaptively cuts off simple and overly catastrophic tasks from multi-turn expansion, focusing resource-heavy compilation and hardware exploration exclusively on high-value, complex tasks. To fully operationalize these paths without manual hyperparameter engineering, we propose a Rank-Based Reward formulation. By deriving scale-free relative advantages from pairwise tournament outcomes within the GRPO rollout group, our method inherently penalizes token inefficiency on simple prompts while maximizing learning gradients on challenging distributions. Empirical evaluations show that LEAP achieves superior first-turn proficiency and robust multi-turn debugging resilience while converging faster than unpruned multi-turn baselines, establishing a practical paradigm for low-level code RL.
- Abstract(参考訳): 強化学習(RL)による学習後の大規模言語モデル(LLM)は、コード生成能力が大幅に向上している。
批判ネットワークの重いメモリフットプリントを回避するため、現在の最先端フレームワークは、ルールベースの検証サンドボックスに結びついたグループ相対ポリシー最適化(GRPO)のような、批判のないパラダイムを活用している。
しかし、CUDAカーネル生成のような低レベルのシステムプログラミングにこれらのフレームワークを適用すると、バイナリパス/フェイル報酬は厳しい信号の空間性をもたらす一方、マルチターン環境フィードバックループは、トラジェクトリ間でのコンパイルの遅延と報酬の希釈に悩まされる。
本稿では,低レベルのハードウェアアクセラレータアライメントに最適化されたスケーラブルで計算効率の良いマルチターンRLフレームワークLEAP(Lean Environment-Feedback via Adaptive Pruning)を紹介する。
LEAPはDCP(Difficulty-Conditioned Pruning)を特徴としている。DCPは、単純で過度に破滅的なタスクをマルチターン展開から適応的に切り離し、リソース重大なコンパイルとハードウェア探索を高価値で複雑なタスクのみに集中する動的ゲーティング機構である。
手動のハイパーパラメータ工学を使わずにこれらの経路を完全に運用するために,ランクベース・リワードの定式化を提案する。
GRPOロールアウトグループ内のペアトーナメント結果からスケールフリーな相対的優位性を導出することにより,本手法は,難解な分布の学習勾配を最大化しつつ,単純なプロンプトに対するトークン不効率性を本質的にペナルティ化する。
実証的な評価では、LEAPは未処理のマルチターンベースラインよりも高速に収束しながら、優れたファーストターン習熟性と堅牢なマルチターンデバッグのレジリエンスを実現し、低レベルコードRLの実用的なパラダイムを確立している。
関連論文リスト
- Stable-MM-R1: Anchoring Multimodal Reasoning Dynamics via Entropy-Guided Stratification [19.490862077232205]
強化学習訓練の安定化を目的としたデータ中心型フレームワークを提案する。
まず、動的にデータをフィルタリングして「蒸留ゾーン」にフォーカスする潜在的クエリマイニング(PAQM)を導入する。
本稿では,Hybrid Stratified Replay(HSR)を提案する。これは,Path Entropyに基づくロールアウトの階層化,ロールアウトレベルの信頼性プロキシ,結果報酬に基づいてバッチを再構成する機構である。
論文 参考訳(メタデータ) (2026-09-07T07:47:00Z) - V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think [90.69263509098948]
本稿では,ELBOをベースとしたサロゲートとグループ相対ポリシー最適化アルゴリズムを統合した変分GRPOを提案する。
V-GRPOはテキストと画像の合成において最先端のパフォーマンスを実現し、MixGRPOよりも2倍のスピードアップ、DiffusionNFTより3倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2026-04-25T17:03:21Z) - Cluster-Aware Attention-Based Deep Reinforcement Learning for Pickup and Delivery Problems [6.977990610183958]
emphCAADRL (Cluster-Aware Attention-based Deep Reinforcement Learning)は、PDPインスタンスのマルチスケール構造を利用するDRLフレームワークである。
提案手法は, ニューラルネットワークを用いた探索ベースラインよりも, 推論時間を大幅に短縮する。
論文 参考訳(メタデータ) (2026-03-09T17:31:34Z) - LightningRL: Breaking the Accuracy-Parallelism Trade-off of Block-wise dLLMs via Reinforcement Learning [38.04066732299875]
Diffusion Large Language Models (dLLMs) は、並列トークン生成のための有望なパラダイムとして登場した。
その可能性にもかかわらず、既存のdLLMは通常、厳格な精度パラレルのトレードオフに悩まされる。
我々は,事前学習したdLLMの速度品質フロンティアを直接最適化するポストトレーニングフレームワークLightningRLを提案する。
論文 参考訳(メタデータ) (2026-03-04T11:43:19Z) - Parallel Diffusion Solver via Residual Dirichlet Policy Optimization [88.7827307535107]
拡散モデル(DM)は、最先端の生成性能を達成したが、シーケンシャルなデノナイジング特性のため、高いサンプリング遅延に悩まされている。
既存のソルバベースの加速度法では、低次元の予算で画像品質が著しく低下することが多い。
本研究では,各ステップに複数の勾配並列評価を組み込んだ新しいODE解法であるEnsemble Parallel Directionsolvr(EPD-EPr)を提案する。
論文 参考訳(メタデータ) (2025-12-28T05:48:55Z) - Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective [85.06838178922791]
強化学習(RL)は自己回帰言語モデルに非常に効果的であることが証明されている。
しかし、これらの手法を拡散大言語モデル(dLLM)に適応させることは、根本的な課題を提起する。
本稿では,全シーケンス生成を単一アクションとして扱い,ELBOを抽出可能なシークエンスレベル確率プロキシとして利用する,原則的RLフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-03T13:05:32Z) - Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle [65.14124923451077]
強化学習(Reinforcement Learning, RL)は、マルチモーダル大言語モデル(MLLM)の推論能力を高めるための効果的なポストトレーニングパラダイムとして登場した。
しかしながら、現在のRLパイプラインは、アドバンテージ・コラプシング(Advantage Collapsing)とロールアウト・サイレンシング(Rollout Silencing)という2つの未解決の問題によって、トレーニングの非効率に悩まされることが多い。
軌道サンプリングとバッチ合成を動的に再構成することにより、RLの微調整効率を向上する、シンプルだが原則化されたフレームワークであるShuffle-R1を提案する。
論文 参考訳(メタデータ) (2025-08-07T17:53:47Z) - REBEL: Reinforcement Learning via Regressing Relative Rewards [59.68420022466047]
生成モデルの時代における最小限のRLアルゴリズムであるREBELを提案する。
理論的には、自然ポリシーグラディエントのような基本的なRLアルゴリズムはREBELの変種と見なすことができる。
我々はREBELが言語モデリングと画像生成に一貫したアプローチを提供し、PPOやDPOとより強くあるいは類似した性能を実現することを発見した。
論文 参考訳(メタデータ) (2024-04-25T17:20:45Z) - Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement [67.1393112206885]
大規模言語モデル(LLM)は、対話的な意思決定タスクにおいてインテリジェントなエージェントとして期待されている。
本稿では,トークンレベルでのLLMの最適化に適したエントロピー拡張RL法である,エントロピー正規化トークンレベル最適化(ETPO)を導入する。
我々は,データサイエンスコード生成を多段階対話型タスクのシリーズとしてモデル化したシミュレーション環境におけるETPOの有効性を評価する。
論文 参考訳(メタデータ) (2024-02-09T07:45:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。