論文の概要: LEAP: Lean Environment-Feedback via Adaptive Pruning for Code RL in GPU Kernel Generation
- arxiv url: http://arxiv.org/abs/2608.01804v2
- Date: Tue, 04 Aug 2026 02:24:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.430451
- Title: LEAP: Lean Environment-Feedback via Adaptive Pruning for Code RL in GPU Kernel Generation
- Title(参考訳): LEAP: GPUカーネル生成におけるコードRLのアダプティブプルーニングによるリーン環境フィードバック
- Authors: Tankun Li, Zhi Chen, Yaohua Tang,
- Abstract要約: 強化学習(RL)による学習後の大規模言語モデル(LLM)は、コード生成能力が大幅に向上している。
現在の最先端フレームワークは、ルールベースの検証サンドボックスに結びついたグループ相対ポリシー最適化(GRPO)のような、批判のないパラダイムを活用している。
低レベルのハードウェアアクセラレータアライメントに最適化されたスケーラブルで計算効率の良いマルチターンフレームワークであるAdaptive PruningによるLEAPLean Environment-Feedbackを紹介する。
- 参考スコア(独自算出の注目度): 3.4535054007206636
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post-training large language models (LLMs) via reinforcement learning (RL) has significantly advanced code generation capabilities. To bypass the heavy memory footprint of critic networks, current state-of-the-art frameworks leverage critic-free paradigms like Group Relative Policy Optimization (GRPO) tied to rule-based verification sandboxes. However, applying these frameworks to low-level systems programming, such as CUDA kernel generation-presents severe challenges: binary pass/fail rewards introduce severe signal sparsity, while multi-turn environmental feedback loops suffer from prohibitive compilation latencies and reward dilution across trajectories. In this work, we introduce LEAP (Lean Environment-Feedback via Adaptive Pruning), a scalable and computationally efficient multi-turn RL framework optimized for low-level hardware accelerator alignment. LEAP features Difficulty-Conditioned Pruning (DCP), a dynamic gating mechanism that adaptively cuts off simple and overly catastrophic tasks from multi-turn expansion, focusing resource-heavy compilation and hardware exploration exclusively on high-value, complex tasks. To fully operationalize these paths without manual hyperparameter engineering, we propose a Rank-Based Reward formulation. By deriving scale-free relative advantages from pairwise tournament outcomes within the GRPO rollout group, our method inherently penalizes token inefficiency on simple prompts while maximizing learning gradients on challenging distributions. Empirical evaluations show that LEAP achieves superior first-turn proficiency and robust multi-turn debugging resilience while converging faster than unpruned multi-turn baselines, establishing a practical paradigm for low-level code RL.
- Abstract(参考訳): 強化学習(RL)による学習後の大規模言語モデル(LLM)は、コード生成能力が大幅に向上している。
批判ネットワークの重いメモリフットプリントを回避するため、現在の最先端フレームワークは、ルールベースの検証サンドボックスに結びついたグループ相対ポリシー最適化(GRPO)のような、批判のないパラダイムを活用している。
しかし、CUDAカーネル生成のような低レベルのシステムプログラミングにこれらのフレームワークを適用すると、バイナリパス/フェイル報酬は厳しい信号の空間性をもたらす一方、マルチターン環境フィードバックループは、トラジェクトリ間でのコンパイルの遅延と報酬の希釈に悩まされる。
本稿では,低レベルのハードウェアアクセラレータアライメントに最適化されたスケーラブルで計算効率の良いマルチターンRLフレームワークLEAP(Lean Environment-Feedback via Adaptive Pruning)を紹介する。
LEAPはDCP(Difficulty-Conditioned Pruning)を特徴としている。DCPは、単純で過度に破滅的なタスクをマルチターン展開から適応的に切り離し、リソース重大なコンパイルとハードウェア探索を高価値で複雑なタスクのみに集中する動的ゲーティング機構である。
手動のハイパーパラメータ工学を使わずにこれらの経路を完全に運用するために,ランクベース・リワードの定式化を提案する。
GRPOロールアウトグループ内のペアトーナメント結果からスケールフリーな相対的優位性を導出することにより,本手法は,難解な分布の学習勾配を最大化しつつ,単純なプロンプトに対するトークン不効率性を本質的にペナルティ化する。
実証的な評価では、LEAPは未処理のマルチターンベースラインよりも高速に収束しながら、優れたファーストターン習熟性と堅牢なマルチターンデバッグのレジリエンスを実現し、低レベルコードRLの実用的なパラダイムを確立している。
関連論文リスト
- Cluster-Aware Attention-Based Deep Reinforcement Learning for Pickup and Delivery Problems [6.977990610183958]
emphCAADRL (Cluster-Aware Attention-based Deep Reinforcement Learning)は、PDPインスタンスのマルチスケール構造を利用するDRLフレームワークである。
提案手法は, ニューラルネットワークを用いた探索ベースラインよりも, 推論時間を大幅に短縮する。
論文 参考訳(メタデータ) (2026-03-09T17:31:34Z) - LightningRL: Breaking the Accuracy-Parallelism Trade-off of Block-wise dLLMs via Reinforcement Learning [38.04066732299875]
Diffusion Large Language Models (dLLMs) は、並列トークン生成のための有望なパラダイムとして登場した。
その可能性にもかかわらず、既存のdLLMは通常、厳格な精度パラレルのトレードオフに悩まされる。
我々は,事前学習したdLLMの速度品質フロンティアを直接最適化するポストトレーニングフレームワークLightningRLを提案する。
論文 参考訳(メタデータ) (2026-03-04T11:43:19Z) - Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective [85.06838178922791]
強化学習(RL)は自己回帰言語モデルに非常に効果的であることが証明されている。
しかし、これらの手法を拡散大言語モデル(dLLM)に適応させることは、根本的な課題を提起する。
本稿では,全シーケンス生成を単一アクションとして扱い,ELBOを抽出可能なシークエンスレベル確率プロキシとして利用する,原則的RLフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-03T13:05:32Z) - REBEL: Reinforcement Learning via Regressing Relative Rewards [59.68420022466047]
生成モデルの時代における最小限のRLアルゴリズムであるREBELを提案する。
理論的には、自然ポリシーグラディエントのような基本的なRLアルゴリズムはREBELの変種と見なすことができる。
我々はREBELが言語モデリングと画像生成に一貫したアプローチを提供し、PPOやDPOとより強くあるいは類似した性能を実現することを発見した。
論文 参考訳(メタデータ) (2024-04-25T17:20:45Z) - Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement [67.1393112206885]
大規模言語モデル(LLM)は、対話的な意思決定タスクにおいてインテリジェントなエージェントとして期待されている。
本稿では,トークンレベルでのLLMの最適化に適したエントロピー拡張RL法である,エントロピー正規化トークンレベル最適化(ETPO)を導入する。
我々は,データサイエンスコード生成を多段階対話型タスクのシリーズとしてモデル化したシミュレーション環境におけるETPOの有効性を評価する。
論文 参考訳(メタデータ) (2024-02-09T07:45:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。