論文の概要: Rubric-to-Code Credit Assignment for Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.27906v2
- Date: Mon, 31 Aug 2026 09:54:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 15:47:04.372889
- Title: Rubric-to-Code Credit Assignment for Reinforcement Learning
- Title(参考訳): 強化学習のためのルーブリック・コード・クレジット・アサインメント
- Abstract要約: textbfRubric-to-Code Credit Assignment (RCCA)は、明示的な機能的ルーリックに関するトレーニングタスクを構築する。
textbfLing-RCCA-FlashはMiniAppBenchで41.25得点し、Ling-3.0-Flashを32.20ポイント改善し、Claude Opus 4.5をわずかに上回った。
また、ArtifactsBenchでは76.19に到達し、SFTモデルを4.48ポイント改善し、GPT-5スコアを3.64ポイント越えて公式のArtifactsBenchリーダーボード設定の下で新しいトップスコアを確立した。
- 参考スコア(独自算出の注目度): 21.1862592292469
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Interactive web application generation requires models to produce usable HTML, CSS, and JavaScript applications from natural language requests. Unlike conventional code generation, application quality depends on multiple user-facing functional requirements, each often tied to localized code regions such as event handlers, state updates, DOM fragments, or CSS selectors. Standard GRPO collapses these structured outcomes into a single sequence-level reward and applies the resulting advantage uniformly to all tokens, weakening credit assignment. We propose \textbf{Rubric-to-Code Credit Assignment} (RCCA), a reinforcement learning framework that converts rubric-level functional feedback into localized optimization signals over generated code. RCCA builds training tasks around explicit functional rubrics, uses a hierarchical reward to separate format, source-code, runtime, and functional failures, and aligns evaluator-generated textual attributions with responsible code spans and generated tokens. The resulting model, \textbf{Ling-RCCA-Flash}, scores 41.25 on MiniAppBench, improving Ling-3.0-Flash by 32.20 points and slightly surpassing Claude Opus 4.5. It also reaches 76.19 on ArtifactsBench, improving the SFT model by 4.48 points and establishing a new top score under the official ArtifactsBench leaderboard setting by surpassing the GPT-5 score by 3.64 points, suggesting transferable implementation-level gains.
- Abstract(参考訳): インタラクティブなWebアプリケーション生成には、自然言語要求から利用可能なHTML、CSS、JavaScriptアプリケーションを生成するモデルが必要である。
従来のコード生成とは異なり、アプリケーション品質は複数のユーザ向きの機能要件に依存しており、それぞれがイベントハンドラ、状態更新、DOMフラグメント、CSSセレクタといったローカライズされたコード領域に結び付けられていることが多い。
標準GRPOは、これらの構造化結果を単一のシーケンスレベルの報酬に分解し、結果として得られる利点を全てのトークンに均一に適用し、クレジット割り当てを弱める。
本稿では,ルーブリックレベルの関数フィードバックを局所最適化信号に変換する強化学習フレームワークである‘textbf{Rubric-to-Code Credit Assignment} (RCCA) を提案する。
RCCAは、明示的な機能的ルーリックに関するトレーニングタスクを構築し、階層的な報酬を使用して、フォーマット、ソースコード、ランタイム、関数的障害を分離し、評価器生成したテキスト属性を、責任のあるコードスパンと生成されたトークンと整合させる。
結果のモデルである「textbf{Ling-RCCA-Flash}」はMiniAppBenchで41.25点を獲得し、Ling-3.0-Flashを32.20点改善し、Claude Opus 4.5をわずかに上回った。
また、ArtifactsBenchでは76.19に到達し、SFTモデルを4.48ポイント改善し、GPT-5スコアを3.64ポイント上回ることで公式のArtifactsBenchリーダーボード設定の下で新しいトップスコアを確立した。
関連論文リスト
- SCOPE: Leveraging Subgoal Critiques for Code Generation [14.869703886733761]
本稿では,コード生成のプロファイラdサブゴール批判であるSCOPEを紹介する。
SCOPEはリーン指向の証明モデルを採用し、下流のコード生成のために3つの解析可能なフィードバックフィールドを生成する。
提案手法は、教師付き微調整、プロセス整合強化学習(RL)、フィードバック誘導推論を組み合わせたものである。
論文 参考訳(メタデータ) (2026-07-07T04:09:41Z) - Themis: Training Robust Multilingual Code Reward Models for Flexible Multi-Criteria Scoring [51.497900015187675]
Themis-CodePreferenceは、これまでで最大のコード好みのオープンソースコレクションで、多言語コード報酬モデルのスイートであるThemis-RMのトレーニングに使用しています。
多様な嗜好に基づいてトレーニングを行う場合, 積極的なスケーリング傾向, 強い言語間移動を示す実験とアブリケーションを行った。
論文 参考訳(メタデータ) (2026-05-01T16:07:34Z) - SPARC: Scenario Planning and Reasoning for Automated C Unit Test Generation [1.0010193170880752]
本稿では,高レベルのプログラム意図とポインタ演算と手動メモリ管理の厳密な構文制約とのギャップを埋める,ニューロシンボリックなシナリオベースのフレームワークを提案する。
我々は、59の現実世界およびアルゴリズムの被験者で評価し、バニラプロンプト生成ベースラインを31.36%、分岐カバレッジ26.01%、突然変異スコア20.78%で上回り、シンボリック実行ツールKLEEに適合または超えている。
論文 参考訳(メタデータ) (2026-02-18T18:09:03Z) - Divide-and-Conquer Meets Consensus: Unleashing the Power of Functions in Code Generation [25.344800819245858]
FunCoderは、機能的なコンセンサスに分割と参照の戦略を取り入れたコード生成フレームワークである。
FunCoderは、HumanEval、MBPP、xCodeEval、MATHにおいて、GPT-3.5とGPT-4で、最先端のメソッドを平均で+9.8%上回る。
論文 参考訳(メタデータ) (2024-05-30T14:31:33Z) - Learning Prompt with Distribution-Based Feature Replay for Few-Shot Class-Incremental Learning [56.29097276129473]
分散型特徴再現(LP-DiF)を用いた学習プロンプト(Learning Prompt)という,シンプルで効果的なフレームワークを提案する。
新しいセッションでは,学習可能なプロンプトが古い知識を忘れないようにするため,擬似機能的リプレイ手法を提案する。
新しいセッションに進むと、古いクラスのディストリビューションと現在のセッションのトレーニングイメージを組み合わせて擬似フィーチャーをサンプリングして、プロンプトを最適化する。
論文 参考訳(メタデータ) (2024-01-03T07:59:17Z) - RLTF: Reinforcement Learning from Unit Test Feedback [17.35361167578498]
Reinforcement Learning from Unit Test Feedback(リンク)は、新しいオンラインRLフレームワークである。
提案手法は,訓練中にリアルタイムにデータを生成し,高精度なフィードバック信号を用いて高品質なコードを生成する。
論文 参考訳(メタデータ) (2023-07-10T05:18:18Z) - Exploring Continual Learning for Code Generation Models [80.78036093054855]
継続的学習(CL)は、コードドメインの中でまだ過小評価されていない重要な側面である。
コード生成,翻訳,要約,改良など,幅広いタスクをカバーするCodeTask-CLというベンチマークを導入する。
即時選択機構の不安定な訓練により,プロンプトプール (PP) などの有効手法が破滅的な忘れ込みに悩まされることが判明した。
論文 参考訳(メタデータ) (2023-07-05T16:58:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。