論文の概要: Noisy Test-Time Reinforcement Learning for Code LLMs
- arxiv url: http://arxiv.org/abs/2609.32172v1
- Date: Sat, 26 Sep 2026 02:50:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 19:16:15.007853
- Title: Noisy Test-Time Reinforcement Learning for Code LLMs
- Title(参考訳): コードLLMのためのノイズの多いテスト時間強化学習
- Abstract要約: 大規模言語モデル(LLM)は、様々なコード関連タスクで顕著なパフォーマンスを示している。
LLMは曖昧でエラーを起こしやすいため、コードLLMの堅牢性には重大な課題がある。
本稿では,NTRL-Code(Noisy Test-time Reinforcement Learning framework)を提案する。
- 参考スコア(独自算出の注目度): 49.18760234865557
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) have demonstrated remarkable performance across various code-related tasks. However, unlike carefully curated datasets that are typically high-quality and error-free, real-world user instructions are often vague and error-prone, posing significant challenges to the robustness of code LLMs. Furthermore, robustness-oriented fine-tuning relies on paired clean-noisy samples, which are costly to curate and require sophisticated noisy simulation techniques. To address these challenges, we propose the Noisy Test-time Reinforcement Learning framework (NTRL-Code), which enables robust self-evolution of code LLMs using only unlabeled noisy data during the testing stage. Specifically, NTRL-Code uses conservative self-denoising to obtain a cleaner semantic anchor for target estimation, and employs an abstract-syntax-tree (AST)-based structural aggregation mechanism to estimate a proxy target from multiple candidate programs. The policy is then optimized on the original noisy prompts with a hybrid reward that combines format validity, code similarity, and anti-repetition signals. Extensive experiments on three benchmarks, each incorporating character-level, word-level, and paragraph-level perturbations, demonstrate that NTRL-Code yields robust and consistent improvements, stabilizing the predictions of various base models. Our code is available at https://github.com/Xikai97/NTRL-Code.
- Abstract(参考訳): 大規模言語モデル(LLM)は、様々なコード関連タスクで顕著なパフォーマンスを示している。
しかし、一般的に高品質でエラーのない、現実のユーザ命令である慎重にキュレートされたデータセットとは異なり、しばしば曖昧でエラーを起こし、LLMの堅牢性には重大な課題がある。
さらに、ロバストネス指向の微調整は、洗練されたノイズシミュレーション技術を必要とする、ペア化されたクリーンノイズサンプルに依存している。
これらの課題に対処するため、テスト段階ではラベルなしノイズデータのみを使用して、コードLLMの堅牢な自己進化を可能にするノイズテスト時強化学習フレームワーク(NTRL-Code)を提案する。
具体的には、NTRL-Codeは、保守的な自己決定を用いて、ターゲット推定のためのよりクリーンなセマンティックアンカーを取得し、抽象構文木(AST)に基づく構造集約機構を用いて、複数の候補プログラムからプロキシターゲットを推定する。
ポリシーは、フォーマットの妥当性、コード類似性、反繰り返し信号を組み合わせたハイブリッド報酬によって、元のノイズプロンプトに最適化される。
文字レベル、単語レベル、段落レベルの摂動を組み込んだ3つのベンチマークによる大規模な実験により、NTRL-Codeは、様々なベースモデルの予測を安定化し、堅牢で一貫した改善をもたらすことを示した。
私たちのコードはhttps://github.com/Xikai97/NTRL-Codeで利用可能です。
関連論文リスト
- Large Language Models as Falsifiers for Cyber-Physical Systems [9.51315659492505]
Falsificationは、サイバー物理システムの正式な仕様に対する反例を検索する。
LLM-Falsifierは,ロバスト性STL度を最小化することで仕様を偽造する手法である。
ARCH-COMPのファルシフィケーションベンチマークでは、LCM-Falsifierは既存のファルシフィケーションツールより優れていることが示されている。
論文 参考訳(メタデータ) (2026-09-17T17:40:04Z) - Robust Code RL via Faulty-Code-Driven Test case Synthesis and Dense Reward Shaping [25.919848220574803]
RobustTestsは、欠陥のあるコード駆動のテストケース合成戦略を特徴とするフレームワークである。
遅延論理的不一致を捕捉し、バリデータエージェントを使用して無効または冗長なテストケースをフィルタリングする。
我々は,ロバストテストによるQwen3-32Bの微調整により,LiveCodeBenchでは3%の絶対的なゲインが得られることを示す。
論文 参考訳(メタデータ) (2026-08-25T07:00:08Z) - Task Abstention for Large Language Models in Code Generation [16.35286288670945]
大規模言語モデル(LLM)は、自動コード生成に革命をもたらした。
「一つはいわゆる幻覚である。」
本研究は,特定のコード生成タスクの実行を停止すべきか否かを判定し,幻覚を避けるためのタスク停止問題について検討する。
論文 参考訳(メタデータ) (2026-05-16T14:58:11Z) - Verbatim Data Transcription Failures in LLM Code Generation: A State-Tracking Stress Test [1.8875967655304022]
多くの実世界のソフトウェアタスクは、提供されたデータのコードへの正確な書き起こしを必要とする。
小さな省略や変更は、構文的に有効なプログラムを作成しながら沈黙し続けることができる。
本稿では、この信頼性の懸念を解消するために、意図的に最小限の書き起こし-コードベンチマークを導入する。
論文 参考訳(メタデータ) (2026-01-07T06:38:34Z) - Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective [85.06838178922791]
強化学習(RL)は自己回帰言語モデルに非常に効果的であることが証明されている。
しかし、これらの手法を拡散大言語モデル(dLLM)に適応させることは、根本的な課題を提起する。
本稿では,全シーケンス生成を単一アクションとして扱い,ELBOを抽出可能なシークエンスレベル確率プロキシとして利用する,原則的RLフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-03T13:05:32Z) - VERIRL: Boosting the LLM-based Verilog Code Generation via Reinforcement Learning [32.974199255760944]
本稿では,Verilogコード生成に適した強化学習フレームワークを提案する。
スパース信号と雑音信号に対処するために,トレースバックに基づくRescore機構を提案する。
RL微調整中の破滅的忘れと過適合を軽減するため,サンプルバランスの重み付け戦略を導入する。
論文 参考訳(メタデータ) (2025-08-25T20:20:44Z) - DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation [68.19756761027351]
拡散大言語モデル(dLLM)は自己回帰(AR)モデルの魅力的な代替品である。
本研究は,それらの認知過程と強化学習手法について考察する。
我々の研究は、dLLM生成のメカニズムについて深い洞察を与え、効果的な拡散ネイティブなRLトレーニングフレームワークを提供します。
論文 参考訳(メタデータ) (2025-06-25T17:35:47Z) - Benchmarking Uncertainty Quantification Methods for Large Language Models with LM-Polygraph [83.90988015005934]
不確実性定量化は機械学習アプリケーションにおいて重要な要素である。
最新のUQベースラインの集合を実装した新しいベンチマークを導入する。
我々は、11タスクにわたるUQと正規化技術に関する大規模な実証的研究を行い、最も効果的なアプローチを特定した。
論文 参考訳(メタデータ) (2024-06-21T20:06:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。