論文の概要: Route-Align-Verify for Functional Correctness in Code Generation
- arxiv url: http://arxiv.org/abs/2608.03341v1
- Date: Tue, 04 Aug 2026 08:52:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.105259
- Title: Route-Align-Verify for Functional Correctness in Code Generation
- Title(参考訳): コード生成における機能的正確性に対するルートアライメント検証
- Authors: Erxue Zhou, Jingxiang Meng, Aofan Liu,
- Abstract要約: RAVは軽量でモジュール化されたフレームワークで、3つの調整されたステージを通じて固定されたバックボーンモデルでコード生成を改善する。
MBPPベンチマークのRAVを,高濃度およびフル設定の両方で評価した。
その結果、バックボーンアーキテクチャを変更することなく、コード生成における機能的正しさを有意義に改善できることが示唆された。
- 参考スコア(独自算出の注目度): 0.8475107963160777
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) have substantially improved code generation, yet achieving strong functional correctness remains difficult, especially for heterogeneous programming tasks where a single prompting strategy and a single directly generated output are often insufficient. In this paper, we present RAV, a lightweight and modular framework that improves code generation with a fixed backbone model through three coordinated stages: Route, which applies task-aware prompt routing before generation; Align, which reduces the mismatch between fine-tuning prompts and inference-time prompts through aligned LoRA adaptation; and Verify, which selects the final output by executing multiple candidates against visible public tests. We evaluate RAV on the MBPP benchmark under both the sanitized and full settings. The complete RAV pipeline achieves the best performance among all evaluated configurations, reaching 0.8911 on MBPP Sanitized and 0.8520 on MBPP Full. Compared with the base model, these results represent improvements of 6.35 and 9.92 percentage points, respectively. Component-wise ablation experiments further show that task-aware routing and aligned adaptation become substantially more effective when combined with execution-based verification. Additional robustness and contamination analyses support the reliability of the observed improvements. Overall, the results indicate that functional correctness in code generation can be meaningfully improved without modifying the backbone architecture, by jointly optimizing how tasks are prompted, how the model is adapted, and how final outputs are selected.
- Abstract(参考訳): 大規模言語モデル(LLM)はコード生成を大幅に改善したが、特に1つのプロンプト戦略と1つの直接生成出力が不十分な不均一なプログラミングタスクにおいて、強い機能的正しさを達成することは困難である。
本稿では,3つの調整段階を通じて,固定バックボーンモデルによるコード生成を改善する軽量でモジュール化されたフレームワークであるRAVについて述べる。タスク認識型プロンプトを生成前に適用するルータ,微調整型プロンプトと推論時プロンプトのミスマッチを低減するAlign,複数の候補を可視公開テストに対して実行することで最終的な出力を選択するVerifyについて述べる。
MBPPベンチマークのRAVを,高濃度およびフル設定の両方で評価した。
完全なRAVパイプラインは、MBPP Sanitizedで0.8911、MBPP Fullで0.8520に達した。
ベースモデルと比較して、これらの結果はそれぞれ6.35ポイントと9.92ポイントの改善を示している。
コンポーネントワイドアブレーション実験は、実行ベース検証と組み合わせることで、タスク対応ルーティングとアライメント適応が大幅に効果的になることを示す。
さらなる堅牢性と汚染分析は、観測された改善の信頼性を支持する。
全体としては、バックボーンアーキテクチャを変更することなくコード生成における機能的正しさを有意義に改善できることを示し、タスクの推進方法、モデルの適応方法、最終的なアウトプットの選択方法を共同で最適化した。
関連論文リスト
- DaV-Gen: End-to-End Generative Retrieval via Draft-and-Verify [4.546259713278263]
textbfDaV-Genは、検索とレコメンデーションの両方のパラダイムを基本として設計された、新しい統一ソリューションである。
トレーニング中、モデルは候補のドラフトと詳細な検証の両方に同時に最適化される。
これは、2つの異なるが関連する目的に基づいてモデルを共同で訓練する複合損失関数によって達成される。
論文 参考訳(メタデータ) (2026-07-09T11:22:50Z) - LLM-as-a-Verifier: A General-Purpose Verification Framework [74.40111651545979]
本稿では,汎用検証フレームワーク LLM-as-a-Verifier を紹介する。
追加のトレーニングを必要とせずに、エージェントタスクに対してきめ細かいフィードバックを提供する。
いくつかのベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-07-06T17:59:35Z) - Developing a Totally Unimodular Linear Program for Optimal Conformance Checking: When and Why It Complements A* [0.324890820102255]
本稿では、完全一様線形プログラム(LP)としてのアライメントに基づく整合性チェックの再構成を提案する。
基礎となるネットワークフロー構造を利用することで、LP緩和による最適極点解が保証される。
両手法を併用した単純なアルゴリズム選択ガイドラインを導出し, 平均実行時節約率38.6%, 選択精度96%を実現した。
論文 参考訳(メタデータ) (2026-05-26T12:30:23Z) - PARM: Pipeline-Adapted Reward Model [60.769414637325326]
リワードモデル(RM)は、大規模言語モデル(LLM)を人間の好みと整合させることの中心であり、高度な復号化戦略を推進している。
これまでの作業はシングルステップ生成に重点を置いていたが、現実のアプリケーションはますますマルチステージパイプラインを採用するようになっている。
我々は、最適化のためのコード生成を通じてこれを調査し、報酬モデルを定式化とソリューション段階の両方に統合するパイプラインを構築する。
論文 参考訳(メタデータ) (2026-04-20T14:29:08Z) - $V_1$: Unifying Generation and Self-Verification for Parallel Reasoners [69.66089681814013]
$V_$は、効率的なペアワイドランキングを通じて生成と検証を統合するフレームワークである。
V_$-Inferはポイントワイド検証でPass@1を最大10%改善する。
V_$-PairRLは、標準のRLとポイントワイドのジョイントトレーニングよりも、テストタイムのスケーリングが7ドル--9%で向上する。
論文 参考訳(メタデータ) (2026-03-04T17:22:16Z) - CVeDRL: An Efficient Code Verifier via Difficulty-aware Reinforcement Learning [57.24524263804788]
コード検証は、LLMベースのコード生成の検証後において重要な役割を果たす。
既存の教師付き微調整手法は、データの不足、高い失敗率、推論効率の低下に悩まされている。
機能的な報酬しか持たない単純RLは、難しいブランチやサンプルに対して効果的な単体テストを生成することができないことを示す。
論文 参考訳(メタデータ) (2026-01-30T10:33:29Z) - Optimization Modeling via Semantic Anchored Alignment [30.047608671041104]
SAC-Optは,問題セマンティクスにおいて,解答フィードバックではなく最適化モデルに基づく後方誘導補正フレームワークである。
各ステップで、SAC-Optは元のセマンティックアンカーと生成されたコードから再構成されたアンカーを調整し、ミスマッチしたコンポーネントのみを選択的に修正する。
7つの公開データセットに関する実証的な結果は、SAC-Optが平均モデリング精度を7.8%改善し、ComplexLPデータセットで最大21.9%向上したことを示している。
論文 参考訳(メタデータ) (2025-09-28T12:25:31Z) - Toward Reproducible Cross-Backend Compatibility for Deep Learning: A Configuration-First Framework with Three-Tier Verification [1.5269986601063288]
本稿では,ディープラーニングシステムにおけるクロスバックエンド互換性を評価するための構成優先フレームワークを提案する。
このフレームワークはYAMLを使ったコードから実験を分離し、ライブラリモデルとリポジトリモデルの両方をサポートし、3層認証プロトコルを使用している。
ランの72.0%が通過し、ほとんどの不一致はより厳格な閾値で発生している。
論文 参考訳(メタデータ) (2025-08-29T16:28:28Z) - On the Role of Feedback in Test-Time Scaling of Agentic AI Workflows [71.92083784393418]
エージェントAI(自律的な計画と行動を行うシステム)は広く普及しているが、複雑なタスクにおけるタスクの成功率は低いままである。
推論時のアライメントは、サンプリング、評価、フィードバックの3つのコンポーネントに依存します。
本稿では,様々な形態の批判から抽出されたフィードバックを繰り返し挿入するIterative Agent Decoding(IAD)を紹介する。
論文 参考訳(メタデータ) (2025-04-02T17:40:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。