論文の概要: Function-Level Execution Feedback for Code Preference Optimization
- arxiv url: http://arxiv.org/abs/2608.23632v1
- Date: Sun, 23 Aug 2026 13:53:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.432207
- Title: Function-Level Execution Feedback for Code Preference Optimization
- Title(参考訳): コード優先最適化のための関数レベル実行フィードバック
- Authors: Idris Nechnech, Sehwan Kim, Jimin Seo, Yeongoon Kim, Minhae Oh, Sangwoo Hong, Jungwoo Lee,
- Abstract要約: 分割された多機能プログラムにおいて,ステップをモジュールレベルの関数として定義する,コード優先最適化のためのフレームワークを提案する。
本手法は,ステップワイズKTOのコード固有インスタンス化を実現する。
我々はHumanEval(+), MBPP(+), BigCodeBench, LiveCodeBenchを評価し,STEP-KTODERは結果のみのKTOとDPOよりも改善することを示した。
- 参考スコア(独自算出の注目度): 7.688541319434344
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Process supervision has improved mathematical reasoning, where intermediate steps are naturally expressed as chains of thought. In code generation, however, process supervision remains underexplored because there is no standard notion of a step. Supervision can target lines, reasoning traces, or program states, making it unclear what to label and optimize. We propose STEP-KTODER, a framework for code preference optimization that defines steps as module-level functions in decomposed multi-function programs and assigns binary correctness labels via automatically generated unit tests. Our method provides a code-specific instantiation of stepwise KTO, combining function-level process supervision with outcome-level feedback on the full program. We evaluate on HumanEval(+), MBPP(+), BigCodeBench, and LiveCodeBench, showing that STEP-KTODER improves over outcome-only KTO and DPO. Further analysis shows that execution-based labels are essential: LLM-as-a-judge annotations systematically over-predict function failures, corrupt positive step labels, and degrade downstream preference optimization. Code is available at: https://github.com/inechnech/STEP-KTODER.
- Abstract(参考訳): プロセスの監督は数学的推論を改善し、中間段階は自然に思考の連鎖として表される。
しかし、コード生成においては、プロセスの監督は、ステップの標準的な概念がないため、未調査のままである。
Supervisionは、行、推論トレース、プログラム状態をターゲットにして、ラベル付けと最適化の方法が明確でないようにする。
コード優先最適化のためのフレームワークSTEP-KTODERを提案し、分解された多機能プログラムにおいてステップをモジュールレベル関数として定義し、自動生成された単体テストを通してバイナリ正当性ラベルを割り当てる。
本手法は,関数レベルのプロセス監視と結果レベルのフィードバックを組み合わせた,段階的KTOのコード固有インスタンス化を提供する。
我々はHumanEval(+), MBPP(+), BigCodeBench, LiveCodeBenchを評価し,STEP-KTODERは結果のみのKTOとDPOよりも改善することを示した。
LLM-as-a-judgeアノテーションは、体系的に過予測関数の失敗、腐敗した正のステップラベル、下流の好みの最適化を分解する。
コードは、https://github.com/inechnech/STEP-KTODER.comで入手できる。
関連論文リスト
- Bellman-Taylor Score Decoding for Markov Decision Processes with State-Dependent Feasible Action Sets [14.165642103539632]
本稿では,政策学習をユークリッドのスコア空間に移行し,アクションデコーダによる実行可能性を高める枠組みを提案する。
このフレームワークを,状態依存型インデックスベースのディスパッチルールを本質的に学習する待ち行列ネットワーク制御問題に適用する。
数値実験により、小さなインスタンスではほぼ最適性能を示し、大規模システムではベンチマークよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-06-09T15:15:21Z) - ThinkBooster: A Unified Framework for Seamless Test-Time Scaling of LLM Reasoning [110.46431027868954]
ThinkBoosterは、大規模言語モデル(LLM)推論のシームレスなテスト時間計算スケーリングのためのフレームワークである。
最新のTTCスケーリング戦略とスコアファミリを実装するモジュール型のPythonライブラリで構成されている。
デプロイ可能なOpenAI互換プロキシサービスにより、現実のアプリケーションへの適応推論のドロップイン統合が可能になる。
論文 参考訳(メタデータ) (2026-06-05T05:28:46Z) - Step-TP: A Grounded, Step-Level Dataset with Chain-of-Thought Reasoning for LLM-Guided Tensor Program Optimization [24.150613011881774]
Step-TPはテンソルプログラム最適化のためのトレーニング後のデータセットである。
構造的チェーン・オブ・シークレット(CoT)推論による、基底的で原子レベルのステップレベルの監視を提供する。
Step-TPは、中間プログラム状態上のクローズド推論ループを形成し、信頼性の高いマルチステップ最適化を可能にする。
論文 参考訳(メタデータ) (2026-05-25T15:29:49Z) - Semantics-Based Verification of an Implemented Shor Oracle for ECDLP in Qrisp [9.455788055292418]
本稿では,Qrisp上に構築されたエンドツーエンドでコンパイル可能なCDLP実装に対して,セマンティクス第一の検証視点を提案する。
プログラムセマンティクスのレベルで実装されたオラクルを指定し、そのキーコンポーネントに対する洗練スタイルの検証義務を導出し、結果として生じるオラクルファミリーに対して高い複雑性の議論を提供する。
論文 参考訳(メタデータ) (2026-05-01T18:21:37Z) - DreamPRM-Code: Function-as-Step Process Reward Model with Label Correction for LLM Coding [30.131052926559956]
本稿では,関数を推論ステップとして扱う符号化型PRMであるDreamPRM-Codeを提案する。
ラベルノイズに対処するため、DreamPRM-Codeはメタラーニングに基づく補正機構を導入した。
テスト時間のスケーリングを適用することで、DreamPRM-Codeは80.9pass@1レートでLiveCodeBenchで最先端のパフォーマンスを達成し、OpenAI o4-miniを上回った。
論文 参考訳(メタデータ) (2025-12-17T01:11:35Z) - PACIFIC: a framework for generating benchmarks to check Precise Automatically Checked Instruction Following In Code [1.1164117387254457]
大言語モデル(LLM)ベースのコードアシスタントは、生成AIの強力な応用として登場した。
これらのシステムの主な要件は、ユーザの指示を正確に従う能力である。
PACIFICは,逐次命令追従機能とコードドライラン機能とを厳格に評価するベンチマークを自動的に生成する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-12-11T14:49:56Z) - Verification Learning: Make Unsupervised Neuro-Symbolic System Feasible [49.084647802326366]
本稿では,Nesyにおけるラベルに基づく推論プロセスをラベルのない検証プロセスに変換する,新しい学習パラダイムであるVerification Learning(VL)を紹介する。
VLは、ラベルのないデータと、現在の予測が規則に準拠しているかどうかを検証する関数にのみ依存することにより、優れた学習結果を得る。
我々の理論的分析は、Nesyシステム内のどのタスクがラベルなしで完了できるかを指摘し、なぜルールが無限ラベルを置き換えられるのかを説明している。
論文 参考訳(メタデータ) (2025-03-17T08:28:58Z) - Test-Time Alignment for Large Language Models via Textual Model Predictive Control [63.508812485566374]
Textual Model Predictive Control (TMPC) は、推論時に大規模言語モデルを調整するために適応された新しい予測計画フレームワークである。
TMPCは、談話レベル翻訳、長文応答生成、プログラム合成の3つの異なるセグメンテーション特性を持つタスクで評価される。
その結果、TMPCはパフォーマンスを継続的に改善し、一般性を強調している。
論文 参考訳(メタデータ) (2025-02-28T07:24:33Z) - Step-KTO: Optimizing Mathematical Reasoning through Stepwise Binary Feedback [94.25162866972077]
Step-KTOは、プロセスレベルと結果レベルのバイナリフィードバックを組み合わせたトレーニングフレームワークである。
実験の結果,Step-KTOは最終回答の精度と中間推論の質の両方を著しく向上させることがわかった。
論文 参考訳(メタデータ) (2025-01-18T15:38:03Z) - Contextual Stochastic Bilevel Optimization [50.36775806399861]
文脈情報と上層変数の期待を最小化する2レベル最適化フレームワークCSBOを導入する。
メタラーニング、パーソナライズドラーニング、エンド・ツー・エンドラーニング、Wassersteinはサイド情報(WDRO-SI)を分散的に最適化している。
論文 参考訳(メタデータ) (2023-10-27T23:24:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。