論文の概要: Benchmarking Code Improvement with Progressive, Adaptive, and Interactive Feedback
- arxiv url: http://arxiv.org/abs/2607.01360v1
- Date: Wed, 01 Jul 2026 18:20:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.550321
- Title: Benchmarking Code Improvement with Progressive, Adaptive, and Interactive Feedback
- Title(参考訳): プログレッシブ、アダプティブ、インタラクティブなフィードバックによるコード改善のベンチマーク
- Authors: Cuong Chi Le, Aashish Yadavally, Minh Le-Anh, Tien N. Nguyen,
- Abstract要約: PAIR-Benchは、大規模言語モデル(LLM)を評価するためのプログレッシブベンチマークである。
不正確なプログラムや不完全なプログラムを、フィードバック誘導による改善によって、より正しいプログラムに変換する。
モデルがターゲットの障害を修復するかどうかを計測し、ヒントを超えて一般化し、すでに正しい振る舞いを保持し、どのくらいの助けが必要なのかを測定します。
- 参考スコア(独自算出の注目度): 13.976149104483449
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are typically evaluated on code generation and program repair using binary functional correctness: a generated program or patch either passes or fails a test suite. This protocol is simple but coarse, as it ignores partial progress, feedback use, regressions, and the refinement trajectory through which models often improve code. We introduce PAIR-Bench, a progressive and adaptive benchmark for evaluating code improvement: transforming an incorrect or incomplete program into a more correct one through feedback-guided refinement. PAIR-Bench uses progressive hinting, a structured feedback protocol with two controls. Failure-region control determines what the feedback targets by grouping hidden failing tests into failure scenarios, while hint-depth control determines how much repair-relevant information is revealed, from coarse symptoms to implementation-level guidance. This design enables PAIR-Bench to measure whether a model repairs targeted failures, generalizes beyond the hint, preserves already-correct behavior, and how much assistance it requires. By evaluating repair trajectories progressive metrics rather than only final pass/fail outcomes, PAIR-Bench provides a finer-grained assessment of LLM code-improvement capability.
- Abstract(参考訳): 大規模言語モデル(LLM)は通常、バイナリ関数の正当性を使ってコード生成とプログラムの修正で評価される:生成されたプログラムまたはパッチがテストスイートをパスまたは失敗する。
このプロトコルは単純だが、部分的な進歩、フィードバックの使用、回帰、そしてモデルがしばしばコードを改善する洗練された軌道を無視しているため、粗い。
PAIR-Benchは、コード改善を評価するための、プログレッシブで適応的なベンチマークである。
PAIR-Benchはプログレッシブヒントを使っており、2つのコントロールを持つ構造化されたフィードバックプロトコルである。
障害領域制御は、隠れたテストから障害シナリオにグループ化することで、フィードバックがターゲットとするものを決定するが、ヒント-深さ制御は、粗い症状から実装レベルのガイダンスに至るまで、修理関連情報がどの程度明らかにされるかを決定する。
この設計により、PAIR-Benchは、モデルが対象とする障害を修復するかどうか、ヒントを超えて一般化し、すでに正しい振る舞いを保持し、必要な助けをどれだけ確保するかを測定することができる。
PAIR-Benchは、最終的なパス/フェイル結果だけでなく、プログレッシブなメトリクスを評価することで、LLMコード改善能力のよりきめ細かい評価を提供する。
関連論文リスト
- REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - ProcCtrlBench: Evaluating Process-Level Defects and Control Preservation in LLM Coding Agents [4.908588441456849]
ProcCtrlBenchは、LLM符号化エージェントの実行プロセス評価のベンチマークである。
4つのカテゴリで11の障害タイプをカバーする再利用可能なオントロジーに、繰り返し実行される障害を整理する。
最終結果のみではなく、標準化されたプロセスエビデンスを通じてエージェントの軌跡を評価する。
論文 参考訳(メタデータ) (2026-05-18T08:34:48Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Beyond Fixed Tests: Repository-Level Issue Resolution as Coevolution of Code and Behavioral Constraints [17.818522356206977]
ほとんどの大規模言語モデル(LLM)ベースの修復システムは、修理中に固定された動作制約を扱います。
本稿では,Agent-CoEvoを提案する。Agent-CoEvoは共進化的マルチエージェントフレームワークで,候補コードパッチとテストパッチを共同で探索し,洗練する。
Agent-CoEvoは、修復の成功と再現性の両方において、最先端のエージェントベースとエージェントレスベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-04-06T10:26:46Z) - TraceCoder: A Trace-Driven Multi-Agent Framework for Automated Debugging of LLM-Generated Code [11.207330722400764]
人間の観察・分析・修復過程をエミュレートするフレームワークであるTraceCoderを提案する。
このフレームワークはまずコードを診断プローブで測定し、粒度の細かいランタイムトレースをキャプチャする。
その後、これらのトレースについて因果解析を行い、失敗の根本原因を正確に特定する。
論文 参考訳(メタデータ) (2026-02-06T16:59:48Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Probing Pre-trained Language Models on Code Changes: Insights from ReDef, a High-Confidence Just-in-Time Defect Prediction Dataset [0.0]
本稿では,22の大規模C/C++プロジェクトから得られた関数レベル修正の信頼性の高いベンチマークであるReDefを紹介する。
欠陥ケースはコミットの反転によって固定され、クリーンケースはポストホック履歴チェックによって検証される。
このパイプラインは3,164の欠陥と10,268のクリーンな修正をもたらし、既存のリソースよりも信頼性の高いラベルを提供する。
論文 参考訳(メタデータ) (2025-09-11T07:07:11Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Teaching Your Models to Understand Code via Focal Preference Alignment [70.71693365502212]
既存の手法では、テストケースの成功率に基づいてn個の候補解が評価される。
このアプローチは、特定のエラーを特定するのではなく、失敗するコードブロック全体を整列するので、意味のあるエラーと訂正の関係を捉えるのに必要な粒度が欠けている。
我々は、人間の反復デバッグを模倣してコードLLMを洗練させる新しい優先順位調整フレームワークであるTarget-DPOを提案する。
論文 参考訳(メタデータ) (2025-03-04T16:56:34Z) - FixEval: Execution-based Evaluation of Program Fixes for Programming
Problems [23.987104440395576]
FixEvalは、競合するプログラミング問題とそれに対応する修正に対して、バグの多いコードを提出するベンチマークです。
FixEvalは、モデル生成プログラム修正の正確性を評価するために、ユニットテストの広範なコレクションを提供する。
実験の結果,マッチングに基づくメトリクスは,モデル生成プログラムの修正を正確に反映しないことがわかった。
論文 参考訳(メタデータ) (2022-06-15T20:18:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。