論文の概要: From Failing to Passing: Evolving Natural Language Prompt Optimization Rules for LLM Code Generation
- arxiv url: http://arxiv.org/abs/2607.05121v1
- Date: Mon, 06 Jul 2026 14:10:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.186311
- Title: From Failing to Passing: Evolving Natural Language Prompt Optimization Rules for LLM Code Generation
- Title(参考訳): 失敗から通過へ:LLMコード生成のための自然言語プロンプト最適化ルールの進化
- Authors: Amal Akli, Melissa Akli, Cedric Richter, Mike Papadakis, Yves Le Traon,
- Abstract要約: 本稿では,自然言語変換ルールの集合を特定し,進化させる検索ベースアプローチを提案する。
次に、進化した変換ルールと実行フィードバックの修復を組み合わせた、段階的な修復パイプラインFIXを提案する。
以上の結果から,DualFixはベースライン障害の最大30%を回復し,SelfFixの3~5倍の障害を修正した。
- 参考スコア(独自算出の注目度): 11.454560846406698
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are known to be sensitive to prompt formulation. Even minor variations in wording can substantially degrade performance. This sensitivity reveals an opportunity: if prompt phrasing can harm performance, can it be used to improve it? To investigate this question, we introduce a search-based approach that identifies and evolves a set of natural language transformation rules with strong downstream effects on coding performance. We then propose DUALFIX, a staged repair pipeline that combines the evolved transformation rules with execution-feedback repair, addressing both specification-level and implementation-level failures. A key strength of our approach lies in its generality: the evolved rules are error-agnostic, reusable across problems, and transferable across models. We evaluate DUALFIX against execution-feedback repair baselines across three models on two challenging benchmarks, LiveCodeBench and APPS. Our results show that the evolved transformations fix from 10-30% of failing cases, including 12-17% of failures that execution-based repair alone cannot resolve. Overall, DualFix recovers up to 30% of baseline failures and fixes 3-5 times more failing cases than Self-Fix across all evaluated settings. Furthermore, we also show that rules evolved on one model transfer zero-shot to other models, outperforming execution-feedback repair without any re-optimization.
- Abstract(参考訳): 大規模な言語モデルは、迅速な定式化に敏感であることが知られている。
単語の微妙なバリエーションでさえ、性能を著しく低下させる可能性がある。
この感度は、もしプロンプトのフレーズがパフォーマンスを損なう可能性があるなら、それを改善するために使えるだろうか?
そこで本研究では,符号化性能に強いダウンストリーム効果を持つ自然言語変換規則の集合を同定し,進化させる検索に基づく手法を提案する。
次に、進化した変換ルールと実行フィードバックの修復を組み合わせ、仕様レベルと実装レベルの両方の障害に対処する、段階的な修復パイプラインであるDUALFIXを提案する。
進化したルールはエラーに依存しず、問題間で再利用でき、モデル間で転送可能である。
我々は,LiveCodeBench と APPS の2つのベンチマークで,実行フィードバック修復ベースラインに対するDUALFIX の評価を行った。
その結果、進化した変換は失敗例の10~30%から、実行ベースの修復だけでは解決できない障害の12~17%に修正されていることがわかった。
全体として、DualFixはベースライン障害の最大30%を回復し、評価されたすべての設定でSelf-Fixよりも3~5倍の障害ケースを修正する。
さらに、あるモデルでゼロショットを他のモデルに転送するルールが進化し、再最適化なしに実行フィードバックの修復性能が向上することを示した。
関連論文リスト
- Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation [65.7390808636333]
マルチラウンド・リフレクティブ・ビジュアル・ジェネレーション(RVG)を実現するためのコア・フレームワークとしてReason-Reflect-Rectify(R3)ループを形式化する。
R3-Benchは600以上のエキスパートアノテーション付きインスタンスのベンチマークで、反復的推論と修正機能を定量化します。
実験の結果、R3-RefinerはR3-Benchを大幅に改善した。
論文 参考訳(メタデータ) (2026-05-19T10:24:31Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation [59.964989458924585]
AdaExploreは、パフォーマンスクリティカルなカーネルコード生成のための蓄積された実行フィードバックによる自己改善を可能にするエージェントフレームワークである。
適応段階では、エージェントはタスクを合成し、繰り返し発生する障害を有効ルールの再利用可能なメモリに変換する。
探索段階では、候補核を木として整理し、小さな局所精製とより大きな構造再生を交互に行う。
論文 参考訳(メタデータ) (2026-04-17T18:25:03Z) - ReLoop: Structured Modeling and Behavioral Verification for Reliable LLM-Based Optimization [6.572539312871392]
大規模言語モデル(LLM)は、自然言語を最適化コードに変換することができるが、サイレント障害は重大なリスクをもたらす。
2つの相補的な方向からサイレント障害に対処するReLoopを紹介します。
論文 参考訳(メタデータ) (2026-02-17T20:20:33Z) - Understanding Robustness of Model Editing in Code LLMs: An Empirical Study [1.5624785508022727]
本稿では,5つの最先端モデル編集手法の体系的研究を行う。
これらの手法を3つの主要なオープンソースコードLLM、CodeLlama、CodeQwen1.5、DeepSeek-Coderに適用する。
インスタント編集はモデル性能を常に劣化させ、構文的妥当性は86ポイントまで低下し、機能的正しさは最高のパフォーマンス設定でも45ポイントまで低下する。
論文 参考訳(メタデータ) (2025-11-05T04:58:13Z) - Automated Repair of Ambiguous Problem Descriptions for LLM-Based Code Generation [9.943472604121425]
自然言語(NL)の曖昧さは、ソフトウェアの品質を損なう可能性がある。
あいまいなNL記述の自動修復を導入する。
このアプローチをSpecFixというツールで実装しています。
論文 参考訳(メタデータ) (2025-05-12T06:47:53Z) - Confident Adaptive Language Modeling [95.45272377648773]
CALMは、入力と生成時間ごとに異なる量の計算を動的に割り当てるフレームワークである。
ハイパフォーマンスを確実に維持しつつ、計算能力、潜在的スピードアップを最大3ドルまで削減する上で、我々のフレームワークの有効性を実証する。
論文 参考訳(メタデータ) (2022-07-14T17:00:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。