論文の概要: EvoOtter: Evolutionary Reproduction Test Generator
- arxiv url: http://arxiv.org/abs/2607.02854v1
- Date: Fri, 03 Jul 2026 01:30:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.435083
- Title: EvoOtter: Evolutionary Reproduction Test Generator
- Title(参考訳): EvoOtter: 進化的再生テストジェネレータ
- Authors: Toufique Ahmed, Jatin Ganhotra, Avraham Shinnar, Martin Hirzel,
- Abstract要約: EvoOtterは連続半減によるテスト実行コストを制御する。
この問題に対する事前推論スケーリングアプローチのコストのごく一部で、最先端のBRTを生成する。
- 参考スコア(独自算出の注目度): 7.216607755908824
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Before fixing an issue, it is useful to first reproduce it by generating a bug reproduction test (BRT). However, generating a BRT is itself a challenging task, because issue descriptions tend to be informal, making it difficult to determine whether a candidate BRT indeed fails for the reason in the issue. Prior work has attempted to tackle this problem via inference scaling, using large language models to generate many BRTs and patches, then using execution feedback to select and improve them. Unfortunately, this is expensive and the feedback is unreliable. This paper explores evolutionary programming for BRT generation to sharpen the feedback, while enhancing evolutionary programming to keep costs in check. Our new approach, EvoOtter, controls test execution costs via successive halving. Furthermore, it controls LLM costs via batched crossover for an entire generation in a single LLM call, as well as via rule-based code mutations, with a new fitness score tailored for BRTs. As a result, EvoOtter generates state-of-the-art quality BRTs at the fraction of the cost of prior inference-scaling approaches to this problem. More broadly, this paper points at how to efficiently and effectively combine evolutionary programming with large language models for software engineering.
- Abstract(参考訳): 問題を修正する前に、最初にバグ再現テスト(BRT)を生成することで、それを再現することは有用である。
しかしながら、問題記述が非公式である傾向があるため、BRT候補が問題の原因で実際に失敗するかどうかを判断することが難しくなるため、BRT生成自体が難しい作業である。
これまでの作業では、推論スケーリング、大規模言語モデルによる多数のBRTとパッチの生成、実行フィードバックによる選択と改善といった方法でこの問題に対処しようとしていた。
残念ながら、これは高価で、フィードバックは信頼できない。
本稿では,BRT生成のための進化的プログラミングについて検討し,コストを抑えるために進化的プログラミングを改良する。
私たちの新しいアプローチであるEvoOtterは、連続半減によるテスト実行コストを制御します。
さらに、単一のLLMコールで、バッチ化されたクロスオーバーによるLLMコストと、ルールベースのコード変更によって、BRT用に調整された新しいフィットネススコアを制御します。
結果として、EvoOtterは、この問題に対する事前推論スケーリングアプローチのコストのごく一部で最先端のBRTを生成する。
より広範に、ソフトウェア工学のための大規模な言語モデルと進化的プログラミングを効率的に効果的に組み合わせる方法について述べる。
関連論文リスト
- REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - INFUSER: Influence-Guided Self-Evolution Improves Reasoning [54.101135873140066]
2つの共進化的役割を持つ反復的協調学習フレームワークを導入する。
解答器は、生成元が提供する回答に対して標準正当性報酬で訓練される。
8B INF共進化ジェネレータは、数学とコーディングにおいて凍った32B思考ジェネレータより優れている。
論文 参考訳(メタデータ) (2026-06-08T05:40:36Z) - Trace2Skill: Verifier-Guided Skill Evolution for Long-Context EDA Agents [0.3733676450456031]
テスト時間スケーリングフレームワークであるTrace2Skillを提案する。
新しいモデルをトレーニングしたり、より多くの候補ソリューションをサンプリングする代わりに、Trace2Skillはエージェントの自然言語スキルを進化可能なポリシーとして扱う。
成功と失敗モードのために繰り返しロールアウトトレースをマイニングし、それらを密集した診断やオラクルのレッスンに変換し、オラクル、ミューテータ、セレクタループを使用してタスク固有のスキルを生成する。
論文 参考訳(メタデータ) (2026-05-20T23:10:49Z) - BACE: LLM-based Code Generation through Bayesian Anchored Co-Evolution of Code and Test Populations [0.9668407688201359]
我々は、ベイズ的共進化過程として合成を再構成するフレームワークであるBACEを紹介する。
BACEはプロプライエタリモデルとオープンウェイトな小言語モデルの両方で優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-03-30T16:40:11Z) - Taming Imperfect Process Verifiers: A Sampling Perspective on Backtracking [54.43083499412643]
言語モデルの生成能力をプロセス検証器と組み合わせたテストタイムアルゴリズムは、新しい推論能力を引き出すための有望なレバーを提供する。
提案手法は, 理論的に根拠付きバックトラックを用いて, 検証誤差に対して, 確実な堅牢性を実現するための新しいプロセス誘導型テスト時間サンプリングアルゴリズムであるVGBを導入する。
論文 参考訳(メタデータ) (2025-10-03T16:21:14Z) - Satori-SWE: Evolutionary Test-Time Scaling for Sample-Efficient Software Engineering [51.7496756448709]
言語モデル(LM)は、コーディングベンチマークではうまく機能するが、現実のソフトウェア工学のタスクでは苦労する。
既存のアプローチは、高品質なデータによる教師付き微調整に依存している。
本研究では, 生成を進化過程として扱うサンプル効率の高い手法であるテスト時間スケーリング(EvoScale)を提案する。
論文 参考訳(メタデータ) (2025-05-29T16:15:36Z) - Agentic Bug Reproduction for Effective Automated Program Repair at Google [9.64193881099048]
本稿では,業界,特にGoogleにおけるBRTの自動生成について検討する。
我々は、最先端のBRT生成技術であるLIBROを適応し、評価し、エージェントベースのアプローチであるBRT Agentを提示する。
以上の結果から,APRシステムにBRTを提供することで,バグが30%増えることが判明した。
論文 参考訳(メタデータ) (2025-02-03T20:57:17Z) - LLMs as Continuous Learners: Improving the Reproduction of Defective Code in Software Issues [62.12404317786005]
EvoCoderは、イシューコード再現のための継続的学習フレームワークである。
その結果,既存のSOTA法よりも20%改善した。
論文 参考訳(メタデータ) (2024-11-21T08:49:23Z) - CodeRL: Mastering Code Generation through Pretrained Models and Deep
Reinforcement Learning [92.36705236706678]
CodeRLは、事前訓練されたLMと深層強化学習によるプログラム合成タスクのための新しいフレームワークである。
推論中、我々は重要なサンプリング戦略を持つ新しい生成手順を導入する。
モデルバックボーンについては,CodeT5のエンコーダデコーダアーキテクチャを拡張し,学習目標を拡張した。
論文 参考訳(メタデータ) (2022-07-05T02:42:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。