論文の概要: Humanizing Automatically Generated Unit Test Suites with LLM-Based Refactoring
- arxiv url: http://arxiv.org/abs/2606.28229v2
- Date: Wed, 01 Jul 2026 13:24:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 15:15:53.055173
- Title: Humanizing Automatically Generated Unit Test Suites with LLM-Based Refactoring
- Title(参考訳): LLMに基づくリファクタリングによる自動生成ユニットテストスイートの人間化
- Authors: Wendkûuni C. Ouédraogo, Yinghua Li, Xueqi Dang, Paweł Borsukiewicz, Liang Xiao, Lingfeng Bao, Anil Koyuncu, Jacques Klein, David Lo, Tegawendé F. Bissyandé,
- Abstract要約: EvoSuiteのような検索ベースのテスト生成ツールは、コンパイル可能で高カバレッジのユニットテストを大規模に生成するが、それらのスイートは読み書きが難しいことが多い。
コンパイル可能なSBSTスイート上でLLMを制御層として使用するハイブリッドSBST+LLMアプローチであるTestHumanizerを導入し、命名、構造、開発者指向の明確性を改善する。
TestHumanizerのコンパイル率は88~98%に達し、EvoSuiteの100%ベースラインに近い。
- 参考スコア(独自算出の注目度): 18.727291516223115
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Search-based test generation tools such as EvoSuite produce compilable and high-coverage unit tests at scale, but their suites are often hard to read and maintain. LLMs can generate more natural tests, yet direct generation remains brittle, with compilation rates of only 51-78% in our study. We introduce TestHumanizer, a hybrid SBST+LLM approach that uses LLMs as controlled refactoring layers over compilable SBST suites to improve naming, structure, and developer-oriented clarity while preserving behavior and compilation validity. We evaluate TestHumanizer on 350 classes from Defects4J and SF110. EvoSuite generates 15 suites per class, and each suite is refactored under three context configurations using gpt-4o and mistral-large-2407, yielding 31,500 refactorings. TestHumanizer reaches 88-98% compilation rates, close to EvoSuite's 100% baseline and clearly above direct LLM generation. Structural coverage is largely preserved, typically within 1-2 percentage points, and 86-95% of refactorings satisfy a composite faithful-refactoring threshold. Refactored suites also improve predicted readability, reduce control-flow and cognitive complexity, and mitigate structural smells. The summary-based setting offers the most robust trade-off, while long code-centric prompts are more prone to hallucination-induced failures. A developer study on 30 classes and 444 test methods confirms significant gains in perceived readability and willingness to adopt, with Wilcoxon p less than 0.01 and substantial inter-rater agreement. Overall, LLMs are most effective not as standalone generators but as validation-gated refinement layers over robust SBST outputs.
- Abstract(参考訳): EvoSuiteのような検索ベースのテスト生成ツールは、コンパイル可能で高カバレッジのユニットテストを大規模に生成するが、それらのスイートは読み書きが難しいことが多い。
LLMはより自然なテストを生成することができるが、直接生成は不安定であり、我々の研究では51-78%しかコンパイルできない。
コンパイル可能なSBSTスイート上でLLMを制御されたリファクタリング層として使用するハイブリッドSBST+LLMアプローチであるTestHumanizerを導入し、動作とコンパイルの有効性を維持しながら、命名、構造、開発者指向の明確さを改善する。
We evaluate TestHumanizer on 350 classes from Defects4J and SF110。
EvoSuiteはクラス毎に15のスイートを生成し、各スイートは gpt-4o と mistral-large-2407 を使用して3つのコンテキスト構成でリファクタリングされる。
TestHumanizerのコンパイル率は88-98%に達し、EvoSuiteの100%ベースラインに近い。
構造的カバレッジは、通常1-2ポイント以内で維持され、86-95%のリファクタリングは、複合的な忠実なリファクタリングしきい値を満たす。
リファクタリングされたスイートは、予測可読性を改善し、制御フローと認知の複雑さを減らし、構造的な臭いを軽減する。
要約ベースの設定は最も堅牢なトレードオフを提供するが、長いコード中心のプロンプトは幻覚による障害を引き起こす傾向にある。
30のクラスと444のテストメソッドに関する開発者研究は、Wilcoxon p が 0.01 未満で、実質的なラター間合意によって、可読性と採用意欲が著しく向上することを確認している。
全体として、LCMはスタンドアロンのジェネレータとしてではなく、堅牢なSBST出力上のバリデーション修飾層として最も効果的である。
関連論文リスト
- SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers [55.39407031861402]
本稿では,スマートコントラクトデコンパイルのためのデータセットとベンチマーク手法であるSCDBenchを紹介する。
データセットには600の現実のSolidityコントラクトと、ペア化されたバイトコード入力、地味なソースコード、再生可能なセマンティックチェックポイントが含まれている。
我々は,GLM-5の変種を含むゼロショット逆コンパイル設定において,Claude Opus 4.7,GPT-5.3-Codex,GLM-5を評価した。
論文 参考訳(メタデータ) (2026-05-27T20:08:47Z) - Constraint-Guided Multi-Agent Decompilation for Executable Binary Recovery [47.704311990064554]
脱コンパイルは、セキュリティ分析、マルウェアのリバースエンジニアリング、レガシーソフトウェアメンテナンスに不可欠である。
マルチレベル制約誘導型デコンパイル(MCGD)により,デコンパイルされたコードを再実行可能なソースに変換するマルチエージェントフレームワークを提案する。
本フレームワークは,84~97%の再実行性を実現し,28~89ポイントのベースラインデコンパイラ出力を改善した。
論文 参考訳(メタデータ) (2026-04-27T01:28:11Z) - TestDecision: Sequential Test Suite Generation via Greedy Optimization and Reinforcement Learning [17.157244731153554]
MDPとしてテストスイートの生成を形式化し,その目的が単調な部分モジュラリティを示すことを示す。
本研究では,LSMを神経グリージーの専門家に変換するTestDecisionを提案する。
TestDecisionは既存の高度なメソッドよりも大幅に優れています。
論文 参考訳(メタデータ) (2026-04-02T09:13:52Z) - SWE-Refactor: A Repository-Level Benchmark for Real-World LLM-Based Code Refactoring [20.694251041823097]
大規模言語モデル(LLM)は、ソフトウェア工学のタスクに取り組むことに広く関心を集めている。
既存のベンチマークは一般的に3つの欠点に悩まされる。
SWE-Refactor は開発者によって書かれた 18 の Java プロジェクトから抽出された 1,099 の挙動保存 LLM で構成されている。
論文 参考訳(メタデータ) (2026-02-03T16:36:29Z) - From Human to Machine Refactoring: Assessing GPT-4's Impact on Python Class Quality and Readability [46.83143241367452]
リファクタリングは、プログラムの振る舞いを変えることなく、コード品質を改善することを目的としている。
LLM(Large Language Models)の最近の進歩は、コードの自動保存に新たな機会をもたらしている。
GPT-4o を用いて,クラスEval ベンチマークから 100 個の Python クラスに適用した LLM 型クラスに関する実証的研究を行った。
以上の結果から, GPT-4oは, 可読性の低下を犠牲にしながら, コードの臭いを低減し, 品質指標を改善する行動保存剤を一般的に生産していることが示唆された。
論文 参考訳(メタデータ) (2026-01-19T15:22:37Z) - Rethinking Cognitive Complexity for Unit Tests: Toward a Readability-Aware Metric Grounded in Developer Perception [15.677544288705883]
単体テストに適したテスト意識認知複雑度尺度であるCCTRを紹介する。
EvoSuite, GPT-4o, Mistral Large-1024が生成した15,750のテストスイートをDefects4JおよびSF110から350クラスにわたって評価した。
論文 参考訳(メタデータ) (2025-06-07T11:16:13Z) - Enhancing LLM-Based Code Generation with Complexity Metrics: A Feedback-Driven Approach [6.289275189295223]
本稿では,コード複雑度と大言語モデル生成コードの成功との関係について検討する。
提案手法では,既往の故障した出力からの複雑性メトリクスに基づいて,LCMに正しいコードを生成するための反復的フィードバック手法を提案する。
実験結果から,本手法は特に小型LCMでは顕著な改善が見られた。
論文 参考訳(メタデータ) (2025-05-29T19:06:14Z) - MANTRA: Enhancing Automated Method-Level Refactoring with Contextual RAG and Multi-Agent LLM Collaboration [44.75848695076576]
本稿では,包括的Large Language ModelsエージェントベースのフレームワークであるMANTRAを紹介する。
ManTRAは、コンテキスト対応検索強化生成、協調型マルチエージェントコラボレーション、および言語強化学習を統合している。
MANTRA はベースライン LLM モデルを大幅に上回ることを示す実験結果が得られた。
論文 参考訳(メタデータ) (2025-03-18T15:16:51Z) - Test smells in LLM-Generated Unit Tests [16.061139428298986]
本稿では, LLM 生成単体試験におけるテスト臭拡散の大規模解析法として, マルチベンチマークを初めて提案する。
本研究では,4つのLCM(GPT-3.5,GPT-4,Mistral 7B,Mixtral 8x7B)から20,505のクラスレベルスイート,TestBenchから972のメソッドレベルケース,14,469のEvoSuiteテスト,34,635のオープンソースJavaプロジェクトから779,585の人書きテストについて検討した。
論文 参考訳(メタデータ) (2024-10-14T15:35:44Z) - LLMs as Factual Reasoners: Insights from Existing Benchmarks and Beyond [135.8013388183257]
そこで我々は,SummEditsと呼ばれる10ドメインのベンチマークで不整合検出ベンチマークを作成し,実装する新しいプロトコルを提案する。
ほとんどのLLMはSummEditsで苦労しており、パフォーマンスはランダムに近い。
最も優れたモデルであるGPT-4は、推定された人間のパフォーマンスよりも8%低い。
論文 参考訳(メタデータ) (2023-05-23T21:50:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。