論文の概要: EvoDev: An Iterative Feature-Driven Framework for End-to-End Software Development with LLM-based Agents
- arxiv url: http://arxiv.org/abs/2511.02399v1
- Date: Tue, 04 Nov 2025 09:27:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-11-05 18:47:05.872577
- Title: EvoDev: An Iterative Feature-Driven Framework for End-to-End Software Development with LLM-based Agents
- Title(参考訳): EvoDev: LLMベースのエージェントによるエンドツーエンドソフトウェア開発のための反復的機能駆動フレームワーク
- Authors: Junwei Liu, Chen Xu, Chong Wang, Tong Bai, Weitong Chen, Kaseng Wong, Yiling Lou, Xin Peng,
- Abstract要約: EvoDevは機能駆動開発にインスパイアされた反復型ソフトウェア開発フレームワークである。
EvoDevはユーザー要求をユーザ価値のある一連の機能に分解する。
機能間の依存関係を明示的にモデル化するフィーチャーマップを構築する。
- 参考スコア(独自算出の注目度): 18.460084059087084
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Recent advances in large language model agents offer the promise of automating end-to-end software development from natural language requirements. However, existing approaches largely adopt linear, waterfall-style pipelines, which oversimplify the iterative nature of real-world development and struggle with complex, large-scale projects. To address these limitations, we propose EvoDev, an iterative software development framework inspired by feature-driven development. EvoDev decomposes user requirements into a set of user-valued features and constructs a Feature Map, a directed acyclic graph that explicitly models dependencies between features. Each node in the feature map maintains multi-level information, including business logic, design, and code, which is propagated along dependencies to provide context for subsequent development iterations. We evaluate EvoDev on challenging Android development tasks and show that it outperforms the best-performing baseline, Claude Code, by a substantial margin of 56.8%, while improving single-agent performance by 16.0%-76.6% across different base LLMs, highlighting the importance of dependency modeling, context propagation, and workflow-aware agent design for complex software projects. Our work summarizes practical insights for designing iterative, LLM-driven development frameworks and informs future training of base LLMs to better support iterative software development.
- Abstract(参考訳): 大規模言語モデルエージェントの最近の進歩は、自然言語要求からエンドツーエンドのソフトウェア開発を自動化することを約束している。
しかし、既存のアプローチは主に線形のウォーターフォールスタイルのパイプラインを採用しており、これは現実世界の開発の反復性を過度に単純化し、複雑な大規模プロジェクトと戦っている。
これらの制限に対処するため,機能駆動開発に触発された反復型ソフトウェア開発フレームワークであるEvoDevを提案する。
EvoDevは、ユーザ要求をユーザ価値のある一連の機能に分解し、機能間の依存関係を明示的にモデル化する有向非循環グラフであるFeature Mapを構築する。
機能マップの各ノードは、ビジネスロジック、設計、コードを含むマルチレベル情報を保持し、依存関係に沿って伝播して、その後の開発イテレーションのコンテキストを提供する。
EvoDevはAndroid開発タスクに挑戦する上で評価し、最高のパフォーマンスのベースラインであるClaude Codeを56.8%上回り、単一エージェントのパフォーマンスを16.0%-76.6%向上させ、複雑なソフトウェアプロジェクトにおける依存性モデリング、コンテキストの伝搬、ワークフロー対応エージェント設計の重要性を強調した。
我々の研究は、反復型LCM駆動開発フレームワークを設計するための実践的な洞察を要約し、反復型ソフトウェア開発をより支援するために、ベースLSMの将来のトレーニングを通知する。
関連論文リスト
- A Lightweight Modular Framework for Constructing Autonomous Agents Driven by Large Language Models: Design, Implementation, and Applications in AgentForge [1.932555230783329]
LLM駆動の自律エージェントの構築を民主化するために設計された軽量でオープンソースのPythonフレームワーク。
AgentForgeは、(1)正式に定義された入出力契約できめ細かいタスク分解を可能にする構成可能なスキル抽象化、(2)クラウドベースのAPIとローカル推論エンジンのシームレスな切り替えをサポートする統一されたバックエンドインターフェース、(3)エージェントロジックと実装の詳細を分離する宣言型YAMLベースの構成システムである。
論文 参考訳(メタデータ) (2026-01-19T20:33:26Z) - ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development [72.4729759618632]
本稿では,現実的かつ実行可能なワークフロー内でエージェントバックエンドコーディングを評価するベンチマークであるABC-Benchを紹介する。
オープンソースリポジトリから8つの言語と19のフレームワークにまたがる224の実践的なタスクをキュレートしました。
我々の評価は、最先端モデルでさえ、これらの総合的なタスクに対して信頼性の高いパフォーマンスを提供するのに苦労していることを示している。
論文 参考訳(メタデータ) (2026-01-16T08:23:52Z) - An Empirical Study of Agent Developer Practices in AI Agent Frameworks [59.862193600499914]
大規模言語モデル(LLM)の台頭はエージェントへの関心の高まりを引き起こし、エージェントフレームワークの急速な成長につながった。
エージェントフレームワークが広く使われているにもかかわらず、それらの実践的応用とエージェント開発プロセスにどのように影響するかは未解明のままである。
開発者の80%以上が、特定の開発要件に最も適合するフレームワークを特定するのに苦労していると報告している。
論文 参考訳(メタデータ) (2025-12-01T17:52:15Z) - Towards Realistic Project-Level Code Generation via Multi-Agent Collaboration and Semantic Architecture Modeling [7.753074942497876]
CodeProjectEvalは、12.7ファイルと2,388.6行のタスクを持つ18の現実世界リポジトリから構築されたプロジェクトレベルのコード生成データセットである。
プロジェクトをアーキテクチャ設計、スケルトン生成、コードフィリングステージに分解するマルチエージェントフレームワークであるProjectGenを提案する。
実験によると、ProjectGenは、52/124のテストケースを小さなプロジェクトレベルのコード生成データセットDevBenchに渡すことで、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-11-05T12:12:35Z) - KAT-Coder Technical Report [48.00975798131211]
KAT-Coderは、中期訓練、監視ファインチューニング(SFT)、強化ファインチューニング(RFT)、強化デプロイ適応(Reinforcement-to-Deployment Adaptation)を含む多段階のカリキュラムを通じて訓練された大規模なエージェントコードモデルである。
これらの段階により、KAT-Coderは堅牢なツール使用信頼性、命令アライメント、長いコンテキスト推論を実現することができる。
論文 参考訳(メタデータ) (2025-10-21T16:27:47Z) - Code Digital Twin: Empowering LLMs with Tacit Knowledge for Complex Software Development [8.821206496273842]
ソフトウェアモデルと大規模言語モデルの両方の観点から、課題を特定します。
ソフトウェアの物理層と概念層の両方をモデル化するフレームワークであるCode Digital Twinを提案する。
私たちのビジョンは、AIの進歩とエンタープライズソフトウェアの現実の橋渡しと位置づけています。
論文 参考訳(メタデータ) (2025-10-18T08:17:54Z) - A Survey of Vibe Coding with Large Language Models [93.88284590533242]
視覚符号化(Vibe Coding)は、開発者が成果観察を通じてAI生成の実装を検証する開発手法である。
変革の可能性にもかかわらず、この創発的パラダイムの有効性は未解明のままである。
この調査は、大規模な言語モデルによるVibe Codingの総合的かつ体系的なレビューを初めて提供する。
論文 参考訳(メタデータ) (2025-10-14T11:26:56Z) - Codev-Bench: How Do LLMs Understand Developer-Centric Code Completion? [60.84912551069379]
Code-Development Benchmark (Codev-Bench)は、細粒度で現実世界、リポジトリレベル、開発者中心の評価フレームワークです。
Codev-Agentは、リポジトリのクローリングを自動化し、実行環境を構築し、既存のユニットテストから動的呼び出しチェーンを抽出し、データ漏洩を避けるために新しいテストサンプルを生成するエージェントベースのシステムである。
論文 参考訳(メタデータ) (2024-10-02T09:11:10Z) - Think-on-Process: Dynamic Process Generation for Collaborative Development of Multi-Agent System [13.65717444483291]
ToP (Think-on-Process) はソフトウェア開発のための動的プロセス生成フレームワークである。
本フレームワークはGPT-3.5とGPT-4の動的プロセス生成能力を著しく向上させる。
論文 参考訳(メタデータ) (2024-09-10T15:02:34Z) - HumanEvo: An Evolution-aware Benchmark for More Realistic Evaluation of Repository-level Code Generation [36.1669124651617]
我々は,大規模言語モデルのコード生成性能を,ソフトウェア開発の進化的性質を反映した設定内で理解するための実証的研究を行う。
我々は、自動実行ベースの評価ツールを備えた進化型リポジトリレベルのコード生成データセットであるHumanEvoを使用します。
従来の進化を無視した評価手法は, 10.0%から61.1%の範囲で, LLMの膨張性能が向上することがわかった。
論文 参考訳(メタデータ) (2024-06-11T03:19:18Z) - SOEN-101: Code Generation by Emulating Software Process Models Using Large Language Model Agents [50.82665351100067]
FlowGenは、複数のLarge Language Model (LLM)エージェントに基づいたソフトウェアプロセスモデルをエミュレートするコード生成フレームワークである。
FlowGenScrumをHumanEval、HumanEval-ET、MBPP、MBPP-ETの4つのベンチマークで評価した。
論文 参考訳(メタデータ) (2024-03-23T14:04:48Z) - Prompting Large Language Models to Tackle the Full Software Development Lifecycle: A Case Study [72.24266814625685]
DevEvalでソフトウェア開発ライフサイクル全体にわたって、大きな言語モデル(LLM)のパフォーマンスを調査します。
DevEvalは4つのプログラミング言語、複数のドメイン、高品質なデータ収集、各タスクに対して慎重に設計および検証されたメトリクスを備えている。
GPT-4を含む現在のLLMは、DevEvalで提示される課題を解決できないことが実証研究によって示されている。
論文 参考訳(メタデータ) (2024-03-13T15:13:44Z) - Redefining Developer Assistance: Through Large Language Models in Software Ecosystem [0.5580128181112308]
本稿では,インストラクションチューニングによって開発されたDevAssistLlamaを紹介し,ソフトウェア関連自然言語クエリの処理を支援する。
DevAssistLlamaは、特に複雑な技術ドキュメントの扱いに長けており、ソフトウェア固有のタスクにおける開発者の能力を向上させる。
論文 参考訳(メタデータ) (2023-12-09T18:02:37Z) - ChatDev: Communicative Agents for Software Development [84.90400377131962]
ChatDevはチャットを利用したソフトウェア開発フレームワークで、特別なエージェントがコミュニケーション方法についてガイドされる。
これらのエージェントは、統一された言語ベースのコミュニケーションを通じて、設計、コーディング、テストフェーズに積極的に貢献する。
論文 参考訳(メタデータ) (2023-07-16T02:11:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。