論文の概要: Beyond Functional Correctness: Design Issues in AI IDE-Generated Large-Scale Projects
- arxiv url: http://arxiv.org/abs/2604.06373v1
- Date: Tue, 07 Apr 2026 18:59:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-09 17:30:51.190547
- Title: Beyond Functional Correctness: Design Issues in AI IDE-Generated Large-Scale Projects
- Title(参考訳): 機能的正確性を超えて - AI IDEで生成された大規模プロジェクトにおける設計上の問題
- Abstract要約: その結果,Cursorは16,965 LoC ファイルと114 ファイルに対して,機能的な大規模プロジェクトを生成することができることがわかった。
生成したプロジェクトには、長期的な保守性と進化可能性のリスクを引き起こす可能性のある設計上の問題が含まれています。
- 参考スコア(独自算出の注目度): 5.428703898705396
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: New generation of AI coding tools, including AI-powered IDEs equipped with agentic capabilities, can generate code within the context of the project. These AI IDEs are increasingly perceived as capable of producing project-level code at scale. However, there is limited empirical evidence on the extent to which they can generate large-scale software systems and what design issues such systems may exhibit. To address this gap, we conducted a study to explore the capability of Cursor in generating large-scale projects and to evaluate the design quality of projects generated by Cursor. First, we propose a Feature-Driven Human-In-The-Loop (FD-HITL) framework that systematically guides project generation from curated project descriptions. We generated 10 projects using Cursor with the FD-HITL framework across three application domains and multiple technologies. We assessed the functional correctness of these projects through manual evaluation, obtaining an average functional correctness score of 91%. Next, we analyzed the generated projects using two static analysis tools, CodeScene and SonarQube, to detect design issues. We identified 1,305 design issues categorized into 9 categories by CodeScene and 3,193 issues in 11 categories by SonarQube. Our findings show that (1) when used with the FD-HITL framework, Cursor can generate functional large-scale projects averaging 16,965 LoC and 114 files; (2) the generated projects nevertheless contain design issues that may pose long-term maintainability and evolvability risks, requiring careful review by experienced developers; (3) the most prevalent issues include Code Duplication, high Code Complexity, Large Methods, Framework Best-Practice Violations, Exception-Handling Issues and Accessibility Issues; (4) these design issues violate design principles such as SRP, SoC, and DRY. The replication package is at https://github.com/Kashifraz/DIinAGP
- Abstract(参考訳): エージェント機能を備えたAI駆動IDEを含む、新しい世代のAIコーディングツールは、プロジェクトのコンテキスト内でコードを生成することができる。
これらのAI IDEは、大規模にプロジェクトレベルのコードを生成することができると、ますます認識されている。
しかし、大規模なソフトウェアシステムの生成の程度や、そのようなシステムの設計上の問題点について、実証的な証拠は限られている。
このギャップに対処するため,我々はCursorの大規模プロジェクト生成能力の調査と,Cursorが生成するプロジェクトの設計品質の評価を行った。
まず,プロジェクト記述からプロジェクト生成を体系的にガイドする機能駆動型ヒューマン・イン・ザ・ループ(FD-HITL)フレームワークを提案する。
3つのアプリケーションドメインと複数の技術にわたるFD-HITLフレームワークでCursorを使って10のプロジェクトを生成しました。
これらのプロジェクトの機能的正当性を手作業による評価により評価し,機能的正当性スコアの平均91%を得た。
次に,CodeSceneとSonarQubeという2つの静的解析ツールを用いて生成したプロジェクトを分析し,設計上の問題を検出する。
CodeSceneでは1,305、SonarQubeでは11カテゴリで3,193に分類した。
その結果,(1)FD-HITLフレームワークを使用する場合,Cursorは16,965 LoCおよび114ファイルの平均的な大規模プロジェクトを生成することができる。(2) 生成したプロジェクトには,長期間の保守性と進化可能性リスクを生じる設計上の問題が含まれ,経験者による注意深いレビューを必要とする。(3) コードの重複,高コード複雑度,大規模メソッド,フレームワークのベストプラクティス違反,例外ハンド問題とアクセシビリティ問題,(4) これらの設計問題は,SRP, SoC, DRYなどの設計原則に違反している。
レプリケーションパッケージはhttps://github.com/Kashifraz/DIinAGPにある。
関連論文リスト
- Engineering Pitfalls in AI Coding Tools: An Empirical Study of Bugs in Claude Code, Codex, and Gemini CLI [14.169228579189989]
本稿では,AI支援コーディングツール構築における工学的落とし穴の実証的研究について述べる。
私たちは、GitHub上の3つのAI支援コーディングツールのオープンソースリポジトリにある3,8K以上の公開報告されたバグを分析するために、オープンソースコーディング手法を採用しています。
結果から,これらのツールのバグの67%以上が機能に関連していることが判明した。
論文 参考訳(メタデータ) (2026-03-21T15:05:23Z) - IQuest-Coder-V1 Technical Report [56.045533451719905]
IQuest-Coder-V1 シリーズ-(7B/14B/40B/40B-Loop) は、新しいコード大言語モデル(LLM)のファミリーである。
IQuest-Coder-V1は、コードインテリジェンスの重要な次元にわたる競合モデルの最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-03-17T16:15:31Z) - ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development [49.63491095660809]
ProjDevBenchはエンドツーエンドのベンチマークで、コーディングエージェントにプロジェクト要件を提供し、その結果のリポジトリを評価する。
概念指向タスクと実世界のアプリケーションシナリオの両方をカバーし、8つのカテゴリにまたがる20のプログラミング問題をキュレートします。
エージェントは基本的な機能を扱うが、複雑なシステム設計、時間最適化、リソース管理に苦労する。
論文 参考訳(メタデータ) (2026-02-02T05:17:23Z) - An Empirical Study of Developer-Provided Context for AI Coding Assistants in Open-Source Projects [2.392035679895744]
本稿では,開発者が提供するコンテキストの出現形態を特徴付けるための大規模な実証的研究について述べる。
我々は、開発者が本質的と考えるプロジェクトコンテキストの包括的な分類法を5つのハイレベルなテーマにまとめて開発した。
この状況が、プロジェクトタイプやプログラミング言語によってどのように異なるかについても検討しています。
論文 参考訳(メタデータ) (2025-12-21T23:51:02Z) - Towards Realistic Project-Level Code Generation via Multi-Agent Collaboration and Semantic Architecture Modeling [7.753074942497876]
CodeProjectEvalは、12.7ファイルと2,388.6行のタスクを持つ18の現実世界リポジトリから構築されたプロジェクトレベルのコード生成データセットである。
プロジェクトをアーキテクチャ設計、スケルトン生成、コードフィリングステージに分解するマルチエージェントフレームワークであるProjectGenを提案する。
実験によると、ProjectGenは、52/124のテストケースを小さなプロジェクトレベルのコード生成データセットDevBenchに渡すことで、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-11-05T12:12:35Z) - Knowledge-Guided Multi-Agent Framework for Application-Level Software Code Generation [47.691865459572995]
本稿ではKGACGという知識誘導型アプリケーションレベルコード生成フレームワークを構想する。
KGACGは、ソフトウェア要件仕様とアーキテクチャ設計文書を実行可能なコードに変換することを目的としている。
論文 参考訳(メタデータ) (2025-10-22T03:10:58Z) - A Survey on Code Generation with LLM-based Agents [61.474191493322415]
大規模言語モデル(LLM)を利用したコード生成エージェントは、ソフトウェア開発パラダイムに革命をもたらしている。
LLMは3つのコア特徴によって特徴づけられる。
本稿では,LLMに基づくコード生成エージェントの分野を体系的に調査する。
論文 参考訳(メタデータ) (2025-07-31T18:17:36Z) - CXXCrafter: An LLM-Based Agent for Automated C/C++ Open Source Software Building [14.687126587793028]
C/C++プロジェクトは、ダウンストリームアプリケーションの進行を妨げるため、実際は難しいことがしばしば証明される。
CXXCrafterと呼ばれる自動ビルドシステムを開発し、依存関係の解決などの課題に対処します。
オープンソースソフトウェアに対する我々の評価は、CXXCrafterがプロジェクト構築において78%の成功率を達成したことを示している。
論文 参考訳(メタデータ) (2025-05-27T11:54:56Z) - Towards Exception Safety Code Generation with Intermediate Representation Agents Framework [54.03528377384397]
大規模言語モデル(LLM)は、しばしば生成されたコードの堅牢な例外処理に苦しむ。
中間表現(IR)アプローチにより,LLM生成コードの例外安全性を実現する新しいマルチエージェントフレームワークであるSeekerを提案する。
Seekerは例外処理をScanner, Detector, Predator, Ranker, Handlerの5つの特殊エージェントに分解する。
論文 参考訳(メタデータ) (2024-10-09T14:45:45Z) - DevEval: Evaluating Code Generation in Practical Software Projects [52.16841274646796]
我々はDevEvalという名の新しいベンチマークを提案し、実践プロジェクトにおける開発者の経験と一致している。
DevEvalは、119の実用的なプロジェクトから2,690のサンプルを含む厳格なパイプラインを通じて収集される。
DevEvalの5つの人気のあるLCMを評価し、コード生成における実際の能力を明らかにする。
論文 参考訳(メタデータ) (2024-01-12T06:51:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。