論文の概要: WiseSpec: Requirements-Driven Agents for Code Generation
- arxiv url: http://arxiv.org/abs/2609.00568v1
- Date: Tue, 01 Sep 2026 02:04:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.21907
- Title: WiseSpec: Requirements-Driven Agents for Code Generation
- Title(参考訳): WiseSpec: コード生成に必要なエージェント
- Abstract要約: WiseSpecは、リポジトリレベルのコード生成のための要件駆動のエージェントフレームワークである。
我々は、WiseSpecがすべてのベースラインを一貫して上回り、 %Resolvedで平均13.17%の改善を達成したことを示す。
- 参考スコア(独自算出の注目度): 3.1580161263510855
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Code generation aims to automatically generate source code from task requirements and has attracted significant attention with the rapid advancement of large language models (LLMs). Despite remarkable progress, LLMs often struggle to generate correct code for complex software engineering tasks because task descriptions are frequently incomplete, ambiguous, or lack critical contextual information. Existing approaches primarily improve the capabilities of coding agents through more sophisticated tools, skills, and workflows, while largely overlooking the quality of the task requirements themselves. To address this limitation, we draw inspiration from software requirements engineering and propose WiseSpec, a novel requirements-driven agent framework for repository-level code generation. WiseSpec automatically constructs structured and information-rich requirements, assesses their quality through execution-based evaluation, and iteratively refines them to better guide code generation. Experimental results show that WiseSpec consistently outperforms all baselines, achieving an average improvement of 13.17% in %Resolved.
- Abstract(参考訳): コード生成は、タスク要求からソースコードを自動的に生成することを目的としており、大規模言語モデル(LLM)の急速な進歩によって大きな注目を集めている。
目覚ましい進歩にもかかわらず、LLMは複雑なソフトウェアエンジニアリングタスクのための正しいコードを生成するのに苦労することが多い。
既存のアプローチは主に、より洗練されたツール、スキル、ワークフローを通じて、コーディングエージェントの能力を改善する。
この制限に対処するため、ソフトウェア要件エンジニアリングからインスピレーションを得て、リポジトリレベルのコード生成のための新しい要求駆動エージェントフレームワークであるWiseSpecを提案する。
WiseSpecは構造化された情報豊富な要件を自動的に構築し、実行ベースの評価を通じて品質を評価し、コード生成をより良くガイドするために繰り返し洗練します。
実験の結果、WiseSpec はすべてのベースラインを一貫して上回り、平均 13.17% の %Resolved 改善を達成した。
関連論文リスト
- SpecCoder: Specification-Aware Code Generation with Curriculum Dual-Task Reinforcement Learning [30.588079618949447]
SpecCoderは、コード生成のための2段階のトレーニングフレームワークである。
まず、GRPを訓練し、構造化された仕様分析を導出し、それらに条件付きコードを生成する。
このカリキュラムは仕様誘導生成と識別を共同で最適化し、仕様とコード動作のより強力な対応を促進する。
論文 参考訳(メタデータ) (2026-09-05T11:52:54Z) - ClarifyCodeBench: Evaluating LLMs on Clarifying Ambiguous Requirements for Code Generation [54.788849448970154]
我々はClarifyCodeBenchを紹介した。ClarifyCodeBenchは、要求のあいまいさを解決するためのLarge Language Modelsの機能を評価するための、インタラクティブなベンチマークだ。
ClarifyCodeBenchを用いて、6つの最先端LCMの体系的評価を行う。
1) 能力の疎結合: 強いコード生成性能は本質的には効果的な要求の明確化に変換されない; 2) 推論パラドックス: 計算思考の増大はコードの正確性を高めるが、あいまいさの識別において限界的な利益をもたらす。
論文 参考訳(メタデータ) (2026-07-01T09:58:59Z) - REAgent: Requirement-Driven LLM Agents for Software Issue Resolution [35.30650311049838]
課題解決は、与えられた課題記述からパッチを自動的に生成することを目的としている。
本稿では,パッチ生成をガイドする要件駆動型エージェントフレームワークREAgentを提案する。
論文 参考訳(メタデータ) (2026-04-08T09:22:30Z) - Requirements Development and Formalization for Reliable Code Generation: A Multi-Agent Vision [45.59678433715798]
我々は、textscrequirements textscdevelopmentとtextscformalization(textscDeFo)をベースとした、信頼性の高いコード生成のための最初のマルチエージェントフレームワークを構想する。
textscReDeFoの中核は、潜在的に曖昧な自然言語要求と正確な実行可能なコードの間のギャップを埋めるために、正式な仕様を使用することである。
論文 参考訳(メタデータ) (2025-08-26T04:45:04Z) - Uncovering Systematic Failures of LLMs in Verifying Code Against Natural Language Specifications [0.6813925418351435]
大規模言語モデル(LLM)はソフトウェア開発において不可欠なツールとなり、要求工学、コード生成、レビュータスクに広く利用されている。
本稿では,LLMが自然言語の要求に適合するかどうかを評価する上で,体系的に失敗していることを明らかにする。
以上の結果から,LCMは要件を満たすことのできないコード実装や潜在的な欠陥を含むコード実装を誤って分類することが多いことが判明した。
論文 参考訳(メタデータ) (2025-08-17T13:07:26Z) - MERA Code: A Unified Framework for Evaluating Code Generation Across Tasks [56.34018316319873]
我々は,最新のLLMをロシア語で評価するためのベンチマークであるMERA Codeを提案する。
このベンチマークには、8つのプログラミング言語にまたがる11の評価タスクが含まれている。
我々はオープンなLLMとフロンティアAPIモデルを評価し、非英語言語における実用的なコーディングタスクの観点からそれらの制限を分析した。
論文 参考訳(メタデータ) (2025-07-16T14:31:33Z) - AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios [51.46347732659174]
LLM(Large Language Models)は、現実世界のエージェントアプリケーションにおいて高度な機能を示す。
AgentIFは、エージェントシナリオでLLM命令に従う能力を体系的に評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2025-05-22T17:31:10Z) - CodeIF: Benchmarking the Instruction-Following Capabilities of Large Language Models for Code Generation [20.013757490442064]
タスク指向の命令に準拠する大規模言語モデル(LLM)の能力を評価するために設計された最初のベンチマークであるCodeIFを紹介する。
CodeIFは関数合成、アルゴリズム命令、コード説明など幅広いタスクを含んでいる。
我々はLLMによる広範囲な実験を行い、これらの課題の要求を満たす上での強みと限界を分析した。
論文 参考訳(メタデータ) (2025-02-26T14:19:49Z) - Codev-Bench: How Do LLMs Understand Developer-Centric Code Completion? [60.84912551069379]
Code-Development Benchmark (Codev-Bench)は、細粒度で現実世界、リポジトリレベル、開発者中心の評価フレームワークです。
Codev-Agentは、リポジトリのクローリングを自動化し、実行環境を構築し、既存のユニットテストから動的呼び出しチェーンを抽出し、データ漏洩を避けるために新しいテストサンプルを生成するエージェントベースのシステムである。
論文 参考訳(メタデータ) (2024-10-02T09:11:10Z) - MMAU: A Holistic Benchmark of Agent Capabilities Across Diverse Domains [54.117238759317004]
大規模マルチタスクエージェント理解(MMAU)ベンチマークは、複雑な環境設定を必要としない包括的なオフラインタスクを特徴としている。
ツールユース、DAG(Directed Acyclic Graph)QA、データサイエンスと機械学習コーディング、コンテストレベルのプログラミング、数学の5分野にわたるモデルを評価する。
3K以上の異なるプロンプトを含む20の精巧に設計されたタスクにより、MMAUはLLMエージェントの強度と限界を評価するための包括的なフレームワークを提供する。
論文 参考訳(メタデータ) (2024-07-18T00:58:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。