論文の概要: On the Viability of Requirements Generation From Code: An Experience Report
- arxiv url: http://arxiv.org/abs/2606.25550v1
- Date: Wed, 24 Jun 2026 08:28:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.27894
- Title: On the Viability of Requirements Generation From Code: An Experience Report
- Title(参考訳): コードからの要求生成の可能性について:経験報告
- Authors: Alexander Korn, Jone Bartel, Max Unterbusch, Andreas Vogelsang,
- Abstract要約: 要求工学における実証的研究は、ソースコードと対応する要件をペアリングする適切なデータセットの欠如によって妨げられている。
この欠点に対処するための誘惑的なルートは、既存のコードベースから要求を合成するためにLarge Language Modelsを使用することである。
LLMをベースとしたRAGをベースとしたエージェントアプローチの評価を行い、ソースコードから要件を生成し、その実装状況を検証するとともに、要求臭を合成的に導入する。
- 参考スコア(独自算出の注目度): 40.65529582262402
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Empirical research in Requirements Engineering is hampered by a lack of adequate datasets that pair source code with corresponding requirements. A tempting route to addressing this lack is the use of Large Language Models to synthesize requirements from existing code bases. We investigate this question by evaluating an LLM-based and RAG-supported agentic approach that generates requirements from source code, verifies their implementation status relying on a human-in-the-loop, and synthetically introduces requirements smells and non-implemented requirements. Our goal was to create datasets that mimic reality and foster empirical RE research. However, during the study, various problems arose, leading to this experience report. Contrary to our initial hypotheses, LLMs were unable to (i) generate non-implemented requirements reliably, (ii) generate high quality requirements, and (iii) reliably introduce synthetic requirements smells. Furthermore, neither an LLM nor a single human-in-the-loop suffices to detect requirements smells reliably. These findings suggest that the generation of code-to-requirements datasets using LLMs is not yet viable and requires human supervision, especially for quality assurance. We critically reflect on our lessons learned and draw relevant conclusions for both researchers and practitioners.
- Abstract(参考訳): 要求工学における実証的研究は、ソースコードと対応する要件をペアリングする適切なデータセットの欠如によって妨げられている。
この欠点に対処するための誘惑的なルートは、既存のコードベースから要求を合成するためにLarge Language Modelsを使用することである。
本稿では,LLMをベースとしたRAGをベースとしたエージェントアプローチを用いて,ソースコードから要件を生成し,その実装状況を検証するとともに,要求臭や非実装要件を総合的に導入することによって,この問題を考察する。
私たちの目標は、現実を模倣するデータセットを作成し、経験的RE研究を促進することです。
しかし、研究期間中に様々な問題が発生し、この経験報告に繋がった。
最初の仮説とは対照的に、LSMはできなかった。
i)非実装要件を確実に生成する。
(二)高品質な要求を生じさせ、
三) 合成要求臭を確実に導入すること。
さらに、LCMもループ内の1人の人間も、要求を検出するのに十分でない。
これらの結果から,LSMを用いたコード・ツー・要求データセットの生成はまだ不可能であり,特に品質保証のためには人間の監督が必要であることが示唆された。
我々は、学んだ教訓を批判的に反映し、研究者と実践者の両方に関連する結論を導きます。
関連論文リスト
- Automating the Detection of Requirement Dependencies Using Large Language Models [5.561866904930191]
要件依存関係の自動検出のためのLCMベースのアプローチであるLEREDDを導入する。
自然言語(NL)要求から直接、多様な依存型を特定するように設計されている。
2つの最先端のベースラインに対してLEREDDを実験的に評価した。
論文 参考訳(メタデータ) (2026-02-25T22:33:27Z) - MSRS: Evaluating Multi-Source Retrieval-Augmented Generation [51.717139132190574]
多くの現実世界のアプリケーションは、複数のソースにまたがる情報を統合して要約する能力を必要としている。
本稿では、RAGシステムに対して異なるソース間で情報を統合するための評価ベンチマークを構築するためのスケーラブルなフレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-28T14:59:55Z) - Can Code Language Models Learn Clarification-Seeking Behaviors? [4.788534218705066]
ClarifyCoderは,合成データ生成と命令調整を行うフレームワークである。
ClarifyCoderは,あいまいなタスクに対して,コミュニケーション率63%,質問率52%を達成した。
論文 参考訳(メタデータ) (2025-04-23T00:34:39Z) - EvalAgent: Discovering Implicit Evaluation Criteria from the Web [82.82096383262068]
EvalAgentは、ニュアンスとタスク固有の基準を自動的に発見するように設計されたフレームワークである。
EvalAgentは、さまざまな長期評価基準を提案するために、専門家が作成したオンラインガイダンスをマイニングしている。
我々の実験では、EvalAgentが生み出す基準は暗黙的だが具体的であることが示されている。
論文 参考訳(メタデータ) (2025-04-21T16:43:50Z) - Analysis of LLMs vs Human Experts in Requirements Engineering [0.0]
大規模言語モデル(LLM)のソフトウェア開発への応用は、コード生成のテーマとなっている。
本研究は, LLMがソフトウェアシステムの要件を抽出する能力と, タイムボックス型およびプロンプトボックス型研究における人間専門家の要求とを比較した。
論文 参考訳(メタデータ) (2025-01-31T16:55:17Z) - On the Impact of Requirements Smells in Prompts: The Case of Automated Traceability [45.24937784556523]
我々は,大言語モデル(LLM)のプロンプトに使用される曖昧さや不整合といった潜在的な問題に対する,要求の匂い指標の役割について検討する。
要求の臭いは、あるコードに要求が実装されたかどうか(トレースリンクが存在する)を予測する際には小さいが重大な効果があったが、関連するコード行で要求をトレースする場合には大きな影響は見られなかった。
これらの結果から,要求臭は特定のSEタスクのLLM性能に影響を及ぼすが,全てのタスクに均一に影響を与えない可能性が示唆された。
論文 参考訳(メタデータ) (2025-01-08T19:54:31Z) - OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models [76.59316249991657]
コードのための大規模言語モデル(LLM)は、コード生成、推論タスク、エージェントシステムなど、さまざまな領域で必須になっている。
オープンアクセスのコード LLM はプロプライエタリなモデルの性能レベルに近づきつつあるが、高品質なコード LLM は依然として限られている。
トップクラスのコードLLMであるOpenCoderは、主要なモデルに匹敵するパフォーマンスを達成するだけでなく、研究コミュニティの"オープンクックブック"としても機能します。
論文 参考訳(メタデータ) (2024-11-07T17:47:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。