論文の概要: Epic-Organized vs. Requirement-Aligned Gherkin: An Empirical Evaluation of LLM-Based Acceptance Criteria Generation
- arxiv url: http://arxiv.org/abs/2607.01980v1
- Date: Thu, 02 Jul 2026 10:12:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.78471
- Title: Epic-Organized vs. Requirement-Aligned Gherkin: An Empirical Evaluation of LLM-Based Acceptance Criteria Generation
- Title(参考訳): Epic-Organized vs. Requirement-Aligned Gherkin: A empirical Evaluation of LLM-based Acceptance Criteria Generation
- Abstract要約: 本研究は, エピック組織型Gherkinが要求整合生成よりも品質とカバレッジを向上するかどうかを考察する。
我々は,4つの要件文書に基づいて,Timeless(エピックに編成されたLLMパイプライン)アプローチを,単純かつ大規模な言語モデル(LLM)ベースラインと比較した。
- 参考スコア(独自算出の注目度): 2.1130434009438974
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automated authoring of Gherkin Behavior-Driven Development (BDD) acceptance criteria remains a manual bottleneck in requirements engineering. This study investigates whether epic-organized LLM-generated Gherkin produces higher quality and coverage than requirement-aligned generation. We compare our Timeless (an epic-organized LLM pipeline) approach against a naive large language model (LLM) baseline on four requirements documents (107 requirements) from the PURE dataset. Evaluation covers structural metrics, automated requirement coverage via TF-IDF and dense embeddings, and blind expert assessment by four researchers. In our evaluation, the JSON-constrained pipeline produced structurally valid scenarios across all generated outputs, while the zero-shot baseline achieved 99% structural validity. Semantic coverage was comparable to the baseline, with Timeless achieving 94.3% semantic Requirement Coverage Rate compared with 92.9% for the baseline. TF-IDF produced lower coverage scores for the epic-organized output, suggesting that lexical metrics may miss coverage when scenarios paraphrase requirements at a higher level of abstraction. Expert raters prefer the epic-organized strategy on Correctness (4.61 vs 4.14), Executability (4.61 vs 4.07), and Completeness (4.31 vs 3.50). Overall, the results suggest that epic-organized generation can improve perceived Gherkin quality while maintaining comparable semantic coverage, although broader replication is needed before generalizing this finding.
- Abstract(参考訳): Gherkin Behavior-Driven Development (BDD) の受け入れ基準の自動作成は、要件エンジニアリングにおいて手作業によるボトルネックのままである。
本研究は, エピック型LLM生成Gherkinが要求整合生成よりも高い品質とカバレッジをもたらすかどうかを考察する。
PUREデータセットからの4つの要件文書(107要件)に基づいて,我々のTimeless(エピックに編成されたLLMパイプライン)アプローチとLLMベースラインを比較した。
評価対象は、構造指標、TF-IDFと密埋め込みによる自動要件カバレッジ、そして4人の研究者によるブラインドエキスパートアセスメントである。
評価では、JSON制約のパイプラインは、すべての出力に対して構造的に妥当なシナリオを生成し、ゼロショットベースラインは99%の構造的妥当性を達成した。
セマンティックなカバレッジはベースラインに匹敵するものであり、タイムレスは94.3%のセマンティックな要求カバーレートを達成した。
TF-IDFはエピック化された出力に対して低いカバレッジスコアを生成し、より高い抽象化レベルでシナリオが要求される場合、語彙メトリクスはカバレッジを欠く可能性があることを示唆した。
専門家は、正確性(4.61対4.14)、実行可能性(4.61対4.07)、完全性(4.31対3.50)に関するエピック組織戦略を好んでいる。
全体としては、エピック・オーガナイズド・ジェネレーションは、この発見を一般化するにはより広範な複製が必要であるが、同等なセマンティック・カバレッジを維持しながら、認識されるGherkinの品質を向上させる可能性があることを示唆している。
関連論文リスト
- Empirical Evaluation of Open-Source Large Language Models for Retrieval-Augmented Generation in ESG Domain [3.6950894119105473]
Large Language Models (LLMs) と Retrieval-contexted Generation (RAG) は、RAGASによる説明責任抽出を自動化する可能性を提供する。
本稿では,EU上場企業からの498のリアルタイムESGレポートに基づいて,構造化フレームワークと評価リソースを用いてESGコンテキストにおけるオープンソースモデルの評価を行う。
glm-4.7-flash, nemotron-3-nano:4b, qwen3:4b-instruct, gemma3:4b, gemma4:e4b, gemma4:e2b。
論文 参考訳(メタデータ) (2026-09-14T09:02:35Z) - GenRubric: Self-Evolving Rubric Generation for Scalable LLM Evaluation [74.44235943118994]
GenRubricは、ラベルのないクエリからルーブリック生成を改善する自己進化フレームワークである。
我々はこの原理を強化学習により実現し、ルーブリック間の包括性信号とグループレベルの報酬と基準レベルの報酬を組み合わせる。
人間の注釈付きルーブリックベンチマークの実験では、自己進化は生成されたルーブリックと専門家によるルーブリックによる評価の一致を改善することが示されている。
論文 参考訳(メタデータ) (2026-08-30T15:39:39Z) - An Explicit World Model Based on Data-First Ontology: DaoQL Multimodal Storage Validation and Counterfactual Reasoning Evaluation [1.9674271425998944]
大規模言語モデルは、暗黙的にニューラルウェイトで世界モデルを符号化し、医療や金融といった高精度領域における4つの構造的リスクを露呈する。
我々は、明示的な世界モデルを形式化し、規則の独立の下では、明示的なモデルは、構成可能な反事実分解可能性に十分な条件を提供することを示す。
実装されたシステムは、DaoQLの検証済みストレージ層と明示的なEvalパスに注目し、グラフ、カラム、ベクタ、フルテキストエンジンをひとつのプロセスに統合する。
論文 参考訳(メタデータ) (2026-07-19T14:20:22Z) - CDR-Bench: Evaluating Faithful Execution of Compositional, Order-Sensitive Data Refinement Recipes [52.734097662607375]
CDR-Benchは、4つの現実世界のデータリファインメントドメインにまたがる3,462の高品質なタスクを特徴とする包括的なベンチマークである。
我々のベンチマークでは、原子性、秩序に依存しない、秩序に敏感な設定でモデルを評価する。
10以上の最先端のLLMの実験では、一貫した障害パターンが明らかになっている。
論文 参考訳(メタデータ) (2026-06-30T10:08:45Z) - A Hybrid Vision-Language Architecture for Automated Defect Reasoning and Report Generation in Industrial Inspection [0.42970700836450487]
本稿では,風力タービン羽根試験用分離・エッジ展開可能なパイプラインについて述べる。
The EyesはY26-x-obb指向のバウンディングボックスで、データセットネイティブの解像度で欠陥をローカライズする。
ブリッジは決定論的でパラメータフリーな符号化モジュールであり、検出された各バウンディングボックスをグリッド参照トークンにマップする。
論文 参考訳(メタデータ) (2026-05-26T04:27:38Z) - Transforming External Knowledge into Triplets for Enhanced Retrieval in RAG of LLMs [55.78708003681562]
Retrieval-Augmented Generation (RAG)は、大規模言語モデル(LLM)における幻覚を、生成時に外部知識を取り入れることで緩和する。
既存のRAGアプローチは通常、コンテキストとしてテキストフラグメントを検索し、非構造化する。
本稿では,三重項に基づく検索フレームワークTri-RAGを提案する。
論文 参考訳(メタデータ) (2026-04-14T11:36:29Z) - Mitigating LLM Hallucinations through Domain-Grounded Tiered Retrieval [0.0]
大型言語モデル (LLM) は前例のない流布を達成したが、「幻覚」の影響を受けないままである。
本研究では,LLMをパターンマッチングから真偽探索へシフトさせることにより,事実不正確さを検知する階層型検索・検証アーキテクチャを提案する。
システムは5つの多様なベンチマークから650のクエリで評価された。
論文 参考訳(メタデータ) (2026-03-18T15:59:30Z) - Distributional Open-Ended Evaluation of LLM Cultural Value Alignment Based on Value Codebook [50.10594064510559]
DOVEは、人文テキストとLLM出力を直接比較する分散評価フレームワークである。
DOVEは, ダウンストリームタスクと31.56%の相関を達成し, 高い信頼性を保ちながら, 文化ごとのサンプル500点程度の信頼性を維持した。
論文 参考訳(メタデータ) (2026-03-16T08:33:10Z) - Structured Prompting Enables More Robust Evaluation of Language Models [38.53918044830268]
DSPy+HELMフレームワークを提案する。
構造化されたプロンプトがなければ、HELMはLM性能(平均4%)を過小評価し、性能評価はベンチマークによって異なることがわかった。
これは、構造化されたプロンプトを確立された評価フレームワークに体系的に統合する最初のベンチマーク研究である。
論文 参考訳(メタデータ) (2025-11-25T20:37:59Z) - How Good Are Synthetic Requirements ? Evaluating LLM-Generated Datasets for AI4RE [0.5156484100374059]
本稿では,合成要求データを生成するための改良された製品ラインアプローチを提案する。
提案する4つの研究課題は,データ品質にどのような影響を及ぼすか,また,自動的なプロンプト最適化,およびポストジェネレーションのキュレーションについて検討する。
以上の結果から, 人工的な要件は, 特定のタスクにおいて, 人為的な要件と一致し, より優れる可能性が示唆された。
論文 参考訳(メタデータ) (2025-06-26T10:52:07Z) - SFR-RAG: Towards Contextually Faithful LLMs [57.666165819196486]
Retrieval Augmented Generation (RAG) は、外部コンテキスト情報を大言語モデル(LLM)と統合し、事実の精度と妥当性を高めるパラダイムである。
SFR-RAG(SFR-RAG)について述べる。
また、複数の人気かつ多様なRAGベンチマークをコンパイルする新しい評価フレームワークであるConBenchについても紹介する。
論文 参考訳(メタデータ) (2024-09-16T01:08:18Z) - RAGEval: Scenario Specific RAG Evaluation Dataset Generation Framework [66.93260816493553]
本稿では,様々なシナリオにまたがってRAGシステムを評価するためのフレームワークであるRAGvalを紹介する。
事実の正確性に焦点をあてて,完全性,幻覚,不適切性の3つの新しい指標を提案する。
実験結果から, RAGEvalは, 生成した試料の明瞭度, 安全性, 適合性, 豊かさにおいて, ゼロショット法とワンショット法より優れていた。
論文 参考訳(メタデータ) (2024-08-02T13:35:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。