論文の概要: Prompting GPT-5 on Scrum Certification Questions: An Empirical Accuracy Study
- arxiv url: http://arxiv.org/abs/2607.00049v1
- Date: Mon, 29 Jun 2026 23:55:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.594863
- Title: Prompting GPT-5 on Scrum Certification Questions: An Empirical Accuracy Study
- Title(参考訳): スクラム認定問題に関するGPT-5の試行 - 実証的精度調査
- Abstract要約: 大規模言語モデル(LLM)は、ドキュメント、コーチング、トレーニングのためにアジャイルソフトウェア開発でますます使われています。
本稿では,異なるプロンプト手法がスクラム認定スタイルの質問に対するLCM応答の事実的正確性にどのように影響するかを検討する。
- 参考スコア(独自算出の注目度): 0.6531122829756467
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) are increasingly used in Agile Software Development for documentation, coaching, and training. As practitioners adopt these tools to prepare for certifications such as Professional Scrum Master (PSM), a key question is whether LLMs can reliably reason about Scrum, a framework with normative, well-defined rules described in the Scrum Guide (2020). This paper examines how different prompt techniques affect the factual accuracy of LLM responses to Scrum certification-style questions. A dataset of 993 validated PSM-aligned questions was answered by GPT-5 using three techniques: zero-shot, chain-of-thought, and with-source citation. All prompts achieved certification-level accuracy above 85\%, with the citation-based variant performing best (89.1\%) and yielding the lowest error rate. Correct answers concentrated in well-defined topics, such as \emph{Definition of Done}, Events, and Product Backlog Management, and in single-answer multiple-choice items, while multi-select questions and more interpretive areas, such as Scrum Team and Product Value, were less stable. Among questions where at least one prompt failed (16.2\%), errors clustered into misalignment with the Scrum Guide (28\%), content outside its scope (34\%), and outdated or biased interpretations (38\%). Overall, prompt techniques produced modest but consistent improvements, particularly in reducing misinterpretation and version drift, supporting more reliable use of LLMs in Agile learning and certification preparation.
- Abstract(参考訳): 大規模言語モデル(LLM)は、ドキュメント、コーチング、トレーニングのためにアジャイルソフトウェア開発でますます使われています。
専門家がプロフェッショナルスクラムマスタ(PSM)のような認定を受けるためにこれらのツールを採用すると、重要な疑問は、スクラムガイド(2020年)に記載された規範的で明確に定義されたルールを持つフレームワークであるスクラムについて、LLMが確実に推論できるかどうかである。
本稿では,異なるプロンプト手法がスクラム認定スタイルの質問に対するLCM応答の事実的正確性にどのように影響するかを検討する。
993のデータセットは、ゼロショット、チェーン・オブ・ソート、ウィキソースの3つの手法を用いて、GPT-5によって回答された。
全てのプロンプトは85\%以上の認証レベルの精度を達成し、引用ベースの変種は最高(89.1\%)であり、エラー率が最も低い。
正しい答えは、 'emph{Definition of Done}' や Events、Product Backlog Management といった、明確に定義されたトピックに集中した。
少なくとも1つのプロンプトが失敗(16.2\%)、エラーがスクラムガイド(28\%)、スコープ外のコンテンツ(34\%)、時代遅れまたはバイアスのある解釈(38\%)と混同された。
全体として、プロンプトテクニックは、特に誤解とバージョンドリフトの削減、アジャイルの学習と認定の準備において、より信頼性の高いLLMの使用のサポートにおいて、控えめだが一貫性のある改善を生み出しました。
関連論文リスト
- MTAC-IFBench: Benchmarking Instruction-Following in Multi-Turn Agentic Coding [83.0805548642958]
MTAC-IFBenchは、ソフトウェア開発におけるインストラクションフォローのための包括的なベンチマークである。
6つのプライマリと18のセカンダリカテゴリにまたがるさまざまな制約を持つ、多ターンプログレッシブなソフトウェア開発指示が特徴である。
MTAC-IFBenchは、マルチターン命令フォローにおける既存のコードエージェントの重大な欠陥を認識し、インタラクションセッションが長くなるにつれてパフォーマンスが急速に低下する。
論文 参考訳(メタデータ) (2026-09-14T03:57:37Z) - Teaching Code LLMs to Reason with Intermediate Formal Specifications [9.552020178028576]
SpecCoderは、検証済みの参照プログラム、振る舞いを変えるミュータント、マルチターン仕様修正トレースから学ぶトレーニングフレームワークである。
SpecCoderは、欠陥のある実行を拒否しながら正しい実行を保持する仕様を選択し、受動的アノテーションから実行可能なエビデンスに変換する。
論文 参考訳(メタデータ) (2026-07-05T11:09:30Z) - Comparing Large Language Models on Scrum Certification-Style Questions: Accuracy, Stability, and Error Patterns [0.19674381684480705]
大規模言語モデル(LLM)は、試験や認定スタイルの質問応答タスクでますます使われている。
本稿では,993のスクラム認定スタイルの質問に対して,現代LLMであるtextitGPT-5 mini, textitGemini 3 Flash, textitDeepSeek Chat 3.2の性能評価を行った。
論文 参考訳(メタデータ) (2026-06-29T23:37:56Z) - Adoption of Large Language Models in Scrum Management: Insights from Brazilian Practitioners [2.0118771669399327]
最近のLLM(Large Language Models)の出現は、知識集約型スクラムプラクティスをサポートする新たな機会を生み出しました。
本研究では,ブラジルの70人のプロフェッショナルを対象に,スクラムマネジメント活動におけるLLMの使用状況について調査した。
その結果, LLMは高い習熟度と頻繁な使用率を示し, 回答者の85%が中級または上級の習熟度, 52%が毎日使用していることがわかった。
論文 参考訳(メタデータ) (2026-02-09T01:21:23Z) - Encyclo-K: Evaluating LLMs with Dynamically Composed Knowledge Statements [78.87065404966002]
既存のベンチマークは、主に質問レベルで質問をキュレートする。
ベンチマーク構築をゼロから再考するステートメントベースのベンチマークであるEncyclo-Kを提案する。
論文 参考訳(メタデータ) (2025-12-31T13:55:54Z) - Anka: A Domain-Specific Language for Reliable LLM Code Generation [0.0]
大規模言語モデル(LLM)は、複雑な多段階プログラミングタスクの体系的なエラーを示す。
明示的で制約のある構文で設計されたデータ変換パイプライン用のドメイン固有言語()であるAnkaを紹介します。
Ankaは100のベンチマーク問題に対して99.9%のパース成功と95.8%のタスク精度を達成した。
論文 参考訳(メタデータ) (2025-12-29T05:28:17Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Do AI models help produce verified bug fixes? [62.985237003585674]
大規模言語モデルは、ソフトウェアバグの修正に使用される。
本稿では,プログラマが大規模言語モデルを用いて,自身のスキルを補完する方法について検討する。
その結果は、プログラムバグに対する保証された修正を提供するAIとLLMの適切な役割への第一歩となる。
論文 参考訳(メタデータ) (2025-07-21T17:30:16Z) - Specification-Guided Repair of Arithmetic Errors in Dafny Programs using LLMs [79.74676890436174]
本稿では,障害の局所化と修復のためのオラクルとして形式仕様を用いたDafny用のAPRツールを提案する。
プログラム内の各ステートメントの状態を決定するために、Hoareロジックの使用を含む一連のステップを通じて、障害をローカライズします。
また, GPT-4o miniが74.18%と高い修理成功率を示した。
論文 参考訳(メタデータ) (2025-07-04T15:36:12Z) - A Real-World Benchmark for Evaluating Fine-Grained Issue Solving Capabilities of Large Language Models [11.087034068992653]
FAUN-Eval は LLM の Fine-grAined issUe solviNg 機能を評価するために特別に設計されたベンチマークである。
30の有名なGitHubリポジトリからキュレートされたデータセットを使って構築されている。
FAUN-Evalでは,4つのクローズドソースモデルと6つのオープンソースモデルを含む10個のLLMを評価した。
論文 参考訳(メタデータ) (2024-11-27T03:25:44Z) - SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal [64.9938658716425]
SORRY-Benchは、安全でないユーザ要求を認識し拒否する大規模言語モデル(LLM)能力を評価するためのベンチマークである。
まず、既存の手法では、安全でないトピックの粗い分類を使い、いくつかのきめ細かいトピックを過剰に表現している。
第二に、プロンプトの言語的特徴とフォーマッティングは、様々な言語、方言など、多くの評価において暗黙的にのみ考慮されているように、しばしば見過ごされる。
論文 参考訳(メタデータ) (2024-06-20T17:56:07Z) - Factcheck-Bench: Fine-Grained Evaluation Benchmark for Automatic Fact-checkers [121.53749383203792]
本稿では,大規模言語モデル (LLM) 生成応答の事実性に注釈を付けるための総合的なエンドツーエンドソリューションを提案する。
オープンドメインの文書レベルの事実性ベンチマークを,クレーム,文,文書の3段階の粒度で構築する。
予備実験によると、FacTool、FactScore、Perplexityは虚偽の主張を識別するのに苦労している。
論文 参考訳(メタデータ) (2023-11-15T14:41:57Z) - Instances Need More Care: Rewriting Prompts for Instances with LLMs in the Loop Yields Better Zero-Shot Performance [11.595274304409937]
大規模言語モデル(LLM)はゼロショットタスクのパフォーマンスに革命をもたらした。
レッツ・シンク・バイ・ステップ(Let's Think by Step)」のようなトリガーフレーズを使った現在の手法は依然として限られている。
本研究では,タスクインスタンスのゼロショットプロンプトを最適化するPRomPTedを導入する。
論文 参考訳(メタデータ) (2023-10-03T14:51:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。