論文の概要: Requirements-Augmented Generation for Trustworthy Acceptance Testing of LLM-Based Software
- arxiv url: http://arxiv.org/abs/2608.12970v1
- Date: Thu, 13 Aug 2026 08:49:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.444535
- Title: Requirements-Augmented Generation for Trustworthy Acceptance Testing of LLM-Based Software
- Title(参考訳): LLMベースのソフトウェアにおける信頼に値する受け入れテストのための要求増大生成
- Authors: Fanyu Wang, Chetan Arora, Zhenping Xie, Yonghui Liu, Kla Tantithamthavorn, Aldeida Aleti, Siwei Jiang,
- Abstract要約: LLMベースのソフトウェア(LBS)は、大きな言語モデルをコアコンポーネントとして統合し、柔軟でパーソナライズされた応答を提供する。
LBSは、古典的な受け入れテストとテストオラクルを不十分にする文脈依存的な振る舞いを示す。
本稿では,2つの技術貢献を通じて検証信頼性を調整したLBSの自動受け入れテストフレームワークを提案する。
- 参考スコア(独自算出の注目度): 14.133677111708634
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: LLM-based software (LBS) integrates large language models as core components to deliver flexible, personalised responses. Unlike traditional software with deterministic outputs, LBSs exhibit context-dependent, stochastic behaviour that renders classical acceptance testing and test oracles insufficient: the same query may require fundamentally different responses depending on user personas and software context. This gap creates an urgent need for automated acceptance testing frameworks that autonomously interpret user instructions, while reliably inferring user intentions in a changing environment. In this paper, we present an automated acceptance testing framework for LBS with calibrated verdict reliability via two technical contributions. First, we introduce Requirements-Augmented Generation (REAG), which interprets user intentions by retrieving relevant software requirements, domain knowledge, and personas via adaptive RAG and self-reasoning to generate context-aware test oracles. Second, recognising that oracle generation may retrieve irrelevant constraints, misinterpret intent, or hallucinate requirements, we introduce a confidence-calibrated cascade judgment. This method quantifies verdict reliability via simulated expert agreement -- accepting high-confidence verdicts, escalating ambiguous cases, or abstaining when uncertain -- with empirical reliability guarantees backed by conformal risk control. An industrial case study on a production nutrition advisory application demonstrates that REAG achieves a 3.91/5 oracle quality score, reaching qualified or marginal oracle quality in 82% of cases. The confidence-calibrated cascade achieves 98.8% accuracy, improves oracle quality from 3.91 to 4.30 by filtering unqualified outputs, and delivers a 31.7% cost-efficiency improvement over single-judge baselines, validating industrial viability
- Abstract(参考訳): LLMベースのソフトウェア(LBS)は、大きな言語モデルをコアコンポーネントとして統合し、柔軟でパーソナライズされた応答を提供する。
決定論的出力を持つ従来のソフトウェアとは異なり、LBSは文脈に依存した確率的な振る舞いを示し、古典的な受け入れテストとテストのオラクルが不十分である。
このギャップは、ユーザの指示を自律的に解釈する自動受け入れテストフレームワークを緊急に必要とします。
本稿では,LBSの自動受入テストフレームワークを提案する。
まず,Requireements-Augmented Generation (REAG)を導入し,関連するソフトウェア要件,ドメイン知識,ペルソナを適応的なRAGと自己推論を用いて検索し,コンテキスト認識型テストオラクルを生成する。
第二に、オラクル生成が無関係な制約、誤解釈意図、幻覚的要求を回復する可能性があることを認識し、信頼度を補正したカスケード判定を導入する。
この方法は、シミュレーションされた専門家合意による検証の信頼性を定量化し、信頼性の高い判断を受け入れ、不明瞭なケースをエスカレートしたり、不確実なケースを排除したりする。
工業ケーススタディでは、REAGが3.91/5のオラクル品質を達成し、82%のケースで資格または限界オラクル品質に達することを実証している。
信頼性校正カスケードは98.8%の精度を達成し、資格のない出力をフィルタリングすることでオラクル品質を3.91から4.30に改善し、シングルジャッジベースラインよりも31.7%のコスト効率向上を実現し、工業的可能性を検証する。
関連論文リスト
- Benchmarking LLM-Based Static Analysis for Secure Smart Contract Development: Reliability, Limitations, and Potential Hybrid Solutions [0.0]
大規模言語モデル(LLM)はますます開発者に統合されているが、自律的なセキュリティ監査者としての信頼性はまだ証明されていない。
我々は、現在の生成モデルが従来の静的解析ツールの代替として有効なのか、それとも単なる補完に過ぎないのかを評価する。
以上の結果から, LLMの有効性は, 固有語彙バイアスと外部データ入力の厳密な検証の欠如によって損なわれていることが示唆された。
論文 参考訳(メタデータ) (2026-05-11T19:10:47Z) - Confidence-Aware Alignment Makes Reasoning LLMs More Reliable [65.44962502963378]
CASPOは、トークンレベルの信頼度とステップワイドな論理的正しさを、個別の報酬モデルをトレーニングせずに整合させるフレームワークである。
推論中、信頼を意識した思考(CaT)を提案し、不確実な推論枝を無視可能なO(V)レイテンシで動的に生成する。
10のベンチマークと複数のモデルファミリでの実験では、CASPOは推論の信頼性と推論効率を一貫して改善している。
論文 参考訳(メタデータ) (2026-05-08T07:08:25Z) - Leveraging Large Language Models for Trustworthiness Assessment of Web Applications [13.909850314037653]
本研究では,大規模言語モデル(LLM)を活用したWebアプリケーションの信頼性評価を自動化する実証的手法を提案する。
本稿では,LSP(Logic Score of Preference)に基づく階層品質モデルの拡張を提案する。
実験結果から,過度な構造的コンテキストがノイズを発生させる可能性が示唆された。
論文 参考訳(メタデータ) (2026-03-24T23:33:54Z) - Fact-Checking with Large Language Models via Probabilistic Certainty and Consistency [7.806516365113592]
大規模言語モデル(LLM)は、事実の正確性を必要とするアプリケーションでますます使われている。
事実チェックはこれらのエラーを軽減することができるが、既存の手法は通常、外的証拠を無差別に回収する。
本稿では,確率的確実性と一貫性(PCC)について紹介する。
論文 参考訳(メタデータ) (2026-01-05T21:57:41Z) - Reliable LLM-Based Edge-Cloud-Expert Cascades for Telecom Knowledge Systems [54.916243942641444]
大規模言語モデル(LLM)は、通信などの分野において、自動化の鍵となる存在として浮上している。
本研究では,問合せパイプラインによる意思決定を支援する,エッジクラウドに精通したLLMベースの知識システムについて検討する。
論文 参考訳(メタデータ) (2025-12-23T03:10:09Z) - Rubric-Conditioned LLM Grading: Alignment, Uncertainty, and Robustness [4.129847064263056]
ルーブリックをベースとした短問合せ学習における大規模言語モデルの性能を体系的に評価する。
二つのタスクに対してアライメントは強いが、粗い粒度が増すにつれて劣化する。
実験により、モデルが注射に抵抗性がある一方で、同義置換に敏感であることが判明した。
論文 参考訳(メタデータ) (2025-12-21T05:22:04Z) - ORFuzz: Fuzzing the "Other Side" of LLM Safety -- Testing Over-Refusal [27.26251627767238]
大規模言語モデル(LLM)は、過度に保守的な安全対策のため、誤って良心的なクエリーを拒否する過度な拒絶を示す。
本稿では,LLMオーバーリフレクションの系統的検出と解析を行うための,最初の進化的テストフレームワークORFuzzを紹介する。
論文 参考訳(メタデータ) (2025-08-15T05:03:26Z) - Are You Getting What You Pay For? Auditing Model Substitution in LLM APIs [71.7892165868749]
LLM(Commercial Large Language Model) APIは基本的な信頼の問題を生み出します。
ユーザーは特定のモデルに課金するが、プロバイダが忠実に提供できることを保証することはない。
我々は,このモデル置換問題を定式化し,現実的な逆条件下での検出方法を評価する。
我々は,信頼された実行環境(TEE)を実用的で堅牢なソリューションとして使用し,評価する。
論文 参考訳(メタデータ) (2025-04-07T03:57:41Z) - Enhancing LLM Reliability via Explicit Knowledge Boundary Modeling [41.19330514054401]
大規模言語モデル(LLM)は、不一致の自己認識に起因する幻覚の傾向にある。
本稿では,高速かつ低速な推論システムを統合し,信頼性とユーザビリティを調和させる明示的知識境界モデリングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-04T03:16:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。