論文の概要: An Empirical Study of Sustainability in Prompt-driven Test Script Generation Using Small Language Models
- arxiv url: http://arxiv.org/abs/2604.02754v1
- Date: Fri, 03 Apr 2026 06:00:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-06 17:20:24.340031
- Title: An Empirical Study of Sustainability in Prompt-driven Test Script Generation Using Small Language Models
- Title(参考訳): 小言語モデルを用いたプロンプト駆動テストスクリプト生成におけるサステナビリティの実証的研究
- Authors: Pragati Kumari, Novarun Deb,
- Abstract要約: 本研究では,小言語モデル(SLM)のアクシデント駆動単体テストスクリプト生成における環境・性能のトレードオフを実験的に検討する。
以上の結果から,異なるSLMはエネルギー使用量が少なく,実行速度が速いことや,同等条件下で高い安定性やカバレッジを維持できることが示唆された。
- 参考スコア(独自算出の注目度): 0.42970700836450487
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The increasing use of language models in automated test script generation raises concerns about their environmental impact, yet existing sustainability analyses focus predominantly on large language models. As a result, the energy and carbon characteristics of small language models (SLMs) during prompt-driven unit-test script generation remain largely unexplored. To address this gap, this study empirically examines the environmental and performance tradeoffs of SLMs (in the 2B-8B parameter range) using the HumanEval benchmark and adaptive prompt variants (based on the Anthropic template). The analysis uses CodeCarbon to characterize energy consumption carbon emissions and duration under controlled conditions, with unit-test script coverage serving as an initial proxy for generated test quality. Our results show that different SLMs exhibit distinct sustainability profiles - some favor lower energy use and faster execution, while others maintain higher stability or coverage under comparable conditions. Overall, this work provides focused empirical evidence on sustainable SLM-based test script generation, clarifying how prompt structure and model selection jointly shape environmental and performance outcomes.
- Abstract(参考訳): 自動テストスクリプト生成における言語モデルの利用の増加は、その環境への影響に対する懸念を引き起こすが、既存のサステナビリティ分析は主に大きな言語モデルに焦点を当てている。
その結果、プロンプト駆動単体テストスクリプト生成時の小言語モデル(SLM)のエネルギーと炭素特性は、ほとんど未解明のままである。
このギャップに対処するため,HumanEvalベンチマークと適応的プロンプト変種(Artohropicテンプレートに基づく)を用いて,SLMの環境・性能トレードオフ(2B-8Bパラメータ範囲)を実験的に検討した。
この分析では、CodeCarbonを使用して、制御された条件下でのエネルギー消費炭素排出量と持続時間を特徴づけ、ユニットテストスクリプトカバレッジが生成されたテスト品質の初期プロキシとして機能する。
以上の結果から,異なるSLMはエネルギー使用量が少なく,実行速度が速いことや,同等条件下で高い安定性やカバレッジを維持できることが示唆された。
全体として、この研究は、持続可能なSLMベースのテストスクリプト生成に関する実験的な証拠を提供し、構造とモデルの選択がいかにして環境とパフォーマンスの成果を共同で形成するかを明確にする。
関連論文リスト
- Sustainability Analysis of Prompt Strategies for SLM-based Automated Test Generation [0.42970700836450487]
本稿では,SLMを用いた自動テスト生成のための迅速なエンジニアリング戦略の体系的持続可能性評価について述べる。
我々は,3つのオープンソースSLMに対して,制御された実験環境下での迅速な7つの戦略を解析した。
その結果、迅速な戦略は持続可能性の結果に実質的かつ独立した影響を与え、しばしばモデル選択の影響を上回ります。
論文 参考訳(メタデータ) (2026-04-03T06:10:07Z) - DeCEAT: Decoding Carbon Emissions for AI-driven Software Testing [0.42970700836450487]
本研究は,小言語モデル(SLM)の環境・性能トレードオフを体系的に評価するDeCEATフレームワークを紹介する。
以上の結果から,SLMは炭素制約下では高い安定性や精度を維持しつつ,それぞれ異なる持続可能性強度を示すことが明らかとなった。
この作業は、自動化されたSLMベースのテスト生成に特化して、サステナビリティ評価フレームワークを提供する。
論文 参考訳(メタデータ) (2026-02-20T05:54:58Z) - AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition [72.24180896265192]
本稿では,騒音環境下でのエージェントモデルのロバスト性を評価するためのフレームワークであるAgentNoiseBenchを紹介する。
まず、実世界のシナリオにおけるバイアスと不確実性の詳細な分析を行う。
次に,環境騒音をユーザノイズとツールノイズの2つの主要なタイプに分類する。
この分析に基づいて,既存のエージェント中心ベンチマークに制御可能なノイズを注入する自動パイプラインを開発した。
論文 参考訳(メタデータ) (2026-02-11T20:33:10Z) - Emissions and Performance Trade-off Between Small and Large Language Models [1.0863226323853896]
本研究では,事前定義されたタスクの持続可能な代替手段として,微調整小言語モデル(SLM)を用いる可能性について検討する。
その結果,6つのタスクのうち4つのタスクにおいて,SLMは推定時の二酸化炭素排出量の大幅な削減に匹敵する性能を維持した。
論文 参考訳(メタデータ) (2025-12-21T07:00:22Z) - BTC-SAM: Leveraging LLMs for Generation of Bias Test Cases for Sentiment Analysis Models [1.5637023740732419]
感性分析(SA)モデルは、現実世界の応用において有害な社会的バイアスを持つ。
最小限の仕様を持つSAモデルにおいて、バイアステストのための高品質なテストケースを生成する新しいバイアステストフレームワークであるBTC-SAMを提案する。
論文 参考訳(メタデータ) (2025-09-28T22:39:40Z) - A Controllable Examination for Long-Context Language Models [62.845852724511964]
本研究では,長文言語モデルを評価するベンチマークである$textbfLongBioBenchを紹介する。
その結果,ほとんどのモデルでは,検索結果に対する意味的理解や基礎的推論が不足していることが判明した。
我々のさらなる分析は、文脈的非コヒーレンスなど、既存の合成ベンチマークで採用されているいくつかの設計選択を示している。
論文 参考訳(メタデータ) (2025-06-03T14:23:06Z) - Assessing Generative Language Models in Classification Tasks: Performance and Self-Evaluation Capabilities in the Environmental and Climate Change Domain [0.0]
本稿では,2つの大規模言語モデル (LLMs) , GPT3.5 と Llama2 と 1つの小言語モデル (SLM) Gemma を,気候変動 (CC) と環境領域の3つの異なる分類課題で比較した。
論文 参考訳(メタデータ) (2024-08-30T15:52:41Z) - Exploring Precision and Recall to assess the quality and diversity of LLMs [82.21278402856079]
我々はtextscLlama-2 や textscMistral のような大規模言語モデル (LLM) のための新しい評価フレームワークを提案する。
このアプローチにより、コーパスの整合を必要とせず、生成したテキストの品質と多様性を微妙に評価できる。
論文 参考訳(メタデータ) (2024-02-16T13:53:26Z) - Generative Judge for Evaluating Alignment [84.09815387884753]
本稿では,これらの課題に対処するために,13Bパラメータを持つ生成判断器Auto-Jを提案する。
我々のモデルは,大規模な実環境シナリオ下でのユーザクエリとLLM生成応答に基づいて訓練されている。
実験的に、Auto-Jはオープンソースモデルとクローズドソースモデルの両方を含む、強力なライバルのシリーズを上回っている。
論文 参考訳(メタデータ) (2023-10-09T07:27:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。