論文の概要: Temporal Modeling of Change History for Black-Box Test Suite Minimization
- arxiv url: http://arxiv.org/abs/2605.25441v1
- Date: Mon, 25 May 2026 05:37:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:19.329148
- Title: Temporal Modeling of Change History for Black-Box Test Suite Minimization
- Title(参考訳): ブラックボックステストスイート最小化のための変更履歴の時間モデル
- Abstract要約: テストスイート最小化(TSM)は、テストスイートのサイズを削減し、障害検出機能を保持する。
最近の変更履歴は、ブラックボックスTSMを導くための軽量でスケーラブルな指標として研究されている。
ブラックボックスTSMに時間的モデリングを導入し、時間的リスク駆動テストスイート最小化(TRTM)を提案する。
- 参考スコア(独自算出の注目度): 0.5798758080057375
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Test Suite Minimization (TSM) reduces the size of test suites while preserving their fault detection capability. In black-box TSM, reduction is performed without relying on production-code instrumentation. While several black-box TSM approaches have explored metrics like test logs or test similarity, these often suffer from scalability and efficiency issues. Recently, change history has been explored as a lightweight and scalable indicator for guiding black-box TSM. However, existing approaches treat historical modifications uniformly, ignoring the temporal dynamics of software evolution where recently modified code tends to be more fault-prone. To address this limitation, we introduce temporal modeling into black-box TSM and propose Temporal Risk-driven Test Suite Minimization (TRTM). TRTM extracts modification history from version-control metadata and applies exponential temporal attenuation to weight changes based on recency, producing time-weighted class-level risk scores that reflect fault-proneness. Next, it determines dependencies between test cases and production classes by constructing static call graphs derived solely from test code, preserving the black-box setting. The risk scores of the classes exercised by each test case are then aggregated using statistical measures such as Average and Geometric Mean to compute a risk score for the test case. Finally, test cases with the highest risk scores are selected to construct the reduced suite. Evaluation on a large dataset containing 14 projects with 631 versions shows that TRTM consistently outperforms the state-of-the-art baseline, achieving a mean Accuracy of 0.72 (vs. 0.66) and Fault Detection Rate (FDR) of 0.75 (vs. 0.69), while also reducing execution time.
- Abstract(参考訳): テストスイート最小化(TSM)は、テストスイートのサイズを削減し、障害検出機能を保持する。
ブラックボックスTSMでは、生産コードインスツルメンテーションに頼ることなく削減を行う。
いくつかのブラックボックスのTSMアプローチでは、テストログやテストの類似性といったメトリクスを探索しているが、スケーラビリティと効率性の問題があることが多い。
近年、変更履歴はブラックボックスTSMを導くための軽量でスケーラブルな指標として研究されている。
しかし、既存のアプローチは、ソフトウェア進化の時間的ダイナミクスを無視して、歴史的修正を均一に扱う。
この制限に対処するために、ブラックボックスTSMに時間モデルを導入し、時間的リスク駆動テストスイート最小化(TRTM)を提案する。
TRTMは、バージョン管理メタデータから変更履歴を抽出し、リフレレンスに基づく重み変化に指数的時間減衰を適用し、フォールト・プレネネスを反映した時間重み付きクラスレベルのリスクスコアを生成する。
次に、テストコードから派生した静的なコールグラフを構築し、ブラックボックスの設定を保存することで、テストケースと本番クラス間の依存関係を決定する。
各テストケースで実行されたクラスのリスクスコアは、平均値や幾何平均などの統計値を用いて集計され、テストケースのリスクスコアが計算される。
最後に、リスクスコアが最も高いテストケースを選択して、削減スイートを構築する。
631バージョンを含む14のプロジェクトを含む大規模なデータセットの評価によると、TRTMは最先端のベースラインを一貫して上回り、平均精度は0.72(vs. 0.66)、故障検出率(FDR)は0.75(vs. 0.69)であり、実行時間を短縮している。
関連論文リスト
- Method-level Change-proneness: A Better Metric for Black-box Test Suite Minimization [0.651722296019499]
テストスイート最小化(TSM)は、テストスイートのサイズを削減し、障害検出機能を保持する。
我々は,より粒度の高いメソッドレベルのCPを提案し,MCTM(Message-level Change-proneness based Test-suite Minimization)を実装した。
MCTMは平均で0.93の精度と0.94の故障検出率を達成し、クラスレベルのCPと類似性に基づくアプローチを著しく上回っている。
論文 参考訳(メタデータ) (2026-05-13T18:13:58Z) - Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites [49.16055123488827]
十分に強力なテストスイートは、報告された成功率を膨らませながら、妥当だが意味的に正しくないパッチを認めることができる。
STINGは、意味的に変化するプログラムの変種を診断ストレス要因として利用する、ターゲットテスト拡張のためのフレームワークである。
STINGは211インスタンスにまたがる1014の検証テストを生成し、パッチリージョンラインとブランチカバレッジを10.8%、9.5%向上させた。
論文 参考訳(メタデータ) (2026-04-02T01:13:40Z) - MIST-RL: Mutation-based Incremental Suite Testing via Reinforcement Learning [19.054149750597933]
MIST-RL (Mutation-based Incremental Suite Testing via Reinforcement Learning) は、"スケーリング・バイ・ユーティリティ(scaling-by-utility)"に重点を移すフレームワークである。
我々は,機能的に等価なアサーションを抑えながら,新たな欠陥を発見するモデルにインセンティブを与える,動的ペナルティと組み合わされた新たなインクリメンタル突然変異報酬を導入する。
HumanEval+とMBPP+の実験は、MIST-RLが最先端のベースラインより優れていることを示した。
論文 参考訳(メタデータ) (2026-03-02T03:22:44Z) - MINGLE: Mixture of Null-Space Gated Low-Rank Experts for Test-Time Continual Model Merging [29.58798660724693]
連続モデルマージは、オリジナルのトレーニングデータにアクセスすることなく、独立して微調整されたモデルを順次統合する。
テスト時間連続モデルマージの新しいフレームワークであるMINGLEを提案する。
MINGLEは堅牢な一般化を実現し、忘れることを大幅に減らし、従来の最先端の手法を平均で7-9%上回っている。
論文 参考訳(メタデータ) (2025-05-17T07:24:22Z) - STAMP: Outlier-Aware Test-Time Adaptation with Stable Memory Replay [76.06127233986663]
テスト時間適応(TTA)は、トレーニングデータとテストデータの間の分散シフトに、未ラベルのデータのみを用いて対処することを目的としている。
本稿では,サンプル認識とオフリエ拒絶の両方を行う問題に注意を払っている。
本稿では,STAble Memory rePlay (STAMP) と呼ばれる新しい手法を提案する。
論文 参考訳(メタデータ) (2024-07-22T16:25:41Z) - Uncertainty-Calibrated Test-Time Model Adaptation without Forgetting [65.21599711087538]
テスト時間適応(TTA)は、与えられたモデルw.r.t.を任意のテストサンプルに適用することにより、トレーニングデータとテストデータの間の潜在的な分散シフトに取り組むことを目指している。
事前の手法は各テストサンプルに対してバックプロパゲーションを実行するため、多くのアプリケーションに対して許容できない最適化コストがかかる。
本稿では, 有効サンプル選択基準を策定し, 信頼性および非冗長なサンプルを同定する, 効率的なアンチフォッティングテスト時間適応法を提案する。
論文 参考訳(メタデータ) (2024-03-18T05:49:45Z) - Un-Mixing Test-Time Normalization Statistics: Combatting Label Temporal Correlation [11.743315123714108]
本稿では,Un-Mixing Test-Time Normalization Statistics (UnMix-TNS)と呼ばれる新しい手法を提案する。
本手法は,複数の異なる統計成分を混合することにより,テストバッチ内の各インスタンスの統計を校正する。
この結果は,UnMix-TNSの安定性と性能を,様々なベンチマークで著しく向上させる能力を強調した。
論文 参考訳(メタデータ) (2024-01-16T12:48:52Z) - LLMs as Factual Reasoners: Insights from Existing Benchmarks and Beyond [135.8013388183257]
そこで我々は,SummEditsと呼ばれる10ドメインのベンチマークで不整合検出ベンチマークを作成し,実装する新しいプロトコルを提案する。
ほとんどのLLMはSummEditsで苦労しており、パフォーマンスはランダムに近い。
最も優れたモデルであるGPT-4は、推定された人間のパフォーマンスよりも8%低い。
論文 参考訳(メタデータ) (2023-05-23T21:50:06Z) - LTM: Scalable and Black-box Similarity-based Test Suite Minimization based on Language Models [0.6562256987706128]
テストスイートはソフトウェアが進化するにつれて成長する傾向にあり、割り当てられたテスト予算ですべてのテストケースを実行することができないことが多い。
テストスイートの最小化(TSM)は、冗長なテストケースを削除することで、ソフトウェアテストの効率を改善するために使用される。
LTM(Language model-based Test suite Minimization)を提案する。
論文 参考訳(メタデータ) (2023-04-03T22:16:52Z) - Sequential Kernelized Independence Testing [77.237958592189]
我々は、カーネル化依存度にインスパイアされたシーケンシャルなカーネル化独立試験を設計する。
シミュレーションデータと実データの両方にアプローチのパワーを実証する。
論文 参考訳(メタデータ) (2022-12-14T18:08:42Z) - Efficient Test-Time Model Adaptation without Forgetting [60.36499845014649]
テストタイム適応は、トレーニングとテストデータの間の潜在的な分散シフトに取り組むことを目指している。
信頼性および非冗長なサンプルを同定するためのアクティブなサンプル選択基準を提案する。
また、重要なモデルパラメータを劇的な変化から制約するFisher regularizerを導入します。
論文 参考訳(メタデータ) (2022-04-06T06:39:40Z) - Test-time Batch Statistics Calibration for Covariate Shift [66.7044675981449]
我々は,推論中に深層モデルを新しい環境に適応させることを提案する。
バッチ統計の校正に$alpha$-BNの一般的な定式化を提案する。
また、統合テスト時間適応フレームワークCoreを形成するための新しい損失関数も提示する。
論文 参考訳(メタデータ) (2021-10-06T08:45:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。