論文の概要: Evolution-Aware Regression Test Prioritization of ML-Enabled Systems Using Gradient-Based Behavior Vectors
- arxiv url: http://arxiv.org/abs/2606.28037v1
- Date: Fri, 26 Jun 2026 12:43:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.485144
- Title: Evolution-Aware Regression Test Prioritization of ML-Enabled Systems Using Gradient-Based Behavior Vectors
- Title(参考訳): グラディエントに基づく行動ベクトルを用いたML対応システムの進化型回帰テスト優先化
- Authors: Eunho Cho, Donghwan Shin, In-Young Ko,
- Abstract要約: 勾配に基づく振る舞いベクトルデルタ(GBV-PD)は回帰テスト優先化のための振る舞いベクトル空間を運用するための最初のアプローチである。
GBV-PDは、非方向性ベースラインを一貫して上回り、フルグレード参照と競合した。
これらの結果は,行動空間のアイデアをML対応システムの繰り返し更新回帰テストのための実用的で効率的なメカニズムとして運用できることを示唆している。
- 参考スコア(独自算出の注目度): 3.679343863104537
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: The machine learning(ML) component of an ML-enabled system evolves through retraining, fine-tuning, and optimization, so previously valid test results may no longer hold. A single evolution step can worsen performance on some test cases while improving others, making regression test prioritization inherently directional. We present Gradient-based Behavior Vector-Parameter Delta(GBV-PD), the first approach to operationalize the behavior vector space for evolution-aware regression test prioritization. GBV-PD represents each test case as a gradient-based vector(GBV), a low-dimensional projection of its loss gradient under the original model. It then projects the observed parameter update of the evolved model onto the same PCA basis and uses the resulting alignment to estimate whether each test case's loss is likely to increase or decrease, without running the evolved model on test cases during prioritization. In an empirical study across classification and regression tasks, GBV-PD consistently outperformed non-directional baselines and remained competitive with a full-gradient reference, while offering better time and storage profiles for repeated updates via reusable GBV caching. These results show that behavior-space ideas can be operationalized into a practical and efficient mechanism for repeated-update regression testing of evolving ML-enabled systems.
- Abstract(参考訳): ML対応システムの機械学習(ML)コンポーネントは、リトレーニング、微調整、最適化を通じて進化する。
単一の進化ステップは、いくつかのテストケースのパフォーマンスを悪化させ、他のケースを改善し、回帰テストの優先順位付けを本質的に方向付けする。
進化を考慮した回帰テスト優先化のための行動ベクトル空間を運用するための最初のアプローチである、勾配に基づく行動ベクトルパラメータデルタ(GBV-PD)を提案する。
GBV-PDは、各テストケースを、元のモデルの下での損失勾配の低次元投影である勾配に基づくベクトル(GBV)として表現する。
次に、進化したモデルの観察されたパラメータ更新を同じPCAベースに投影し、結果のアライメントを使用して、優先順位付け中のテストケースで進化したモデルを走らせることなく、各テストケースの損失が増加または減少する可能性があるかを推定する。
分類と回帰タスクに関する実証的研究では、GBV-PDは非方向性のベースラインを一貫して上回り、フルグレードのリファレンスと競合し続けた。
これらの結果は,行動空間のアイデアをML対応システムの繰り返し更新回帰テストのための実用的で効率的なメカニズムとして運用できることを示唆している。
関連論文リスト
- Stabilizing Test-Time Adaptation of High-Dimensional Simulation Surrogates via D-Optimal Statistics [23.824598203175455]
TTA(Test-Time Adaptation)は、マシンラーニングサロゲートのトレーニングとデプロイの間の分散シフトを軽減する。
本稿では,最大情報量(D-Optimal)統計を格納するTTAフレームワークを提案する。
提案手法は, 計算コストの低減により, 最大7%のアウト・オブ・ディストリビューション改善が得られる。
論文 参考訳(メタデータ) (2026-02-17T18:55:18Z) - CURE: Critical-Token-Guided Re-Concatenation for Entropy-Collapse Prevention [24.71056659948577]
本稿では,探索と利用のバランスをとる2段階フレームワークCURE(Critical-token-gUided Re Concatenation for Entropy-collapse Prevention)を紹介する。
CUREは6つのベンチマークで5%のパフォーマンス向上を実現し、エントロピーと精度の両方で最先端のパフォーマンスを確立する。
論文 参考訳(メタデータ) (2025-08-14T18:40:34Z) - Self-Boost via Optimal Retraining: An Analysis via Approximate Message Passing [58.52119063742121]
独自の予測と潜在的にノイズの多いラベルを使ってモデルをトレーニングすることは、モデルパフォーマンスを改善するためのよく知られた戦略である。
本稿では,モデルの予測と提供ラベルを最適に組み合わせる方法について論じる。
我々の主な貢献は、現在のモデルの予測と与えられたラベルを組み合わせたベイズ最適集約関数の導出である。
論文 参考訳(メタデータ) (2025-05-21T07:16:44Z) - Q-value Regularized Transformer for Offline Reinforcement Learning [70.13643741130899]
オフライン強化学習(RL)における最先端化のためのQ値正規化変換器(QT)を提案する。
QTはアクション値関数を学習し、条件付きシーケンスモデリング(CSM)のトレーニング損失にアクション値を最大化する用語を統合する
D4RLベンチマークデータセットの実証評価は、従来のDP法やCSM法よりもQTの方が優れていることを示す。
論文 参考訳(メタデータ) (2024-05-27T12:12:39Z) - Post-Hoc Reversal: Are We Selecting Models Prematurely? [13.910702424593797]
ポストホック変換を適用した後に性能傾向が逆転するポストホック逆転現象を示す。
予備的な分析は、これらの変換が、誤ラベルされた例の影響を抑えることによって、逆転を引き起こすことを示唆している。
ポストホック選択(post-hoc selection)は、ポストホックメトリクスがモデル開発決定を通知するシンプルな手法である。
論文 参考訳(メタデータ) (2024-04-11T14:58:19Z) - Test-Time Model Adaptation with Only Forward Passes [68.11784295706995]
テストタイム適応は、トレーニング済みのモデルを、潜在的に分布シフトのある未確認テストサンプルに適応させるのに有効であることが証明されている。
テスト時間フォワード最適化適応法(FOA)を提案する。
FOAは量子化された8ビットのViTで動作し、32ビットのViTで勾配ベースのTENTより優れ、ImageNet-Cで最大24倍のメモリ削減を実現する。
論文 参考訳(メタデータ) (2024-04-02T05:34:33Z) - Model-Based Reparameterization Policy Gradient Methods: Theory and
Practical Algorithms [88.74308282658133]
Reization (RP) Policy Gradient Methods (PGM) は、ロボット工学やコンピュータグラフィックスにおける連続的な制御タスクに広く採用されている。
近年の研究では、長期強化学習問題に適用した場合、モデルベースRP PGMはカオス的かつ非滑らかな最適化環境を経験する可能性があることが示されている。
本稿では,長期モデルアンロールによる爆発的分散問題を緩和するスペクトル正規化法を提案する。
論文 参考訳(メタデータ) (2023-10-30T18:43:21Z) - Data Augmentation through Expert-guided Symmetry Detection to Improve
Performance in Offline Reinforcement Learning [0.0]
マルコフ決定過程(MDP)の動的モデルのオフライン推定は非自明な作業である。
近年の研究では、密度推定法に依存する専門家誘導パイプラインが、決定論的環境において、この構造を効果的に検出できることが示されている。
学習したMDPを解き、実際の環境に最適化されたポリシーを適用すると、前者の結果が性能改善につながることを示す。
論文 参考訳(メタデータ) (2021-12-18T14:32:32Z) - Regression Bugs Are In Your Model! Measuring, Reducing and Analyzing
Regressions In NLP Model Updates [68.09049111171862]
この研究は、NLPモデル更新における回帰エラーの定量化、低減、分析に重点を置いている。
回帰フリーモデル更新を制約付き最適化問題に定式化する。
モデルアンサンブルが回帰を減らす方法を実証的に分析します。
論文 参考訳(メタデータ) (2021-05-07T03:33:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。