論文の概要: Mutation Testing for Reproducibility Safeguards in Machine Learning Research Software: An Empirical Study
- arxiv url: http://arxiv.org/abs/2608.27100v1
- Date: Thu, 27 Aug 2026 13:15:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.412758
- Title: Mutation Testing for Reproducibility Safeguards in Machine Learning Research Software: An Empirical Study
- Title(参考訳): 機械学習研究ソフトウェアにおける再現性保護のための突然変異試験--実証的研究
- Abstract要約: 機械学習研究における再現性は、ランダムシード、依存バージョン、データのパーティショニング、評価設定などの実験的な選択に依存する。
既存のリポジトリバリデーションは、そのような選択の変更を検知することなく、うまく実行できます。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reproducibility in machine-learning research depends on experimental choices such as random seeds, dependency versions, data partitioning, and evaluation configuration. Existing repository validation workflows may execute successfully without detecting changes to such choices. We study this problem using MLReproMutate, research software that applies controlled, reproducibility-relevant mutations to ML research repositories and evaluates them against validation workflows already present in those repositories. We conducted an outcome-blind empirical study of 39 frozen repository-operator cases using four mutation classes: random seed, dependency pin, data split, and cross-validation fold count. Repository revisions, mutation candidates, and validation workflows were fixed before mutation outcomes were observed. Primary execution yielded outcomes for 13 of 39 cases; a bounded restoration procedure increased the combined evaluable set to 24. After excluding one confirmed-equivalent mutation, 23 confirmed non-equivalent mutations remained. The selected validation workflows detected 2 of these 23 mutations, corresponding to an observed detection proportion of 8.7%. These results do not imply that the corresponding repositories are irreproducible. Rather, they show that, in this sample, existing validation workflows often did not detect the particular controlled reproducibility-relevant changes introduced by the study. The findings motivate reproducibility-oriented mutation testing as a complementary way to assess whether research-software safeguards constrain experimentally important choices.
- Abstract(参考訳): 機械学習研究における再現性は、ランダムシード、依存バージョン、データのパーティショニング、評価設定などの実験的な選択に依存する。
既存のリポジトリバリデーションワークフローは、そのような選択の変更を検知することなく、うまく実行することができる。
MLReproMutateは,ML研究レポジトリに再現性関連突然変異を制御し,それらのレポジトリに存在する検証ワークフローに対して評価するソフトウェアである。
ランダムシード, 依存ピン, データ分割, クロスバリデーション・フォールドカウントの4つの変異クラスを用いて, 39例の凍結保存作業を行った。
突然変異結果が観察される前に, リポジトリリビジョン, 突然変異候補, バリデーションワークフローが修正された。
初回手術は39例中13例に有意な有意な成績を示した。
1つの非等価変異を除外した後、23の非等価変異が残った。
選択された検証ワークフローでは、23の変異のうち2つが検出され、検出率は8.7%であった。
これらの結果は、対応するリポジトリが実行不可能であることを意味するものではない。
むしろ、このサンプルでは、既存の検証ワークフローが、研究によって導入された特定の制御された再現性関連の変化を検知しなかったことが示されています。
本研究は, 再現性指向突然変異検査を, 研究ソフトの保護が実験的に重要な選択を制約するか否かを, 相補的に評価することを目的とした。
関連論文リスト
- Auditing and Decomposing Feedback-Driven Evolution in LLM Test Generation under the Oracle Problem [14.44743150931186]
無効または不特定な入力は、急激な障害検出と明らかな進化的利益を生み出す。
我々は、142の開発タスク、114のロックされた外部タスク、128のホールドアウトタスクを使用して、フィードバック駆動のテスト生成において、この障害モードを監査する。
自己進化型テストジェネレータの評価において,検証対象のアーティファクト,インタラクションの足場,グラウンドドフィードバックを分離するオーディエンス・アンド・プレースボプロトコルを提案する。
論文 参考訳(メタデータ) (2026-08-20T04:29:35Z) - PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering [71.15346406323827]
本稿では,プロセス・アウトカム・アライメント・アライメント・検証における検証結果を評価するベンチマークであるPRIMEを紹介する。
現在の検証器は、しばしば導出欠陥を検出するのに失敗する。
本稿では,PRIMEで選択した検証手法を利用したプロセス認識型RLVRトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2026-02-12T04:45:01Z) - Deep Learning Framework Testing via Model Mutation: How Far Are We? [30.292791319442404]
既存の突然変異に基づく検査手法の欠陥検出機能を再検討する。
わずか23モデルで39のユニークな欠陥を特定しました。そのうち31は開発者によって確認され、8つは修正されました。
論文 参考訳(メタデータ) (2025-06-21T08:44:33Z) - Pre-validation Revisited [79.92204034170092]
シミュレーションと応用による予測,推測,誤差推定における事前検証の特性と利点を示す。
そこで本研究では, あるモデル下での事前検証予測のためのテスト統計量の解析的分布だけでなく, 推論を行うための一般的なブートストラップ手順も提案する。
論文 参考訳(メタデータ) (2025-05-21T00:20:14Z) - Validating GWAS Findings through Reverse Engineering of Contingency Tables [2.107610564835429]
本稿では,データセット共有を必要とせずに意図しない誤りを検出するGWAS検証手法を提案する。
提案手法は, GWAS結果から得られるp値を利用して, 単一ヌクレオチド多型(SNP)の一致度を推定する。
信頼性の高いしきい値に該当する結果を検証し、しきい値を超える結果を警告し、さらなる検査を行う。
論文 参考訳(メタデータ) (2024-11-17T20:35:05Z) - A Comprehensive Study on Large Language Models for Mutation Testing [36.00296047226433]
大規模言語モデル(LLM)は、最近、研究作業と産業実践の両方においてミュータントを生成するために使用されている。
BugFarm と LLMorpheus (最先端の2つの LLM ベースのアプローチ) を,Java の実世界の2つのバグベンチマークから,851 の実際のバグに対して評価した。
以上の結果から, LLMは既存のルールベースアプローチと比較して, 実際のバグに近づき, 111.29%の障害検出率を持つ, より多様な変異体を生成することが明らかとなった。
論文 参考訳(メタデータ) (2024-06-14T08:49:41Z) - An Empirical Evaluation of Manually Created Equivalent Mutants [54.02049952279685]
手動で作成した突然変異体の10%未満は等価である。
驚くべきことに、我々の発見は、開発者の大部分が同等のミュータントを正確に識別するのに苦労していることを示している。
論文 参考訳(メタデータ) (2024-04-14T13:04:10Z) - mlscorecheck: Testing the consistency of reported performance scores and
experiments in machine learning [0.0]
我々は、報告された性能スコアと機械学習問題における様々な実験装置との矛盾を識別できる数値的手法を開発した。
これらの一貫性テストは、オープンソースのパッケージmlscorecheckに統合される。
論文 参考訳(メタデータ) (2023-11-13T18:31:48Z) - Selective Nonparametric Regression via Testing [54.20569354303575]
本研究では,所定の点における条件分散の値に関する仮説を検証し,留置手順を開発する。
既存の手法とは異なり、提案手法は分散自体の値だけでなく、対応する分散予測器の不確実性についても考慮することができる。
論文 参考訳(メタデータ) (2023-09-28T13:04:11Z) - Contextual Predictive Mutation Testing [17.832774161583036]
MutationBERTは、ソースメソッドの突然変異とテストメソッドを同時にエンコードする予測突然変異テストのアプローチである。
精度が高いため、MutationBERTは、ライブミュータントをチェック・検証する以前のアプローチで費やされた時間の33%を節約する。
我々は、入力表現と、テストマトリックスレベルからテストスイートレベルまで予測を引き上げるためのアグリゲーションアプローチを検証し、同様の性能改善を見出した。
論文 参考訳(メタデータ) (2023-09-05T17:00:15Z) - Statistical and Computational Phase Transitions in Group Testing [73.55361918807883]
本研究の目的は、希少な疾患を患っているk人の集団を同定することである。
個々人のテストを割り当てるための2つの異なる単純なランダムな手順を考える。
論文 参考訳(メタデータ) (2022-06-15T16:38:50Z) - Efficient Test-Time Model Adaptation without Forgetting [60.36499845014649]
テストタイム適応は、トレーニングとテストデータの間の潜在的な分散シフトに取り組むことを目指している。
信頼性および非冗長なサンプルを同定するためのアクティブなサンプル選択基準を提案する。
また、重要なモデルパラメータを劇的な変化から制約するFisher regularizerを導入します。
論文 参考訳(メタデータ) (2022-04-06T06:39:40Z) - Tracking the risk of a deployed model and detecting harmful distribution
shifts [105.27463615756733]
実際には、デプロイされたモデルのパフォーマンスが大幅に低下しないという、良心的なシフトを無視することは理にかなっている。
我々は,警告を発射する有効な方法は,(a)良性な警告を無視しながら有害なシフトを検知し,(b)誤報率を増大させることなく,モデル性能の連続的なモニタリングを可能にすることを論じる。
論文 参考訳(メタデータ) (2021-10-12T17:21:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。