論文の概要: bioLeak: Leakage-Aware Modeling and Diagnostics for Machine Learning in R
- arxiv url: http://arxiv.org/abs/2604.10965v1
- Date: Mon, 13 Apr 2026 04:01:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:16.308189
- Title: bioLeak: Leakage-Aware Modeling and Diagnostics for Machine Learning in R
- Title(参考訳): BioLeak: Rにおける機械学習のための漏洩認識モデリングと診断
- Authors: Selçuk Korkmaz,
- Abstract要約: BioLeak(バイオリーク)は、共通リーク機構に適合したモデルの構築と監査を行うRパッケージである。
この実装はバイナリ分類、マルチクラス分類、回帰分析、生存分析をサポートし、タスク固有のメトリクスと分割、適合、監査、インフレーションの要約のためのS4コンテナを提供する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Data leakage remains a recurrent source of optimistic bias in biomedical machine learning studies. Standard row-wise cross-validation and globally estimated preprocessing steps are often inappropriate for data with repeated measurements, study-level heterogeneity, batch effects, or temporal dependencies. This paper describes bioLeak, an R package for constructing leakage-aware resampling workflows and for auditing fitted models for common leakage mechanisms. The package provides leakage-aware split construction, train-fold-only preprocessing, cross-validated model fitting, nested hyperparameter tuning, post hoc leakage audits, and HTML reporting. The implementation supports binary classification, multiclass classification, regression, and survival analysis, with task-specific metrics and S4 containers for splits, fits, audits, and inflation summaries. The simulation artifacts show how apparent performance changes under controlled leakage mechanisms, and the case study illustrates how guarded and leaky pipelines can yield materially different conclusions on multi-study transcriptomic data. The emphasis throughout is on software design, reproducible workflows, and interpretation of diagnostic output.
- Abstract(参考訳): データ漏洩は、バイオメディカル機械学習研究における楽観的なバイアスの繰り返し源である。
標準的な行単位のクロスバリデーションと世界規模で推定される事前処理ステップは、繰り返し測定、研究レベルの不均一性、バッチ効果、時間的依存関係を持つデータには不適切であることが多い。
本稿では,リーク対応再サンプリングワークフローを構築するためのRパッケージであるbioLeakについて述べる。
このパッケージは、リーク対応の分割構造、列車折り畳みのみの事前処理、クロスバリデーションモデルフィッティング、ネストされたハイパーパラメータチューニング、ポストホックリーク監査、HTMLレポートを提供する。
この実装はバイナリ分類、マルチクラス分類、回帰分析、生存分析をサポートし、タスク固有のメトリクスと分割、適合、監査、インフレーションの要約のためのS4コンテナを提供する。
シミュレーションアーティファクトは、制御された漏洩機構の下での明らかな性能変化を示し、ケーススタディは、マルチスタディ・トランスクリプトロミクスデータにおいて、ガードされたパイプラインとリークされたパイプラインがどのように実質的に異なる結論を得るかを示す。
全体としての重点は、ソフトウェア設計、再現可能なワークフロー、診断出力の解釈である。
関連論文リスト
- fastml: Guarded Resampling Workflows for Safer Automated Machine Learning in R [0.0]
我々は、ガードされた再サンプリングを通して漏洩認識機械学習のためのシングルコールインタフェースであるfastmlを提示する。
fastmlはグループ化とタイムオーダーのリサンプリングをサポートし、ハイリスク設定をブロックし、外部依存関係のレシピを監査し、サンドボックス実行と統合モデル説明を含む。
論文 参考訳(メタデータ) (2026-04-06T22:41:27Z) - How does downsampling affect needle electromyography signals? A generalisable workflow for understanding downsampling effects on high-frequency time series [1.3648865252191944]
神経筋疾患の検出を支援する手段として、針筋電図(nEMG)信号の自動解析が登場している。
ダウンサンプリングは潜在的な解決策を提供するが、診断信号の内容と分類性能への影響は十分に理解されていない。
本研究では,高周波時系列におけるダウンサンプリングによる情報損失を系統的に評価するためのワークフローを提案する。
論文 参考訳(メタデータ) (2026-01-15T08:46:56Z) - Towards a more realistic evaluation of machine learning models for bearing fault diagnosis [0.28873930745906956]
本稿では,振動を用いた軸受故障診断におけるデータ漏洩問題とそのモデル評価への影響について検討する。
本研究では, 軸受データ分割に着目したリークフリー評価手法を提案し, トレーニングやテストに使用する物理部品の重複を防止した。
CWRU、パダーボーン大学(PU)、オタワ大学(UORED-VAF)の3つの広く採用されているデータセットに対する方法論の評価を行った。
論文 参考訳(メタデータ) (2025-09-26T12:35:02Z) - Large-Scale Targeted Cause Discovery via Learning from Simulated Data [66.51307552703685]
本稿では,観測結果から対象変数の因果変数を推定する機械学習手法を提案する。
我々は、シミュレートされたデータに基づいて教師あり学習を用いてニューラルネットワークを訓練し、因果関係を推定する。
大規模遺伝子制御ネットワークにおける因果関係の同定に優れた性能を示す実験結果が得られた。
論文 参考訳(メタデータ) (2024-08-29T02:21:11Z) - COMPILED: Deep Metric Learning for Defect Classification of Threaded Pipe Connections using Multichannel Partially Observed Functional Data [6.688305507010403]
本稿では,各サンプルが部分的に観察された多チャンネル関数データとして表現される欠陥分類に着目した。
各欠陥タイプのサンプルは限定的かつ不均衡である。
本稿では,Deep Metrics Learningに基づくCompactLEDと呼ばれる革新的な分類手法を提案する。
論文 参考訳(メタデータ) (2024-04-04T09:55:11Z) - Boosting Differentiable Causal Discovery via Adaptive Sample Reweighting [62.23057729112182]
異なるスコアに基づく因果探索法は観測データから有向非巡回グラフを学習する。
本稿では,Reweighted Score関数ReScoreの適応重みを動的に学習することにより因果発見性能を向上させるためのモデルに依存しないフレームワークを提案する。
論文 参考訳(メタデータ) (2023-03-06T14:49:59Z) - MIRACLE: Causally-Aware Imputation via Learning Missing Data Mechanisms [82.90843777097606]
欠落データに対する因果認識型計算アルゴリズム(MIRACLE)を提案する。
MIRACLEは、欠落発生機構を同時にモデル化することにより、ベースラインの計算を反復的に洗練する。
我々は、MIRACLEが一貫してイミューテーションを改善することができることを示すために、合成および様々な公開データセットに関する広範な実験を行う。
論文 参考訳(メタデータ) (2021-11-04T22:38:18Z) - Task-agnostic Continual Learning with Hybrid Probabilistic Models [75.01205414507243]
分類のための連続学習のためのハイブリッド生成識別手法であるHCLを提案する。
フローは、データの配布を学習し、分類を行い、タスクの変更を特定し、忘れることを避けるために使用される。
本研究では,スプリット-MNIST,スプリット-CIFAR,SVHN-MNISTなどの連続学習ベンチマークにおいて,HCLの強い性能を示す。
論文 参考訳(メタデータ) (2021-06-24T05:19:26Z) - Robust Finite Mixture Regression for Heterogeneous Targets [70.19798470463378]
本稿では,サンプルクラスタの探索と,複数の不完全な混合型ターゲットを同時にモデル化するFMRモデルを提案する。
我々は、高次元の学習フレームワークの下で、無症状のオラクルのパフォーマンス境界をモデルに提供します。
その結果,我々のモデルは最先端の性能を達成できることがわかった。
論文 参考訳(メタデータ) (2020-10-12T03:27:07Z) - Out-of-distribution Generalization via Partial Feature Decorrelation [72.96261704851683]
本稿では,特徴分解ネットワークと対象画像分類モデルとを協調的に最適化する,PFDL(Partial Feature Deorrelation Learning)アルゴリズムを提案する。
実世界のデータセットを用いた実験により,OOD画像分類データセットにおけるバックボーンモデルの精度が向上することを示した。
論文 参考訳(メタデータ) (2020-07-30T05:48:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。