論文の概要: A Reproducible Log-Driven AutoML Framework for Interpretable Pipeline Optimization in Healthcare Risk Prediction
- arxiv url: http://arxiv.org/abs/2605.21528v1
- Date: Tue, 19 May 2026 16:57:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 16:35:41.928843
- Title: A Reproducible Log-Driven AutoML Framework for Interpretable Pipeline Optimization in Healthcare Risk Prediction
- Title(参考訳): 医療リスク予測のためのパイプライン最適化のための再現可能なログ駆動型オートMLフレームワーク
- Abstract要約: 本研究では、決定論的かつログ駆動の自動機械学習フレームワークであるyvsoucom-iterkitを紹介する。
18,000以上のパイプライン構成にわたるPima Indians DiabetesとStrokeデータセットの実験は、部分的に冗長な検索スペースを明らかにしている。
このフレームワークは、アンサンブルモデルを使用して、強力で安定したパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 7.356849324535381
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Accurate and reproducible disease risk prediction remains challenging due to heterogeneous features, limited samples, and severe class imbalance. This study introduces yvsoucom-iterkit, a deterministic and log-driven automated machine learning framework that formulates pipeline optimization as a fully reproducible, configuration-level system. Each pipeline is encoded as a traceable log entity, enabling analysis of component attribution, interactions, similarity, and cross-seed robustness. Experiments on the Pima Indians Diabetes and Stroke datasets across more than 18,000 pipeline configurations reveal a structured and partially redundant search space, where performance is governed by a small subset of interacting components. Random Forest importance analysis identifies augmentation (0.454), model choice (0.198), and imbalance handling (0.101) as key drivers on Pima, while imbalance handling dominates Stroke (0.406). Component similarity analysis shows strong redundancy, with feature selection variants (biMax-biMean) exhibiting low RMS distance (0.0252), mixup closely matching no augmentation (0.0279), and TomekLinks aligning with no imbalance handling (0.0325), whereas Gaussian noise shows greater divergence from no augmentation (0.10). The framework achieves strong and stable performance using ensemble models (Weighted-F1 0.89, Macro-F1 0.88 on Pima; Weighted-F1 0.94 on Stroke), while Macro-F1 remains lower on Stroke (0.67) due to class imbalance. Cross-seed analysis reveals a performance-robustness trade-off, with ensembles showing lower variability (0.023-0.026) than SVM. These results indicate that effective AutoML optimization can focus on a reduced set of high-impact components.
- Abstract(参考訳): 不均一な特徴、限られたサンプル、重度の集団不均衡のため、正確な再現可能な疾患リスク予測は依然として困難である。
この研究では、パイプライン最適化を完全な再現可能な構成レベルのシステムとして定式化する、決定論的かつログ駆動の自動機械学習フレームワークであるyvsoucom-iterkitを紹介した。
各パイプラインはトレース可能なログエンティティとしてエンコードされ、コンポーネントの属性、インタラクション、類似性、クロスシードロバスト性の分析を可能にする。
18,000以上のパイプライン構成にわたるPima Indians DiabetesとStrokeデータセットの実験では、構造化され、部分的に冗長な検索スペースが示され、パフォーマンスは相互作用するコンポーネントの小さなサブセットによって管理される。
ランダムフォレストの重要度分析では、増加(0.454)、モデル選択(0.198)、不均衡ハンドリング(0.101)がピマのキードライバーであり、不均衡ハンドリングがストローク(0.406)を支配している。
成分類似性分析は、RMS距離が低い(0.0252)特徴選択変種(biMax-biMean)、増大しない(0.0279)ミキサップ、不均衡なハンドリングのないトメックリンク(0.0325)、ガウスノイズは増大しない(0.10)といった強い冗長性を示す。
このフレームワークは、アンサンブルモデル(PimaのWeighted-F1 0.89、StrokeのMacro-F1 0.94、StrokeのMacro-F1 0.89、クラス不均衡のためMacro-F1はStrokeの0.67)を使用して、強力で安定したパフォーマンスを実現している。
クロスシード解析では、SVMよりも低い変数(0.023-0.026)を示すアンサンブルによる性能損益性トレードオフが明らかにされている。
これらの結果は、AutoMLの効率的な最適化は、高インパクトなコンポーネントの少ないセットにフォーカスできることを示唆している。
関連論文リスト
- Task-Relevant Feature-Dynamics Fidelity Enables Zero-Shot Sim-to-Real Transfer for Robotic Ultrasound Scanning [58.25007580703646]
我々は,共有構造中間領域,軌道レベルの固定雑音,数ステップの条件流生成を組み合わせたTR指向超音波シミュレータを開発した。
ファントム実験では、4つの標的機に400発のゼロショット配置のうち390発が成功した。
論文 参考訳(メタデータ) (2026-08-30T02:37:00Z) - Latent Stability Analysis of Malware Representations Under Feature-Space Perturbations [0.0]
本稿では,EMBER特徴空間におけるマルウェア摂動評価のための潜時安定性解析パイプラインを提案する。
パイプラインは完全なEMBER機能、PCAベースの圧縮、変分オートエンコーダ表現のベータ/デノベート、Mandelbrotにインスパイアされたエスケープタイム記述子、PINNスタイルのラテントフローモジュールを比較している。
EMBER静的PE特徴ベクトルに対して,180,000のトレーニングサンプル,180,000のテストサンプル,24万のホールドアウトサンプルを用いて実験を行った。
論文 参考訳(メタデータ) (2026-07-27T15:53:28Z) - When Do Autoregressive Sequence Models Forecast Physical Wavefields? A Controlled Study on Synthetic Seismograms [43.8784307709823]
物理信号の長距離自己回帰予測は誤差蓄積によって制限される。
物理的に構造化されたテストベッドとして,合成3成分地震計を用いて,このようなロールアウトが安定であるかどうかを問う。
論文 参考訳(メタデータ) (2026-06-09T13:46:14Z) - An Empirical Analysis of Optimization Dynamics and Sparsity Boundaries in Large-Scale Pedestrian Attribute Recognition [0.0]
本稿では,ResNet-18バックボーン上のマルチラベル音声損失ハイパーパラメータの体系的アブレーションについて述べる。
校正された構成 (alpha=0.50, gamma=2.0) は、BCEベースラインと一致する62.32%のマクロF1スコアを達成する。
我々は、0.1%未満の正のサンプル分画が世界的損失の再重み付けを非効率にするハードバウンダリであるスパーシティウォールを同定する。
論文 参考訳(メタデータ) (2026-06-09T04:54:56Z) - Constraint-Aware Optimization for Robust Protein Stability Prediction [0.3316543849024811]
逆フォールディング表現を用いたタンパク質言語モデルの統合によるMultimodal $G$は,Megascaleデータセット上で強力な分布精度を実現する。
既存のアプローチは、これらの制限に主に追加のアーキテクチャコンポーネントを通して対処する。
本稿では, 平衡平均二乗誤差, シームズ反対称正則化器と, 位置推定器の特徴表現における新しいOODマージン損失を組み合わせた制約対応最適化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-06T11:04:52Z) - UTOPYA: A Multimodal Deep Learning Framework for Physics-Informed Anomaly Detection and Time-Series Prediction [42.532335022354545]
バッチプロセスにおける異常検出は、過渡的ダイナミクス、欠陥ラベルの不足、単一モードセンサデータへの依存によって妨げられる。
本研究は, バッチ蒸留における異常検出, 時系列予測, 位相分類を共同で扱うマルチモーダルフレームワークUTOPYAを紹介する。
本研究で導入された物理インフォームド正規化スキームは、時間的滑らかさと熱力学的モノトニクスを強制する。
論文 参考訳(メタデータ) (2026-05-18T10:28:15Z) - Architecture-Agnostic Modality-Isolated Gated Fusion for Robust Multi-Modal Prostate MRI Segmentation [0.0]
多重化前立腺MRIは、T2パラメトリック(T2W)、見かけ拡散係数(ADC)、高b値拡散強調(HBV)配列を組み合わせる。
実際には、拡散配列は、T2Wよりも、取得のばらつき、動き、アーティファクトの影響を受けることが多い。
我々は、学習ゲーティングステージの前に、個別のモダリティ固有の符号化ストリームを維持するために、Modality-Isolated Gated Fusion (MIGF)を提案する。
論文 参考訳(メタデータ) (2026-04-12T15:54:21Z) - How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles [46.63622714488747]
共有事前学習データ、蒸留、アライメントパイプラインは、隠れた振る舞い依存、潜伏絡みを誘導することができる。
実際には、これは相関した推論パターンと同期された障害として現れます。
ブラックボックス言語モデル間の行動絡みを監査するための統計的枠組みを開発する。
論文 参考訳(メタデータ) (2026-04-08T23:32:06Z) - SCALE:Scalable Conditional Atlas-Level Endpoint transport for virtual cell perturbation prediction [46.645872209565574]
仮想セル摂動予測のための大規模基盤モデルを提案する。
まず、データスループットを大幅に改善するBioNeMoベースのトレーニングおよび推論フレームワークを構築します。
第二に、摂動予測を条件付き輸送として定式化し、それをセットアウェアフローアーキテクチャで実装する。
第3に,生物学的に有意な指標に基づく厳密なセルレベルプロトコルを用いて,Tahoe-100Mのモデルを評価する。
論文 参考訳(メタデータ) (2026-03-18T05:51:08Z) - Do Generative Metrics Predict YOLO Performance? An Evaluation Across Models, Augmentation Ratios, and Dataset Complexity [43.338311770275745]
本報告では, YOLOv11の合成増強の制御された評価法について述べる。
実際のトレーニングスプリットの10%から150%の増大率に対して, GAN, 拡散, ハイブリッドベースの6つのジェネレータをベンチマークした。
データセット生成/拡張設定毎に、マッチしたサイズのブートストラッププロトコルで事前トレーニングデータセットメトリクスを計算する。
論文 参考訳(メタデータ) (2026-02-20T03:02:36Z) - Robust Machine Learning for Regulatory Sequence Modeling under Biological and Technical Distribution Shifts [0.3948325938742681]
性能劣化、校正失敗、不確実性に基づく信頼性を定量化するためのロバストネスフレームワークを導入する。
シミュレーションでは、セル型特異的プログラム、摂動、GCバイアス、深さ変化、バッチ効果、ヘテロscedastic noiseによってモチーフ駆動の制御出力が生成される。
モデルは精度は保たれるが、高い誤差、激しいばらつきの誤校正、モチーフ効果の反転とノイズによるカバー崩壊が支配的な体制である。
論文 参考訳(メタデータ) (2026-01-21T13:15:27Z) - Transparent Early ICU Mortality Prediction with Clinical Transformer and Per-Case Modality Attribution [42.85462513661566]
ICU滞在後48時間から, 生理的時系列測定と非構造的臨床記録とを融合した, 軽量で透明なマルチモーダルアンサンブルを提案する。
ロジスティック回帰モデルは、バイタル用双方向LSTMとノート用微調整された臨床ModernBERT変換器の2つのモード固有モデルからの予測を組み合わせる。
MIMIC-IIIベンチマークでは、遅延融合アンサンブルは、よく校正された予測を維持しながら、最高の単一モデルに対する差別を改善する。
論文 参考訳(メタデータ) (2025-11-19T20:11:49Z) - Graph-Based Fault Diagnosis for Rotating Machinery: Adaptive Segmentation and Structural Feature Integration [0.0]
本稿では,回転機械における頑健かつ解釈可能なマルチクラス故障診断のためのグラフベースフレームワークを提案する。
エントロピー最適化信号セグメンテーション、時間周波数特徴抽出、グラフ理論モデリングを統合し、振動信号を構造化表現に変換する。
提案手法は,2つのベンチマークデータセットで評価した場合,高い診断精度を実現する。
論文 参考訳(メタデータ) (2025-04-29T13:34:52Z) - Machine Learning for ALSFRS-R Score Prediction: Making Sense of the Sensor Data [44.99833362998488]
筋萎縮性側索硬化症(Amyotrophic Lateral Sclerosis、ALS)は、急速に進行する神経変性疾患である。
iDPP@CLEF 2024チャレンジを先導した今回の調査は,アプリから得られるセンサデータを活用することに焦点を当てている。
論文 参考訳(メタデータ) (2024-07-10T19:17:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。