論文の概要: Beyond the Model: The Critical Role of Data Filtering in Clinical Machine Learning
- arxiv url: http://arxiv.org/abs/2610.06640v1
- Date: Mon, 05 Oct 2026 16:26:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 00:02:25.164054
- Title: Beyond the Model: The Critical Role of Data Filtering in Clinical Machine Learning
- Title(参考訳): モデルを超えて: 臨床機械学習におけるデータフィルタリングの役割
- Abstract要約: フィルタリングの選択は、通常の前処理のステップではなく、科学的手法の一部として扱うべきだと我々は主張する。
この作業のソースコードはすべてGitHubで入手できる。
- 参考スコア(独自算出の注目度): 1.0250149287812593
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Machine learning (ML) studies using clinical data often rely on preprocessing and filtering pipelines before model development. The filtering decisions made in these pipelines can alter the dataset's statistical structure and may artificially reduce or increase the complexity of the prediction task. We argue that filtering choices should be treated as part of the scientific method rather than as a routine preprocessing step. We further discuss the need for explainable and transparent preprocessing pipelines that allow researchers to understand why specific filtering choices are made and how these choices affect the resulting data distribution and model performance. All of the source code for this work is available on GitHub.
- Abstract(参考訳): 臨床データを用いた機械学習(ML)の研究は、しばしばモデル開発の前に前処理とフィルタリングパイプラインに依存する。
これらのパイプラインで行われるフィルタリング決定は、データセットの統計構造を変更し、予測タスクの複雑さを人工的に低減または増大させる可能性がある。
フィルタリングの選択は、通常の前処理のステップではなく、科学的手法の一部として扱うべきだと我々は主張する。
さらに、特定のフィルタリング選択を行う理由と、これらの選択が結果のデータ分散とモデルパフォーマンスにどのように影響するかを研究者が理解できるようにする、説明可能な透明な前処理パイプラインの必要性についても論じる。
この作業のソースコードはすべてGitHubで入手できる。
関連論文リスト
- Filter Learning for Subgraphs: Algebras and Performance Risk Bounds [63.46320825598287]
本稿では,部分的な観測の下でグラフフィルタを近似する部分グラフフィルタ学習の枠組みを提案する。
距離を意識したラプラシアン構造に基づく部分グラフフィルタ代数を開発し、効率的な近似のための構造化および制御可能なフィルタのクラスを定義する。
論文 参考訳(メタデータ) (2026-07-23T12:36:05Z) - OpenCodeReasoning: Advancing Data Distillation for Competitive Coding [61.15402517835137]
教師付き微調整(SFT)データセットを構築し、様々なサイズのモデルで最先端のコーディング能力を実現する。
私たちのモデルは、LiveCodeBenchで61.8%、CodeContestsで24.6%を達成するためにSFTのみを使用しており、強化学習でトレーニングされた代替品を上回っています。
論文 参考訳(メタデータ) (2025-04-02T17:50:31Z) - LLM-Select: Feature Selection with Large Language Models [64.5099482021597]
大規模言語モデル(LLM)は、データサイエンスの標準ツールに匹敵するパフォーマンスで、最も予測可能な機能を選択することができる。
以上の結果から,LSMはトレーニングに最適な機能を選択するだけでなく,そもそもどの機能を収集すべきかを判断する上でも有用である可能性が示唆された。
論文 参考訳(メタデータ) (2024-07-02T22:23:40Z) - DiffPrep: Differentiable Data Preprocessing Pipeline Search for Learning
over Tabular Data [12.416345241511781]
与えられたデータセットに対するデータ前処理パイプラインを自動かつ効率的に検索するDiffPrepを提案する。
実験の結果,DiffPrepは実世界の18のデータセットのうち15の精度で最高のテスト精度を達成できた。
論文 参考訳(メタデータ) (2023-08-20T23:40:26Z) - Batch Normalization Tells You Which Filter is Important [49.903610684578716]
我々は,事前学習したCNNのBNパラメータに基づいて,各フィルタの重要性を評価することによって,簡易かつ効果的なフィルタ刈取法を提案する。
CIFAR-10とImageNetの実験結果から,提案手法が優れた性能を発揮することを示す。
論文 参考訳(メタデータ) (2021-12-02T12:04:59Z) - Outlier Detection as Instance Selection Method for Feature Selection in
Time Series Classification [0.0]
まれなインスタンスのための機能選択メソッドに提供されるフィルタインスタンス。
一部のデータセットでは、結果としてパフォーマンスが向上したのはわずか数パーセントだった。
他のデータセットでは、最大16%のパフォーマンス向上を実現しました。
論文 参考訳(メタデータ) (2021-11-16T14:44:33Z) - Towards data-driven filters in Paraview [0.0]
我々は、事前学習された機械学習モデルの能力を可視化システムに公開するフィルタを開発する。
フィルタは入力データをモデルに入力することで変換し、残りの視覚化パイプラインへの入力としてモデルの出力を提供する。
画像および流体データの分割と分類のための一連の簡易なユースケースについて述べる。
論文 参考訳(メタデータ) (2021-08-11T13:02:22Z) - Dependency Aware Filter Pruning [74.69495455411987]
重要でないフィルタを割ることは、推論コストを軽減するための効率的な方法である。
以前の作業は、その重み基準やそれに対応するバッチノームスケーリング要因に従ってフィルタをプルークする。
所望の空間性を達成するために,空間性誘導正規化を動的に制御する機構を提案する。
論文 参考訳(メタデータ) (2020-05-06T07:41:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。