論文の概要: Rethinking How We Evaluate Methodological Progress in Health AI
- arxiv url: http://arxiv.org/abs/2609.18134v2
- Date: Mon, 21 Sep 2026 03:08:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:28:59.943826
- Title: Rethinking How We Evaluate Methodological Progress in Health AI
- Title(参考訳): ヘルスAIの方法論的進歩を再考する
- Abstract要約: 共有評価フレームワークにおいて,12の歴史的アルゴリズムと最近のアルゴリズムを評価した。
臨床に有意義なタスクを専門的に実装することと、ランダムにサンプリングされたイベントコードと予測地平線から定義されたタスクを生成することの2つの相補的なタスクファミリを比較した。
その結果、ランダムに生成されたタスクから臨床的に意味のあるタスク、データセット間での相互比較は、評価設定間で強く伝達されることがわかった。
- 参考スコア(独自算出の注目度): 0.7734726150561086
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Methodological progress in artificial intelligence (AI) for electronic health records (EHRs) depends on our ability to determine which algorithms work better, and under which conditions. However, such progress is thought to be hindered by difficulties in reproducibility and in defining clinically meaningful evaluation tasks. We empirically study these barriers by re-implementing 12 historical and recent algorithms within a shared evaluation framework and evaluating them on two clinical datasets, MIMIC-IV and NWICU. We compare two complementary task families: expert-authored clinically meaningful tasks and generated tasks defined from randomly sampled event codes and prediction horizons. We ask whether relative algorithms comparisons transfer across task families and datasets, whether residual task heterogeneity contains useful methodological structure, and what a controlled comparison reveals about progress over the last decade. We find that aggregate pairwise comparisons transfer strongly across evaluation settings, including from randomly generated tasks to clinically meaningful tasks and across datasets. At the same time, clinically meaningful tasks exhibit greater task-method interaction, providing preliminary evidence that task properties can help explain when particular modeling choices are advantageous. Finally, newer algorithms do not consistently outperform earlier approaches: gradient-boosted trees remain highly competitive when paired with a modern, wide and sparse representation of the EHR. Together, these results suggest that useful methodological knowledge may require less task engineering than commonly assumed, while highlighting the importance of understanding the structured heterogeneity that remains across tasks and methods.
- Abstract(参考訳): 電子健康記録(EHR)のための人工知能(AI)の方法論的進歩は、どのアルゴリズムがよりよく機能するか、どの条件下で機能するかを決定する能力に依存する。
しかし、再現性や臨床的に有意な評価タスクの定義が困難であることから、このような進歩は妨げられていると考えられる。
共有評価フレームワークに12の歴史的および最近のアルゴリズムを再実装し、MIMIC-IVとNWICUの2つの臨床データセット上で評価することにより、これらの障壁を実証研究する。
臨床に有意義なタスクを専門とする2つの補完的タスクファミリと、ランダムにサンプリングされたイベントコードと予測地平線から定義されたタスクを比較検討した。
我々は,タスクファミリとデータセット間の相対アルゴリズムの比較,残余タスクの不均一性が有用な方法論構造を含むか否か,そして過去10年間の進捗について,制御された比較が示すものかどうかを問う。
その結果、ランダムに生成されたタスクから臨床的に意味のあるタスク、データセット間での相互比較は、評価設定間で強く伝達されることがわかった。
同時に、臨床的に有意義なタスクはタスクとメソッドの相互作用がより大きくなり、特定のモデリング選択が有利な場合にタスク特性が説明できるという予備的な証拠を提供する。
最後に、新しいアルゴリズムは、従来のアプローチを一貫して上回るものではない: 勾配木は、現代的、広範かつまばらな EHR 表現と組み合わせて、非常に競争力のあるままである。
これらの結果は、有用な方法論的知識は、一般的に想定されるよりもタスク工学を必要とせず、同時に、タスクやメソッドにまたがる構造的不均一性を理解することの重要性を強調している。
関連論文リスト
- TIDE-Bench: Task-Aware and Diagnostic Evaluation of Tool-Integrated Reasoning [14.200781347796307]
我々はツール統合推論手法を評価するための総合的で効率的なベンチマークであるTIDE-Benchを紹介する。
多様なタスク設定を提供し、広く使われている数学的推論と知識集約型QAタスクを2つの新しく設計されたタスクと組み合わせている。
第2に、TIDE-Benchは包括的なタスク対応評価プロトコルを採用し、最終回答の品質、プロセスの信頼性、ツール使用効率、推論コストを共同で測定する。
第3に、TIDE-Benchは、既存のデータセットから低識別インスタンスをフィルタリングすることで、高品質で差別的な評価セットを構築する。
論文 参考訳(メタデータ) (2026-05-10T13:56:46Z) - Machine Text Detectors are Membership Inference Attacks [55.07733196689313]
我々は,あるタスクに対してもともと開発された手法が,他方でどのように機能するかを理論的,実証的に検討する。
7つの最先端MIA法と5つの最先端マシンテキスト検出器を含む大規模実験は、クロスタスク性能において非常に強いランク相関(rho >)を示す。
この結果から,両研究コミュニティ間のクロスタスク意識とコラボレーションの必要性が示唆された。
論文 参考訳(メタデータ) (2025-10-22T11:39:01Z) - Efficient Task Grouping Through Samplewise Optimisation Landscape Analysis [23.177220600984665]
本稿では,既存の手法の圧倒的な計算要求を削減するための効率的なタスクグループ化フレームワークを提案する。
グラフベースのクラスタリングアルゴリズムを用いて、最適タスク群をピンポイントする。
8つの異なるデータセットで実施された実証的な評価は、提案フレームワークの有効性を強調している。
論文 参考訳(メタデータ) (2024-12-05T18:33:59Z) - Robust Analysis of Multi-Task Learning Efficiency: New Benchmarks on Light-Weighed Backbones and Effective Measurement of Multi-Task Learning Challenges by Feature Disentanglement [69.51496713076253]
本稿では,既存のMTL手法の効率性に焦点をあてる。
バックボーンを小さくしたメソッドの大規模な実験と,MetaGraspNetデータセットを新しいテストグラウンドとして実施する。
また,MTLにおける課題の新規かつ効率的な識別子として,特徴分散尺度を提案する。
論文 参考訳(メタデータ) (2024-02-05T22:15:55Z) - NEVIS'22: A Stream of 100 Tasks Sampled from 30 Years of Computer Vision
Research [96.53307645791179]
我々は,100以上の視覚的分類タスクのストリームからなるベンチマークであるNever-Ending VIsual-classification Stream (NEVIS'22)を紹介する。
分類に制限されているにもかかわらず、OCR、テクスチャ分析、シーン認識など、様々なタスクが生成される。
NEVIS'22は、タスクの規模と多様性のために、現在のシーケンシャルな学習アプローチに対して前例のない課題を提起している。
論文 参考訳(メタデータ) (2022-11-15T18:57:46Z) - Generalization bounds and algorithms for estimating conditional average
treatment effect of dosage [13.867315751451494]
本研究では,治療薬対の条件付き平均因果効果を観測データと仮定の組み合わせで推定する作業について検討した。
これは疫学や経済学など、意思決定のために治療薬対を必要とする分野における長年にわたる課題である。
この問題に対するいくつかのベンチマークデータセットに対して、実証的に新しい最先端のパフォーマンス結果を示す。
論文 参考訳(メタデータ) (2022-05-29T15:26:59Z) - Real-time landmark detection for precise endoscopic submucosal
dissection via shape-aware relation network [51.44506007844284]
内視鏡下粘膜下郭清術における高精度かつリアルタイムなランドマーク検出のための形状認識型関係ネットワークを提案する。
まず,ランドマーク間の空間的関係に関する先行知識を直感的に表現する関係キーポイント・ヒートマップを自動生成するアルゴリズムを考案する。
次に、事前知識を学習プロセスに段階的に組み込むために、2つの補完的な正規化手法を開発する。
論文 参考訳(メタデータ) (2021-11-08T07:57:30Z) - The Medical Segmentation Decathlon [37.44481677534694]
最先端の画像セグメンテーションアルゴリズムは、未確認のタスクで再訓練された場合、成熟し、正確で、一般化される。
一連のタスクにおける一貫した良いパフォーマンスは、以前は目に見えないタスクの異なるセットで、彼らの平均的なパフォーマンスを保った。
正確なAIセグメンテーションモデルのトレーニングは現在、非AI専門家にコモディティ化されている。
論文 参考訳(メタデータ) (2021-06-10T13:34:06Z) - Can Active Learning Preemptively Mitigate Fairness Issues? [66.84854430781097]
データセットバイアスは、機械学習における不公平な原因の1つです。
不確実性に基づくALで訓練されたモデルが保護クラスの決定において公平であるかどうかを検討する。
また,勾配反転(GRAD)やBALDなどのアルゴリズム的公正性手法の相互作用についても検討する。
論文 参考訳(メタデータ) (2021-04-14T14:20:22Z) - Multi-task Supervised Learning via Cross-learning [102.64082402388192]
我々は,様々なタスクを解くことを目的とした回帰関数の集合を適合させることで,マルチタスク学習と呼ばれる問題を考える。
我々の新しい定式化では、これらの関数のパラメータを2つに分けて、互いに近づきながらタスク固有のドメインで学習する。
これにより、異なるドメインにまたがって収集されたデータが、互いのタスクにおける学習パフォーマンスを改善するのに役立つ、クロス・ファーティライズが促進される。
論文 参考訳(メタデータ) (2020-10-24T21:35:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。