論文の概要: Instability in Patient Clustering: A Multiverse Analysis of Unsupervised Clustering in the CENTER-TBI cohort
- arxiv url: http://arxiv.org/abs/2609.08577v1
- Date: Tue, 08 Sep 2026 11:12:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 20:40:33.906723
- Title: Instability in Patient Clustering: A Multiverse Analysis of Unsupervised Clustering in the CENTER-TBI cohort
- Title(参考訳): 患者クラスタリングにおける不安定性:CENTER-TBIコホートにおける教師なしクラスタリングの多変量解析
- Authors: Sean R E A Bagcik, Aneeta Merlin Chacko, Ewout W Steyerberg, Maarten van Smeden, Andrew I R Maas, Erik van Zwet, Nicole S Erler,
- Abstract要約: 教師なしクラスタリングは、サブグループを定義する可能性がある患者の特性のパターンを探索するために広く用いられている。
本研究の目的は,これらの選択がクラスタリングソリューションにどのように影響するかを検討することである。
- 参考スコア(独自算出の注目度): 0.4592965637622503
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Understanding patient heterogeneity is key to improving prognostic modeling in traumatic brain injury (TBI). Unsupervised clustering is widely used to explore patterns in patient characteristics that may define subgroups. However, it involves a multitude of decisions, including the choice of algorithm, the distance metric, and the method used to determine the "optimal" number of clusters. The aim of this study is to investigate how these choices influence the resulting clustering solution. We analyzed data from 4,509 patients enrolled in the Collaborative European NeuroTrauma Effectiveness Research in TBI (CENTER-TBI) study. K-medoids, agglomerative, and spectral clustering were applied in a complete 3 X 2 X 2 factorial design, in combination with Euclidean or Gower's distances, and silhouette score or gap statistic to choose the number of clusters. We investigated the agreement of clustering solutions with UpSet Plots and stability with the (adjusted) Rand index. Comparisons were made both across approaches using the original dataset and within approaches using bootstrap resampling. Clustering results varied substantially depending on the analysis choices. The number of suggested clusters varied widely, from one to twenty-five. Adjusted Rand indices confirmed low concordance between methods. Moreover, none of the clustering solutions demonstrated discriminatory performance comparable to a supervised logistic regression model in classifying patient recovery illustrating the limited usefulness of clustering for this purpose. The high instability in clustering results compromises interpretability and underscores that such solutions should not be blindly interpreted as underlying structure.
- Abstract(参考訳): 患者の不均一性を理解することは、外傷性脳損傷(TBI)の予後モデリングを改善する鍵となる。
教師なしクラスタリングは、サブグループを定義する可能性がある患者の特性のパターンを探索するために広く用いられている。
しかし、アルゴリズムの選択、距離メートル法、クラスタの「最適」数を決定する方法など、多くの決定が伴う。
本研究の目的は,これらの選択がクラスタリングソリューションにどのように影響するかを検討することである。
TBI (CentER-TBI) 研究の欧州共同神経トラウマ効果研究に登録された4,509例のデータを分析した。
K-メロイド、凝集性、スペクトルクラスタリングは、ユークリッドまたはゴーワーの距離と組み合わせて完全な3 X 2 X 2因子設計に応用され、クラスタ数を選択するためにシルエットスコアまたはギャップ統計が得られた。
我々は、UpSet Plotsによるクラスタリングソリューションの一致と(調整された)Randインデックスによる安定性について検討した。
オリジナルのデータセットを使用したアプローチとブートストラップリサンプリングを使用したアプローチで比較を行った。
クラスタリングの結果は分析の選択によって大きく異なる。
提案されたクラスタの数は1から25まで様々であった。
調整されたRand指標は、メソッド間の低一致を確認した。
さらに、クラスタリングソリューションのいずれも、クラスタリングの限られた有用性を示す患者回復の分類において、教師付きロジスティック回帰モデルに匹敵する差別的性能を示さなかった。
クラスタリングにおける高い不安定性は、解釈可能性を損なうものであり、そのようなソリューションは、基盤となる構造として盲目的に解釈されるべきでないことをアンダースコアとして示している。
関連論文リスト
- Interpretable Clustering with the Distinguishability Criterion [0.4419843514606336]
本稿では,特定クラスタの分離可能性の定量化と推定クラスタ構成の検証を行うために,分散可能性基準と呼ばれるグローバルな基準を提案する。
本稿では、分散可能性基準と多くの一般的なクラスタリング手順を統合した損失関数に基づく計算フレームワークを提案する。
シミュレーション研究および実データアプリケーションに基づく包括的データ解析の結果とともに,これらの新しいアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-04-24T16:38:15Z) - Deep Embedding Clustering Driven by Sample Stability [16.53706617383543]
サンプル安定性(DECS)により駆動されるディープ埋め込みクラスタリングアルゴリズムを提案する。
具体的には、まずオートエンコーダで初期特徴空間を構築し、次にサンプル安定性に制約されたクラスタ指向の埋め込み機能を学ぶ。
5つのデータセットに対する実験結果から,提案手法は最先端のクラスタリング手法と比較して優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2024-01-29T09:19:49Z) - CLAMS: A Cluster Ambiguity Measure for Estimating Perceptual Variability
in Visual Clustering [23.625877882403227]
本稿では,クラスタアンビグニティ(Cluster Ambiguity)と呼ばれる視覚的クラスタリングを行う際の知覚的変動について検討する。
我々は,モノクローム散乱体におけるクラスタのあいまいさを自動的に予測する,データ駆動型視覚品質尺度であるCLAMSを紹介する。
論文 参考訳(メタデータ) (2023-08-01T04:46:35Z) - Revisiting Instance-Optimal Cluster Recovery in the Labeled Stochastic Block Model [85.51611950757643]
IAC (Instance-Adaptive Clustering, インスタンス適応クラスタリング) を提案する。
IACは$ MathcalO(n, textpolylog(n) $の計算複雑性を維持しており、大規模問題に対してスケーラブルで実用的なものである。
論文 参考訳(メタデータ) (2023-06-18T08:46:06Z) - A One-shot Framework for Distributed Clustered Learning in Heterogeneous
Environments [54.172993875654015]
異種環境における分散学習のためのコミュニケーション効率化手法のファミリーを提案する。
ユーザによるローカル計算に基づくワンショットアプローチと、サーバにおけるクラスタリングベースのアグリゲーションステップは、強力な学習保証を提供する。
厳密な凸問題に対しては,ユーザ毎のデータ点数がしきい値を超える限り,提案手法はサンプルサイズの観点から順序最適平均二乗誤差率を達成する。
論文 参考訳(メタデータ) (2022-09-22T09:04:10Z) - Optimal Clustering with Bandit Feedback [57.672609011609886]
本稿では,バンディットフィードバックを用いたオンラインクラスタリングの問題点について考察する。
これは、NPハード重み付きクラスタリング問題をサブルーチンとして解決する必要性を回避するための、シーケンシャルなテストのための新しい停止規則を含む。
合成および実世界のデータセットの広範なシミュレーションを通して、BOCの性能は下界と一致し、非適応的ベースラインアルゴリズムよりも大幅に優れることを示す。
論文 参考訳(メタデータ) (2022-02-09T06:05:05Z) - Scalable Hierarchical Agglomerative Clustering [65.66407726145619]
既存のスケーラブルな階層的クラスタリング手法は、スピードの質を犠牲にする。
我々は、品質を犠牲にせず、数十億のデータポイントまでスケールする、スケーラブルで集約的な階層的クラスタリング法を提案する。
論文 参考訳(メタデータ) (2020-10-22T15:58:35Z) - Blocked Clusterwise Regression [0.0]
我々は、各ユニットが複数の潜伏変数を持つことを可能にすることで、離散的非観測的不均一性に対する以前のアプローチを一般化する。
我々は,クラスタの過剰な数のクラスタリングの理論に寄与し,この設定に対する新たな収束率を導出する。
論文 参考訳(メタデータ) (2020-01-29T23:29:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。