論文の概要: When Does Deep Representation Learning Help Single-Cell Clustering? A Sensitivity-Aware Diagnostic Benchmark for Biomedical AI Pipelines
- arxiv url: http://arxiv.org/abs/2607.25288v1
- Date: Tue, 28 Jul 2026 04:48:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.714452
- Title: When Does Deep Representation Learning Help Single-Cell Clustering? A Sensitivity-Aware Diagnostic Benchmark for Biomedical AI Pipelines
- Title(参考訳): ディープ表現学習はシングルセルクラスタリングに役立つのか? バイオメディカルAIパイプラインの感度認識診断ベンチマーク
- Authors: Nguyen Thanh Phong, Truong Viet Vu, Nguyen Ha Thu, Tran An Ky, Tran Hoang Thong, Le Pham Thuy Hien, Nguyen Thai Anh,
- Abstract要約: 単細胞リボ核酸シークエンシング(scRNA-seq)は、精密医療のための基礎技術である。
追加の深層表現のステージは計算とチューニングのコストに価値があるだろうか?
この問題は、実際の10データセット上の9つのクラスタリングパイプラインの診断ベンチマークを用いて解決する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Single-cell ribonucleic acid sequencing (scRNA-seq) is a foundational technology for precision-medicine workflows that contribute to United Nations Sustainable Development Goal 3 on Good Health and Well-being, and unsupervised clustering is the analytical step that turns raw expression matrices into interpretable cell populations. Practitioners therefore face a recurring engineering decision: is an additional deep representation stage worth its compute and tuning cost, or do classical principal component analysis (PCA) pipelines already suffice? We address this question with a diagnostic benchmark of nine clustering pipelines on ten real datasets (90-5,685 cells, 19,046-41,480 genes, 4-11 cell types), augmented by a partial scVI V2 specialized comparison on seven datasets. The protocol integrates Optuna hyperparameter search, repeated-run robustness, Friedman/Wilcoxon-Holm/TOST testing, and Sobol total-order sensitivity analysis. The contrastive autoencoder achieved the highest mean Adjusted Rand Index (0.7872), but Holm-corrected tests did not establish dominance over the strongest baselines. Per-dataset analysis reveals three reproducible regimes: probabilistic variational autoencoder (VAE) variants help on the smallest datasets, deep autoencoders win on mid-scale data with multi-batch or many-type structure, and classical PCA pipelines remain competitive when linear projection already captures the dominant variation. Sobol indices identify learning rate ($S_T=0.70$) and latent dimensionality ($S_T=0.56$) as the dominant variance contributors, indicating where limited tuning budgets should be allocated. The contribution is therefore a dataset-aware and compute-conscious decision framework for biomedical AI pipelines supporting sustainable healthcare analytics, rather than a universal superiority claim.
- Abstract(参考訳): 単細胞リボ核酸シークエンシング(scRNA-seq)は、国連の健康と幸福に関する持続可能な開発目標3に貢献する精密医療ワークフローの基礎技術であり、教師なしクラスタリングは、生の表現行列を解釈可能な細胞集団に変換する分析段階である。
計算とチューニングのコストに価値はあるのか、それとも古典的な主成分分析(PCA)パイプラインはすでに十分だろうか?
我々は,10個の実データセット(90-5,685セル,19,046-41,480遺伝子,4-11セルタイプ)上の9つのクラスタリングパイプラインの診断ベンチマークを用いて,この問題に対処する。
このプロトコルは、Optunaハイパーパラメータ探索、繰り返しの堅牢性、Friedman/Wilcoxon-Holm/TOSTテスト、およびSobol全順序感度分析を統合している。
対照的なオートエンコーダはAdjusted Rand Index (0.7872) の最高値に達したが、ホルム補正テストは最強のベースラインに対する優位性を確立しなかった。
確率的変動オートエンコーダ(VAE)変種は最小のデータセットに役立ち、ディープオートエンコーダはマルチバッチまたは多型構造を持つ中規模データに勝利し、古典的なPCAパイプラインは線形射影が既に支配的な変動を捉えているときに競争力を維持する。
Sobol indicesは学習率(S_T=0.70$)と潜在次元(S_T=0.56$)を支配的な分散コントリビュータとして識別し、限られたチューニング予算を割り当てるべき場所を示す。
このコントリビューションは、普遍的な優位性というよりも、持続可能な医療分析をサポートするバイオメディカルAIパイプラインのための、データセット対応で計算重視の意思決定フレームワークである。
関連論文リスト
- OncoTraj: a public benchmark for longitudinal resistance prediction in EGFR-mutant non-small-cell lung cancer on osimertinib [0.0]
OncoTraj は 813 EGFR変異 NSCLC 患者のオシメルチニブを服用する公的なベンチマークである。
OncoTrajは、3つのロックされたタスクを定義している。 (A) 固定12ヶ月の目印による進行のバイナリ分類、 (B) 日ごとの時間から最初の生産性の回帰、 (C) 支配的な抵抗機構の6つのクラス分類である。
論文 参考訳(メタデータ) (2026-06-09T17:33:24Z) - Adapting Foundation Models for Annotation-Efficient Adnexal Mass Segmentation in Cine Images [4.42778347374376]
超音波による近接性質量評価は、主観的解釈と重要なサーバ間変動によって妨げられることが多い、困難な臨床課題である。
本稿では,事前訓練されたDINOv3基盤視変換器バックボーンのロバストなセマンティクスを活かしたラベル効率のセグメンテーションフレームワークを提案する。
提案手法は,U-Net,U-Net++,DeepLabV3,MAnetなどの完全教師付きベースラインと比較して,最先端の性能を実現する。
論文 参考訳(メタデータ) (2026-04-09T09:48:50Z) - scBench: Evaluating AI Agents on Single-Cell RNA-seq Analysis [6.518767416778027]
scBenchは、scRNA-seqデータセットに由来する394の検証可能な問題のベンチマークである。
8つのフロンティアモデルのベンチマークデータによると、精度は29~53%で、強力なモデルタスクとモデルプラットフォーム相互作用がある。
論文 参考訳(メタデータ) (2026-02-09T03:20:31Z) - Linearized Optimal Transport for Analysis of High-Dimensional Point-Cloud and Single-Cell Data [45.87606039212519]
シングルセル技術は、細胞の高次元点雲を生成する。
各患者は単純なベクトルではなく不規則な点雲で表される。
線形最適輸送フレームワークを用いて不規則点雲を固定次元ユークリッド空間に埋め込む。
論文 参考訳(メタデータ) (2025-10-24T21:33:12Z) - Enhanced ECG Arrhythmia Detection Accuracy by Optimizing Divergence-Based Data Fusion [5.575308369829893]
ケルネル密度推定(KDE)とクルバック・リーブラー(KL)の発散を利用した特徴量に基づく融合アルゴリズムを提案する。
健常者2000名, 病人2000名から収集した心電図による社内データセットを用いて, PTB-XLデータセットを用いて本手法の検証を行った。
その結果, 本手法は, 統合データセットにおける異常心電図症例の特徴に基づく分類精度を大幅に向上させることを示した。
論文 参考訳(メタデータ) (2025-03-19T12:16:48Z) - Towards a Benchmark for Colorectal Cancer Segmentation in Endorectal Ultrasound Videos: Dataset and Model Development [59.74920439478643]
本稿では,多様なERUSシナリオをカバーする最初のベンチマークデータセットを収集し,注釈付けする。
ERUS-10Kデータセットは77の動画と10,000の高解像度アノテートフレームで構成されています。
本稿では,ASTR (Adaptive Sparse-context TRansformer) という大腸癌セグメンテーションのベンチマークモデルを提案する。
論文 参考訳(メタデータ) (2024-08-19T15:04:42Z) - Improved Robustness for Deep Learning-based Segmentation of Multi-Center Myocardial Perfusion MRI Datasets Using Data Adaptive Uncertainty-guided Space-time Analysis [0.24285581051793656]
灌流データセットの完全な自動解析により、患者のストレス/レスト研究の迅速かつ客観的な報告が可能になる。
トレーニングデータやソフトウェアやハードウェアのバリエーションが限られているにもかかわらず、マルチセンタデータセットを分析できるディープラーニング技術は、現在進行中の課題である。
提案したDAUGS分析手法は,多心応力灌流データセットのセグメンテーションのためのディープラーニング手法の堅牢性を向上させる可能性を秘めている。
論文 参考訳(メタデータ) (2024-08-09T01:21:41Z) - Minimally Supervised Learning using Topological Projections in
Self-Organizing Maps [55.31182147885694]
自己組織化マップ(SOM)におけるトポロジカルプロジェクションに基づく半教師付き学習手法を提案する。
提案手法は,まずラベル付きデータ上でSOMを訓練し,最小限のラベル付きデータポイントをキーベストマッチングユニット(BMU)に割り当てる。
提案した最小教師付きモデルが従来の回帰手法を大幅に上回ることを示す。
論文 参考訳(メタデータ) (2024-01-12T22:51:48Z) - Generalizing electrocardiogram delineation: training convolutional
neural networks with synthetic data augmentation [63.51064808536065]
ECGのデライン化のための既存のデータベースは小さく、サイズやそれらが表す病態の配列に不足している。
まず、原データベースから抽出した基本セグメントのプールを与えられたECGトレースを確率的に合成し、その整合性のある合成トレースに配置するための一連のルールを考案した。
第二に、2つの新しいセグメンテーションに基づく損失関数が開発され、これは、正確な数の独立構造の予測を強制し、サンプル数の削減に焦点をあてて、より密接なセグメンテーション境界を創出することを目的としている。
論文 参考訳(メタデータ) (2021-11-25T10:11:41Z) - An Uncertainty-Driven GCN Refinement Strategy for Organ Segmentation [53.425900196763756]
本研究では,不確実性解析とグラフ畳み込みネットワークに基づくセグメンテーション改善手法を提案する。
半教師付きグラフ学習問題を定式化するために、特定の入力ボリュームにおける畳み込みネットワークの不確実性レベルを用いる。
本手法は膵臓で1%,脾臓で2%向上し,最先端のCRF改善法よりも優れていた。
論文 参考訳(メタデータ) (2020-12-06T18:55:07Z) - A Systematic Approach to Featurization for Cancer Drug Sensitivity
Predictions with Deep Learning [49.86828302591469]
35,000以上のニューラルネットワークモデルをトレーニングし、一般的な成果化技術を駆使しています。
RNA-seqは128以上のサブセットであっても非常に冗長で情報的であることがわかった。
論文 参考訳(メタデータ) (2020-04-30T20:42:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。