論文の概要: Score Distributions, Not Cells: Evaluating Single-Cell Perturbations Under Class Overlap
- arxiv url: http://arxiv.org/abs/2607.04595v1
- Date: Mon, 06 Jul 2026 01:47:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.988911
- Title: Score Distributions, Not Cells: Evaluating Single-Cell Perturbations Under Class Overlap
- Title(参考訳): 細胞ではなくスコア分布:クラスオーバーラップ下での単セル摂動の評価
- Authors: Youssef Marrakchi, Davide D'Ascenzo, Sebastiano Cultrera di Montesano,
- Abstract要約: 2つの摂動によって異なる細胞の集団が生成され、同時に個々の細胞がどちらの細胞に属しているかが重なり合う。
セル毎の精度はモデルの品質よりもこの重複を測定する。
この修正は、細胞によってではなく、全人口の摂動を評価することである。
- 参考スコア(独自算出の注目度): 0.09558392439655013
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Most classification problems assume the classes are roughly separable, so that an individual sample can usually be assigned to one class. Single-cell perturbation data violates this assumption: two perturbations can produce different populations of cells while overlapping so much that an individual cell could belong to either. Per-cell accuracy then measures this overlap rather than model quality. We see this on Tahoe-100M and the Virtual Cell Challenge, where a linear classifier, an MLP, and a Transformer all plateau near macro-F1 0.2-0.3 even though almost every pair of perturbations is statistically distinguishable. The fix is to score perturbations across the whole population rather than cell by cell. We average a classifier's per-cell probability vectors over all cells of a perturbation to form a population profile, then rank candidate perturbations by this profile; we call the resulting score the Classifier Discrimination Score (CDS). Taking the top-ranked class recovers the winning perturbation. It needs no retraining, costs linear time in the number of cells, and recovers near-perfect identification from the same weak models. CDS differs from the pseudobulk-based Perturbation Discrimination Score (PDS) used in recent benchmarks only in where the average is taken, raw gene expression for PDS versus a learned discriminative space for CDS, and identifies the true perturbation more reliably on both datasets, with the gap widening as cells grow scarce. Because a metric that misranks the ground truth will misrank the models scored against it, per-cell accuracy and raw-pseudobulk scores should be used with caution when comparing perturbation models.
- Abstract(参考訳): ほとんどの分類問題は、クラスが大まかに分離可能であると仮定するので、個々のサンプルは通常1つのクラスに割り当てられる。
単細胞摂動データは、この仮定に反する: 2つの摂動は異なる細胞の集団を生成できると同時に、個々の細胞がいずれの細胞にも属できるほど重複する。
セル毎の精度はモデルの品質ではなく、この重なり合いを測定する。
このことはTahoe-100MとVirtual Cell Challengeでは、ほとんど全ての摂動が統計的に区別可能であるにもかかわらず、線形分類器、MLP、トランスフォーマーがマクロF1 0.2-0.3の近傍にある。
この修正は、細胞によってではなく、全人口の摂動を評価することである。
我々は、摂動の全てのセル上の分類器のセルごとの確率ベクトルを平均化し、集団プロファイルを作成し、このプロファイルにより候補摂動をランク付けし、その結果のスコアを識別器判別スコア(CDS)と呼ぶ。
最上位クラスを制すると、勝利の混乱が回復する。
再訓練を必要とせず、細胞数に線形時間を要し、同じ弱いモデルからほぼ完璧な同定を回復する。
CDSは、最近のベンチマークで用いられる疑似バルクに基づく摂動判別スコア(PDS)と異なり、PDSの生遺伝子発現はCDSの学習的識別空間と異なり、両方のデータセットで真の摂動をより確実に識別し、細胞が成長するにつれてギャップが広がる。
基底の真理を誤る計量は、それに対して得られたモデルを誤るので、セル毎の精度と生の擬似バルクスコアは摂動モデルを比較する際に注意して使うべきである。
関連論文リスト
- PerturbCellRL: Verifier-Guided Reinforcement Learning for Single-Cell Perturbation Prediction [28.013973806760976]
単細胞摂動モデルは、細胞が介入にどのように反応するかを予測することによって、コストのかかるウェットラブスクリーニングを減らすことができる。
PerturbCellRLは、事前訓練された単細胞転写生成器をポストトレーニングする強化学習フレームワークである。
複数の遺伝的および化学的摂動ベンチマークを用いてPerturbCellRLを評価した。
論文 参考訳(メタデータ) (2026-06-26T06:15:04Z) - PerturbDiff: Functional Diffusion for Single-Cell Perturbation Modeling [32.464109652332915]
PerturbDiffは、個々の細胞から分布全体へモデリングをシフトする。
PerturbDiffは、単一セル応答予測における最先端のパフォーマンスを実現し、目に見えない摂動をはるかに良く一般化する。
論文 参考訳(メタデータ) (2026-02-23T10:28:56Z) - Departures: Distributional Transport for Single-Cell Perturbation Prediction with Neural Schrödinger Bridges [51.83259180910313]
遺伝子機能解析における大きなボトルネックは、単細胞データの未成熟の性質である。
我々は、SB(Schrdinger Bridge)を近似して、単セル摂動データに対処する。
本モデルは,異種単一セル応答を効果的に捉え,最先端の性能を実現する。
論文 参考訳(メタデータ) (2025-11-17T08:27:13Z) - Unlasting: Unpaired Single-Cell Multi-Perturbation Estimation by Dual Conditional Diffusion Implicit Bridges [68.98973318553983]
本稿では,Dual Diffusion Implicit Bridges (DDIB) に基づくフレームワークを提案する。
我々は、生物学的に意味のある方法で摂動シグナルを伝達するために遺伝子制御ネットワーク(GRN)情報を統合する。
また、サイレント遺伝子を予測し、生成したプロファイルの品質を向上させるためのマスキング機構も組み込んだ。
論文 参考訳(メタデータ) (2025-06-26T09:05:38Z) - Learnable Distribution Calibration for Few-Shot Class-Incremental
Learning [122.2241120474278]
FSCIL(Few-shot class-incremental Learning)は、古いクラス分布を記憶し、少数のトレーニングサンプルから新しいクラス分布を推定するという課題に直面している。
本稿では,これら2つの課題を統一フレームワークを用いて体系的に解決することを目的とした,学習可能な分布校正手法を提案する。
論文 参考訳(メタデータ) (2022-10-01T09:40:26Z) - The Cellwise Minimum Covariance Determinant Estimator [1.90365714903665]
そこで本研究では,MCD方式のセルワイド・ロバストなバージョンであるCellMCDを提案する。
セルワイド・アウトリーのシミュレーションでは良好に動作し、クリーンなデータに対する有限サンプル効率が高い。
実際のデータと結果の視覚化で示される。
論文 参考訳(メタデータ) (2022-07-27T12:33:51Z) - PLM: Partial Label Masking for Imbalanced Multi-label Classification [59.68444804243782]
長いラベルの分布を持つ実世界のデータセットで訓練されたニューラルネットワークは、頻繁なクラスに偏りがあり、頻繁なクラスでは不十分である。
本稿では,この比率を利用したPLM(Partial Label Masking)を提案する。
本手法は,マルチラベル (MultiMNIST と MSCOCO) とシングルラベル (CIFAR-10 と CIFAR-100) の2つの画像分類データセットにおいて,既存の手法と比較して高い性能を実現する。
論文 参考訳(メタデータ) (2021-05-22T18:07:56Z) - Red Blood Cell Segmentation with Overlapping Cell Separation and
Classification on Imbalanced Dataset [1.7219362335740878]
重なり合う細胞は、分類する前に複数の単一のRBCに分離しなければならない誤った予測結果を引き起こすことがある。
深層学習で複数のクラスを分類するためには、正常なサンプルが稀な疾患のサンプルよりも常に高いため、医療画像では不均衡の問題が一般的である。
本稿では,血液スミア画像から赤血球を分離・分類する新しい手法を提案する。
論文 参考訳(メタデータ) (2020-12-02T16:49:51Z) - Selective Classification Can Magnify Disparities Across Groups [89.14499988774985]
選択的分類は平均的精度を向上させることができるが、既存の精度格差を同時に増大させることができる。
禁忌の増大は、一部のグループでのアキュラシーを減少させることもある。
我々は,グループ間で類似のフルカバレッジ精度を実現する分散ロバストモデルを訓練し,選択分類が各グループを均一に改善することを示す。
論文 参考訳(メタデータ) (2020-10-27T08:51:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。