論文の概要: Beyond Gene Reconstruction: Learning Cell Representations through Complementary Transcriptomic Views
- arxiv url: http://arxiv.org/abs/2608.00985v1
- Date: Sun, 02 Aug 2026 04:35:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.04445
- Title: Beyond Gene Reconstruction: Learning Cell Representations through Complementary Transcriptomic Views
- Title(参考訳): 遺伝子再構成を超えて:相補的転写学的視点による細胞表現の学習
- Abstract要約: 相補的な転写学的な視点から細胞表現を学習する対照的な事前学習フレームワークを提案する。
本研究では,共同発現誘導遺伝子パーティショニング,表現認識コントラストセット構築,コントラストオンセットという3次元の具体的適応を導入する。
- 参考スコア(独自算出の注目度): 8.738986684868424
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The rapid growth of single-cell transcriptomic data has enabled the development of foundation models pretrained primarily by reconstructing masked expression values. This objective encourages these models to learn gene dependencies but does not directly optimize whole-cell representations, which are essential for many downstream tasks. To bridge this gap, we propose a contrastive pretraining framework that learns cell representations through complementary transcriptomic views. Since standard contrastive learning is not readily applicable to single-cell pretraining, we introduce specific adaptations along three dimensions --- co-expression-guided gene partitioning, expression-aware contrast-set construction, and competence-gated contrastive onset. Specifically, we first construct two complementary views of each cell by partitioning its genes according to their co-expression structure. Then, to prevent the model from using gene-set identity as a shortcut, we construct hard negatives by permuting expression values while keeping gene identities unchanged. Finally, we introduce a competence-aware controller to determine how the contrastive objective is applied. Experiments on cell-type annotation and gene regulatory network inference demonstrate competitive transfer under the evaluated protocols. In the six-network GRN evaluation, our method records the highest mean AUROC and AUPRC point estimates among the compared variants, while the highest-scoring variant differs across individual networks. These results establish complementary-view contrastive learning as an effective direction for single-cell pretraining beyond gene reconstruction.
- Abstract(参考訳): 単細胞転写データの急速な成長により、主にマスク付き表現値の再構成によって事前訓練された基礎モデルの開発が可能となった。
この目的は、これらのモデルが遺伝子依存を学習することを奨励するが、多くの下流タスクに不可欠な全セル表現を直接最適化しない。
このギャップを埋めるために、相補的な転写学的な視点を通して細胞表現を学習する対照的な事前学習フレームワークを提案する。
標準コントラスト学習は単細胞事前学習では容易には適用できないため,共同発現誘導遺伝子パーティショニング,表現認識コントラストセット構築,コントラストオンセットという3次元の具体的適応を導入する。
具体的には、まず、その遺伝子をその共発現構造に従って分割することで、各細胞の2つの相補的なビューを構築する。
そして,遺伝子組のアイデンティティをショートカットとして使用するのを防ぐために,遺伝子同一性を保ちつつ,表現値を置換して強陰性を構築する。
最後に,コントラスト目的の適用方法を決定するために,コントラスト対応コントローラを導入する。
細胞型アノテーションと遺伝子制御ネットワーク推論の実験は、評価されたプロトコルの下での競合移動を示す。
提案手法は, 比較した変種のうち, AUROC と AUPRC の点推定値の平均を最大に記録する一方, 最上位の変種は各ネットワーク間で異なる。
これらの結果から, 相補的な視点によるコントラクティブ・ラーニングが, 遺伝子再構成以上の単細胞事前学習の有効な方向として確立された。
関連論文リスト
- BioM-JEPA: joint-embedding prediction of graph-connected gene blocks in single cells [64.21963170814706]
BioM-JEPAはグラフ接続された遺伝子ブロックの集合表現を予測する。
学生ネットワークは、細胞内の残りの遺伝子から各ターゲットブロック表現を推論する。
CellBenchタスク全体で、BioM-JEPA埋め込みは発現、経路、および周辺情報を保持している。
論文 参考訳(メタデータ) (2026-08-06T11:58:29Z) - DUET: Dual-Paradigm Adaptive Expert Triage with Single-cell Inductive Prior for Spatial Transcriptomics Prediction [6.028508407069093]
組織像から空間的に解決された遺伝子発現を推定することは空間転写学に費用対効果をもたらす。
本稿では,パラメトリック予測とメモリベース検索を共役する新しいデュアルパラダイムフレームワークDUETを提案する。
論文 参考訳(メタデータ) (2026-05-13T20:43:29Z) - Prototype Guided Post-pretraining for Single-Cell Representation Learning [0.0]
遺伝子発現データからの単一細胞表現学習は、細胞機能の基礎となる複雑な制御ロジックを明らかにする手段を提供する。
遺伝子をトークンとして扱い、細胞を文として扱う、いくつかの単細胞事前訓練モデルが最近提案されている。
本稿では,単細胞基礎モデルの事前学習段階と微調整段階の間で動作するポストプレトレーニング手法であるCellRefineを紹介する。
論文 参考訳(メタデータ) (2026-05-08T16:08:10Z) - You Only Train Once: Differentiable Subset Selection for Omics Data [16.72884554628602]
YOTOは、独立した遺伝子サブセットを共同で識別し、単一の異なるアーキテクチャ内で予測を行うエンドツーエンドフレームワークである。
2つの代表的単一セルRNA-seqデータセット上でYOTOを評価し,最先端のベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2025-12-19T15:17:34Z) - Departures: Distributional Transport for Single-Cell Perturbation Prediction with Neural Schrödinger Bridges [51.83259180910313]
遺伝子機能解析における大きなボトルネックは、単細胞データの未成熟の性質である。
我々は、SB(Schrdinger Bridge)を近似して、単セル摂動データに対処する。
本モデルは,異種単一セル応答を効果的に捉え,最先端の性能を実現する。
論文 参考訳(メタデータ) (2025-11-17T08:27:13Z) - A Large-Scale Benchmark of Cross-Modal Learning for Histology and Gene Expression in Spatial Transcriptomics [8.854289521774483]
HESCAPEは空間転写学におけるクロスモーダルコントラスト事前学習の評価のためのベンチマークである。
空間転写学データに事前訓練された遺伝子モデルは、空間データや単純なベースラインアプローチなしで訓練された遺伝子よりも優れている。
バッチ効果は、効果的なクロスモーダルアライメントを阻害する重要な要因である。
論文 参考訳(メタデータ) (2025-08-02T21:11:36Z) - Unlasting: Unpaired Single-Cell Multi-Perturbation Estimation by Dual Conditional Diffusion Implicit Bridges [68.98973318553983]
本稿では,Dual Diffusion Implicit Bridges (DDIB) に基づくフレームワークを提案する。
我々は、生物学的に意味のある方法で摂動シグナルを伝達するために遺伝子制御ネットワーク(GRN)情報を統合する。
また、サイレント遺伝子を予測し、生成したプロファイルの品質を向上させるためのマスキング機構も組み込んだ。
論文 参考訳(メタデータ) (2025-06-26T09:05:38Z) - Language-Enhanced Representation Learning for Single-Cell Transcriptomics [27.33236345953242]
単細胞転写学における言語強化表現学習のための新しいフレームワークである scMMGPT を提案する。
scMMGPTは、ロバストな細胞表現抽出を採用し、定量的な遺伝子発現データを保存し、革新的な2段階事前学習戦略を導入する。
論文 参考訳(メタデータ) (2025-03-12T14:26:16Z) - UniGenX: a unified generative foundation model that couples sequence, structure and function to accelerate scientific design across proteins, molecules and materials [62.72989417755985]
自然系における関数の統一生成モデルUniGenXを提案する。
UniGenXはシンボルトークンと数値トークンの混合ストリームとして異種入力を表す。
ドメイン間のファンクション・アウェア・ジェネレーションに対して、最先端または競合的なパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-03-09T16:43:07Z) - Single-Cell Deep Clustering Method Assisted by Exogenous Gene
Information: A Novel Approach to Identifying Cell Types [50.55583697209676]
我々は,細胞間のトポロジ的特徴を効率的に捉えるために,注目度の高いグラフオートエンコーダを開発した。
クラスタリング過程において,両情報の集合を統合し,細胞と遺伝子の特徴を再構成し,識別的表現を生成する。
本研究は、細胞の特徴と分布に関する知見を高め、疾患の早期診断と治療の基礎となる。
論文 参考訳(メタデータ) (2023-11-28T09:14:55Z) - Rethinking Semi-Supervised Medical Image Segmentation: A
Variance-Reduction Perspective [51.70661197256033]
医用画像セグメンテーションのための階層化グループ理論を用いた半教師付きコントラスト学習フレームワークARCOを提案する。
まず、分散還元推定の概念を用いてARCOを構築することを提案し、特定の分散還元技術が画素/ボクセルレベルのセグメンテーションタスクにおいて特に有用であることを示す。
5つの2D/3D医療データセットと3つのセマンティックセグメンテーションデータセットのラベル設定が異なる8つのベンチマークで、我々のアプローチを実験的に検証する。
論文 参考訳(メタデータ) (2023-02-03T13:50:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。