論文の概要: AnnotateMissense: a genome-wide annotation and benchmarking framework for missense pathogenicity prediction
- arxiv url: http://arxiv.org/abs/2605.24520v1
- Date: Sat, 23 May 2026 11:15:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:18.158081
- Title: AnnotateMissense: a genome-wide annotation and benchmarking framework for missense pathogenicity prediction
- Title(参考訳): AnnotateMissense:ミスセンス病原性予測のためのゲノムワイドアノテーションおよびベンチマークフレームワーク
- Authors: Muhammad Muneeb, David B. Ascher,
- Abstract要約: AnnotateMissenseは、ミスセンス変異解釈のためのスケーラブルなアノテーション、ベンチマーク、ゲノムワイド予測フレームワークである。
dbNSFP v5.1由来のhg38ミスセンス変異体をANNOVARアノテーション、転写/タンパク質記述子、AlphaMissenseスコア、ESM由来の特徴、保存測定値、人口頻度変数、確立された病原性予測因子、工学化されたアミノ酸/コドン標識特徴と統合する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Missense variant interpretation remains challenging because pathogenicity depends on heterogeneous evidence from population frequency, evolutionary conservation, transcript context, amino acid substitution severity, prior pathogenicity predictors and protein-language-model-derived features. We present AnnotateMissense, a scalable annotation, benchmarking and genome-wide prediction framework for missense variant interpretation. AnnotateMissense integrates hg38 missense variants derived from dbNSFP v5.1 with ANNOVAR annotations, dbNSFP transcript/protein descriptors, AlphaMissense scores, ESM-derived features, conservation metrics, population-frequency variables, established pathogenicity predictors and engineered amino acid/codon-context features. Using 132,714 ClinVar-labelled missense variants, we benchmarked machine-learning and deep-learning models under controlled feature configurations. The full 303-feature benchmark set achieved the strongest performance with XGBoost, reaching mean MCC = 0.9411 and ROC-AUC = 0.9950 across stratified five-fold cross-validation. Restricted naive and location-oriented feature sets achieved lower best MCC values of 0.4989 and 0.5113, respectively. Circularity-controlled ablations showed that removing prior-predictor, population-frequency and clinically overlapping evidence reduced performance, whereas excluding AlphaMissense and ESM-derived features alone had minimal effect. Temporal ClinVar validation on newly observed pathogenic/benign variants achieved MCC = 0.7613, accuracy = 0.8798 and F1-score = 0.8750. The final model was applied to 90,643,830 hg38 missense variants to generate AnnotateMissense pathogenicity scores and binary prediction labels. Code and outputs are available at https://github.com/MuhammadMuneeb007/CAGI7_Annotate_All_Missense and https://doi.org/10.5281/zenodo.19981867.
- Abstract(参考訳): 病原性は、集団頻度、進化保存、転写コンテキスト、アミノ酸置換の重症度、先行病原性予測因子、タンパク質言語由来の特徴など、異質な証拠に依存しているため、未分化の解釈は依然として困難である。
提案するAnnotateMissenseは、スケーラブルなアノテーション、ベンチマーク、ミスセンス変異解釈のためのゲノムワイド予測フレームワークである。
AnnotateMissenseは、dbNSFP v5.1から派生したhg38ミスセンス変異体を、ANNOVARアノテーション、dbNSFP転写/タンパク質記述子、AlphaMissenseスコア、ESM由来の特徴、保存指標、集団変数変数、確立された病原性予測子、エンジニア付きアミノ酸/コドンコンテキスト特徴と統合する。
132,714個のClinVarラベリングミスセンスモデルを用いて、制御された特徴構成の下で機械学習モデルとディープラーニングモデルをベンチマークした。
フル303機能ベンチマークセットはXGBoostで最強のパフォーマンスを達成し、階層化された5倍のクロスバリデーションで平均MCC = 0.9411、ROC-AUC = 0.9950に達した。
制限されたナイーブと位置指向の特徴セットはそれぞれ0.4989と0.5113の最も低いMCC値を得た。
サーキュラリティコントロールによるアブリゲーションでは, 事前予測, 人口頻度, 臨床上重複する証拠の除去が性能を低下させる一方, AlphaMissense と ESM 由来の特徴を除くと, 効果は最小であった。
MCC = 0.7613、精度 = 0.8798、F1スコア = 0.8750 に達した。
最終モデルは90,643,830 hg38のミスセンス変種に適用され、AnnotateMissense病原性スコアとバイナリ予測ラベルを生成する。
コードと出力はhttps://github.com/MuhammadMuneeb007/CAGI7_Annotate_All_Missenseとhttps://doi.org/10.5281/zenodo.19981867で入手できる。
関連論文リスト
- NeuroFlake: A Neuro-Symbolic LLM Framework for Flaky Test Classification [0.0]
同じバージョンのコードに対して非決定論的パス/フェイル動作を示す、不安定なテストは、信頼できる回帰テストに重大な課題を生じさせる。
我々は,現実世界のデータセット上でフレキテストの分類を行う新しいニューロ・シンボリック・フレームワークであるNeuroFlakeを紹介する。
論文 参考訳(メタデータ) (2026-05-12T03:56:40Z) - Suppressing Prior-Comparison Hallucinations in Radiology Report Generation via Semantically Decoupled Latent Steering [94.37535002230504]
本研究では,Semantically Decoupled Latent Steeringと呼ばれる学習自由な推論時間制御フレームワークを開発した。
提案手法は,大言語モデル (LLM) による意味分解による意味のない介入ベクトルを構築する。
本手法は歴史的幻覚の可能性を著しく低下させることを示す。
論文 参考訳(メタデータ) (2026-02-27T04:49:01Z) - Conditional Random Fields for Interactive Refinement of Histopathological Predictions [20.862265116241716]
HistoCRFは条件付きランダムフィールド(CRF)のためのCRFベースのフレームワークである
ラベルの多様性を促進し、専門家のアノテーションを活用するペアワイズポテンシャルの新たな定義を提案する。
異なる臓器や疾患をカバーする5つのパッチレベルの分類データセットの実験では、アノテーションなしでの平均精度が16.4%、アノテーションがわずか100の27.5%向上した。
論文 参考訳(メタデータ) (2026-01-17T15:19:40Z) - Prostate-VarBench: A Benchmark with Interpretable TabNet Framework for Prostate Cancer Variant Classification [14.190646211771073]
VUS(Variants of Uncertain Significance)は前立腺癌ゲノムの臨床的有用性を制限する。
Prostate-VarBenchは、prostate固有のベンチマークを作成するための、キュレートされたパイプラインである。
論文 参考訳(メタデータ) (2025-11-12T06:13:50Z) - Uncertainty-Aware Genomic Classification of Alzheimer's Disease: A Transformer-Based Ensemble Approach with Monte Carlo Dropout [0.0]
アルツハイマー病(英語版) (AD) は遺伝学的に複雑であり、ゲノムデータも複雑である。
我々はモンテカルロ・ドロップアウトを用いた変圧器を用いたアンサンブルモデル(TrUENet)を開発した。
論文 参考訳(メタデータ) (2025-05-31T18:20:49Z) - CRTRE: Causal Rule Generation with Target Trial Emulation Framework [47.2836994469923]
ターゲットトライアルエミュレーションフレームワーク(CRTRE)を用いた因果ルール生成という新しい手法を提案する。
CRTREは、アソシエーションルールの因果効果を推定するためにランダム化トライアル設計原則を適用している。
次に、病気発症予測などの下流アプリケーションにそのような関連ルールを組み込む。
論文 参考訳(メタデータ) (2024-11-10T02:40:06Z) - STAR Loss: Reducing Semantic Ambiguity in Facial Landmark Detection [80.04000067312428]
本稿では,意味的あいまいさの特性を利用した自己適応型あいまいさ低減(STAR)の損失を提案する。
意味的あいまいさは異方性予測分布をもたらすことが分かり、予測分布を用いて意味的あいまいさを表現する。
また,分布の異常変化とモデルの初期収束を回避できる2種類の固有値制限法を提案する。
論文 参考訳(メタデータ) (2023-06-05T10:33:25Z) - Variational Classification [51.2541371924591]
我々は,変分オートエンコーダの訓練に用いるエビデンスローバウンド(ELBO)に類似した,モデルの訓練を目的とした変分目的を導出する。
軟質マックス層への入力を潜伏変数のサンプルとして扱うことで, 抽象化された視点から, 潜在的な矛盾が明らかとなった。
我々は、標準ソフトマックス層に見られる暗黙の仮定の代わりに、選択された潜在分布を誘導する。
論文 参考訳(メタデータ) (2023-05-17T17:47:19Z) - Assessing putative bias in prediction of anti-microbial resistance from
real-world genotyping data under explicit causal assumptions [3.795323061432507]
サンプリングが非ランダム化されているため、AMR予測ツールの開発にはバイアスがかかる。
遺伝子型・フェノタイプAMRデータを用いたAMR予測における確率に基づく再バランスと共起調整の有効性を評価した。
論文 参考訳(メタデータ) (2021-07-06T21:19:21Z) - Unlabelled Data Improves Bayesian Uncertainty Calibration under
Covariate Shift [100.52588638477862]
後続正則化に基づく近似ベイズ推定法を開発した。
前立腺癌の予後モデルを世界規模で導入する上で,本手法の有用性を実証する。
論文 参考訳(メタデータ) (2020-06-26T13:50:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。