論文の概要: Screening of Biosecurity Features in Metagenomic Data with Evo 2 Probes
- arxiv url: http://arxiv.org/abs/2607.14070v1
- Date: Wed, 15 Jul 2026 17:38:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.852464
- Title: Screening of Biosecurity Features in Metagenomic Data with Evo 2 Probes
- Title(参考訳): Evo 2プローブを用いたメタゲノミクスデータのバイオセキュリティ特性のスクリーニング
- Abstract要約: Evo 2のようなゲノム基盤モデルは、リッチなシーケンス表現を学習するが、バイオセキュリティスクリーニングの価値はほとんど探索されていない。
凍結したEvo2層26の活性化に対して、最小限の線形および注意プローブを訓練することにより、これらの表現の中でどの程度のバイオセキュリティ関連信号が線形にアクセスできるかを問う。
保持されたメダゲノミクステストセット全体で、プローブは強い差別で抗菌抵抗を検出する。
- 参考スコア(独自算出の注目度): 35.18016233072556
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Genomic foundation models such as Evo 2 learn rich sequence representations, but their value for biosecurity screening is largely unexplored. We ask how much biosecurity-relevant signal is linearly accessible in these representations by training minimal linear and attention probes on frozen Evo 2 layer-26 activations, without fine-tuning the underlying model. Across held-out metagenomic test sets, the probes detect antimicrobial resistance (AMR) with strong discrimination: a linear probe reaches a region-level ROC-AUC of 0.888 (mean-pool), rising to 0.977 with a single-head attention probe. The probes resolve finer-grained AMR drug-class subcategories and separate them from unrelated functional genes, providing additional evidence that the learned signal is not explained solely by generic functional-gene status. Bacterial virulence is also decodable, though more weakly (region-level ROC-AUC 0.833). The AMR probe retains comparable ranking performance on simulated short reads without retraining, enabling evaluation before assembly in settings where assembly is computationally costly or unreliable. It achieves a read-level ROC-AUC of 0.898 (mean-pool), comparable to the mean-pooled full-region result. Within SynGenome, AMR-associated prompt labels are only weakly recoverable from Evo 1.5-generated sequences; these prompt-derived labels do not establish the function of the generated response sequences. A complementary sparse-autoencoder analysis recovers interpretable resistance-associated features but proves less consistent than the supervised probes. Together, these results position lightweight embedding-based probes as a fast, inexpensive first-pass detection layer for metagenomic biosurveillance and map both strengths and current limits of the approach. This work was conducted as part of the AIxBio Hackathon 2026 hosted by BlueDot Impact, Apart Research, and Cambridge Biosecurity Hub.
- Abstract(参考訳): Evo 2のようなゲノム基盤モデルは、リッチなシーケンス表現を学習するが、バイオセキュリティスクリーニングの価値はほとんど探索されていない。
凍結したEvo 2層26の活性化に対して最小限の線形および注意プローブを訓練し, 基礎となるモデルを微調整することなく, 生体セキュリティ関連信号がどの程度リニアアクセス可能かを問う。
ホールドアウトされたメダゲノミクステストセット全体で、このプローブは強い差別で抗微生物抵抗(AMR)を検出し、線形プローブは0.888(平均プール)の領域レベルのLOC-AUCに到達し、単一ヘッドアテンションプローブで0.977まで上昇する。
これらのプローブは、よりきめ細かいAMR薬物クラスサブカテゴリを解決し、それらを無関係な機能的遺伝子から分離し、学習信号が一般的な機能的遺伝子状態によってのみ説明されないという追加の証拠を与える。
細菌の病原性も陰性であるが、より弱い(ROC-AUC 0.833)。
AMRプローブは、シミュレーションされたショートリード上での同等のパフォーマンスを維持し、アセンブリが計算的にコストがかかるか信頼性の低い設定でアセンブリの前に評価を可能にする。
ROC-AUCの読み出しレベルは0.898(平均プール)で、平均プールされたフルリージョンの結果に匹敵する。
SynGenome内では、AMR関連プロンプトラベルはEvo 1.5生成配列から弱い回復しかできないが、これらのプロンプト由来のラベルは生成された応答配列の機能を確立していない。
相補的なスパース・オートエンコーダ解析は、解釈可能な抵抗関連の特徴を回復するが、教師付きプローブよりも一貫性が低いことを証明している。
これらの結果は, 軽量埋込型プローブを, メタジノミックバイオサーベイランスのための高速で安価な第1パス検出層として位置づけ, アプローチの強度と現在の限界の両方をマッピングする。
この研究は、BlueDot Impact、Apart Research、Cambridge Biosecurity Hubが主催するAIxBio Hackathon 2026の一部として実施された。
関連論文リスト
- MalariAI: A Label-Resilient Decoupled Framework for Universal Cell Segmentation and Explainable Stage Classification in Dense Malaria Blood Smears [0.0]
血液スミア顕微鏡によるマラリアの診断は、グローバルヘルスAIにとって重要な課題である。
3つの複合的障害モードは、既存のディープラーニングシステムの信頼性の高い臨床展開を防ぐ。
統一パイプラインにおける3つの障害モードすべてに対処する、2段階の分離フレームワークであるMarariAIを紹介します。
論文 参考訳(メタデータ) (2026-07-01T03:27:04Z) - An iterative energy-based multimodal transformer for joint retrieval of wheat soil moisture, leaf area index, and plant height from Sentinel-1 and Sentinel-2 time series [1.86672057283442]
iEBTは共有シーケンス内にマルチモーダル予測器を埋め込み、初期状態推定を生成し、ターゲット[SM, LAI, PH]ベクトルを反復的に更新する。
Modality ablationsによると、Sentinel-1はSM検索を、Sentinel-2はLAIを、PHは複合的な構造・形態的シグネチャに依存している。
論文 参考訳(メタデータ) (2026-06-23T21:05:53Z) - Influence-Guided Symbolic Regression: Scientific Discovery via LLM-Driven Equation Search with Granular Feedback [56.69850045068714]
逐次的2段階プロセスとして方程式発見をフレーム化する方法である textitInfluence-Guided Regression (IGSR) を導入する。
LLM-SRBench, 薬理学的PKPDモデル, 疫学シミュレーション, 実世界のゲノムデータなど, IGSRの有効性を示す。
論文 参考訳(メタデータ) (2026-05-27T23:48:01Z) - scHelix: Asymmetric Dual-Stream Integration via Explicit Gene-Level Disentanglement [84.88065404629079]
scHelixは、機能がどのように処理されるかを根本的に変更するデータセット適応フレームワークである。
scHelixは、停止段階のグラフキャッシュを備えたデュアルストリームスパース拡散エンコーダを使用する。
scHelixは最先端のメソッドより優れています。
論文 参考訳(メタデータ) (2026-05-18T15:55:13Z) - Rethinking Molecular OOD Generalization via Target-Aware Source Selection [10.102858221967791]
SCOPE-BENCHは、明示的な物理化学的記述空間におけるクラスタレベルのパーティショニングに基づいて構築されたベンチマークである。
POMAは、知識伝達を検索-合成-適応パイプラインとして定式化するフレームワークである。
SCOPE-BENCHにおける最先端の3D分子モデルの予測誤差は平均5.9倍である。
論文 参考訳(メタデータ) (2026-05-13T16:09:46Z) - Multitask Multimodal Fusion with Tabular Foundation Models for Peak and Durability Prediction of Pertussis Booster Response [0.0]
Pertussis booster vaccination(英語版)は、ピーク等級と長期の耐久性の両方において、個体間で広く異なる免疫反応を産生する。
ほとんどの計算モデルは1つしか目標とせず、完全なブースト・アンド・ワン軌道を欠いている。
2つのエンドポイントは冗長ではなく生物学的に分離されているため、両方を共同で予測することは自明ではない。
論文 参考訳(メタデータ) (2026-05-13T01:00:50Z) - Suppressing Prior-Comparison Hallucinations in Radiology Report Generation via Semantically Decoupled Latent Steering [94.37535002230504]
本研究では,Semantically Decoupled Latent Steeringと呼ばれる学習自由な推論時間制御フレームワークを開発した。
提案手法は,大言語モデル (LLM) による意味分解による意味のない介入ベクトルを構築する。
本手法は歴史的幻覚の可能性を著しく低下させることを示す。
論文 参考訳(メタデータ) (2026-02-27T04:49:01Z) - Microelectrode Signal Dynamics as Biomarkers of Subthalamic Nucleus Entry on Deep Brain Stimulation: A Nonlinear Feature Approach [0.0]
本稿では、非線形力学とエントロピーに基づくメトリクスを利用して、STN内外から記録された神経活動の分類を行うフレームワークを提案する。
本研究は,DBS手術中におけるリアルタイム・データ駆動意思決定支援における非線形・エントロピー信号記述子の可能性を明らかにするものである。
論文 参考訳(メタデータ) (2025-06-14T23:23:26Z) - SMILE-UHURA Challenge -- Small Vessel Segmentation at Mesoscopic Scale from Ultra-High Resolution 7T Magnetic Resonance Angiograms [60.35639972035727]
公開されている注釈付きデータセットの欠如は、堅牢で機械学習駆動のセグメンテーションアルゴリズムの開発を妨げている。
SMILE-UHURAチャレンジは、7T MRIで取得したTime-of-Flightアンジオグラフィーの注釈付きデータセットを提供することで、公開されている注釈付きデータセットのギャップに対処する。
Diceスコアは、それぞれのデータセットで0.838 $pm$0.066と0.716 $pm$ 0.125まで到達し、平均パフォーマンスは0.804 $pm$ 0.15までになった。
論文 参考訳(メタデータ) (2024-11-14T17:06:00Z) - CovidDeep: SARS-CoV-2/COVID-19 Test Based on Wearable Medical Sensors
and Efficient Neural Networks [51.589769497681175]
新型コロナウイルス(SARS-CoV-2)がパンデミックを引き起こしている。
SARS-CoV-2の逆転写-ポリメラーゼ連鎖反応に基づく現在の試験体制は、試験要求に追いついていない。
我々は,効率的なDNNと市販のWMSを組み合わせたCovidDeepというフレームワークを提案する。
論文 参考訳(メタデータ) (2020-07-20T21:47:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。