論文の概要: PlantBGC: Transformer for Plant BGC Discovery via Label-Free Domain Adaptation and Weak Supervision
- arxiv url: http://arxiv.org/abs/2607.27258v1
- Date: Wed, 29 Jul 2026 03:13:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.271526
- Title: PlantBGC: Transformer for Plant BGC Discovery via Label-Free Domain Adaptation and Weak Supervision
- Title(参考訳): PlantBGC: Label-free Domain AdaptationとWeak Supervisionによる植物BGC発見用トランスフォーマ
- Abstract要約: MIBiG菌BGCで訓練されたエンコーダのみのトランスフォーマーを用いて、ゲノムを秩序づけられたPfamドメイン配列として表現し、BGC様の学習を行う。
微生物のベンチマークでは、PlantBGCはトークンレベルAUC = 0.988(10倍CV)と0.979(リーブクラスアウト)を達成する。
植物において、適応は、厳密な100%のカバレッジで、n = 34のキュレートされたローチの既知のBGC回復を改善する。
- 参考スコア(独自算出の注目度): 7.101237028296392
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Plant biosynthetic gene clusters (BGCs) encode specialized-metabolite pathways, yet curated plant BGC labels remain scarce, hindering supervised discovery at genome scale. Existing plant BGC mining tools are largely signature- and rule-driven and do not fully leverage recent advances in contextual representation learning for modeling long-range domain context and controlling false positives under strong domain shift. We seek an AI-assisted workflow that narrows experimental search space by transferring supervision from well-annotated microbial BGCs to plant genomes. We present PlantBGC, representing genomes as ordered Pfam-domain sequences and learning BGC-likeness with an encoder-only Transformer trained on MIBiG microbial BGCs and adapted to plants via label-free masked language modeling. On microbial benchmarks, PlantBGC achieves token-level AUC = 0.988 (10-fold CV) and 0.979 (leave-class-out). On plants, adaptation improves known-BGC recovery on n = 34 curated loci under strict 100% coverage, increasing recovery from 29.4% to 67.6% and indicating more complete boundaries. GO/KEGG-derived weak supervision reduces proxy primary-like ratio by 48.40% (GO) and 45.20% (KEGG), with consistent per-species reductions (paired Wilcoxon p = 1.53e-5). Compared to plantiSMASH, PlantBGC yields more compact loci on matched regions (median length ratio = 0.278; 93.8% of pairs are shorter).
- Abstract(参考訳): 植物生合成遺伝子クラスター(BGC)は、特殊な代謝産物経路をコードするが、培養された植物BGCラベルは乏しいままであり、ゲノムスケールでの観察を妨げている。
既存のBGCマイニングツールは、主にシグネチャとルール駆動であり、長距離ドメインコンテキストのモデリングや強いドメインシフトの下で偽陽性を制御するために、コンテキスト表現学習の最近の進歩を十分に活用していない。
我々は、よく注釈された微生物BGCから植物ゲノムへの監督を移すことで、実験的な検索空間を狭めるAI支援ワークフローを模索する。
そこで本研究では,MIBiG 微生物 BGC で訓練されたエンコーダのみのトランスフォーマーを,ラベルのないマスク付き言語モデルにより植物に適応させることにより,ゲノムを秩序づけられたPfamドメイン配列として表現し,BGC様の学習を行う。
微生物のベンチマークでは、PlantBGCはトークンレベルのAUC = 0.988(10倍CV)と0.979(リーブクラスアウト)を達成する。
植物において、適応は、厳密な100%のカバレッジでn = 34のキュレートされたローシの既知のBGC回復を改善し、29.4%から67.6%に回復し、より完全な境界を示す。
GO/KEGG由来の弱い監督は、プロキシプライマリの比率を48.40%(GO)と45.20%(KEGG)に減らし、一貫した種ごとの減少(Wilcoxon p = 1.53e-5)を行う。
plantiSMASHと比較すると、PlantBGCはマッチした領域でよりコンパクトな座位を得る(中間長比 = 0.278; 93.8%は短い)。
関連論文リスト
- BioM-JEPA: joint-embedding prediction of graph-connected gene blocks in single cells [64.21963170814706]
BioM-JEPAはグラフ接続された遺伝子ブロックの集合表現を予測する。
学生ネットワークは、細胞内の残りの遺伝子から各ターゲットブロック表現を推論する。
CellBenchタスク全体で、BioM-JEPA埋め込みは発現、経路、および周辺情報を保持している。
論文 参考訳(メタデータ) (2026-08-06T11:58:29Z) - LLMBDC: Language Model for Biological Domains Oriented Clustering of Gene Ontology [9.988332501423043]
遺伝子オントロジー(GO)エンリッチメント分析は、大規模ゲノムデータを生物学的知見に翻訳するための基礎的なツールである。
既存の要約ツールは、固定された類似度メトリクスに依存している。
GO用語を解釈可能な高階生物ドメインにクラスタリングするには、スケーラブルでコンテキスト対応のフレームワークが必要である。
論文 参考訳(メタデータ) (2026-07-30T19:29:22Z) - Calibrated Tree-Neural Fusion for Fine-Grained Vegetation Community Classification [5.365444289459681]
Calibrated EcoTreeFuseNet-Plusはツリーニューラル確率融合フレームワークである。
提案したモデルでは精度0.8000、マクロF1スコア0.7768、バランス精度0.7903、MCC0.7903が達成された。
その結果,小さめ,きめ細かい生態分類のための信頼性の高い識別・校正トレードオフが示された。
論文 参考訳(メタデータ) (2026-07-27T08:37:49Z) - Screening of Biosecurity Features in Metagenomic Data with Evo 2 Probes [35.18016233072556]
Evo 2のようなゲノム基盤モデルは、リッチなシーケンス表現を学習するが、バイオセキュリティスクリーニングの価値はほとんど探索されていない。
凍結したEvo2層26の活性化に対して、最小限の線形および注意プローブを訓練することにより、これらの表現の中でどの程度のバイオセキュリティ関連信号が線形にアクセスできるかを問う。
保持されたメダゲノミクステストセット全体で、プローブは強い差別で抗菌抵抗を検出する。
論文 参考訳(メタデータ) (2026-07-15T17:38:02Z) - StruMPL: Multi-task Dense Regression under Disjoint Partial Supervision and MNAR Labels [0.25241093712112367]
地球観測による森林表層バイオマス(AGB)の推定は、2つの構造的非互換なラベル源を組み合わせたものである。
我々はこれをMNARラベルとマルチタスク間物理的制約との不均一な解離部分監督の下でのマルチタスク密度回帰として定式化する。
我々は,損失を拘束しながらIPW重み付き定常点を回復するためには,共同最適化が必要であることを解析的かつ実証的に示す。
論文 参考訳(メタデータ) (2026-05-19T14:51:12Z) - GGBound: A Genome-Grounded Agent for Microbial Life-Boundary Prediction [16.245500767957697]
微生物株の生理的生活境界を特徴付けることは、バイオテクノロジーと生態学の中心である。
既存の計算手法では、生理的特性を独立した教師対象として扱うか、または静的エンコーダとして生物学的基礎モデルを扱う。
微生物のライフバウンダリ予測を統合ゲノム・生理的タスクとして定式化し,ツール拡張LDMエージェントで処理する。
論文 参考訳(メタデータ) (2026-05-14T06:37:55Z) - BAWSeg: A UAV Multispectral Benchmark for Barley Weed Segmentation [31.004130414489698]
そこで本研究では,2ストリーム分割ネットワークをネイティブ解像度で,放射能キューと正規化インデックスキューとを融合する。
植生インデックスとスペクトルアテンションは、植生インデックスマップの窓付き自己アテンションで動作する。
植生指数と分光アテンションは75.6%のmIoUと63.5%の雑草IoUを22.8Mパラメータで達成し、多スペクトルのSegFormer-B1ベースラインを1.2mIoUと1.9の雑草IoUで上回っている。
論文 参考訳(メタデータ) (2026-03-02T14:49:05Z) - Inferring Clinically Relevant Molecular Subtypes of Pancreatic Cancer from Routine Histopathology Using Deep Learning [30.979270201588236]
PDACの基底型および古典型TCGへの分子置換は予後および予測値を確立している。
本稿では,標準的なH&E染色WSIから直接治療関連分子サブタイプを予測する,解釈可能なディープラーニングフレームワークであるPanSubNetを紹介する。
PanSubNetは2つの多施設コホートにまたがる1,055人のデータを用いて開発された。
論文 参考訳(メタデータ) (2026-01-06T20:52:12Z) - Learning ON Large Datasets Using Bit-String Trees [0.0]
この論文は類似性保存ハッシュ、分類、がんゲノム学の計算方法を発展させている。
Inverted hash table (ComBI) の圧縮BSTを導入する。
GRAFとComBIは,がん患者の生存率のスケーラブルな予測を可能にするサンプル単位の分類可能性の推定に有効であることを示す。
論文 参考訳(メタデータ) (2025-08-23T16:49:42Z) - FGBERT: Function-Driven Pre-trained Gene Language Model for Metagenomics [46.189419603576084]
FGBERTは、タンパク質に基づく遺伝子表現を文脈認識トークン化剤として利用する、新しいメダゲノミクス事前訓練モデルである。
これは、遺伝子、機能、細菌、環境レベルにまたがる4つのレベルでのメダゲノミクスデータセットに優れた性能を示す。
論文 参考訳(メタデータ) (2024-02-24T13:13:17Z) - Graph Neural Networks for Microbial Genome Recovery [64.91162205624848]
本稿では,グラフニューラルネットワーク(GNN)を用いて,メダゲノミクスビニングのためのコンティグ表現を学習する際のアセンブリグラフを活用することを提案する。
提案手法であるVaeG-Binは,個々のコンティグの潜在表現を学習するための変分オートエンコーダと,アセンブリグラフ内のコンティグの近傍構造を考慮したGNNを組み合わせる。
論文 参考訳(メタデータ) (2022-04-26T12:49:51Z) - Cancer Gene Profiling through Unsupervised Discovery [49.28556294619424]
低次元遺伝子バイオマーカーを発見するための,新しい,自動かつ教師なしのフレームワークを提案する。
本手法は,高次元中心型非監視クラスタリングアルゴリズムLP-Stabilityアルゴリズムに基づく。
私達の署名は免疫炎症および免疫砂漠の腫瘍の区別の有望な結果報告します。
論文 参考訳(メタデータ) (2021-02-11T09:04:45Z) - Supporting supervised learning in fungal Biosynthetic Gene Cluster
discovery: new benchmark datasets [0.0]
二次代謝物の真菌生合成遺伝子クラスター(英: Fungal Biosynthetic Gene Clusters, BGCs)は、天然物を生成する遺伝子群である。
データ駆動型手法や確率的および教師あり学習法は,BGCの同定において検討されている。
我々は、教師付き学習を用いたBGC発見タスクを支援するために、新たに公開された真菌BGCデータセットを提案する。
論文 参考訳(メタデータ) (2020-01-09T23:47:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。