論文の概要: Coarse composition suffices: tabular in-context learning for multi-activity antimicrobial peptide profiling
- arxiv url: http://arxiv.org/abs/2608.30337v2
- Date: Sun, 06 Sep 2026 06:00:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 22:37:20.321121
- Title: Coarse composition suffices: tabular in-context learning for multi-activity antimicrobial peptide profiling
- Title(参考訳): 多能性抗菌ペプチドプロファイリングのための表型インコンテクスト学習法
- Authors: Anuj Pal, Raunak Kumar, Dhruvi Solanki, Parikshit Pareek, Juhi Singh, Jitin Singla,
- Abstract要約: 単純なシーケンスのみのパイプラインは、マルチモーダルな構造条件のディープモデルにマッチし、超えられることを示す。
ESCAPE (82,359 peptides; 5 labels)では、ラベル・パワーセットのTabPFNモデルがmAP-5 = 77.8%を達成する。
- 参考スコア(独自算出の注目度): 2.571440349338848
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Antimicrobial peptides (AMPs) often act against multiple pathogen classes, making multi-label activity prediction a more realistic screening target than binary antimicrobial classification. The ESCAPE benchmark formalizes this setting, but leading approaches typically rely on multimodal, structure-conditioned deep models that are costly to train and tune. We show that a simple, sequence-only pipeline can match and surpass these methods by combining 330 interpretable sequence descriptors with TabPFN, a tabular foundation model that performs in-context prediction in a single forward pass without gradient-based training or hyperparameter search. On ESCAPE (82,359 peptides; five labels), a label-powerset TabPFN model achieves mAP-5 = 77.8%, improving on the previously best reported 72.1%. A probabilistic classifier chain is the first method to match or exceed the best published average precision on each of the five labels simultaneously. The gains persist under the prior state-of-the-art single-fold training protocol, indicating they are not a training-set-size artefact, and are largest for remote homologues (+11.2 points below 30% sequence identity). Ablations further show that predicted structure is unnecessary at inference and that performance is not driven by any single descriptor family: ten global physicochemical scalars recover 91% of full-feature performance. Finally, explicitly modelling label dependence yields targeted benefits for scarce activities and supports ranking which activity to assay next from partial positive evidence.
- Abstract(参考訳): 抗微生物ペプチド(AMP)は、しばしば複数の病原体に対して作用し、二進的な抗菌分類よりもより現実的なスクリーニングターゲットとなる。
ESCAPEベンチマークは、この設定を形式化するが、主要なアプローチは通常、トレーニングとチューニングにコストがかかるマルチモーダルな構造条件のディープモデルに依存している。
330の解釈可能なシーケンス記述子とTabPFNを組み合わせることで、単純なシーケンスのみのパイプラインがこれらの手法と一致し、これらの手法を克服できることを示す。
ESCAPE (82,359 peptides; 5 labels)では、ラベル・パワーセットのTabPFNモデルがmAP-5 = 77.8%を達成する。
確率的分類器チェーンは、5つのラベルのそれぞれについて、最高の発行された平均精度を同時に一致または超える最初の方法である。
このゲインは、従来の最先端のシングルフォールドトレーニングプロトコルの下で継続され、トレーニングセットサイズのアーティファクトではなく、リモートホモログ(シーケンシャルアイデンティティの30%以下+11.2ポイント)で最大であることを示している。
さらにアブレーションは、予測された構造は推論時に不要であり、パフォーマンスは1つの記述子ファミリーによって駆動されないことを示している。
最後に、ラベル依存を明示的にモデル化することは、希少な活動に対する目標的利益をもたらし、部分的肯定的な証拠から次に判断する活動のランク付けをサポートする。
関連論文リスト
- Fine-Tuning Over Architectural Complexity: Broad-Coverage PII Detection on PIIBench with DeBERTa [0.0]
PII検出システムは、狭いソースまたはドメイン境界内で頻繁に訓練され、異種テキストにデプロイする場合のカバレッジを制限する。
我々は,10個のソースデータセットに82個の保持されたエンティティタイプにまたがる修正されたマルチソースPIIBenchのモデル微調整について検討した。
直接トークン分類の微調整,ソース条件付き階層モデル(SC+H),3段階のカリキュラム拡張(SC+H+Curr)の3つのアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-25T13:12:42Z) - Multitask Multimodal Fusion with Tabular Foundation Models for Peak and Durability Prediction of Pertussis Booster Response [0.0]
Pertussis booster vaccination(英語版)は、ピーク等級と長期の耐久性の両方において、個体間で広く異なる免疫反応を産生する。
ほとんどの計算モデルは1つしか目標とせず、完全なブースト・アンド・ワン軌道を欠いている。
2つのエンドポイントは冗長ではなく生物学的に分離されているため、両方を共同で予測することは自明ではない。
論文 参考訳(メタデータ) (2026-05-13T01:00:50Z) - PRIME: Prototype-Driven Multimodal Pretraining for Cancer Prognosis with Missing Modalities [86.63247982275396]
PRIMEは、欠落を認識したマルチモーダルな自己教師型事前トレーニングフレームワークである。
部分的に観察されたコホートから頑健で伝達可能な表現を学ぶ。
The Cancer Genome AtlasのPRIMEを32種類の癌に対してラベルフリープレトレーニングで評価した。
論文 参考訳(メタデータ) (2026-04-05T21:14:27Z) - Investigating Knowledge Distillation Through Neural Networks for Protein Binding Affinity Prediction [0.22369578015657954]
予測精度とデータ可用性のトレードオフにより、タンパク質結合親和性を正確に予測することは困難である。
学習中にタンパク質構造データを使用し,推論時にのみシーケンスデータを必要とする知識蒸留に基づく回帰フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-07T08:43:08Z) - FlowDock: Geometric Flow Matching for Generative Protein-Ligand Docking and Affinity Prediction [3.8366697175402225]
FlowDockは、非有界(アポ)構造をそれらの有界(ホロ)構造にマッピングすることを学ぶ最初の深部幾何学的生成モデルである。
FlowDockは、予測された構造的信頼度スコアと、生成したタンパク質-リガンド複合体構造とのアフィニティ値を提供する。
論文 参考訳(メタデータ) (2024-12-14T20:54:37Z) - Probably Approximately Precision and Recall Learning [60.00180898830079]
機械学習における重要な課題は、一方的なフィードバックの頻度である。
本稿では,確率的近似(PAC)フレームワークを導入し,各入力をラベルの集合にマッピングする仮説を定めている。
我々は、正のデータのみから学習する新しいアルゴリズムを開発し、実現可能な場合において最適なサンプル複雑性を実現する。
論文 参考訳(メタデータ) (2024-11-20T04:21:07Z) - Rethinking Classifier Re-Training in Long-Tailed Recognition: A Simple
Logits Retargeting Approach [102.0769560460338]
我々は,クラスごとのサンプル数に関する事前知識を必要とせず,シンプルなロジットアプローチ(LORT)を開発した。
提案手法は,CIFAR100-LT, ImageNet-LT, iNaturalist 2018など,様々な不均衡データセットの最先端性能を実現する。
論文 参考訳(メタデータ) (2024-03-01T03:27:08Z) - Self-Supervised Pretraining Improves Performance and Inference
Efficiency in Multiple Lung Ultrasound Interpretation Tasks [65.23740556896654]
肺超音波検査における複数分類課題に適用可能なニューラルネットワーク特徴抽出器を,自己指導型プレトレーニングで作成できるかどうかを検討した。
3つの肺超音波のタスクを微調整すると、事前訓練されたモデルにより、各テストセットの受信操作曲線(AUC)における平均クロスタスク面積は、それぞれ0.032と0.061に改善された。
論文 参考訳(メタデータ) (2023-09-05T21:36:42Z) - RanPAC: Random Projections and Pre-trained Models for Continual Learning [59.07316955610658]
継続学習(CL)は、古いタスクを忘れずに、非定常データストリームで異なるタスク(分類など)を学習することを目的としている。
本稿では,事前学習モデルを用いたCLの簡潔かつ効果的なアプローチを提案する。
論文 参考訳(メタデータ) (2023-07-05T12:49:02Z) - Pre-training Co-evolutionary Protein Representation via A Pairwise
Masked Language Model [93.9943278892735]
タンパク質配列表現学習の鍵となる問題は、配列中の残基間の共変量によって反映される共進化情報をキャプチャすることである。
Pairwise Masked Language Model (PMLM) と呼ばれる専用言語モデルによる事前学習により,この情報を直接キャプチャする新しい手法を提案する。
提案手法は, 相互関係を効果的に把握し, ベースラインと比較して, 接触予測性能を最大9%向上できることを示す。
論文 参考訳(メタデータ) (2021-10-29T04:01:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。