論文の概要: Benchmarking Peptide-Protein Affinity Prediction Across Peptide and Target Shifts
- arxiv url: http://arxiv.org/abs/2608.30175v1
- Date: Mon, 31 Aug 2026 02:56:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.203003
- Title: Benchmarking Peptide-Protein Affinity Prediction Across Peptide and Target Shifts
- Title(参考訳): ペプチドとターゲットシフト間のペプチド-プロテイン親和性予測のベンチマーク
- Abstract要約: 定量的ペプチド-タンパク質結合データの3つのソースを統合し, 11,349個の脱重複ペアを得た。
ペプチド相似性, 標的内, 離脱対象の分割条件下で, 10個のペプチド表現, ESM-2タンパク質埋め込み, 6個の回帰因子を比較検討した。
- 参考スコア(独自算出の注目度): 3.2000742569384237
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Peptide-protein affinity models are often evaluated with a single data split, obscuring whether they interpolate among measurements for observed targets or generalize across peptide or target shifts. We integrated three sources of quantitative peptide-protein binding data to obtain 11,349 deduplicated pairs and benchmarked ten peptide representations, ESM-2 protein embeddings, and six regressors under peptide-similarity, within-target, and leave-target-out partitions. Across 60 matched representation-regressor configurations, mean test Spearman correlations were 0.462, 0.669, and 0.530, respectively. The top configuration shifted from ECFP-16 count fingerprints with random forest in the first two settings to HELM-BERT with Extra Trees when exact target sequences were excluded. Representation-rank correlations ranged from -0.042 to 0.624 across partitions, whereas regressor-rank correlations ranged from 0.771 to 0.943. Learning curves showed that representation differences were largest with limited supervision and narrowed as training data increased. PeptideCLM-2 adaptation and simple element-wise interaction features provided no consistent gain over a frozen encoder and direct concatenation under the tested protocols. These conclusions are specific to a dataset that pools transformed Kd, Ki, and IC50 measurements and to target exclusion at the exact-sequence level. Peptide-protein affinity benchmarks should therefore align data partitions with the intended use and jointly assess the effects of data scale, molecular representation, and downstream learner.
- Abstract(参考訳): ペプチド-タンパク質親和性モデルはしばしば単一のデータ分割で評価され、観測対象の測定値間で補間されるか、ペプチドや標的シフトにまたがって一般化されるかが観察される。
11,349個の非重複配列と10個のペプチド表現,ESM-2タンパク質埋め込み,および6個のレグレクターをペプチド類似性,標的内,および離脱対象の分割下で得るために,定量的ペプチド結合データの3つのソースを統合した。
60以上の表現-回帰器構成で, 平均スピアマン相関は0.462, 0.669, 0.530であった。
トップ設定は、最初の2つの設定でランダムフォレストを持つECFP-16数の指紋から、正確なターゲットシーケンスが除外されたときにエクストラツリーを持つHELM-BERTに移行した。
表現ランク相関は分割毎に-0.042から0.624まで、回帰ランク相関は0.771から0.943までであった。
学習曲線は、表現差が最大であり、監督が限られており、トレーニングデータが増加するにつれて制限されることを示した。
ペプチドCLM-2の適応と単純な元素間相互作用により、凍結エンコーダよりも一貫した利得が得られず、試験されたプロトコルの下で直接結合する。
これらの結論は、変換されたKd、Ki、IC50の測定をプールするデータセットに特化しており、正確なシーケンスレベルでの排除を目標としている。
したがって、ペプチド-タンパク質親和性ベンチマークは、データパーティションを意図した用途と整合させ、データスケール、分子表現、下流学習者の影響を共同で評価する必要がある。
関連論文リスト
- Coarse composition suffices: tabular in-context learning for multi-activity antimicrobial peptide profiling [2.571440349338848]
単純なシーケンスのみのパイプラインは、マルチモーダルな構造条件のディープモデルにマッチし、超えられることを示す。
ESCAPE (82,359 peptides; 5 labels)では、ラベル・パワーセットのTabPFNモデルがmAP-5 = 77.8%を達成する。
論文 参考訳(メタデータ) (2026-08-31T06:50:09Z) - A Multidimensional Data-Driven Hybrid Transformer Framework for Non-invasive Continuous Blood Pressure Prediction [28.58502100288247]
本稿では,ECG/III特徴系列から拡張型および収縮型BPを推定するハイブリッドトランスフォーマーフレームワークを提案する。
このフレームワークは、生の波形ではなく、生理的記述子の10段階のシーケンスと、2つの人口統計学的コをモデル化する。
論文 参考訳(メタデータ) (2026-08-24T14:02:10Z) - Decomposing the Generalization Gap in PROTAC Activity Prediction: Variance Attribution and the Inter-Laboratory Ceiling [11.472625518731173]
我々は、これを評価科学的な問題とみなし、実験的なテストベッドとして標的タンパク質の分解を利用する。
ProTAC-Bench (10,748 測定,173 ターゲット,65 LOTO フォルダ),分散復号化フレームワーク,ターゲットごとのキャリブレーションプロトコル,評価コードをリリースする。
論文 参考訳(メタデータ) (2026-05-12T08:35:02Z) - An Integrated Deep-Learning Framework for Peptide-Protein Interaction Prediction and Target-Conditioned Peptide Generation with ConGA-PepPI and TC-PepGen [2.9196005639424647]
早期ペプチドスクリーニングのための統合フレームワークを提案する。
このフレームワークは、ConGA-PepPI(Partner-Aware Prediction and Localization Model)とターゲット条件生成モデル(TC-PepGen)を組み合わせる。
5倍のクロスバリデーションでは、ConGA-PepPIは0.839の精度と0.921のAUROCを達成し、結合部位のAUPR値はタンパク質側が0.601、ペプチド側が0.950であった。
論文 参考訳(メタデータ) (2026-04-20T16:20:23Z) - Investigating Knowledge Distillation Through Neural Networks for Protein Binding Affinity Prediction [0.22369578015657954]
予測精度とデータ可用性のトレードオフにより、タンパク質結合親和性を正確に予測することは困難である。
学習中にタンパク質構造データを使用し,推論時にのみシーケンスデータを必要とする知識蒸留に基づく回帰フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-07T08:43:08Z) - CONFIDE: Hallucination Assessment for Reliable Biomolecular Structure Prediction and Design [46.12506067241116]
本稿では,位相的フラストレーションを定量化する自己評価尺度であるCODE(Chain of Diffusion Embeddings)を提案する。
エネルギー的およびトポロジ的視点を組み合わせた統合評価フレームワークであるCONFIDEを提案する。
データ駆動の埋め込みと理論的な洞察を組み合わせることで、CODEとConFIDEは、幅広い生体分子システムで既存の指標より優れています。
論文 参考訳(メタデータ) (2025-11-20T03:38:46Z) - AttentiveGRUAE: An Attention-Based GRU Autoencoder for Temporal Clustering and Behavioral Characterization of Depression from Wearable Data [46.262619407930266]
本稿では,時間的クラスタリングと縦型ウェアラブルデータによる結果の予測を目的とした,新しい注意型ゲートリカレントユニット(GRU)オートエンコーダであるAttentiveGRUAEを提案する。
372名(GLOBEM 2018-2019)の長期睡眠データからAttentiveGRUAEを評価する。
これは、クラスタリングの品質と抑うつの分類の両方において、ベースラインクラスタリング、ドメイン指向の自己教師付きモデル、および改善されたモデルよりも優れたパフォーマンスを示す。
論文 参考訳(メタデータ) (2025-10-02T20:52:16Z) - PRING: Rethinking Protein-Protein Interaction Prediction from Pairs to Graphs [88.98041407783502]
PRINGは、タンパク質とタンパク質の相互作用予測をグラフレベルで評価する最初のベンチマークである。
PRINGは、21,484タンパク質と186,818の相互作用からなる高品質な多種PPIネットワークデータセットをキュレートする。
論文 参考訳(メタデータ) (2025-07-07T15:21:05Z) - PSC-CPI: Multi-Scale Protein Sequence-Structure Contrasting for
Efficient and Generalizable Compound-Protein Interaction Prediction [63.50967073653953]
化合物-タンパク質相互作用予測は、合理的な薬物発見のための化合物-タンパク質相互作用のパターンと強度を予測することを目的としている。
既存のディープラーニングベースの手法では、タンパク質配列や構造が単一のモダリティしか利用していない。
CPI予測のためのマルチスケールタンパク質配列構造コントラストフレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-13T03:51:10Z) - State-specific protein-ligand complex structure prediction with a
multi-scale deep generative model [68.28309982199902]
タンパク質-リガンド複合体構造を直接予測できる計算手法であるNeuralPLexerを提案する。
我々の研究は、データ駆動型アプローチがタンパク質と小分子の構造的協調性を捉え、酵素や薬物分子などの設計を加速させる可能性を示唆している。
論文 参考訳(メタデータ) (2022-09-30T01:46:38Z) - Semi-supervised Contrastive Learning with Similarity Co-calibration [72.38187308270135]
SsCL(Semi-supervised Contrastive Learning)と呼ばれる新しいトレーニング戦略を提案する。
ssclは、自己教師付き学習におけるよく知られたコントラスト損失と、半教師付き学習におけるクロスエントロピー損失を組み合わせる。
SsCLはより差別的な表現を生じさせ,ショット学習に有益であることを示す。
論文 参考訳(メタデータ) (2021-05-16T09:13:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。