論文の概要: Structure-Aware Masking for Protein Representation Learning
- arxiv url: http://arxiv.org/abs/2605.16581v1
- Date: Fri, 15 May 2026 19:36:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:46.714823
- Title: Structure-Aware Masking for Protein Representation Learning
- Title(参考訳): タンパク質表現学習のための構造認識型マスキング
- Authors: Thomas Walton, Ayan Goel, Amirali Aghazadeh,
- Abstract要約: 構造認識型マスキング手法であるBucket Maskingを導入する。
マスク分布を残留接触に条件付けすることで、Bucket Maskingは学習目標を長距離相互作用のモデル化へとシフトさせる。
下流の4つのタンパク質のフィットネス予測タスクで、Bucket Maskingは通常のランダムマスクよりも最大14%改善できる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Masked language modeling (MLM) is the standard objective for training protein language models, typically implemented by randomly masking individual residues at a fixed rate (e.g., 15%). This practice implicitly assumes that all sequence positions contribute equally to representation learning. In downstream fitness prediction tasks, however, protein sequences are governed by three-dimensional structural dependencies and long-range residue contacts that induce strong nonlocal couplings between residues. We introduce Bucket Masking, a structure-aware masking strategy that selects groups of residues based on their proximity in three-dimensional space, preferentially masking structurally coupled regions during training. By conditioning the masking distribution on residue contacts, Bucket Masking shifts the learning objective toward modeling long-range interactions that are critical for protein function. Across four downstream protein fitness prediction tasks, Bucket Masking enables up to a 14% improvement over standard random masking, excelling at predicting higher-order mutational interactions. Through controlled ablations, we show that these improvements arise from mask placement rather than span size, establishing masking as a positional inductive bias.
- Abstract(参考訳): Masked Language Modeling (MLM) はタンパク質言語モデルを訓練するための標準目的であり、通常、固定レート(例えば15%)で個々の残基をランダムにマスキングすることによって実装される。
このプラクティスは、すべてのシーケンス位置が表現学習に等しく寄与すると暗黙的に仮定する。
しかし、下流の適合度予測タスクでは、タンパク質配列は3次元構造依存と長距離残基接触によって制御され、残基間の強い非局所結合が引き起こされる。
我々は,3次元空間における近接性に基づいて残余群を選択する構造対応マスキング手法であるBucket Maskingを導入し,トレーニング中の構造結合領域を優先的にマスキングする。
マスク分布を残留接触に条件付けすることで、バックト・マスキングは、タンパク質機能に不可欠な長距離相互作用をモデル化する学習目標をシフトさせる。
下流の4つのタンパク質の適合性予測タスクの中で、Bucket Maskingは標準的なランダムマスクよりも最大14%改善できる。
これらの改善はスパンサイズではなくマスク配置から生じ,位置誘導バイアスとしてマスクが確立された。
関連論文リスト
- GenMask: Adapting DiT for Segmentation via Direct Mask Generation [81.54526445834294]
間接的な適応の代わりに、セグメント化タスクは生成的な方法で直接訓練されるべきである、と我々は主張する。
分割のための極度のノイズレベルと画像生成のための中等度雑音を強調する二元マスクの時間ステップサンプリング戦略を導入する。
GenMaskは,RGB空間における色鮮やかな画像だけでなく,黒と白のセグメンテーションマスクを生成するためのDiTトレインである。
論文 参考訳(メタデータ) (2026-03-25T03:52:05Z) - A Random Matrix Theory of Masked Self-Supervised Regression [16.836043197411378]
実験では,様々なマスキングパターンにまたがって予測を集約し,行列値の合同予測を行う。
このオブジェクトは、互いに条件をコーディネートする方法を符号化し、新しい分析課題を生じさせる。
マスクされた自己教師型学習がPCAを確実に上回る構造的体制を同定する。
論文 参考訳(メタデータ) (2026-01-30T17:32:33Z) - S$^2$Drug: Bridging Protein Sequence and 3D Structure in Contrastive Representation Learning for Virtual Screening [72.89086338778098]
タンパク質リガンドコントラスト表現学習のための2段階フレームワークを提案する。
最初の段階では、ESM2ベースのバックボーンを用いて、ChemBLでタンパク質配列を事前訓練する。
第2段階では、残基レベルゲーティングモジュールを介して配列と構造情報を融合することでPDBBindを微調整する。
この補助的なタスクは、モデルを誘導し、タンパク質配列内の結合残基を正確に局在させ、それらの3次元空間配列をキャプチャする。
論文 参考訳(メタデータ) (2025-11-10T11:57:47Z) - Soften the Mask: Adaptive Temporal Soft Mask for Efficient Dynamic Facial Expression Recognition [4.151073288078749]
動的表情認識(DFER)は,非言語コミュニケーションによる心理的意図の理解を促進する。
既存の手法では、バックグラウンドノイズや冗長なセマンティクスといった無関係な情報を管理するのに苦労し、効率と有効性の両方に影響を及ぼす。
そこで本稿では,DFERのための新しい教師付き仮面自動エンコーダネットワーク,すなわちAdaToskを提案する。
論文 参考訳(メタデータ) (2025-02-28T12:45:08Z) - A Theoretical Analysis of Self-Supervised Learning for Vision Transformers [66.08606211686339]
マスク付きオートエンコーダ(MAE)とコントラスト学習(CL)は異なる種類の表現をキャプチャする。
我々は,MAEとCLの両目的に対して,一層ソフトマックス型視覚変換器(ViT)のトレーニングダイナミクスについて検討した。
論文 参考訳(メタデータ) (2024-03-04T17:24:03Z) - FoldToken: Learning Protein Language via Vector Quantization and Beyond [56.19308144551836]
タンパク質配列構造を離散シンボルとして表現するために textbfFoldTokenizer を導入する。
学習したシンボルを textbfFoldToken と呼び、FoldToken の配列が新しいタンパク質言語として機能する。
論文 参考訳(メタデータ) (2024-02-04T12:18:51Z) - Pre-training Co-evolutionary Protein Representation via A Pairwise
Masked Language Model [93.9943278892735]
タンパク質配列表現学習の鍵となる問題は、配列中の残基間の共変量によって反映される共進化情報をキャプチャすることである。
Pairwise Masked Language Model (PMLM) と呼ばれる専用言語モデルによる事前学習により,この情報を直接キャプチャする新しい手法を提案する。
提案手法は, 相互関係を効果的に把握し, ベースラインと比較して, 接触予測性能を最大9%向上できることを示す。
論文 参考訳(メタデータ) (2021-10-29T04:01:32Z) - Improving Self-supervised Pre-training via a Fully-Explored Masked
Language Model [57.77981008219654]
Masked Language Model (MLM)フレームワークは、自己教師型言語事前学習に広く採用されている。
そこで本研究では,テキストシーケンスを複数の非重複セグメントに分割するマスキング手法を提案する。
論文 参考訳(メタデータ) (2020-10-12T21:28:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。