論文の概要: Task- and dataset-specific information in protein language models
- arxiv url: http://arxiv.org/abs/2608.12090v2
- Date: Thu, 13 Aug 2026 07:47:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 14:00:09.861507
- Title: Task- and dataset-specific information in protein language models
- Title(参考訳): タンパク質言語モデルにおけるタスクとデータセット固有の情報
- Abstract要約: タンパク質言語モデルはアミノ酸配列を潜在空間埋め込みに変換する。
一般的なコンセンサスでは、モデルの最後のレイヤからの埋め込みが使用される。
中間PLM層に生成した埋め込みの情報性について検討する。
- 参考スコア(独自算出の注目度): 17.862607776640058
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Protein language models (PLMs) have transferred the latest advances from natural language processing to computational biology. These models, trained on large corpora of protein sequence data, are widely used to translate amino acid sequences into latent-space embeddings, ready for use in diverse downstream tasks (DTs). By a common consensus, embeddings from the model's last layer are used, and the model's internal behavior remains poorly understood. We analyzed 13 PLMs across 15 DTs from 11 datasets to investigate the informativeness of embeddings created in intermediate PLM layers. We trained probe models on embeddings from each layer, compared their performance, and computed characteristics of the latent spaces they span to estimate the information they contain, and found that the last layers of PLMs rarely contained embeddings that led to the best results on downstream tasks. Furthermore, we identified a connection between DTs and the distribution across PLMs' layers of the relevant information to predict that task. For example, similarity between the pre-training objective and the objective of predicting properties of individual residues leads to a steady increase in understanding of such tasks across the layers of PLMs. On the other hand, for whole-protein tasks, we observe that the dataset, rather than the task itself, defines PLMs' ability to perform well on a DT. Embeddings from shallow layers of PLMs perform better for datasets that contain deep mutational scan (DMS) data, while datasets containing diverse natural proteins find most useful embeddings in the models' deeper layers. Additionally, we discover that the performance of PLMs drops significantly when tasks are introduced for artificial proteins.
- Abstract(参考訳): タンパク質言語モデル(PLM)は、自然言語処理から計算生物学へ最新の進歩を移した。
これらのモデルは、タンパク質配列データの大規模なコーパスに基づいて訓練され、アミノ酸配列を潜在空間の埋め込みに変換するために広く使われ、様々な下流タスク(DT)で使用できる。
一般的なコンセンサスでは、モデルの最後のレイヤからの埋め込みが使用され、モデルの内部動作は理解されていないままである。
我々は,11個のデータセットから15個のDTにまたがる13個のPLMを解析し,中間的なPLM層に生成した埋め込みの情報を調査した。
我々は各層からの埋め込みに関する調査モデルを訓練し、それらの性能を比較し、それらが分散している潜伏空間の特徴を計算し、それらに含まれる情報を推定し、PLMの最後の層が下流タスクに最高の結果をもたらすような埋め込みをほとんど含まないことを発見した。
さらに,DTとPLMの層間の関係を同定し,その課題を予測した。
例えば、事前学習目標と個々の残基の性質を予測する目的との類似性は、PLMの層をまたいだそのようなタスクの理解を着実に増加させる。
一方、タンパク質全体のタスクでは、タスク自体ではなくデータセットが、DT上でのPLMの能力を定義する。
PLMの浅い層からの埋め込みは、深部突然変異スキャン(DMS)データを含むデータセットよりも優れており、多様な天然タンパク質を含むデータセットはモデルの深い層に最も有用な埋め込みを見つける。
さらに,人工タンパク質のタスク導入時にPLMの性能が著しく低下することが判明した。
関連論文リスト
- Position: Let's Develop Data Probes to Fundamentally Understand How Data Affects LLM Performance [33.08440302959991]
我々は、適切に定義されたランダムプロセスから合成配列を生成するための体系的手法を開発する必要性を主張する。
データプローブ上でのLCMの挙動を観察することにより、研究者は、データ特性がモデルの性能、一般化、堅牢性にどのように影響するかを体系的に研究することができる。
論文 参考訳(メタデータ) (2026-05-11T11:44:40Z) - Do All Individual Layers Help? An Empirical Study of Task-Interfering Layers in Vision-Language Models [51.754991950934375]
事前トレーニングされたVLMでは、すべてのレイヤがデフォルトで実行され、下流タスクで予測される。
パラメータをゼロにすることで、ひとつの層にインターベンションすることで、特定のタスクのパフォーマンスを向上させることができる。
与えられたタスクに対して最も干渉するレイヤを動的に識別し、バイパスする、トレーニング不要なテスト時間適応手法であるTaLoを提案する。
論文 参考訳(メタデータ) (2026-02-01T11:37:05Z) - DatawiseAgent: A Notebook-Centric LLM Agent Framework for Adaptive and Robust Data Science Automation [10.390461679868197]
我々は、適応的で堅牢なデータサイエンス自動化のためのノートブック中心の大規模言語モデル(LLM)エージェントフレームワークであるDatawiseAgentを紹介する。
人間のデータサイエンティストが計算ノートブックでどのように機能するかに触発されたDatawiseAgentは、統一された相互作用表現とマルチステージアーキテクチャを導入した。
論文 参考訳(メタデータ) (2025-03-10T08:32:33Z) - Diversity as a Reward: Fine-Tuning LLMs on a Mixture of Domain-Undetermined Data [54.3895971080712]
多様なデータセットを使用した細調整された大規模言語モデル(LLM)は、さまざまな領域にわたる全体的なパフォーマンス向上に不可欠である。
本稿では,LLMに2つのアイデンティティを与える新しい手法を提案する。多様性報酬に基づいてデータを認知的に探索し,選択する出力モデルと,選択したデータに調整する入力モデルである。
論文 参考訳(メタデータ) (2025-02-05T17:21:01Z) - Mitigating Forgetting in LLM Fine-Tuning via Low-Perplexity Token Learning [65.23593936798662]
LLM生成データによる微調整により,目標タスクの性能が向上し,非目標タスクの劣化が低減されることを示す。
微調整後のLSMにおける破滅的忘れを緩和するために、トークンの難易度低減に基づく経験的説明を提供する最初の研究である。
論文 参考訳(メタデータ) (2025-01-24T08:18:56Z) - On Domain-Adaptive Post-Training for Multimodal Large Language Models [78.65220510401045]
本稿では,MLLMのドメイン適応をポストトレーニングにより体系的に検討する。
データ合成、トレーニングパイプライン、タスク評価に重点を置いています。
バイオメディシン、食品、リモートセンシングなどの高インパクト領域で実験を行う。
論文 参考訳(メタデータ) (2024-11-29T18:42:28Z) - SELF-GUIDE: Better Task-Specific Instruction Following via Self-Synthetic Finetuning [70.21358720599821]
大規模言語モデル(LLM)は、適切な自然言語プロンプトを提供する際に、多様なタスクを解決するという約束を持っている。
学生LLMからタスク固有の入出力ペアを合成する多段階メカニズムであるSELF-GUIDEを提案する。
ベンチマークの指標から,分類タスクに約15%,生成タスクに18%の絶対的な改善を報告した。
論文 参考訳(メタデータ) (2024-07-16T04:41:58Z) - On Inter-dataset Code Duplication and Data Leakage in Large Language Models [4.148857672591562]
本稿では,データセット間の重複現象とその大規模言語モデル(LLM)評価への影響について検討する。
この結果から,複数のSEタスクにまたがるLCMの評価は,データ間重複現象に起因する可能性が示唆された。
オープンソースモデルがデータセット間の重複に影響される可能性があることを示す。
論文 参考訳(メタデータ) (2024-01-15T19:46:40Z) - Task-Distributionally Robust Data-Free Meta-Learning [99.56612787882334]
Data-Free Meta-Learning (DFML)は、複数の事前学習モデルを活用することで、独自のトレーニングデータを必要とせずに、新しいタスクを効率的に学習することを目的としている。
TDS(Task-Distribution Shift)とTDC(Task-Distribution Corruption)の2つの大きな課題を初めて明らかにした。
論文 参考訳(メタデータ) (2023-11-23T15:46:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。