論文の概要: DNA Language Models: An Assessment of Pre-Training for Fine-Tuning Tasks
- arxiv url: http://arxiv.org/abs/2606.30140v1
- Date: Mon, 29 Jun 2026 11:20:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.202463
- Title: DNA Language Models: An Assessment of Pre-Training for Fine-Tuning Tasks
- Title(参考訳): DNA言語モデル:微調整作業のための事前学習の評価
- Abstract要約: 基礎モデルと大規模言語モデル(LLM)の最近の進歩は、ゲノム配列の研究と復号化の新しい機会をもたらした。
DNABERT2のような最先端のアプローチはトランスフォーマーベースのアーキテクチャに依存しているが、ConvNovaのような他のアプローチは依然として従来の畳み込みモデルに基づいている。
i)トランスフォーマーベースモデルは、重度事前トレーニングにおける微調整タスクに十分な改善をもたらすか、(ii)この設定における事前トレーニングの実際の貢献は何か、(iii)BPEトークン化がゲノム関連タスクのパフォーマンスにどのように影響するか、という3つの重要な疑問を調査する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent breakthroughs in foundation models and Large Language Models (LLMs) have introduced new opportunities for studying and decoding genomic sequences. Several state-of-the-art approaches, such as DNABERT2, rely on transformer-based architectures, while others, such as ConvNova, still build upon more conventional convolutional models. However, systematic benchmark comparisons across these methods remain scarce. Given that transformer-based models require extensive and costly pretraining, it is crucial to evaluate whether their performance gains justify this overhead. Moreover, LLMs such as DNABERT2 typically rely on Byte Pair Encoding (BPE) tokenization, whose relevance for DNA sequence representation is still debated within the genomics community. In this work, we investigate three key questions: (i) do transformer-based models provide sufficient improvements on fine-tuning tasks upon heavy pretraining, (ii) what is the actual contribution of pretraining in this setting, and (iii) how does BPE tokenization impact performance on genomics-related tasks?
- Abstract(参考訳): 基礎モデルと大規模言語モデル(LLM)の最近の進歩は、ゲノム配列の研究と復号化の新しい機会をもたらした。
DNABERT2のような最先端のアプローチはトランスフォーマーベースのアーキテクチャに依存しているが、ConvNovaのような他のアプローチは依然として従来の畳み込みモデルに基づいている。
しかし、これらの手法の体系的なベンチマーク比較は依然として乏しい。
トランスフォーマーベースのモデルは、広範囲でコストのかかる事前訓練を必要とするため、パフォーマンス向上がこのオーバーヘッドを正当化するかどうかを評価することが不可欠である。
さらに、DNABERT2 のような LLM は通常、Byte Pair Encoding (BPE) トークン化に依存しており、DNA 配列表現の関連性はゲノムコミュニティ内で議論されている。
本研究では,3つの重要な疑問について考察する。
(i)トランスベースのモデルは、重度事前訓練時の微調整作業に十分な改善をもたらす。
(二)この設定における予習の実際の貢献とは何で、
3)BPEトークン化はゲノム関連タスクにどのように影響しますか?
関連論文リスト
- How Private Are DNA Embeddings? Inverting Foundation Model Representations of Genomic Sequences [0.45880283710344055]
DNA基盤モデルは、バイオインフォマティクスや医療応用における変革的なツールとなっている。
Embeddings-as-a-Service (EBERT) フレームワークは Embeddings-as-a-Service を通じて共有されつつある。
本研究では,DNA基盤モデルのインバージョン攻撃に対するレジリエンスを評価する。
論文 参考訳(メタデータ) (2026-03-06T23:52:26Z) - How to Set the Learning Rate for Large-Scale Pre-training? [73.03133634525635]
我々はこの調査を2つの異なる研究パラダイムであるフィッティングとトランスファーに定式化する。
フィッティングパラダイムでは,探索係数のスケーリング法則を導入し,O(n3) から O(n*C_D*C_) への探索複雑性を予測モデルにより効果的に低減する。
我々は、$Transferの原則をMixture of Experts (MoE)アーキテクチャに拡張し、モデル深さ、重量減衰、トークン水平線を含む適用範囲を広げる。
論文 参考訳(メタデータ) (2026-01-08T15:55:13Z) - Same model, better performance: the impact of shuffling on DNA Language Models benchmarking [0.0]
大規模言語モデルは、複雑な生物学的配列をデコードする可能性から、ゲノム学でますます人気がある。
DNA LMの評価は、ゲノムのドメイン固有の課題と機械学習の方法論を交差させる複雑なタスクであることを示す。
ストレージの前にデータを事前シャッフルすることで、効率を保ちながらハードウェア依存をなくすという簡単な解決策を提案する。
論文 参考訳(メタデータ) (2025-10-14T15:16:56Z) - HAD: Hybrid Architecture Distillation Outperforms Teacher in Genomic Sequence Modeling [52.58723853697152]
DNA配列モデリングのためのハイブリッドアーキテクチャ蒸留(HAD)手法を提案する。
我々はNTv2-500Mを教師モデルとして採用し,グループマスキング戦略を考案した。
類似したパラメータを持つモデルと比較して,本モデルは優れた性能を示した。
論文 参考訳(メタデータ) (2025-05-27T07:57:35Z) - Regulatory DNA sequence Design with Reinforcement Learning [56.20290878358356]
本稿では,強化学習を利用して事前学習した自己回帰モデルを微調整する生成手法を提案する。
2つの酵母培地条件下でのプロモーター設計タスクの評価と,3種類のヒト細胞に対するエンハンサー設計タスクの評価を行った。
論文 参考訳(メタデータ) (2025-03-11T02:33:33Z) - On Machine Learning Approaches for Protein-Ligand Binding Affinity Prediction [2.874893537471256]
本研究では,タンパク質-リガンド結合親和性予測における古典的木モデルと高度なニューラルネットワークの性能を評価する。
2次元モデルと3次元モデルを組み合わせることで、現在の最先端のアプローチを超えて、アクティブな学習結果が向上することを示す。
論文 参考訳(メタデータ) (2024-07-15T13:06:00Z) - An Emulator for Fine-Tuning Large Language Models using Small Language
Models [91.02498576056057]
本研究では,異なるスケールでの事前学習と微調整の結果を近似する分布から,エミュレート・ファインチューニング(EFT)を原理的かつ実用的なサンプリング法として導入する。
EFTは、追加トレーニングを伴わずに、有益性や無害性といった競合する行動特性をテスト時間で調整できることを示す。
最後に、LMアップスケーリングと呼ばれるエミュレートされたファインチューニングの特殊な場合において、小さなファインチューニングモデルと組み合わせることで、大きな事前学習モデルのリソース集約的なファインチューニングを回避する。
論文 参考訳(メタデータ) (2023-10-19T17:57:16Z) - TWINS: A Fine-Tuning Framework for Improved Transferability of
Adversarial Robustness and Generalization [89.54947228958494]
本稿では,様々な分類タスクにおいて,逆向きに事前訓練されたモデルの微調整に焦点を当てる。
本稿では,TWINS(Two-WIng NormliSation)ファインチューニングフレームワークを提案する。
TWINSは、一般化とロバスト性の両方の観点から、幅広い画像分類データセットに有効であることが示されている。
論文 参考訳(メタデータ) (2023-03-20T14:12:55Z) - Leveraging Pre-trained Models for Failure Analysis Triplets Generation [0.0]
我々は、故障解析トリプレット(FAT)を生成する下流タスクにおいて、トランスフォーマーモデルのような事前訓練された因果言語モデルの注意機構を活用する。
生成事前学習型変換器2(GPT2)は、故障解析三重項生成(FATG)タスクにおいて、他の変換器モデルよりも優れていた。
特に, GPT2(1.5Bパラメータで学習)は, ROUGEにおいて, トレーニング済みBERT, BART, GPT3よりも高い性能を示した。
論文 参考訳(メタデータ) (2022-10-31T17:21:15Z) - Scale Efficiently: Insights from Pre-training and Fine-tuning
Transformers [57.931830650323]
本稿では,事前学習および微調整型変圧器によるスケーリングの洞察について述べる。
モデルのサイズだけでなく、モデル形状が下流の微調整に重要であることを示す。
再設計したモデルにより、下流の微調整品質が向上する。
論文 参考訳(メタデータ) (2021-09-22T12:29:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。