論文の概要: RIBOSPAN: A Long-Context RNA Foundation Model for Versatile RNA Modeling
- arxiv url: http://arxiv.org/abs/2608.22849v2
- Date: Fri, 28 Aug 2026 14:00:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 15:11:36.065206
- Title: RIBOSPAN: A Long-Context RNA Foundation Model for Versatile RNA Modeling
- Title(参考訳): RIBOSPAN:Versatile RNAモデリングのための長期RNA基盤モデル
- Authors: Ziyuan Wang, Bohao Tang, Fei Zhang, Shuo Han, Pengfei Liu,
- Abstract要約: 本稿では,2方向RNA基盤モデルであるRIBOSPANについて,文脈長が最大10,240 ntまで事前訓練した。
RIBOSPANは、完全長RNAの高分解能モデリングを可能にするために、高密度な双方向自己アテンション、単一ヌクレオチドのトークン化、および注意分離配列パッキングを組み合わせた。
凍結したRNA型評価は、RIBOSPANが最先端のRNA表現を学習し、長いRNAに対して特に有利であることを示している。
- 参考スコア(独自算出の注目度): 26.58224679878256
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Full-length RNAs, particularly messenger RNAs, often exceed the context lengths used to pretrain existing RNA foundation models, limiting complete-transcript modeling at single-nucleotide resolution. We present RIBOSPAN, a 1.61-billion-parameter bidirectional RNA foundation model natively pretrained with context lengths up to 10,240 nt. RIBOSPAN combines dense bidirectional self-attention, single-nucleotide tokenization, and attention-isolated sequence packing to enable high-resolution modeling of complete long RNAs. Native 10K pretraining preserves strong reconstruction at 10,240 tokens and, in a controlled long-context benchmark, maintains strong contextual responsiveness and context-specific representation separation while keeping perturbation-induced changes highly localized. Inference-time YaRN scaling recovers much of the contextual organization lost by direct short-context extrapolation, but induces substantially greater distal representation diffusion. Frozen RNA-type evaluations show that RIBOSPAN learns state-of-the-art RNA representations, with a particularly clear advantage on long RNAs. Across downstream biological benchmarks, RIBOSPAN emerges as the strongest encoder-only RNA foundation model, achieving state-of-the-art performance in both full-transcript biological property prediction and zero-shot mutation-fitness modeling. Building on the same backbone, we develop a multidimensionally conditioned discrete-diffusion framework for full-length mRNA generation and redesign, including synonymous-codon diffusion for protein-preserving CDS optimization. Together, RIBOSPAN establishes a powerful long-context foundation for transferable RNA representation learning, biological prediction, and full-transcript mRNA design.
- Abstract(参考訳): フル長RNA、特にメッセンジャーRNAは、既存のRNA基盤モデルの事前訓練に使用される文脈長を超え、単一ヌクレオチド解像度での完全転写モデリングを制限している。
本稿では,1.61ビリオンの双方向RNA基盤モデルであるRIBOSPANについて,文脈長が最大10,240 ntまで事前訓練を行った。
RIBOSPANは、完全長RNAの高分解能モデリングを可能にするために、高密度な双方向自己アテンション、単一ヌクレオチドのトークン化、および注意分離配列パッキングを組み合わせた。
ネイティブ10Kプリトレーニングは、10,240トークンの強い再構成を保ち、制御された長期コンテキストベンチマークでは、強いコンテキスト応答性とコンテキスト特異的な表現分離を維持しながら、摂動による変化を高度に局所的に維持する。
推論時YaRNスケーリングは、直接の短文補間によって失われる文脈的組織の多くを回復するが、遠位表現拡散は著しく大きい。
凍結したRNA型評価は、RIBOSPANが最先端のRNA表現を学習し、長いRNAに対して特に有利であることを示している。
下流の生物学的ベンチマーク全体では、RIBOSPANはエンコーダのみのRNA基盤モデルとして最強であり、完全転写生物特性予測とゼロショット変異適合性モデリングの両方において最先端のパフォーマンスを達成する。
同じバックボーン上に構築し、タンパク質保存CDS最適化のための同義語-コドン拡散を含む、完全長mRNA生成と再設計のための多次元的条件付き離散拡散フレームワークを開発する。
RIBOSPANは、転写可能なRNA表現学習、生物学的予測、全転写mRNA設計のための強力な長文基盤を確立する。
関連論文リスト
- Fair splits flip the leaderboard: CHANRG reveals limited generalization in RNA secondary-structure prediction [44.072730684426794]
現在のベンチマークではRNAファミリー間の一般化を過大評価することができる。
我々は包括的階層を提示する。
非コードRNA群(英: Non-coding RNA Groups of Non-coding RNAs,CHANRG)は、170,083個の構造的非冗長RNAのベンチマークである。
論文 参考訳(メタデータ) (2026-03-20T20:18:08Z) - RiboSphere: Learning Unified and Efficient Representations of RNA Structures [57.40815107640066]
RNAのバックボーンは非常に柔軟で、非カノニカル相互作用が一般的であり、実験的に決定された3D構造は比較的少ない。
本稿では,ベクトル量子化とフローマッチングを組み合わせることで,RNAの固有な幾何学的表現を学習するフレームワークであるemphRiboSphereを紹介する。
論文 参考訳(メタデータ) (2026-03-20T04:36:35Z) - Comprehensive benchmarking of large language models for RNA secondary structure prediction [0.0]
RNA-LLMはRNA配列の大規模なデータセットを使用して、自己教師付き方法で、意味的に豊かな数値ベクトルで各RNA塩基をどう表現するかを学ぶ。
その中で、二次構造を予測することは、RNAの機能的機構を明らかにするための基本的な課題である。
本稿では,いくつかの事前学習されたRNA-LLMの総合的な実験解析を行い,それらを統合されたディープラーニングフレームワークにおけるRNA二次構造予測タスクと比較する。
論文 参考訳(メタデータ) (2024-10-21T17:12:06Z) - Latent Diffusion Models for Controllable RNA Sequence Generation [33.38594748558547]
RNAはDNAとタンパク質の間の重要な中間体であり、高い配列の多様性と複雑な3次元構造を示す。
可変長の離散RNA配列の生成と最適化のための潜時拡散モデルを開発した。
実験の結果、RNA拡散は様々な生物学的指標の自然な分布と一致した非コードRNAを生成することが確認された。
論文 参考訳(メタデータ) (2024-09-15T19:04:50Z) - BEACON: Benchmark for Comprehensive RNA Tasks and Language Models [60.02663015002029]
本稿では、最初の包括的なRNAベンチマークBEACON(textbfBEnchmtextbfArk for textbfCOmprehensive RtextbfNA Task and Language Models)を紹介する。
まずBEACONは、構造解析、機能研究、工学的応用を網羅した、これまでの広範囲にわたる研究から導かれた13のタスクから構成される。
第2に、CNNのような従来のアプローチや、言語モデルに基づく高度なRNA基盤モデルなど、さまざまなモデルについて検討し、これらのモデルのタスク固有のパフォーマンスに関する貴重な洞察を提供する。
第3に、重要なRNA言語モデルコンポーネントについて検討する。
論文 参考訳(メタデータ) (2024-06-14T19:39:19Z) - Accurate RNA 3D structure prediction using a language model-based deep learning approach [50.193512039121984]
RhoFold+はRNA言語モデルに基づくディープラーニング手法で、配列から単一鎖RNAの3次元構造を正確に予測する。
RhoFold+はRNA 3D構造予測のための完全に自動化されたエンドツーエンドパイプラインを提供する。
論文 参考訳(メタデータ) (2022-07-04T17:15:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。