論文の概要: Monkey King Bang: A Unified Scientific Multimodal Foundation Model
- arxiv url: http://arxiv.org/abs/2607.20557v1
- Date: Fri, 17 Jul 2026 13:56:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.166822
- Title: Monkey King Bang: A Unified Scientific Multimodal Foundation Model
- Title(参考訳): モンキーキングバン:統一された科学マルチモーダルファンデーションモデル
- Authors: Hesen Chen, Xinyu Su, Xiaomeng Yang, Yuetan Lin, Zixiong Yang, Junyi An, Fenglei Cao, Yifeng Jiao, Yunqi Zhang, Yuan Cheng, Zhiyu Tan, Hao Li, Libo Wu, Yuan Qi,
- Abstract要約: 我々は、理解と生成の両方のための統一的な科学的マルチモーダルモデルであるMKBを紹介する。
MKBは、DNA、RNA、タンパク質、小分子、地球科学、医療画像を含む6つの科学分野をカバーしている。
生物配列、分子弦、気象場、セグメンテーションマスクなどのネイティブな出力をサポートする。
- 参考スコア(独自算出の注目度): 26.409792993729948
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scientific discovery is increasingly shifting from isolated disciplines to multi-domain reasoning, and AI for science faces a similar transition. Existing systems are either specialised for individual domains or unify scientific data mainly through text tokenisation and prompt-based interfaces, limiting their ability to handle diverse scientific inputs, produce modality-native outputs, and support joint understanding, reasoning, and generation across scientific domains. We introduce MKB, a unified scientific multimodal model for both understanding and generation, built around a shared Transformer backbone and modality-tailored encoders, adapters, and decoders. MKB covers six scientific branches, including DNA, RNA, proteins, small molecules, earth science, and medical images, and supports native outputs such as biological sequences, molecular strings, meteorological fields, and segmentation masks. Training follows a two-stage modality-then-language curriculum: Stage 1 aligns modality-specific components with the frozen backbone, and Stage 2 consolidates them with the language backbone using mixed scientific and general corpora. Experiments show that MKB achieves competitive scientific understanding across biological and molecular benchmarks, produces high-fidelity native outputs for weather forecasting, biological generation, and medical-image segmentation, and largely retains the general capabilities of its Qwen3-VL backbone. These results demonstrate the feasibility of the proposed paradigm, suggesting that shared-backbone models with modality-tailored components can provide a promising foundation for future cross-domain scientific multimodal exploration. The model and code are publicly available at https://github.com/Shanghai-Academy-of-AI-For-Science/MKB and https://huggingface.co/sais-org/MKB.
- Abstract(参考訳): 科学の発見は、孤立した規律からマルチドメイン推論へ、そして科学のためのAIも同様の移行に直面している。
既存のシステムは個々のドメインに特化されているか、主にテキストのトークン化とプロンプトベースのインターフェースを通じて科学データを統一している。
我々は,共有トランスフォーマーバックボーンとモダリティ調整エンコーダ,アダプタ,デコーダを中心に構築された,理解と生成の両方のための統一科学的マルチモーダルモデルであるMKBを紹介する。
MKBは、DNA、RNA、タンパク質、小分子、地球科学、医療画像を含む6つの科学分野をカバーし、生物学的配列、分子文字列、気象学領域、セグメンテーションマスクなどのネイティブな出力をサポートする。
ステージ1は、モダリティ固有のコンポーネントを凍結したバックボーンと整列させ、ステージ2は、科学と一般的なコーパスを混合して、それらを言語バックボーンと統合する。
実験の結果、MKBは生物と分子のベンチマークで競争力のある科学的理解を達成し、気象予報、生物生成、医療画像のセグメンテーションのための高忠実なネイティブアウトプットを生成し、Qwen3-VLバックボーンの一般的な能力を保っていることがわかった。
これらの結果は、提案パラダイムの実現可能性を示し、モダリティを調整したコンポーネントを用いた共有バックボーンモデルが、将来のクロスドメイン科学的マルチモーダル探索のための有望な基盤となることを示唆している。
モデルはhttps://github.com/Shanghai-Academy-of-AI-For-Science/MKBとhttps://huggingface.co/sais-org/MKBで公開されている。
関連論文リスト
- S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation [31.901449470705618]
我々はS1-Omniを科学的理解・予測・生成のための統合多モーダル推論モデルとして提示する。
S1-Omniのアーキテクチャは、科学データの統一表現、自然界の知識アライメント、ドメイン固有のタスクのデコードという3つのコアコンポーネントの上に構築されている。
S1-Omniは200の科学的タスクをカバーし、数百万の推論サンプルを含むS1-Omni-Corpusで訓練され、60以上の科学的ベンチマークで評価されている。
論文 参考訳(メタデータ) (2026-07-17T06:56:08Z) - Speaking the Language of Science: Toward a General-Purpose Generative Foundation Model for the Natural Sciences [89.71422932447423]
LOGOSは、自然科学における異種タスクを統一する科学生成言語モデルである。
空間的接触パターンと制約パターンを離散トークンとして表現することにより、モデルは純粋にシーケンシャルな方法で複雑な構造的相互作用をキャプチャする。
多様なタスクにわたって、LOGOSは一貫してドメイン固有のベースラインにマッチまたは性能を向上する。
論文 参考訳(メタデータ) (2026-06-15T16:14:53Z) - SciCore-Mol: Augmenting Large Language Models with Pluggable Molecular Cognition Modules [37.73750078629302]
SciCore-Molは、離散言語記号とトポロジカル分子または連続反応データの間のギャップを埋めるモジュラーフレームワークである。
SciCore-Molは, 分子理解, 生成, 反応予測, 一般化学知識にまたがる包括的性能を実現する。
この研究は、切り離された、プラグ可能な、柔軟に編成されたモジュールを通じて、大規模言語モデルに科学的専門知識を持たせるための体系的な青写真を提供する。
論文 参考訳(メタデータ) (2026-05-21T10:37:53Z) - A unified multimodal understanding and generation model for cross-disciplinary scientific research [20.510417042775973]
FuXi-Uniは、科学的理解と単一のアーキテクチャ内の科学領域にわたる高忠実度生成のためのネイティブ統一マルチモーダルモデルである。
特に、FuXi-Uniは、自然言語トークン内の学際的な科学トークンを整列させ、科学トークンを再構築するために科学デコーダを使用している。
地球システムモデリングにおいて、このモデルは、グローバルな天気予報、熱帯サイクロン(TC)予測の編集、言語命令のみによって駆動される空間的ダウンスケーリングをサポートする。
論文 参考訳(メタデータ) (2026-01-04T04:31:38Z) - SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligence [99.30934038146965]
SciEvalKitは、科学知能のコア能力に焦点を当てている。
物理学、化学から天文学、材料科学まで6つの主要な科学領域をサポートしている。
このツールキットはオープンソースで、コミュニティ主導の開発とAI4Scienceの進歩を促進するために積極的にメンテナンスされている。
論文 参考訳(メタデータ) (2025-12-26T17:36:02Z) - Learning Cell-Aware Hierarchical Multi-Modal Representations for Robust Molecular Modeling [74.25438319700929]
分子と細胞応答の局所的グローバル依存性をモデル化する堅牢なフレームワークであるCHMR(Cell-aware Hierarchical Multi-modal Representations)を提案する。
728タスクにまたがる9つの公開ベンチマークで評価され、CHMRは最先端のベースラインを上回っている。
その結果, 階層認識型マルチモーダル学習による分子表現の信頼性, 生物学的基盤化の利点が示された。
論文 参考訳(メタデータ) (2025-11-26T07:15:00Z) - A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers [251.23085679210206]
科学大規模言語モデル(Sci-LLMs)は、科学研究において、知識の表現、統合、適用の方法を変えつつある。
この調査は、モデルとその基盤となるデータ基板の共進化として、Sci-LLMの開発を再考する。
我々は、科学的データの統一された分類法と、科学的知識の階層的なモデルを定式化する。
論文 参考訳(メタデータ) (2025-08-28T18:30:52Z) - MAMMAL -- Molecular Aligned Multi-Modal Architecture and Language [0.4631438140637248]
MAMMALは多タスク基盤モデルの作成に応用された汎用的手法であり、多様なモダリティにわたる大規模生物学的データセットから学習する。
11の下流タスクで評価され、9つのタスクでSOTA(the new state of the art)に到達し、2つのタスクでSOTAに匹敵する。
抗体-抗原およびナノボディ-抗原複合体上でのαfold 3結合予測能について検討し, 4点中3点においてMAMMALの分類性能は有意に向上した。
論文 参考訳(メタデータ) (2024-10-28T20:45:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。