論文の概要: S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation
- arxiv url: http://arxiv.org/abs/2607.15686v1
- Date: Fri, 17 Jul 2026 06:56:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.776356
- Title: S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation
- Title(参考訳): S1-Omni:科学理解・予測・生成のための統一マルチモーダル推論モデル
- Abstract要約: 我々はS1-Omniを科学的理解・予測・生成のための統合多モーダル推論モデルとして提示する。
S1-Omniのアーキテクチャは、科学データの統一表現、自然界の知識アライメント、ドメイン固有のタスクのデコードという3つのコアコンポーネントの上に構築されている。
S1-Omniは200の科学的タスクをカバーし、数百万の推論サンプルを含むS1-Omni-Corpusで訓練され、60以上の科学的ベンチマークで評価されている。
- 参考スコア(独自算出の注目度): 31.901449470705618
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present S1-Omni, a unified multimodal reasoning model for scientific understanding, prediction, and generation. AI for Science (AI4S) has advanced significantly through domain-specific models, tool-augmented LLMs, and scientific language models. However, model capabilities remain highly fragmented, limiting the joint modeling of heterogeneous data, scientific laws, and expert knowledge. S1-Omni addresses this gap by consolidating these capabilities into a single, coherent scientific reasoning model. The architecture of S1-Omni is built upon three core components: unified representation of scientific data, natural-world knowledge alignment, and decoding for domain-specific tasks. First, S1-Omni maps natural-language instructions and scientific objects, including CIF, SMILES, protein sequences, spectra, and scientific images, into a shared representation space. Second, it incorporates scientific laws and expert knowledge into data construction and training, enabling the model to reason from scientific evidence. Third, it performs task-specific decoding to support a broad range of applications, including property prediction, spectrum-to-molecular generation, protein site and structure prediction, and scientific image generation and editing. S1-Omni is trained on S1-Omni-Corpus, which covers 200 scientific tasks and contains millions of reasoning samples, and is evaluated on over 60 scientific benchmarks. It outperforms GPT-5.5 and Gemini-3.1-Pro on most benchmarks and matches or surpasses domain-specific models on several benchmarks. Overall, S1-Omni provides a practical path toward unified scientific modeling.
- Abstract(参考訳): 本稿では,S1-Omniを科学的理解,予測,生成のための統一型マルチモーダル推論モデルとして提示する。
AI for Science(AI4S)は、ドメイン固有モデル、ツール拡張LLM、科学言語モデルを通じて大きく進歩している。
しかし、モデル能力は非常に断片化されており、異種データの連成モデリング、科学法則、専門家の知識が制限されている。
S1-Omniはこのギャップに対処し、これらの能力を単一の一貫性のある科学的推論モデルに統合する。
S1-Omniのアーキテクチャは、科学データの統一表現、自然界の知識アライメント、ドメイン固有のタスクのデコードという3つのコアコンポーネントの上に構築されている。
まず、S1-Omniは、CIF、SMILES、タンパク質配列、スペクトル、科学画像などの自然言語命令と科学オブジェクトを共有表現空間にマッピングする。
第二に、科学的法則と専門家の知識をデータ構築と訓練に取り入れることで、モデルが科学的証拠から推論することができる。
第3に、プロパティ予測、スペクトル-分子生成、タンパク質部位と構造予測、科学的画像生成と編集など、幅広い応用をサポートするためにタスク固有のデコードを実行する。
S1-Omniは200の科学タスクをカバーし、数百万の推論サンプルを含むS1-Omni-Corpusで訓練され、60以上の科学ベンチマークで評価されている。
GPT-5.5 や Gemini-3.1-Pro よりも優れており、多くのベンチマークではドメイン固有のモデルよりも優れている。
全体として、S1-Omniは統一された科学モデリングへの実践的な道を提供する。
関連論文リスト
- Monkey King Bang: A Unified Scientific Multimodal Foundation Model [26.409792993729948]
我々は、理解と生成の両方のための統一的な科学的マルチモーダルモデルであるMKBを紹介する。
MKBは、DNA、RNA、タンパク質、小分子、地球科学、医療画像を含む6つの科学分野をカバーしている。
生物配列、分子弦、気象場、セグメンテーションマスクなどのネイティブな出力をサポートする。
論文 参考訳(メタデータ) (2026-07-17T13:56:50Z) - S1-Omni-Image: A Unified Model for Scientific Image Understanding, Generation, and Editing [25.725824689793402]
本稿では,科学画像の理解,生成,編集のためのオープンウェイト統一マルチモーダルモデルを提案する。
S1-Omni-Imageは、バックボーンS1-VL-32Bの科学的なマルチモーダル推論に基づいている。
統一されたフレームワークで、科学的な画像理解、生成、編集をサポートする。
論文 参考訳(メタデータ) (2026-06-23T11:19:34Z) - Speaking the Language of Science: Toward a General-Purpose Generative Foundation Model for the Natural Sciences [89.71422932447423]
LOGOSは、自然科学における異種タスクを統一する科学生成言語モデルである。
空間的接触パターンと制約パターンを離散トークンとして表現することにより、モデルは純粋にシーケンシャルな方法で複雑な構造的相互作用をキャプチャする。
多様なタスクにわたって、LOGOSは一貫してドメイン固有のベースラインにマッチまたは性能を向上する。
論文 参考訳(メタデータ) (2026-06-15T16:14:53Z) - Faithful, Enriched, and Precise: Benchmarking Natural-Science Illustration Generation by T2I models [49.93401412148884]
FEPBenchは、慎重に選択された高品質な科学イラストから構築されたベンチマークである。
我々は,T2Iモデルについて,命令忠実度,推論エンリッチメント,意味的精度の3つの次元に沿って評価する。
その結果、GPT Image 2やNano Banana Proのような最先端のクローズドソースモデルでさえ、テキストレンダリングのボトルネック、推論のリッチ化の制限、生成のリッチネスと精度のバランスの難しさに悩まされていることがわかった。
論文 参考訳(メタデータ) (2026-06-04T09:49:02Z) - Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scale [243.02537333434245]
Intern-S1-Proは、最初の1トリリオンパラメータの科学マルチモーダル基礎モデルである。
その科学的専門知識は、重要な科学分野にまたがって100以上の専門的なタスクを習得するために大幅に拡張されている。
XTuner と LMDeploy は、1-トリリオンパラメータレベルでの強化学習(RL)の訓練を効率的に行う。
論文 参考訳(メタデータ) (2026-03-26T05:21:45Z) - A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers [251.23085679210206]
科学大規模言語モデル(Sci-LLMs)は、科学研究において、知識の表現、統合、適用の方法を変えつつある。
この調査は、モデルとその基盤となるデータ基板の共進化として、Sci-LLMの開発を再考する。
我々は、科学的データの統一された分類法と、科学的知識の階層的なモデルを定式化する。
論文 参考訳(メタデータ) (2025-08-28T18:30:52Z) - OmniScience: A Domain-Specialized LLM for Scientific Reasoning and Discovery [12.306721865990053]
一般科学のための専門的な大規模推論モデルであるOmniScienceを紹介する。
我々は、分子を潜在的電解質溶媒または添加剤として効率よくランク付けする電池剤を開発した。
我々は,ドメイン適応型事前学習と推論に基づく知識蒸留が性能レベルを達成するために重要であることをアブレーション実験で実証した。
論文 参考訳(メタデータ) (2025-03-22T01:18:59Z) - Nature Language Model: Deciphering the Language of Nature for Scientific Discovery [105.55751854768297]
基礎モデルは自然言語処理と人工知能に革命をもたらした。
本研究では,科学発見のためのシーケンスベース科学基盤モデルであるNatureLMを紹介する。
論文 参考訳(メタデータ) (2025-02-11T13:08:03Z) - A Comprehensive Survey of Scientific Large Language Models and Their Applications in Scientific Discovery [68.48094108571432]
大規模言語モデル(LLM)は、テキストやその他のデータ処理方法に革命をもたらした。
我々は,科学LLM間のクロスフィールドおよびクロスモーダル接続を明らかにすることで,研究ランドスケープのより総合的なビューを提供することを目指している。
論文 参考訳(メタデータ) (2024-06-16T08:03:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。