論文の概要: Rosetta: Composable Native Multimodal Pretraining
- arxiv url: http://arxiv.org/abs/2607.00293v1
- Date: Wed, 01 Jul 2026 00:42:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.673672
- Title: Rosetta: Composable Native Multimodal Pretraining
- Title(参考訳): Rosetta: 構成可能なネイティブマルチモーダル事前トレーニング
- Abstract要約: Rosettaは、シームレスで非破壊的なモダリティ拡張のための、構成可能なネイティブマルチモーダル事前トレーニングフレームワークである。
グローバルな共有専門家の中核的な知識を保ち、モダリティ固有の能力はプラグアンドプレイの専門家に分散している。
優れた画像生成を提供し、クロスモーダルのシナジーをアンロックし、真に構成可能で統一されたマルチモーダル基盤モデルへの道を開く。
- 参考スコア(独自算出の注目度): 45.254713953182716
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Achieving true artificial general intelligence requires foundation models capable of integrating new modalities without forgetting prior knowledge. However, accommodating continuous generative objectives alongside discrete understanding tasks causes severe gradient conflicts. Existing architectures, including standard Mixture-of-Experts (MoE), are highly susceptible to representation overwriting. Even structurally partitioned paradigms like Mixture-of-Transformers (MoT) remain vulnerable to catastrophic forgetting, severely impeding multimodal scalability. In this work, we introduce Rosetta, a composable native multimodal pretraining framework designed for seamless and non-destructive modality expansion. Rosetta adopts a modular paradigm where core foundational knowledge is preserved within global shared experts, while modality-specific capabilities are distributed across plug-and-play experts. To guarantee non-destructive composition, we propose Momentum-Anchored Orthogonal Projection (MAOP). MAOP leverages the optimizer's momentum state as an implicit semantic anchor, selectively neutralizing conflicting gradient components from new modalities while preserving synergistic updates. Extensive evaluations demonstrate that, while standard MoE and MoT architectures suffer catastrophic forgetting of previously acquired knowledge, Rosetta robustly preserves established language and visual understanding. Furthermore, it delivers superior image generation and unlocks cross-modal synergy, paving the way for truly composable and unified multimodal foundation models. To facilitate further multimodal research, we release our code and checkpoints to the community. Project page at https://rosetta-lmm.github.io/.
- Abstract(参考訳): 真の汎用人工知能を達成するためには、事前の知識を忘れずに新しいモダリティを統合できる基礎モデルが必要である。
しかし、個別の理解タスクと平行して連続的な生成目的を調節することは、深刻な勾配の衝突を引き起こす。
標準的なMixture-of-Experts (MoE)を含む既存のアーキテクチャは、上書きの表現に非常に敏感である。
Mixture-of-Transformers (MoT)のような構造的に分割されたパラダイムでさえ、破滅的な忘れ込みに弱いままであり、マルチモーダルスケーラビリティを著しく妨げている。
本稿では, シームレスで非破壊的なモダリティ拡張を目的とした, 構成可能なネイティブマルチモーダル事前学習フレームワークであるRosettaを紹介する。
Rosetta氏は、コアとなる基礎知識をグローバルな共有専門家内に保持するモジュールパラダイムを採用し、モダリティ固有の能力はプラグアンドプレイの専門家に分散している。
非破壊的な構成を保証するため,モーメントアンコール直交射影(MAOP)を提案する。
MAOPはオプティマイザの運動量状態を暗黙のセマンティックアンカーとして利用し、相乗的更新を保ちつつ、競合する勾配成分を新しいモードから選択的に中和する。
大規模な評価では、標準的な MoE と MoT アーキテクチャは、以前獲得した知識を破滅的に忘れてしまうが、Rosetta は確立した言語と視覚的理解をしっかりと保存している。
さらに、優れた画像生成を提供し、クロスモーダルなシナジーを解放し、真に構成可能で統一されたマルチモーダル基盤モデルへの道を開く。
さらなるマルチモーダルな研究を容易にするため、私たちはコードとチェックポイントをコミュニティにリリースします。
プロジェクトページはhttps://rosetta-lmm.github.io/。
関連論文リスト
- CP-MoE: Consistency-Preserving Mixture-of-Experts for Continual Learning [16.033361968793162]
大型言語モデル (LLM) と視覚言語モデル (VLM) における連続学習の大きな障害は、依然として破滅的な忘れ方である。
CP-MoEは、タスク固有の初期更新をキャプチャし、安定した専門家への統合をガイドする、一貫した専門家を中心に構築された継続的学習フレームワークである。
CP-MoE を LLM と VLM をベースとした MoE モデルを用いて一様および多モード連続学習ベンチマークで検証する。
論文 参考訳(メタデータ) (2026-05-18T06:31:14Z) - SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture [110.20462227888915]
NEO-Unify上に構築されたネイティブ統一マルチモーダルパラダイムであるSenseNova-U1を紹介する。
SenseNova-U1-8B-MoT と SenseNova-U1-A3B-MoT の2つのネイティブ統一型について述べる。
また,コミュニティ研究を支援するためのモデル設計,データ前処理,事前/後学習,推論戦略についても紹介する。
論文 参考訳(メタデータ) (2026-05-12T17:59:58Z) - Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding [45.254713953182716]
本稿では,Mixture-of-Experts (MoE) Transformersアーキテクチャにおけるタスク干渉を解決するための統合事前学習フレームワークであるSymbiotic-MoEを提案する。
Modality-Aware Expert Disentanglementは、共有専門家が生成タスクからきめ細かい視覚的意味を吸収することを可能にする。
実験により、共生-MoEはクロスモーダルのシナジーを解き放ちながら、迅速に生成的収束を達成できることが示された。
論文 参考訳(メタデータ) (2026-04-09T03:19:26Z) - LongCat-Next: Lexicalizing Modalities as Discrete Tokens [111.50794040093656]
LongCat-Nextは、テキスト、ビジョン、オーディオを単一の自己回帰的目的の下で処理する、ネイティブなマルチモーダルモデルである。
特にLongCat-Nextは、タスク理解における離散視覚モデリングの長年のパフォーマンス上限に対処している。
ネイティブなマルチモダリティに向けた試みとして、LongCat-Nextとそのトークンライザをオープンソースとして公開し、コミュニティにおけるさらなる研究と開発を促進したいと思っています。
論文 参考訳(メタデータ) (2026-03-29T06:35:03Z) - Top 10 Open Challenges Steering the Future of Diffusion Language Model and Its Variants [85.33837131101342]
本稿では,基盤基盤,アルゴリズム最適化,認知推論,統合マルチモーダルインテリジェンスという4つの柱で構成された戦略ロードマップを提案する。
この移行は、複雑な構造的推論、動的自己補正、シームレスなマルチモーダル統合が可能な次世代AIの開発に不可欠である、と我々は主張する。
論文 参考訳(メタデータ) (2026-01-20T14:58:23Z) - NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching [64.10695425442164]
NExT-OMNI(英語版)は、離散フローパラダイムによる統一モデリングを実現するオープンソース・オムニモーダル・ファンデーション・モデルである。
NExT-OMNIは、大規模なインターリーブ付きテキスト、画像、ビデオ、オーディオデータに基づいて訓練され、マルチモーダル生成および理解ベンチマーク上で競合するパフォーマンスを提供する。
さらなる研究を進めるために、トレーニングの詳細、データプロトコル、およびコードとモデルチェックポイントの両方をオープンソース化する。
論文 参考訳(メタデータ) (2025-10-15T16:25:18Z) - Growing Transformers: Modular Composition and Layer-wise Expansion on a Frozen Substrate [1.0152838128195467]
大規模言語モデル(LLM)をスケールするための一般的なパラダイムは、モノリシックなエンドツーエンドのトレーニングである。
本稿では,トランスフォーマーにおける創発的意味論の原理によって実現された,代替的,建設的なスケーリングパラダイムについて考察する。
私たちはこれを、初期段階の厳密な層凍結とモデルスタック全体の効率的で総合的な微調整を組み合わせた、階層的に構築的な手法で運用します。
論文 参考訳(メタデータ) (2025-07-08T20:01:15Z) - Mixture of Experts Made Intrinsically Interpretable [34.36996159677674]
我々は,emphintrinsically interpretableとして設計されたMixture-of-Experts (MoE)言語モデルである textbfMoE-X を提案する。
我々のアプローチは、言語モデルにおいて、スパースアクティベーションを持つより広いネットワークが解釈可能な要因を捉える傾向にあるという観察に動機づけられている。
MoE-X は GPT-2 よりもパープレキシティが良く、解釈性はスパースオートエンコーダ (SAE) ベースのアプローチを超えている。
論文 参考訳(メタデータ) (2025-03-05T17:40:54Z) - AllSpark: A Multimodal Spatio-Temporal General Intelligence Model with Ten Modalities via Language as a Reference Framework [21.10693332367192]
マルチモーダル時間汎用人工知能モデルであるAllSparkを提案する。
私たちのモデルは10の異なるモダリティを統一されたフレームワークに統合します。
実験により、AllSparkは言語を組み込むことで、数ショットの分類タスクで優れていることが示されている。
論文 参考訳(メタデータ) (2023-12-31T17:21:02Z) - Language Models are General-Purpose Interfaces [109.45478241369655]
本稿では,様々な基礎モデルに対する汎用インタフェースとして言語モデルを提案する。
事前訓練されたエンコーダのコレクションは、様々なモダリティ(ビジョンや言語など)を知覚する
インタフェースとモジュールエンコーダを協調的に事前学習するための半因果言語モデリング手法を提案する。
論文 参考訳(メタデータ) (2022-06-13T17:34:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。