論文の概要: M*: A Modular, Extensible, Serving System for Multimodal Models
- arxiv url: http://arxiv.org/abs/2606.12688v2
- Date: Sat, 13 Jun 2026 05:57:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 13:45:31.11842
- Title: M*: A Modular, Extensible, Serving System for Multimodal Models
- Title(参考訳): M*:マルチモーダルモデルのためのモジュール型拡張型サービングシステム
- Abstract要約: 本稿では,複合AIモデルの効率的な提供を目的とした汎用サービスシステムであるM*を提案する。
広範囲の家族から合成モデルを簡潔にキャプチャする方法を示す。
M*はまた、ロボット計画のためのV-JEPA 2-ACロールアウトベースラインを最大12.5倍上回っている。
- 参考スコア(独自算出の注目度): 62.77975969000349
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We are entering a new era of composite model architectures that integrate diverse components such as vision encoders, language backbones, diffusion and flow heads, audio codecs, action generators, and world-model predictors. Such architectures underpin a broad class of multimodal models, including unified multimodal models, omni models, speech-language models, vision-language-action policies, and world models. However, existing model serving frameworks were built on narrow assumptions about model structure, making them ill-suited to accommodate this new architectural diversity. Here we present M*, a universal serving system for efficient serving of composite AI models. M* represents models as dataflow graphs, processing requests spanning diverse modalities and tasks as traversals over these graphs. The core insight is a modular abstraction that supports arbitrary composition of model components, flexible placement onto a physical cluster, and model-agnostic optimizations within a distributed runtime. We call this abstraction the Walk Graph and show how it can concisely capture composite models from a broad range of families. We instantiate M* on representative models and find that it achieves, on average, 20% lower end-to-end latency than vLLM-Omni for text-to-image workloads on BAGEL, while delivering up to 2.9x lower real-time factor and 2.7x higher throughput for text-to-speech workloads on Qwen3-Omni. M* also outperforms the V-JEPA 2-AC rollout baseline for robotic planning by up to 12.5x. Thus, our work paves the road towards more efficient serving of complex models with minimal developer effort.
- Abstract(参考訳): 我々は、視覚エンコーダ、言語バックボーン、拡散とフローヘッド、オーディオコーデック、アクションジェネレータ、世界モデル予測器といった多様なコンポーネントを統合する複合モデルアーキテクチャの新しい時代に入った。
このようなアーキテクチャは、統一マルチモーダルモデル、オムニモデル、言語モデル、視覚言語アクションポリシー、世界モデルなど、幅広い種類のマルチモーダルモデルを支える。
しかし、既存のモデル提供フレームワークはモデル構造に関する狭い前提に基づいて構築されており、この新しいアーキテクチャの多様性に対応するのに不適当である。
本稿では,複合AIモデルの効率的な提供を目的とした汎用サービスシステムであるM*について述べる。
M*はモデルをデータフローグラフとして表現し、さまざまなモダリティとタスクをまたいだ要求をこれらのグラフ上のトラバーサルとして処理する。
中心となる洞察は、モデルコンポーネントの任意の構成、物理クラスタへの柔軟な配置、分散ランタイム内のモデル非依存の最適化をサポートするモジュール化された抽象化である。
この抽象化をウォークグラフと呼び、広範囲のファミリーから合成モデルを簡潔にキャプチャする方法を示します。
我々は代表モデル上でM*をインスタンス化し、BAGEL上のテキスト・トゥ・イメージのワークロードでは平均20%のレイテンシを vLLM-Omni よりも低くし、Qwen3-Omni 上でのテキスト・トゥ・音声のワークロードでは最大2.9倍のリアルタイム係数と2.7倍のスループットを提供する。
M*はまた、ロボット計画のためのV-JEPA 2-ACロールアウトベースラインを最大12.5倍上回っている。
このように、当社の作業は、開発者の最小限の労力で、複雑なモデルのより効率的な提供に向けた道を開いたのです。
関連論文リスト
- Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space [52.34072027212278]
埋め込みモデルは、セマンティック検索や検索強化生成のような現代のAIシステムの基本コンポーネントである。
大規模基盤モデルの最近の進歩は、埋め込みモデルの開発を著しく加速させてきた。
マルチモーダルdLLMを埋め込みモデルに変換するための最初の体系的研究について述べる。
論文 参考訳(メタデータ) (2026-01-19T06:51:15Z) - Show-o2: Improved Native Unified Multimodal Models [57.34173415412808]
Show-o2は、自動回帰モデリングとフローマッチングを利用するネイティブ統合マルチモーダルモデルである。
3次元因果変分オートエンコーダ空間上に構築され、空間的(時間的)融合の二重経路によって統一された視覚表現が構成される。
論文 参考訳(メタデータ) (2025-06-18T15:39:15Z) - OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging [124.91183814854126]
モデルマージは、複数のエキスパートモデルをひとつのモデルに組み合わせようとしている。
本稿ではMLLMのトレーニングと評価のタスクを明確に分割したモデルマージ研究のベンチマークを紹介する。
モデルマージは、トレーニングデータを必要とせずに改善されたMLLMを構築するための有望な方法であることがわかった。
論文 参考訳(メタデータ) (2025-05-26T12:23:14Z) - VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks [60.5257456681402]
幅広い下流タスクを扱える普遍的な埋め込みを構築する可能性について検討する。
We build a series of VLM2Vec model on SoTA VLMs like Phi-3.5-V, LLaVA-1.6 and evaluate them on MMEB's evaluation split。
以上の結果から,VLM2Vecは既存のマルチモーダル埋め込みモデルよりも10%から20%の絶対的な平均的改善を実現していることがわかった。
論文 参考訳(メタデータ) (2024-10-07T16:14:05Z) - ACE: All-round Creator and Editor Following Instructions via Diffusion Transformer [40.32254040909614]
視覚生成タスクのための全ラウンドクリエータとエディタであるACEを提案する。
まず、Long-Context Condition Unit (LCU)と呼ばれる統一条件形式を導入する。
次に,LCUを入力として使用するトランスフォーマーに基づく新しい拡散モデルを提案する。
論文 参考訳(メタデータ) (2024-09-30T17:56:27Z) - SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation [61.392147185793476]
統一的で汎用的な基礎モデル、すなわちSEED-Xを提案する。
SEED-Xは、理解および生成タスクのための多粒度視覚意味論をモデル化することができる。
我々の研究が、現実世界のアプリケーションで多目的なマルチモーダル基盤モデルによって達成できるものについて、将来の研究に刺激を与えることを期待しています。
論文 参考訳(メタデータ) (2024-04-22T17:56:09Z) - A Lightweight Feature Fusion Architecture For Resource-Constrained Crowd
Counting [3.5066463427087777]
クラウドカウントモデルの汎用性を高めるために,2つの軽量モデルを導入する。
これらのモデルは、MobileNetとMobileViTという2つの異なるバックボーンを持ちながら、同じダウンストリームアーキテクチャを維持している。
隣接特徴融合を利用して、事前学習モデル(PTM)から多様な特徴を抽出し、その後、シームレスにこれらの特徴を組み合わせる。
論文 参考訳(メタデータ) (2024-01-11T15:13:31Z) - Reformulating Vision-Language Foundation Models and Datasets Towards
Universal Multimodal Assistants [65.47222691674074]
Muffinフレームワークは、事前訓練された視覚言語モデルを使用して視覚信号のプロバイダとして機能する。
UniMM-Chatデータセットはデータセットの相補性を探求し、高品質で多様なマルチモーダル命令を生成する。
論文 参考訳(メタデータ) (2023-10-01T12:35:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。