論文の概要: Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction
- arxiv url: http://arxiv.org/abs/2505.02471v1
- Date: Mon, 05 May 2025 08:56:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-05-06 18:49:35.61334
- Title: Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction
- Title(参考訳): Ming-Lite-Uni:自然マルチモーダルインタラクションのための統一アーキテクチャの進歩
- Abstract要約: Ming-Lite-Uniは、統一されたビジュアルジェネレータとマルチモーダル自動回帰モデルを備えたオープンソースのフレームワークである。
Ming-Lite-Uniはアルファ段階にあり、間もなく改良される。
- 参考スコア(独自算出の注目度): 39.00641004430462
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce Ming-Lite-Uni, an open-source multimodal framework featuring a newly designed unified visual generator and a native multimodal autoregressive model tailored for unifying vision and language. Specifically, this project provides an open-source implementation of the integrated MetaQueries and M2-omni framework, while introducing the novel multi-scale learnable tokens and multi-scale representation alignment strategy. By leveraging a fixed MLLM and a learnable diffusion model, Ming-Lite-Uni enables native multimodal AR models to perform both text-to-image generation and instruction based image editing tasks, expanding their capabilities beyond pure visual understanding. Our experimental results demonstrate the strong performance of Ming-Lite-Uni and illustrate the impressive fluid nature of its interactive process. All code and model weights are open-sourced to foster further exploration within the community. Notably, this work aligns with concurrent multimodal AI milestones - such as ChatGPT-4o with native image generation updated in March 25, 2025 - underscoring the broader significance of unified models like Ming-Lite-Uni on the path toward AGI. Ming-Lite-Uni is in alpha stage and will soon be further refined.
- Abstract(参考訳): 我々はMing-Lite-Uniを紹介した。Ming-Lite-Uniは、新しく設計された統一ビジュアルジェネレータと、視覚と言語を統一するためのネイティブなマルチモーダル自動回帰モデルを備えたオープンソースのマルチモーダルフレームワークである。
具体的には、MetaQueriesとM2-omniフレームワークをオープンソースで実装し、新しいマルチスケール学習可能なトークンとマルチスケール表現アライメント戦略を導入する。
固定MLLMと学習可能な拡散モデルを活用することで、Ming-Lite-Uniは、ネイティブなマルチモーダルARモデルにより、テキスト・ツー・イメージ生成と命令ベースの画像編集タスクの両方を実行でき、純粋な視覚的理解を超えてその能力を拡張できる。
実験の結果,明-Lite-Uniの強い性能を示し,そのインタラクティブなプロセスの流体特性を印象づけることができた。
すべてのコードとモデルの重み付けは、コミュニティ内でさらなる調査を促進するためにオープンソース化されている。
この作業は、2025年3月25日に更新されたネイティブ画像生成とChatGPT-4oのような同時マルチモーダルAIマイルストーンと一致し、AGIへの道程におけるMing-Lite-Uniのような統一モデルの広範な重要性を強調している。
Ming-Lite-Uniはアルファ段階にあり、間もなく改良される。
関連論文リスト
- Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation [68.03746493619285]
視覚理解,テキスト・ツー・イメージ生成,指導誘導画像編集のための統合マルチモーダル基盤モデルであるJoyAI-Imageを提案する。
我々は,一貫した命令チューニング,長文レンダリングの監督,空間的接地データ,一般および空間的編集信号を組み合わせたスケーラブルなトレーニングレシピを構築した。
JoyAI-Imageは、理解、生成、長文レンダリング、および編集ベンチマークにまたがる実験により、最先端または競争力の高いパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-05-05T15:49:47Z) - Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding [134.93925077411564]
Lumina-DiMOOは、シームレスなマルチモーダル生成と理解のためのオープンソースの基礎モデルである。
完全に離散的な拡散モデリングを使用して、様々なモードにわたる入力と出力を処理する。
複数のベンチマークで最先端のパフォーマンスを実現し、既存のオープンソース統一マルチモーダルモデルを上回っている。
論文 参考訳(メタデータ) (2025-10-07T17:59:20Z) - Query-Kontext: An Unified Multimodal Model for Image Generation and Editing [53.765351127477224]
統一マルチモーダルモデル(UMM)はテキスト・ツー・イメージ生成(T2I)と編集(TI2I)において顕著な性能を示した。
本稿では,マルチモーダル入力から符号化されたセマンティックキューと粗粒度画像条件からなるマルチモーダルコンテクス」を用いて,VLMと拡散モデルをブリッジする新しいアプローチであるQuery-Kontextを紹介する。
実験により,本手法は強い統一ベースラインと一致し,いくつかのケースにおいてタスク固有の最先端手法よりも優れていた。
論文 参考訳(メタデータ) (2025-09-30T17:59:46Z) - VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models [82.05514464090172]
マルチモーダルな大言語モデル(MLLM)は、視覚的およびテキスト的理解の統合を著しく進歩させてきた。
しかし、マルチモーダル入力からコードを生成する能力は依然として限られている。
視覚とコーディング言語モデルをシームレスにマージする統合フレームワークであるVisCodexを紹介します。
論文 参考訳(メタデータ) (2025-08-13T17:00:44Z) - Ming-Omni: A Unified Multimodal Model for Perception and Generation [69.82909107437777]
本稿では,画像,テキスト,音声,ビデオの処理が可能な統合マルチモーダルモデルを提案する。
Ming-Omniは専用エンコーダを使用して異なるモダリティからトークンを抽出し、Lingによって処理する。
Ming-Omniは、オーディオと画像生成をサポートすることで、従来のマルチモーダルモデルを超えて拡張する。
論文 参考訳(メタデータ) (2025-06-11T02:50:49Z) - Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation [54.588082888166504]
我々は、因果アプローチを通じてインターリーブされたマルチモーダル生成を可能にする統一的なフレームワークであるMogaoを提案する。
Mogooは、Deep-fusion設計、デュアルビジョンエンコーダ、インターリーブされた回転位置埋め込み、マルチモーダル分類器フリーガイダンスなど、アーキテクチャ設計における重要な技術的改善のセットを統合している。
実験により,モガオはマルチモーダル理解とテキスト・ツー・イメージ生成において最先端の性能を発揮するとともに,高品質でコヒーレントなインターリーブ・アウトプットの創出にも優れていることが示された。
論文 参考訳(メタデータ) (2025-05-08T17:58:57Z) - ARMOR v0.1: Empowering Autoregressive Multimodal Understanding Model with Interleaved Multimodal Generation via Asymmetric Synergy [14.703591553247948]
ARMORは、既存のマルチモーダルな大規模言語モデルを微調整することで、理解と生成の両方を達成するフレームワークである。
ARMORは、モデルアーキテクチャ、トレーニングデータ、トレーニングアルゴリズムの3つの観点から既存のMLLMを拡張している。
実験により、ARMORは既存のMLLMをUniMにアップグレードし、将来性のある画像生成機能を持つことを示した。
論文 参考訳(メタデータ) (2025-03-09T10:15:39Z) - MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model [49.931663904599205]
MaVEnは、マルチモーダル大言語モデル(MLLM)のマルチモーダル推論能力を高めるために設計された革新的なフレームワークである。
MaVEnは複雑なマルチイメージのシナリオにおけるMLLMの理解を著しく向上するとともに,単一イメージのコンテキストにおけるパフォーマンスも向上することを示す。
論文 参考訳(メタデータ) (2024-08-22T11:57:16Z) - SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for
Multi-modal Large Language Models [86.478087039015]
モデル重み、チューニングタスク、視覚埋め込みを併用した多目的多モード大言語モデル(MLLM)を提案する。
提案したジョイントミキシングに基づいて,高解像度画像のきめ細かい外観をより正確に捉えるための効率的な手法を提案する。
今後のMLLM研究におけるジョイントミキシングの探求に光を当てることを願っている。
論文 参考訳(メタデータ) (2023-11-13T18:59:47Z) - u-LLaVA: Unifying Multi-Modal Tasks via Large Language Model [17.3535277338312]
u-LLaVAは、MLLMの知覚能力を改善するためにピクセル、地域、グローバル機能を統合する革新的な統合マルチタスクフレームワークである。
この研究は、277Kサンプルからなるマスクベースの新しいマルチタスクデータセットに貢献し、MLLMの微粒化知覚能力に挑戦し評価する。
論文 参考訳(メタデータ) (2023-11-09T13:18:27Z) - DreamLLM: Synergistic Multimodal Comprehension and Creation [58.08565432353053]
DreamLLMはマルチモーダル大規模言語モデル(MLLM)を初めて実現した学習フレームワークである
DreamLLMは生のインターリーブドドキュメントの生成を促進し、テキストと画像の両方のコンテンツと非構造化レイアウトをモデル化する。
その結果、DreamLLMはフリーフォームインターリーブコンテンツを生成する最初のMLLMとなった。
論文 参考訳(メタデータ) (2023-09-20T17:58:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。