論文の概要: Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding
- arxiv url: http://arxiv.org/abs/2607.15054v1
- Date: Thu, 16 Jul 2026 14:31:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.137578
- Title: Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding
- Title(参考訳): 単一専門家を超えて:空間理解のためのMLLMにおける多様な視覚的優先順位の調和
- Authors: Xiao Lin, Xiaohu Huang, Kai Han,
- Abstract要約: MLLM(Multimodal Large Language Models)は空間的理解において大きな可能性を証明している。
ViPSは、多様なモデルの可能性をMLLMに完全に解き放つために設計された、新しいマルチモデル以前のフレームワークである。
ViPSは様々な視覚的前提を調和させ、複数の複雑な空間的推論と3次元空間的理解ベンチマークにまたがって新しい最先端性能を確立する。
- 参考スコア(独自算出の注目度): 19.376274836271342
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) have demonstrated substantial promise in spatial understanding. Existing works typically incorporate prior knowledge extracted from a pre-trained foundation model to further enhance the spatial awareness of MLLMs. In this paper, we first reveal that when integrating diverse foundation models into MLLMs, different models provide complementary spatial priors that benefit different tasks. Motivated by this, we propose $\textbf{ViPS}$, a novel multi-model prior framework designed to fully unleash the potential of incorporating multiple $\textbf{Vi}$sual $\textbf{P}$riors from diverse models into MLLMs for $\textbf{S}$patial understanding. Specifically, ViPS introduces an Efficient Prior Proxy to generate multiple foundational priors with minimal inference overhead, and a Dynamic Prior Fusion mechanism to achieve harmonious and context-aware prior fusion and injection from the prior proxies. Extensive experiments demonstrate that ViPS successfully harmonizes diverse visual priors, establishing new state-of-the-art performance across multiple complex spatial reasoning and 3D spatial understanding benchmarks. Project page: https://visual-ai.github.io/vips
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は空間的理解において大きな可能性を証明している。
既存の研究は、MLLMの空間的認識をさらに高めるために、訓練済みの基礎モデルから抽出された事前知識を取り入れている。
本稿では,多種多様な基礎モデルをMLLMに組み込む場合,異なるモデルが相補的な空間的事前情報を提供し,様々な作業に役立てることを明らかにする。
これは、さまざまなモデルから複数の$\textbf{Vi}$sual $\textbf{P}$riorsをMLLMに組み込んで、$\textbf{S}$patialな理解を可能にする、新しいマルチモデル事前フレームワークである。
具体的には、ViPSは、推論オーバーヘッドを最小限に抑えた複数の基礎的なプリミティブを生成するための効率的なプリミティブプロキシを導入し、動的プリミティブメカニズムは、以前のプロキシからの調和的でコンテキスト対応のプリミティブとインジェクションを実現する。
広汎な実験により、VPSは様々な視覚的先行と調和し、複数の複雑な空間的推論と3次元空間的理解ベンチマークにまたがって新しい最先端の性能を確立することができた。
プロジェクトページ: https://visual-ai.github.io/vips
関連論文リスト
- Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models [45.592930731636386]
マルチモーダルビデオ生成に適した最初の表現アライメント手法であるM2$-REPAを提案する。
まず、拡散モデルの中間表現からモダリティ固有の特徴を分離し、それぞれ対応する専門的基礎モデルと整合させる。
本手法は, 視覚的品質と長期的整合性において, ベースラインを著しく上回っている。
論文 参考訳(メタデータ) (2026-05-03T14:22:22Z) - Knowledge is Power: Advancing Few-shot Action Recognition with Multimodal Semantics from MLLMs [37.35588113092876]
我々は,FSARの強化のためのマルチモーダル知識基盤としてMLLMを利用する最初のエンドツーエンド手法であるFSAR-LLaVAを提案する。
まず,MLLMのマルチモーダルデコーダを用いて時間的・意味的に豊かな表現を抽出する。
次に,MLLMの汎用性を活用して,多様なシナリオに柔軟に対応する入力プロンプトを構築する。
最後に,マルチモーダルな特徴を併用してメトリック学習をガイドするために,トレーニング不要なマルチモーダルプロトタイプマッチングメトリクスを導入する。
論文 参考訳(メタデータ) (2026-03-27T03:05:56Z) - Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion [66.78268790956493]
オムニ・ディフュージョン(Omni-Diffusion)は、マスクベースの離散拡散モデルに基づいて構築された、最初の任意のマルチモーダル言語モデルである。
本手法は2つ以上のモダリティを処理する既存のマルチモーダルシステムに匹敵する性能または性能を示す。
論文 参考訳(メタデータ) (2026-03-06T18:59:57Z) - See&Trek: Training-Free Spatial Prompting for Multimodal Large Language Model [33.18304419115947]
SEE&TREKは、視覚のみの制約下でのマルチモーダル大言語モデル(MLLM)の空間的理解を強化する最初のトレーニングフリープロンプトフレームワークである。
視覚的多様性の向上と運動再建に注力する。
本手法はトレーニング・GPUフリーであり,1回のフォワードパスしか必要とせず,既存のMLLMSにシームレスに統合できる。
論文 参考訳(メタデータ) (2025-09-19T15:30:26Z) - OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging [124.91183814854126]
モデルマージは、複数のエキスパートモデルをひとつのモデルに組み合わせようとしている。
本稿ではMLLMのトレーニングと評価のタスクを明確に分割したモデルマージ研究のベンチマークを紹介する。
モデルマージは、トレーニングデータを必要とせずに改善されたMLLMを構築するための有望な方法であることがわかった。
論文 参考訳(メタデータ) (2025-05-26T12:23:14Z) - M$^3$GPT: An Advanced Multimodal, Multitask Framework for Motion Comprehension and Generation [78.77004913030285]
M$3$GPTは、理解と生成のための先進的な$textbfM$ultimodal, $textbfM$ultitaskフレームワークである。
我々は、テキスト、音楽、モーション/ダンスなどのマルチモーダルな条件信号に対して離散ベクトル量子化を用い、大きな言語モデルへのシームレスな統合を可能にした。
M$3$GPTは、様々な動作関連タスク間の接続とシナジーをモデル化することを学ぶ。
論文 参考訳(メタデータ) (2024-05-25T15:21:59Z) - SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for
Multi-modal Large Language Models [86.478087039015]
モデル重み、チューニングタスク、視覚埋め込みを併用した多目的多モード大言語モデル(MLLM)を提案する。
提案したジョイントミキシングに基づいて,高解像度画像のきめ細かい外観をより正確に捉えるための効率的な手法を提案する。
今後のMLLM研究におけるジョイントミキシングの探求に光を当てることを願っている。
論文 参考訳(メタデータ) (2023-11-13T18:59:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。