論文の概要: SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding
- arxiv url: http://arxiv.org/abs/2608.05137v1
- Date: Wed, 05 Aug 2026 17:56:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.071251
- Title: SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding
- Title(参考訳): SmartMage: 3Dシーン理解のための動的モダリティオーケストレーション
- Authors: Yue Zhang, Yingzhao Jian, Yunqiu Xu, Xiaoxiao Sun, Hehe Fan,
- Abstract要約: 既存のMLLM(Multimodal Large Language Models)は通常、クエリ依存のモダリティニーズを見越して、固定されたモダリティの組み合わせに依存している。
本稿では,セマンティック・アウェアな3Dシーン理解のための異種モーダルを動的にオーケストレーションする統合MLLMであるSmartMageを提案する。
SmartMageは5つの3Dシーン理解ベンチマークで最先端のパフォーマンスを達成し、RGBのみのビデオ理解ベンチマークで競合する結果を得る。
- 参考スコア(独自算出の注目度): 30.617509486770743
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Understanding 3D scenes is fundamental to embodied intelligence, requiring joint reasoning over heterogeneous information from multiple modalities, including visual and geometric cues. However, the relevance of these modalities often varies across queries. Existing Multimodal Large Language Models (MLLMs) typically rely on fixed modality combinations, overlooking query-dependent modality needs. Such a rigid design can introduce semantic noise from irrelevant modalities while underutilizing more informative ones, leading to wasted computation and diluted reasoning. To address these challenges, this paper proposes SmartMage, a unified MLLM that dynamically orchestrates heterogeneous modalities for semantic-aware 3D scene understanding. Specifically, SmartMage incorporates: (1) a Semantic-guided Modality Adaptive RouTng (SMART) module that selects task-relevant modalities using semantic priors, text-modality alignment, and modality quality; and (2) a Modality-Aware Gating Expert (MAGE) module that leverages modality priors to guide expert activation, fostering adaptive specialization in multimodal reasoning. Empirically, SmartMage achieves state-of-the-art performance across five 3D scene understanding benchmarks, and attains competitive results on RGB-only video understanding benchmarks. In our diagnostic benchmark ScanFacet, tasks are divided into fine-grained semantic categories, enabling analysis of modality combinations preferred by each semantic type. The observed modality-semantic patterns provide further evidence of SmartMage's effectiveness. Project page: https://yuecheong.github.io/SmartMage/.
- Abstract(参考訳): 3Dシーンを理解することはインテリジェンスを具現化するための基本であり、視覚的および幾何学的手がかりを含む複数のモードからの異種情報に対する共同推論を必要とする。
しかし、これらのモダリティの関連性はしばしばクエリによって異なる。
既存のMLLM(Multimodal Large Language Models)は通常、クエリ依存のモダリティニーズを見越して、固定されたモダリティの組み合わせに依存している。
このような厳密な設計は、無関係なモダリティからのセマンティックノイズを導入しつつ、より情報的なノイズを弱め、無駄な計算と希薄な推論をもたらす。
これらの課題に対処するために,セマンティック・アウェアな3Dシーン理解のための異質なモーダルを動的にオーケストレーションする統合MLLMであるSmartMageを提案する。
具体的には,(1)セマンティック・ガイダンス・モダリティ・アダプティブ・ルータング(SMART)モジュール,(2)セマンティック・モダリティ・アライメント,およびモダリティ・クオリティを用いたタスク関連モダリティを選択するモジュール,(2)モダリティ・アウェア・ゲーティング・エキスパート(MAGE)モジュールを,専門家のアクティベーションをガイドし,マルチモーダル推論における適応的特殊化を促進するモジュールを組み込んだ。
実証的には、SmartMageは5つの3Dシーン理解ベンチマークで最先端のパフォーマンスを達成し、RGBのみのビデオ理解ベンチマークで競合する結果を得る。
診断ベンチマークScanFacetでは,タスクを細粒度セマンティックカテゴリに分割し,各セマンティックタイプが好むモダリティの組み合わせの分析を可能にする。
観察されたモダリティ・セマンティックパターンは、SmartMageの有効性のさらなる証拠となる。
プロジェクトページ: https://yuecheong.github.io/SmartMage/。
関連論文リスト
- MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models [70.34265674686516]
マルチモーダル埋め込みモデルは、テキスト、画像、ビデオ、オーディオなどの異種入力を共有意味空間にマッピングすることを目的としている。
本稿では,テキスト,画像,ビデオ,オーディオ,エージェント中心のシナリオにまたがる埋め込みを評価するベンチマークであるMMEB-V3を紹介する。
本研究は, 完全モダリティ埋め込みの系統的解析を行い, 3つの重要な知見を同定する。
論文 参考訳(メタデータ) (2026-04-25T14:15:05Z) - Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding [48.14432643308697]
長いビデオ理解は、マルチモーダルな大規模言語モデルにとって非常に難しい課題です。
Q-Gateは、選択を動的モダリティルーティング問題として扱うプラグイン・アンド・プレイフレームワークである。
論文 参考訳(メタデータ) (2026-04-19T13:04:18Z) - STMI: Segmentation-Guided Token Modulation with Cross-Modal Hypergraph Interaction for Multi-Modal Object Re-Identification [14.549172375231729]
3つの主要コンポーネントからなる新しいマルチモーダル学習フレームワークSTMIを提案する。
マルチモーダルReIDシナリオにおけるSTMIフレームワークの有効性とロバスト性を実証する。
論文 参考訳(メタデータ) (2026-02-28T15:07:10Z) - RingMo-Agent: A Unified Remote Sensing Foundation Model for Multi-Platform and Multi-Modal Reasoning [15.670921552151775]
RingMo-Agentはマルチモーダルおよびマルチプラットフォームデータを扱うように設計されている。
RS-VL3Mと呼ばれる大規模な視覚言語データセットでサポートされている。
これは視覚的理解と高度な分析タスクの両方に有効である。
論文 参考訳(メタデータ) (2025-07-28T12:39:33Z) - SM3Det: A Unified Model for Multi-Modal Remote Sensing Object Detection [79.58755811919366]
本稿では,リモートセンシングのためのマルチモーダルデータセットとマルチタスクオブジェクト検出(M2Det)という新しいタスクを提案する。
水平方向または指向方向の物体を、あらゆるセンサーから正確に検出するように設計されている。
この課題は、1)マルチモーダルモデリングの管理に関わるトレードオフ、2)マルチタスク最適化の複雑さに起因する。
論文 参考訳(メタデータ) (2024-12-30T02:47:51Z) - OmniBench: Towards The Future of Universal Omni-Language Models [63.16606414452612]
OmniBenchは、視覚的、音響的、テキスト的入力を同時に認識し、解釈し、推論する能力を評価するために設計された新しいベンチマークである。
評価の結果,オープンソース OLM は三モーダル文脈における命令追従や推論に重大な制限があることが明らかとなった。
我々は,OLM性能を向上させるため,より堅牢な3モーダル統合技術とトレーニング戦略の開発を提唱する。
論文 参考訳(メタデータ) (2024-09-23T17:59:05Z) - Learning Modality-agnostic Representation for Semantic Segmentation from Any Modalities [8.517830626176641]
Any2Segは、任意の視覚的条件におけるモダリティの組み合わせから堅牢なセグメンテーションを実現する新しいフレームワークである。
4つのモダリティを持つ2つのベンチマークの実験は、Any2Segがマルチモーダル設定の下で最先端を達成することを示した。
論文 参考訳(メタデータ) (2024-07-16T03:34:38Z) - Modality Prompts for Arbitrary Modality Salient Object Detection [57.610000247519196]
本論文は、任意のモーダリティ・サリエント物体検出(AM SOD)の課題について述べる。
任意のモダリティ、例えばRGBイメージ、RGB-Dイメージ、RGB-D-Tイメージから有能なオブジェクトを検出することを目的としている。
AM SODの2つの基本的な課題を解明するために,新しいモード適応トランス (MAT) を提案する。
論文 参考訳(メタデータ) (2024-05-06T11:02:02Z) - Multi-modal Semantic Understanding with Contrastive Cross-modal Feature
Alignment [11.897888221717245]
マルチモーダルな特徴アライメントを実現するためのCLIP誘導型コントラスト学習型アーキテクチャを提案する。
我々のモデルはタスク固有の外部知識を使わずに実装が簡単であり、そのため、他のマルチモーダルタスクに容易に移行できる。
論文 参考訳(メタデータ) (2024-03-11T01:07:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。