論文の概要: MLLM-Microscope: Unlocking Hidden Structure Within Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2606.00909v1
- Date: Sat, 30 May 2026 22:20:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.971772
- Title: MLLM-Microscope: Unlocking Hidden Structure Within Multimodal Large Language Models
- Title(参考訳): MLLM-Microscope:マルチモーダル大言語モデル内の隠れ構造をアンロックする
- Abstract要約: MLLM(Multimodal Large Language Models)内の隠れ表現を解析するための新しいシステムであるMLLM-Microscopeを提案する。
LLaVA-NeXTとOmniFusionの2つの最先端MLLMを評価した。
両モダリティのトークンの主ストリームと残留ストリームの両方が、変圧器層にまたがる高い線形挙動を示すことがわかった。
- 参考スコア(独自算出の注目度): 0.17188280334580194
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: This work presents MLLM-Microscope, a novel system designed for analyzing the hidden representations within Multimodal Large Language Models (MLLMs). Our system evaluates the linearity, intrinsic dimension, and anisotropy of multimodal token embeddings across transformer layers. Utilizing the ScienceQA dataset, we evaluate two state-of-the-art MLLMs, LLaVA-NeXT and OmniFusion. We find that both the main and residual streams for tokens of both modalities exhibit highly linear behaviors across transformer layers. However, LLaVA-NeXT's image tokens reveal a slight decline in linearity, whereas OmniFusion's remain consistent. Image token dimensions in OmniFusion remain consistently higher across layers compared to LLaVA-NeXT. Also, the OmniFusion's anisotropy is observed to stay consistently low throughout the layers. These findings suggest that the inner workings of MLLMs highly depend on the nature of modality fusion performed before passing the token sequence into LLM. This and other new potential insights obtainable from our system are surely capable of enhancing our understanding of the inner workings of MLLMs, informing future model design and optimization.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)内の隠れ表現を解析するための新しいシステムであるMLLM-Microscopeを提案する。
本システムは, 変圧器層にまたがる多モードトークンの線形性, 固有次元, 異方性を評価する。
その結果,ScienceQAデータセットを用いて2つの最先端MLLM,LLaVA-NeXT,OmniFusionを評価した。
両モダリティのトークンの主ストリームと残留ストリームの両方が、変圧器層にまたがる高い線形挙動を示すことがわかった。
しかし、LLaVA-NeXTの画像トークンは線形性がわずかに低下しているのに対して、OmniFusionは一貫している。
OmniFusionのイメージトークン次元は、LLaVA-NeXTに比べて、層間で一貫して高い。
また、オムニフュージョンの異方性は、層全体で一貫して低いままである。
これらの結果から,MLLMの内部構造は,トークン配列をLSMに渡す前に行われるモダリティ融合の性質に大きく依存していることが示唆された。
この他,我々のシステムから得られる新たな潜在的な洞察は,MLLMの内部動作の理解を深め,将来のモデル設計と最適化を実現することができる。
関連論文リスト
- Segmentation as A Plug-and-Play Capability for Frozen Multimodal LLMs [9.6979217203587]
LENS(Leveraging kEypoiNts for MLLMs)は,新しいプラグアンドプレイソリューションである。
LENSは軽量で訓練可能なヘッドを完全に凍結されたMLLMに取り付ける。
セグメンテーション性能は、リトレーニングベースの手法と競合するか、優れている。
論文 参考訳(メタデータ) (2025-10-19T10:21:01Z) - NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints [100.02131897927484]
本稿では,Multimodal Large Language Models(MLLM)のエンドツーエンドなネイティブトレーニングに焦点を当てる。
そこで我々は,NaViLと呼ばれるネイティブMLLMと,シンプルで費用対効果の高いレシピを組み合わせて提案する。
14のマルチモーダルベンチマークによる実験結果から,既存のMLLMに対するNaViLの競合性能が確認された。
論文 参考訳(メタデータ) (2025-10-09T17:59:37Z) - DeepMLF: Multimodal language model with learnable tokens for deep fusion in sentiment analysis [62.31018417955254]
DeepMLFは、深層融合に適した学習可能なトークンを持つ新しいマルチモーダル言語モデルである。
以上の結果から,より深層核融合により,既存のアプローチよりも優れた核融合深度 (5-7) が得られることが確認された。
論文 参考訳(メタデータ) (2025-04-15T11:28:02Z) - LLaVA-KD: A Framework of Distilling Multimodal Large Language Models [72.68665884790002]
本稿では,l-MLLMからs-MLLMへ知識を伝達する新しいフレームワークを提案する。
本稿では,教師モデルの頑健な表現を視覚的,言語的両面で伝達するために,MDist(Multimodal Distillation)を導入する。
また,提案した蒸留戦略の可能性をフル活用するための3段階学習手法を提案する。
論文 参考訳(メタデータ) (2024-10-21T17:41:28Z) - Dense Connector for MLLMs [89.50595155217108]
Dense Connector - 既存のMLLMを大幅に強化するプラグイン・アンド・プレイ型ヴィジュアル言語コネクタ。
この上に構築されたEfficient Dense Connectorは,視覚トークンの25%に過ぎず,LLaVA-v1.5に匹敵するパフォーマンスを実現する。
画像のみを訓練したわれわれのモデルは、ビデオ理解でも際立ったゼロショットの能力を誇示している。
論文 参考訳(メタデータ) (2024-05-22T16:25:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。