論文の概要: Architecture-Dependent Fusion Pathways in MLLMs
- arxiv url: http://arxiv.org/abs/2610.03289v1
- Date: Fri, 02 Oct 2026 13:32:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.396351
- Title: Architecture-Dependent Fusion Pathways in MLLMs
- Title(参考訳): MLLMにおけるアーキテクチャ依存核融合経路
- Abstract要約: MLLM(Multimodal Large Language Models)は、視覚・テキストタスク間で高いパフォーマンスを実現する。
視覚的およびテキスト的情報が層にまたがって融合する内部メカニズムは 十分に理解されていない
本稿では,2つのアーキテクチャパラダイム – 結合アーキテクチャとネイティブマルチモーダルアーキテクチャ – の代表的MLLMについて検討する。
- 参考スコア(独自算出の注目度): 2.7005039251859775
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) achieve strong performance across vision-language tasks, yet the internal mechanisms by which visual and textual information are fused across layers remain insufficiently understood. We investigate representative MLLMs from two architectural paradigms: concatenation architectures and native multimodal architectures. We conduct three progressively connected analyses: alignment decoupling identifies which modality changes, attention routing and entropy characterize how cross-modal information is distributed, and intrinsic dimensionality examines how fusion reshapes feature spaces. Separately, we perform causal intervention experiments as a validation of the resulting interpretation. As a supplementary analysis, we use visual CKA to examine the Platonic Representation Hypothesis. Together, these analyses reveal two distinct fusion pathways: concatenation models follow a text-first, vision-later pathway, whereas native models exhibit earlier visual-textual co-adaptation and feature-space reorganization. This work provides a mechanistic perspective for understanding multimodal fusion and supports architecture-aware diagnostics of multimodal representations.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は視覚言語タスク間で高い性能を達成するが、レイヤ間で視覚情報とテキスト情報が融合する内部メカニズムはいまだに十分に理解されていない。
本稿では,2つのアーキテクチャパラダイム – 結合アーキテクチャとネイティブマルチモーダルアーキテクチャ – の代表的MLLMについて検討する。
アライメントデカップリングは、どのモダリティが変化するかを識別し、アライメントルーティングとエントロピーは、どのようにクロスモーダル情報を分散するかを特徴付ける。
また,解析結果の検証として因果介入実験を行った。
補足的解析として視覚的CKAを用いてプラトン表現仮説を検証した。
結合モデルは、テキストファーストの視覚後続の経路に従うのに対し、ネイティブモデルは、初期の視覚-テキスト共適応と特徴空間再構成の2つの異なる融合経路を示す。
この研究は、マルチモーダル融合を理解するための力学的な視点を提供し、マルチモーダル表現のアーキテクチャ認識診断をサポートする。
関連論文リスト
- From Models to Systems: A Comprehensive Survey of Efficient Multimodal Learning [126.2308206954491]
本調査では,効率的なマルチモーダル学習のためのモデル・ツー・システム分類を初めて導入した。
我々は300を超える精巧な作品から3つの階層的なレベル – モデル,アルゴリズム,システム – への洞察を抽出し,アーキテクチャのパーシモニー,実行の洗練,ハードウェア対応のオーケストレーションを行う。
論文 参考訳(メタデータ) (2026-09-16T21:27:22Z) - Decoupled Vision-Language System for Multimodal Understanding and Generation [89.34379992467393]
マルチモーダルな大言語モデル(MLLM)のための新しいアーキテクチャ設計、Libraを導入し、マルチモーダルな理解と生成を両立させる。
Libraアーキテクチャは1つの視覚システムと1つの言語システムを含み、クロスモーダルブリッジで接続される。
この設計は、自己モーダルモデリングと相互モーダル相互作用を分離し、各モーダルが効果的な相互モーダル理解を維持しながら、そのユニークな表現を学習できるようにする。
論文 参考訳(メタデータ) (2026-06-29T12:54:52Z) - Semantic Generative Tuning for Unified Multimodal Models [62.18894352635965]
統一マルチモーダルモデル(UMM)は、単一のアーキテクチャ内で視覚的理解と視覚的生成を統合する。
訓練パラダイムは 独立して テキスト信号を通して 理解を最適化する 密集したピクセルの目的を通して 生成する
本研究は,UMMの分離を橋渡しするための生成プロキシとして階層的視覚タスクを定式化する,生成後学習に関する最初の体系的な研究である。
論文 参考訳(メタデータ) (2026-05-18T17:46:46Z) - A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models [24.18585407100395]
大規模視覚言語モデル(LVLM)は優れた性能を発揮するが、内部決定プロセスは不透明である。
本稿では,LVLMの「情報スペクトル」を定量的に測定するために,部分情報分解(PID)を用いた新しいフレームワークを提案する。
分析の結果,2つの重要な結果が明らかになった: (i)2つのタスク・レジーム (synergy-driven vs. knowledge-driven) と (ii) 2つの安定な家族レベルの戦略 (fusion-centric vs. language-centric) である。
論文 参考訳(メタデータ) (2026-03-31T12:32:29Z) - Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention [7.511262066889113]
MLLM(Multimodal Large Language Models)は、視覚言語理解において顕著な進歩を遂げている。
複数のアーキテクチャにまたがる階層的なマスキング解析を行い、MLLM内での視覚テキストの融合がどのように進化するかを明らかにする。
我々は、初期融合と最終層間の変換をモデル化し、意味のある注意シフトを強調する、トレーニングなしのコントラスト注意フレームワークを導入する。
論文 参考訳(メタデータ) (2026-01-13T02:26:21Z) - UniAlignment: Semantic Alignment for Unified Image Generation, Understanding, Manipulation and Perception [54.53657134205492]
UniAlignmentは単一の拡散変換器内での統一されたマルチモーダル生成フレームワークである。
固有モード意味アライメントとクロスモーダル意味アライメントの両方を組み込むことで、モデルのクロスモーダル一貫性と命令追従ロバスト性を高める。
本稿では、複雑なテキスト命令下でのマルチモーダルなセマンティック一貫性を評価するために設計された新しいベンチマークであるSemGen-Benchを紹介する。
論文 参考訳(メタデータ) (2025-09-28T09:11:30Z) - Multi-Modal Interpretability for Enhanced Localization in Vision-Language Models [2.984679075401059]
本稿では,視覚言語モデルの解釈性向上を目的としたマルチモーダル説明型学習フレームワークを提案する。
我々のアプローチは、複数の意味レベルで特徴を処理し、異なる粒度における画像領域間の関係をキャプチャする。
意味関係情報を勾配に基づく属性マップに組み込むことで、MMELはより焦点を絞った、文脈を意識した視覚化を実現できることを示す。
論文 参考訳(メタデータ) (2025-09-17T18:18:59Z) - A Survey on Mechanistic Interpretability for Multi-Modal Foundation Models [74.48084001058672]
基礎モデルの台頭は機械学習の研究に変化をもたらした。
マルチモーダル・ファンデーション・モデル(MMFM)は、ユニモーダル・フレームワークを超えて、ユニークな解釈可能性の課題を提起する。
本研究は,(1)多モーダルモデルへのLLM解釈可能性法の適応,(2)単モーダル言語モデルとクロスモーダルシステムとの機械的差異の理解の2つの重要な側面について考察する。
論文 参考訳(メタデータ) (2025-02-22T20:55:26Z) - Explaining Multi-modal Large Language Models by Analyzing their Vision Perception [4.597864989500202]
本研究では,画像埋め込み成分に着目し,MLLMの解釈可能性を高める新しい手法を提案する。
オープンワールドのローカライゼーションモデルとMLLMを組み合わせることで、同じビジョンの埋め込みからテキストとオブジェクトのローカライゼーション出力を同時に生成できる新しいアーキテクチャを構築する。
論文 参考訳(メタデータ) (2024-05-23T14:24:23Z) - Multi-Grained Multimodal Interaction Network for Entity Linking [65.30260033700338]
マルチモーダルエンティティリンクタスクは、マルチモーダル知識グラフへの曖昧な言及を解決することを目的としている。
MELタスクを解決するための新しいMulti-Grained Multimodal InteraCtion Network $textbf(MIMIC)$ frameworkを提案する。
論文 参考訳(メタデータ) (2023-07-19T02:11:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。