論文の概要: Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding
- arxiv url: http://arxiv.org/abs/2604.07753v1
- Date: Thu, 09 Apr 2026 03:19:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-10 18:34:05.669118
- Title: Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding
- Title(参考訳): Symbiotic-MoE: 生成と理解の相乗効果を解き放つ
- Authors: Xiangyue Liu, Zijian Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Ping Tan,
- Abstract要約: 本稿では,Mixture-of-Experts (MoE) Transformersアーキテクチャにおけるタスク干渉を解決するための統合事前学習フレームワークであるSymbiotic-MoEを提案する。
Modality-Aware Expert Disentanglementは、共有専門家が生成タスクからきめ細かい視覚的意味を吸収することを可能にする。
実験により、共生-MoEはクロスモーダルのシナジーを解き放ちながら、迅速に生成的収束を達成できることが示された。
- 参考スコア(独自算出の注目度): 45.254713953182716
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Empowering Large Multimodal Models (LMMs) with image generation often leads to catastrophic forgetting in understanding tasks due to severe gradient conflicts. While existing paradigms like Mixture-of-Transformers (MoT) mitigate this conflict through structural isolation, they fundamentally sever cross-modal synergy and suffer from capacity fragmentation. In this work, we present Symbiotic-MoE, a unified pre-training framework that resolves task interference within a native multimodal Mixture-of-Experts (MoE) Transformers architecture with zero-parameter overhead. We first identify that standard MoE tuning leads to routing collapse, where generative gradients dominate expert utilization. To address this, we introduce Modality-Aware Expert Disentanglement, which partitions experts into task-specific groups while utilizing shared experts as a multimodal semantic bridge. Crucially, this design allows shared experts to absorb fine-grained visual semantics from generative tasks to enrich textual representations. To optimize this, we propose a Progressive Training Strategy featuring differential learning rates and early-stage gradient shielding. This mechanism not only shields pre-trained knowledge from early volatility but eventually transforms generative signals into constructive feedback for understanding. Extensive experiments demonstrate that Symbiotic-MoE achieves rapid generative convergence while unlocking cross-modal synergy, boosting inherent understanding with remarkable gains on MMLU and OCRBench.
- Abstract(参考訳): 画像生成によるLMM(Large Multimodal Models)の強化は、過度な勾配の衝突による理解タスクにおける破滅的な忘れ込みにつながることが多い。
Mixture-of-Transformers (MoT)のような既存のパラダイムは、この衝突を構造的分離によって緩和するが、基本的にはクロスモーダルなシナジーを断ち切っており、容量の断片化に悩まされている。
本研究では,マルチモーダルなMixture-of-Experts (MoE) トランスフォーマーアーキテクチャにおけるタスク干渉をゼロパラメータオーバヘッドで解決する,統合事前学習フレームワークであるSymbiotic-MoEを提案する。
まず、標準のMoEチューニングがルーティングの崩壊につながることを確認し、そこでは生成勾配が専門家の利用を支配している。
そこで我々は,共有専門家をマルチモーダルなセマンティックブリッジとして活用しながら,専門家をタスク固有のグループに分割するModality-Aware Expert Disentanglementを紹介した。
重要なことは、この設計により、共有専門家は生成タスクからきめ細かい視覚的意味を吸収し、テキスト表現を豊かにすることが可能になる。
これを最適化するために,差分学習率と初期勾配遮蔽を特徴とするプログレッシブトレーニング戦略を提案する。
このメカニズムは、事前訓練された知識を早期のボラティリティから保護するだけでなく、最終的に生成的信号を理解のための建設的なフィードバックに変換する。
広範囲にわたる実験により、Symbiotic-MoEはクロスモーダルのシナジーを解き放ち、MMLUとOCRBenchに顕著な利得で本質的な理解を高めながら、迅速に生成的収束を達成できることが示されている。
関連論文リスト
- Beyond Surface Artifacts: Capturing Shared Latent Forgery Knowledge Across Modalities [52.189426539304065]
本稿では,従来の「機能融合」から「モダリティ一般化」に再定義するパラダイムシフトを提案する。
モーダリティ固有のスタイルを明示的に分離することにより,MAFは必須かつ非モーダルな潜在フォージェリー知識を正確に抽出する。
論文 参考訳(メタデータ) (2026-04-09T03:35:21Z) - Unsafe by Reciprocity: How Generation-Understanding Coupling Undermines Safety in Unified Multimodal Models [53.41258113970795]
統一マルチモーダルモデル(UMM)における相互機能相互性自体が脆弱性の構造的源となっているかを検討する。
相互相互作用に基づくクロスファンクショナル・ファンクショナル・エクスプロイテーションは, 理解と生成の間の双方向の相互作用を明示的に活用する, 新たな攻撃パラダイムである。
論文 参考訳(メタデータ) (2026-03-28T16:28:39Z) - Understanding and Harnessing Sparsity in Unified Multimodal Models [32.09095929575726]
大規模なマルチモーダルモデルは、理解と生成の両方において顕著な進歩を遂げた。
最近の取り組みは、単一のフレームワーク内で両方の機能をサポートするために異種コンポーネントを統合する統合マルチモーダルモデルを模索している。
しかし、これらの非効率性がどのように異なるコンポーネントにまたがって現れるかという体系的な理解は依然として限られている。
論文 参考訳(メタデータ) (2025-12-02T02:47:29Z) - Architecture Decoupling Is Not All You Need For Unified Multimodal Model [64.19284951218098]
本稿では,トレーニング中のタスク-特定マルチモーダルインタラクションパターンを明示的に学習する,意図的インタラクションアライメント(AIA)の損失を提案する。
AIAは、横断的な注意パターンを洗練するだけでなく、生成と理解の両方のパフォーマンスも向上させる。
論文 参考訳(メタデータ) (2025-11-27T17:55:25Z) - HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation [72.69742127579508]
最近の統一モデルでは、理解の専門家(LLMなど)と生成の専門家(拡散モデルなど)を統合している。
本研究では,非対称なH字型アーキテクチャであるHBridgeを提案する。
複数のベンチマークにわたる大規模な実験は、HBridgeの有効性と優れた性能を示している。
論文 参考訳(メタデータ) (2025-11-25T17:23:38Z) - UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation [39.921363034430875]
統一された画像理解と生成は、マルチモーダル人工知能において有望なパラダイムとして浮上している。
本研究では,タスク固有の専門家モデルの理解と生成のためのモダリティアライメント行動について検討する。
タスクの干渉を避けるため,タスク固有の分岐を深いレイヤに導入しながら,タスクのタスク表現学習のための浅いレイヤを共有する,新しいY字型アーキテクチャであるUniForkを紹介した。
論文 参考訳(メタデータ) (2025-06-20T17:52:31Z) - More Experts Than Galaxies: Conditionally-overlapping Experts With Biologically-Inspired Fixed Routing [5.846028298833611]
Conditionally Overlapping Mixture of ExperTs (COMET) は、モジュラーでスパースなアーキテクチャを、指数関数的に重複する専門家数で誘導する一般的なディープラーニング手法である。
画像分類,言語モデリング,回帰といったタスクにおけるCOMETの有効性を示す。
論文 参考訳(メタデータ) (2024-10-10T14:58:18Z) - Mixture of insighTful Experts (MoTE): The Synergy of Thought Chains and Expert Mixtures in Self-Alignment [103.05005690990271]
MoTE(Mixture of insightful Experts)は、推論チェーンとエキスパートミックスを組み合わせて自己調整を改善する新しいフレームワークである。
MoTEはモデルの安全性、脱獄耐性、過剰な拒否機能を大幅に改善し、OpenAIの最先端のo1モデルに匹敵するパフォーマンスを実現している。
論文 参考訳(メタデータ) (2024-05-01T15:06:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。