論文の概要: MoEMB: Scaling Universal Multimodal Embeddings with Efficient Mixture-of-Experts Models
- arxiv url: http://arxiv.org/abs/2609.08663v1
- Date: Tue, 08 Sep 2026 12:29:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.647059
- Title: MoEMB: Scaling Universal Multimodal Embeddings with Efficient Mixture-of-Experts Models
- Title(参考訳): MoEMB: 効率的な混合実験モデルによるユニバーサルマルチモーダル埋め込みのスケーリング
- Abstract要約: ユニバーサルマルチモーダル埋め込み(UME)は、幅広いタスクやモダリティを扱うエンコーダの能力をますます要求している。
MoEMBがエキスパート軸に沿ってUMEをスケールする
MoEMBはTTEベースのメソッドを4倍のアクティブパラメータで上回り、計算量は大幅に少ない。
- 参考スコア(独自算出の注目度): 55.732137666068446
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Universal multimodal embedding (UME) increasingly demands encoder's capacity for handling a broad range of tasks and modalities with increased complexity. Prior scaling methods either increase the representation size, retrieval effort, or scales the encoder into a heavy multimodal LLM. Recent works, such as Think-Then-Embed (TTE), explore scaling via reasoning tokens. However, embedding models are hard to scale up: increasing parameters directly tradeoffs for the large training batch size that contrastive learning needs, and retrieval has to be served under tight latency. Moreover, UME tasks are diverse in complexity, where scaling up embedders can bring significant redundant computation. In this work, we propose MOEMB, which instead scales UME along the expert axis through mixture-of-experts (MoE), growing encoder capacity while preserving single-vector, non-autoregressive encoding. Through a systematic study of the design space and training recipes for MoE-based UME, MoEMB sets a new state of the art on both MMEB-V2 and MRMR among models trained on public MMEB-family data: with only 3B active parameters, MoEMB surpasses TTE-based methods with >4x active parameters, using significantly less computes. To further improve the scalability and efficiency, we conduct the first comprehensive study of adaptive computation for MoE-based embedding, spanning diverse strategies across training-based and inference-only methods. Together, these results support expert scaling as an effective and efficient direction for UME, with adaptive computation further improving efficiency for MLLM-based embedding models towards large-scale retrieval and recommendation systems.
- Abstract(参考訳): ユニバーサル・マルチモーダル・埋め込み(UME)は、エンコーダの幅広いタスクやモダリティを扱う能力を複雑さを増して要求する。
以前のスケーリング手法では、表現サイズ、検索努力、エンコーダを重いマルチモーダル LLM にスケールアップする。
最近のThink-Then-Embed (TTE)のような研究は、推論トークンによるスケーリングを探求している。
しかし、埋め込みモデルはスケールアップが困難である: 対照的に学習を必要とする大規模なトレーニングバッチサイズに対して、パラメータを直接的にトレードオフし、検索をタイトなレイテンシで提供する必要がある。
さらに、UMEタスクは複雑度が多様であり、組込み器のスケールアップは大きな冗長な計算をもたらす可能性がある。
本研究では,専門家軸に沿ってUMEをスケールするMOEMBを提案する。このMOEMBは,単ベクトル非自己回帰符号化を保ちながら,エンコーダ容量を増大させる。
MoEMBは、MoEベースのUMEの設計空間とトレーニングのレシピを体系的に研究し、MMEB-V2とMRMRの両方で新しい最先端のモデルを設定している。
スケーラビリティと効率をさらに向上するため、我々はMoEベースの埋め込みのための適応計算の総合的研究を行い、トレーニングベースおよび推論のみの手法にまたがる多様な戦略を網羅した。
これらの結果とともに、専門家のスケーリングをUMEの効率的かつ効率的な方向として支援し、適応計算によりMLLMベースの埋め込みモデルの大規模検索とレコメンデーションシステムへの効率をさらに向上する。
関連論文リスト
- MoEITS: A Green AI approach for simplifying MoE-LLMs [0.0]
MoE-LLMs単純化のための元のアルゴリズムであるMoEITSを示す。
MoEITSは洗練されたシンプルさで特徴付けられ、標準化された情報理論フレームワークによって支えられている。
これはMixtral 8times7$B、Qwen1.5-2.7B、DeepSeek-V2-Liteに適用された最先端のMoE-LLMプルーニング法と比較される。
論文 参考訳(メタデータ) (2026-04-12T12:17:22Z) - Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs [10.443777669301983]
MLLM(Multimodal Large Language Models)は,マルチモーダル検索において非常に有望であることを示す。
しかし、それらの実用的な応用は、視覚的な入力から大量のトークンを処理することから生じる相当な計算コストによって妨げられることが多い。
汎用マルチモーダル埋め込みにおいて,高効率および最先端性能を実現する一連の新しいモデルであるMagic-MM-Embeddingを提案する。
論文 参考訳(メタデータ) (2026-02-05T04:01:01Z) - MoIIE: Mixture of Intra- and Inter-Modality Experts for Large Vision Language Models [52.876185634349575]
我々は、モダリティ内およびモダリティ間エキスパート(MoIIE)の混合をLVLM(Large Vision-Language Models)に組み込むことを提案する。
それぞれのトークンに対して、専門家のルーティングはそのモダリティによってガイドされ、それぞれのモダリティの専門家と、モダリティ間のエキスパートの共有プールにトークンを指示する。
5.5B と 11.3B の活性化パラメータを持つ MoIIE モデルは,既存のオープンソース MoE-LLM ベースのマルチモーダルモデルの性能に適合するか,さらに上回っている。
論文 参考訳(メタデータ) (2025-08-13T13:00:05Z) - MoLAE: Mixture of Latent Experts for Parameter-Efficient Language Models [10.623996218106564]
Mixture of Experts (MoE)は、Large Language Models (LLM)を効率的にスケーリングするための重要なアーキテクチャパラダイムとなっている。
我々は、共有射影を通して専門家の操作を低次元の潜在空間に変換する新しいパラメータ化であるMoLAEを導入し、それに続いて専門家固有の変換を行う。
モデル性能を保ちながら,MoLAEは複数の次元にわたる効率を著しく向上することを示す。
論文 参考訳(メタデータ) (2025-03-29T14:35:34Z) - DSMoE: Matrix-Partitioned Experts with Dynamic Routing for Computation-Efficient Dense LLMs [86.76714527437383]
本稿では,事前学習したFFN層を計算ブロックに分割することで,分散化を実現するDSMoEを提案する。
我々は,Sigmoid アクティベーションとストレートスルー推定器を用いた適応型エキスパートルーティングを実装し,トークンがモデル知識の様々な側面に柔軟にアクセスできるようにする。
LLaMAモデルを用いた実験により、DSMoEは既存のプルーニング法やMoE法に比べて優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-02-18T02:37:26Z) - Read-ME: Refactorizing LLMs as Router-Decoupled Mixture of Experts with System Co-Design [59.00758127310582]
本稿では、事前学習された高密度LCMをより小さなMoEモデルに変換する新しいフレームワークRead-MEを提案する。
当社のアプローチでは,専門家の抽出にアクティベーション空間を用いる。
Read-MEは、同様のスケールの他の人気のあるオープンソース高密度モデルよりも優れています。
論文 参考訳(メタデータ) (2024-10-24T19:48:51Z) - Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts [54.529880848937104]
そこで我々は,MoEアーキテクチャをUni-MoEと呼ぶ一貫したMLLMを開発し,様々なモダリティを扱えるようにした。
具体的には、統一マルチモーダル表現のためのコネクタを持つモダリティ特化エンコーダを特徴とする。
マルチモーダルデータセットの包括的集合を用いた命令調整Uni-MoEの評価を行った。
論文 参考訳(メタデータ) (2024-05-18T12:16:01Z) - When Parameter-efficient Tuning Meets General-purpose Vision-language
Models [65.19127815275307]
PETALは、一意のモード近似技術によって達成される全パラメータの0.5%しか必要とせず、トレーニングプロセスに革命をもたらす。
実験の結果,PETALは現状の手法をほとんどのシナリオで上回るだけでなく,完全な微調整モデルよりも優れていることがわかった。
論文 参考訳(メタデータ) (2023-12-16T17:13:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。