論文の概要: Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?
- arxiv url: http://arxiv.org/abs/2607.12787v1
- Date: Tue, 14 Jul 2026 14:01:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.164725
- Title: Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?
- Title(参考訳): マルチモーダル感情言語モデルが本当に必要か?
- Abstract要約: マルチモーダル大言語モデル(MLLM)は、マルチモーダル感情認識(MER)の性能を大幅に改善した
これらの改善は、モデルパラメータサイズ(例えば、少なくとも7B)の増大を伴う。
高品質のMERには、1Bパラメータよりも大きいマルチモーダルMERモデルが必要ですか?
本稿では,より高速なマルチモーダル感情理解・認識を実現する軽量なMERフレームワーク(Light-MER)を提案する。
- 参考スコア(独自算出の注目度): 21.02574750546335
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in multimodal large language models (MLLMs) have significantly improved the performance of multimodal emotion recognition (MER) and enabled interpretable description generation by jointly modeling video, audio, and language, etc. However, these performance improvements are often accompanied by an increase in model parameter size (e.g, at least 7B), which simultaneously incurs high computational costs and reduces inference efficiency, thereby hindering real-time deployment on resource-constrained platforms such as robots and mobile devices. This raises a fundamental question: do we really need the multimodal MER model larger than 1B parameters for high-quality MER? In this paper, we challenge the assumption that larger models are inherently necessary and proposes a lightweight MER framework (called Light-MER), which achieves better and faster multimodal sentiment understanding and recognition through knowledge distillation. It can transfer knowledge from a strong, large-scale teacher model to a lightweight sub-billion-parameter student model, aiming to preserve rich multimodal emotion reasoning and recognition while substantially improving deployment efficiency. Specifically, we introduce two new optimization strategies to enhance knowledge transfer: (1) a new optimal transport loss that combines Sliced Wasserstein Distance with hidden-state alignment, and (2) a new multi-reward optimization strategy based on GRPO that balances MER performance and efficiency, aimed at further enhancing the learning capabilities of student models. Extensive experiments on nine benchmark datasets demonstrate that Light-MER achieves state-of-the-art performance while significantly improving inference efficiency. This highlights the strong potential of small multimodal emotion language models for future research. Code is available at https://github.com/GAIR-Lab/Light-MER.
- Abstract(参考訳): MLLM(Multimodal large language model)の最近の進歩は、MER(Multimodal emotion recognition)の性能を大幅に向上させ、ビデオや音声、言語などを共同でモデル化することで、解釈可能な記述生成を可能にした。
しかしながら、これらの性能改善はしばしば、高い計算コストを同時に発生させ、推論効率を低下させるモデルパラメータサイズ(例えば、少なくとも7B)の増加を伴うため、ロボットやモバイルデバイスのようなリソースに制約されたプラットフォームへのリアルタイムなデプロイを妨げている。
高品質のMERには、1Bパラメータよりも大きいマルチモーダルMERモデルが必要ですか?
本稿では,大規模モデルが本質的に必要であるという仮定に挑戦し,知識蒸留によるマルチモーダル感情理解と認識を向上する軽量なMERフレームワーク(Light-MER)を提案する。
強力で大規模な教師モデルから軽量なサブビリオンパラメータの学生モデルに知識を移し、リッチなマルチモーダルな感情推論と認識を保ちながら、展開効率を大幅に向上させることを目的としている。
具体的には,(1)スライスされたワッサースタイン距離と隠れ状態アライメントを組み合わせた新しい最適輸送損失,(2)MER性能と効率のバランスをとるGRPOに基づく新しいマルチリワード最適化戦略を,学生モデルの学習能力の向上を目的として導入する。
9つのベンチマークデータセットに対する大規模な実験は、Light-MERが最先端のパフォーマンスを達成し、推論効率を著しく改善していることを示している。
このことは、将来の研究のための小さなマルチモーダル感情言語モデルの強い可能性を強調している。
コードはhttps://github.com/GAIR-Lab/Light-MERで入手できる。
関連論文リスト
- BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion [6.8723394189831035]
大規模言語モデルは、リソース制約のある環境でのデプロイメントに挑戦する。
本稿では,エンドツーエンドの視覚的質問応答のための軽量MLLMフレームワークを提案する。
提案手法は,効率的なマルチモーダル理解のために最適化されたコンパクトだが強力な視覚言語である BreezeCLIP を中心にしている。
論文 参考訳(メタデータ) (2025-09-10T16:09:49Z) - AMMKD: Adaptive Multimodal Multi-teacher Distillation for Lightweight Vision-Language Models [35.71783914954563]
本稿では, マルチモーダルな特徴融合, マルチティーチンガー蒸留, 適応最適化を統合し, 軽量で効果的な検索モデルを提供する新しいフレームワークを提案する。
3つのベンチマークデータセットの実験では、AMMKDはモデル複雑性を著しく低減し、その有効性と柔軟性を検証しながら、優れたパフォーマンスを達成することが示されている。
論文 参考訳(メタデータ) (2025-08-23T04:52:20Z) - PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning [54.73049408950049]
モーダリティ適応型学習を伴う効率的な統一マルチモーダル検索のための階層型言語モデルを提案する。
本手法は,構造的,学習的両面からの統合的マルチモーダル検索を改善する。
論文 参考訳(メタデータ) (2025-07-10T16:47:25Z) - ADEM-VL: Adaptive and Embedded Fusion for Efficient Vision-Language Tuning [38.26304604660713]
ADEM-VLは、事前訓練された大規模言語モデルに基づいてモデルをチューニングする効率的な視覚言語手法である。
我々のフレームワークはScienceQAデータセットの平均精度を0.77%上回る。
論文 参考訳(メタデータ) (2024-10-23T11:31:06Z) - Mini-InternVL: A Flexible-Transfer Pocket Multimodal Model with 5% Parameters and 90% Performance [78.48606021719206]
Mini-InternVL は 1B から 4B までのパラメータを持つ一連の MLLM であり、パラメータの 5% しか持たない性能の90% を達成している。
我々は,ダウンストリームタスクにおける特化モデルの転送と性能向上を可能にする,Mini-InternVLの統一適応フレームワークを開発した。
論文 参考訳(メタデータ) (2024-10-21T17:58:20Z) - EMMA: Efficient Visual Alignment in Multi-Modal LLMs [56.03417732498859]
EMMAは、視覚的およびテキスト的エンコーディングを効率的に融合するために設計された軽量なクロスプラットフォームモジュールである。
EMMAは複数のタスクのパフォーマンスを最大9.3%向上させ、幻覚に対する堅牢性を大幅に向上させる。
論文 参考訳(メタデータ) (2024-10-02T23:00:31Z) - LLAVADI: What Matters For Multimodal Large Language Models Distillation [77.73964744238519]
本研究では,新しい効率的なモデル構造を提案するのではなく,スクラッチから小規模MLLMを訓練する。
本研究は, 知識蒸留プロセスにおける学習戦略, モデル選択, 蒸留アルゴリズムに関するものである。
異なるベンチマークと適切な戦略を評価することで、2.7Bの小型モデルでも7Bまたは13Bのパラメータを持つ大型モデルと同等に動作することができる。
論文 参考訳(メタデータ) (2024-07-28T06:10:47Z) - When Parameter-efficient Tuning Meets General-purpose Vision-language
Models [65.19127815275307]
PETALは、一意のモード近似技術によって達成される全パラメータの0.5%しか必要とせず、トレーニングプロセスに革命をもたらす。
実験の結果,PETALは現状の手法をほとんどのシナリオで上回るだけでなく,完全な微調整モデルよりも優れていることがわかった。
論文 参考訳(メタデータ) (2023-12-16T17:13:08Z) - Scalable and Efficient MoE Training for Multitask Multilingual Models [55.987536562357086]
我々は,MoEモデルを数兆のパラメータに効率的にスケールできるシステムを開発した。
また,MoEサンプルの効率を向上させるための新たなトレーニング手法を提案し,時間効率を向上させるために専門家の刈り取り戦略を活用する。
50言語で100億のパラメータで訓練されたモデルは、機械翻訳(MT)および多言語自然言語生成タスクにおける最先端のパフォーマンスを達成することができる。
論文 参考訳(メタデータ) (2021-09-22T00:57:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。