論文の概要: NeuCME: Toward Dynamic Multimodal Continual Learning via Neural Combinatorics of Multiple Experts
- arxiv url: http://arxiv.org/abs/2609.07009v1
- Date: Mon, 07 Sep 2026 03:59:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.351487
- Title: NeuCME: Toward Dynamic Multimodal Continual Learning via Neural Combinatorics of Multiple Experts
- Title(参考訳): NeuCME: 複数の専門家のニューラルネットワークによる動的マルチモーダル連続学習を目指して
- Abstract要約: 本稿では,タスク間の知識を多様性で効果的に学習し,統合する新しいフレームワークを提案する。
提案したNeuCMEモデルは,3つの重要な構成要素,すなわち,モダリティ・コビニナリハーサル,多段混合実験,タスク関連誘導蒸留からなる。
4つの実世界のデータセットを用いた実験は、提案されたNeuCMEが最先端の手法より優れていることを示した。
- 参考スコア(独自算出の注目度): 27.96783589932736
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal continual learning has recently shown great potential for developing agents with human-like intelligence by continuously learning new tasks across multiple modalities. However, existing methods typically assume that the set of modalities per task is predefined and fixed. In this paper, we investigate a more realistic learning setting, referred to as dynamic multimodal continual learning, in which the set of modalities may vary across tasks rather than remaining fixed. This setting involves two primary challenges: (i) spatio-temporal catastrophic forgetting and (ii) adaptive multimodal fusion. To address these challenges, we propose NeuCME (as shorthand for \textbf{Neu}ral \textbf{C}ombinatorics of \textbf{M}ultiple \textbf{E}xperts), a novel framework designed to effectively learn and integrate knowledge across tasks with varying modalities. The proposed NeuCME model comprises three key components, namely modality-combinational rehearsal, multi-gated mixture-of-experts, and task relevance-guided distillation. Furthermore, we formulate an evaluation metric to quantify the dynamism of task sequences and then set up a comprehensive benchmark with different degrees of dynamism. Extensive experiments using four real-world datasets demonstrate that the proposed NeuCME outperforms state-of-the-art methods markedly.
- Abstract(参考訳): マルチモーダル連続学習は、最近、複数のモーダルにまたがる新しいタスクを継続的に学習することで、人間のような知能を持つエージェントを開発する大きな可能性を示している。
しかしながら、既存のメソッドは通常、タスク毎のモダリティのセットが事前に定義され、固定されていると仮定する。
本稿では,動的マルチモーダル連続学習と呼ばれる,より現実的な学習環境について検討する。
この設定には2つの主要な課題があります。
一 時空間的破滅的忘れ物
(ii)適応多モード核融合
これらの課題に対処するために,我々は,タスク間で知識を効果的に学習し,統合する新しいフレームワークであるNeuCME(NeuCME, 略して \textbf{Neu}ral \textbf{C}ombinatorics of \textbf{M}ultiple \textbf{E}xperts)を提案する。
提案したNeuCMEモデルは,3つの重要な構成要素,すなわち,モダリティ・コビニナリハーサル,多段混合実験,タスク関連誘導蒸留からなる。
さらに,タスクシーケンスのダイナミズムを定量化するために評価基準を定式化し,ダイナミズムの度合いが異なる総合的なベンチマークを設定した。
4つの実世界のデータセットを用いた大規模な実験は、提案されたNeuCMEが最先端の手法を著しく上回っていることを示している。
関連論文リスト
- Taming Modality Entanglement in Continual Audio-Visual Segmentation [30.143320890304366]
本稿では,音声によって案内される新しいクラスを連続的にセグメント化することを目的とした,新しいCAVSタスクを提案する。
1)マルチモーダルなセマンティックドリフトと2)共起混同の2つの重要な課題が同定された。
Collisionベースのマルチモーダルリハーサルフレームワークは、これらの課題に対処するために設計されている。
論文 参考訳(メタデータ) (2025-10-20T07:23:36Z) - Harmony: A Unified Framework for Modality Incremental Learning [81.13765007314781]
本稿では,連続的に進化するモーダルシーケンスを横断するインクリメンタル学習が可能な統一モデルの実現可能性について検討する。
本研究では,適応的アライメントと知識保持を実現するために,Harmonyという新しいフレームワークを提案する。
提案手法は適応性のある特徴変調と累積的モーダルブリッジングを導入する。
論文 参考訳(メタデータ) (2025-04-17T06:35:01Z) - Self-Controlled Dynamic Expansion Model for Continual Learning [10.447232167638816]
本稿では, 自己制御型動的拡張モデル(SCDEM)を提案する。
SCDEMは複数のトレーニング可能なトレーニング済みのViTバックボーンを編成し、多様で意味的に豊かな表現を提供する。
提案手法の有効性を評価するため,幅広い実験が実施されている。
論文 参考訳(メタデータ) (2025-04-14T15:22:51Z) - DynCIM: Dynamic Curriculum for Imbalanced Multimodal Learning [27.20479303843989]
DynCIMは、サンプルとモダリティの両方の観点から固有の不均衡を定量化するために設計された、新しい動的カリキュラム学習フレームワークである。
DynCIMは、予測偏差、一貫性、安定性に応じて各サンプルの難易度を動的に評価するために、サンプルレベルのカリキュラムを使用している。
モダリティレベルのカリキュラムは、グローバルおよびローカルからのモダリティ貢献を測定する。
論文 参考訳(メタデータ) (2025-03-09T05:30:15Z) - Modality-Inconsistent Continual Learning of Multimodal Large Language Models [37.15220266767881]
マルチモーダル大言語モデル(MLLM)のための新しい連続学習シナリオであるMICL(Modality-Inconsistent Continual Learning)を導入する。
既存の視覚のみやモダリティの増分設定とは異なり、MICLはモダリティとタスクタイプのシフトを組み合わせており、どちらも破滅的な忘れを招いている。
本稿では, Pseudo Targets Generation Module を用いて, 以前見られたタスクタイプシフトによる忘れを軽減した MoInCL を提案する。
論文 参考訳(メタデータ) (2024-12-17T16:13:56Z) - Enhancing Continual Learning in Visual Question Answering with Modality-Aware Feature Distillation [48.071162716120334]
入力のマルチモーダルな性質がモデルの学習力学に与える影響について検討する。
本研究の目的は, モダリティ対応型特徴蒸留 (MAFED) 方式を提案することである。
論文 参考訳(メタデータ) (2024-06-27T16:12:57Z) - Multiple Heads are Better than One: Mixture of Modality Knowledge Experts for Entity Representation Learning [51.80447197290866]
高品質なマルチモーダル実体表現を学習することは、マルチモーダル知識グラフ(MMKG)表現学習の重要な目標である。
既存の手法は、エレガントなエンティティワイドマルチモーダル融合戦略の構築に重点を置いている。
適応型マルチモーダルな実体表現を学習するために,Mixture of Modality Knowledge Expert (MoMoK) を用いた新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-05-27T06:36:17Z) - Multi-Head Mixture-of-Experts [100.60556163597946]
MH-MoE(Multi-Head Mixture-of-Experts)を提案する。
MH-MoEは、他のSMoE最適化手法の実装と分離が容易であり、性能向上のために他のSMoEモデルとの統合が容易である。
論文 参考訳(メタデータ) (2024-04-23T13:47:09Z) - T-REX: Mixture-of-Rank-One-Experts with Semantic-aware Intuition for Multi-task Large Language Model Finetuning [31.276142111455847]
大規模言語モデル(LLM)は多様なマルチタスクの微調整において重要な適応課題に直面している。
我々はmixunderlinetextbfTureunderlinetextbf-of-underlinetextbfRank-onunderlinetextbfE-eunderlinetextbfXper ts (textttT-REX) という新しいフレームワークを設計する。
Rank-1のエキスパートは、ミックス・アンド・マッチのメカニズムにより、線形パラメータのオーバーヘッドを持つエキスパートのベクトル部分空間を2次に拡張し、最適で近似誤差削減を達成することができる。
論文 参考訳(メタデータ) (2024-04-13T12:14:58Z) - Unified Multi-modal Unsupervised Representation Learning for
Skeleton-based Action Understanding [62.70450216120704]
教師なしの事前訓練は骨格に基づく行動理解において大きな成功を収めた。
我々はUmURLと呼ばれる統一マルチモーダル非教師なし表現学習フレームワークを提案する。
UmURLは効率的な早期融合戦略を利用して、マルチモーダル機能を単一ストリームで共同でエンコードする。
論文 参考訳(メタデータ) (2023-11-06T13:56:57Z) - Channel Exchanging Networks for Multimodal and Multitask Dense Image
Prediction [125.18248926508045]
本稿では,マルチモーダル融合とマルチタスク学習の両方に適用可能な,自己適応的でパラメータフリーなチャネル交換ネットワーク(CEN)を提案する。
CENは異なるモダリティのワーク間でチャネルを動的に交換する。
濃密な画像予測を応用するために、CENの有効性は4つの異なるシナリオで検証される。
論文 参考訳(メタデータ) (2021-12-04T05:47:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。