論文の概要: Beyond Modality Fusion: Deep Ensembles for Multimodal Classification
- arxiv url: http://arxiv.org/abs/2607.05019v2
- Date: Tue, 07 Jul 2026 07:13:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 14:37:43.330781
- Title: Beyond Modality Fusion: Deep Ensembles for Multimodal Classification
- Title(参考訳): モダリティ融合を超えて:マルチモーダル分類のためのディープアンサンブル
- Authors: Ilya Burenko, Dmitry Vetrov,
- Abstract要約: マルチモーダル分類において、レイトフュージョンアプローチは、単一モーダルニューラルネットワークによって抽出されたモーダリティ固有の特徴を分類する。
本研究では, マルチモーダルデータを非モーダルネットワークの深いアンサンブルを用いて, 明示的なモダリティ融合なしに効果的に分類できることを示す。
本稿では,モダリティの数と予測強度の両方を制御できる合成マルチモーダルフレームワークを提案する。
- 参考スコア(独自算出の注目度): 0.38059763597999
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In multimodal classification, late-fusion approaches classify concatenated modality-specific features extracted by unimodal neural networks. When modality imbalance is pronounced, various regularization techniques have been proposed to balance the learning process and overcome the inferior performance of late-fusion networks. In contrast, this work demonstrates that multimodal data can be effectively classified without any explicit modality fusion, using deep ensembles of unimodal networks. We systematically compare deep ensembles to late-fusion networks at equal parameter count and show that ensembles consistently outperform state-of-the-art late-fusion methods designed to address modality imbalance. This advantage also holds over intermediate-fusion techniques we evaluated and over hybrid methods that combine unimodal and multimodal predictions. We propose and empirically validate a method for selecting the number of models per modality in an ensemble, avoiding computationally expensive exhaustive search. Under extreme modality imbalance and small ensemble sizes, the heuristic indicates that ensembles of unimodal models trained solely on the stronger modality are preferable; as the ensemble scales up, incorporating models from the weaker modality becomes beneficial. Both predictions align with our empirical findings. To systematically explore the challenges of optimizing multimodal models, we propose a synthetic multimodal framework that allows control over both the number of modalities and their predictive strength; our findings are consistent across synthetic and real-world datasets. Finally, by fitting scaling laws to bimodal datasets, we estimate the asymptotic performance of ensembles.
- Abstract(参考訳): マルチモーダル分類において、レイトフュージョン・アプローチは、単一モーダルニューラルネットワークによって抽出された連結モダリティ固有の特徴を分類する。
モーダリティの不均衡が発音されると、学習過程のバランスを保ち、レイトフュージョンネットワークの劣る性能を克服する様々な正規化手法が提案されている。
対照的に、この研究は、単一モーダルネットワークの深いアンサンブルを用いて、明示的なモダリティ融合なしに、マルチモーダルデータを効果的に分類できることを示した。
我々は, アンサンブルとレイトフュージョンネットワークを等価パラメータ数で体系的に比較し, アンサンブルがモダリティの不均衡に対処するために設計された最先端のレイトフュージョン法より一貫して優れていることを示す。
この利点は、評価した中間核融合技術や、一様および多モードの予測を組み合わせたハイブリッド手法にも耐えうる。
本研究では,アンサンブルにおけるモダリティ毎のモデル数を選択する手法を提案し,実証的に検証する。
極度のモダリティ不均衡と小さなアンサンブルサイズの下で、ヒューリスティックは、より強いモダリティにのみ訓練されたユニモーダルモデルのアンサンブルが好ましいことを示している。
どちらの予測も経験的な結果と一致します。
マルチモーダルモデルの最適化という課題を体系的に検討するため,本研究では,モダリティの数と予測強度の両方を制御可能な合成マルチモーダルフレームワークを提案する。
最後に、2モーダルデータセットにスケーリング法則を適用することにより、アンサンブルの漸近的性能を推定する。
関連論文リスト
- Omnimodal Dataset Distillation via High-order Proxy Alignment [59.74134776126595]
本稿では,プロキシ構造を用いて高次クロスモーダルアライメントをキャプチャするHoPAを提案する。
本手法は,一対のモダリティモデリングの複雑さを回避し,不均一なモダリティをまたいだスケーラブルなプロキシ解析を可能にする。
論文 参考訳(メタデータ) (2026-04-12T14:47:41Z) - Calibrated Multimodal Representation Learning with Missing Modalities [100.55774771852468]
マルチモーダル表現学習は、それらを統一潜在空間に整列させることにより、異なるモダリティを調和させる。
最近の研究は、従来のクロスモーダルアライメントを一般化して、強化されたマルチモーダル・シナジーを生成するが、すべてのモダリティを共通の例に含める必要がある。
我々は、アンカーシフトの観点から、この問題に関する理論的洞察を提供する。
モーダルの欠如に起因する不完全なアライメントを校正するために,マルチモーダル表現学習のためのCalMRLを提案する。
論文 参考訳(メタデータ) (2025-11-15T05:01:43Z) - NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching [64.10695425442164]
NExT-OMNI(英語版)は、離散フローパラダイムによる統一モデリングを実現するオープンソース・オムニモーダル・ファンデーション・モデルである。
NExT-OMNIは、大規模なインターリーブ付きテキスト、画像、ビデオ、オーディオデータに基づいて訓練され、マルチモーダル生成および理解ベンチマーク上で競合するパフォーマンスを提供する。
さらなる研究を進めるために、トレーニングの詳細、データプロトコル、およびコードとモデルチェックポイントの両方をオープンソース化する。
論文 参考訳(メタデータ) (2025-10-15T16:25:18Z) - Rebalanced Multimodal Learning with Data-aware Unimodal Sampling [39.77348232514481]
We propose a novel MML approach called underlineData-aware underlineUnimodal underlineSampling(method)。
学習状況に基づいて、強化学習(RL)に基づくデータ認識アンモダルサンプリング手法を提案する。
本手法は,プラグインとして既存のほとんどすべてのマルチモーダル学習手法にシームレスに組み込むことができる。
論文 参考訳(メタデータ) (2025-03-05T08:19:31Z) - Bridging the inference gap in Mutimodal Variational Autoencoders [6.246098300155483]
マルチモーダル変分オートエンコーダは、観測されたモダリティから観測されていないモダリティを生成するための多目的でスケーラブルな方法を提供する。
エキスパートの混合集合を用いた最近のモデルは、複雑なデータセットにおける生成品質を制限する理論的に基礎的な制限に悩まされている。
本稿では,混合アグリゲーションを導入することなく,結合分布と条件分布の両方を学習できる新しい解釈可能なモデルを提案する。
論文 参考訳(メタデータ) (2025-02-06T10:43:55Z) - Regularized Neural Ensemblers [55.15643209328513]
本研究では,正規化ニューラルネットワークをアンサンブル手法として活用することを検討する。
低多様性のアンサンブルを学習するリスクを動機として,ランダムにベースモデル予測をドロップすることで,アンサンブルモデルの正規化を提案する。
このアプローチはアンサンブル内の多様性の低い境界を提供し、過度な適合を減らし、一般化能力を向上させる。
論文 参考訳(メタデータ) (2024-10-06T15:25:39Z) - Dealing with All-stage Missing Modality: Towards A Universal Model with Robust Reconstruction and Personalization [14.606035444283984]
現在のアプローチでは、推論中にモダリティ不完全入力を処理するモデルの開発に重点を置いている。
本稿では、モダリティ再構成とモデルパーソナライゼーションを備えた頑健な普遍モデルを提案する。
本手法は2つの脳腫瘍セグメンテーションベンチマークで広範囲に検証されている。
論文 参考訳(メタデータ) (2024-06-04T06:07:24Z) - Unified Multi-modal Unsupervised Representation Learning for
Skeleton-based Action Understanding [62.70450216120704]
教師なしの事前訓練は骨格に基づく行動理解において大きな成功を収めた。
我々はUmURLと呼ばれる統一マルチモーダル非教師なし表現学習フレームワークを提案する。
UmURLは効率的な早期融合戦略を利用して、マルチモーダル機能を単一ストリームで共同でエンコードする。
論文 参考訳(メタデータ) (2023-11-06T13:56:57Z) - Sequential Bayesian Neural Subnetwork Ensembles [4.6354120722975125]
本稿では、トレーニング過程を通じてモデルの複雑さを一貫して維持する動的ベイズニューラルワークのシーケンシャルアンサンブルに対するアプローチを提案する。
提案手法は,予測精度,不確実性推定,アウト・オブ・ディストリビューション検出,および対向ロバスト性の観点から,従来の密度決定モデルとスパース決定モデル,ベイズアンサンブルモデルより優れる。
論文 参考訳(メタデータ) (2022-06-01T22:57:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。