論文の概要: Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification
- arxiv url: http://arxiv.org/abs/2607.24683v1
- Date: Mon, 27 Jul 2026 17:23:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.520837
- Title: Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification
- Title(参考訳): マルチモーダル分類における任意モードの欠落に対する共学習
- Abstract要約: 欠落したモダリティを扱うために、機能レベルと決定レベルの両方で情報を活用する2つのアプローチを導入します。
2つのマルチモーダル分類ベンチマークの実験では、様々なモダリティ条件が欠如している。
- 参考スコア(独自算出の注目度): 5.850980612003824
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-modal classification leverages complementary information across diverse data sources to enhance predictive performance. However, real-world scenarios subject to operational constraints, such as sensor failures or privacy restrictions, lead to inconsistent modality availability between training and inference times. To handle missing modalities, prior studies have mainly covered bimodal data setups and focused on designing robust fusion processes. Instead, we adopt a multi-modal co-learning framework that prioritizes inter-modal collaboration rather than multi-modal fusion. Specifically, we consider that any subset of modalities may be absent, without assuming predefined missing-modality patterns, an inference scenario we refer to as missing arbitrary modalities. To address this challenge, we introduce two alternative approaches that leverage information at both feature- and decision-level. Experiments on two multi-modal classification benchmarks demonstrate significant robustness gains in various missing modality conditions. The first method shows more robust behavior under minimal missing conditions, where a single modality is absent, whereas the second performs better under extreme missing conditions, where all-but-one modalities are missing. Our code is available at https://github.com/fmenat/Co4Miss.
- Abstract(参考訳): マルチモーダル分類は、様々なデータソースにまたがる相補的な情報を活用し、予測性能を向上させる。
しかし、現実のシナリオは、センサーの障害やプライバシーの制限といった運用上の制約を受けており、トレーニングと推論時間の間に一貫性のないモダリティの可用性をもたらす。
モダリティの欠如に対処するため、従来の研究は主にバイモーダルデータの設定をカバーし、堅牢な融合プロセスの設計に重点を置いてきた。
代わりに、マルチモーダル融合よりもモーダル間コラボレーションを優先するマルチモーダルコラーニングフレームワークを採用しています。
具体的には、未定義のモダリティパターンを仮定することなく、任意のモダリティの部分集合が欠落する可能性があると考え、この推論シナリオを任意のモダリティの欠落とみなす。
この課題に対処するために、機能レベルと意思決定レベルの両方で情報を活用する2つの代替アプローチを導入します。
2つのマルチモーダル分類ベンチマークの実験は、様々なモダリティ条件で顕著なロバスト性向上を示す。
第1の手法は、単一のモダリティが欠如している最小の条件下ではより堅牢な振る舞いを示すが、第2の手法は極端に欠落している条件下では、全対一のモダリティが欠落している。
私たちのコードはhttps://github.com/fmenat/Co4Miss.comで入手可能です。
関連論文リスト
- BrokenBind: Universal Modality Exploration beyond Dataset Boundaries [112.81381711545043]
我々はBrokenBindを紹介した。BrokenBindは、異なるデータセットから提示されるバインディングのモダリティに焦点を当てている。
私たちのフレームワークでは、データセットの制限なしに、任意の2つのモダリティを結び付けることができます。
論文 参考訳(メタデータ) (2026-02-06T07:26:49Z) - Towards Modality Generalization: A Benchmark and Prospective Analysis [68.20973671493203]
本稿では,モダリティ・ジェネリゼーション(MG)について述べる。
マルチモーダルアルゴリズムを特徴とする包括的ベンチマークを提案し,一般化に着目した既存手法を適用した。
私たちの研究は、堅牢で適応可能なマルチモーダルモデルを進化させる基盤を提供し、現実的なシナリオで目に見えないモダリティを扱えるようにします。
論文 参考訳(メタデータ) (2024-12-24T08:38:35Z) - Deep Correlated Prompting for Visual Recognition with Missing Modalities [22.40271366031256]
大規模マルチモーダルモデルでは、ペア化された大規模マルチモーダルトレーニングデータを用いて、一連のタスクに対して優れた性能を示す。
しかし、プライバシーの制約やコレクションの難しさのために、この単純な仮定が現実の世界で常に成り立つとは限らない。
そこで本研究では,大規模事前学習型マルチモーダルモデルを用いて,欠落事例を異なる入力タイプとして扱うことで,欠落したモダリティシナリオに対処する学習手法を提案する。
論文 参考訳(メタデータ) (2024-10-09T05:28:43Z) - Missing Modality Prediction for Unpaired Multimodal Learning via Joint Embedding of Unimodal Models [6.610033827647869]
実世界のシナリオでは、完全なマルチモーダルデータを一貫して取得することは重大な課題である。
これはしばしば、特定のモダリティのデータが欠落しているモダリティの問題につながる。
自己教師型共同埋め込み学習手法を用いて, パラメータ効率のよい未学習モデルの微調整を行う新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-07-17T14:44:25Z) - Learning Unseen Modality Interaction [54.23533023883659]
マルチモーダル学習は、すべてのモダリティの組み合わせが訓練中に利用でき、クロスモーダル対応を学ぶことを前提としている。
我々は、目に見えないモダリティ相互作用の問題を提起し、第1の解を導入する。
異なるモジュラリティの多次元的特徴を、豊富な情報を保存した共通空間に投影するモジュールを利用する。
論文 参考訳(メタデータ) (2023-06-22T10:53:10Z) - Exploiting modality-invariant feature for robust multimodal emotion
recognition with missing modalities [76.08541852988536]
我々は、欠落したモダリティ・イマジネーション・ネットワーク(IF-MMIN)に不変な特徴を用いることを提案する。
提案モデルは,不確実なモダリティ条件下で,すべてのベースラインを上回り,全体の感情認識性能を不変に向上することを示す。
論文 参考訳(メタデータ) (2022-10-27T12:16:25Z) - Bi-Bimodal Modality Fusion for Correlation-Controlled Multimodal
Sentiment Analysis [96.46952672172021]
Bi-Bimodal Fusion Network (BBFN) は、2対のモダリティ表現で融合を行う新しいエンドツーエンドネットワークである。
モデルは、モダリティ間の既知の情報不均衡により、2つのバイモーダルペアを入力として取る。
論文 参考訳(メタデータ) (2021-07-28T23:33:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。