論文の概要: Rethinking Multimodal Fusion for Time Series: Auxiliary Modalities Need Constrained Fusion
- arxiv url: http://arxiv.org/abs/2603.22372v1
- Date: Mon, 23 Mar 2026 07:44:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.1075
- Title: Rethinking Multimodal Fusion for Time Series: Auxiliary Modalities Need Constrained Fusion
- Title(参考訳): 時系列用マルチモーダル核融合の再考:補助モーダルは固定核融合を必要とする
- Authors: Seunghan Lee, Jun Seo, Jaehoon Lee, Sungdong Yoo, Minjae Kim, Tae Yoon Lim, Dongwan Kang, Hwanil Choi, SoonYoung Lee, Wonbin Ahn,
- Abstract要約: 核融合戦略を持つマルチモーダルモデルは、しばしば単調TSモデルよりも性能が低いことを示す。
このような統合を制御するために設計された制約付き融合法を提案する。
さまざまなデータセットとTS/テキストモデルにまたがって20K以上の実験を行います。
- 参考スコア(独自算出の注目度): 12.754011132549167
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Recent advances in multimodal learning have motivated the integration of auxiliary modalities such as text or vision into time series (TS) forecasting. However, most existing methods provide limited gains, often improving performance only in specific datasets or relying on architecture-specific designs that limit generalization. In this paper, we show that multimodal models with naive fusion strategies (e.g., simple addition or concatenation) often underperform unimodal TS models, which we attribute to the uncontrolled integration of auxiliary modalities which may introduce irrelevant information. Motivated by this observation, we explore various constrained fusion methods designed to control such integration and find that they consistently outperform naive fusion methods. Furthermore, we propose Controlled Fusion Adapter (CFA), a simple plug-in method that enables controlled cross-modal interactions without modifying the TS backbone, integrating only relevant textual information aligned with TS dynamics. CFA employs low-rank adapters to filter irrelevant textual information before fusing it into temporal representations. We conduct over 20K experiments across various datasets and TS/text models, demonstrating the effectiveness of the constrained fusion methods including CFA. Code is publicly available at: https://github.com/seunghan96/cfa/.
- Abstract(参考訳): マルチモーダル学習の最近の進歩は、テキストやビジョンなどの補助的なモダリティを時系列予測(TS)に統合する動機となっている。
しかし、既存のほとんどのメソッドは限られたゲインを提供し、しばしば特定のデータセットでのみパフォーマンスを改善したり、一般化を制限するアーキテクチャ固有の設計に依存している。
本稿では, 単純加法や連結法を具体化した多モードモデルにおいて, 不適切な情報を導入しうる補助的モダリティの制御不能な統合が原因で, 不定形TSモデルに過小評価されることがしばしばあることを示す。
本研究の目的は,このような統合を制御するために設計された様々な制約付き核融合法を探索し,それらが連続的にナイーブ核融合法より優れていることを明らかにすることである。
さらに,TSバックボーンの変更を伴わずに相互モーダル間通信を制御できる簡易なプラグイン手法であるCFAを提案し,TS動的に整合したテキスト情報のみを統合する。
CFAは低ランクのアダプタを使用して、時間表現に融合する前に無関係なテキスト情報をフィルタリングする。
各種データセットおよびTS/テキストモデルに対して20K以上の実験を行い、CFAを含む制約付き融合法の有効性を実証した。
コードは、https://github.com/seunghan96/cfa/.comで公開されている。
関連論文リスト
- Towards Unified Semantic and Controllable Image Fusion: A Diffusion Transformer Approach [99.80480649258557]
DiTFuseは命令駆動のフレームワークで、単一のモデル内でセマンティクスを意識した融合を実行する。
パブリックなIVIF、MFF、MEFベンチマークの実験では、より優れた量的および質的な性能、よりシャープなテクスチャ、より優れたセマンティック保持が確認されている。
論文 参考訳(メタデータ) (2025-12-08T05:04:54Z) - Spectrum-based Modality Representation Fusion Graph Convolutional Network for Multimodal Recommendation [7.627299398469962]
本稿では,新しいスペクトルベースのモダリティ表現グラフレコメンデータを提案する。
モダリティノイズを同時に抑制しながら、ユニモーダルとフュージョンの両方の好みを捉えることを目的としている。
実世界の3つのデータセットを用いた実験により,提案モデルの有効性が示された。
論文 参考訳(メタデータ) (2024-12-19T15:53:21Z) - Multimodality Helps Few-shot 3D Point Cloud Semantic Segmentation [61.91492500828508]
FS-PCS (Few-shot 3D point cloud segmentation) は、最小のサポートサンプルで新しいカテゴリを分割するモデルを一般化することを目的としている。
テキストラベルと潜在的に利用可能な2次元画像モダリティを利用したマルチモーダルFS-PCS構成を提案する。
トレーニングバイアスを軽減するため,テスト時間適応型クロスモーダル(TACC)技術を提案する。
論文 参考訳(メタデータ) (2024-10-29T19:28:41Z) - Computation and Parameter Efficient Multi-Modal Fusion Transformer for
Cued Speech Recognition [48.84506301960988]
Cued Speech (CS) は、聴覚障害者が使用する純粋視覚符号化法である。
自動CS認識(ACSR)は、音声の視覚的手がかりをテキストに書き起こそうとする。
論文 参考訳(メタデータ) (2024-01-31T05:20:29Z) - A Self-Adjusting Fusion Representation Learning Model for Unaligned
Text-Audio Sequences [16.38826799727453]
融合表現を学習するために各モダリティの関連情報を統合する方法は、マルチモーダル学習における中心的な課題の1つとなっている。
本稿では,不整合テキストや音声シーケンスから直接,頑健な相互拡散表現を学習するために,自己調整型融合表現学習モデルを提案する。
実験結果から,本モデルでは不整合テキスト・オーディオ・シーケンスにおける全ての指標の性能が大幅に向上したことが示された。
論文 参考訳(メタデータ) (2022-11-12T13:05:28Z) - Attention Bottlenecks for Multimodal Fusion [90.75885715478054]
機械知覚モデルは典型的にはモダリティに特化しており、単調なベンチマークのために最適化されている。
複数の層でのモジュラリティ融合に「融合」を用いる新しいトランスフォーマーアーキテクチャを導入する。
我々は、徹底的なアブレーション研究を行い、複数のオーディオ視覚分類ベンチマークで最先端の結果を得る。
論文 参考訳(メタデータ) (2021-06-30T22:44:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。