論文の概要: SynCo: Learning Cross-Modal Synergy by Contrasting Interaction Residuals
- arxiv url: http://arxiv.org/abs/2609.32846v1
- Date: Sat, 26 Sep 2026 18:19:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 19:41:55.986729
- Title: SynCo: Learning Cross-Modal Synergy by Contrasting Interaction Residuals
- Title(参考訳): SynCo: インタラクション残量との対比によるクロスモーダルなシナジーの学習
- Abstract要約: マルチモーダルコントラスト学習は、ラベルのないデータから転送可能な表現を学習するための支配的なパラダイムである。
最近のフレームワークは、対照的な学習を拡張して3つのコンポーネントをすべてキャプチャするが、実際にはシナジーは訓練されていない。
本稿では, 相互作用残差の専門監督を通じて, シナジー訓練を直接処理する手法であるSynCoを提案する。
- 参考スコア(独自算出の注目度): 6.929741688224915
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal contrastive learning is a dominant paradigm for learning transferable representations from unlabeled data, but standard objectives primarily capture information that is redundant between modalities. Partial Information Decomposition (PID) shows that task-relevant information in multimodal data decomposes into three components: redundancy shared between modalities, uniqueness specific to each modality, and synergy available only from their joint observation. Recent frameworks extend contrastive learning to capture all three components, yet synergy remains undertrained in practice. We propose SynCo (Synergy Contrastive Learning), a method that directly addresses synergy undertraining through dedicated supervision on an interaction residual. SynCo fits a linear projector to predict the fused representation from independently computed unimodal features, and the resulting interaction residual, which removes the linearly unimodal-predictable component, receives dedicated contrastive supervision at negligible computational cost. On the controlled Trifeature benchmark, SynCo achieves state-of-the-art synergy capture with a $+5.98\%$ gain over the baseline, and on real-world benchmarks from MultiBench, DARai, and MM-IMDb, SynCo consistently outperforms or matches prior methods across diverse modality combinations and task types. The method operates as a plug-in to existing contrastive multimodal frameworks without modifying the underlying fusion architecture and can further improve synergy capture when combined with other methods.
- Abstract(参考訳): マルチモーダルコントラスト学習は、ラベルのないデータから転送可能な表現を学習するための支配的なパラダイムであるが、標準目的は主にモダリティ間で冗長な情報をキャプチャする。
部分情報分解(PID)は,マルチモーダルデータのタスク関連情報を3つの構成要素に分解することを示す。
最近のフレームワークは、対照的な学習を拡張して3つのコンポーネントをすべてキャプチャするが、実際にはシナジーは訓練されていない。
相互作用残差を専門的に監督することで、シナジーの訓練に直接対処するSynCo(Synergy Contrastive Learning)を提案する。
SynCoは線形プロジェクタに適合し、独立に計算された単調な特徴から融合表現を予測する。
制御されたTrifeatureベンチマークでは、SynCoはベースラインよりも$+5.98\%の利益で最先端のシナジーキャプチャを達成し、MultiBench、DARai、MM-IMDbといった実世界のベンチマークでは、さまざまなモダリティの組み合わせとタスクタイプで、従来手法よりも一貫してパフォーマンスが向上または一致している。
本手法は,既存のコントラッシブなマルチモーダルフレームワークへのプラグインとして動作し,その基盤となるフュージョンアーキテクチャを変更することなく,他の手法と組み合わせた場合のシナジーキャプチャをさらに向上させることができる。
関連論文リスト
- SynIB: Informational Bottleneck for Maximizing Synergy in Multimodal Learning [25.615780318743475]
情報理論によるマルチモーダル・シナジーの定式化とSynIB(Syngistic Information Bottleneck)の導入
学習シナジーを優先するために、SynIBはあらゆるモダリティから正確に予測するモデルを動機付け、あらゆるモダリティからの情報が保持されない場合に信頼を罰する。
実世界の5つのベンチマークでは、SynIBはシナジーに依存したサンプルの精度を最大7.8%改善し、全体的な精度は最大3.8%向上した。
論文 参考訳(メタデータ) (2026-05-12T19:42:19Z) - Uni-Synergy: Bridging Understanding and Generation for Personalized Reasoning via Co-operative Reinforcement Learning [56.99010101756807]
我々は、パーソナライズされた理解と生成を共同で最適化する、エンドツーエンドの強化学習フレームワークSync-R1を提案する。
Sync-R1はパーソナライズされた理解を可能にしてコンテンツ生成をガイドし、生成した品質は相互に理解を洗練させる。
また,低電位トラジェクタを適応的にフィルタして勾配分散を低減し,収束を加速する動的グループスケーリング(DGS)も導入する。
実験結果から,Sync-R1は高度なクロスタスク推論とロバストなパーソナライゼーションを実現していることがわかった。
論文 参考訳(メタデータ) (2026-05-11T12:18:26Z) - Feature-level Interaction Explanations in Multimodal Transformers [1.7101146971136896]
マルチモーダルトランスフォーマーは、異なるモーダルが共同で意思決定をどのように支援するかを明確にすることなく、予測を生成する。
本稿では,凍結した事前学習エンコーダからトークン/パッチシーケンスを直接操作する構造化Mixture-of-Experts層であるFeature-level I2MoEを提案する。
我々は,帰属とトップK%マスキングを組み合わせ,忠実度を評価する専門的な説明パイプラインを開発する。
論文 参考訳(メタデータ) (2026-03-04T18:24:31Z) - Orthogonalized Multimodal Contrastive Learning with Asymmetric Masking for Structured Representations [4.67724003380452]
マルチモーダル学習は異種情報源からの情報を統合することを目的としており、そこでは信号はモダリティ間で共有され、個々のモダリティに特有であり、相互作用を通してのみ現れる。
自己教師型マルチモーダルコントラスト学習は目覚ましい進歩を遂げてきたが、既存の手法のほとんどは冗長なクロスモーダル信号を捉え、しばしばモダリティ固有の(一意的な)情報や相互作用駆動の(シネルジスティックな)情報を無視している。
最近の拡張は、この視点を広げるが、それらは相乗的相互作用を明示的にモデル化したり、異なる情報コンポーネントを絡み合った方法で学習することに失敗し、不完全な表現と潜在的な情報漏洩につながる。
基本的枠組みである textbfCOrAL を導入する。
論文 参考訳(メタデータ) (2026-02-16T18:06:53Z) - The More, the Merrier: Contrastive Fusion for Higher-Order Multimodal Alignment [9.00329317378599]
Contrastive Fusion (ConFu) は、個々のモダリティとそれらの融合を統一された表現空間に埋め込むフレームワークである。
合成および実世界のマルチモーダルベンチマーク上でのConFuの評価を行い、クロスモーダルの相補性を活用し、高次依存関係を捕捉し、マルチモーダルの複雑さを増大させる能力を評価する。
論文 参考訳(メタデータ) (2025-11-26T12:25:55Z) - ImagebindDC: Compressing Multi-modal Data with Imagebind-based Condensation [12.924585390383085]
ImageBindDCは、ImageBindの統一された機能空間内で動作する、新しいデータ凝縮フレームワークである。
我々のアプローチは、強力な特徴関数(CF)損失を利用することで、従来の分散マッチングを超えています。
実験では、ImageBindDC:のNYU-v2データセットの有効性を強調している。
論文 参考訳(メタデータ) (2025-11-11T13:55:46Z) - Divide-and-Conquer: Confluent Triple-Flow Network for RGB-T Salient Object Detection [70.84835546732738]
RGB-Thermal Salient Object Detectionは、目視と熱赤外画像のペア内の目立つ物体をピンポイントすることを目的としている。
従来のエンコーダ・デコーダアーキテクチャは、欠陥モードから生じるノイズに対する頑健さを十分に考慮していなかったかもしれない。
本稿では,Divide-and-Conquer戦略を用いた,堅牢なConfluent Triple-Flow NetworkであるConTriNetを提案する。
論文 参考訳(メタデータ) (2024-12-02T14:44:39Z) - Multi-Grained Multimodal Interaction Network for Entity Linking [65.30260033700338]
マルチモーダルエンティティリンクタスクは、マルチモーダル知識グラフへの曖昧な言及を解決することを目的としている。
MELタスクを解決するための新しいMulti-Grained Multimodal InteraCtion Network $textbf(MIMIC)$ frameworkを提案する。
論文 参考訳(メタデータ) (2023-07-19T02:11:19Z) - Multimodal Learning Without Labeled Multimodal Data: Guarantees and Applications [90.6849884683226]
ラベル付き単調データのみを用いた半教師付き環境における相互作用定量化の課題について検討する。
相互作用の正確な情報理論的定義を用いて、我々の重要な貢献は下界と上界の導出である。
本稿では、これらの理論結果を用いてマルチモーダルモデルの性能を推定し、データ収集をガイドし、様々なタスクに対して適切なマルチモーダルモデルを選択する方法について述べる。
論文 参考訳(メタデータ) (2023-06-07T15:44:53Z) - Bi-Bimodal Modality Fusion for Correlation-Controlled Multimodal
Sentiment Analysis [96.46952672172021]
Bi-Bimodal Fusion Network (BBFN) は、2対のモダリティ表現で融合を行う新しいエンドツーエンドネットワークである。
モデルは、モダリティ間の既知の情報不均衡により、2つのバイモーダルペアを入力として取る。
論文 参考訳(メタデータ) (2021-07-28T23:33:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。