論文の概要: Beyond Modality Harmony: Orthogonal Purification and Topology-Guided MoE for Conflict-Aware Multimodal Recommendation
- arxiv url: http://arxiv.org/abs/2609.02152v1
- Date: Wed, 02 Sep 2026 06:06:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.101111
- Title: Beyond Modality Harmony: Orthogonal Purification and Topology-Guided MoE for Conflict-Aware Multimodal Recommendation
- Title(参考訳): モダリティ・ハーモニーを超えて:紛争対応マルチモーダル勧告のための直交浄化とトポロジー誘導型MoE
- Authors: Jialin Liu, Zhaorui Zhang, Ray C. C. Cheung,
- Abstract要約: コンフリクト対応マルチモーダルレコメンデーション(OrthoRec)のための直交浄化とトポロジー誘導型MoEを提案する。
OrthoRecがCGOP(Collaborative-Guided Orthogonal Purification)を導入
我々はOrthoRecが競争力のある最近のベースラインを一貫して上回り、モダリティノイズやアイテムのスポーシティの下で頑健さを向上させることを示した。
- 参考スコア(独自算出の注目度): 6.78317230214304
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal Recommender Systems (MRSs) typically rely on a flawed "modality harmony" assumption, presuming that multimodal features are inherently beneficial and strictly aligned with users' collaborative interaction patterns. However, modality-topology conflicts are ubiquitous in real-world scenarios due to deceptive visual clickbaits and mismatched semantics. Blindly integrating these noisy modalities inevitably pollutes the pristine collaborative space, causing severe representation distortion. To address this, we propose Orthogonal purification and topology-guided MoE for conflict-aware multimodal Recommendation (OrthoRec). At its core, OrthoRec introduces Collaborative-Guided Orthogonal Purification (CGOP), which geometrically decouples multimodal features into directions parallel and orthogonal to a pure collaborative anchor. By adaptively truncating the orthogonal noise with an energy-preserving normalization, CGOP rectifies deceptive semantic directions while preserving the modality's intrinsic representation capacity. Furthermore, we design a Topology-Aware Routing Mixture-of-Experts (TAR-MoE). Guided by the collaborative topology, TAR-MoE employs decoupled sigmoid gating to break the zero-sum bottleneck of traditional softmax attention, autonomously determining the injection scale for each purified modality. Finally, a safe-SSL objective is introduced to dynamically penalize the forced contrastive alignment of contradictory pairs. Experiments on three real-world Amazon datasets show that OrthoRec consistently outperforms competitive recent baselines and exhibits improved robustness under modality noise and item sparsity.
- Abstract(参考訳): マルチモーダル・レコメンダ・システム(MRS)は通常、マルチモーダル機能は本質的に有益であり、ユーザの協調的な相互作用パターンと厳密に一致していると仮定して、欠陥のある「モダリティ調和」の仮定に依存している。
しかし、モダリティとトポロジーの対立は、視覚的なクリックベイトやミスマッチしたセマンティクスによって、現実のシナリオでは至るところに存在している。
これらのノイズモードを盲目的に統合することは、必然的に原始的協調空間を汚染し、激しい表現歪みを引き起こす。
そこで我々は,紛争対応マルチモーダルレコメンデーション(OrthoRec)のための直交浄化とトポロジー誘導型MoEを提案する。
OrthoRecの核心となるのは、協調誘導直交浄化(CGOP)であり、これは幾何的にマルチモーダルな特徴を純粋に協調的なアンカーに平行で直交する方向に分解するものである。
エネルギー保存正規化により直交雑音を適応的に切り離すことにより、CGOPは、モダリティの本質的な表現能力を保ちながら、知覚的意味方向を補正する。
さらに,TAR-MoE(Topology-Aware Routing Mixture-of-Experts)を設計する。
共同トポロジーによって導かれたTAR-MoEは、従来のソフトマックスアテンションのゼロサムボトルネックを断ち切るために、分離されたシグモイドゲーティングを用いて、精製された各モードに対する注入スケールを自律的に決定する。
最後に、矛盾するペアの強制的コントラストアライメントを動的に罰する安全なSSL目標を導入する。
実世界の3つのAmazonデータセットの実験によると、OrthoRecは競争力のある最近のベースラインを一貫して上回り、モダリティノイズとアイテムのスポーシティによる堅牢性の向上を示している。
関連論文リスト
- N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization [55.14402862283128]
我々は,グループ相対政策最適化フレームワークに統合された新しい探索戦略であるN-GRPOを紹介する。
トークンレベルのサンプリングやネイティブな埋め込みレベルのノイズに頼るのではなく、Semantic Neighbor Mixingを活用する。
N-GRPOは、数学推論ベンチマークの強いベースラインよりも一貫した改善を達成し、また分布外タスクの堅牢な一般化能力を示す。
論文 参考訳(メタデータ) (2026-06-09T12:21:27Z) - Intra-Modal Neighbors Never Lie: Rectifying Inter-Modal Noisy Correspondence via Graph-Based Intra-Modal Reasoning [35.81581893839085]
大規模ウェブハーベストデータセットは、クロスモーダル検索の進展を加速させているが、必然的にノイズ対応に悩まされている。
In-modal Neighbor-aware Noise Rectification (IN2R) という新しい枠組みを提案する。
論文 参考訳(メタデータ) (2026-06-02T12:26:28Z) - Better with Less: Tackling Heterogeneous Multi-Modal Image Joint Pretraining via Conditioned and Degraded Masked Autoencoder [34.73963627819185]
高分解能光合成開口レーダ(SAR)プレトレーニングは、単一ソース表現を相互に強化するために、モダリティの相乗効果を求める。
我々は、アライメントの少ないテキスト・ベッター・シナジーの先駆者であるCoDe-MAEを提案する。
CoDe-MAEは、表現の劣化を防ぎ、多様な単一および双方向の下流タスクにまたがる新しい最先端のパフォーマンスを確立する。
論文 参考訳(メタデータ) (2026-04-18T10:23:00Z) - Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs [84.3271821505699]
カオス・オブ・モダリティ(Chain of Modality, CoM)は、マルチモーダル融合を受動的結合から動的オーケストレーションに移行するエージェントフレームワークである。
CoMはトレーニングフリーまたはデータ効率のSFT設定で動作し、様々なベンチマークで堅牢で一貫した一般化を実現する。
論文 参考訳(メタデータ) (2026-04-16T01:21:14Z) - OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL [63.388513841293616]
既存の偽造検出手法は、現実世界の誤報に多いインターリーブされたテキスト、画像、ビデオを扱うのに失敗する。
このギャップを埋めるため,本論文では,オムニバス・ビジョン言語による偽造検出と接地のための統一フレームワークの開発を目標としている。
我々は、OmniVL-Guardという、オムニバス視覚言語による偽造検出と接地のためのバランスの取れた強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T09:41:36Z) - UniRoute: Unified Routing Mixture-of-Experts for Modality-Adaptive Remote Sensing Change Detection [6.323154336421137]
UniRouteは、モダリティ適応学習のための統一されたフレームワークである。
グローバルな意味的文脈から局所空間の詳細を遠ざけるための適応受容場ルーティングMOEモジュールを提案する。
また,データスカースな異種環境下での統一学習を安定化する一貫性を考慮した自己蒸留手法を提案する。
論文 参考訳(メタデータ) (2026-01-21T09:21:25Z) - Test-time Adaptive Hierarchical Co-enhanced Denoising Network for Reliable Multimodal Classification [55.56234913868664]
マルチモーダルデータを用いた信頼性学習のためのTAHCD(Test-time Adaptive Hierarchical Co-enhanced Denoising Network)を提案する。
提案手法は,最先端の信頼性の高いマルチモーダル学習手法と比較して,優れた分類性能,堅牢性,一般化を実現する。
論文 参考訳(メタデータ) (2026-01-12T03:14:12Z) - Calibrated Multimodal Representation Learning with Missing Modalities [100.55774771852468]
マルチモーダル表現学習は、それらを統一潜在空間に整列させることにより、異なるモダリティを調和させる。
最近の研究は、従来のクロスモーダルアライメントを一般化して、強化されたマルチモーダル・シナジーを生成するが、すべてのモダリティを共通の例に含める必要がある。
我々は、アンカーシフトの観点から、この問題に関する理論的洞察を提供する。
モーダルの欠如に起因する不完全なアライメントを校正するために,マルチモーダル表現学習のためのCalMRLを提案する。
論文 参考訳(メタデータ) (2025-11-15T05:01:43Z) - UniMRSeg: Unified Modality-Relax Segmentation via Hierarchical Self-Supervised Compensation [104.59740403500132]
マルチモーダルイメージセグメンテーションは、不完全/破損したモダリティの劣化による実際のデプロイメント課題に直面している。
階層型自己教師型補償(HSSC)による統一Modality-relaxセグメンテーションネットワーク(UniMRSeg)を提案する。
我々のアプローチは、入力レベル、特徴レベル、出力レベルをまたいだ完全なモダリティと不完全なモダリティの間の表現ギャップを階層的に橋渡しします。
論文 参考訳(メタデータ) (2025-09-19T17:29:25Z) - Dynamic Weighted Combiner for Mixed-Modal Image Retrieval [8.683144453481328]
フレキシブル検索パラダイムとしてのMixed-Modal Image Retrieval (MMIR) が注目されている。
以前のアプローチは常に2つの重要な要因のため、限られたパフォーマンスを達成する。
以上の課題に対処するための動的重み付け結合器(DWC)を提案する。
論文 参考訳(メタデータ) (2023-12-11T07:36:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。