論文の概要: Beyond Noisy Signals: Dual-Level Denoising for Multi-modal Sequential Recommendation
- arxiv url: http://arxiv.org/abs/2607.18786v1
- Date: Tue, 21 Jul 2026 07:06:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.343753
- Title: Beyond Noisy Signals: Dual-Level Denoising for Multi-modal Sequential Recommendation
- Title(参考訳): 雑音以外の信号:マルチモーダルシーケンスレコメンデーションのためのデュアルレベルデノベーション
- Abstract要約: textbfDual-level textbfDenoising textbfMulti-modal textbfSequential textbfRecommendation frameworkを提案する。
- 参考スコア(独自算出の注目度): 6.902443075506667
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-modal Sequential Recommendation (SR) incorporates rich side information (e.g., textual and visual features) to enhance dynamic user preference modeling. However, existing frameworks inevitably suffer from a \textbf{Dual-Noise Dilemma}: (1) \textit{Feature-level redundancy} stemming from the semantic gap between generic pre-trained representations and fine-grained recommendation intent; and (2) \textit{Sequence-level stochasticity} induced by spurious interactions such as accidental clicks. To break this bottleneck, we propose \textbf{DDMSR}, a novel \textbf{D}ual-level \textbf{D}enoising \textbf{M}ulti-modal \textbf{S}equential \textbf{R}ecommendation framework that systematically purifies signals from both feature-topological and sequence-frequency perspectives. Specifically, we first design a graph-based feature denoising module that leverages Laplacian smoothing on item semantic graphs as a structural low-pass filter, effectively suppressing high-frequency semantic noise while preserving salient features. For sequence purification, we introduce a frequency-domain sequence denoising module, utilizing the Fast Fourier Transform and a learnable frequency filter to adaptively modulate the interaction spectrum and attenuate anomalous signals. Furthermore, a multi-modal contrastive alignment objective is incorporated to bridge the heterogeneity gap and enforce cross-modal semantic consistency. Extensive experiments on four public benchmark datasets demonstrate that DDMSR consistently outperforms state-of-the-art baselines, providing a highly robust and efficient solution for multi-modal sequential recommendation. The source code is available at: ~\href{https://github.com/jluo00/DDMSR}{\textcolor{blue}{https://github.com/jluo00/DDMSR}}.
- Abstract(参考訳): Multi-modal Sequential Recommendation (SR)は、リッチなサイド情報(テキストや視覚的特徴など)を取り入れ、動的なユーザ嗜好モデリングを強化する。
しかし、既存のフレームワークは、必然的に \textbf{Dual-Noise Dilemma} に苦しめられている: (1) \textit{Feature-level redundancy} は、一般的な事前学習された表現ときめ細かい推奨意図のセマンティックなギャップから生じる; (2) 偶然クリックのような刺激的な相互作用によって引き起こされる \textit{Sequence-level stochasticity} である。
このボトルネックを打破するために、我々は、特徴位相とシーケンス周波数の両方の観点から信号を体系的に浄化する、新しい \textbf{D}ual-level \textbf{D}enoising \textbf{M}ulti-modal \textbf{S}equential \textbf{R}ecommendation framework である \textbf{D}ual-level \textbf{D}enoising \textbf{M}ulti-modal \textbf{S}equential \textbf{R}ecommendation frameworkを提案する。
具体的には、まず、アイテムセマンティックグラフ上のラプラシアンな平滑化を構造的ローパスフィルタとして活用し、高頻度セマンティックノイズを効果的に抑制し、健全な特徴を保存するグラフベースの特徴記述モジュールを設計する。
シーケンス浄化のために、Fast Fourier変換と学習可能な周波数フィルタを利用して、相互作用スペクトルを適応的に変調し、異常信号の減衰を行う周波数領域列デノナイズモジュールを導入する。
さらに、不均一性ギャップをブリッジし、モーダル間のセマンティック一貫性を強制するために、マルチモーダルコントラストアライメントの目的が組み込まれている。
4つの公開ベンチマークデータセットに対する大規模な実験により、DDMSRは最先端のベースラインを一貫して上回り、マルチモーダルシーケンシャルなレコメンデーションのための非常に堅牢で効率的なソリューションを提供する。
ソースコードは以下の通りである。 ~\href{https://github.com/jluo00/DDMSR}{\textcolor{blue}{https://github.com/jluo00/DDMSR}}。
関連論文リスト
- Dynamic Spectral Denoising with Global-Context Attention for Multi-Behavior Recommendation [58.33732779555114]
重要なボトルネックは、2つの結合した不均一性によって引き起こされる表現レベルの失敗である、と我々は主張する。
マルチビヘイビアレコメンデーション(SpectraMB)のためのグローバルコンテキストを考慮した動的スペクトルデノベーションを提案する。
SpectraMBは、ほとんどの評価設定で最高の結果を達成し、ノイズのある相互作用下での堅牢性の向上を示す。
論文 参考訳(メタデータ) (2026-06-01T15:58:13Z) - Disentangle-then-Refine: LLM-Guided Decoupling and Structure-Aware Refinement for Graph Contrastive Learning [8.080589414732982]
テキスト分散グラフ(TAG)上の従来のグラフコントラスト学習(GCL)は、意図せずノイズを伴うタスク関連信号を絡み合わせるブラインド拡張に依存している。
近似直交分解に固定された頑健なフレームワークであるSDM-SCRを提案する。
論文 参考訳(メタデータ) (2026-04-16T07:57:11Z) - Subtractive Modulative Network with Learnable Periodic Activations [59.89799070130572]
本稿では,古典的部分抽出合成にインスパイアされた,パラメータ効率の高いインプシットニューラル表現アーキテクチャを提案する。
我々のSMNは2つの画像データセット上で40ドル以上のPSNRを達成し、再現精度とパラメータ効率の両面で最先端の手法と比較した。
論文 参考訳(メタデータ) (2026-02-18T10:20:50Z) - FITMM: Adaptive Frequency-Aware Multimodal Recommendation via Information-Theoretic Representation Learning [14.873780184982003]
マルチモーダルレコメンデーションのための周波数対応情報理論フレームワークを提案する。
FITMMはグラフ付きアイテム表現を構築し、モダリティワイドスペクトル分解を行い、軽量なバンド内マルチモーダル成分を形成する。
実世界の3つのデータセットの実験では、FITMMは一貫して、高度なベースラインをはるかに上回っている。
論文 参考訳(メタデータ) (2026-01-30T03:16:54Z) - Test-time Adaptive Hierarchical Co-enhanced Denoising Network for Reliable Multimodal Classification [55.56234913868664]
マルチモーダルデータを用いた信頼性学習のためのTAHCD(Test-time Adaptive Hierarchical Co-enhanced Denoising Network)を提案する。
提案手法は,最先端の信頼性の高いマルチモーダル学習手法と比較して,優れた分類性能,堅牢性,一般化を実現する。
論文 参考訳(メタデータ) (2026-01-12T03:14:12Z) - DynaPURLS: Dynamic Refinement of Part-aware Representations for Skeleton-based Zero-Shot Action Recognition [51.80782323686666]
textbfDynaPURLSは、堅牢でマルチスケールなビジュアル・セマンティック対応を確立する統一的なフレームワークである。
我々のフレームワークは、グローバルな動きと局所的な身体部分のダイナミクスの両方を含む階層的なテキスト記述を生成するために、大きな言語モデルを活用する。
NTU RGB+D 60/120とPKU-MMDを含む3つの大規模ベンチマークデータセットの実験は、DynaPURLSが先行技術よりも大幅に優れていることを示した。
論文 参考訳(メタデータ) (2025-12-12T10:39:10Z) - From Points to Clouds: Learning Robust Semantic Distributions for Multi-modal Prompts [11.693848445032259]
大規模視覚言語モデル(VLM)を適応するための重要な手法として,MPL(Multimodal Prompt Learning)が登場した。
拡散モデルにインスパイアされた新しいフレームワークであるPoints-to-Clouds(P2C)を紹介する。
P2Cは、11データセットにわたる実験において、強いベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2025-11-28T06:03:35Z) - FindRec: Stein-Guided Entropic Flow for Multi-Modal Sequential Recommendation [57.577843653775]
textbfFindRec (textbfFlexible unified textbfinformation textbfdisentanglement for multi-modal sequence textbfRecommendation)を提案する。
Stein kernel-based Integrated Information Coordination Module (IICM) は理論上、マルチモーダル特徴とIDストリーム間の分散一貫性を保証する。
マルチモーダル特徴を文脈的関連性に基づいて適応的にフィルタリング・結合するクロスモーダル・エキスパート・ルーティング機構。
論文 参考訳(メタデータ) (2025-07-07T04:09:45Z) - Graph with Sequence: Broad-Range Semantic Modeling for Fake News Detection [18.993270952535465]
BREAKは偽ニュース検出のための広範囲セマンティクスモデルである。
完全に接続されたグラフを利用して、包括的なセマンティクスをキャプチャする。
構造ノイズと特徴ノイズの両方を最小限に抑えるために、デュアルデノゲーションモジュールを使用している。
論文 参考訳(メタデータ) (2024-12-07T14:35:46Z) - The Silent Assistant: NoiseQuery as Implicit Guidance for Goal-Driven Image Generation [31.599902235859687]
本稿では,テキストプロンプトなどの明示的なユーザ定義入力を補完する暗黙のガイダンスとして,一致したガウスノイズを活用することを提案する。
NoiseQueryはきめ細かい制御を可能にし、ハイレベルなセマンティクスや低レベルなビジュアル属性よりもパフォーマンスが大幅に向上する。
論文 参考訳(メタデータ) (2024-12-06T14:59:00Z) - High-Fidelity Speech Synthesis with Minimal Supervision: All Using
Diffusion Models [56.00939852727501]
最小教師付き音声合成は、2種類の離散音声表現を組み合わせることでTSを分離する。
非自己回帰フレームワークは、制御可能性を高め、持続拡散モデルは、多様化された韻律表現を可能にする。
論文 参考訳(メタデータ) (2023-09-27T09:27:03Z) - Conditional Denoising Diffusion for Sequential Recommendation [62.127862728308045]
GAN(Generative Adversarial Networks)とVAE(VAE)の2つの顕著な生成モデル
GANは不安定な最適化に苦しむ一方、VAEは後続の崩壊と過度に平らな世代である。
本稿では,シーケンスエンコーダ,クロスアテンティブデノナイジングデコーダ,ステップワイズディフューザを含む条件付きデノナイジング拡散モデルを提案する。
論文 参考訳(メタデータ) (2023-04-22T15:32:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。