論文の概要: Stream-aware Side Adaptation for Large Pre-trained Multimodal Embedding Models in Sequential Recommendation
- arxiv url: http://arxiv.org/abs/2607.10909v1
- Date: Sun, 12 Jul 2026 20:28:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.564019
- Title: Stream-aware Side Adaptation for Large Pre-trained Multimodal Embedding Models in Sequential Recommendation
- Title(参考訳): シークエンシャルレコメンデーションにおける大規模事前学習型マルチモーダル埋め込みモデルのストリームアウェアサイド適応
- Abstract要約: Stresaは、大規模なトレーニング済みのマルチモーダル埋め込みモデルをシーケンシャルなレコメンデーションで凍結するための、ストリーム対応のサイドアダプションフレームワークである。
Stresaは、パブリックデータセットの標準サイドアダプタと最先端のベースラインを一貫して上回る。
- 参考スコア(独自算出の注目度): 19.749298228783374
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recently, large pretrained multimodal embedding models such as Qwen3-VL Embedding have shown strong promise for sequential recommendation, as they provide reusable semantic item representations across modalities and domains. However, directly using these embeddings often leads to suboptimal performance because of domain misalignment. Efficient side adaptation is therefore an attractive solution. Although adapting all backbone layers should help, existing side adapters often degrade with depth, prompting layer dropping despite the loss of useful hidden states. This is due to two major challenges: (1) the lack of modeling in selecting fused representations during residual addition, and (2) the insufficient preservation of earlier representations during progressive sigmoid fusion. This paper therefore asks a practical question: How can we design a side adaptation approach that effectively unlocks the potential of large pre-trained multimodal embedding models? To address this question, we propose Stresa, a stream-aware side-adaptation framework for frozen large pre-trained multimodal embedding models in sequential recommendation. Stresa introduces Stream-aware Hidden-Adapter Fusion (SHAF) to preserve historical side memory during fusion and Residual Stream Adapter (ReSA) to produce selective residual updates across layers. Empirically, Stresa consistently outperforms standard side adapters and state-of-the-art baselines on public datasets across multiple backbone embedding models. These results highlight the promise of adapting large embedding models for sequential recommendation. Our code is publicly available at https://github.com/GAIR-Lab/Stresa.
- Abstract(参考訳): 近年、Qwen3-VL Embeddingのような大規模な事前訓練されたマルチモーダル埋め込みモデルは、モダリティやドメイン間で再利用可能なセマンティックアイテム表現を提供するため、シーケンシャルなレコメンデーションを強く約束している。
しかし、これらの埋め込みを直接使用すると、ドメインのミスアライメントのため、しばしば準最適パフォーマンスにつながる。
したがって、効率的な側適応は魅力的な解である。
すべてのバックボーン層を適応させることは有効であるが、既存のサイドアダプタは深さで劣化することが多く、有用な隠蔽状態が失われてもレイヤーが低下する。
これは,(1)残余加重時における融合表現の選択におけるモデリングの欠如,(2)進行性シグモイド融合時における先行表現の保存が不十分である,という2つの大きな課題に起因する。
そこで本研究では,大規模な事前学習型マルチモーダル埋め込みモデルの可能性を効果的に解き放つ,サイドアダプティブアプローチをどうやって設計できるのか,という実践的な疑問を提起する。
この問題に対処するため,ストリーム対応サイドアダプティブフレームワークであるStresaを提案する。
Stresaは、ストリーム対応のHidden-Adapter Fusion (SHAF)を導入し、フュージョン中の履歴メモリとResidual Stream Adapter (ReSA)を保存し、層間の選択的残留更新を生成する。
実証的には、Stresaは標準のサイドアダプタと最先端のベースラインを、複数のバックボーン埋め込みモデルにまたがるパブリックデータセットで一貫して上回っている。
これらの結果は、シーケンシャルなレコメンデーションのために大規模な埋め込みモデルを適用するという約束を強調している。
私たちのコードはhttps://github.com/GAIR-Lab/Stresa.comで公開されています。
関連論文リスト
- Adapting Frozen Mono-modal Backbones for Multi-modal Registration via Contrast-Agnostic Instance Optimization [6.63504422595921]
我々は,凍結事前訓練されたtextbfmono-modal 画像登録モデルと,textbfmulti-modal 画像登録のための軽量適応パイプラインを統合する登録フレームワークを提案する。
我々は,Learner2Reg 2025 LUMIR検証セットに対するアプローチを評価し,事前訓練したモノモーダルバックボーンに対する一貫した改善を観察する。
論文 参考訳(メタデータ) (2026-03-27T13:21:19Z) - Learning from Next-Frame Prediction: Autoregressive Video Modeling Encodes Effective Representations [53.91818843831925]
NExT-Vidは,新しい自己回帰型視覚生成事前学習フレームワークである。
本研究では,文脈分離型自己回帰予測器を導入し,セマンティック表現をターゲットデコーディングから切り離す。
文脈分離型フローマッチング事前学習により,本手法は強い表現を実現する。
論文 参考訳(メタデータ) (2025-12-24T07:07:08Z) - Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation [60.33386541343322]
本稿では,Hardness-Aware とNoNoRec (HaNoRec) を併用したマルチモーダル大規模言語モデルフレームワークを提案する。
具体的には、HaNoRecは、各トレーニングサンプルの予測硬度とポリシーモデルのリアルタイム応答性の両方に基づいて、最適化重量を動的に調整する。
論文 参考訳(メタデータ) (2025-11-24T04:10:46Z) - MPRU: Modular Projection-Redistribution Unlearning as Output Filter for Classification Pipelines [23.370444162993707]
本稿では,機械アンラーニング(MU)へのインセンティブ的アプローチを提案する。
学習は、最後のトレーニングシーケンスを逆転させることで行うことができる。これは、モデルの最後にプロジェクション-再配布層を追加することで実装される。
実験結果から,計算コストの低減を図った完全再学習モデルと一貫した出力が得られた。
論文 参考訳(メタデータ) (2025-10-30T08:09:37Z) - QARM: Quantitative Alignment Multi-Modal Recommendation at Kuaishou [23.818456863262494]
異なる下流モデルに対して、専門的で訓練可能なマルチモーダル情報をカスタマイズするための定量的なマルチモーダルフレームワークを導入する。
ダウンストリームタスクの利用における2つの難題に着想を得て、異なるダウンストリームモデルに対して、専門的で訓練可能なマルチモーダル情報をカスタマイズする定量的なマルチモーダルフレームワークを導入する。
論文 参考訳(メタデータ) (2024-11-18T17:08:35Z) - SurgeryV2: Bridging the Gap Between Model Merging and Multi-Task Learning with Deep Representation Surgery [54.866490321241905]
モデルマージに基づくマルチタスク学習(MTL)は、複数のエキスパートモデルをマージしてMTLを実行するための有望なアプローチを提供する。
本稿では,統合モデルの表現分布について検討し,「表現バイアス」の重要な問題を明らかにする。
このバイアスは、マージされたMTLモデルの表現と専門家モデルの間の大きな分布ギャップから生じ、マージされたMTLモデルの最適下性能に繋がる。
論文 参考訳(メタデータ) (2024-10-18T11:49:40Z) - Towards Robust and Efficient Cloud-Edge Elastic Model Adaptation via Selective Entropy Distillation [56.79064699832383]
Cloud-Edge Elastic Model Adaptation (CEMA)パラダイムを確立し、エッジモデルが前方伝播のみを実行するようにします。
CEMAでは,通信負担を軽減するため,不要なサンプルをクラウドにアップロードすることを避けるための2つの基準を考案した。
論文 参考訳(メタデータ) (2024-02-27T08:47:19Z) - Diffusion Augmentation for Sequential Recommendation [47.43402785097255]
本稿では,より高品質な生成のためのDiffuASR(Diffusion Augmentation for Sequential Recommendation)を提案する。
DiffuASRによる強化データセットは、複雑なトレーニング手順なしで、シーケンシャルレコメンデーションモデルを直接トレーニングするために使用することができる。
3つの逐次レコメンデーションモデルを用いた3つの実世界のデータセットに関する広範な実験を行った。
論文 参考訳(メタデータ) (2023-09-22T13:31:34Z) - How Well Do Sparse Imagenet Models Transfer? [75.98123173154605]
転送学習は、大規模な"上流"データセットで事前訓練されたモデルが、"下流"データセットで良い結果を得るために適応される古典的なパラダイムである。
本研究では、ImageNetデータセットでトレーニングされた畳み込みニューラルネットワーク(CNN)のコンテキストにおいて、この現象を詳細に調査する。
スパースモデルでは, 高空間であっても, 高密度モデルの転送性能にマッチしたり, 性能に優れることを示す。
論文 参考訳(メタデータ) (2021-11-26T11:58:51Z) - A Generic Network Compression Framework for Sequential Recommender
Systems [71.81962915192022]
シークエンシャルレコメンデーションシステム(SRS)は,ユーザの動的関心を捉え,高品質なレコメンデーションを生成する上で重要な技術となっている。
CpRecと呼ばれる圧縮されたシーケンシャルレコメンデーションフレームワークを提案する。
大規模なアブレーション研究により、提案したCpRecは実世界のSRSデータセットにおいて最大4$sim$8倍の圧縮速度を達成できることを示した。
論文 参考訳(メタデータ) (2020-04-21T08:40:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。