論文の概要: Agents as Knowledge Integrator and Utilizer in Multimodal Recommendation
- arxiv url: http://arxiv.org/abs/2608.29410v1
- Date: Sat, 29 Aug 2026 19:25:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.953947
- Title: Agents as Knowledge Integrator and Utilizer in Multimodal Recommendation
- Title(参考訳): 知識インテグレータとしてのエージェントとマルチモーダルレコメンデーション
- Authors: Jinfeng Xu, Zheyu Chen, Shuo Yang, Jinze Li, Puzhen Wu, Zewei Liu, Zheng Lin, Jianheng Tang, Jing Yang, Wei Wang, Xiping Hu, Edith Ngai,
- Abstract要約: マルチモーダルコンテンツは、レコメンデーショングラフの構築やランキングの調整に使用される前に、ユーザの振る舞いと共に解釈されるべきです。
本稿ではエージェントベースのマルチモーダルレコメンデーションフレームワークであるAgentMMRecを提案する。
Amazonの3つのマルチモーダルレコメンデーションデータセットの実験は、AgentMMRecが最近のマルチモーダルベースラインよりも一貫してリコールとNDCGを改善していることを示している。
- 参考スコア(独自算出の注目度): 32.21401177935487
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Online platforms increasingly rely on multimodal recommender systems to rank products, media, and other Web content. Existing methods usually inject visual and textual features into item representations or build homogeneous graphs from modality-level similarity, but the resulting signals can remain misaligned with the recommendation objective. We study this semantic gap from a knowledge-integration perspective: multimodal content should be interpreted together with user behavior before it is used to construct recommendation graphs or adjust rankings. We propose AgentMMRec, an agent-based multimodal recommendation framework with two coordinated roles. The Integrator Agent infers behavior- and multimodal-aware user preferences and item properties from training interactions and item content, then stores them in a reusable knowledge memory. The Utilizer Agent consumes this memory to refine modality-specific item-item graphs, construct behavior-aware homogeneous graphs, and rerank candidate lists under a frozen evaluation-time memory. This design differs from direct LLM feature augmentation and pure LLM reranking because the generated knowledge is first converted into graph structure and model representations before recommendation. Experiments on three Amazon multimodal recommendation datasets show that AgentMMRec consistently improves Recall and NDCG over recent multimodal baselines, remains effective under sparsity and item cold-start settings, and can transfer its constructed knowledge to existing backbones.
- Abstract(参考訳): オンラインプラットフォームは、製品、メディア、その他のWebコンテンツをランク付けするマルチモーダルレコメンデーションシステムにますます依存している。
既存の方法は、通常、アイテム表現に視覚的特徴とテキスト的特徴を注入するか、モダリティレベルの類似性から同質なグラフを構築するが、結果として得られる信号は推奨目的と一致しない。
このセマンティックギャップを知識統合の観点から検討する: マルチモーダルコンテンツは、レコメンデーショングラフの構築やランキングの調整に使用される前に、ユーザの行動とともに解釈されるべきである。
本稿ではエージェントベースのマルチモーダルレコメンデーションフレームワークであるAgentMMRecを提案する。
インテグレータエージェントは、トレーニングインタラクションとアイテムコンテンツから振る舞いとマルチモーダル対応のユーザ好みとアイテムプロパティを推測し、再利用可能なナレッジメモリに格納する。
Utilizer Agentは、このメモリを消費して、モダリティ固有のアイテムイテムグラフを洗練し、振舞いを意識した同質なグラフを構築し、凍結した評価時間メモリの下で候補リストをリランクする。
この設計は、生成した知識がまずグラフ構造やモデル表現に変換されるため、直接LLM機能拡張や純粋なLLM再ランクと異なる。
Amazonの3つのマルチモーダルレコメンデーションデータセットの実験によると、AgentMMRecは、最近のマルチモーダルベースラインよりも一貫してリコールとNDCGを改善し、スパーシとアイテムコールスタート設定の下で有効であり、構築された知識を既存のバックボーンに転送可能である。
関連論文リスト
- Seeing and Reflecting: Multimodal Memory-Enhanced Agent Collaboration for Recommendation [27.43053910738573]
MMEACRはマルチモーダルメモリ強化エージェントコラボレーションフレームワークである。
微粒なマルチモーダルマッチングから解釈可能なエージェントを分離する。
MMEACRは、競争力のあるLLMベースおよびエージェントベースベースラインに対して、高い全体的なパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-07-08T07:50:03Z) - Multimodal Generative Recommendation for Fusing Semantic and Collaborative Signals [17.608491612845306]
逐次リコメンデータシステムは、ユーザのインタラクション履歴をモデル化し、結果のユーザ表現とストアドアイテムの埋め込みの間の内部積を計算することで、関連する項目をランク付けする。
大きなアイテムを格納する際のメモリオーバーヘッドを大幅に回避するため、生成推奨パラダイムは、各アイテムを独立したセマンティックコードとしてモデル化する。
これらのメソッドは、大きなアイテムセットの伝統的なシーケンシャルなレコメンデータを超えておらず、それらが対処するように設計されたシナリオでの採用を制限する。
マルチモーダル・セマンティック・コラボレーション・ジェネレーティブ・レコメンダであるMSCGRecを提案する。
論文 参考訳(メタデータ) (2026-02-03T16:39:35Z) - MLLMRec: Exploring the Potential of Multimodal Large Language Models in Recommender Systems [8.744074431975019]
本稿では,MLLM方式のマルチモーダル・レコメンデーション・フレームワークを提案する。
MLLMRecは、最高のベースラインよりも平均38.53%改善して最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-08-21T06:50:00Z) - Learning Item Representations Directly from Multimodal Features for Effective Recommendation [51.49251689107541]
マルチモーダルレコメンデータシステムは、主にベイズパーソナライズされたランク付け(BPR)最適化を利用してアイテム表現を学習する。
本稿では,マルチモーダルな特徴からアイテム表現を直接学習し,推薦性能を向上する新しいモデル(LIRDRec)を提案する。
論文 参考訳(メタデータ) (2025-05-08T05:42:22Z) - MMGRec: Multimodal Generative Recommendation with Transformer Model [81.61896141495144]
MMGRecは、マルチモーダルレコメンデーションに生成パラダイムを導入することを目指している。
まず,階層的な量子化手法であるGraph CF-RQVAEを考案し,各項目にRec-IDを割り当てる。
次に、Transformerベースのレコメンデータをトレーニングし、過去のインタラクションシーケンスに基づいて、ユーザが推奨するアイテムのRec-IDを生成する。
論文 参考訳(メタデータ) (2024-04-25T12:11:27Z) - On Generative Agents in Recommendation [58.42840923200071]
Agent4Recは、Large Language Modelsに基づいたレコメンデーションのユーザーシミュレータである。
各エージェントは、ページ単位でパーソナライズされた推奨モデルと対話する。
論文 参考訳(メタデータ) (2023-10-16T06:41:16Z) - MM-GEF: Multi-modal representation meet collaborative filtering [43.88159639990081]
本稿では,グラフアーリーフュージョンを用いたマルチモーダルレコメンデーション MM-GEF を提案する。
MM-GEFはマルチモーダル信号と協調信号の両方から得られる構造情報を注入することにより、洗練された項目表現を学習する。
論文 参考訳(メタデータ) (2023-08-14T15:47:36Z) - Mining Latent Structures for Multimedia Recommendation [46.70109406399858]
本稿では,マルチモーダル再圧縮のためのLATent sTructureマイニング手法を提案する。
各モダリティの項目構造を学び、複数のモダリティを集約して潜在アイテムグラフを得る。
学習した潜在グラフに基づいてグラフ畳み込みを行い、アイテム表現に高次項目親和性を明示的に注入する。
論文 参考訳(メタデータ) (2021-04-19T03:50:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。