論文の概要: Tokenizing Numerical and Embedding Features for LLM RecSys
- arxiv url: http://arxiv.org/abs/2607.10016v1
- Date: Fri, 10 Jul 2026 22:36:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.276098
- Title: Tokenizing Numerical and Embedding Features for LLM RecSys
- Title(参考訳): LLMRecSysにおける数値的および埋め込み的特徴の抽出
- Authors: Zhe Xu, Ankit Peshin, Chiyu Zhang, Feng Qi, Johnson Lui, Anil Ramakrishna, Justin Johnson, Carl Hu, Kaushik Rangadurai, Luke Simon,
- Abstract要約: 大規模言語モデル(LLM)は、レコメンデーションシステムのためのバックボーンアーキテクチャとしてますます使われている。
数値的および埋め込み的特徴をLLM埋め込み空間にマッピングするソフト・トーケン・フュージョン・フレームワークを提案する。
相互作用に基づく融合は異種ソフトトークンの直接結合よりも効果的であることを示す。
- 参考スコア(独自算出の注目度): 17.301482289239285
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly used as backbone architectures for recommender systems because of their strong sequence modeling and representation learning capabilities. However, most LLM-based recommenders operate primarily on discrete textual tokens, whereas practical recommendation pipelines also rely on continuous numerical features and dense embedding features produced by upstream feature engineering or pretrained encoders. This mismatch limits the ability of LLM-based models to exploit fine-grained non-textual signals. We propose a soft-token fusion framework that maps numerical and embedding features into the LLM embedding space, allowing heterogeneous recommendation signals to be consumed through the standard token interface. We instantiate the framework in a shared-parameter LLM-based two-tower retrieval model and introduce an interaction-based fusion module that refines embedding and numerical soft tokens before they are inserted into the final LLM input. Experiments on three Amazon recommendation benchmarks show that soft-token fusion improves retrieval performance over LLM-based baselines, and that interaction-based fusion is more effective than direct concatenation of heterogeneous soft tokens.
- Abstract(参考訳): 大規模言語モデル(LLM)は、強力なシーケンスモデリングと表現学習能力のため、レコメンデータシステムのためのバックボーンアーキテクチャとしてますます使われている。
しかし、ほとんどのLLMベースのレコメンデータは、主に個別のテキストトークンで動作しているが、実用的なレコメンデーションパイプラインは、上流の特徴工学や事前訓練されたエンコーダによって生成される連続的な数値的特徴や密着した埋め込み機能にも依存している。
このミスマッチは、細粒度の非テキスト信号を利用するLLMベースのモデルの能力を制限している。
数値および埋め込み機能をLLM埋め込み空間にマッピングし、標準トークンインタフェースを介して不均一なレコメンデーション信号の消費を可能にするソフト・トーケン・フュージョン・フレームワークを提案する。
共有パラメータLLMに基づく2tower検索モデルでフレームワークをインスタンス化し、最終LLM入力に挿入する前に埋め込みおよび数値ソフトトークンを洗練する相互作用ベースの融合モジュールを導入する。
3つのAmazonレコメンデーションベンチマークの実験では、ソフトトークンの融合はLLMベースのベースラインよりも検索性能が向上し、インタラクションベースの融合は異種ソフトトークンの直接結合よりも効果的であることが示されている。
関連論文リスト
- Multi-LLM Token Filtering and Routing for Sequential Recommendation [9.595389306819651]
大規模言語モデル(LLM)は、リッチなセマンティック知識を提供することによって、最近、推奨されている。
コーパスレスシーケンシャルレコメンデーションのためのマルチLLMトークンフィルタリング・ルーティングフレームワークであるMLTFRを提案する。
MLTFRは、最先端のレコメンデーションベースラインや既存のアライメント手法よりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-04-20T12:50:21Z) - FACE: A General Framework for Mapping Collaborative Filtering Embeddings into LLM Tokens [28.971310672971914]
大規模言語モデル(LLM)は、協調フィルタリング(CF)ベースのレコメンデーションシステムと統合するために研究されている。
重要な課題は、LCMがCFアプローチが生み出す非セマンティックな埋め込みを解釈するのに苦労していることである。
FACEはCF埋め込みを事前訓練されたLLMトークンにマッピングする一般的な解釈可能なフレームワークである。
論文 参考訳(メタデータ) (2025-10-17T15:19:54Z) - When Transformers Meet Recommenders: Integrating Self-Attentive Sequential Recommendation with Fine-Tuned LLMs [0.0]
SASRecLLMは、Low-Rank Adaptation (LoRA)を使用して微調整されたLLMで、SASRecをコラボレーティブエンコーダとして統合する新しいフレームワークである。
複数のデータセットの実験によると、SASRecLLMは、コールドスタートとウォームスタートの両方のシナリオにおいて、強いベースラインよりも堅牢で一貫性のある改善を実現している。
論文 参考訳(メタデータ) (2025-07-08T07:26:55Z) - LLM2Rec: Large Language Models Are Powerful Embedding Models for Sequential Recommendation [49.78419076215196]
シーケンスレコメンデーションは、類似したユーザやアイテムの履歴行動から協調フィルタリング(CF)信号をモデル化することで、ユーザの将来のインタラクションを予測することを目的としている。
従来のシーケンシャルなレコメンダは、高次の共起パターンを通じてCF信号をキャプチャするIDベースの埋め込みに依存している。
大規模言語モデル(LLM)の最近の進歩は、テキスト記述からアイテム表現を導出するテキストベースのレコメンデーションアプローチを動機付けている。
理想的な埋め込みモデルは、ドメイン内およびドメイン外のレコメンデーションパフォーマンスを改善するために、CF信号とリッチなセマンティック表現をシームレスに統合すべきである、と我々は主張する。
論文 参考訳(メタデータ) (2025-06-16T13:27:06Z) - Large Language Models are Good Relational Learners [55.40941576497973]
本稿では,グラフニューラルネットワーク(GNN)に基づくエンコーダを用いて,大規模言語モデル(LLM)のための構造化リレーショナルプロンプトを生成する新しいアーキテクチャであるRel-LLMを紹介する。
従来のテキストベースのシリアライズ手法とは異なり,本手法はデータベース固有の関係構造を保ちながら,LLMが複雑なエンティティ関係を処理・推論することを可能にする。
論文 参考訳(メタデータ) (2025-06-06T04:07:55Z) - LLM-Lasso: A Robust Framework for Domain-Informed Feature Selection and Regularization [59.75242204923353]
LLM-Lassoは大規模言語モデル(LLM)を利用してラッソ回帰における特徴選択を導くフレームワークである。
LLMは各特徴に対してペナルティ因子を生成し、単純でチューニング可能なモデルを用いてラスソペナルティの重みに変換される。
LLMによりより関連づけられた特徴は、より低い罰を受け、最終モデルに保持される可能性を高める。
論文 参考訳(メタデータ) (2025-02-15T02:55:22Z) - Beyond Inter-Item Relations: Dynamic Adaption for Enhancing LLM-Based Sequential Recommendation [83.87767101732351]
逐次リコメンデータシステム(SRS)は,ユーザの過去のインタラクションシーケンスに基づいて,ユーザが好む次の項目を予測する。
様々なAIアプリケーションにおける大規模言語モデル(LLM)の台頭に触発されて、LLMベースのSRSの研究が急増している。
我々は,大きめの粒度適応の上に構築された逐次レコメンデーションモデルであるDARecを提案する。
論文 参考訳(メタデータ) (2024-08-14T10:03:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。