論文の概要: Tlow: Flow-based Item Tokenizer for Recommendation
- arxiv url: http://arxiv.org/abs/2608.24176v1
- Date: Tue, 25 Aug 2026 07:43:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.862137
- Title: Tlow: Flow-based Item Tokenizer for Recommendation
- Title(参考訳): Tlow:リコメンデーションのためのフローベースアイテムトケナイザ
- Authors: Nian Li, Chonggang Song, Jingtao Ding, Lingling Yi, Yong Li, Qingmin Liao,
- Abstract要約: Item tokenizerはトークンIDにセマンティック埋め込みをエンコードして、ランダムに割り当てられたアイテムIDを置き換える。
最も一般的なトークン化ツールであるRQ-VAEは、コードブックに固有の依存関係があるため、復号効率の低下に悩まされている。
本稿では, 生のセマンティック埋め込みを潜在空間に変換するために, ファウンダライン・ロー・アイテム・アンダーライン・Tokenizer (Tlow)を提案する。
- 参考スコア(独自算出の注目度): 44.2281760601041
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Item tokenizer encodes semantic embeddings into token IDs to replace the randomly assigned item IDs used in traditional recommendation models, fundamentally addressing the problems of excessive parameters and cold starts. However, the most common tokenizer, RQ-VAE, suffers from low decoding efficiency due to the inherent dependencies among its codebooks. Meanwhile, efficient independent tokenizers such as optimized product quantization (OPQ) still struggle with dimensional correlations and distribution complexity of semantic embeddings. In this work, we propose a f\underline{low}-based item \underline{T}okenizer (Tlow) to transform raw semantic embeddings into a latent space where embeddings conform to a unified standard normal distribution, achieving dual advantages of dimensional independence and distributional simplicity. Independent tokenization performed on these latent embeddings yields semantically clear token IDs. Additionally, we introduce a novel codebook guidance to align the codebook space with the token embedding space, further aiding the learning of more semantically distinct token embeddings. Offline experiments on four public datasets demonstrate that Tlow's tokenization and codebook guidance significantly improve recommendation performance. The improvement on cross-domain and multi-modal recommendations also proves the effectiveness of item tokenization in a simplified embedding space. Online experiments for a multi-modal retrieval task on China's largest social media platform WeChat validate Tlow's powerful distribution transformation capability. The retrieval model based on token IDs improves user CTR by 10.32\% globally and by 11.64\% for new items. Our codes are available at https://github.com/wjjln/Tlow.
- Abstract(参考訳): アイテムトークンライザはトークンIDにセマンティック埋め込みをエンコードして、従来のレコメンデーションモデルで使用されるランダムに割り当てられたアイテムIDを置き換える。
しかし、最も一般的なトークン化ツールであるRQ-VAEは、コードブックに固有の依存関係があるため、復号効率の低下に悩まされている。
一方、最適化製品量子化(OPQ)のような効率的な独立トークン化器は、意味的埋め込みの次元的相関や分布の複雑さに苦慮している。
本研究では,f\underline{low}-based item \underline{T}okenizer (Tlow) を用いて,埋め込みが統一標準正規分布に適合する潜在空間に生のセマンティック埋め込みを変換し,次元独立性と分布単純性の両立を実現する。
これらの潜伏埋め込みで実行される独立したトークン化は、意味的に明確なトークンIDをもたらす。
さらに、コードブック空間をトークン埋め込み空間と整合させる新しいコードブックガイダンスを導入し、より意味的に異なるトークン埋め込みの学習を支援する。
4つの公開データセットのオフライン実験は、Tlowのトークン化とコードブックガイダンスが推奨性能を大幅に改善していることを示している。
クロスドメインおよびマルチモーダルレコメンデーションの改善は、シンプルな埋め込み空間におけるアイテムトークン化の有効性を証明している。
中国最大のソーシャルメディアプラットフォームWeChatにおけるマルチモーダル検索タスクのオンライン実験は、Tlowの強力な分散変換能力を検証する。
トークンIDに基づく検索モデルは、世界中のユーザCTRを10.32\%、新しいアイテムを11.64\%改善する。
私たちのコードはhttps://github.com/wjjln/Tlow.comで公開されています。
関連論文リスト
- Exploiting Discriminative Codebook Prior for Autoregressive Image Generation [54.14166700058777]
トークンベースの自己回帰画像生成システムは、まずトークンインデックスのシーケンスをコードブックでトークン化し、次にこれらのシーケンスを自己回帰パラダイムでモデル化する。
自己回帰生成モデルはインデックス値のみに基づいて訓練されるが、豊富なトークン類似性情報を含むコードブックにエンコードされた前者は利用されない。
近年の研究では、トークン上に単純なk平均クラスタリングを行い、コードブックを減らした生成モデルのトレーニングを容易にすることで、これを先に組み込もうとしている。
k-meansの代替として、差別的コードブック先駆者(DCPE)を提案する。
論文 参考訳(メタデータ) (2025-08-14T15:00:00Z) - Training-Free Tokenizer Transplantation via Orthogonal Matching Pursuit [45.18582668677648]
大規模言語モデルにおいて,トークン化剤を移植するためのトレーニング不要な手法を提案する。
それぞれの語彙外トークンを,共有トークンの疎線形結合として近似する。
我々は,OMPがベースモデルの性能を最良にゼロショット保存できることを示す。
論文 参考訳(メタデータ) (2025-06-07T00:51:27Z) - Unified Semantic and ID Representation Learning for Deep Recommenders [28.709935854073535]
統一意味・ID表現学習フレームワークを提案する。
我々のフレームワークでは、IDトークンはユニークなアイテム属性をキャプチャし、セマンティックトークンは共有可能な、転送可能な特性を表す。
本フレームワークは,先行層におけるコサイン類似性と最終層におけるユークリッド距離を統合し,表現学習を最適化する。
論文 参考訳(メタデータ) (2025-02-23T07:17:28Z) - Order-agnostic Identifier for Large Language Model-based Generative Recommendation [94.37662915542603]
アイテムは、ユーザ履歴をエンコードし、次のアイテムを生成するために、LLM(Large Language Models)の識別子に割り当てられる。
既存のアプローチでは、トークンシーケンス識別子を使用して、アイテムを個別のトークンシーケンスとして表現するか、IDまたはセマンティック埋め込みを使用して単一トークン識別子を使用する。
本稿では,セマンティック・トークンライザを利用するSETRecを提案する。
論文 参考訳(メタデータ) (2025-02-15T15:25:38Z) - Enhancing Item Tokenization for Generative Recommendation through Self-Improvement [67.94240423434944]
生成レコメンデーションシステムは大規模言語モデル(LLM)によって駆動される
現在のアイテムトークン化手法には、テキスト記述、数値文字列、離散トークンのシーケンスの使用が含まれる。
自己改善アイテムトークン化手法を提案し,LLMがトレーニングプロセス中に独自のアイテムトークン化を洗練できるようにする。
論文 参考訳(メタデータ) (2024-12-22T21:56:15Z) - Learning Multi-Aspect Item Palette: A Semantic Tokenization Framework for Generative Recommendation [55.99632509895994]
マルチアスペクトセマンティックトークン化のための新しいアプローチであるLAMIAを紹介する。
単一の埋め込みを使用するRQ-VAEとは異なり、LAMIAは独立的でセマンティックな並列な埋め込みの集合である「アイテムパレット」を学習する。
その結果,提案手法よりも提案手法の精度が大幅に向上した。
論文 参考訳(メタデータ) (2024-09-11T13:49:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。