論文の概要: Tokens are All You Need: Dual-purpose Semantic IDs for Achieving LLM-Level I/O Efficiency in recommendation systems
- arxiv url: http://arxiv.org/abs/2607.24865v1
- Date: Sun, 26 Jul 2026 18:04:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.560747
- Title: Tokens are All You Need: Dual-purpose Semantic IDs for Achieving LLM-Level I/O Efficiency in recommendation systems
- Title(参考訳): 必要なものすべて:レコメンデーションシステムにおけるLLM-Level I/O効率向上のための汎用セマンティックID
- Authors: Baolei Li, Yiping Yuan, Yilin Zheng, Likang Yin, Ling Liu, Fabio Soldo, Romer Rosales, Xinyang Yi, Lichan Hong,
- Abstract要約: 大規模レコメンデーションシステムは、巨大で密度の高い埋め込みテーブルのため、"メモリウォール"のボトルネックに直面します。
コンピュータビジョンデータ圧縮に着想を得て,LLMレベルのI/O効率を実現するためにDual-purpose Semantic IDを提案する。
- 参考スコア(独自算出の注目度): 11.795172547249
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large-scale recommendation systems face "Memory Wall" bottlenecks due to massive, dense embedding tables. While generative retrieval uses discrete tokens for IDs, high-dimensional context still relies on inefficient dense formats. Inspired by computer vision data compression, we propose Dual-purpose Semantic IDs to achieve LLM-level I/O efficiency. Our methodology uses hierarchical quantization to condense continuous embeddings into discrete Semantic IDs performing two concurrent roles: (1) Collaborative Identity: modeling user-item interactions via learnable embedding table; and (2) Content Reconstruction: using a lightweight Semantic Decoder for on-the-fly embedding approximation. This approach replaces massive vector storage with on-demand reconstruction, reducing system overhead and data footprints. We demonstrate the efficacy of our framework through offline evaluations and successful online deployment in production-scale ranking and retrieval systems at a major video sharing platform, showing that discrete tokens are indeed all you need for highly efficient, content-rich recommendation.
- Abstract(参考訳): 大規模レコメンデーションシステムは、巨大で密度の高い埋め込みテーブルのため、"メモリウォール"のボトルネックに直面します。
生成的検索はIDに離散トークンを使用するが、高次元コンテキストは依然として非効率な高密度フォーマットに依存している。
コンピュータビジョンデータ圧縮に着想を得て,LLMレベルのI/O効率を実現するためにDual-purpose Semantic IDを提案する。
本手法では,連続的な埋め込みを個別のセマンティックIDに凝縮するために階層的量子化を用いて,(1)協調的アイデンティティ:学習可能な埋め込みテーブルによるユーザ-イテム相互作用のモデル化,(2)コンテンツ再構成:オンザフライ埋め込み近似に軽量セマンティックデコーダを用いる。
このアプローチは大規模なベクトルストレージをオンデマンドの再構築に置き換え、システムのオーバーヘッドとデータフットプリントを削減する。
我々は,大規模なビデオ共有プラットフォームにおいて,オフライン評価とオンライン展開を成功させることで,本フレームワークの有効性を実証し,高度に効率的なコンテンツリッチなレコメンデーションのために,離散トークンが本当に必要であることを示す。
関連論文リスト
- TokenMinds: Pretrained User Tokens and Embeddings for User Understanding in Large Recommender Systems [22.086361560657593]
TokenMindsはPLUMフレームワークをアイテム検索からユーザモデリングまで拡張する産業規模のシステムである。
個別のSIDベースのユーザトークンと、事前訓練されたLLMから適応したエンコーダデコーダアーキテクチャにより、密なユーザ埋め込みの両方を生成する。
論文 参考訳(メタデータ) (2026-06-23T20:20:37Z) - MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval [111.99106496142474]
Visual Document Retrieval (VDR)は、微細な視覚的詳細とグローバルな文書構造の両方をキャプチャする表現を必要とする。
既存のVDRモデルは、高解像度文書を処理する際に効率と効率のバランスをとるのに苦労する。
本稿では,X-VisEmbパラダイムを提案する。X-VisEmbパラダイムは,多分解能サンプリングと符号化から,粒度横断的特徴融合から適応的表現蒸留へと進展する。
論文 参考訳(メタデータ) (2026-03-07T15:17:22Z) - DOS: Dual-Flow Orthogonal Semantic IDs for Recommendation in Meituan [8.259886050799922]
生成レコメンデーションシステムのためのDual-Flow Orthogonal Semantic ID (DOS)法を提案する。
DOSは、セマンティックIDのコードブック空間を生成空間と整合させるために協調的な信号を利用する、ユーザイムの二重フローフレームを使用している。
DOSはMeituanのモバイルアプリケーションにうまくデプロイされ、数億のユーザにサービスを提供している。
論文 参考訳(メタデータ) (2026-02-04T11:43:42Z) - SimpleMem: Efficient Lifelong Memory for LLM Agents [73.74399447715052]
セマンティックロスレス圧縮に基づく効率的なメモリフレームワークSimpleMemを紹介する。
本稿では,情報密度とトークン利用量の最大化を目的とした3段階パイプラインを提案する。
ベンチマークデータセットを用いた実験により,提案手法は精度,検索効率,推論コストにおいて,ベースラインアプローチを一貫して上回っていることがわかった。
論文 参考訳(メタデータ) (2026-01-05T21:02:49Z) - A Simple and Effective Framework for Symmetric Consistent Indexing in Large-Scale Dense Retrieval [11.72564658353791]
大規模情報検索システムでは,高効率・競争精度のため,高密度検索が業界標準となっている。
広く採用されているデュアルトウワー符号化アーキテクチャは、主に表現空間のミスアライメントと検索インデックスの不整合という、固有の課題を導入している。
本稿では2つの相乗的モジュールからなるシンプルで効果的なSCIフレームワークを提案する。
提案手法の有効性は,公開データセットと実世界のeコマースデータセットにまたがる結果によって検証され,理論的に保証される。
論文 参考訳(メタデータ) (2025-12-15T08:11:24Z) - The Best of the Two Worlds: Harmonizing Semantic and Hash IDs for Sequential Recommendation [51.62815306481903]
我々は,SIDとHIDを調和させる新しいフレームワークであるtextbfnameを提案する。具体的には,HIDのユニークなコラボレーティブアイデンティティを保ちながら,SID内のマルチグラニュラーセマンティクスの両方をキャプチャ可能な,デュアルブランチモデリングアーキテクチャを考案する。
実世界の3つのデータセットの実験では、名前は、既存のベースラインを越えながら、頭と尾の両方の推奨品質のバランスをとる。
論文 参考訳(メタデータ) (2025-12-11T07:50:53Z) - CAM: A Constructivist View of Agentic Memory for LLM-Based Reading Comprehension [55.29309306566238]
現在のLarge Language Models (LLM) は、長文文書を解釈する際に圧倒的な情報量に直面している。
この課題は、バニラLSMを自律的な読み出しエージェントに高めることができる凝集性メモリモジュールの必須性を高める。
我々はジャン・ピアジェの構成主義理論(Constructivist Theory)からインスピレーションを得て、エージェントメモリの3つの特性(構造化スキーマ、フレキシブルな同化、動的調節)を表現した。
論文 参考訳(メタデータ) (2025-10-07T02:16:30Z) - Order-agnostic Identifier for Large Language Model-based Generative Recommendation [94.37662915542603]
アイテムは、ユーザ履歴をエンコードし、次のアイテムを生成するために、LLM(Large Language Models)の識別子に割り当てられる。
既存のアプローチでは、トークンシーケンス識別子を使用して、アイテムを個別のトークンシーケンスとして表現するか、IDまたはセマンティック埋め込みを使用して単一トークン識別子を使用する。
本稿では,セマンティック・トークンライザを利用するSETRecを提案する。
論文 参考訳(メタデータ) (2025-02-15T15:25:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。