論文の概要: CARD: Non-Uniform Quantization of Visual Semantic Unit for Generative Recommendation
- arxiv url: http://arxiv.org/abs/2604.26427v1
- Date: Wed, 29 Apr 2026 08:38:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-30 15:59:36.317053
- Title: CARD: Non-Uniform Quantization of Visual Semantic Unit for Generative Recommendation
- Title(参考訳): CARD:生成レコメンデーションのためのビジュアルセマンティックユニットの非均一量子化
- Authors: Yibiao Wei, Jie Zou, Pengfei Zhang, Xiao Ao, Weikang Guo, Zeyu Ma, Yang Yang,
- Abstract要約: 我々はCARDと呼ばれる新しい生成レコメンデーションフレームワークを提案する。
CARDは、テキスト、視覚、協調的な信号をエンコーディングの前に構造化された視覚表現に統一する視覚意味ユニットを導入している。
我々は、学習可能で可逆な非一様変換を量子化プロセスに組み込んだ非一様量子化フレームワークを開発し、歪んだ意味分布をよりバランスの取れた潜在空間にマッピングする。
- 参考スコア(独自算出の注目度): 16.01204624133875
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Generative recommendation frameworks typically represent items as discrete Semantic IDs (SIDs). While existing studies have sought to enhance SID construction by incorporating multimodal content, collaborative signals, or more advanced quantization techniques, learning high-quality SIDs still faces two key challenges: (1) The two-stage generative recommendation paradigm (SID construction and autoregressive generation) provides insufficient supervision for heterogeneous fusion, which hinders learning high-quality SIDs, and (2) non-uniform embeddings lead to codeword imbalance and generation bias. To address these challenges, we propose a novel generative recommendation framework, called CARD. CARD introduces a visual semantic unit that unifies textual, visual, and collaborative signals into a structured visual representation prior to encoding, enabling holistic semantic modeling and effectively alleviating the semantic gap, thereby reducing the reliance on supervision signals during SID learning. Furthermore, to deal with the highly non-uniform distribution of item semantic embeddings in recommendation scenarios, we develop a non-uniform quantization framework (NU-RQ-VAE), which incorporates a learnable and invertible non-uniform transformation into the quantization process to map skewed semantic distributions into a more balanced latent space, thereby significantly improving codebook utilization and quantization accuracy. Experiments on multiple datasets show that CARD consistently outperforms baseline methods under various settings; meanwhile, the proposed non-uniform transformation module is plug-and-play and remains robust across different quantization schemes. Code is available at https://github.com/HAI-UESTC/CARD.
- Abstract(参考訳): ジェネレーティブレコメンデーションフレームワークは通常、アイテムを離散セマンティックID(SID)として表現する。
既存の研究は、多モードコンテンツ、協調信号、より高度な量子化技術を導入してSID構築を強化することを目的としているが、高品質なSIDの学習は、(1)2段階生成推奨パラダイム(SID構築と自己回帰生成)が、高品質なSIDの学習を妨げるヘテロジニアス融合の不十分な監視を提供し、(2)コードワードの不均衡と生成バイアスをもたらす。
これらの課題に対処するため、我々はCARDと呼ばれる新しい生成的推薦フレームワークを提案する。
CARDは、テキスト、ビジュアル、コラボレーティブな信号をエンコーディングの前に構造化された視覚表現に統合し、全体論的セマンティックモデリングを可能にし、セマンティックギャップを効果的に緩和し、SID学習中の監視信号への依存を減らす視覚的セマンティックユニットを導入している。
さらに,レコメンデーションシナリオにおける項目意味埋め込みの非一様分布に対処するため,学習可能な非一様変換を量子化プロセスに組み込んだ非一様量子化フレームワーク(NU-RQ-VAE)を開発した。
複数のデータセットの実験では、CARDはさまざまな設定下でベースラインメソッドを一貫して上回り、一方、提案された非一様変換モジュールはプラグアンドプレイであり、異なる量子化スキームで堅牢である。
コードはhttps://github.com/HAI-UESTC/CARDで入手できる。
関連論文リスト
- Rethinking Generative Recommender Tokenizer: Recsys-Native Encoding and Semantic Quantization Beyond LLMs [17.944727019161878]
ReSIDは、情報保存とシーケンシャルな予測可能性の観点から学ぶことを推奨する、原則化されたSIDフレームワークである。
高いシーケンシャルおよびSIDベースの生成ベースラインを平均10%以上上回り、トークン化コストを最大122倍削減する。
論文 参考訳(メタデータ) (2026-02-02T17:00:04Z) - PRISM: Purified Representation and Integrated Semantic Modeling for Generative Sequential Recommendation [28.629759086187352]
本稿では,PRISMとPureified RepresentationとIntegrated Semantic Modelingを組み合わせた新しい生成レコメンデーションフレームワークを提案する。
PRISMは4つの実世界のデータセットで、最先端のベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-01-23T08:50:16Z) - VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction [83.50898344094153]
VQRAEは、イメージ理解のための連続的セマンティック機能と、統一トークン化器内での視覚生成のためのトークンを生成する。
デザインは、多モーダル理解、離散トークンの能力を維持するために、無視可能な意味情報を可能にする。
VQRAEは、視覚的理解、生成、再構築のベンチマークで競合性能を示す。
論文 参考訳(メタデータ) (2025-11-28T17:26:34Z) - Multi-Aspect Cross-modal Quantization for Generative Recommendation [27.92632297542123]
生成レコメンデーション(MACRec)のための多視点クロスモーダル量子化を提案する。
まず、ID学習過程において、競合率を効果的に低減するクロスモーダル量子化を導入する。
また、暗黙のアライメントや明示的なアライメントを含むマルチアスペクトのクロスモーダルアライメントも組み込んでいます。
論文 参考訳(メタデータ) (2025-11-19T04:55:14Z) - Learning Multi-Aspect Item Palette: A Semantic Tokenization Framework for Generative Recommendation [55.99632509895994]
マルチアスペクトセマンティックトークン化のための新しいアプローチであるLAMIAを紹介する。
単一の埋め込みを使用するRQ-VAEとは異なり、LAMIAは独立的でセマンティックな並列な埋め込みの集合である「アイテムパレット」を学習する。
その結果,提案手法よりも提案手法の精度が大幅に向上した。
論文 参考訳(メタデータ) (2024-09-11T13:49:48Z) - Learnable Item Tokenization for Generative Recommendation [113.80559032128065]
LETTER (Larnable Tokenizer for generaTivE Recommendation) を提案する。
LETTERは、セマンティック正規化のためのResidual Quantized VAE、協調正規化のためのコントラストアライメント損失、コードの割り当てバイアスを軽減するための多様性損失を組み込んでいる。
論文 参考訳(メタデータ) (2024-05-12T15:49:38Z) - Enhancing Multimodal Unified Representations for Cross Modal Generalization [52.16653133604068]
我々は、コードブック(TOC)のトレーニング不要最適化と、FCID(Fin and Coarse Cross-modal Information Disentangling)を提案する。
これらの方法は、各モードの特定の特性に合わせて、事前学習から統一された離散表現を洗練し、きめ細かな情報と粗い情報の絡み合わせを行う。
論文 参考訳(メタデータ) (2024-03-08T09:16:47Z) - Adaptive Discrete Communication Bottlenecks with Dynamic Vector
Quantization [76.68866368409216]
入力に条件付けされた離散化の厳密度を動的に選択する学習を提案する。
コミュニケーションボトルネックの動的に変化する厳密さは、視覚的推論や強化学習タスクにおけるモデル性能を向上させることができることを示す。
論文 参考訳(メタデータ) (2022-02-02T23:54:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。