論文の概要: SA-RSQ: A Versatile Sparse Representation Framework for Multi-modal Recommender Systems
- arxiv url: http://arxiv.org/abs/2608.22979v2
- Date: Tue, 25 Aug 2026 03:07:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.18345
- Title: SA-RSQ: A Versatile Sparse Representation Framework for Multi-modal Recommender Systems
- Title(参考訳): SA-RSQ:マルチモーダルレコメンダシステムのためのマルチモーダルスパース表現フレームワーク
- Abstract要約: ハード量子化はコンパクトだが境界歪みをもたらすが、高密度なソフト量子化は限られたストレージ予算に表現品質を結合する。
本研究では,Sparse-based Residual Soft Quantization (SA-RSQ)を提案する。
プロプライエタリなフードデリバリー広告データセットの実験では、アイテムあたり8~48バイトのストレージ予算間での、良好な再構築パフォーマンスとCTRトレードオフが示されている。
- 参考スコア(独自算出の注目度): 10.538492036847094
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deploying high-dimensional multimodal features in industrial recommender systems incurs substantial storage and latency overhead. Hard quantization is compact but introduces boundary distortion, whereas dense soft quantization couples representation quality to the limited storage budget. We propose Sparse Activation-based Residual Soft Quantization (SA-RSQ), which uses Top-K sparse routing and softmax weights to store compact (Index, Probability) tuples. The stored tuples decouple per-item storage from codebook dimensionality; for a fixed selected support, gradients propagate through the routing weights and weighted reconstruction without relying on a straight-through estimator. Experiments on a proprietary food-delivery advertising dataset show favorable reconstruction-performance and CTR trade-offs across storage budgets of 8-48 bytes per item. A preliminary Next-Distribution Prediction study and a one-week online A/B test further demonstrate the practical potential of SA-RSQ, with relative lifts of +2.51% in CTR and +3.66% in CPM.
- Abstract(参考訳): 産業レコメンデーションシステムに高次元のマルチモーダル機能を展開すると、かなりのストレージと遅延のオーバーヘッドが発生する。
ハード量子化はコンパクトだが境界歪みをもたらすが、高密度なソフト量子化は限られたストレージ予算に表現品質を結合する。
本研究では,Sparse Activation-based Residual Soft Quantization (SA-RSQ)を提案する。
記憶されたタプルは、コードブックの次元から切り離され、固定された支持のために、勾配は、直線スルー推定器に頼ることなく、ルーティング重みと重み付き再構成を介して伝播する。
プロプライエタリなフードデリバリー広告データセットの実験では、アイテムあたり8~48バイトのストレージ予算間での、良好な再構築パフォーマンスとCTRトレードオフが示されている。
予備的なNext-Distriion Prediction研究と1週間のオンラインA/Bテストにより、SA-RSQの実用可能性はさらに示され、相対リフトはCTRで2.51%、CPMで3.66%である。
関連論文リスト
- Hardware Robustness of Sample-Based Quantum Diagonalization [17.52301775749581]
量子対角化(Quantum Diagonalization, SQD)は、変分最適化をQPUサンプル上の自己整合回復ループに置き換えるハイブリッド量子古典法である。
これらの領域にわたるIBM Heronハードウェア上でのSQDロバスト性を解析する。
論文 参考訳(メタデータ) (2026-07-20T17:36:08Z) - BitNet Text Embeddings [104.29781473344813]
BITEMBEDは,符号化効率とベクトル記憶を両立させるLLMベースのテキスト埋め込みのための極低ビットフレームワークである。
BITEMBEDは、トレーニング済みのLLMバックボーンを3次重み、量子化アクティベーション、軽量な正規化改善を備えたBitNetスタイルの埋め込みエンコーダに変換する。
Qwen3-0.6B と Gemma703-2M を用いた MMTEB (eng) の実験では、BITEMBED は完全精度の教師埋め込み器とほぼ同等であることが示された。
論文 参考訳(メタデータ) (2026-06-24T10:37:01Z) - ConCise: Training-Free Conclusion-Chain State Compression for Cost-Efficient Multi-Step RAG Services [11.399162464271692]
多段階検索強化世代 (RAG) は, 複雑な質問応答のための LLM 対応 Web サービスとして広く利用されている。
RAGは、履歴文書と推論トレースをラウンド全体で蓄積し、累積的な入力トークンを膨らませる。
本稿では,クロスラウンド・コンテキスト・トランスミッションを再構成するトレーニング不要な状態層プロトコルであるConCiseを提案する。
論文 参考訳(メタデータ) (2026-06-13T08:10:53Z) - UniQL: Unified Quantization and Low-rank Compression for Adaptive Edge LLMs [22.43695132973238]
学習後量子化と低ランク圧縮を一体化したUniQLを導入し,エッジLLMのデバイス上でのプルーニングレートについて述べる。
UniQLは、Transformers、State Space Models(SSM)、ハイブリッドモデルの量子化と低ランク圧縮を統合する一般的なフレームワークである。
当社のフレームワークは,シングルパスワークフローにおいて,クラウド上でウェイトソート,微調整,量子化を行うと同時に,デバイス上でのプルーニングレートを最大35%まで向上させる。
論文 参考訳(メタデータ) (2025-12-03T02:33:39Z) - Quantized Visual Geometry Grounded Transformer [67.15451442018258]
本稿では,VGGTの最初の量子化フレームワーク,すなわちQuantVGGTを提案する。
球状前アダマール回転と局所流路平滑化を統合したDual-Smoothed Fine-Grained Quantizationを導入する。
また、重層統計量を用いて外周をフィルタするノイズフィルタディバースサンプリングを設計する。
論文 参考訳(メタデータ) (2025-09-25T15:17:11Z) - A Universal Framework for Compressing Embeddings in CTR Prediction [68.27582084015044]
本稿では,事前学習した埋め込みを定量化することにより,埋め込みテーブルを圧縮するモデル非依存型埋め込み圧縮(MEC)フレームワークを提案する。
まず、高頻度特徴と低周波特徴のバランスをとるために、人気重み付け正規化を適用します。
3つのデータセットの実験により,提案手法はメモリ使用量を50倍以上削減し,レコメンデーション性能を維持・改善する。
論文 参考訳(メタデータ) (2025-02-21T10:12:34Z) - PAMS: Quantized Super-Resolution via Parameterized Max Scale [84.55675222525608]
深部畳み込みニューラルネットワーク(DCNN)は超解像処理(SR)において優位な性能を示した
本稿では,PAMS(Parameterized Max Scale)と呼ばれる新しい量子化手法を提案する。
実験により,提案手法はEDSRやRDNなどの既存のSRモデルを適切に圧縮・高速化できることが示された。
論文 参考訳(メタデータ) (2020-11-09T06:16:05Z) - A Generic Network Compression Framework for Sequential Recommender
Systems [71.81962915192022]
シークエンシャルレコメンデーションシステム(SRS)は,ユーザの動的関心を捉え,高品質なレコメンデーションを生成する上で重要な技術となっている。
CpRecと呼ばれる圧縮されたシーケンシャルレコメンデーションフレームワークを提案する。
大規模なアブレーション研究により、提案したCpRecは実世界のSRSデータセットにおいて最大4$sim$8倍の圧縮速度を達成できることを示した。
論文 参考訳(メタデータ) (2020-04-21T08:40:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。