論文の概要: Memory Layer: Train the In-Model Cache for Recommendation Models
- arxiv url: http://arxiv.org/abs/2607.25110v1
- Date: Mon, 27 Jul 2026 22:15:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.64198
- Title: Memory Layer: Train the In-Model Cache for Recommendation Models
- Title(参考訳): メモリ層:レコメンデーションモデルのためのモデル内キャッシュをトレーニングする
- Authors: Liangyuan Na, Gufan Yin, Yixin Bao, Xianjie Chen, Justin Lin, Ziheng huang, Xinyuan Zhang, Wen Zhang, Hao Lin, Xiaoheng Mao, Shuo Tang, Min Yu, Lei Chen, Chao yang, Ziliang Zhao, Mengjiao Zhou, Zheng Qi, Dmitry Barablin, Chuo-Yun Yang, Kaustubh Vartak, Tingting Zhang, Arun Kumar Singh,
- Abstract要約: モデルと協調したモデル内キー値埋め込みキャッシュであるメモリ層を導入する。
常に埋め込みは、まだキャッシュされていないアイテムをカバーしているため、すべてのアイテムが予測を受け取る。
この設計は3つの独立したトレーナーと予測器の更新パスを1つの自己完結パイプラインに統合する。
- 参考スコア(独自算出の注目度): 25.559123940613404
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Early ranking stages in recommendation systems precompute item embeddings and cache them in-model for scoring within strict latency constraints. Because this cache exists only at serving time, outside the training loop, training and serving use different item representations, a structural discrepancy that limits quality and adds operational fragility. We show that co-designing the training and serving paths removes this representation discrepancy at its source. We introduce the memory layer, an in-model key-value embedding cache co-trained with the model: the item tower writes embeddings during training and the model reads them at serving, one source of truth for item representations by construction. Always-on embeddings cover items not yet cached, so every item receives a prediction, and the design consolidates three separate trainer-to-predictor update paths into a single self-contained pipeline. Deployed in production on Instagram Reels, the memory layer raises prediction coverage from 96% to 100%, improves embedding freshness from $O(5\text{ min})$ to $O(20\text{ s})$, and narrows the training-serving Normalized Entropy (NE) gap by up to 86%, yielding over $2\times$ recall for the freshest content and a 5-6% cold start engagement lift. Because embeddings are produced during training, the system needs no separate bulk-evaluation or publish-time recomputation, cutting training-and-publish computational cost by 30% at neutral serving computational cost.
- Abstract(参考訳): レコメンデーションシステムの初期段階では、アイテムの埋め込みをプリ計算し、厳格なレイテンシ制約内でスコア付けするためにモデルをキャッシュする。
このキャッシュは、トレーニングループ外のサービスにのみ存在し、トレーニングとサービスで異なるアイテム表現を使用するため、品質を制限し、運用上の脆弱性を追加する構造上の相違がある。
トレーニングとサービスパスを共同設計することで,この表現の相違が除去されることを示す。
本稿では,本モデルと併用したメモリ層について紹介する。アイテムタワーはトレーニング中に埋め込みを記述し,モデルがサービス時にそれを読み取り,構成によるアイテム表現の真理の1つの情報源である。
常時オンの埋め込みは、まだキャッシュされていないアイテムをカバーするため、すべてのアイテムが予測を受け取り、設計は3つの独立したトレーナーと予測器の更新パスを1つの自己完結パイプラインに統合する。
Instagram Reelsで本番環境にデプロイされたメモリレイヤは、予測カバレッジを96%から100%に引き上げ、組み込みのフレッシュネスを$O(5\text{ min})$から$O(20\text{ s})$に改善し、トレーニング対象の正規化エントロピー(NE)ギャップを最大86%縮小し、最新コンテンツのリコールと5-6%のコールドスタートエンゲージメントリフトを2ドル以上削減する。
埋め込みはトレーニング中に生成されるため、システムはバルク評価やパブリッシュタイムの再計算を別途必要とせず、中立的な計算コストでトレーニング・アンド・パブリッシュの計算コストを30%削減する。
関連論文リスト
- ReCache: Learning Budget-Aware Caching Schedules for Diffusion Models via REINFORCE [40.4732814295941]
ReCacheは、生成品質を最大化する再計算スケジュールを学ぶ。
政策勾配を通し、完全な拡散推論を通じてバックペーストを横取りする。
スケジュールベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-06-04T11:59:56Z) - Fast Unlearning at Scale via Margin Self-Correction [52.46927918952516]
言語モデルアンラーニングは、トレーニングモデルを更新して、選択したトレーニング例を見ていないかのように振る舞う。
MASCは、既存のベースラインの計算コストのごく一部で、競争力のある忘れがちなトレードオフを達成する。
論文 参考訳(メタデータ) (2026-06-01T21:49:54Z) - Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing [29.913403615975174]
高いスループットでトランスフォーマー言語モデルを実行するには、冗長な計算を避けるためにキーバリュー(KV)をキャッシュする必要がある。
KVキャッシュのメモリフットプリントは著しく、サービスコストに大きな影響を与えます。
本稿では,ランダムな層間注意(ランダムな層間注意,ランダムな層間注意,ランダムな層間注意)を提案する。
論文 参考訳(メタデータ) (2026-04-03T14:56:17Z) - $\Delta$-Patching: A Framework for Rapid Adaptation of Pre-trained
Convolutional Networks without Base Performance Loss [71.46601663956521]
大規模なデータセットで事前トレーニングされたモデルはしばしば、時間とともにやってくる新しいタスクやデータセットをサポートするように微調整される。
モデルコピーを格納することなく、効率よく微調整ニューラルネットワークモデルに$Delta$-Patchingを提案する。
我々の実験によると、$Delta$-Networksは、トレーニングされるパラメータのごく一部しか必要とせず、初期のモデルパッチ作業より優れています。
論文 参考訳(メタデータ) (2023-03-26T16:39:44Z) - Dimensionality Reduced Training by Pruning and Freezing Parts of a Deep
Neural Network, a Survey [69.3939291118954]
最先端のディープラーニングモデルには、何十億にも達するパラメータカウントがある。そのようなモデルのトレーニング、保存、転送は、エネルギーと時間を要するため、コストがかかる。
モデル圧縮は、ストレージと転送コストを低減し、フォワードおよび/または後方パスでの計算数を減少させることで、トレーニングをより効率的にすることができる。
この研究は、トレーニング全体を通してディープラーニングモデルでトレーニングされた重量を減らす方法に関する調査である。
論文 参考訳(メタデータ) (2022-05-17T05:37:08Z) - ProgFed: Effective, Communication, and Computation Efficient Federated Learning by Progressive Training [65.68511423300812]
本稿では,効率的なフェデレート学習のためのプログレッシブトレーニングフレームワークであるProgFedを提案する。
ProgFedは計算と双方向通信のコストを本質的に低減し、最終モデルの強力な性能を維持している。
以上の結果から, ProgFed はフルモデルの標準トレーニングと同等の速度で収束することがわかった。
論文 参考訳(メタデータ) (2021-10-11T14:45:00Z) - DeepObliviate: A Powerful Charm for Erasing Data Residual Memory in Deep
Neural Networks [7.687838702806964]
DeepObliviateと呼ばれるアプローチを提案し、マシンアンラーニングを効率的に実装します。
本手法は,中間モデルをハードディスク上に格納することで,元のトレーニングプロセスを改善する。
ゼロから再トレーニングする方法と比較して、99.0%、95.0%、91.9%、96.7%、74.1%の精度と66.7$times$、75.0$times$、33.3$times$、29.4$times$、13.7$times$ speedupsが得られる。
論文 参考訳(メタデータ) (2021-05-13T12:02:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。