論文の概要: Cut Binary Cross Entropy: Efficient Large-Vocabulary Loss and Gradient Kernels for Sequential Recommendation
- arxiv url: http://arxiv.org/abs/2610.05559v1
- Date: Sun, 04 Oct 2026 21:47:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 13:05:37.108862
- Title: Cut Binary Cross Entropy: Efficient Large-Vocabulary Loss and Gradient Kernels for Sequential Recommendation
- Title(参考訳): カット二項交叉エントロピー : 逐次レコメンデーションのための高効率大語彙損失とグラディエントカーネル
- Abstract要約: CutBCEは、JAXとPallasで実装されたハードウェアアクセラレーションされたバイナリクロスエントロピー損失と勾配演算子である。
シングルチップのTPU v5e/v6eミニベンチマークでは、CutBCEは最大91.9%のスピードアップでOOMエラーを除去する。
- 参考スコア(独自算出の注目度): 3.6647335536847727
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Industrial sequential recommender systems operate over massive item catalogs (e.g., 10^5--10^7 items). Multi-label recommendation models are trained with Binary Cross-Entropy (BCE) loss over the full vocabulary, but standard BCE materializes a dense [B, N, V] logits tensor in High Bandwidth Memory (HBM), incurring prohibitive $O(BNV)$ memory and fatal Out-Of-Memory (OOM) errors. While chunked loss optimizations exist for Softmax Cross-Entropy in LLMs, large-scale multi-label BCE optimization remains unexplored across deep learning ecosystems. We propose CutBCE, an exact, hardware-accelerated BCE loss and gradient operator implemented in JAX and Pallas for large-vocabulary workloads. CutBCE introduces (1) an exact fused reformulation evaluating dense background loss and sparse target corrections; (2) a custom Vector-Jacobian Product (VJP) with a dedicated Pallas TPU backward kernel computing logit tiles on-chip in both passes so logits and their gradients never reside in HBM; (3) dynamic VMEM budgeting and sharding-aware collective hoisting for distributed meshes; and (4) count-based zero-overhead training metrics. On single-chip TPU v5e/v6e mini-benchmarks, CutBCE eliminates OOM errors with up to 91.9% speedup. On 8-chip TPU slice training for multi-label SASRec with 876k items (Yambda-50M), CutBCE reduces peak HBM by 65.7% (>14 GiB saved per chip) and increases training speed by 225.9% with comparable accuracy. CutBCE is open-sourced at https://github.com/AI-Hypercomputer/RecML/blob/main/recml/core/ops/binary_cross_entropy_ops.py.
- Abstract(参考訳): 産業用シーケンシャルレコメンダシステムは、大量のアイテムカタログ(例:10^5--10^7アイテム)を運用している。
マルチラベルレコメンデーションモデルは、完全な語彙上でのバイナリクロスエントロピー(BCE)損失をトレーニングするが、標準のBCEは、高帯域メモリ(HBM)の高密度な[B, N, V]ログテンソルを具体化し、禁忌な$O(BNV)$メモリと致命的なOut-Of-Memory(OOM)エラーを引き起こす。
LLMにおけるSoftmaxクロスエントロピーのチャンクドロス最適化は存在するが、大規模マルチラベルBCE最適化はディープラーニングエコシステム全体では未検討である。
そこで我々は,JAX と Pallas で実装されたハードウェアアクセラレーションによる BCE の損失・勾配演算子である CutBCE を提案する。
CutBCEでは,(1)厳密なバックグラウンド損失とスパース目標修正を評価する厳密な融合型再構成,(2)専用のPallas TPUを内蔵したカスタムベクター・ヤコビアン製品(VJP),(3)分散メッシュに対する動的VMEM予算とシャーディング対応集団ホストリング,(4)カウントベースゼロオーバーヘッドトレーニングメトリクスを導入している。
シングルチップのTPU v5e/v6eミニベンチマークでは、CutBCEは最大91.9%のスピードアップでOOMエラーを除去する。
マルチラベルSASRecの8チップTPUスライストレーニング(Yambda-50M)では、CutBCEはピークHBMを65.7%削減し(>14 GiB saved per chip)、トレーニング速度を225.9%向上させた。
CutBCEはhttps://github.com/AI-Hyper computer/RecML/blob/main/recml/core/ops/binary_cross_entropy_ops.pyでオープンソース化されている。
関連論文リスト
- Out of the Memory Barrier: A Highly Memory Efficient Training System for LLMs with Million-Token Contexts [68.79341332280062]
長いコンテキストでの大規模言語モデル(LLM)のトレーニングは、トレーニング時間ではなく、GPUメモリの異常なオーバーヘッドによって厳しく制限される。
この障壁に直面するメモリ効率の高いトレーニングシステムOOMBを紹介します。
本手法では,オンザフライアクティベーション・リコンピュテーションを備えたチャンク・リカレント・トレーニング・フレームワークを用いて,一定のアクティベーションメモリフットプリントを維持する。
論文 参考訳(メタデータ) (2026-02-02T13:52:40Z) - Mixed-Precision Training and Compilation for RRAM-based Computing-in-Memory Accelerators [0.8708298560474775]
CIMアーキテクチャのための混合精度トレーニングおよびコンパイルフレームワークを提案する。
最大の課題は巨大な検索スペースであり、優れた量子化パラメータを見つけるのが難しくなる。
最良の場合、我々の手法は既存の最先端ソリューションよりも2.48倍のスピードアップを達成し、精度の損失は0.086%である。
論文 参考訳(メタデータ) (2026-01-29T13:54:55Z) - Memory-Efficient Acceleration of Block Low-Rank Foundation Models on Resource Constrained GPUs [11.45717904490388]
トランスフォーマーベースの基盤モデルの最近の進歩は、多くのタスクのデフォルト選択となった。
その急速に成長するサイズは、単一のGPUに完全なモデルを適合させることがますます難しくなり、計算コストが禁じられる。
ブロック低ランク(BLR)圧縮技術は、重み行列のコンパクト表現を学習することでこの問題に対処する。
論文 参考訳(メタデータ) (2025-12-24T00:41:13Z) - SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations [54.303301888915406]
混合エキスパートモデル(MoE)は、計算コストを大幅に増加させることなく、言語モデルをスケールアップするためのデファクトアーキテクチャとして登場した。
最小のアクティベーションキャッシングでMoEの前後パスを計算するメモリ効率のアルゴリズムを提案する。
また,グループ化されたGEMMカーネルのパディングによる無駄計算を最小限に抑える新しい「トークンラウンドリング」手法を提案する。
論文 参考訳(メタデータ) (2025-12-16T04:39:10Z) - Striking the Right Balance between Compute and Copy: Improving LLM Inferencing Under Speculative Decoding [12.302511322703852]
本稿では,Balancing Memory and Compute (BMC) と呼ばれる新しいKVキャッシュ割り当て機構を提案する。
BMCは、rイテレーション毎に、r冗長な行を持つKVテンソルを割り当て、それらのイテレーションのオーバーヘッドをコピーすることなく、インプレース更新を可能にする。
BMCは、最先端の推論サーバvLLMとDeepSpeedで最大1.36倍と2.29倍のスループットを達成している。
論文 参考訳(メタデータ) (2025-11-15T04:49:23Z) - Cut Your Losses in Large-Vocabulary Language Models [102.6981011879656]
我々は,全トークンのロジットをグローバルメモリに実体化することなく,クロスエントロピー損失を計算する手法であるカットクロスエントロピー(CCE)を提案する。
CCEはロスのメモリフットプリントを24GBから1MBに減らし、ヘッドのトレーニング時間のメモリ消費を28GBから1GBに短縮する。
論文 参考訳(メタデータ) (2024-11-13T20:30:15Z) - Breaking the Memory Barrier: Near Infinite Batch Size Scaling for Contrastive Loss [59.835032408496545]
本稿では, コントラスト損失計算を任意の小ブロックに分割するタイルベースの戦略を提案する。
分散システムの階層構造を活用するためのマルチレベルタイリング戦略も導入する。
SOTAメモリ効率のソリューションと比較すると、同等の速度を維持しながら、メモリの2桁の削減を実現している。
論文 参考訳(メタデータ) (2024-10-22T17:59:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。