論文の概要: ROCS: Request-Oriented Compute Sharing for Efficient Large-Scale Recommendation
- arxiv url: http://arxiv.org/abs/2607.27744v1
- Date: Thu, 30 Jul 2026 06:33:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.423379
- Title: ROCS: Request-Oriented Compute Sharing for Efficient Large-Scale Recommendation
- Title(参考訳): ROCS: 大規模レコメンデーションを効率的にするためのリクエスト指向のコンピュータ共有
- Abstract要約: リクエスト指向のコンピュータ共有(ROCS)は、レコメンデーション推論のユニークな特性を利用する。
ROCSは、リクエスト/候補間のインタラクションを可能な限り遅くし、候補に依存した表現を分離し、リクエスト毎にモデルのかなりの部分を評価します。
ROCSは、広告や有機表面、検索とランキングの段階、および推論の複雑さの2桁以上の規模にまたがる大規模なレコメンデーションシステムに展開されている。
- 参考スコア(独自算出の注目度): 43.781215072800364
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern recommendation models gain prediction quality by scaling feature-interaction and sequence modules, but production cost constraints cap how far systems can scale. In this work, we propose Request-Oriented Compute Sharing (ROCS), a modeling and inference paradigm that exploits a unique property of recommendation inference: each user request is evaluated against many candidates, while request-side features are shared across candidates. ROCS defers request-candidate interactions as late as possible, isolates candidate-dependent representations, and evaluates substantial portions of the model once per request rather than once per candidate, significantly improving inference efficiency while maintaining or improving prediction quality. To realize this paradigm, we develop Generalized Layer Masking (GLM) to enforce candidate isolation in feature-interaction architectures, and Deep Cross Attention (DCA) to extend request-oriented sharing to sequence architectures. To support efficient GPU deployment, we co-design In-Kernel Broadcast Optimization (IKBO) that significantly accelerates ROCS model execution. Experiments on public benchmarks show that ROCS consistently improves the quality-efficiency tradeoff across recommendation backbones. On production-scale workloads, ROCS achieves up to a 3x QPS improvement on retrieval models without quality degradation and a 0.5% relative LogLoss improvement with a 50% QPS gain on a short-form video ranking model. ROCS has been deployed across large-scale recommendation systems spanning ads and organic surfaces, retrieval and ranking stages, and more than two orders of magnitude in inference complexity, delivering significant online gains at reduced infrastructure cost.
- Abstract(参考訳): 現代のレコメンデーションモデルは、フィーチャ・インタラクションとシーケンス・モジュールのスケーリングによって予測品質を得るが、生産コストの制約により、システムがどれだけスケールできるかが制限される。
本研究では,複数の候補に対して各ユーザ要求が評価され,要求側の特徴が候補間で共有されるという,レコメンデーション推論のユニークな特性を利用したモデリングと推論のパラダイムであるリクエスト指向コンピューティング共有(ROCS)を提案する。
ROCSは、リクエスト/候補間のインタラクションを可能な限り遅くし、候補に依存した表現を分離し、候補毎に1回ではなく1回の要求でモデルのかなりの部分を評価し、予測品質を維持したり改善したりしながら、推論効率を大幅に改善する。
このパラダイムを実現するために、機能相互作用アーキテクチャにおける候補分離を強制する汎用層マスキング(GLM)と、要求指向の共有をシーケンスアーキテクチャに拡張するDeep Cross Attention(DCA)を開発した。
In-Kernel Broadcast Optimization (IKBO)を共同設計し,ROCSモデルの実行を大幅に高速化する。
公開ベンチマークの実験では、ROCSはレコメンデーションバックボーン間の品質と効率のトレードオフを一貫して改善している。
プロダクションスケールのワークロードでは、ROCSは品質劣化のない検索モデルで最大3倍のQPS改善を実現し、短い形式のビデオランキングモデルでは50%のQPSゲインで0.5%の相対的なLogLoss改善を実現している。
ROCSは、広告や有機表面、検索とランキングの段階、および推論の複雑さの2桁以上の桁数にまたがる大規模なレコメンデーションシステムに展開され、インフラコストの削減によってオンライン上の大きな利益をもたらしている。
関連論文リスト
- AIGQ: An End-to-End Hybrid Generative Architecture for E-commerce Query Recommendation [9.218475190088734]
タオバオのホームページ上のHintQとして広く知られている事前検索クエリレコメンデーションは、意図的捕獲と需要発見において重要な役割を担っている。
これらの課題を克服するために、HintQシナリオの最初のエンドツーエンド生成フレームワークであるAIGQを提案する。
論文 参考訳(メタデータ) (2026-03-20T07:27:59Z) - RankGR: Rank-Enhanced Generative Retrieval with Listwise Direct Preference Optimization in Recommendation [36.297513746770456]
提案するRangGRは、リストワイズ直接選好最適化をレコメンデーションに組み込んだジェネレーティブ検索手法である。
IAPでは、新しいリストワイズ直接選好最適化戦略をGRに組み込んで、階層的ユーザの選好をより包括的に理解する。
トレーニングとデプロイメントにおいていくつかの実践的な改善を実現し、最終的には毎秒1万近いリクエストを処理可能なリアルタイムシステムを実現しています。
論文 参考訳(メタデータ) (2026-02-09T12:13:43Z) - Unifying Ranking and Generation in Query Auto-Completion via Retrieval-Augmented Generation and Multi-Objective Alignment [8.610245271469267]
クエリオートコンプリート(QAC)では,ユーザが入力するクエリ補完が提案されている。
伝統的なレトリート・アンド・ランクパイプラインは、長い尾のカバレッジが限られており、広範な機能エンジニアリングを必要としている。
本稿では,QACをRAG(Retrieval-Augmented Generation)とDPO(Multi-objective Direct Preference Optimization)を通じて,エンドツーエンドのリスト生成として再構成する統合フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-01T05:15:07Z) - SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models [53.19726629537694]
ビデオ生成モデルと人間の好みのトレーニング後のアライメントは、重要な目標である。
現在のデータ収集パラダイムは、プロンプト内のペアワイズアノテーションに依存しており、ノイズのラベル付けに悩まされている。
ビデオRMトレーニングのための体系的フレームワークであるSoliRewardを提案する。
論文 参考訳(メタデータ) (2025-12-17T14:28:23Z) - SCoRE: Streamlined Corpus-based Relation Extraction using Multi-Label Contrastive Learning and Bayesian kNN [0.2812395851874055]
本稿では,モジュール型かつ費用対効果の高い文レベルの関係抽出システムであるSCoREを紹介する。
SCoREは簡単なPLMスイッチングを可能にし、微調整を必要とせず、多様なコーパスやKGにスムーズに適応する。
SCoREは, エネルギー消費を大幅に削減しつつ, 最先端の手法に適合するか, 超越しているかを示す。
論文 参考訳(メタデータ) (2025-07-09T14:33:07Z) - Intra-Trajectory Consistency for Reward Modeling [67.84522106537274]
軌道内整合性正則化を開発し、より高い次トーケン生成確率を持つプロセスがより一貫した報酬を維持することを強制する。
提案した正規化でトレーニングした報酬モデルにより、より優れたDPO整合ポリシーが導出され、より優れたベスト・オブ・N(BON)検証結果が得られることを示す。
論文 参考訳(メタデータ) (2025-06-10T12:59:14Z) - Optimizing Sequential Recommendation Models with Scaling Laws and Approximate Entropy [104.48511402784763]
SRモデルの性能法則は,モデルの性能とデータ品質の関係を理論的に調査し,モデル化することを目的としている。
データ品質を評価するために、従来のデータ量メトリクスと比較して、より曖昧なアプローチを示すために、近似エントロピー(ApEn)を提案する。
論文 参考訳(メタデータ) (2024-11-30T10:56:30Z) - A Thorough Performance Benchmarking on Lightweight Embedding-based Recommender Systems [67.52782366565658]
State-of-the-art recommender system (RS) は、埋め込みベクトルによって符号化される分類的特徴に依存し、結果として非常に大きな埋め込みテーブルとなる。
軽量埋め込み型RSの繁栄にもかかわらず、評価プロトコルには幅広い多様性が見られる。
本研究では, LERSの性能, 効率, クロスタスク転送性について, 徹底的なベンチマークによる検討を行った。
論文 参考訳(メタデータ) (2024-06-25T07:45:00Z) - RecPipe: Co-designing Models and Hardware to Jointly Optimize
Recommendation Quality and Performance [6.489720534548981]
RecPipeは、推奨品質と推論性能を共同で最適化するシステムである。
RPAccelは、品質、テールレイテンシ、システムスループットを共同で最適化するカスタムアクセラレータである。
論文 参考訳(メタデータ) (2021-05-18T20:44:04Z) - A Generic Network Compression Framework for Sequential Recommender
Systems [71.81962915192022]
シークエンシャルレコメンデーションシステム(SRS)は,ユーザの動的関心を捉え,高品質なレコメンデーションを生成する上で重要な技術となっている。
CpRecと呼ばれる圧縮されたシーケンシャルレコメンデーションフレームワークを提案する。
大規模なアブレーション研究により、提案したCpRecは実世界のSRSデータセットにおいて最大4$sim$8倍の圧縮速度を達成できることを示した。
論文 参考訳(メタデータ) (2020-04-21T08:40:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。