論文の概要: SequenceO1: End-to-End Ultra-Long (100K) Sequence Modeling in Recommendation with Low-Rank Caching
- arxiv url: http://arxiv.org/abs/2609.08443v1
- Date: Tue, 08 Sep 2026 08:49:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.621352
- Title: SequenceO1: End-to-End Ultra-Long (100K) Sequence Modeling in Recommendation with Low-Rank Caching
- Title(参考訳): シーケンスO1:低ランクキャッシングによる勧告における100K(End-to-End Ultra-Long)シーケンスモデリング
- Abstract要約: SequenceO1は、超長期のユーザ行動シーケンスモデリングのためのエンドツーエンドフレームワークである。
Douyinのフルトラフィックにデプロイされ、最大100Kのインタラクション履歴がある。
結果は、オフラインとオンラインの連続的なゲインを示しているが、スケッチは、エンドツーエンドのシーケンスランキングを直接100Kにスケーリングするメリットの大部分を保っている。
- 参考スコア(独自算出の注目度): 17.335538522124555
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modeling long-term user behavior is central to sequential recommendation and billion-scale industrial recommender systems, yet production ranking models operate under strict latency, memory, communication, and training-throughput constraints. At the 100K scale, the challenge extends beyond attention complexity: raw sequence features must be stored, transferred, and repeatedly processed during training and online serving. Existing approaches based on history truncation, multi-stage behavior retrieval, compressed lifelong histories, or train-short/infer-long extrapolation either weaken end-to-end optimization or retain substantial length-dependent cost. We present SequenceO1, an end-to-end framework for ultra-long user behavior sequence modeling, deployed at full traffic on Douyin with histories of up to 100K interactions. SequenceO1 follows a compress-then-reason design. Its Sketch Attention (SA) uses learnable prototypes and prototype-wise normalization to compress the raw history into a fixed-size, target-agnostic user representation. Target-conditioned Stacked Target-to-History Cross Attention (STCA) then models complementary time scales: a recent 10K suffix for short-term interests and the compact sketch for long-term preferences. To make training and inference practical, SequenceO1 combines low-rank user representation caching, multi-request user-level batching, pipeline lift, and a fused FlashSA kernel to amortize feature storage, communication, and computation across targets, training instances, and consecutive requests. Production experiments show consistent offline and online gains, while the compact cached sketch retains most of the benefit of directly scaling end-to-end sequence ranking to 100K. These results provide a practical model-system approach to efficient attention, sequence compression, and scalable long-sequence and long-context recommendation systems.
- Abstract(参考訳): 長期ユーザー行動のモデリングは、逐次レコメンデーションと数十億ドル規模の産業レコメンデーションシステムの中心であるが、生産ランキングモデルは厳格なレイテンシ、メモリ、通信、トレーニング・スループットの制約の下で動作している。
生のシーケンス機能は、トレーニングとオンラインサービスの間、保存、転送、繰り返し処理されなければならない。
既存のアプローチは、履歴の切り離し、多段階の振る舞いの検索、圧縮寿命の履歴、または列車ショート/インファーロングの外挿がエンドツーエンドの最適化を弱めるか、あるいは相当な時間依存コストを維持する。
我々は,Douyin上で最大100Kのインタラクション履歴をフルトラフィックで展開する,超長期ユーザ行動シーケンスモデリングのためのエンドツーエンドフレームワークSequenceO1を提案する。
SequenceO1は圧縮領域の設計に従っている。
そのSketch Attention (SA)は学習可能なプロトタイプとプロトタイプワイドな正規化を使用して、生の履歴を固定サイズでターゲットに依存しないユーザ表現に圧縮する。
ターゲット条件付きスタック・ターゲット・ツー・ヒストリー・クロス・アテンション(STCA)は、補完的な時間スケールをモデル化する。
トレーニングと推論を実用的なものにするために、SequenceO1では、低ランクなユーザ表現キャッシュ、マルチリクエストのユーザレベルのバッチ、パイプラインリフト、融合したFlashSAカーネルを組み合わせて、機能ストレージ、通信、ターゲットを越えた計算、トレーニングインスタンス、連続的なリクエストを記憶する。
プロダクション実験は、オフラインとオンラインの連続的なゲインを示しているが、コンパクトなキャッシュされたスケッチは、エンドツーエンドのシーケンスランキングを100Kまで直接スケーリングするメリットの大部分を保っている。
これらの結果は、効率的な注意、シーケンス圧縮、スケーラブルな長文・長文レコメンデーションシステムへの実用的なモデルシステムアプローチを提供する。
関連論文リスト
- Rethinking Convolutional Networks for Attribute-Aware Sequential Recommendation [6.846413131554734]
属性対応シーケンシャルレコメンデーションでは、ユーザが過去のインタラクションの時系列的に順序付けられた履歴に基づいて、次に対話するアイテムを予測する。
既存の方法は典型的には、シーケンス全体を統一表現に集約するために自己認識機構を利用する。
本稿では,畳み込み層を階層的かつ低スケールに利用して,コンパクトかつ表現力のあるシーケンス表現を生成するConvRecを提案する。
論文 参考訳(メタデータ) (2026-05-06T10:18:43Z) - Action-Aware Generative Sequence Modeling for Short Video Recommendation [50.74467504063892]
ショートビデオには様々な部分が含まれており、ユーザーはそれらすべてに対して同じ態度を取ることはできない。
従来のバイナリ分類レコメンデーションモデルは、ビデオを単一の全体的エンティティとして扱うが、そのような微妙な好みを正確に捉えるには限界に直面している。
本稿では,時間的次元に沿ってユーザアクションを洗練させる行動認識生成系列ネットワーク(A2Gen)を提案する。
論文 参考訳(メタデータ) (2026-04-28T16:41:04Z) - GEMs: Breaking the Long-Sequence Barrier in Generative Recommendation with a Multi-Stream Decoder [54.64137490632567]
本稿では,長期的履歴からユーザのシーケンスをキャプチャする新しい統一フレームワークを提案する。
GEM(Generative Multi-streamer)は、ユーザのシーケンスを3つのストリームに分割する。
大規模産業データセットに対する大規模な実験により、GEMは推奨精度において最先端の手法を大幅に上回っていることが示された。
論文 参考訳(メタデータ) (2026-02-14T06:42:56Z) - Length-Adaptive Interest Network for Balancing Long and Short Sequence Modeling in CTR Prediction [50.094751096858204]
LAINは、長いシーケンスと短いシーケンスのモデリングのバランスをとるために、シーケンス長を条件信号として組み込んだプラグアンドプレイフレームワークである。
私たちの仕事は、シーケンシャルなレコメンデーションにおいて、長さによるバイアスを軽減する、汎用的で効率的でデプロイ可能なソリューションを提供します。
論文 参考訳(メタデータ) (2026-01-27T03:14:20Z) - Make It Long, Keep It Fast: End-to-End 10k-Sequence Modeling at Billion Scale on Douyin [21.0248704845397]
Douyinのような短いビデオレコメンデータは、レイテンシやコストの予算を壊さずに、非常に長いユーザー履歴を活用できなければならない。
長大なモデリングを10kの履歴に拡張するエンド・ツー・エンドシステムを提案する。
論文 参考訳(メタデータ) (2025-11-08T17:22:54Z) - OmniSAT: Compact Action Token, Faster Auto Regression [70.70037017501357]
我々は、コンパクトで転送可能なアクション表現を学ぶOmni Swift Action Tokenizerを紹介する。
その結果、離散トークン化はトレーニングシーケンスを6.8$times$に短縮し、ターゲットエントロピーを低下させる。
論文 参考訳(メタデータ) (2025-10-08T03:55:24Z) - Long-Sequence Recommendation Models Need Decoupled Embeddings [49.410906935283585]
我々は、既存の長期推薦モデルにおいて無視された欠陥を識別し、特徴付ける。
埋め込みの単一のセットは、注意と表現の両方を学ぶのに苦労し、これら2つのプロセス間の干渉につながります。
本稿では,2つの異なる埋め込みテーブルを別々に学習し,注意と表現を完全に分離する,DARE(Decoupled Attention and Representation Embeddings)モデルを提案する。
論文 参考訳(メタデータ) (2024-10-03T15:45:15Z) - TWIN V2: Scaling Ultra-Long User Behavior Sequence Modeling for Enhanced CTR Prediction at Kuaishou [28.809014888174932]
SIMの強化であるTWIN-V2を導入し、ライフサイクルの振る舞いを圧縮し、より正確で多様なユーザの興味を明らかにする。
効率的なデプロイメントフレームワークの下では、TWIN-V2が主要なトラフィックにデプロイされ、Kuaishouでは毎日数億人のアクティブユーザを提供する。
論文 参考訳(メタデータ) (2024-07-23T10:00:45Z) - Efficient User Sequence Learning for Online Services via Compressed Graph Neural Networks [18.068737439570402]
グラフニューラルネットワーク(GNN)は、モデルシーケンス関係に広く適用され、類似したシーケンスから情報を抽出している。
本稿では,ユーザシーケンス表現学習のための関係モデリングにグラフ圧縮技術を導入するため,ECSeqという新しい統合フレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T06:22:11Z) - Sparse Attentive Memory Network for Click-through Rate Prediction with
Long Sequences [10.233015715433602]
本稿では,長期的ユーザ行動モデリングのためのスパース注意記憶ネットワークを提案する。
SAMは数千のスケールでユーザ行動シーケンスの効率的なトレーニングとリアルタイム推論をサポートする。
SAMは、世界最大の国際Eコマースプラットフォームのひとつとして成功している。
論文 参考訳(メタデータ) (2022-08-08T10:11:46Z) - Dynamic Memory based Attention Network for Sequential Recommendation [79.5901228623551]
DMAN(Dynamic Memory-based Attention Network)と呼ばれる新しい連続的推薦モデルを提案する。
長い動作シーケンス全体を一連のサブシーケンスに分割し、モデルをトレーニングし、ユーザの長期的な利益を維持するためにメモリブロックのセットを維持する。
動的メモリに基づいて、ユーザの短期的および長期的関心を明示的に抽出し、組み合わせて効率的な共同推薦を行うことができる。
論文 参考訳(メタデータ) (2021-02-18T11:08:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。