論文の概要: Teacher Retains Full Tokens, Student Merges Efficiently: TM20K for E-Commerce Sequence Modeling in Ad Recommendation
- arxiv url: http://arxiv.org/abs/2608.07055v1
- Date: Fri, 07 Aug 2026 10:04:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.459277
- Title: Teacher Retains Full Tokens, Student Merges Efficiently: TM20K for E-Commerce Sequence Modeling in Ad Recommendation
- Title(参考訳): 教師はフルトークンを保持し、学生は効率的にマージする:広告推薦におけるEコマースシーケンスモデリングのためのTM20K
- Abstract要約: 本稿では,トランスモデリングによる超長大シーケンスモデリングの有効性と効率のバランスをとる。
学生モデルでは、単純だが動機のよいトークンマージアプローチがいくつか提案され、シーケンス長が大幅に圧縮される。
そして、1回限りの教師がフルシーケンストークンで強く訓練され、学生モデルのパフォーマンスがさらに向上する。
提案したパラダイムであるTM20KはByteDanceのeコマース広告レコメンデーションシステムにうまくデプロイされている。
- 参考スコア(独自算出の注目度): 13.464904715421374
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Benefiting from ultra-long behavior sequence modeling, existing recommender systems bring users a better experience via simultaneously considering their long-term and short-term interests. Nevertheless, extended sequence lengths introduce substantial burdens on training efficiency and serving throughput. Prior approaches typically utilize search-based or cluster-based compression on ultra-long sequences at the cost of fine-grained information, or rely on various lightweight target attention structures incapable of sufficient sequential feature extraction. In this paper, we balance the effectiveness and efficiency for ultra-long sequence modeling via full transformer modeling accompanied with a two-stage knowledge distillation framework. First, both teacher and student models take the full attention mechanism rather than pure target-sequence attention for effective sequence scaling. For student models, we propose several simple yet well-motivated token merge approaches, significantly compressing the sequence length while maintaining an acceptable performance. Then, a one-time teacher is heavily trained with full sequence tokens, further boosting the performance of student models via knowledge distillation. The proposed paradigm named TM20K has been successfully deployed in ByteDance's e-commerce advertising recommender system that extends the e-commerce sequence length to 20K, delivering substantial improvements in key business metrics (e.g., ADSS +1.036\%) while keeping the training and serving cost nearly the same as the online state-of-the-art model (e.g., serving latency only +5.6\%).
- Abstract(参考訳): 超長期の行動シーケンスモデリングに特化して、既存のレコメンデータシステムは、長期的および短期的な関心を同時に考慮して、より良いエクスペリエンスを提供する。
それでも、拡張シーケンス長は、トレーニング効率とスループットにかなりの負担をもたらす。
従来のアプローチでは、通常、細粒度情報を犠牲にして超長いシーケンスを探索ベースまたはクラスタベースで圧縮するか、あるいは十分なシーケンシャルな特徴抽出ができない様々な軽量なターゲットアテンション構造に依存していた。
本稿では,2段階の知識蒸留フレームワークを伴い,フルトランスモデリングによる超長期シーケンスモデリングの有効性と効率のバランスをとる。
まず、教師モデルと学生モデルの両方が、効果的なシーケンススケーリングのための純粋なターゲットシーケンスアテンションではなく、完全なアテンションメカニズムを取り入れている。
学生モデルでは,いくつかの単純なトークンマージ手法を提案し,許容性能を維持しつつシーケンス長を著しく圧縮する。
そして、1回限りの教師がフルシークエンストークンで訓練され、知識蒸留による学生モデルの性能をさらに向上させる。
提案されたパラダイムであるTM20Kは、ByteDanceのeコマース広告推薦システムにおいて、eコマースシーケンスの長さを20Kに拡張し、主要なビジネスメトリクス(例えばADSS +1.036\%)を大幅に改善し、トレーニングとサービス提供コストは、オンライン最先端モデル(例えば、レイテンシは+5.6\%)とほぼ同じである。
関連論文リスト
- SequenceO1: End-to-End Ultra-Long (100K) Sequence Modeling in Recommendation with Low-Rank Caching [17.335538522124555]
SequenceO1は、超長期のユーザ行動シーケンスモデリングのためのエンドツーエンドフレームワークである。
Douyinのフルトラフィックにデプロイされ、最大100Kのインタラクション履歴がある。
結果は、オフラインとオンラインの連続的なゲインを示しているが、スケッチは、エンドツーエンドのシーケンスランキングを直接100Kにスケーリングするメリットの大部分を保っている。
論文 参考訳(メタデータ) (2026-09-08T08:49:44Z) - Intra-class Patch Swap for Self-Distillation [3.282914142012984]
単一学生ネットワークに基づく無教師蒸留フレームワークを提案する。
我々のアプローチは、クラス内パッチスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワ
提案手法は,既存の自己蒸留ベースラインと従来の教師ベースのKDアプローチを一貫して上回る。
論文 参考訳(メタデータ) (2025-05-20T09:30:19Z) - LONGER: Scaling Up Long Sequence Modeling in Industrial Recommenders [23.70714095931094]
GPU効率の良いリコメンダのための長時間最適化されたtraNsformer。
オフラインのメトリクスとオンラインのA/Bテストでは、一貫して強力なベースラインを上回ります。
論文 参考訳(メタデータ) (2025-05-07T13:54:26Z) - Active Data Curation Effectively Distills Large-Scale Multimodal Models [66.23057263509027]
知識蒸留(KD)は、大規模モデルをより小さなものに圧縮するデファクトスタンダードである。
本研究では, 対照的なマルチモーダル事前学習のための効果的な蒸留法として, 能動的データキュレーションの代替として, 簡単なアプローチを探求する。
我々の単純なオンラインバッチ選択方法であるACIDは、さまざまなモデル、データ、計算構成において、強力なKDベースラインよりも優れています。
論文 参考訳(メタデータ) (2024-11-27T18:50:15Z) - Denoising Pre-Training and Customized Prompt Learning for Efficient Multi-Behavior Sequential Recommendation [69.60321475454843]
マルチビヘイビアシークエンシャルレコメンデーションに適した,最初の事前学習および迅速な学習パラダイムであるDPCPLを提案する。
事前学習段階において,複数の時間スケールでノイズを除去する新しい行動マイナ (EBM) を提案する。
次に,提案するCustomized Prompt Learning (CPL)モジュールを用いて,事前学習したモデルを高効率にチューニングすることを提案する。
論文 参考訳(メタデータ) (2024-08-21T06:48:38Z) - Efficient User Sequence Learning for Online Services via Compressed Graph Neural Networks [18.068737439570402]
グラフニューラルネットワーク(GNN)は、モデルシーケンス関係に広く適用され、類似したシーケンスから情報を抽出している。
本稿では,ユーザシーケンス表現学習のための関係モデリングにグラフ圧縮技術を導入するため,ECSeqという新しい統合フレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T06:22:11Z) - Step-On-Feet Tuning: Scaling Self-Alignment of LLMs via Bootstrapping [53.454408491386886]
自己アライメントのブートストラップは、シングルラウンドアプローチをはるかに上回る。
モデルが継続的に強化した複数ショット機能を活用してゼロまたはワンショットのパフォーマンスを向上するステップ・オン・フィート・チューニング(SOFT)を提案する。
簡単な学習法に基づいて、自己アライメントの性能をさらに向上させるSOFT+を提案する。
論文 参考訳(メタデータ) (2024-02-12T12:30:42Z) - Revisiting the Power of Prompt for Visual Tuning [50.11465784194896]
本研究では,プロンプトとパッチトークンの相互関係について検討した。
プロンプトトークンはパッチトークンと高い相互情報を共有する傾向にあるという観測から着想を得て,下流トークンのプロトタイプを用いた初期化プロンプトを提案する。
本手法は, 自己指導型プレトレーニングの適応性を著しく向上させ, 少なくとも10%から30%のタスク性能向上を実現した。
論文 参考訳(メタデータ) (2024-02-04T07:49:02Z) - TransNormerLLM: A Faster and Better Large Language Model with Improved
TransNormer [34.790081960470964]
最初の線形注意に基づくLarge Language Model(LLM)であるTransNormerLLMを提案する。
我々は, 位置埋め込み, 線形注意加速度, ゲーティング機構, テンソル正規化, 推論加速度, 安定化など, 高度な修正を行う。
自己収集コーパス上に385M, 1B, 7Bの大きさの列車モデルとアブリケーションを用いてモデル設計を検証する。
論文 参考訳(メタデータ) (2023-07-27T16:45:33Z) - AttentionLite: Towards Efficient Self-Attention Models for Vision [9.957033392865982]
本稿では,リソース制約のあるアプリケーションに対して,パラメータのクラスを生成・計算するための新しいフレームワークである attentionliteable を提案する。
計算量の多い教師から知識を同時蒸留でき、同時に学生モデルを1回の訓練パスで刈り取ることができる。
論文 参考訳(メタデータ) (2020-12-21T17:54:09Z) - Efficient Crowd Counting via Structured Knowledge Transfer [122.30417437707759]
クラウドカウントはアプリケーション指向のタスクであり、その推論効率は現実世界のアプリケーションにとって不可欠である。
本稿では,学生ネットワークを軽量かつ高効率に構築する構造的知識伝達フレームワークを提案する。
我々のモデルはNvidia 1080 GPUで最低6.5$times$のスピードアップを取得し、最先端のパフォーマンスも達成しています。
論文 参考訳(メタデータ) (2020-03-23T08:05:41Z) - MiniLM: Deep Self-Attention Distillation for Task-Agnostic Compression
of Pre-Trained Transformers [117.67424061746247]
本稿では,大規模トランスフォーマーをベースとした事前学習モデルの簡易かつ効率的な圧縮手法を提案する。
本稿では,教師の最後のトランスフォーマー層の自己保持モジュールを蒸留することを提案する。
実験結果から, 単言語モデルでは, 学生モデルのパラメータサイズの違いにより, 最先端のベースラインよりも優れた結果が得られた。
論文 参考訳(メタデータ) (2020-02-25T15:21:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。