論文の概要: Knowledge-Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation
- arxiv url: http://arxiv.org/abs/2608.02738v2
- Date: Thu, 06 Aug 2026 05:18:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.617643
- Title: Knowledge-Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation
- Title(参考訳): 知識幾何学デカップリング:ストリーミング推薦のための再学習型事前学習
- Abstract要約: 産業レコメンデーターは、プレトレイン-Then-Transferパラダイムをますます採用している。
行動分布のドリフトは、行動シーケンスから何を学ぶか、学習した知識を伝達するかという2つの疑問を提起する。
我々はこれらの問題を解決するために知識幾何学デカップリング(KGD)を提案する。
- 参考スコア(独自算出の注目度): 29.47478593926429
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Industrial recommenders increasingly adopt the pretrain-then-transfer paradigm, yet behavioral distribution drift raises two questions: what to learn from behavior sequences, and how to transfer the learned knowledge while the pretrained model is continually refreshed. To resolve them, we propose Knowledge-Geometry Decoupling (KGD). For what to learn, conventional next-token prediction treats adjacency as dependency and may encode spurious transitions across unrelated sessions. We introduce Behavioral Multi-Token Prediction (BMTP) to retain only collaboratively or semantically related future items as supervision, yielding cleaner and more transferable behavioral knowledge. For how to transfer, pretrained knowledge and task-specific geometry impose conflicting optimization demands on shared parameters. To handle it, KGD assigns them to separate parameter sets: a refreshable encoder owns behavioral knowledge, while a task learner reads contextualized encoder states through read-only cross-attention and writes task-specific geometry through Anchored Calibration Residual (ACR) orthogonal to the pretrained embedding. The decoupled ownership enables continual knowledge refresh without task-gradient interference or invalidating downstream adaptation. KGD improves over strong pretrain-transfer baselines by 4-12% on eight public benchmarks and sustains its advantage over a 90-day production stream where baselines show no gains. KGD has been fully deployed in Shopee. In a live A/B test on Shopee Homepage Search, it increases GMV per user by 1.75% and advertising revenue by 1.53%, demonstrating its high practical value. We provide the core implementation of KGD at https://github.com/FuCongResearchSquad/KGD4REC.
- Abstract(参考訳): 産業レコメンデータは、プレトレイン-then-transferパラダイムを採用する傾向にあるが、行動分布のドリフトは、行動シーケンスから何を学ぶか、事前訓練されたモデルが継続的に更新される間に学習した知識を伝達するかという2つの疑問を提起する。
そこで我々はKGD(Knowledge-Geometry Decoupling)を提案する。
学習すべきことは、従来の次世代の予測では、隣接を依存性として扱い、無関係なセッション間での急激な移行をエンコードする可能性がある。
行動多言語予測(BMTP)を導入し、協調的あるいは意味論的に関係のある将来の項目のみを監督し、よりクリーンでより伝達可能な行動知識を提供する。
転送方法として、事前訓練された知識とタスク固有の幾何は、共有パラメータに矛盾する最適化要求を課す。
タスク学習者は、読み取り専用のクロスアテンションを通じてコンテキスト化されたエンコーダ状態を読み、Anchored Calibration Residual (ACR) を通じて、事前訓練された埋め込みに直交するタスク固有の幾何学を記述する。
分離されたオーナシップは、タスクの段階的な干渉や下流適応の無効化なしに、継続的な知識リフレッシュを可能にする。
KGDは8つの公開ベンチマークで、強いプレトレイン-トランスファーベースラインを4-12%改善し、ベースラインが上昇しない90日間の生産ストリームに対して優位性を維持する。
KGDはShopeeに完全にデプロイされている。
Shopee Homepage SearchのライブA/Bテストでは、ユーザ当たりのGMVを1.75%、広告収入を1.53%増加させ、その実用的な価値を示している。
我々は、https://github.com/FuCongResearchSquad/KGD4RECでKGDのコア実装を提供します。
関連論文リスト
- REER-PT: Reverse-Engineered Reasoning for Perplexity-Guided Pre-training Data Augmentation [64.84437332310516]
我々は,Reverse-Engineered Reasoning (REER) を生の事前学習データに拡張するスケーラブルなフレームワークである textbfREER-PT を紹介する。
REER-PTは予測が難しいが、それ以前のコンテキストから推論できる継続を識別し、コンテキストと継続の間の欠落した接続を再構築する簡潔な推論アノテーションを挿入する。
このスパース変換は、ソーステキストを保存し、トレーニング前のオンライン推論ロールアウトを避けることで、標準的な次世代の予測と互換性を維持します。
論文 参考訳(メタデータ) (2026-08-31T11:34:19Z) - PriFT: Prior-Support Guided Supervised Fine-Tuning [74.65198014829393]
Supervised Fine-tuning (SFT) は、下流タスク適応のための効率的なアプローチである。
SFTはトークン単位で固定されたデモトークンに適合する。
凍結した事前訓練参照からトークン重みを導出し、微調整の影響を受けない安定した再重み付け信号を得るPriFTを提案する。
論文 参考訳(メタデータ) (2026-06-08T12:14:06Z) - CLAD-Net: Continual Activity Recognition in Multi-Sensor Wearable Systems [4.252135605345159]
我々は,過去のタスクのパフォーマンスを犠牲にすることなく,ウェアラブルセンサモデルを継続的に更新できるフレームワークであるCLAD-Netを提案する。
CLAD-Netは、長期記憶として機能する自己教師型トランスフォーマーと、知識蒸留による活動分類を訓練した教師型畳み込みニューラルネットワーク(CNN)を統合する。
PAMAP2では、CLAD-Netの最終的な精度は91.36パーセント、リプレイは8.78パーセントで、メモリベースと正規化ベースのベースラインを上回っている。
論文 参考訳(メタデータ) (2025-09-27T03:15:44Z) - EKPC: Elastic Knowledge Preservation and Compensation for Class-Incremental Learning [53.88000987041739]
クラスインクリメンタルラーニング(Class-Incremental Learning, CIL)は、AIモデルを、時間とともに異なるクラスのシーケンシャルに到着したデータから継続的に学習可能にすることを目的としている。
本稿では, 重要度を考慮した重要度正規化 (IPR) と CIL のためのトレーニング可能なセマンティックドリフト補償 (TSDC) を統合したElastic Knowledge Preservation and Compensation (EKPC) 法を提案する。
論文 参考訳(メタデータ) (2025-06-14T05:19:58Z) - Pre-training vs. Fine-tuning: A Reproducibility Study on Dense Retrieval Knowledge Acquisition [28.48078856765935]
デンスレトリバーは、コントラスト学習によって微調整された事前訓練されたバックボーン言語モデル(BERT、LLaMAなど)を使用して、テキストをセンス表現に符号化するタスクを実行する。
近年の研究では、高密度レトリバーにおける微調整と事前学習の役割に疑問が呈されている。
本研究は、DPRチューニングにおいて、事前学習した知識は、知識を再編成するのではなく、主にニューロンの活性化を調整し、検索性能を支えていることを確認した。
論文 参考訳(メタデータ) (2025-05-12T01:24:00Z) - Beyond Prompt Learning: Continual Adapter for Efficient Rehearsal-Free Continual Learning [22.13331870720021]
C-ADA (Continuous Adapter) という,RFCL タスクに対する超高速学習手法を提案する。
C-ADAは、CALの特定の重みを柔軟に拡張し、各タスクの新たな知識を学び、古い重みを凍結して以前の知識を保存する。
提案手法は,現状のSOTA(State-of-the-art)法よりも優れ,性能とトレーニング速度を大幅に向上させる。
論文 参考訳(メタデータ) (2024-07-14T17:40:40Z) - GIST: Improving Parameter Efficient Fine Tuning via Knowledge
Interaction [16.371592369253623]
本稿では,GISTと呼ばれるファインチューニングフレームワークをプラグアンドプレイ方式で提案する。
具体的には、まず、下流タスクにPEFTメソッドを適用する際に、Gistトークンと呼ばれるトレーニング可能なトークンを導入します。
このトークンはPEFT法によって学習されたタスク固有の知識の集合体として機能し、下流の知識と明示的な結びつきを形成する。
論文 参考訳(メタデータ) (2023-12-12T13:35:41Z) - Quick Dense Retrievers Consume KALE: Post Training Kullback Leibler
Alignment of Embeddings for Asymmetrical dual encoders [89.29256833403169]
我々は,高密度検索手法の推論効率を高めるための効率的かつ正確な手法であるKulback Leibler Alignment of Embeddings (KALE)を紹介した。
KALEは、バイエンコーダトレーニング後の従来の知識蒸留を拡張し、完全なリトレーニングやインデックス生成なしに効率的なクエリエンコーダ圧縮を可能にする。
KALEと非対称トレーニングを用いることで、3倍高速な推論を持つにもかかわらず、DistilBERTの性能を超えるモデルを生成することができる。
論文 参考訳(メタデータ) (2023-03-31T15:44:13Z) - MASTER: Multi-task Pre-trained Bottlenecked Masked Autoencoders are
Better Dense Retrievers [140.0479479231558]
本研究では,様々な事前学習タスクをマルチタスク事前学習モデル(MASTER)に統合することを目的とする。
MASTERは共有エンコーダのマルチデコーダアーキテクチャを利用して、タスク全体にわたる豊富なセマンティック情報を高密度ベクトルに圧縮する表現ボトルネックを構築することができる。
論文 参考訳(メタデータ) (2022-12-15T13:57:07Z) - Knowledge Distillation as Efficient Pre-training: Faster Convergence,
Higher Data-efficiency, and Better Transferability [53.27240222619834]
効率的な事前学習としての知識蒸留は、学習した特徴表現を学習済みモデルから将来の下流タスクのための新しい学生モデルに効率的に転送することを目的としている。
提案手法は,3つの下流タスクにおける教師付き事前学習タスクと,10倍少ないデータと5倍少ない事前学習時間を必要とする9つの下流データセットとを比較検討する。
論文 参考訳(メタデータ) (2022-03-10T06:23:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。