論文の概要: GOD: Enhancing Generalization via Deep Grafting for Sequential Recommendation
- arxiv url: http://arxiv.org/abs/2608.16073v2
- Date: Tue, 25 Aug 2026 02:29:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:33.525467
- Title: GOD: Enhancing Generalization via Deep Grafting for Sequential Recommendation
- Title(参考訳): GOD: シークエンシャルレコメンデーションのためのディープグラフティングによる一般化の促進
- Authors: WooJoo Kim, JunYoung Kim, JaeHyung Lim, HwanJo Yu,
- Abstract要約: 逐次推薦者はスパースでノイズの多い歴史に苦しむことが多く、一般化は目に見えない相互作用に制限される。
そこで我々は, グラフト指向蒸留(GOD)を提案する。
GODは3つの実世界のデータセットで、最先端のベースラインを最大13.92%上回っている。
- 参考スコア(独自算出の注目度): 12.722528861651059
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sequential recommenders often struggle with sparse and noisy histories, limiting generalization to unseen interactions. Knowledge distillation mitigates this by transferring dense supervision from a teacher to a student. However, most distillation methods run teacher and student independently, then match student outputs or representations to the teacher. Such supervision entangles student-component effects, blurring whether weak generalization stems from unreliable embeddings, overfitted encoding, or co-adaptation to sparse histories. In this paper, we propose Graft-Oriented Distillation (GOD), a component-level distillation framework for improved generalization through grafting. Grafting denotes replacing selected frozen-teacher components with trainable student counterparts to build hybrid source models. GOD uses these hybrid models to evaluate student embeddings with the teacher encoder and the student encoder with teacher embeddings, providing component-level feedback. At inference, GOD uses only the student, incurring no additional cost. Across three real-world datasets, GOD outperforms state-of-the-art baselines by up to 13.92%.
- Abstract(参考訳): 逐次推薦者はスパースでノイズの多い歴史に苦しむことが多く、一般化は目に見えない相互作用に制限される。
知識蒸留は、教師から生徒に密集した監督を移すことによってこれを緩和する。
しかし、ほとんどの蒸留法は、教師と生徒を独立して実行し、生徒の出力や表現を教師にマッチさせる。
このような監督は、学生構成的効果を巻き込み、弱い一般化が信頼できない埋め込み、過度に適合したエンコーディング、あるいはスパース歴史への共適応に由来するかどうかを曖昧にする。
本稿では, グラフト指向蒸留(GOD)を提案する。
Graftingは、選択した凍結教師コンポーネントをトレーニング可能な学生コンポーネントに置き換えて、ハイブリッドソースモデルを構築することを意味する。
GODはこれらのハイブリッドモデルを用いて、教師エンコーダと教師エンコーダによる生徒の埋め込みを評価し、コンポーネントレベルのフィードバックを提供する。
推測では、GODは学生のみを使用し、追加費用は発生しない。
3つの実世界のデータセットで、GODは最先端のベースラインを最大13.92%上回っている。
関連論文リスト
- In Good GRACEs: Principled Teacher Selection for Knowledge Distillation [32.00881805808886]
本研究では,教師が学生モデルのポストトレーニングにどの程度効果的であるかを定量化するために,GRACEと呼ばれる軽量スコアを提案する。
GRACEは、検証者、教師のログ、教師の内部、テストデータにアクセスすることなく、生徒の勾配の分布特性を測定する。
論文 参考訳(メタデータ) (2025-11-04T18:58:47Z) - Learning from Stochastic Teacher Representations Using Student-Guided Knowledge Distillation [64.15918654558816]
教師表現のフィルタリングと重み付けのための自己蒸留(SSD)訓練戦略を導入し,タスク関連表現のみから抽出する。
UCR Archiveのウェアラブル/バイオサインデータセット、HARデータセット、画像分類データセットなどの実世界の感情コンピューティングに関する実験結果は、提案したSSD手法が最先端の手法より優れていることを示している。
論文 参考訳(メタデータ) (2025-04-19T14:08:56Z) - Improving Knowledge Distillation via Regularizing Feature Norm and
Direction [16.98806338782858]
知識蒸留(KD)は、大きな訓練されたモデル(例えば教師)を利用して、同じタスクのために同じデータセット上で小さな学生モデルを訓練する。
教師の特徴を知識として扱うこと、知識蒸留訓練の学生は、その特徴を教師の特徴と整合させることによって、例えば、ロジット間のKL偏差を最小化し、中間特徴間のL2距離を最小化する。
教師に対する生徒の特徴の整合性の向上は教師の知識をよりよく蒸留すると考えるのは自然なことだが、単にこの整合性を強制することは生徒のパフォーマンスに直接寄与しない。
論文 参考訳(メタデータ) (2023-05-26T15:05:19Z) - Exploring Content Relationships for Distilling Efficient GANs [69.86835014810714]
本稿では,過剰パラメータ生成逆数ネットワーク(GAN)に対処するコンテンツ関係蒸留(CRD)を提案する。
従来のインスタンスレベルの蒸留とは対照的に,教師出力の内容を細粒度にスライスすることで,新しいGAN圧縮指向の知識を設計する。
提案した内容レベルの蒸留をベースとして,オンライン教師識別器を配置し,教師生成器と共同訓練した場合の更新を継続し,生徒生成器と共同訓練した場合の凍結を継続し,より良い対人訓練を行う。
論文 参考訳(メタデータ) (2022-12-21T15:38:12Z) - Teacher's pet: understanding and mitigating biases in distillation [61.44867470297283]
いくつかの研究により、蒸留によって学生の全体的なパフォーマンスが著しく向上することが示されている。
しかし、これらのゲインはすべてのデータサブグループに均一なのでしょうか?
蒸留が特定の部分群の性能に悪影響を及ぼすことを示す。
信頼性の低いサブグループに対して,教師の影響を和らげる手法を提案する。
論文 参考訳(メタデータ) (2021-06-19T13:06:25Z) - Distilling a Powerful Student Model via Online Knowledge Distillation [158.68873654990895]
既存のオンライン知識蒸留アプローチは、最高のパフォーマンスを持つ学生を採用するか、より良い全体的なパフォーマンスのためのアンサンブルモデルを構築する。
本稿では,機能融合と自己蒸留という2つの要素からなるFFSDと呼ばれる新しいオンライン知識蒸留法を提案する。
論文 参考訳(メタデータ) (2021-03-26T13:54:24Z) - Distilling Object Detectors with Task Adaptive Regularization [97.52935611385179]
現在の最先端のオブジェクト検出器は高い計算コストを犠牲にしており、ローエンドデバイスへのデプロイが困難である。
より大規模な教師モデルから知識を伝達することで、より小さな学生ネットワークを訓練することを目的とした知識蒸留は、モデル小型化のための有望な解決策の1つである。
論文 参考訳(メタデータ) (2020-06-23T15:58:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。