論文の概要: FOSTER: First-order Dataset Distillation for Text-based Sequential Recommendation
- arxiv url: http://arxiv.org/abs/2605.30772v1
- Date: Fri, 29 May 2026 03:00:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.354415
- Title: FOSTER: First-order Dataset Distillation for Text-based Sequential Recommendation
- Title(参考訳): FOSTER:テキストベースのシークエンシャルレコメンデーションのための1次データセット蒸留
- Abstract要約: 離散アイテムの大きなプールを考えると、一階データセット蒸留は非自明である。
FOSTERは、既存のデータセット蒸留とコアセット選択ベースラインを一貫して上回る。
- 参考スコア(独自算出の注目度): 33.97925620107937
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-based sequential recommender systems, while greatly improving recommendation accuracy by incorporating item contexts, are undeniably more expensive to train. By condensing a large dataset into a compact set of synthetic samples for model training, dataset distillation offers a promising solution. However, its adoption in text-based sequential recommendation is non-trivial given the large pool of discrete items. This challenge is further compounded by language model-based item encoding, which makes bi-level optimization commonly used in dataset distillation prohibitively expensive. To this end, we propose First-order dataset distillation for Text-based Sequential Recommendation (FOSTER), which facilitates effectiveness and efficiency via three novel components: (1) stochastic item subset sampling that replaces costly full-corpus embedding extraction at each distillation step; (2) first-order optimization with trajectory-anchored parameter reset to avoid expensive bi-level gradient computation; and (3) regularization that explicitly promotes co-occurrence between semantically similar items in the synthetic sequences. Extensive experiments on three benchmarks show that FOSTER consistently outperforms existing dataset distillation and coreset selection baselines, approximating full-dataset performance using as few as 20 synthetic interaction sequences.
- Abstract(参考訳): テキストベースのシーケンシャルレコメンデータシステムは、アイテムコンテキストを組み込むことで推奨精度を大幅に向上する一方で、トレーニングに要するコストは明らかに高い。
大きなデータセットをモデルトレーニング用のコンパクトな合成サンプルに凝縮することで、データセット蒸留は有望な解決策を提供する。
しかし、テキストベースのシーケンシャルレコメンデーションへの採用は、離散アイテムの大量プールを考えると、簡単ではない。
この課題は、言語モデルに基づくアイテムエンコーディングによってさらに複雑化されており、データセットの蒸留で一般的に使用される二段階最適化は、非常に高価である。
そこで本研究では, テキストベースの逐次推薦法(FOSTER)の1次データセット蒸留法を提案し, その有効性と効率性を両立させる。(1) 高コストな全体埋込み抽出を各蒸留工程で置き換える確率的アイテムサブセットサンプリング, (2)高コストな2段階勾配計算を避けるためにトラジェクトリアンコールパラメータリセットによる一次最適化, (3) 合成シーケンスにおける意味論的類似項目間の共起を明示的に促進する正規化である。
3つのベンチマークの大規模な実験により、FOSTERは既存のデータセット蒸留とコアセット選択ベースラインを一貫して上回り、20の合成相互作用シーケンスでフルデータセットのパフォーマンスを近似していることが示された。
関連論文リスト
- Pool-Select-Refine: Allocation-Aware Generative Dataset Distillation with Soft-Label-Guided Latent Refinement [2.407317612563673]
本稿では,アロケーションアウェアな生成データセット蒸留のための2段階フレームワークを提案する。
まず、オーバーコンプリート候補プールを構築し、目標予算の下でコンパクトなサブセットを選択する。
第2に,教師モデルから抽出したソフトラベル指導を用いて,潜時空間で選択したサンプルを精査する。
論文 参考訳(メタデータ) (2026-06-01T08:56:47Z) - SAS: Semantic-aware Sampling for Generative Dataset Distillation [55.27114962330541]
本稿では,コントラスト言語-画像事前学習(CLIP)をポストサンプリングのセマンティクスとして活用することで,データセット蒸留のセマンティック・アウェア・パースペクティブを導入する。
我々のゴールは、コンパクトであるだけでなく、意味的にクラス差別的で多様である蒸留データセットを得ることです。
論文 参考訳(メタデータ) (2026-05-18T08:05:46Z) - TD3: Tucker Decomposition Based Dataset Distillation Method for Sequential Recommendation [50.23504065567638]
本稿では,メタラーニングフレームワークにおける textbfDataset textbfDistillation 手法である textbfTD3 を紹介する。
TD3は、オリジナルのデータから完全に表現力のある合成配列の要約を蒸留する。
拡張技術により、学習者は合成要約を忠実に適合させ、アンプループでの正確な更新を確実にすることができる。
論文 参考訳(メタデータ) (2025-02-05T03:13:25Z) - Dataset Distillation as Pushforward Optimal Quantization [2.5892916589735457]
そこで本研究では,実データ上での学習に類似した性能を,桁違いに少ない計算量で実現した合成トレーニングセットを提案する。
特に、既存の非絡み合ったデータセット蒸留法を古典的最適量子化とワッサーシュタインのバリセンタ問題にリンクする。
我々は,ImageNet-1Kデータセットの性能向上とモデル間一般化を,より簡単な追加計算で実現し,より高階のイメージ・パー・クラス・セッティングにおけるSOTA性能を向上する。
論文 参考訳(メタデータ) (2025-01-13T20:41:52Z) - Embarassingly Simple Dataset Distillation [0.0]
本研究は, 2段階最適化問題として直接扱うことにより, その中核におけるデータセットの蒸留に取り組む。
蒸留されたデータの性質を深く掘り下げると、相互相関が明らかになる。
異なるデータ予算にまたがって、ほぼ最適性能のサブセットを含む蒸留データセットを生成するブーピング機構を考案する。
論文 参考訳(メタデータ) (2023-11-13T02:14:54Z) - Sequential Subset Matching for Dataset Distillation [44.322842898670565]
我々はSeqMatch(Sequential Subset Matching)と呼ばれる新しいデータセット蒸留戦略を提案する。
解析の結果,SeqMatchは合成インスタンスを逐次生成することで,結合問題に効果的に対処できることが示唆された。
私たちのコードはhttps://github.com/shqii1j/seqmatch.comから入手可能です。
論文 参考訳(メタデータ) (2023-11-02T19:49:11Z) - Data Distillation Can Be Like Vodka: Distilling More Times For Better
Quality [78.6359306550245]
蒸留に1つの合成部分集合を用いるだけでは最適な一般化性能は得られない。
PDDは複数の小さな合成画像集合を合成し、それぞれ前の集合に条件付けし、これらの部分集合の累積和でモデルを訓練する。
実験の結果, PDDは既存のデータセット蒸留法の性能を最大4.3%向上させることができることがわかった。
論文 参考訳(メタデータ) (2023-10-10T20:04:44Z) - Improved Distribution Matching for Dataset Condensation [91.55972945798531]
本稿では,分布マッチングに基づく新しいデータセット凝縮法を提案する。
提案手法は,計算資源の少ない従来の最適化指向手法よりも優れている。
論文 参考訳(メタデータ) (2023-07-19T04:07:33Z) - A Well-Composed Text is Half Done! Composition Sampling for Diverse
Conditional Generation [79.98319703471596]
高品質の条件付き生成のための多種多様な出力を生成するための簡易で効果的な合成サンプリング法であるコンポジションサンプリングを提案する。
これは最近提案された計画ベースのニューラルジェネレーションモデルに基づいて構築され、まず最初に出力の合成を作成し、それと入力を条件付けして生成するように訓練される。
論文 参考訳(メタデータ) (2022-03-28T21:24:03Z) - Deep Shells: Unsupervised Shape Correspondence with Optimal Transport [52.646396621449]
本稿では,3次元形状対応のための教師なし学習手法を提案する。
提案手法は,複数のデータセット上での最先端技術よりも大幅に改善されていることを示す。
論文 参考訳(メタデータ) (2020-10-28T22:24:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。