論文の概要: Intent-Driven Semantic ID Generation for Grounded Conversational News Recommendation
- arxiv url: http://arxiv.org/abs/2605.07613v1
- Date: Fri, 08 May 2026 11:43:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-11 19:43:39.019206
- Title: Intent-Driven Semantic ID Generation for Grounded Conversational News Recommendation
- Title(参考訳): ニュースレコメンデーションのためのインテント駆動型セマンティックID生成
- Authors: Hongyang Su, Beibei Kong, Lei Cheng, Chengxiang Zhuo, Zang Li, Chenyun Yu,
- Abstract要約: 我々は、Generate-then-Matchパラダイムの下で、インテント駆動セマンティックID(SID)生成を導入する。
現在のニュースプールにファジィ整合した階層的なSIDプレフィックスに、さまざまな意図をマッピングして、完全に根拠付けられたレコメンデーションを保証します。
メインストリームの中国のニュースプラットフォームでは、我々の7Bモデルは152Kのオープン世代のSID空間で0%の幻覚と12.4%のL1マッチを達成する。
- 参考スコア(独自算出の注目度): 9.321036338096269
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Conversational news recommendation requires grounding each suggestion in a rapidly evolving article corpus while addressing implicit user intents that lack explicit retrievable keywords. To characterize this scenario, we identify 6 intent types from production dialogues: five are implicit and pose fundamental challenges to standard RAG pipelines, forming a critical retrieve-first bottleneck. To address these issues, we introduce intent-driven Semantic ID (SID) generation under a Generate-then-Match paradigm. With two-stage training that consists of multi-task SID alignment and GPT-4 Chain-of-Thought distillation, an LLM maps diverse intents to hierarchical SID prefixes, which are then fuzzy-matched to the current news pool to guarantee fully grounded recommendations. Profile-Aware Dual-Signal Reasoning (PADR) further enables cold-start users to obtain valid recommendations using only profiles. On a mainstream Chinese news platform, our 7B model achieves 0% hallucination and 12.4% L1 match in the 152K open-generation SID space (4x random baseline). It matches GPT-4+Hybrid RAG on L1 while surpassing it on finer-grained metrics (L2 2x, Category +1.2pp) at ~100x lower cost. Cold-start users, where existing baselines score 0%, achieve 18.0% L1 (6x random), the highest among all user groups.
- Abstract(参考訳): 会話的なニュースレコメンデーションでは、各提案を急速に進化する記事コーパスに根拠付け、明示的な検索可能なキーワードを欠いた暗黙のユーザー意図に対処する必要がある。
5つは暗黙的であり、標準的なRAGパイプラインに根本的な課題を生じさせ、重要な検索優先ボトルネックを形成します。
これらの問題に対処するために、Generate-then-Matchパラダイムの下で意図駆動型セマンティックID(SID)生成を導入する。
マルチタスクのSIDアライメントとGPT-4のChain-of-Thought蒸留からなる2段階のトレーニングにより、LLMは階層的なSIDプレフィックスに様々な意図をマッピングし、現在のニュースプールにファジィ整合して完全に根拠づけられたレコメンデーションを保証する。
Profile-Aware Dual-Signal Reasoning (PADR)により、コールドスタートユーザはプロファイルのみを使用して有効なレコメンデーションを取得できる。
主要な中国のニュースプラットフォームでは、我々の7Bモデルは152KのオープンジェネレーションSID空間(ランダムベースライン4倍)において、0%の幻覚と12.4%のL1マッチを達成する。
L1上のGPT-4+Hybrid RAGと一致し、よりきめ細かい測定値(L2 2x, Category +1.2pp)を約100倍のコストで上回る。
既存のベースラインスコア0%のコールドスタートユーザは、18.0% L1 (6倍ランダム)を獲得し、全ユーザグループの中で最高である。
関連論文リスト
- CapsID: Soft-Routed Variable-Length Semantic IDs for Generative Recommendation [6.439016735163573]
生成レコメンデーションは、各項目をセマンティックID(SID)のシーケンスにマッピングし、検索を自己回帰トークン生成として再キャストする。
CAPSIDは硬質残留量子化をカプセルルーティングに置き換える。
Amazon Beauty, Sports, Toys, and a 35M-item industrial catalogでは、CAPSID+SEMANTICBPEはReSIDよりも平均して10.6%改善している。
論文 参考訳(メタデータ) (2026-05-06T16:33:13Z) - GenRec: A Preference-Oriented Generative Framework for Large-Scale Recommendation [14.663434490160016]
我々は、JD App上にデプロイされた嗜好指向の生成フレームワークであるGenRecを紹介する。
月のオンラインA/Bテストでは、GenRecは9.5%のクリック数の改善と8.7%のトランザクション数を達成した。
論文 参考訳(メタデータ) (2026-04-16T11:07:05Z) - Dynamic Context Evolution for Scalable Synthetic Data Generation [0.0]
大規模言語モデルは、多くのバッチで独立して繰り返し出力を生成する。
3つのメカニズムからなる動的コンテキスト進化(DCE)を紹介する。
DCEは、メモリ状態と回転多様性戦略を使用して、各バッチの生成プロンプトを再構築する。
論文 参考訳(メタデータ) (2026-04-08T14:38:11Z) - End-to-End Semantic ID Generation for Generative Advertisement Recommendation [33.453121305193434]
生成広告推薦のための統一SID生成フレームワークを提案する。
具体的には、生の広告データからエンドツーエンドで埋め込みとSIDを協調的に最適化する。
実験により、UniSIDは最先端のSID生成方法よりも一貫して優れていることが示された。
論文 参考訳(メタデータ) (2026-02-11T02:38:26Z) - Differentiable Semantic ID for Generative Recommendation [65.83703273297492]
生成的推薦は、各項目がリッチコンテンツから学習された個別意味ID(SID)によって表現される新しいパラダイムを提供する。
実際には、SIDはレコメンデーションの正確さよりもコンテンツ再構成に最適化されるのが一般的である。
自然なアプローチは、セマンティックインデックスを差別化して、レコメンデーショングラデーションが直接SID学習に影響を与えるようにすることだ。
本稿では,ジェネレーティブレコメンデーションのための効果的な識別可能なセマンティックIDに向けた第一歩として,DIGERを提案する。
論文 参考訳(メタデータ) (2026-01-27T15:34:11Z) - Towards Global Retrieval Augmented Generation: A Benchmark for Corpus-Level Reasoning [50.27838512822097]
我々は,グローバルRAG機能を評価するために設計された最初のベンチマークであるGlobalQAを紹介する。
我々は,チャンクレベルの検索によって構造的コヒーレンスを保存するマルチツール協調フレームワークであるGlobalRAGを提案する。
Qwen2.5-14Bモデルでは、GlobalRAGは最強のベースラインである1.51 F1と比較して6.63 F1を達成した。
論文 参考訳(メタデータ) (2025-10-30T07:29:14Z) - DiffGRM: Diffusion-based Generative Recommendation Model [63.35379395455103]
ジェネレーティブレコメンデーション(GR)は、トークン化器を介して各項目をn桁のセマンティックID(SID)として表現する新興パラダイムである。
自己回帰デコーダをマスク付き離散拡散モデル(MDM)に置き換える拡散ベースGRモデルDiffGRMを提案する。
実験では、複数のデータセットに対する強力な生成的および差別的推奨ベースラインよりも一貫した利得を示す。
論文 参考訳(メタデータ) (2025-10-21T03:23:32Z) - FORGE: Forming Semantic Identifiers for Generative Retrieval in Industrial Datasets [64.51403245281547]
FORGEは、産業データセットを使ったジェネレーティブrEtrievalにおけるFOrmingセマンティック識別のベンチマークである。
現実世界のアプリケーションでは、オンラインコンバージェンスを半減するオフライン事前トレーニングスキーマが導入されている。
論文 参考訳(メタデータ) (2025-09-25T08:44:22Z) - Recommender Systems with Generative Retrieval [58.454606442670034]
本稿では,対象候補の識別子を自己回帰的に復号する新たな生成検索手法を提案する。
そのために、各項目のセマンティックIDとして機能するために、意味論的に意味のあるコードワードを作成します。
提案手法を用いて学習した推薦システムは,様々なデータセット上での現在のSOTAモデルよりも大幅に優れていることを示す。
論文 参考訳(メタデータ) (2023-05-08T21:48:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。