論文の概要: RoleMix: Unifying Sequential and Non-Sequential Features via Semantic Tokenization for Post-Click Conversion Rate Prediction
- arxiv url: http://arxiv.org/abs/2607.22700v1
- Date: Sat, 18 Jul 2026 15:44:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.830203
- Title: RoleMix: Unifying Sequential and Non-Sequential Features via Semantic Tokenization for Post-Click Conversion Rate Prediction
- Title(参考訳): RoleMix: クリック後変換率予測のための意味的トークン化による逐次的・非逐次的特徴の統合
- Abstract要約: RoleMixは、共有されたロール保存トークンインターフェースを通じて、シーケンシャルかつ非シーケンシャルなエビデンスを表す。
大規模なKDDカップ2026 Tencent UniRec Challengeでは、RoleMixは83.648%のオンラインAUCを達成し、公式産業ベースラインを1.953%上回っている。
- 参考スコア(独自算出の注目度): 1.6050320174037502
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Post-click conversion rate (PCVR) prediction is central to industrial recommendation, but remains challenged by the structural mismatch between sparse, unordered multi-field features and long, domain-specific behavior histories. Existing models often process these signals through separate pathways and fuse them late, weakening semantic roles and limiting cross-signal refinement. We propose RoleMix, a unified interaction architecture that represents sequential and non-sequential evidence through a shared, role-preserving token interface. Non-sequential fields are converted into explicit semantic tokens that preserve user, item, pairwise, dense, contextual, and cross-feature roles, while long behavior domains are compressed into item- and context-aware sequence-query tokens through two-stage hierarchical window attention. The resulting global, semantic, and sequence-query tokens are jointly refined by stacked UniMixing-Lite blocks for PCVR prediction. On the large-scale KDD Cup 2026 Tencent UniRec Challenge, RoleMix achieves 83.648% online AUC, outperforming the official industrial baseline by 1.953%. Ablation studies show that semantic tokenization yields the largest isolated gain, highlighting a key principle for large-scale PCVR modeling: preserving field semantics at the token-interface level is as important as scaling the interaction backbone.
- Abstract(参考訳): ポストクリック変換率(PCVR)の予測は、産業的な推奨の中心であるが、スパース、非秩序なマルチフィールド特徴と長いドメイン固有の行動履歴の間の構造的ミスマッチによって、依然として挑戦されている。
既存のモデルは、しばしばこれらの信号を別々の経路で処理し、それらを遅く融合させ、意味的役割を弱め、信号間の洗練を制限する。
共有されたロール保存トークンインタフェースを通じて、シーケンシャルかつ非シーケンシャルな証拠を表す統一された相互作用アーキテクチャであるRoleMixを提案する。
非シーケンスフィールドは、ユーザ、アイテム、ペア、密集、コンテキスト、およびクロスフィーチャーロールを保持する明示的なセマンティックトークンに変換される。
結果として得られるグローバル、セマンティック、シーケンスクエリトークンは、PCVR予測のために積み重ねられたUniMixing-Liteブロックによって共同で洗練される。
大規模なKDDカップ2026 Tencent UniRec Challengeでは、RoleMixは83.648%のオンラインAUCを達成し、公式産業ベースラインを1.953%上回った。
アブレーション研究は、意味的トークン化が最大の孤立した利益をもたらすことを示しており、大規模なPCVRモデリングの鍵となる原則を強調している。
関連論文リスト
- Accelerating Unified Multimodal Models with Core-Expansion Routing and Unified Computation Scheduling [61.28599393707943]
統一マルチモーダルモデルは、理解と生成を共同でサポートするが、トークン、レイヤ、生成タイムステップ間でかなりの冗長な計算を行う。
本稿では,タスク共有型コアスコアラと進行条件付き生成拡張を提案し,生成分解とクロスタスクコアアライメントを最適化した。
2つの代表的UMMアーキテクチャの実験では、両タスク間で一貫した品質改善が示され、98.03%の高密度な理解性能を維持し、エンドツーエンドの推論速度は1.93times$である。
論文 参考訳(メタデータ) (2026-08-29T14:27:55Z) - Topology-Masked Unified Backbone for Joint Feature Interaction and Multi-Domain Sequence Modeling [8.950162084237288]
MaskRecは、機能相互作用とマルチドメインシーケンスモデリングのための、トポロジにマッピングされた統一トークンインタラクションアーキテクチャである。
この統一トークン空間に基づいて、MaskRecは構造化されたアテンションマスクであるTopoMaskを設計し、アテンション接続を選択的に有効またはブロックする。
MaskRecは、産業用CVR予測のための統一フレームワークの有効性を検証し、公式ベースラインよりも安定した改善を実現している。
論文 参考訳(メタデータ) (2026-08-27T11:49:55Z) - UniDot: A Unified Network for Sequence Modeling and Feature Interaction in Large-scale Recommendation [3.59042069607434]
ファクトリゼーション・マシンの観点から構築されたポストクリック変換予測のための新しいアーキテクチャであるUniDotを提案する。
トークンの単一のドット積は、機能の相互作用とシーケンスモデリングの両方を基盤にすることができる。
ユニドットは、TAAC KDDカップ2026のインダストリアルトラックで優勝した。
論文 参考訳(メタデータ) (2026-08-17T16:52:56Z) - STAR: Structured Tokenization and Target-Aware Interest Representation for PCVR Prediction [7.574291100593417]
我々は,KDDカップ2026 Tencent UniRec Challengeの枠組みであるSTAR(Structured Tokenization and Target-Aware Interest Representation)を紹介する。
STARはHyFormerスタイルのマルチシーケンスバックボーン上に、構造化された特徴トークン化とターゲット認識された関心表現を組み合わせる。
課題データセットの実験では、ランキングAUCを最も確実に改善するコンポーネントを特定し、LogLossは校正診断として報告されている。
論文 参考訳(メタデータ) (2026-08-13T09:09:54Z) - SITA: Semantic Interest Tokens for Target-Aware Compression in Long-Sequence Recommendation [69.02976266748193]
提案するTextbfSITAは,長期的推薦のための圧縮フレームワークである。
SITAは、対象固有のユーザ表現を構築するために、対応する構造化された関心を適応的に集約する。
公開データセットと大規模産業データセットの実験は、SITAが代表的ベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-08-04T13:59:44Z) - Drift-Aware Continual Tokenization for Generative Recommendation [44.13013639783267]
生成レコメンデーションは通常、2段階のパイプラインを採用し、学習可能なトークンエーザがアイテムを個別のトークンシーケンスにマップする。
最近のトークン化器は、類似のユーザビヘイビアパターンを持つアイテムが同様のコードを受け取るように、協調的な信号も取り入れている。
新しいアイテムは衝突やシフトを引き起こし、新しいインタラクションは既存のアイテムの協調的なドリフトを引き起こす。
DACT, Drift-Aware Continual Tokenization framework with two stage: tokenizer fine-tuning and item-level drift confidence。
論文 参考訳(メタデータ) (2026-03-31T13:02:47Z) - HyFormer: Revisiting the Roles of Sequence Modeling and Feature Interaction in CTR Prediction [8.97787361529607]
本稿では,HyFormerについて述べる。HyFormerは1つのバックボーンに長周期モデリングと特徴相互作用を密に統合するハイブリッドトランスフォーマーアーキテクチャである。
数十億の産業データセットに関する実験は、HyFormerが強いLONGERとRanMixerのベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-01-19T02:55:05Z) - MergeDNA: Context-aware Genome Modeling with Dynamic Tokenization through Token Merging [65.07273789940116]
本稿では,動的ゲノミクストークンと潜在トランスフォーマーをコンテキスト対応事前学習タスクで協調的に最適化する階層型アーキテクチャを提案する。
MergeDNAは3つの人気のあるDNAベンチマークと、微調整やゼロショット評価を伴う複数のマルチオミクスタスクにおいて優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-11-17T19:27:41Z) - Practice on Long Behavior Sequence Modeling in Tencent Advertising [75.65309022911994]
時系列モデリングは,ユーザの長期的嗜好を捉えるためのレコメンデーションシステムにおいて,欠かせないフロンティアとなっている。
長周期モデリングのための2段階フレームワークの実践的アプローチをいくつか提案する。
Tencentの大規模広告プラットフォーム上で本番環境にデプロイされた当社のイノベーションは、大幅なパフォーマンス向上を実現しました。
論文 参考訳(メタデータ) (2025-09-10T06:55:57Z) - Beyond BEV: Optimizing Point-Level Tokens for Collaborative Perception [17.654858416126093]
協調的知覚により、エージェントは中間的特徴を交換することで知覚能力を高めることができる。
既存の手法は通常、これらの中間機能を2D Bird's-eye-view (BEV)表現として整理する。
ポイントレベル最適化トークンを利用した新しい協調認識フレームワークであるCoPLOTを提案する。
論文 参考訳(メタデータ) (2025-08-27T07:27:42Z) - CTR-Sink: Attention Sink for Language Models in Click-Through Rate Prediction [42.92011330807996]
$textitCTR-Sink$は、レコメンデーションシナリオに適した振る舞いレベルの注意シンクを導入した、新しいフレームワークである。
注意シンク理論にヒントを得て、注意集中シンクを構築し、外部情報を介して注意集約を動的に制御する。
論文 参考訳(メタデータ) (2025-08-05T17:30:34Z) - Multi-granularity Interest Retrieval and Refinement Network for Long-Term User Behavior Modeling in CTR Prediction [68.90783662117936]
クリックスルーレート(CTR)の予測は、オンラインパーソナライズプラットフォームにとって不可欠である。
近年の進歩は、リッチなユーザの振る舞いをモデル化することで、CTR予測の性能を大幅に改善できることを示している。
マルチグラニュラリティ興味検索ネットワーク(MIRRN)を提案する。
論文 参考訳(メタデータ) (2024-11-22T15:29:05Z) - Object Segmentation by Mining Cross-Modal Semantics [68.88086621181628]
マルチモーダル特徴の融合と復号を導くために,クロスモーダル・セマンティックスをマイニングする手法を提案する。
具体的には,(1)全周減衰核融合(AF),(2)粗大デコーダ(CFD),(3)多層自己超越からなる新しいネットワークXMSNetを提案する。
論文 参考訳(メタデータ) (2023-05-17T14:30:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。