論文の概要: PSG: Pair-Space Generation for Efficient Generative Reranking
- arxiv url: http://arxiv.org/abs/2607.26427v1
- Date: Wed, 29 Jul 2026 03:14:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.530364
- Title: PSG: Pair-Space Generation for Efficient Generative Reranking
- Title(参考訳): PSG: 効率的なジェネレーティブリグレードのためのペアスペース生成
- Abstract要約: Pair-Space Generation (PSG) は、個々のアイテムから順序付けられたアイテムペアへ生成原子を上昇させる改革である。
PSGは要求毎に$n(n-1)$のペア語彙で動作し、$L/2$トークンしか生成しない。
PSGはKuaishouにもデプロイされており、ユーザー当たりの滞在時間は0.178%アップしている。
- 参考スコア(独自算出の注目度): 11.29998075744073
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern recommender systems adopt Generator-Evaluator (G-E) for list-wise reranking: a generator produces sequences from candidates and an evaluator scores them at sequence-level to filter out the optimal one for exposure. Auto-Regressive(AR), working as the backbone for generative recommendation, suffers two limitations. First, its complexity grows linearly with list length, forcing the system to generate fewer lists under rigorous latency constraints and thus limiting exploration. Second, teacher-forcing creates a train-test mismatch; cumulative errors worsen with length and degrade quality. To address these problems, we propose Pair-Space Generation (PSG), a reformulation that elevates the generation atom from individual items to ordered item pairs. Given $n$ candidate items, PSG operates over pair vocabulary of size $n(n-1)$ per request, generates only $L/2$ tokens. Pair token representations are produced on-the-fly by a pretrained pair-token representation module optimized over large scale exposure logs, eliminating the data sparsity that would otherwise plague a quadratic sized vocabulary. We establish three theoretical guarantees: (i) PSG is bijective with item-space generation and induces an equivalent family of sequence distributions, thus incurring no loss of expressiveness; (ii) generation in pair-token space achieves approximately a $2\times$ to $4\times$ speedup theoretically under moderate settings and $1.83\times$ in the real industrial environmental settings; and (iii) under outcome-only rewards, the worst-case suboptimality of PSG is bounded by $O((L/2)^2 \barε)$, representing a nearly $4\times$ improvement over item-space generation. Beyond benchmark-based validation, PSG has also been deployed on Kuaishou, delivering a 0.178\% lift in per-user stay time on the platform, which serves over 400 million daily active users.
- Abstract(参考訳): ジェネレータは候補からシーケンスを生成し、評価器はそれらをシークエンスレベルでスコアし、露出のために最適な配列をフィルタリングする。
生成レコメンデーションのバックボーンとして機能するAuto-Regressive(AR)には2つの制限がある。
まず、その複雑さはリストの長さとともに線形に増加し、厳格なレイテンシ制約の下でより少ないリストを生成することを余儀なくされ、探索が制限される。
第二に、教師の強制は列車テストのミスマッチを発生させ、累積誤差は、長さと品質の低下によって悪化する。
これらの問題に対処するために,各項目から順序付けられた項目対への生成原子を増大させるPair-Space Generation (PSG)を提案する。
$n$候補アイテムが与えられた場合、PSGは要求毎に$n(n-1)$のペア語彙を演算し、たったの$L/2$トークンを生成する。
ペアトークン表現は、大規模な露光ログに最適化された事前訓練されたペアツーケン表現モジュールによってオンザフライで生成される。
我々は3つの理論的保証を確立する。
i)PSGは、アイテム空間の生成を伴う単射であり、配列分布の等価な族を誘導し、表現力の喪失は生じない。
(ii)ペアトーケンスペースの発電は、理論上は適度な設定で約2ドルから4ドル、実際の工業環境環境では1.83ドルというスピードアップを実現している。
(iii)結果のみの報酬の下では、PSGの最悪の部分最適性は$O((L/2)^2 \barε)$で制限され、アイテム空間の生成よりも約4\times$改善される。
ベンチマークベースの検証以外にも、PSGはKuaishouにもデプロイされており、ユーザ当たりの滞在時間は0.178\%アップし、毎日4億人以上のアクティブユーザが利用できる。
関連論文リスト
- Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems [67.04448659688579]
クエリ非依存の16エントリのコードブックを開発し、上位のデコード候補を1回のバッチフォワードパスでランク付けする。
反復検索がなく、テスト時にメッセージパッシングがないため、Codebook Agentは6つのベンチマークでもっとも正確な方法である。
論文 参考訳(メタデータ) (2026-09-02T08:10:22Z) - Representation Without Reward: A JEPA Audit for LLM Fine-Tuning [1.2691047660244335]
JEPA(Joint-embedding predictive Architectures)は、モデルが観測された出力よりも遅延表現を予測できるように訓練された時に、より有用な抽象化を学ぶべきであることを提案している。
自己回帰型言語モデルの微調整には、この原理はより厳密な要件を必要とする。
我々は、Llama-3.2-1B-Instruct LoRA を用いて、自然言語からレジェックス生成におけるその要件を検証した。
論文 参考訳(メタデータ) (2026-05-14T20:27:32Z) - GenRec: A Preference-Oriented Generative Framework for Large-Scale Recommendation [14.663434490160016]
我々は、JD App上にデプロイされた嗜好指向の生成フレームワークであるGenRecを紹介する。
月のオンラインA/Bテストでは、GenRecは9.5%のクリック数の改善と8.7%のトランザクション数を達成した。
論文 参考訳(メタデータ) (2026-04-16T11:07:05Z) - Self-Hinting Language Models Enhance Reinforcement Learning [37.311361929798714]
我々は、権限付き監督(SAGE)を備えた自己隠れ型GRPOを提案する。
SAGEはトレーニング中に特権付きヒントを注入し、同じ端末検証者報酬の下でロールアウト分布を再生成する。
3つのLSMを持つ6つのベンチマーク実験の結果、SAGEはGRPOを一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-03T05:56:20Z) - GReF: A Unified Generative Framework for Efficient Reranking via Ordered Multi-token Prediction [12.254397628788647]
ランク付けは、項目間のリスト内相関をモデル化する上で重要な役割を果たす。
最近の研究は2段階(ジェネレータ・評価器)パラダイムを踏襲している。
本稿では,2つの主要な課題に対処するため,GReF(Unified Generative Efficient Re rank Framework)を提案する。
論文 参考訳(メタデータ) (2025-10-29T06:54:42Z) - FedSVD: Adaptive Orthogonalization for Private Federated Learning with LoRA [68.44043212834204]
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
論文 参考訳(メタデータ) (2025-05-19T07:32:56Z) - Projection by Convolution: Optimal Sample Complexity for Reinforcement Learning in Continuous-Space MDPs [56.237917407785545]
本稿では,円滑なベルマン作用素を持つ連続空間マルコフ決定過程(MDP)の一般クラスにおいて,$varepsilon$-optimal Policyを学習する問題を考察する。
我々のソリューションの鍵となるのは、調和解析のアイデアに基づく新しい射影技術である。
我々の結果は、連続空間 MDP における2つの人気と矛盾する視点のギャップを埋めるものである。
論文 参考訳(メタデータ) (2024-05-10T09:58:47Z) - Federated Combinatorial Multi-Agent Multi-Armed Bandits [79.1700188160944]
本稿では,Banditを用いたオンライン最適化に適したフェデレーション学習フレームワークを提案する。
この設定では、エージェントのアームサブセットは、個々のアーム情報にアクセスせずにこれらのサブセットに対するノイズの多い報酬を観察し、特定の間隔で協力して情報を共有することができる。
論文 参考訳(メタデータ) (2024-05-09T17:40:09Z) - H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large
Language Models [110.06476624089679]
メモリフットプリントを大幅に削減する新しいKVキャッシュの実装手法を提案する。
我々のアプローチは、トークンのごく一部が、注意点の計算において、ほとんどの価値に寄与する、という観察に基づいている。
我々は,最近のトークンとH$のバランスを動的に保持するKVキャッシュ消去ポリシーであるヘビーヒッター(H$O)を提案する。
論文 参考訳(メタデータ) (2023-06-24T20:11:14Z) - $(\alpha_D,\alpha_G)$-GANs: Addressing GAN Training Instabilities via
Dual Objectives [7.493779672689531]
生成器(G)と識別器(D)に異なる値関数(対象物)を持つ2目的GANのクラスを導入する。
結果のゼロでない和ゲームは、$(alpha_D,alpha_G)$の適切な条件下での$f$-divergenceを最小化する。
合成2次元ガウス混合環とスタックドMNISTデータセットのトレーニング不安定性を緩和するために, チューニング $(alpha_D,alpha_G)$ の値を強調した。
論文 参考訳(メタデータ) (2023-02-28T05:22:54Z) - Projection-free Graph-based Classifier Learning using Gershgorin Disc
Perfect Alignment [59.87663954467815]
グラフベースのバイナリ学習では、既知のラベルのサブセット$hatx_i$を使って未知のラベルを推論する。
ラベルの$x_i$をバイナリ値に制限する場合、問題はNPハードである。
代わりに線形プログラム(LP)の列を解くことにより,高速なプロジェクションフリー手法を提案する。
論文 参考訳(メタデータ) (2021-06-03T07:22:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。