論文の概要: DEGR: Dual Exploration-Driven Generative Re-Ranking for Adaptive Cross-Request Context Bridging
- arxiv url: http://arxiv.org/abs/2608.04809v1
- Date: Wed, 05 Aug 2026 13:14:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.934801
- Title: DEGR: Dual Exploration-Driven Generative Re-Ranking for Adaptive Cross-Request Context Bridging
- Title(参考訳): DEGR: 適応型クロスリクエストコンテキストブリッジのためのデュアル探索駆動ジェネレーティブリランキング
- Authors: Binglei Zhao, Xuanhua Yang, Xiwei Zhao, Sulong Xu,
- Abstract要約: 本稿では,産業レコメンデーションシステムのためのDual Exploration-Driven Generative Re-Ranking(DEGR)手法を提案する。
実験では、DEGRはSOTA法よりも優れており、JD Eコマースレコメンデーションシステムにおいて最大1.22%のUCTRと0.20%のPVの改善を実現している。
- 参考スコア(独自算出の注目度): 7.797900623517651
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In industrial recommendation systems, the re-ranking stage balances business objectives and diversity for sequence-level optimization while modeling contextual information. However, constrained by fixed upstream supply, existing methods fail to deliver further effectiveness gains, especially under low-quality supply. To overcome this, re-ranking can actively balance immediate and exploratory value, for instance, by prioritizing exploratory exposure under low-quality supply to preserve browsing potential and facilitate serendipitous conversions. Therefore, we propose a Dual Exploration-Driven Generative Re-Ranking (DEGR) method. DEGR adopts a hybrid supervised-reinforcement exploration and optimization paradigm, guided by an exploratory reward model that adaptively balances immediate and exploratory value. The hybrid optimization paradigm integrates three key components: supervised learning, exploration diversity constraint, and adaptive reward-weighted ORPO for preference optimization. Through this dual exploration, the generator ultimately acts as an adaptive cross-request contextual bridge. Offline and online experiments indicate that DEGR outperforms SOTA methods, achieving improvements of up to 1.22% UCTR and 0.20% PV in the JD E-commerce recommendation system.
- Abstract(参考訳): 産業レコメンデーションシステムでは、コンテキスト情報をモデル化しながらシーケンスレベルの最適化のために、ビジネス目標と多様性のバランスを取る。
しかし、上流の固定供給に制約されるため、既存の方法は特に低品質の供給下では、さらなる効果を得られない。
これを解決するために、例えば、低品質の供給下で探索的露光を優先し、閲覧可能性を維持し、セレンディピティーな変換を促進することで、即時および探索的価値を積極的にバランスさせることができる。
そこで我々は,Dual Exploration-Driven Generative Re-Ranking (DEGR)法を提案する。
DEGRは、即時と探索的な価値を適応的にバランスする探索的報酬モデルによって導かれる、ハイブリッドな教師付き強化探索と最適化のパラダイムを採用する。
ハイブリッド最適化パラダイムは、教師付き学習、探索的多様性制約、優先最適化のための適応的な報酬重み付けORPOの3つの重要な要素を統合している。
この二重探索を通じて、ジェネレータは最終的に適応的な相互要求コンテキストブリッジとして機能する。
オフラインおよびオンライン実験は、DEGRがSOTA法より優れており、JD Eコマースレコメンデーションシステムにおいて最大1.22%のUCTRと0.20%のPVの改善を実現していることを示している。
関連論文リスト
- Pareto-Guided Optimal Transport for Multi-Reward Alignment [59.776579791864805]
我々は、不均一な報酬上限の下で、統一されたグローバルターゲットに対して最適化する方法を示す。
我々は、様々な報酬信号特性に合わせたオンラインとオフラインの最適化戦略を開発した。
提案手法は, 関節支配率(JDR)が11%向上し, 人体評価において約80%の勝利率を達成した。
論文 参考訳(メタデータ) (2026-05-13T08:19:48Z) - AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization [47.39648302477585]
ストリーミング自動回帰(AR)ビデオジェネレータと数段蒸留を組み合わせることで、低レイテンシで高品質な合成を実現する。
本稿では,ストリーミングAR生成に対するNighbor GRPOのコントラスト的視点を適応させるフレームワークであるAR-CoPOを提案する。
論文 参考訳(メタデータ) (2026-03-18T08:07:01Z) - Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration [49.9937230730202]
本稿では,新たなアクター・リファイナ・コラボレーション・フレームワークであるSearch-R2を提案する。
提案手法は,生成過程をアクターに分解し,最初の推論軌道を生成する。
本稿では,検索-R2がモデルスケール全体にわたって強力なRAGとRLベースのベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-02-03T15:32:09Z) - SCASRec: A Self-Correcting and Auto-Stopping Model for Generative Route List Recommendation [21.36279838596394]
ルートレコメンデーションシステムは、高品質な順序付きレコメンデーションを生成するために、微調整と再ランクを含む多段階パイプラインを採用するのが一般的である。
ランク付けと冗長性排除を1つのエンドツーエンドプロセスに統合する統合生成フレームワークであるSCASRecを提案する。
SCASRecは、ハードサンプルに焦点を当ててリストワイズ改善をガイドするステップワイズ補正報酬(SCR)を導入し、学習可能なエンド・オブ・レコメンデーション(EOR)トークンを使用して、さらなる改善が期待されない場合に生成を適応的に終了する。
論文 参考訳(メタデータ) (2026-02-03T09:51:58Z) - GARDO: Reinforcing Diffusion Models without Reward Hacking [54.841464430913476]
オンライン強化学習(RL)による微調整拡散モデルにより,テキストと画像のアライメントが向上する可能性が示された。
このミスマッチは、しばしば報酬のハッキングにつながり、プロキシスコアは増加し、実際の画像品質は低下し、生成の多様性は崩壊する。
我々は、サンプル効率、効率的な探索、報酬ハッキングの軽減という競合する要求に対処するため、Gated and Adaptive Regularization with Diversity-Aware Optimization (GARDO)を提案する。
論文 参考訳(メタデータ) (2025-12-30T10:55:45Z) - Adaptive Divergence Regularized Policy Optimization for Fine-tuning Generative Models [31.470613363668672]
Adaptive Divergence Regularized Policy Optimization (Adaptive Divergence Regularized Policy Optimization) は、有利な推定値に基づいて正規化強度を自動的に調整する。
We implementation with Wasserstein-2 regularization for flow matching generative model is achieved great results on text-to-image generation。
ADRPOはテキストのみのLLMとマルチモーダル推論モデルの両方をKL規則化された微調整に一般化する。
論文 参考訳(メタデータ) (2025-10-20T19:46:02Z) - RGE-GS: Reward-Guided Expansive Driving Scene Reconstruction via Diffusion Priors [54.81109375939306]
RGE-GSは、拡散に基づく生成と報酬誘導ガウス積分を相乗化する新しい拡張的再構築フレームワークである。
本稿では,復元フェーズに先立って一貫したパターンを識別・優先順位付けする報奨ネットワークを提案する。
復元過程において,シーン収束度に応じてガウス最適化の進捗を自動的に調整する学習戦略を考案した。
論文 参考訳(メタデータ) (2025-06-28T08:02:54Z) - Killing Two Birds with One Stone: Unifying Retrieval and Ranking with a Single Generative Recommendation Model [71.45491434257106]
Unified Generative Recommendation Framework (UniGRF)は、検索とランキングを単一の生成モデルに統合する新しいアプローチである。
ステージ間コラボレーションを強化するため、UniGRFはランキング駆動エンハンサーモジュールを導入した。
UniGRFは、ベンチマークデータセット上で既存のモデルよりも大幅に優れています。
論文 参考訳(メタデータ) (2025-04-23T06:43:54Z) - A RankNet-Inspired Surrogate-Assisted Hybrid Metaheuristic for Expensive Coverage Optimization [5.757318591302855]
大規模カバレッジ最適化タスクを処理するために,RangeNetによるSurrogate支援ハイブリッドメタヒューリスティックを提案する。
我々のアルゴリズムは、EMVOPの最先端アルゴリズムを一貫して上回っている。
論文 参考訳(メタデータ) (2025-01-13T14:49:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。