論文の概要: DMRL: Document-Mediated Reinforcement Learning for Skill Optimization in Advertising Recommendation
- arxiv url: http://arxiv.org/abs/2609.02170v1
- Date: Wed, 02 Sep 2026 06:32:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.106893
- Title: DMRL: Document-Mediated Reinforcement Learning for Skill Optimization in Advertising Recommendation
- Title(参考訳): DMRL: 推薦広告におけるスキル最適化のための文書媒介強化学習
- Abstract要約: Document-Mediated Reinforcement Learning (DMRL)は、構造化された編集アクションのシーケンスとして、スキルドキュメントの最適化をモデル化するスキル自己進化フレームワークである。
DMRLは大規模なショートビデオ広告プラットフォームにデプロイされ、広範な経験的評価により、主要な広告指標全体で最先端のベースラインを上回っている。
- 参考スコア(独自算出の注目度): 18.143707250252927
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Advertising recommendation requires continuously tuning complex system parameters while balancing commercial returns and user experience. Recent work has introduced large language models (LLMs) with skill documents to assist this labor-intensive process, but skill optimization remains largely prompt-driven, lacking a principled mechanism to attribute rewards to specific document edits. To address this limitation, we propose Document-Mediated Reinforcement Learning (DMRL), a skill self-evolution framework that models skill document optimization as a sequence of structured editing actions. In DMRL, an upper-level agent performs controlled document edits, while a frozen lower-level task agent evaluates their effects through A/B testing. To address credit assignment and long-term outcomes, we introduce two key components: (1) Dual-Relative Policy Optimization (DRPO), a post-training policy optimization method for robust and risk-aware advantage estimation; and (2) Long-term Reward Predictor (LRP), which estimates long-term outcomes by modeling population heterogeneity with disentangled representation learning and cross-attention transfer. DMRL was deployed on a large-scale short-video ads platform and extensive empirical evaluation shows that DMRL outperforms state-of-the-art baselines across key advertising metrics
- Abstract(参考訳): 広告レコメンデーションには、商業リターンとユーザエクスペリエンスのバランスをとりながら、複雑なシステムパラメータを継続的にチューニングする必要がある。
最近の研究は、この労働集約的なプロセスを支援するために、大きな言語モデル(LLM)を導入しているが、スキルの最適化は、主に即時駆動であり、特定の文書編集に報酬を付与する原則的なメカニズムが欠如している。
この制限に対処するために、構造化編集行動のシーケンスとしてスキル文書最適化をモデル化するスキル自己進化フレームワークであるDocument-Mediated Reinforcement Learning (DMRL)を提案する。
DMRLでは、上層エージェントが制御された文書編集を行い、凍結された下層タスクエージェントがA/Bテストによりその効果を評価する。
信用割当と長期的成果に対処するため,(1)頑健でリスクに配慮した利便推定のための訓練後ポリシー最適化手法であるDual-Relative Policy Optimization (DRPO) と,(2)不整合表現学習と相互注意伝達を用いた集団の不均一性をモデル化して長期的成果を推定するLRP (Long-term Reward Predictor) の2つの重要な要素を紹介した。
DMRLは大規模なショートビデオ広告プラットフォームにデプロイされ、広範な実証評価の結果、DMRLは主要な広告指標で最先端のベースラインを上回っている。
関連論文リスト
- PaperGuide: Making Small Language-Model Paper-Reading Agents More Efficient [20.72001543887772]
大規模言語モデル(LLM)の最近の進歩は、科学論文を読み取ってタスク関連情報を抽出できる自律エージェントへの関心を喚起している。
既存のアプローチのほとんどは、高度に設計されたプロンプトか、あるいは従来のSFT-RLトレーニングパイプラインに依存している。
本稿では,これらの問題を緩和するフレームワークであるPaper RLを提案する。
論文 参考訳(メタデータ) (2026-01-19T12:07:51Z) - PRInTS: Reward Modeling for Long-Horizon Information Seeking [74.14496236655911]
PRInTS(PRInTS)は、二重機能で訓練された生成型PRMである。
PRInTSは,オープンソースモデルと特殊エージェントの情報検索能力を向上させる。
論文 参考訳(メタデータ) (2025-11-24T17:09:43Z) - OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning [41.49024599460379]
大規模言語モデル(LLM)の整合には,リワードモデル(RM)が不可欠である。
ツール拡張型ロングフォーム報酬モデルであるOpenRMを導入し、外部ツールを呼び出して適切な証拠を収集することで、オープンエンドの応答を判断する。
新たにコンパイルされた3つのデータセットと2つの広く使用されているベンチマークの実験は、OpenRMが既存の報酬モデリングアプローチを大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2025-10-28T17:02:46Z) - Prompt Optimization via Retrieved Reasoning Assets and Multi-Agent Analysis [5.935239028627343]
スコア・アウェア・プロンプト最適化のためのマルチエージェントフレームワークであるMA-SAPOを紹介する。
従来の手法と比較して、MA-SAPOは、体系的な編集を導く構造的推論と評価結果を明示的に結合する。
評価信号を解釈可能な推論連鎖に変換することで、MA-SAPOはより透明で、監査可能で、制御可能な、迅速な改善を生成する。
論文 参考訳(メタデータ) (2025-10-18T20:21:09Z) - CustomIR: Unsupervised Fine-Tuning of Dense Embeddings for Known Document Corpora [0.0]
CustomIRは、ドメイン固有のコーパスへの言語埋め込みモデルの教師なし適応のためのフレームワークである。
実験の結果、CustomIRはRecall@10の2.3ポイントまでの小さなモデルで検索効率を継続的に改善することがわかった。
これらの結果は、ターゲットとなる合成微調整が、ドメイン固有のパフォーマンスを高めるためのスケーラブルでコスト効率の高い戦略を提供することを示している。
論文 参考訳(メタデータ) (2025-09-30T00:25:47Z) - RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 [20.92548890511589]
本稿では,Large Language Models(LLM)を利用したレコメンデーションフレームワークであるRecLLM-R1を紹介する。
RecLLM-R1は、精度、多様性、新規性など、さまざまな評価指標において、既存のベースラインメソッドを大幅に上回っている。
論文 参考訳(メタデータ) (2025-06-24T01:39:34Z) - VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization [59.39976343879587]
VerIPOは、深く長期的な推論チェーンを生成するためのビデオLLMの能力を徐々に改善することを目指している。
トレーニングループはGRPOの拡張検索とDPOのターゲット最適化の恩恵を受けている。
我々の訓練されたモデルは、大規模命令調整ビデオ-LLMの直接推定を超えている。
論文 参考訳(メタデータ) (2025-05-25T06:41:28Z) - Direct Retrieval-augmented Optimization: Synergizing Knowledge Selection and Language Models [83.8639566087953]
本稿では,2つの主要コンポーネントのエンドツーエンドトレーニングを可能にするDROという,直接検索拡張最適化フレームワークを提案する。
DROは、 (i) 文書置換推定と (ii) 再重み付けされ、段階的に改善されたRAGコンポーネントの2つのフェーズの間で交代する。
理論解析により,DROは強化学習における政策段階的な手法に類似していることが明らかとなった。
論文 参考訳(メタデータ) (2025-05-05T23:54:53Z) - On the Role of Feedback in Test-Time Scaling of Agentic AI Workflows [71.92083784393418]
エージェントAI(自律的な計画と行動を行うシステム)は広く普及しているが、複雑なタスクにおけるタスクの成功率は低いままである。
推論時のアライメントは、サンプリング、評価、フィードバックの3つのコンポーネントに依存します。
本稿では,様々な形態の批判から抽出されたフィードバックを繰り返し挿入するIterative Agent Decoding(IAD)を紹介する。
論文 参考訳(メタデータ) (2025-04-02T17:40:47Z) - A Survey of Direct Preference Optimization [103.59317151002693]
LLM(Large Language Models)は、前例のない生成能力を示す。
人的価値との整合性は、有用で無害なデプロイメントを保証する上で、依然として重要です。
直接優先度最適化(DPO)は、最近、合理化された代替案として注目されている。
論文 参考訳(メタデータ) (2025-03-12T08:45:15Z) - From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning [62.54484062185869]
本稿では,エージェントの強化学習プロセスの最適化にステップワイド報酬を利用するStepAgentを紹介する。
エージェント反射とポリシー調整を容易にする暗黙の逆・逆の強化学習手法を提案する。
論文 参考訳(メタデータ) (2024-11-06T10:35:11Z) - Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning [55.96599486604344]
本稿では,Large Language Models (LLMs) の推論能力向上を目的とした,反復的な選好学習プロセスによるアプローチを提案する。
我々は、MCTS(Monte Carlo Tree Search)を用いて好みデータを反復的に収集し、そのルックアヘッド機能を利用して、インスタンスレベルの報酬をよりきめ細かいステップレベルの信号に分解する。
提案アルゴリズムはDPO(Direct Preference Optimization)を用いて,新たに生成されたステップレベルの優先度データを用いてLCMポリシーを更新する。
論文 参考訳(メタデータ) (2024-05-01T11:10:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。