論文の概要: Beyond Action Imitation: Learning a Decision-Aware User Simulator for Online Advertising
- arxiv url: http://arxiv.org/abs/2607.26893v1
- Date: Wed, 29 Jul 2026 13:25:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.688568
- Title: Beyond Action Imitation: Learning a Decision-Aware User Simulator for Online Advertising
- Title(参考訳): 行動模倣を超えて:オンライン広告のための意思決定対応ユーザシミュレータを学習する
- Authors: Zipeng Chen, Jiaer Zheng, Xiangyang Xu, Xinyu Lin, Zhaobin Wang, Zhaohui Liu, Qianjin Xiang, Xiaoyu Zhao, Zhuozhen Yu, Guangshuo Wang, Daxing Chen, Junwei Pan, Zhangbin Zhu, Chengguo Yin, Hao Chen, Tat-Seng Chua, Haijie Gu, Jie Jiang,
- Abstract要約: DASHは思考トレースを共同で生成し,異質なクロスドメイン履歴から行動行動を予測する,意思決定対応のユーザシミュレータである。
ユーザシミュレータをトレーニングするために、DASHは強力なLLMからSFTデータとして思考軌道を蒸留する。
ユーザシミュレータをトレーニングするために、DASHは、RLトレーニングのためのフォーム、コンテンツ、ロジックに沿った思考トレースを評価するルーリックベースの報酬モデルをカスタマイズする。
- 参考スコア(独自算出の注目度): 47.726568328425394
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in LLM-based user simulation have shown promise for offline evaluation of recommendation and advertising systems. However, existing simulators typically infer user preferences from single-domain interaction histories and are primarily optimized to reproduce observable actions such as clicks. Consequently, they capture only a partial view of user preferences, while action-only prediction easily induces model shortcuts and limits both the fidelity and diagnostic value of simulation. To address these challenges, we propose DASH, a decision-aware user simulator that jointly generates thinking traces and predicts behavioral actions from heterogeneous cross-domain histories. DASH first introduces a Context Engineering stage that folds heterogeneous cross-domain histories into decision-relevant context, together with prompt optimization for effective reasoning over the folded context. To train a user simulator, DASH distills thinking trajectories from strong LLMs as SFT data, and further tailors a rubric-based reward model that evaluates thinking traces along form, content, and logic for RL training. Combined with the action reward, these signals jointly improve action prediction and thinking quality. Extensive experiments on real-world Tencent advertising data spanning five heterogeneous content domains demonstrate the effectiveness, efficiency, fidelity, and diagnostic value of DASH.
- Abstract(参考訳): LLMに基づくユーザシミュレーションの最近の進歩は、レコメンデーションと広告システムのオフライン評価を約束している。
しかし、既存のシミュレータは通常、単一ドメインのインタラクション履歴からユーザの好みを推測し、クリックのような観測可能なアクションを再現するために主に最適化されている。
その結果、ユーザ好みの部分的なビューのみをキャプチャし、アクションのみの予測はモデルのショートカットを容易に誘導し、シミュレーションの忠実度と診断値の両方を制限する。
これらの課題に対処するために,異質なクロスドメイン履歴から思考トレースを共同生成し,行動行動を予測する,意思決定対応ユーザシミュレータであるDASHを提案する。
DASHはまず、異質なクロスドメイン履歴を決定関連コンテキストに折り畳み、折りたたみコンテキストに対する効果的な推論を迅速に最適化するコンテキストエンジニアリングのステージを紹介します。
ユーザシミュレータをトレーニングするために、DASHは強力なLLMからの思考軌跡をSFTデータとして蒸留し、RLトレーニングのためのフォーム、コンテンツ、ロジックに沿った思考トレースを評価するルーリックベースの報酬モデルをさらに調整する。
行動報酬と組み合わせることで、これらの信号は行動予測と思考品質を共同で改善する。
5つの異種コンテンツドメインにまたがる現実世界のTencent広告データに対する大規模な実験は、DASHの有効性、効率性、忠実性、診断価値を実証している。
関連論文リスト
- Measuring and Mitigating the Distributional Gap Between Real and Simulated User Behaviors [61.610957638373826]
本研究では,実際のユーザ行動とシミュレーションユーザ行動の分布ギャップを計測する手法を提案する。
実会話とシミュレーション会話のデータセットが与えられた場合,本手法は各会話からユーザ行動の表現を抽出する。
ほとんどのシミュレータも同様に振る舞うが、いくつかは独立している。
論文 参考訳(メタデータ) (2026-05-08T15:09:25Z) - Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces [81.41397370235102]
我々はOmniBehaviorを紹介した。OmniBehaviorは実世界のデータから構築された最初のユーザシミュレーションベンチマークである。
現在のモデルでは,コンテキストウィンドウが拡大しても,複雑な振る舞いを正確にシミュレートすることが困難であることを示す。
この結果、個人差や長い尾の挙動が失われ、将来の高忠実度シミュレーション研究における重要な方向性が浮き彫りになる。
論文 参考訳(メタデータ) (2026-04-09T15:26:21Z) - Mind the Sim2Real Gap in User Simulation for Agentic Tasks [101.69142591891234]
ユーザシミュレーションにおけるSim2Realのギャップを形式化し、実際の人間に対して$$$-benchプロトコルを実行する最初の研究を示す。
LLMシミュレータは過度に協調的であり、スタイリスティックに均一であり、現実的なフラストレーションや曖昧さを欠いている。
これらの知見は, LLMベースのユーザシミュレータをエージェント開発サイクルで使用する際の人間による検証の重要性を強調した。
論文 参考訳(メタデータ) (2026-03-11T19:12:31Z) - ConvApparel: A Benchmark Dataset and Validation Framework for User Simulators in Conversational Recommenders [48.83868690303791]
このギャップに対処するために設計された、人間とAIの会話の新しいデータセットであるConvApparelを紹介します。
そのユニークなデュアルエージェントデータ収集プロトコル -- "よい" と "悪い" のレコメンデータを使用する -- は、偽物検証を可能にする。
本稿では,統計的アライメント,人間的類似度スコア,および対実的検証を組み合わせた総合的検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-18T23:00:21Z) - Beyond Offline A/B Testing: Context-Aware Agent Simulation for Recommender System Evaluation [0.7031557790463293]
本研究では,日常の生活活動におけるインタラクションを固定することで,信頼できるユーザプロキシをシミュレートするエージェントフレームワークであるContextSimを紹介する。
嗜好を本物の人間に合わせるため、エージェントの内部思想をモデル化し、行動レベルと軌道レベルの両方で一貫性を強制する。
論文 参考訳(メタデータ) (2026-01-26T05:01:00Z) - See, Think, Act: Online Shopper Behavior Simulation with VLM Agents [58.92444959954643]
本稿では,視覚情報,特にWebページスクリーンショットのVLMによる動作シミュレーションへの統合について検討する。
我々は,協調行動予測と合理化生成にSFTを用いて,相互作用の完全な文脈を条件づける。
推論能力をさらに強化するため,RLを階層的な報酬構造と統合し,難易度因子によって拡張する。
論文 参考訳(メタデータ) (2025-10-22T05:07:14Z) - PUB: An LLM-Enhanced Personality-Driven User Behaviour Simulator for Recommender System Evaluation [9.841963696576546]
Personality-driven User Behaviour Simulator (PUB)は、パーソナライズされたユーザの振る舞いをモデル化するために、Big Fiveのパーソナリティ特性を統合している。
PUBは、行動ログ(例えば、評価、レビュー)とアイテムメタデータからユーザーの個性を動的に推論し、その後、実際のデータに対する統計的忠実性を保存するための合成相互作用を生成する。
Amazonレビューデータセットの実験では、PUBが生成したログは実際のユーザの行動と密接に一致し、パーソナリティ特性とレコメンデーション結果の間に有意義な関連性を明らかにする。
論文 参考訳(メタデータ) (2025-06-05T01:57:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。