論文の概要: Large Behavior Model: A Promptable Digital Twin of the Retail Customer
- arxiv url: http://arxiv.org/abs/2607.06993v1
- Date: Wed, 08 Jul 2026 04:31:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.28245
- Title: Large Behavior Model: A Promptable Digital Twin of the Retail Customer
- Title(参考訳): 大規模行動モデル:小売店のデジタルツイン
- Abstract要約: 大規模小売取引から直接顧客決定を学習する大規模行動モデル(LBM)を提案する。
モデルは、言語化された行動データに基づいて、継続した事前学習を用いて訓練される。
提案手法は, 購入予測, 否定的差別, バスケット完成, プロモーション応答, ドメイン間ボウチャー償還に関するものである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Customer behavior modeling underpins recommendation, marketing, and decision support, yet existing approaches either optimize predictive accuracy without explaining decisions or simulate users without grounding them in real behavioral data. We present the Large Behavioral Model (LBM) that learns customer decision making directly from large-scale retail transactions through a unified Person-Environment formulation. Customer state is represented by a behavioral profile derived from historical purchases, while product context is incorporated through retrieval-augmented generation. The model is trained using continued pre-training on verbalized behavioral data, supervised fine-tuning for decision generation, and reinforcement learning with verifiable rewards for evidence-based calibration. We evaluate the proposed framework on purchase prediction, hard-negative discrimination, basket completion, promotion response, and cross-domain voucher redemption. The model consistently outperforms frontier general-purpose language models on in-domain retail tasks while demonstrating strong zero-shot and fine-tuned transfer across retailers and decision domains. Ablation studies show that continued pre-training is the primary driver of behavioral generalization, retrieval is most effective when applied during both training and inference, and reinforcement learning improves reliance on explicit behavioral evidence over generic language-model priors. These results demonstrate that behavioral knowledge encoded in transaction histories can be effectively learned by language models, providing a scalable foundation for customer digital twins and behavior simulation.
- Abstract(参考訳): 顧客行動モデリングはレコメンデーション、マーケティング、意思決定のサポートを支えるが、既存のアプローチは決定を説明することなく予測精度を最適化するか、実際の行動データに基礎を置くことなくユーザーをシミュレートする。
本稿では、大規模小売取引から直接顧客決定を学習する大規模行動モデル(LBM)について、統合された個人環境の定式化を通して紹介する。
顧客の状態は、履歴購入から派生した行動プロファイルで表され、製品コンテキストは、検索強化世代によって組み込まれている。
モデルは、言語化された行動データに基づく継続的な事前学習、意思決定のための微調整の監督、証拠に基づく校正のための検証可能な報酬を用いた強化学習を用いて訓練される。
提案手法は, 購入予測, 否定的差別, バスケット完成, プロモーション応答, ドメイン間ボウチャー償還に関するものである。
このモデルは、ドメイン内リテールタスクにおけるフロンティア汎用言語モデルよりも一貫して優れており、小売店や意思決定ドメイン間で強力なゼロショットと微調整の転送を示している。
アブレーション研究は、継続事前学習が行動一般化の原動力であり、トレーニングと推論の両方で適用した場合、検索が最も効果的であることを示し、強化学習は一般的な言語モデルよりも明確な行動証拠に依存していることを示した。
これらの結果は、トランザクション履歴に符号化された行動知識を言語モデルによって効果的に学習できることを示し、顧客デジタルツインと行動シミュレーションのためのスケーラブルな基盤を提供する。
関連論文リスト
- Anatomy of Post-Training: Using Interpretability to Characterize Data and Shape the Learning Signal [29.196846051811576]
本稿では、解釈可能性プロトコルを用いたデータ中心のポストトレーニングパイプラインを導入し、非推奨世代と区別される潜在概念の統計的仮説を立案する。
我々のパイプラインは、既存の嗜好データの望ましくない信号を診断し、ターゲット外の学習を緩和し、安全ガードやモデルパーソナリティといった望ましい特性を増幅または形作るのにも役立ちます。
論文 参考訳(メタデータ) (2026-06-10T17:31:16Z) - BehaviorBench: Modeling Real-World User Decisions from Behavioral Traces [53.55407626944686]
textscBehaviorBenchは、実世界の行動トレースからパーソナライズされた意思決定モデリングを評価するためのベンチマークである。
textscBehaviorBenchは、公開市場とオンチェーンの記録からウォレットレベルの意思決定履歴を再構築する。
2,000以上の評価ウォレットで、ベンチマークには141,445のBeliefインスタンスと1,485,972のTradeインスタンスが含まれている。
論文 参考訳(メタデータ) (2026-06-01T19:04:36Z) - On Predicting the Post-training Potential of Pre-trained LLMs [60.07459271263409]
本稿では,ポストトレーニング前のベースモデルの性能予測という,ポストトレーニング後の潜在能力を予測するための新しいタスクを紹介する。
本稿では,応答判別を活用することで,ベースモデルの生成ギャップを回避できる統一フレームワークであるRuDEを提案する。
実験では、トレーニング後のパフォーマンスと90%以上の相関を示す。
論文 参考訳(メタデータ) (2026-05-12T11:33:49Z) - PANTHER: Generative Pretraining Beyond Language for Sequential User Behavior Modeling [32.37786043225548]
本稿では,ユーザ行動の事前学習と下流適応を統一するハイブリッドな生成識別フレームワークPANTHERを提案する。
PANTHERはWeChat Payのオンライン展開と運用をフルに行い、HitRate@1.5%で25.6%のアップを達成している。
パブリックベンチマークでのクロスドメイン評価は、強力な一般化を示し、最大21%のHitRate@1がトランスフォーマーベースラインを越えている。
論文 参考訳(メタデータ) (2025-10-11T08:24:19Z) - Learning a Dense Reasoning Reward Model from Expert Demonstration via Inverse Reinforcement Learning [50.20267980386502]
我々は、専門家によるデモンストレーションから直接、プロセスの監督のための密集したトークンレベルの報酬モデルを学びます。
学習された推論報酬は、2つの補完的な役割を果たす: (i)訓練中の推論ポリシーを最適化するためのステップレベルのフィードバックを提供する。
論文 参考訳(メタデータ) (2025-10-02T09:55:26Z) - Instruction-Based Fine-tuning of Open-Source LLMs for Predicting Customer Purchase Behaviors [1.4440000007050255]
微調整ミストラルインストラクションモデルの優れた予測能力が実証された。
Mistralモデルは従来のシーケンシャルモデルよりも大幅に優れている。
論文 参考訳(メタデータ) (2025-01-28T11:34:22Z) - Inverse Decision Modeling: Learning Interpretable Representations of
Behavior [72.80902932543474]
我々は,逆決定モデルに関する表現的,統一的な視点を開拓する。
これを逆問題(記述モデルとして)の形式化に用います。
この構造が(有界な)有理性の学習(解釈可能な)表現を可能にする方法について説明する。
論文 参考訳(メタデータ) (2023-10-28T05:05:01Z) - Explain, Edit, and Understand: Rethinking User Study Design for
Evaluating Model Explanations [97.91630330328815]
我々はクラウドソーシング研究を行い、真偽のホテルレビューと偽のホテルレビューを区別するために訓練された詐欺検出モデルと対話する。
単語の線形バッグモデルでは、トレーニング中に特徴係数にアクセスした参加者は、非説明制御と比較して、テストフェーズにおいてモデルの信頼性が大幅に低下する可能性があることを観察する。
論文 参考訳(メタデータ) (2021-12-17T18:29:56Z) - On the estimation of discrete choice models to capture irrational
customer behaviors [4.683806391173103]
我々は、部分的にランク付けされた好みを使って、トランザクションデータから合理的で不合理な顧客タイプを効率的にモデル化する方法を示す。
提案手法の予測精度を評価する実験を幅広く行った。
論文 参考訳(メタデータ) (2021-09-08T19:19:51Z) - Learning Transferrable Parameters for Long-tailed Sequential User
Behavior Modeling [70.64257515361972]
テールユーザに注力することで、より多くのメリットをもたらし、長いテールの問題に対処できる、と私たちは主張しています。
具体的には、頭部から尾部への知識伝達を容易にするために、勾配アライメントを提案し、敵のトレーニングスキームを採用する。
論文 参考訳(メタデータ) (2020-10-22T03:12:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。