論文の概要: Affective Music Recommendation: A Rollout-Based World Model for Offline Preference Optimization
- arxiv url: http://arxiv.org/abs/2605.28810v1
- Date: Wed, 27 May 2026 17:58:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:56.265995
- Title: Affective Music Recommendation: A Rollout-Based World Model for Offline Preference Optimization
- Title(参考訳): Affective Music Recommendation: オフライン優先最適化のためのロールアウトに基づく世界モデル
- Authors: Audrey Chan, Aaron Labbé, Jacob Lavoie, Jordan Bannister, Arsène Fansi Tchango, Guillaume Lajoie, Laurent Charlin,
- Abstract要約: LUCIDの健康・健康プラットフォーム上に展開されたAffective Music Recommendation SystemであるAMRSについて述べる。
AMRSは、使用可能な忠実度を持つ行動信号と感情信号の両方を予測する。
オンライン実験が倫理的に不可能な場合に、情緒的推薦のための方法論を早期に導入した検証として位置づける。
- 参考スコア(独自算出の注目度): 14.843854280227662
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Functional music applications, from consumer focus and sleep aids to clinical interventions, share a distinctive recommendation problem: success is defined by the listener's affective state, but online experimentation on emotion is ethically constrained, particularly for clinical populations who cannot reliably skip a song or report distress. We describe AMRS, the Affective Music Recommendation System deployed on LUCID's health-and-wellness platforms, which serve clinical users (primarily older adults with neurocognitive conditions) and consumer-wellness users across energize, focus, calm, and sleep modes. AMRS is built around a rollout-based world model: a causal transformer trained on logged listening data to jointly predict engagement, binary rating, and self-reported valence and arousal. The world model serves both as an in-silico simulator for offline policy training and as a stress-testing tool before deployment. A recommender policy initialized by behaviour cloning is fine-tuned offline with Direct Preference Optimization (DPO) against a configurable multi-objective utility function. Under a strict cold-start protocol, the world model predicts both behavioural and affective signals with usable fidelity; DPO improves predicted valence and arousal over the cloned baseline while maintaining a similar diversity profile and avoiding the distributional collapse produced by greedy optimization. We position the work as an early deployed validation of a methodology for affective recommendation when online experimentation is ethically untenable.
- Abstract(参考訳): 消費者の焦点や睡眠支援から臨床介入まで、機能音楽の応用は独特なレコメンデーション問題を共有している: 成功は聴取者の感情状態によって定義されるが、感情に関するオンライン実験は倫理的に制約されている。
本稿では,LUCIDの健康・健康プラットフォーム上に展開するAMRS(Affective Music Recommendation System)について述べる。
AMRSはロールアウトベースの世界モデルを中心に構築されており、ログ化されたリスニングデータに基づいてトレーニングされた因果トランスフォーマーで、エンゲージメント、バイナリレーティング、自己報告された原子価と覚醒を共同で予測する。
世界モデルは、オフラインポリシートレーニング用のシリコンシミュレーターと、デプロイ前にストレステストツールとして機能する。
行動クローンによって初期化される推奨ポリシーは、設定可能な多目的ユーティリティ関数に対して、直接参照最適化(DPO)を用いて、オフラインで微調整される。
厳密なコールドスタートプロトコルの下では、世界モデルは行動的信号と感情的信号の両方を使用可能な忠実さで予測し、DPOは、類似した多様性プロファイルを維持しつつ、グレディ最適化によって生じる分布崩壊を回避するとともに、クローン化されたベースライン上の予測値と覚醒を改善する。
オンライン実験が倫理的に不可能な場合に、情緒的推薦のための方法論を早期に導入した検証として位置づける。
関連論文リスト
- Learning from Disagreement: Clinician Overrides as Implicit Preference Signals for Clinical AI in Value-Based Care [4.772536418776007]
3つのコントリビューションで標準選好学習を拡張したフォーマルなフレームワークを提案する。
結果に基づく支払い契約に基づく慢性的な疾患管理は、一意に有利な特性を持つデータをオーバーライドすると主張している。
論文 参考訳(メタデータ) (2026-04-30T15:30:47Z) - Reinforcement Learning enhanced Online Adaptive Clinical Decision Support via Digital Twin powered Policy and Treatment Effect optimized Reward [3.3025649517524793]
本稿では、強化学習がポリシーを提供し、患者デジタルツインが環境を提供し、治療効果が報酬を定義するオンライン適応ツールを提案する。
人工臨床シミュレータの実験では、レイテンシの低下、スループットの安定、安全度の高いクエリ率の低下、標準値ベースラインに対するリターンの改善などが示されている。
論文 参考訳(メタデータ) (2025-08-24T04:51:22Z) - PUB: An LLM-Enhanced Personality-Driven User Behaviour Simulator for Recommender System Evaluation [9.841963696576546]
Personality-driven User Behaviour Simulator (PUB)は、パーソナライズされたユーザの振る舞いをモデル化するために、Big Fiveのパーソナリティ特性を統合している。
PUBは、行動ログ(例えば、評価、レビュー)とアイテムメタデータからユーザーの個性を動的に推論し、その後、実際のデータに対する統計的忠実性を保存するための合成相互作用を生成する。
Amazonレビューデータセットの実験では、PUBが生成したログは実際のユーザの行動と密接に一致し、パーソナリティ特性とレコメンデーション結果の間に有意義な関連性を明らかにする。
論文 参考訳(メタデータ) (2025-06-05T01:57:36Z) - Active Human Feedback Collection via Neural Contextual Dueling Bandits [84.7608942821423]
本稿では,人間の嗜好フィードバックを抽出するアルゴリズムであるNeural-ADBを提案する。
優先フィードバックがBradley-Terry-Luceモデルに従うと、Neural-ADBが学習したポリシーの最悪の準最適差は、選好データセットが増加するにつれて、サブ線形速度で減少することを示す。
論文 参考訳(メタデータ) (2025-04-16T12:16:10Z) - Why am I seeing this? Towards recognizing social media recommender systems with missing recommendations [4.242821809663174]
グラフニューラルネットワーク(GNN)を用いた自動レコメンダ認識手法を提案する。
提案手法は,隠されたレコメンデータの正確な検出とユーザ行動への影響を可能にする。
この研究は、レコメンダが行動をどのように形成し、偏光と誤情報を減らすための努力を支援するかについての洞察を提供する。
論文 参考訳(メタデータ) (2025-04-15T09:16:17Z) - Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment [104.18002641195442]
既存のペアデータを必要としない、効果的でスケーラブルなトレーニングパラダイムである自己拡張型優先度最適化(SAPO)を導入する。
負の反応を自律的に生成するセルフプレイの概念に基づいて、我々はさらに、データ探索とエクスプロイトを強化するために、非政治的な学習パイプラインを組み込む。
論文 参考訳(メタデータ) (2024-05-31T14:21:04Z) - Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF [80.32171988565999]
オンラインとオフラインのRLHFに統一的なアプローチを導入します。
VPOは、報酬関数の最大値推定を対応する値関数で正規化する。
テキスト要約とダイアログの実験は、VPOの実用性と有効性を検証する。
論文 参考訳(メタデータ) (2024-05-29T17:51:42Z) - DTR Bandit: Learning to Make Response-Adaptive Decisions With Low Regret [59.81290762273153]
動的治療体制 (DTR) はパーソナライズされ適応された多段階の治療計画であり、治療決定を個人の初期特徴に適応させ、その後の各段階における中間結果と特徴に適応させる。
本稿では,探索と搾取を慎重にバランスさせることで,遷移モデルと報酬モデルが線形である場合に,速度-最適後悔を実現する新しいアルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-05-06T13:03:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。