論文の概要: MORL-A2C: Multi-Objective Reinforcement Learning Reranker for Optimizing Healthiness in MOPI-HFRS
- arxiv url: http://arxiv.org/abs/2606.23603v1
- Date: Mon, 22 Jun 2026 17:06:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 17:55:15.949087
- Title: MORL-A2C: Multi-Objective Reinforcement Learning Reranker for Optimizing Healthiness in MOPI-HFRS
- Title(参考訳): MORL-A2C:MOPI-HFRSの健康度最適化のための多目的強化学習リランカ
- Authors: Aarya Vasantlal, Joshua Zolla,
- Abstract要約: 不健康な食事行動は、米国における公衆衛生問題であり続けている。
この研究は、多目的パーソナライズされた健康に配慮した食品レコメンデーションシステムを拡張した。
MORL-A2CはMOPI-HFRSの健康基準軸をターゲットとしたシーケンシャルな意思決定拡張である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unhealthy dietary behavior continues to be a persistent public health issue in the United States, exacerbated by recommendation systems that prioritize user preference without considering nutritional health. The Multi-Objective Personalized Interpretable Health-aware Food Recommendation System (MOPI-HFRS), from which this work extends, addresses this by jointly optimizing preference, health, and diversity through Pareto-based optimization. However, this approach relies on static, per-step tradeoff solutions that fail to capture the sequential nature of dietary decision-making. We introduce MORL-A2C, a sequential decision-making extension to MOPI-HFRS targeting the health-preference axis. Leveraging frozen GNN embeddings, MORL-A2C formulates recommendation as a K-step reranking problem using an Advantage Actor-Critic algorithm with a scalarized relevance/health reward. The policy is warm-started via behavior cloning against a dot-product ranker derived from frozen embeddings. We also identify and correct a non-trivial bug in the MOPI-HFRS evaluation pipeline that understated baseline performance; all results are reported against the corrected baseline. On the macro-nutrient benchmark, MORL-A2C achieves a modest reduction in ranking quality (Recall@20: 25.64% to 23.61%, NDCG@20: 23.52% to 20.64%) in exchange for a substantial improvement in health alignment (H-Score@20: 46.05% to 69.57%), with consistent trends on the full-nutrient benchmark. These findings validate that policy-driven sequential optimization can effectively navigate the health-preference trade-off in multi-objective food recommendation.
- Abstract(参考訳): 不健康な食事行動は、栄養的な健康を考慮せずにユーザーの嗜好を優先するレコメンデーションシステムによって悪化し、米国において永続的な公衆衛生問題であり続けている。
この研究が拡張したMOPI-HFRS(Multi-Objective Personalized Interpretable Health-Aware Food Recommendation System)は、Paretoベースの最適化を通じて、好み、健康、多様性を共同で最適化することで、この問題に対処する。
しかし、このアプローチは、食事の意思決定のシーケンシャルな性質を捉えない静的な、ステップごとのトレードオフソリューションに依存している。
MORL-A2CはMOPI-HFRSの健康基準軸をターゲットとしたシーケンシャルな意思決定拡張である。
凍結したGNN埋め込みを利用して、MORL-A2Cは、スキャラライズされた妥当性/健康報酬を持つAdvantage Actor-Criticアルゴリズムを用いて、Kステップの再ランク問題として推奨を定式化する。
この方針は、凍結した埋め込みから派生したドット生成物ランクラーに対する行動クローニングを通じて温かく開始される。
また,MOPI-HFRS評価パイプラインにおける非自明なバグを同定し,修正されたベースラインに対して報告する。
マクロ栄養ベンチマークでは、MORL-A2Cは、健康アライメントの大幅な改善(H-Score@20:46.05%から69.57%)と引き換えに、ランキング品質の緩やかな低下(Recall@20: 25.64%から23.61%、NDCG@20: 23.52%から20.64%)を達成する。
これらの結果から,多目的食品レコメンデーションにおいて,政策主導型逐次最適化が健康基準トレードオフを効果的にナビゲートできることが確認された。
関連論文リスト
- MetaPlate: Counterfactual-Guided RAG-LLM Tool for Personalized Food Recommendation and Hyperglycemia Prevention [1.962656580942496]
先天性高血糖は代謝異常の重要な危険因子である。
既存の食事指導は静的で、実用的でなく、パーソナライズが不十分であることが多い。
パーソナライズされた食事レコメンデーションを生成するコンテキスト認識フレームワークであるMetaPlateを提案する。
論文 参考訳(メタデータ) (2026-06-08T19:52:08Z) - An LLM-RAG Approach for Healthy Eating Index-Informed Personalized Food Recommendations [2.7388641122712802]
食事の質は慢性疾患のリスクの主要な要因である。
標準化された栄養データベースと大規模言語モデルを組み合わせた,個人化された食品レコメンデーションのためのフレームワークを提案する。
提案するLLM-RAGベースのAIシステムは,より正確で説明可能な,個人化された栄養指導を支援することが示唆された。
論文 参考訳(メタデータ) (2026-05-11T03:40:17Z) - Improving Heart-Focused Medical Question Answering in LLMs via Variance-Aware Rubric Rewards with GRPO [0.23749905164931204]
大規模言語モデル(LLM)は、医療アプリケーションにおいて大きな可能性を秘めている。しかしながら、データプライバシの制約、推論コスト、エッジやデバイス上の使用に限定した適合性のために、現実の環境で汎用モデルをデプロイすることは、依然として困難である。
そこで本研究では,RaR-Medicine由来のルビリック・ベース・インシュアランスに応答する心的医学的問題に対するLLMのポストトレーニングのためのグループ相対的ポリシー最適化(GRPO)について検討する。
以上の結果から, 心電図による質問応答の改善には, 心電図による報酬が有効であり, その他の作業にも適用できる可能性が示唆された。
論文 参考訳(メタデータ) (2026-04-17T03:08:55Z) - PRISM: Pushing the Frontier of Deep Think via Process Reward Model-Guided Inference [6.568081870814357]
PRISMは、ステップレベルの検証を用いて、人口浄化とソリューションアグリゲーションの両方を導く推論アルゴリズムである。
数学や科学のベンチマークの他、PRISMは既存のDEEPTHINK法よりも優れている。
論文 参考訳(メタデータ) (2026-03-03T00:03:42Z) - HPS: Hard Preference Sampling for Human Preference Alignment [55.113864906702865]
HPS(Hard Preference Sampling)は、堅牢で効率的な人間の選好アライメントのための新しいフレームワークである。
HPSはアライメント品質を維持しながら計算オーバーヘッドを低減する。
HH-RLHFとPKU-Safetyデータセットの実験はHPSの有効性を検証する。
論文 参考訳(メタデータ) (2025-02-20T09:37:41Z) - MOPI-HFRS: A Multi-objective Personalized Health-aware Food Recommendation System with LLM-enhanced Interpretation [50.309987904297415]
Yelpのような主要な食品レコメンデーションプラットフォームは、ユーザの選択した健康性よりも、ユーザの食事の好みを優先している。
我々はMOPI-HFRS(Multi-Objective Personalized Interpretable Health-Aware Food Recommendation System)を開発した。
ユーザの好み、パーソナライズされた健康、栄養の多様性の3つの目標と、大きな言語モデル(LLM)強化推論モジュールを共同で最適化することで、食品レコメンデーションを提供する。
論文 参考訳(メタデータ) (2024-12-12T01:02:09Z) - Uncertainty-Penalized Direct Preference Optimization [52.387088396044206]
我々は、優先不確実性ペナル化スキームを導入し、DPOの悲観的な枠組みを開発する。
ペナル化は、不確実なサンプルの損失勾配を減衰させる損失の補正として機能する。
我々は,バニラDPOと比較して全体的な性能が向上し,高い不確実性選択/拒絶反応によるプロンプトの完成度も向上した。
論文 参考訳(メタデータ) (2024-10-26T14:24:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。