論文の概要: Scaling Articulated Rationales for MLLM-based Recommendation
- arxiv url: http://arxiv.org/abs/2609.17639v1
- Date: Tue, 15 Sep 2026 13:39:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.468873
- Title: Scaling Articulated Rationales for MLLM-based Recommendation
- Title(参考訳): MLLMに基づくレコメンデーションのためのスケーリングArticulated Rationals
- Abstract要約: 本研究は,新たな極性認識と理性レベルテキスト信号のクラスとして,ユーザ論理(AUR)を記述し,推奨する。
スパースAURをスケーラブルなレコメンデーションシグナルに変換する産業フレームワークであるSARAを紹介します。
- 参考スコア(独自算出の注目度): 47.47487161625309
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern recommendation systems largely infer user preferences from implicit behaviors such as clicks, watch time, and negative feedback, but these signals reveal what users do rather than why they like or dislike content. This work studies articulated user rationales (AURs), i.e., users' natural-language explanations of their preferences, as a new class of polarity-aware and reason-level textual signals for recommendation. Despite their potential value, AURs are difficult to use in industrial systems because they are naturally sparse, often low-quality, and only cover a small fraction of items. We present SARA (Scaling Articulated Rationales), an industrial framework that turns sparse AURs into scalable recommendation signals. SARA first builds a data engine that elicits and curates AURs from 240M Kuaishou Live users, producing SARA-HQ, a quality-controlled and author-centric rationale dataset. It then aligns a general-purpose MLLM into SARA-7B through large-scale SFT and Quality-Refining DPO, extending rationale generation from 86,564 AUR-covered authors to the full 10M-author space. Finally, SARA-Ranker integrates the generated positive and negative rationales into production ranking via rationale-aware interaction modeling and rejection-memory modeling. Extensive offline evaluation, human calibration, and online A/B tests show that SARA-7B generates more specific, polarity-consistent, and grounded rationales than strong MLLM baselines, while SARA-Ranker improves engagement and reduces negative feedback in production. Deployed with daily refresh for over 30 days, SARA establishes articulated rationales as a practical, first-class textual signal for industrial recommendation systems.
- Abstract(参考訳): 現代のレコメンデーションシステムは、クリックやウォッチタイム、ネガティブなフィードバックといった暗黙の行動からユーザの好みを推測するが、これらのシグナルは、ユーザーがコンテンツが好きで嫌いな理由ではなく、何をするかを明らかにする。
本研究は, ユーザの嗜好を自然言語で説明する, ユーザ論理(AUR) を, ポラリティ認識と理性レベルのテキスト信号の新しい分類として研究する。
潜在的な価値にもかかわらず、AURは自然に希薄で、しばしば低品質であり、少数の品目しかカバーしていないため、産業システムでの使用が困難である。
我々は、スパースAURをスケーラブルなレコメンデーション信号に変換する産業フレームワークであるSARA(Scaling Articulated Rationales)を提示する。
SARAはまず、4000万のKuaishou LiveユーザからAURを抽出し、キュレートするデータエンジンを構築し、品質管理と作者中心の合理性データセットであるSARA-HQを作成した。
その後、汎用MLLMを大規模SFTとQuality-Refining DPOを通じてSARA-7Bに整列し、86,564 AURの著者から完全な10Mの著者空間まで合理的に生成する。
最後に、SARA-Rankerは、生成した正の有理と負の有理を、合理的な相互作用モデリングと拒絶メモリモデリングによって生産ランキングに統合する。
大規模なオフライン評価、人間の校正、オンラインA/Bテストにより、SARA-7Bは強力なMLLMベースラインよりも特異で極性に一貫性があり、根拠のある論理を生成し、SARA-Rankerはエンゲージメントを改善し、生産における負のフィードバックを減らす。
毎日30日以上リフレッシュされたSARAは、産業レコメンデーションシステムのための実用的な第一級テキスト信号として、明瞭な合理性を確立している。
関連論文リスト
- LLMAR: A Tuning-Free Recommendation Framework for Sparse and Text-Rich Industrial Domains [0.0]
産業用B2Bアプリケーションは極端なデータ空間に直面するが、リッチなテキストインタラクションが特徴である。
チューニング不要なフレームワーク LLMAR (LLM-Annotated Recommendation) を提案する。
推論駆動(Inference-Driven)、リフレクションループ(Reflection Loop)、コスト効果アーキテクチャ(Cost-Effective Architecture)の3つのコアコントリビューションを紹介します。
論文 参考訳(メタデータ) (2026-03-25T02:49:27Z) - Improving LLM-based Recommendation with Self-Hard Negatives from Intermediate Layers [80.55429742713623]
ILRecはLLMベースのレコメンデーションシステムのための新しい好みの微調整フレームワークである。
負の信号に対してトークンレベルの報酬を割り当てるための軽量な協調フィルタリングモデルを提案する。
3つのデータセットの実験は、LLMベースのレコメンデータシステムの性能向上におけるILRecの有効性を示している。
論文 参考訳(メタデータ) (2026-02-19T14:37:43Z) - Towards Trustworthy LLM-Based Recommendation via Rationale Integration [1.9124955180802976]
LLMに基づくレコメンデータ(LLM-Rec)を提案する。
提案手法では,自己アノテートされた有理数データセットと,有理数ファースト形式の命令チューニングを利用する。
Amazon Reviewデータセットのファッションと科学ドメインに関する実験は、確立されたベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2025-11-07T08:30:29Z) - Large Language Models can be Strong Self-Detoxifiers [82.6594169242814]
SASA(Self-disciplined Autoregressive Smpling)は、大規模言語モデル(LLM)の毒性低減のための軽量制御復号アルゴリズムである。
SASAは、自己回帰サンプリング戦略を調整することにより、電流出力のマージンを追跡し、有害な部分空間から世代を分離する。
Llama-3.1-Instruct (8B), Llama-2 (7B), GPT2-L model with the RealToxicityPrompts, BOLD, and AttaQ benchmarks。
論文 参考訳(メタデータ) (2024-10-04T17:45:15Z) - LLMEmb: Large Language Model Can Be a Good Embedding Generator for Sequential Recommendation [57.49045064294086]
大きな言語モデル(LLM)は、その人気とは無関係に、アイテム間の意味的関係をキャプチャする能力を持つ。
LLMEmb(LLMEmb)は、LCMを利用してアイテム埋め込みを生成し、逐次レコメンダシステム(SRS)の性能を向上させる手法である。
論文 参考訳(メタデータ) (2024-09-30T03:59:06Z) - Efficient and Deployable Knowledge Infusion for Open-World Recommendations via Large Language Models [53.547190001324665]
大規模言語モデル(LLM)からユーザとアイテムに関する2種類の外部知識を取得するためのREKIを提案する。
個別の知識抽出と個別の知識抽出を,異なるシナリオのスケールに合わせて開発し,オフラインのリソース消費を効果的に削減する。
実験によると、REKIは最先端のベースラインより優れており、多くの推奨アルゴリズムやタスクと互換性がある。
論文 参考訳(メタデータ) (2024-08-20T03:45:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。