論文の概要: LLM-Derived Priors for Thompson Sampling in Cold-Start Comment Recommendation
- arxiv url: http://arxiv.org/abs/2608.03382v1
- Date: Tue, 04 Aug 2026 09:31:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.112695
- Title: LLM-Derived Priors for Thompson Sampling in Cold-Start Comment Recommendation
- Title(参考訳): LLM-Derived Priors for Thompson Smpling in Cold-Start Comment Recommendation
- Authors: Eugene Lee, Oseong Choi, Byungsoo Kang, Taeyeong Jang,
- Abstract要約: マルチアームバンディットアルゴリズムはオンラインレコメンデーションで広く使われている。
これらのアルゴリズムは、新しく導入されたアームが相互作用履歴をほとんどあるいは全く持たない場合に、コールドスタートの制限に悩まされることが多い。
我々は大言語モデル(LLM)を用いて、コメントテキストから意味的信号を抽出し、それらを情報的ベイズ先行語に変換する。
- 参考スコア(独自算出の注目度): 1.7219362335740875
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-armed bandit algorithms, especially Thompson sampling, are widely used in online recommendation. Despite their ability to adapt from online feedback, these methods often suffer from cold-start limitations when newly introduced arms have little or no interaction history. In our setting, the candidate arms are user-generated textual comments, whose semantic content can reveal a title's appeal before sufficient interaction feedback is available. We therefore use large language models (LLMs) to extract semantic signals from comment text and convert them into informative Bayesian priors that warm-start Thompson sampling under sparse early-stage feedback. To account for aggregate segment-level differences in response patterns, we maintain and update posteriors separately for each gender-age segment. In a real-world online A/B/C test, we compare a uniform prior with two LLM-based designs: a Gender Prior for demographic-affinity cues and a Content Prior for title-specific identity cues. The results show that LLM-based priors are most beneficial in sparse-feedback regimes -- with the largest gains emerging once a small amount of interaction evidence has accumulated -- and that prior design leads to distinct funnel-level effects. We further analyze prior-reward alignment and demographic heterogeneity, finding that click-oriented alignment is strongest for the Gender Prior and that treatment effects vary substantially across demographic segments. These findings suggest that LLM-derived priors can serve as a practical warm-start mechanism for text-rich bandit recommendation, while also revealing deployment trade-offs.
- Abstract(参考訳): マルチアームバンディットアルゴリズム、特にトンプソンサンプリングは、オンラインレコメンデーションで広く使われている。
オンラインフィードバックから適応する能力にもかかわらず、これらの手法は、新しく導入された腕が相互作用履歴をほとんどあるいは全く持たない場合に、コールドスタートの制限に悩まされることが多い。
我々の設定では、候補アームはユーザ生成のテキストコメントであり、セマンティックコンテンツは十分なインタラクションフィードバックが得られない前にタイトルの魅力を明らかにすることができる。
そこで我々は,大言語モデル(LLM)を用いてコメントテキストから意味的信号を抽出し,少ない初期フィードバック下でのウォームスタートトンプソンサンプリングをベイズ的事前情報に変換する。
応答パターンの集合的なセグメントレベルの差異を考慮に入れ, 性別・年齢区分ごとに後部を個別に維持・更新する。
実世界のオンラインA/B/Cテストでは、一様前と LLM ベースの2つのデザインを比較します。
その結果、LSMベースの事前設計はスパースフィードバック体制において最も有益であり、少量の相互作用証拠が蓄積されると最大の利益が生まれる。
さらに,前向きアライメントと人口動態の不均一性を分析し,クリック指向アライメントがジェンダープライドにとって最強であること,および治療効果が人口層によって大きく異なることを見出した。
これらの結果から, LLM由来の先行技術は, テキストリッチなバンディットレコメンデーションにおいて, 実践的なウォームスタート機構として機能し, 展開のトレードオフを明らかにすることが示唆された。
関連論文リスト
- Jump Start or False Start? A Theoretical and Empirical Evaluation of LLM-initialized Bandits [18.22679814321862]
温暖化は依然として30%の汚職に有効であり、40%の優位性を失い、50%以上のパフォーマンスを低下させます。
我々は,ランダムなラベルノイズと系統的な誤りが,バンドイットを後悔させる前の誤りに与える影響を分解する理論解析を開発した。
論文 参考訳(メタデータ) (2026-04-02T21:27:18Z) - Dynamic Prior Thompson Sampling for Cold-Start Exploration in Recommender Systems [14.172382892203851]
大規模なレコメンデーションシステムにおいて、コールドスタート探索は重要な課題である。
我々は,新しいアームが現時点の勝者に勝る確率を直接制御する事前設計である動的優先トンプソンサンプリングを提案する。
論文 参考訳(メタデータ) (2026-02-01T00:01:41Z) - How Do LLM-Generated Texts Impact Term-Based Retrieval Models? [76.92519309816008]
本稿では,大規模言語モデル(LLM)が項ベース検索モデルに与える影響について検討する。
言語学的解析により,LLM生成テキストはよりスムーズで低周波なZipf勾配を示すことが明らかとなった。
本研究は,項分布がクエリと密接に一致した文書を優先して,項ベース検索モデルがソースバイアスを示すかどうかを考察する。
論文 参考訳(メタデータ) (2025-08-25T06:43:27Z) - End-to-End Personalization: Unifying Recommender Systems with Large Language Models [0.0]
グラフ注意ネットワーク(GAT)と大言語モデル(LLM)を組み合わせた新しいハイブリッドレコメンデーションフレームワークを提案する。
LLMは、タイトル、ジャンル、概要などのメタデータに基づいて意味的に意味のあるプロファイルを生成することによって、ユーザーとアイテムの表現を豊かにするために最初に使用される。
MovieLens 100kと1Mを含むベンチマークデータセットでモデルを評価し、強いベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2025-08-02T22:46:50Z) - Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization [25.290462963681257]
MLLM(Multimodal Large Language Models)は、視覚的な入力に基づいて応答を生成する。
彼らはしばしば、事前学習したコーパスと同様の反応を生み出すバイアスに悩まされ、視覚情報の重要性を誇示する。
我々は、このバイアスを事前学習統計のための"推奨"として扱い、視覚入力におけるモデルの基盤を妨げます。
論文 参考訳(メタデータ) (2024-03-13T17:29:45Z) - Nash Learning from Human Feedback [86.09617990412941]
ペアワイズフィードバックを用いた大規模言語モデルの微調整のための代替パイプラインを提案する。
我々はこのアプローチを人間のフィードバックからナッシュラーニング(NLHF)と呼ぶ。
ミラー降下原理に基づく新しいアルゴリズム解であるNash-MDを提案する。
論文 参考訳(メタデータ) (2023-12-01T19:26:23Z) - On the steerability of large language models toward data-driven personas [98.9138902560793]
大規模言語モデル(LLM)は、特定のグループや集団の意見が不足している偏りのある応答を生成することが知られている。
本稿では, LLM を用いて特定の視点の制御可能な生成を実現するための新しい手法を提案する。
論文 参考訳(メタデータ) (2023-11-08T19:01:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。