論文の概要: Beyond Static Best-of-N: Bayesian List-wise Alignment for LLM-based Recommendation
- arxiv url: http://arxiv.org/abs/2605.04559v1
- Date: Wed, 06 May 2026 07:02:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.688147
- Title: Beyond Static Best-of-N: Bayesian List-wise Alignment for LLM-based Recommendation
- Title(参考訳): 静的Best-of-N:LLMに基づくレコメンデーションのためのベイジアンリストワイドアライメント
- Authors: Ruijun Chen, Chongming Gao, Jiawei Chen, Weiqin Yang, Xiangnan He,
- Abstract要約: 大規模言語モデルは、ユーザ好みをモデル化するための生成機能を活用することで、レコメンデーションシステム(LLM4Rec)に革命をもたらした。
既存のLLM4Recメソッドはトークンレベルの目的に依存しており、実際のレコメンデーション品質を定義するリストレベルと非微分可能なメトリクスを最適化することは困難である。
我々はこれらの課題を克服するためにBLADE (Bayesian List-wise Alignment via Dynamic Estimation)を提案する。
- 参考スコア(独自算出の注目度): 23.95623437107717
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models have revolutionized recommender systems (LLM4Rec) by leveraging their generative capabilities to model complex user preferences. However, existing LLM4Rec methods primarily rely on token-level objectives, making it difficult to optimize list-level and non-differentiable metrics (e.g., NDCG, fairness) that define actual recommendation quality. While Best-of-N (BoN) directly optimizes these metrics during inference, its high computational cost hinders real-world deployment. To address this, BoN Alignment aims to distill the search capability into the model itself, yet current approaches suffer from two critical limitations: (1) Indiscriminate Supervision, where the static reference fails to distinguish the relative quality of candidates exceeding its empirical range, leading to a loss of ranking guidance; and (2) Gradient Decay, where the effective supervision signal rapidly diminishes as the evolving policy improves, resulting in inefficient optimization. To overcome these challenges, we propose BLADE (Bayesian List-wise Alignment via Dynamic Estimation). Unlike static approaches, BLADE introduces a Bayesian framework that continuously updates the target distribution by fusing historical priors with dynamic evidence from the model's current rollouts. This mechanism constructs a self-evolving target that adapts to the model's growing capabilities, ensuring the training signal remains informative throughout the learning process. Extensive experiments on three real-world datasets demonstrate that BLADE significantly outperforms state-of-the-art baselines. Crucially, it breaks the static performance upper bound, achieving sustained gains in both ranking accuracy (Recall, NDCG) and complex list-wise metrics (Fairness, Diversity). The code is available via https://github.com/RegionCh/BLADE.
- Abstract(参考訳): 大規模言語モデルは、複雑なユーザの好みをモデル化するための生成能力を活用することで、推奨システム(LLM4Rec)に革命をもたらした。
しかし、既存のLLM4Recメソッドは主にトークンレベルの目的に依存しており、実際のレコメンデーション品質を定義するリストレベルと非微分可能なメトリクス(例えば、NDCG、フェアネス)を最適化することは困難である。
Best-of-N(BoN)は推論中にこれらのメトリクスを直接最適化するが、その高い計算コストは実際のデプロイメントを妨げる。
この問題を解決するため、BoN Alignment は探索能力をモデル自体に抽出することを目的としているが、現在のアプローチでは、(1) 静的参照が試験範囲を超える候補の相対的な品質を識別できず、ランキングガイダンスが失われる、(2) 効果的な監視信号が急速に減少し、非効率な最適化をもたらす、という2つの重要な制限に悩まされている。
これらの課題を克服するため,我々はBLADE (Bayesian List-wise Alignment via Dynamic Estimation)を提案する。
静的アプローチとは異なり、BLADEはベイズ的フレームワークを導入し、現在のロールアウトからの動的な証拠と過去の先行情報を融合することで、目標の分布を継続的に更新する。
このメカニズムは、学習プロセスを通してトレーニング信号が情報的であることを保証するために、モデルの成長能力に適応する自己進化的ターゲットを構築する。
3つの実世界のデータセットに対する大規模な実験は、BLADEが最先端のベースラインを大幅に上回っていることを示している。
重要なことに、静的パフォーマンス上限を破り、ランキング精度(リコール、NDCG)と複雑なリストワイドメトリクス(フェアネス、ダイバーシティ)の両方で持続的なゲインを達成する。
コードはhttps://github.com/RegionCh/BLADE.comから入手できる。
関連論文リスト
- Dual-End Consistency Model [41.982957134224904]
スロー反復サンプリングは拡散モデルとフローベース生成モデルの実践的展開において大きなボトルネックとなる。
本稿では,安定かつ効果的なトレーニングを実現するために,バイタルサブ軌道クラスタを選択するDual-End Consistency Model (DE-CM)を提案する。
提案手法は,ImageNet 256x256データセットの1ステップ生成において,最先端のFIDスコア1.70を達成し,既存のCMベースのワンステップアプローチよりも優れていた。
論文 参考訳(メタデータ) (2026-02-11T11:51:01Z) - Not All Preferences Are Created Equal: Stability-Aware and Gradient-Efficient Alignment for Reasoning Models [52.48582333951919]
ポリシー更新の信号対雑音比を最大化することにより、アライメントの信頼性を高めるために設計された動的フレームワークを提案する。
SAGE(Stability-Aware Gradient Efficiency)は、モデル能力に基づいて候補プールをリフレッシュする粗いきめ細かいカリキュラムメカニズムを統合する。
複数の数学的推論ベンチマークの実験により、SAGEは収束を著しく加速し、静的ベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2026-02-01T12:56:10Z) - CE-RM: A Pointwise Generative Reward Model Optimized via Two-Stage Rollout and Unified Criteria [48.70940362676624]
専用の2段階ロールアウト法を用いて学習したポイントワイズ生成報酬モデルCE-RM-4Bを提案する。
オープンソースの選好データセットから算出した約5.7Kの高品質データを用いて、CE-RM-4Bは様々な報奨モデルベンチマークにおいて優れた性能を実現する。
論文 参考訳(メタデータ) (2026-01-28T07:46:13Z) - Bayesian Natural Gradient Fine-Tuning of CLIP Models via Kalman Filtering [4.681301898136104]
視覚言語による事前学習モデルにおいて、最適性能を達成する上で大きな課題となる微調整は少ない。
本稿では,CLIPモデルに対するカルマンフィルタを用いた自然明度(NGD)のベイズ近似を提案する。
我々のアルゴリズムは、最先端のベースラインよりも優れた、もしくは同等のID性能を一貫して達成する。
論文 参考訳(メタデータ) (2025-11-03T16:00:45Z) - ERank: Fusing Supervised Fine-Tuning and Reinforcement Learning for Effective and Efficient Text Reranking [33.25740773392183]
ERankは、多種多様な関連シナリオにまたがるLLMから構築された、非常に効率的で効率的なポイントワイド・リランカである。
スーパーバイザードファインチューニング(SFT)から始まる新しい2段階トレーニングパイプラインを提案する。
この段階では、二進ラベルを超えてモデルを生成的に訓練し、微粒な整数スコアを出力し、妥当性の識別を大幅に向上させる。
BRIGHT, FollowIR, TREC DL, BEIRベンチマークにおけるERankリランカの評価を行い, 既存手法と比較して優れた有効性と堅牢性を示した。
論文 参考訳(メタデータ) (2025-08-30T14:56:53Z) - RoHOI: Robustness Benchmark for Human-Object Interaction Detection [84.78366452133514]
ヒューマン・オブジェクト・インタラクション(HOI)検出は、コンテキスト認識支援を可能にするロボット・ヒューマン・アシストに不可欠である。
HOI検出のための最初のベンチマークを導入し、様々な課題下でモデルのレジリエンスを評価する。
我々のベンチマークであるRoHOIは、HICO-DETとV-COCOデータセットに基づく20の汚職タイプと、新しいロバストネスにフォーカスしたメトリクスを含んでいる。
論文 参考訳(メタデータ) (2025-07-12T01:58:04Z) - Dynamic Noise Preference Optimization for LLM Self-Improvement via Synthetic Data [51.62162460809116]
我々は、イテレーション間で一貫した改善を保証するために、動的ノイズ優先最適化(DNPO)を導入します。
Zephyr-7Bでの実験では、DNPOは既存の手法を一貫して上回り、平均性能は2.6%向上した。
DNPOは、GPT-4評価のベースラインに比べて29.4%のウィンロス率差で、モデル生成データの品質が大幅に向上したことを示している。
論文 参考訳(メタデータ) (2025-02-08T01:20:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。