論文の概要: Diagnosing and Mitigating Retrieval Bottlenecks in LLM-Based Cold-Start Recommendation
- arxiv url: http://arxiv.org/abs/2606.29947v1
- Date: Mon, 29 Jun 2026 08:23:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.126994
- Title: Diagnosing and Mitigating Retrieval Bottlenecks in LLM-Based Cold-Start Recommendation
- Title(参考訳): LLMによるコールドスタート勧告の診断と緩和
- Authors: Zhe Dong, Fang Qin, Manish Shah, Yicheng Wang,
- Abstract要約: 大型言語モデル (LLM) はレコメンデーターシステムにおいてリランカーとして使われることが多い。
この仮定を5ドメインのベンチマークで検証し、検索カバレッジから品質を明示的に分離する。
LLMは、特にアイテムがすでに存在するとき、テキストリッチなドメインにおいて、コールドスタートの利点を示すが、この利点は、現在の検索待ちのパイプラインではほとんど到達できない。
- 参考スコア(独自算出の注目度): 10.60293484295824
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly used as rerankers in recommender systems, with the expectation that semantic understanding will help in cold-start and long-tail regimes. We test this assumption with a five-domain benchmark that explicitly separates reranking quality from retrieval coverage. In a positive-controlled regime where the gold item is guaranteed present, calibrated LLM rerankers fail to consistently outperform strong collaborative and content baselines under natural traffic, and within-family scaling from Qwen3-8B to Qwen3-32B narrows but does not close the gap on most domains. In a retrieval-realistic regime where the gold item is not injected, the bottleneck is more severe: standard single retrievers place the gold item in a 200-item pool only 4.6-22.9% of the time, largely because 32-91% of cold-start targets are brand-new items with no training interactions. We introduce LHF, a validation-trained learned hybrid fusion layer over a multi-retriever union pool, as a retrieval-side realizability baseline. LHF is the only combiner we test that beats every single retriever on all five domains and recovers 17-61% of oracle coverage headroom on content-rich domains, but only 5-7% on collaboratively strong domains. End-to-end experiments reveal the remaining mismatch: learned non-LLM ranking exploits the LHF pool, while prompt-level LLM reranking often degrades it. LLMs exhibit pockets of semantic cold-start advantage, especially in text-rich domains when the item is already present, but this advantage is largely unreachable in current retrieve-then-rerank pipelines. We release the benchmark protocol, splits, prompts, evaluation tooling, and archived reproducibility artifacts: data at https://doi.org/10.5281/zenodo.20991039 and code at https://doi.org/10.5281/zenodo.20993306.
- Abstract(参考訳): 大規模言語モデル(LLM)は、コールドスタートやロングテールのレシエーションにおいて意味理解が役立つことを期待して、レコメンデーションシステムにおいてリランカーとしてますます使われている。
この仮定を5ドメインのベンチマークで検証し、検索カバレッジから品質を明示的に分離する。
ゴールドアイテムが保証されている正の制御体制では、キャリブレーションされたLCMリランカーは、自然なトラフィック下で強い協調的およびコンテンツベースラインを一貫して上回ることができず、Qwen3-8BからQwen3-32Bへの内部スケーリングは、ほとんどのドメインでギャップを埋めない。
通常のシングルレトリバーは、金品を200石のプールに置くのは4.6-22.9%に過ぎず、冷戦目標の32-91%が新品で、トレーニングは行わないためである。
本稿では,マルチレトリバー結合プール上で学習したハイブリッド核融合層であるLHFを,検索側で実現可能なベースラインとして紹介する。
LHFは、私たちがテストした唯一のコンバインダーで、5つのドメインすべてですべてのレトリバーを破り、コンテンツリッチなドメインで17~61%のオラクルカバレッジヘッドルームを回復するが、協調的に強力なドメインでは5~7%しかありません。
学習された非LLMランキングはLHFプールを悪用し、プロンプトレベルのLLMランキングはしばしば劣化する。
LLMにはセマンティックコールドスタートの利点があり、特にテキストリッチなドメインではアイテムがすでに存在するが、この利点は現在の検索待ちのパイプラインではほとんど到達できない。
data at https://doi.org/10.5281/zenodo.20991039 and code at https://doi.org/10.5281/zenodo.20993306。
関連論文リスト
- OpenDeepThink: Parallel Reasoning via Bradley-Terry Aggregation [53.88666485159289]
OpenDeepThinkは、集団ベースのテスト時間計算フレームワークで、ペアワイズBradley-Terryの比較によって選択する。
OpenDeepThinkはGemini 3.1 ProのCodeforces Eloを8回のLCMコールラウンドで+405ポイント引き上げる。
CF-73は、国際グランドマスターアノテーションによる73の専門家評価コードフォース問題と、公式判決に対する99%の地域評価合意のキュレートされたセットである。
論文 参考訳(メタデータ) (2026-05-14T17:57:40Z) - Mira-Embeddings-V1: Domain-Adapted Semantic Reranking for Recruitment via LLM-Synthesized Data [12.621394200451613]
採用ドメインのセマンティックリグレードシステムであるmira-embeddings-v1を提案する。
実際のJDから始めて、5段階のプロンプトパイプラインを構築し、さまざまな正と強のサンプルを生成する。
次に、JD--JDコントラストトレーニングとJD--CVトリプルトアライメントの2ラウンドLoRA適応を適用した。
論文 参考訳(メタデータ) (2026-04-20T02:51:12Z) - OpenSanctions Pairs: Large-Scale Entity Matching with LLMs [0.9131359219276399]
我々は,実世界の国際制裁アグリゲーションとアナリストの重複から派生した,大規模エンティティマッチングベンチマークOpenSanctions Pairsをリリースした。
データセットには、31か国で293の異種源にまたがる755,540のラベル付きペアが含まれている。
オフザシェルフ LLM は生産ルールベースのベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2026-02-24T06:25:49Z) - ReFilter: Improving Robustness of Retrieval-Augmented Generation via Gated Filter [21.74343337071446]
本稿ではトークンレベルのフィルタリングと融合を行う新しい潜伏型融合フレームワークを提案する。
ReFilterは、コンテキスト特徴をエンコードするコンテキストエンコーダ、トークンを重み付けするゲートフィルタ、トークン融合モジュールの3つの重要なコンポーネントで構成されている。
実験の結果、ReFilterはドメイン内適応とドメイン外転送の両方で、常に最高の平均性能を達成できることがわかった。
論文 参考訳(メタデータ) (2026-02-13T08:25:26Z) - Diagnosing LLM-based Rerankers in Cold-Start Recommender Systems: Coverage, Exposure and Practical Mitigations [0.0]
大規模言語モデル(LLM)とクロスエンコーダのリランカーはレコメンダシステムの改善に注目されている。
本稿では,Serendipity-2018データセットを用いた冷間開始映画レコメンデーションにおけるクロスエンコーダリランカーの系統的診断について述べる。
論文 参考訳(メタデータ) (2026-02-09T16:44:42Z) - Enhancing LLM-based Fault Localization with a Functionality-Aware Retrieval-Augmented Generation Framework [14.287359838639608]
FaR-Locは、メソッドレベルの障害ローカライゼーションを強化するフレームワークである。
FaR-Locは、LLM機能抽出、Semantic Retrieval、LLM再ランクの3つの重要なコンポーネントで構成されている。
広く使われているDefects4Jベンチマーク実験により、FaR-Locは最先端のLCMベースラインよりも優れていることが示された。
論文 参考訳(メタデータ) (2025-09-24T20:37:11Z) - WikiContradict: A Benchmark for Evaluating LLMs on Real-World Knowledge Conflicts from Wikipedia [59.96425443250666]
Retrieval-augmented Generation (RAG) は,大規模言語モデル(LLM)の限界を緩和する,有望なソリューションとして登場した。
本研究では,ウィキペディアからの矛盾文に基づく質問に対するLLM生成回答の総合評価を行う。
我々は、単一のパスを持つRAGと2つの矛盾するパスを持つRAGを含む、様々なQAシナリオ下で、クローズドおよびオープンソース両方のLSMをベンチマークする。
論文 参考訳(メタデータ) (2024-06-19T20:13:42Z) - SuRe: Summarizing Retrievals using Answer Candidates for Open-domain QA of LLMs [85.54906813106683]
大規模言語モデル(LLM)を用いたオープンドメイン質問応答(ODQA)の簡易かつ効果的なフレームワークを提案する。
SuRe は LLM が与えられた質問に対するより正確な回答を予測するのに役立つ。
様々なODQAベンチマークの実験結果はSuReの優位性を示し、標準的なプロンプトアプローチよりも4.6%、F1スコアが4.0%向上した。
論文 参考訳(メタデータ) (2024-04-17T01:15:54Z) - SPRINT: A Unified Toolkit for Evaluating and Demystifying Zero-shot
Neural Sparse Retrieval [92.27387459751309]
ニューラルスパース検索を評価するための統一PythonツールキットであるSPRINTを提供する。
我々は、よく認識されているベンチマークBEIRにおいて、強く再現可能なゼロショットスパース検索ベースラインを確立する。
SPLADEv2は、元のクエリとドキュメントの外で、ほとんどのトークンでスパース表現を生成する。
論文 参考訳(メタデータ) (2023-07-19T22:48:02Z) - Allies: Prompting Large Language Model with Beam Search [107.38790111856761]
本研究では,ALIESと呼ばれる新しい手法を提案する。
入力クエリが与えられた場合、ALLIESはLLMを活用して、元のクエリに関連する新しいクエリを反復的に生成する。
元のクエリのスコープを反復的に精錬して拡張することにより、ALLIESは直接検索できない隠れた知識をキャプチャし、利用する。
論文 参考訳(メタデータ) (2023-05-24T06:16:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。