論文の概要: Keeping the Index Open: The Recommendation-Side Cost of Shared Search and Recommendation
- arxiv url: http://arxiv.org/abs/2608.24079v2
- Date: Wed, 26 Aug 2026 19:59:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.760696
- Title: Keeping the Index Open: The Recommendation-Side Cost of Shared Search and Recommendation
- Title(参考訳): インデックスをオープンに保つ:共有検索とレコメンデーションの推奨側コスト
- Abstract要約: 検索とレコメンデーションの共有インデックスは、検索に探索スロットがないため、機能のみから新しい項目をスコアしなければなりません。
このオープンネスは、6つのシーケンシャルなベースラインに対して推奨され、それぞれがトレーニングされ、修正されたターゲットの5ラウンドで調整されます。
MovieLens-1Mでは、ウォーム精度が5.2%のRecall@20と11.4%のNDCG@20で最強のリトレーニングベースラインを踏襲している。
- 参考スコア(独自算出の注目度): 1.819875381521184
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A shared search-and-recommendation index must score new items from features alone because search has no exploration slot. In a public log covering both surfaces over one catalog, $38.6\%$ of held-out query-search impressions show an item never previously shown or visited. For user-cold engagements, the feature-based tower serves this demand without measurable loss against $99$ sampled negatives ($0.9595$ Recall@20 versus $0.9510$ warm). A lexical baseline reaches similar parity, while a full-catalog check remains statistically undecided. Dual-encoder retrieval therefore keeps the index \emph{open} to new items, unlike an ID-softmax recommender that requires retraining. We price this openness on recommendation against six sequential baselines, each retrained and tuned through five rounds on corrected targets. A float32 timestamp bug had reordered leave-one-out targets for $19.7\%$ of users. On MovieLens-1M, warm accuracy trails the strongest retrained baseline by $5.2\%$ Recall@20 and $11.4\%$ NDCG@20. On MIND, the gap narrows to $0.8$--$3.6\%$ relative to the five strongest baselines, though the model ranks sixth of seven. Under strict zero-leakage cold-start evaluation, the content tower achieves $0.172 \pm 0.006$ Recall@20, $1.4\times$ the strongest retrained dedicated method ($0.124 \pm 0.007$) and $3\times$ a training-free floor, without cold-specific training. Exact full-softmax training raises Recall@20 by $54\%$ on MIND-small and $6.9\%$ on MovieLens-1M over sampled InfoNCE, but recomputes the full catalog each step and exhausts accelerator memory at $240$K items. Approximate nearest-neighbor search explains none of the remaining gap, serving cost does not regress against ID-softmax retrieval, and a history-window sweep explains half the post-recipe remainder. Exact-quality training at catalog scale remains the open problem.
- Abstract(参考訳): 検索とレコメンデーションの共有インデックスは、検索に探索スロットがないため、機能のみから新しい項目をスコアしなければなりません。
両面を1つのカタログでカバーする公開ログでは、38.6\%の保持されたクエリ検索インプレッションが、これまで表示されたり、訪問されたりしたことがなかったアイテムを示している。
ユーザー主導のエンゲージメントでは、この機能ベースのタワーは99ドルのサンプルネガ(0.9595$ Recall@20対0.9510$ warm)に対して測定不能な損失を伴わずにこの需要に対応している。
語彙ベースラインも同様のパリティに達し、フルカタログチェックは統計的に未決定のままである。
デュアルエンコーダの検索は、再トレーニングを必要とするID-softmaxレコメンデータとは異なり、インデックス \emph{open} を新しい項目に保持する。
このオープンネスは、6つのシーケンシャルなベースラインに対して推奨され、それぞれがトレーニングされ、修正されたターゲットの5ラウンドで調整されます。
フロート32タイムスタンプのバグは、19.7\%のユーザに対して、アウトアウトターゲットをリオーダーした。
MovieLens-1Mでは、5.2 %$ Recall@20 と $11.4 %$ NDCG@20 が最強のリトレーニングベースラインを踏襲している。
MINDでは、このギャップは5つの最強ベースラインに対して0.8$--3.6\%に狭められている。
厳密なゼロリーカゲ冷房評価の下では、コンテンツタワーは0.172 \pm 0.006$ Recall@20, $1.4\times$ the Most Retrained dedicated method(0.124 \pm 0.007$)と3\times$ a training-free floorをコールド特殊訓練なしで達成している。
Exact full-softmax training raises Recall@20 by 5,4\%$ on MIND-small and 6,9\%$ on MovieLens-1M over sampled InfoNCE, but recomputes the full catalogs each step and exhausts accelerator memory at $240$K items。
隣接した最寄りの検索では、残りのギャップは説明されず、サービスコストはID-softmax検索に逆らわない。
カタログスケールでのエクササイズトレーニングは、依然として未解決の問題である。
関連論文リスト
- REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs [0.0]
ほとんどの視覚言語アクション(VLA)モデルはモノリシックである。
本稿では、再利用可能なスキルを学習するためのウェイク/スリープモデルシステムであるREFACTOR-VLAを紹介する。
論文 参考訳(メタデータ) (2026-09-01T13:19:05Z) - Where Grounding Accuracy Lives on the IoU Curve: Label-Free Inference-Time Boundary Refinement [1.4061915592167218]
視覚言語モデルは、不正確なバウンディングボックスを返しながら正しい参照を識別することができる。
そこで本研究では,凍結直接解答モデルを用いて局所的な観測を行う方法について検討する。
3つのエビデンスレベルにまたがって結果を報告します。
論文 参考訳(メタデータ) (2026-08-20T01:40:32Z) - Beyond Self-Knowledge: Propagating Uncertainty Across Reasoning and Retrieval in LLMs [4.476374205849672]
ブラックボックス言語モデルの言語的信頼度は、検索ルーティングのための実用的な信号として機能する。
6つのQAベンチマーク、3つのモデルファミリー、3つの検索ポリシーで27,000のポリシーインスタンスを評価した。
論文 参考訳(メタデータ) (2026-07-28T11:30:25Z) - ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation [72.54604107217669]
textscpass@$k$は圧縮後にほぼ消滅するが、textscpass@$k$は繰り返しサンプリングの下でほぼ回復する。
回復は、密集したトークンレベルの監督の下で、圧縮されたモデル自身のオン政治状態で訓練すべきである。
我々は,教師が確認した反復接尾辞を検知する短時間のOPDスケジュールであるtextbfshortopdを提案する。
論文 参考訳(メタデータ) (2026-07-14T17:50:50Z) - InfluMatch: Frontier-Quality KOL Search at 4B-Model Cost [0.0]
私たちは、小さなオープンウェイトモデルで作られた安価な3段階のカスケード -- 検索$rightarrow$rerank$rightarrow$ reason -- を提示します。
このカスケードはコストのために設計されており、フィルターされたトップ10ハーフのトークンを、50点以上のトークンを推論するのに対して、14点以上のトークンを推論する。
その結果、フロンティアサービスコストのごく一部で、デプロイ可能で説明可能なKOLサーチシステムとなった。
論文 参考訳(メタデータ) (2026-07-07T08:04:05Z) - The Security Budget of Code-LLM Prompt Hardening: Provable Limits Under Pass-Only Acceptance [0.0]
本稿では,emphTri-Audit Protocolとしてフロアを運用する。このプロトコルは,プロンプト側推論レジストリ属性をモデル側実証ログから分離する2軸レポーティングプロトコルである。
CodeLlama-7B, Qwen2.5-Coder-7B/1.5B and DeepSeek-Coder-6.7B at $n=164$ yields the emphCross-Model Tri-Audit Invariance: of 28 pass-serving rows, 12-changed-of-record learned-can
論文 参考訳(メタデータ) (2026-06-02T08:22:14Z) - Which Defense Closes Which Threat? Attributing OWASP-LLM-Top-10 Coverage and Its Brittleness Under Paraphrasing [51.56484100374058]
プロダクションLLMアプリケーションは、いくつかの防衛ファミリを積み重ねる -- 拒絶フレーズフィルタ、トークンバッジコントロール、モデル許容度リスト、レート制限、ツール登録認証 -- が、BASベンチマークでは、単一の集計カバレッジ番号を報告している。
21エージェントベースラインスキャナに4つのLLM-Top-10対応エージェントを追加し、4つの合成LDMエンドポイントの格子をターゲットとした。
論文 参考訳(メタデータ) (2026-06-01T19:39:25Z) - The Tutoring Effectiveness Index: Predicting LLM Math Tutor Quality from Four Conversation Signals [0.12277343096128711]
本研究では,Schoenfeld-Verifyキーワード比,数学ステップ密度,エンドクエストレート,ディープシンキング比プローブからのディープ推論ゲートを組み合わせた,学習自由な判定自由な4信号指標を提案する。
TEIで$N$候補から選択すると、事前不正シナリオの改善率は59.0%$から8.1.9%$まで上昇し、凍結したDeepSeek-R1-8Bベースで$N=8$となる。
論文 参考訳(メタデータ) (2026-05-28T23:55:33Z) - PAR$^2$-RAG: Planned Active Retrieval and Reasoning for Multi-Hop Question Answering [57.89576196160413]
大規模言語モデル (LLM) はマルチホップ質問応答 (MHQA) において脆弱のままである。
textbfPlanned Active Retrieval and Reasoning RAG (PAR$2-RAG)を提案する。
論文 参考訳(メタデータ) (2026-03-30T23:52:54Z) - Do Post-Training Algorithms Actually Differ? A Controlled Study Across Model Scales Uncovers Scale-Dependent Ranking Inversions [1.6498361958317636]
51のポストトレーニングアルゴリズムを同一のインフラで実装した統合フレームワークを提案する。
本研究では,4つのモデルスケール(0.5B--7B),3つの評価領域,20種類のDPO分類にまたがる8つのアルゴリズムについて検討した。
20種類のDPOはボンフェロニ補正後にバニラDPOを著しく上回りませんが、唯一の重要な異常値であるSimPOはより悪くなります。
論文 参考訳(メタデータ) (2026-03-19T04:10:38Z) - Resource-Efficient Iterative LLM-Based NAS with Feedback Memory [49.44875022114861]
ニューラルアーキテクチャサーチ(NAS)はネットワーク設計を自動化するが、従来の手法ではかなりの計算資源を必要とする。
本稿では,大規模言語モデル(LLM)を活用して,畳み込みニューラルネットワークアーキテクチャを反復的に生成し,評価し,洗練するクローズドループパイプラインを提案する。
論文 参考訳(メタデータ) (2026-03-12T16:00:22Z) - SE-Search: Self-Evolving Search Agent via Memory and Dense Reward [87.79131676521656]
Retrieval augmented generation (RAG)は、検索した外部知識を条件づけることにより、大規模言語モデル(LLM)における幻覚や事実エラーを低減する。
既存の手法は、無関係または騒々しい文書を蓄積し、希少な強化学習信号に依存することが多い。
我々は,3つのコンポーネントによるオンライン検索行動を改善するセルフ進化検索エージェントであるtextbfSelf-textbfEvolving textbfSearchを提案する。
論文 参考訳(メタデータ) (2026-02-06T09:14:07Z) - Simple ReFlow: Improved Techniques for Fast Flow Models [68.32300636049008]
拡散および流れマッチングモデルは、優れた生成性能を実現するが、多くのサンプリングステップを犠牲にしている。
我々は、力学、学習、推論のトレーニングに7つの改善点を提案する。
我々は、ニューラルネットワークによる高速な生成のために、最先端のFIDスコア(ガイダンスなし/参照なし)を達成している。
論文 参考訳(メタデータ) (2024-10-10T11:00:55Z) - Fast Rates for Bandit PAC Multiclass Classification [73.17969992976501]
我々は,帯域幅フィードバックを用いたマルチクラスPAC学習について検討し,入力を$K$ラベルの1つに分類し,予測されたラベルが正しいか否かに制限する。
我々の主な貢献は、問題の無知な$(varepsilon,delta)$PACバージョンのための新しい学習アルゴリズムを設計することである。
論文 参考訳(メタデータ) (2024-06-18T08:54:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。