論文の概要: RouteRec: Strict Evaluation of Recommender-Agent Selection and Aggregation
- arxiv url: http://arxiv.org/abs/2607.09908v1
- Date: Fri, 10 Jul 2026 18:58:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.243388
- Title: RouteRec: Strict Evaluation of Recommender-Agent Selection and Aggregation
- Title(参考訳): RouteRec: Recommender-Agent選択と集約の厳密な評価
- Abstract要約: RouteRecは、要求レベルのハードセレクションとアイテムレベルの学習アグリゲーションを比較するフレームワークである。
MovieLens-1Mでは、フルクオリティのオラクルには相当なヘッドルーム(HR@10 = 0.584)がある。
結果として得られる教訓は、ルーティングが解決されるのではなく、アイテムレベルの集約がより有望なアクション空間であるということだ。
- 参考スコア(独自算出の注目度): 4.548136909830987
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recommender systems increasingly face a choice among heterogeneous agents -- collaborative filters, sequential models, content-based retrievers, and LLM-based rerankers -- yet no single agent is uniformly best. We study this choice as task-aware agent ranking under cost constraints using RouteRec, a framework that compares request-level hard selection with item-level learned aggregation over four traditional recommender agents and one LLM reranker agent. On MovieLens-1M, the full quality oracle has substantial headroom (HR@10 = 0.584), confirming that useful cross-agent signal exists. Under a leakage-free 5-fold out-of-fold protocol, however, hard selection remains below BM25 (0.223 vs. 0.254), and selective LLM escalation does not improve it. The same protocol yields a different outcome for learned aggregation: its cheap-only variant matches BM25 in HR and has a higher NDCG point estimate (0.123 vs. 0.114), while gated all-agent aggregation reaches HR@10 = 0.295 with 70.2\% LLM calls. The resulting lesson is not that routing is solved, but that request-level selection of one complete agent list is too coarse for this sparse fixed-candidate setting; item-level aggregation is the more promising action space.
- Abstract(参考訳): レコメンダシステムは、コラボレーティブフィルタ、シーケンシャルモデル、コンテンツベースレトリバー、LCMベースのリランダなど、異種エージェントの選択肢にますます直面している。
本研究では,従来のレコメンデータエージェント4種とLCMリランカエージェント1種に対して,要求レベルのハードセレクションとアイテムレベルの学習集約を比較するフレームワークであるRouteRecを用いて,コスト制約下でのタスク認識エージェントランキングとしてこの選択を検討した。
MovieLens-1Mでは、フルクオリティのオラクルは相当なヘッドルーム(HR@10 = 0.584)を持ち、有用なクロスエージェント信号が存在することを確認している。
しかし、リークフリーの5倍アウトオブフォールドプロトコルでは、ハードセレクションはBM25 (0.223 vs. 0.254) 以下であり、選択的なLCMエスカレーションは改善しない。
同じプロトコルは、学習したアグリゲーションに対して異なる結果をもたらす: その安価な唯一の変種はHRでBM25と一致し、より高いNDCG点推定値(0.123 vs. 0.114)を持ち、ゲートされたオールエージェントアグリゲーションは、70.2\% LLMコールでHR@10 = 0.295に達する。
結果として得られた教訓は、ルーティングが解決されるのではなく、1つの完全なエージェントリストの要求レベルの選択がこのスパースな固定候補設定では粗い。
関連論文リスト
- Natural-Language-Guided Generator-Agnostic Shortlisting for Protein Binder Design [16.443448156662644]
現代のde novo設計は、多くの候補タンパク質結合体を生成するが、湿式検証能力は限られている。
LLMが事前計算された構造信頼度とインタフェース品質のプロキシスコアからマルチメトリックランキングポリシーを生成できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-08-21T05:32:26Z) - SLMs as Multi-Agent Routers: A Progressive SFT and Reinforcement Learning Approach [35.31208793946578]
特殊検索エージェントは一般的に汎用検索よりも高品質な検索結果を呈する。
現在のアプローチでは、推測されたトピックや意図に基づいてクエリをルーティングするが、検索されたコンテンツからのシグナルは含まない。
我々は、教師付き微調整と強化学習により、小さな言語モデルを訓練することで、この問題に対処する。
論文 参考訳(メタデータ) (2026-07-15T11:11:39Z) - Multi-Agent Routing as Set-Valued Prediction: A WildChat Benchmark and Cost-Aware Evaluation [0.0]
ここで導入されたベンチマークには、固定された12エージェントカタログに3000のプロンプトが含まれている。
評価プロトコルは、設定レベルメトリクス(Precision, Recall, F1, Jaccard, Exact Match)、レイテンシ、実行指向の能力被覆シミュレーション、制約付き重み付け設定を組み合わせる。
論文 参考訳(メタデータ) (2026-06-27T13:59:46Z) - Graph-of-Agents: A Graph-based Framework for Multi-Agent LLM Collaboration [57.23877089929136]
Graph-of-Agents (GoA)はマルチエージェントLLM通信をモデリングするための新しいグラフベースのフレームワークである。
GoAは3つの選択されたエージェントしか使用せず、最近のマルチエージェントLCMベースラインよりも優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-04-18T21:13:03Z) - Agent Q-Mix: Selecting the Right Action for LLM Multi-Agent Systems through Reinforcement Learning [68.85408801740228]
協調型マルチエージェント強化学習問題としてトポロジ選択を再構成する強化学習フレームワークである textbfAgent Q-Mix を提案する。
提案手法は,Qmix値分解を用いて分散化された通信決定を学習し,各エージェントがラウンドワイド通信グラフを共同生成する一連の通信行動から選択する。
エージェントQ-Mixは,エージェント故障に対して優れたトークン効率とロバスト性を示しながら,既存手法と比較して高い平均精度を達成する。
論文 参考訳(メタデータ) (2026-04-01T00:38:24Z) - When Agents Disagree: The Selection Bottleneck in Multi-Agent LLM Pipelines [0.0]
マルチエージェントLLMパイプラインは、チームの多様性がアウトプット品質を改善するかどうかという矛盾した証拠を生み出します。
多様性が役に立つか傷つくかを判断する選択ボトルネックを特定することで解決法を提案する。
この結果から, セレクタの品質は, 単ラウンドジェネレータ選択パイプラインにおけるジェネレータの多様性よりも, より影響の高い設計レバーである可能性が示唆された。
論文 参考訳(メタデータ) (2026-03-20T00:50:53Z) - AgentSelect: Benchmark for Narrative Query-to-Agent Recommendation [39.61543921719145]
AgentSelectは、エージェントの選択をナラティブクエリからエージェントへのレコメンデーションとして再設計するベンチマークである。
異種評価アーティファクトを、統一された正のみの相互作用データに変換する。
AgentSelectは、エージェントレコメンデーションのための最初の統一データと評価インフラストラクチャを提供する。
論文 参考訳(メタデータ) (2026-03-04T06:17:51Z) - Diagnosing LLM Reranker Behavior Under Fixed Evidence Pools [0.17188280334580197]
ランク付け評価は、上流レトリバーが返却した候補者をリランカがどのように注文するかを調査する。
この設定は、ランキングの動作と検索品質を結合するので、出力の差はランキングのポリシーだけでは対応できない。
複数Newsクラスタを固定エビデンスプールとして使用することで再ランク付けを分離する制御診断手法を提案する。
論文 参考訳(メタデータ) (2026-02-20T21:07:32Z) - RouteMoA: Dynamic Routing without Pre-Inference Boosts Efficient Mixture-of-Agents [91.0187958746262]
RouteMoAは動的ルーティングを備えた効率的な混合エージェントフレームワークである。
軽量スコアラを使用して、クエリから粗い粒度のパフォーマンスを予測することで、初期スクリーニングを行う。
既存のモデル出力に基づいて、軽量な自己評価とクロスアセスメントによってこれらのスコアを洗練し、追加の推論なしで後部修正を提供する。
論文 参考訳(メタデータ) (2026-01-26T04:22:22Z) - OptAgent: Optimizing Query Rewriting for E-commerce via Multi-Agent Simulation [1.3722079106827219]
OptAgentは、マルチエージェントシミュレーションと遺伝的アルゴリズムを組み合わせて、eコマースクエリのクエリを検証、最適化する新しいフレームワークである。
我々は、OptAgentを5つのカテゴリで1000の現実世界のeコマースクエリのデータセットで評価する。
論文 参考訳(メタデータ) (2025-10-04T10:41:09Z) - Collab: Controlled Decoding using Mixture of Agents for LLM Alignment [90.6117569025754]
人間のフィードバックからの強化学習は、大規模言語モデルを整合させる効果的な手法として現れてきた。
制御された復号化は、再訓練せずに推論時にモデルを整列するメカニズムを提供する。
本稿では,既存の既成のLCMポリシを活用するエージェントベースのデコーディング戦略の混合を提案する。
論文 参考訳(メタデータ) (2025-03-27T17:34:25Z) - MALT: Improving Reasoning with Multi-Agent LLM Training [67.76186488361685]
MALT(Multi-Agent LLM Training)は、推論プロセスを生成、検証、改善ステップに分割する、新しいポストトレーニング戦略である。
MATH、GSM8K、CSQAでは、MALTは、それぞれ15.66%、7.42%、9.40%の相対的な改善で同じベースラインLLMを上回っている。
論文 参考訳(メタデータ) (2024-12-02T19:30:36Z) - Large Language Models are Effective Text Rankers with Pairwise Ranking Prompting [65.00288634420812]
Pairwise Ranking Prompting (PRP)は、大規模言語モデル(LLM)の負担を大幅に軽減する手法である。
本研究は,中等級のオープンソースLCMを用いた標準ベンチマークにおいて,最先端のランク付け性能を達成した文献としては初めてである。
論文 参考訳(メタデータ) (2023-06-30T11:32:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。