論文の概要: Pretrain Once, Route Anywhere: Towards a Foundation Model for LLM Routing
- arxiv url: http://arxiv.org/abs/2609.37362v1
- Date: Tue, 29 Sep 2026 12:23:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.480022
- Title: Pretrain Once, Route Anywhere: Towards a Foundation Model for LLM Routing
- Title(参考訳): LLMルーティングの基礎モデルに向けて
- Abstract要約: RouteFMは、行動コンテキストから匿名候補モデルを特徴づけることを学ぶ。
実験では、ドメイン、モダリティ、候補プール、コンテキスト予算の変更間の転送を実証する。
- 参考スコア(独自算出の注目度): 46.01380774114097
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM) routing aims to assign each query to the most suitable model from a heterogeneous candidate pool, improving the quality--efficiency trade-off of LLM inference. Existing routers are typically learned through local fitting: a router is optimized for a particular query workload and candidate pool, and often requires additional supervision or retraining as the routing environment changes. We ask whether LLM routing can instead be approached from a foundation-model perspective, learning a reusable routing capability that generalizes across tasks, candidate models, and deployment conditions. To this end, we introduce RouteFM, which learns to characterize anonymous candidate models from behavioral context and infer their target-specific capabilities, rather than binding routing decisions to fixed model identities or a single environment. Through episodic pretraining across heterogeneous routing environments, this capability can be reused by a frozen router and adapted to new environments through context alone. Experiments demonstrate transfer across changes in domains, modalities, candidate pools, and context budgets, with the largest gains when behavioral evidence is limited. On MMR-Bench, which is excluded from pretraining, RouteFM outperforms the strongest baseline by 2.23 quality points with only eight observations per candidate. These results support moving LLM routing from repeated local fitting toward a pretrain once, route anywhere paradigm. Our code is publicly available at https://github.com/LAMDA-Model-Reuse/RouteFM.
- Abstract(参考訳): 大規模言語モデル(LLM)ルーティングは、各クエリを不均一な候補プールから最も適切なモデルに割り当てることを目的としており、LLM推論の品質-効率のトレードオフを改善している。
ルータは特定のクエリワークロードと候補プールに最適化されており、ルーティング環境が変化するにつれて、追加の監視や再トレーニングが必要になることが多い。
LLMルーティングが基本モデルの観点からアプローチ可能かどうかを問うとともに,タスクや候補モデル,デプロイメント条件をまたいだ再利用可能なルーティング機能を学ぶ。
この目的のために、固定モデルや単一環境にルーティング決定をバインドするのではなく、行動コンテキストから匿名候補モデルを識別し、ターゲット固有の能力を推測するルーツFMを導入する。
不均一なルーティング環境を横断するエピソディックな事前トレーニングを通じて、この機能は凍結ルータによって再利用され、コンテキストのみを通じて新しい環境に適応することができる。
実験では、ドメイン、モダリティ、候補プール、コンテキスト予算の変化が、行動証拠が制限された場合に最も多く得られることを示す。
事前訓練から除外されたMMR-Benchでは、RouteFMが最強のベースラインを2.23品質で上回り、1候補あたりの観測回数はわずか8回である。
これらの結果は、繰り返しローカルフィッティングからプリトレイン1回、ルート・エアー・パラダイムへのLSMルーティングの移動を支援する。
私たちのコードはhttps://github.com/LAMDA-Model-Reuse/RouteFMで公開されています。
関連論文リスト
- LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer? [69.71754384259167]
マルチモーダル大言語モデル(MLLM)は、OCR、チャート理解、空間的推論、視覚的質問応答、コスト、レイテンシにまたがるヘテロジニアスな強度を持つ。
本稿では,MLLMルーティングを実効的マルチモーダルユーティリティ予測として定式化するルータであるLatentを提案する。
MMR-BenchとVL-Benchの実験では、Latentは固定モデル、特徴レベル、学習ルータベースラインよりも優れていた。
論文 参考訳(メタデータ) (2026-05-11T22:42:12Z) - Rewiring Experts on the Fly:Continuous Rerouting for Better Online Adaptation in Mixture-of-Expert models [52.502867924372275]
Mixture-of-Experts (MoE)モデルは、スパース専門家のアクティベーションを通じて効率的なスケーリングを実現するが、デプロイメントの分散シフトによる最適以下のルーティング決定に悩まされることが多い。
我々は、外部の監視やデータなしで、テキスト生成中にMoEルーティング決定を継続的に適用するテキストタデータフリーオンラインテストタイムフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-16T16:24:36Z) - ICL-Router: In-Context Learned Model Representations for LLM Routing [30.759446235510467]
本稿では,モデル機能を表現するために,コンテキスト内ベクトルを用いた新しいルーティング手法を提案する。
本手法は,分散処理とアウト・オブ・ディストリビューション処理の両方において,最先端のルーティング性能を実現する。
論文 参考訳(メタデータ) (2025-10-10T06:47:37Z) - Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs [69.2486294522259]
BaRPはBandit Routing-feedback with Preferencesアプローチであり、デプロイと同じ部分フィードバック制限の下でトレーニングされる。
提案手法は,学習中のオンラインフィードバック設定をシミュレートし,新たなプロンプトに適応する。
論文 参考訳(メタデータ) (2025-10-08T18:24:59Z) - Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning [27.70756702796812]
マルチLLMルーティングとアグリゲーションを逐次決定プロセスとして定式化する強化学習フレームワークである textbf Generalization-R1 を提案する。
学習を容易にするために,形式報酬と最終結果報酬と,性能とコストのバランスを最適化するための新たなコスト報酬からなる軽量なルールベース報酬を用いる。
論文 参考訳(メタデータ) (2025-06-10T17:56:45Z) - RAGRouter: Learning to Route Queries to Multiple Retrieval-Augmented Language Models [45.58601993849455]
Retrieval-Augmented Generation (RAG) は、知識集約タスクにおけるLarge Language Models (LLM) の性能を大幅に向上させる。
既存のルーティング手法はRAGシナリオで最適以下の性能を示すのに対し,外部文書はLLMのクエリ応答能力に動的に影響を及ぼす。
本稿では、文書埋め込みとRAG機能埋め込みを利用して知識表現シフトを捉えるパラメトリックなRAG対応ルーティング設計であるRAGを提案する。
論文 参考訳(メタデータ) (2025-05-29T03:44:56Z) - Universal Model Routing for Efficient LLM Inference [69.86195589350264]
モデルルーティングは,大規模言語モデル(LLM)の推論コストを削減する手法である
動的ルーティング問題に対する新しいアプローチであるUniRouteを提案する。
これらは理論的に最適なルーティングルールの推定であり、過大なリスクバウンドによってそれらのエラーを定量化する。
論文 参考訳(メタデータ) (2025-02-12T20:30:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。