論文の概要: SeLMRoute: Probabilistic Semantic Evidence for Large Language Model Routing
- arxiv url: http://arxiv.org/abs/2609.34736v1
- Date: Mon, 28 Sep 2026 09:31:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 03:20:00.714519
- Title: SeLMRoute: Probabilistic Semantic Evidence for Large Language Model Routing
- Title(参考訳): SeLMRoute:大規模言語モデルルーティングのための確率論的セマンティックエビデンス
- Abstract要約: SeLMRouteは、候補に依存しないセマンティックエビデンスの抽出と、候補性能の学習を分離するルーティングフレームワークである。
LLMBench (15データセット、20の候補モデル、11,481のクエリ)では、SeLMRouteの平均精度は72.08% pm 0.45$である。
この表現は、評価された意味、密度、語彙、およびドメインレベルの表現の中で最も高い平均性能を達成する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM) routing aims to select the most suitable model for each incoming query. Most existing routers learn this decision directly from query embeddings, model representations, preference data, or clusters of similar examples. Such approaches can be effective, yet the representation used for routing rarely states what a query actually requires. We introduce SeLMRoute, a routing framework that separates the extraction of candidate-independent semantic evidence from the learning of candidate performance and the application of deployment objectives. A decision model first evaluates a set of interpretable questions about the query, such as its reasoning requirements and use of external knowledge, with each judgment retained as a probability distribution. The resulting probabilistic semantic state is used by a lightweight supervised router to estimate candidate model performance. Routing objectives are applied after performance estimation, which allows the same semantic state to support performance-oriented and cost-aware decisions. On the LLMRouterBench (15 datasets, 20 candidate models, 11,481 queries), SeLMRoute achieves an average accuracy of $72.08\% \pm 0.45$, while grouped five-fold out-of-fold evaluation reaches $72.64\%$, compared with $69.23\%$ for the strongest fixed candidate. The representation achieves the highest mean performance among the evaluated semantic, dense, lexical, and domain-level representations. In a separate 13-model performance-cost setting, SeLMRoute improves performance in all five grouped splits, with a mean PerfGain of $2.66\%$. Our code is available at https://github.com/Indigma-Innovations/SeLMRoute.
- Abstract(参考訳): 大規模言語モデル(LLM)ルーティングは、各クエリに最も適したモデルを選択することを目的としている。
既存のルータの多くは、クエリの埋め込み、モデル表現、好みデータ、同様の例のクラスタから直接この決定を学習している。
このようなアプローチは効果的だが、ルーティングに使用される表現は、クエリが実際に必要とするものを記述することは滅多にない。
本稿では,候補非依存のセマンティックエビデンスを,候補性能の学習と展開目標の適用から分離するルーティングフレームワークであるSeLMRouteを紹介する。
決定モデルは、まず、その推論要求や外部知識の使用など、クエリに関する解釈可能な質問のセットを評価し、各判断を確率分布として保持する。
結果として生じる確率的意味状態は、軽量の教師付きルータによって、候補モデルの性能を推定するために使用される。
ルーティングの目的は、パフォーマンス見積の後に適用され、同じセマンティックな状態がパフォーマンス指向の意思決定とコスト認識の意思決定をサポートする。
LLMRouterBench (15データセット、20の候補モデル、11,481のクエリ)では、SeLMRouteの平均精度は72.08\% \pm 0.45$、グループ化された5倍のアウト・オブ・フォールド評価は72.64\%であるのに対して、最も強い固定候補は69.23\%である。
この表現は、評価された意味、密度、語彙、およびドメインレベルの表現の中で最も高い平均性能を達成する。
異なる13モデルのパフォーマンスコスト設定では、SeLMRouteは5つのグループスプリットすべてのパフォーマンスを改善し、平均的なPerfGainは2.66 %$である。
私たちのコードはhttps://github.com/Indigma-Innovations/SeLMRoute.comで利用可能です。
関連論文リスト
- VDAR-Router: Adaptive LLMs Routing via Verbalized Query Difficulty Analysis Retrieval [16.067071673823417]
難解検索に基づくルーティングフレームワークであるVDAR-theを提案する。
入力クエリ毎に、VDAR-theは明示的な難易度解析を生成する。
その後、同様の難易度プロファイルで過去の例を検索する。
論文 参考訳(メタデータ) (2026-07-20T16:00:45Z) - Before Thinking, Learn to Decide: Proactive Routing for Efficient Visual Reasoning [87.18590662029432]
本稿では,プロアクティブルーティングパラダイムであるPRPを提案する。このパラダイムは,ドラフトモデルとターゲットモデルの両方の能力を評価することで,早期意思決定を可能にする。
筆者らの試案であるレーティング学習 (DRL) は内部信頼度推定器を内蔵し, 共同レーティング学習 (JRL) は対象モデルが与えられたクエリをどの程度処理できるかを予測する。
これらの評価により、詳細なインスタンスレベルの textbfProactive Routing が可能になり、全体的なパフォーマンスを損なうことなく、推論を大幅に高速化できる。
論文 参考訳(メタデータ) (2026-06-29T12:30:24Z) - LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer? [69.71754384259167]
マルチモーダル大言語モデル(MLLM)は、OCR、チャート理解、空間的推論、視覚的質問応答、コスト、レイテンシにまたがるヘテロジニアスな強度を持つ。
本稿では,MLLMルーティングを実効的マルチモーダルユーティリティ予測として定式化するルータであるLatentを提案する。
MMR-BenchとVL-Benchの実験では、Latentは固定モデル、特徴レベル、学習ルータベースラインよりも優れていた。
論文 参考訳(メタデータ) (2026-05-11T22:42:12Z) - Route Before Retrieve: Activating Latent Routing Abilities of LLMs for RAG vs. Long-Context Selection [57.3886742625188]
Pre-Routeは、応答前に構造化推論を実行するプロアクティブなルーティングフレームワークである。
本研究は, (i) LLMは, ガイドラインを確実に適用可能な遅延ルーティング能力を有すること, (ii) 線形プローブにより, 表現空間における最適ルーティングの分離性を高めること, (iii) 蒸留により, この推論構造を, 軽量展開のためのより小さなモデルに伝達すること,の3つの重要な知見を示す。
論文 参考訳(メタデータ) (2026-05-11T09:10:55Z) - HierRouter: Coordinated Routing of Specialized Large Language Models via Reinforcement Learning [11.03159148013318]
大規模言語モデル(LLM)は多くのタスクにまたがって最先端のパフォーマンスを提供するが、高い計算とメモリコストを課す。
特殊な軽量言語モデルのプールから推論パイプラインを動的に組み立てる階層的ルーティング手法であるHierを提案する。
論文 参考訳(メタデータ) (2025-11-13T02:12:14Z) - Lookahead Routing for Large Language Models [24.082620717301477]
Lookaheadは、潜在的なモデル出力を"予測"し、これらの予測を使ってモデル選択をガイドするルーティングフレームワークである。
7つの公開ベンチマークに対する実証的な評価は、Lookaheadが既存のルーティングベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-10-22T12:00:21Z) - Arch-Router: Aligning LLM Routing with Human Preferences [1.859931123372708]
ルーティングは、異なるモデルの使用を運用する上で不可欠な技術になっている。
本稿では、クエリをユーザ定義ドメインにマッチさせることで、モデル選択をガイドする、嗜好整合型ルーティングフレームワークを提案する。
我々のアプローチは主観評価基準を捉え、ルーティング決定をより透明で柔軟にする。
論文 参考訳(メタデータ) (2025-06-19T23:57:41Z) - Universal Model Routing for Efficient LLM Inference [69.86195589350264]
モデルルーティングは,大規模言語モデル(LLM)の推論コストを削減する手法である
動的ルーティング問題に対する新しいアプローチであるUniRouteを提案する。
これらは理論的に最適なルーティングルールの推定であり、過大なリスクバウンドによってそれらのエラーを定量化する。
論文 参考訳(メタデータ) (2025-02-12T20:30:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。