論文の概要: SEAR: Schema-Based Evaluation and Routing for LLM Gateways
- arxiv url: http://arxiv.org/abs/2603.26728v1
- Date: Fri, 20 Mar 2026 04:51:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-06 02:36:13.115468
- Title: SEAR: Schema-Based Evaluation and Routing for LLM Gateways
- Title(参考訳): SEAR: LLMゲートウェイのスキーマに基づく評価とルーティング
- Abstract要約: SEAR はマルチモデルマルチプロジェクタ LLM ゲートウェイのためのスキーマベースの評価とルーティングシステムである。
複雑なリクエストセマンティクスをキャプチャし、人間の解釈可能なルーティング説明を可能にし、単一のクエリ層で評価とルーティングを統一する。
SEARは、人間のラベル付きデータに対して強力な信号精度を実現し、同等の品質の大幅なコスト削減を含む、実用的なルーティング決定をサポートする。
- 参考スコア(独自算出の注目度): 10.075582097888253
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evaluating production LLM responses and routing requests across providers in LLM gateways requires fine-grained quality signals and operationally grounded decisions. To address this gap, we present SEAR, a schema-based evaluation and routing system for multi-model, multi-provider LLM gateways. SEAR defines an extensible relational schema covering both LLM evaluation signals (context, intent, response characteristics, issue attribution, and quality scores) and gateway operational metrics (latency, cost, throughput), with cross-table consistency links across around one hundred typed, SQL-queryable columns. To populate the evaluation signals reliably, SEAR proposes self-contained signal instructions, in-schema reasoning, and multi-stage generation that produces database-ready structured outputs. Because signals are derived through LLM reasoning rather than shallow classifiers, SEAR captures complex request semantics, enables human-interpretable routing explanations, and unifies evaluation and routing in a single query layer. Across thousands of production sessions, SEAR achieves strong signal accuracy on human-labeled data and supports practical routing decisions, including large cost reductions with comparable quality.
- Abstract(参考訳): LLMゲートウェイのプロバイダ間での運用LLM応答とルーティング要求を評価するには、きめ細かい品質信号と運用上の決定が必要である。
このギャップに対処するために,マルチモデルマルチプロジェクタLLMゲートウェイのためのスキーマベースの評価とルーティングシステムであるSEARを提案する。
SEARはLLM評価信号(コンテキスト、意図、応答特性、課題属性、品質スコア)とゲートウェイ運用メトリクス(レイテンシ、コスト、スループット)の両方をカバーする拡張可能なリレーショナルスキーマを定義する。
評価信号を確実に投入するために、SEARは、データベース対応構造化出力を生成する自己完結型信号命令、スキーマ内推論、およびマルチステージ生成を提案する。
信号は浅い分類器ではなくLLM推論によって導出されるため、SEARは複雑な要求セマンティクスをキャプチャし、人間の解釈可能なルーティング説明を可能にし、単一のクエリ層で評価とルーティングを統一する。
何千ものプロダクションセッションにわたって、SEARは、人間のラベル付きデータに対して強力な信号精度を達成し、同等の品質の大幅なコスト削減を含む、実用的なルーティング決定をサポートする。
関連論文リスト
- From Sampled Outcomes to Capability Distributions: Rethinking Supervision for LLM Routing [79.19755531338872]
既存のルーティングメソッドは、クエリに対するモデルの単一応答を、トレーニングの能力ラベルとして扱う。
この仮定はルーティング管理にシステマティックノイズを導入し、学習されたルーティングポリシーの信頼性を低下させることを示す。
本稿では, DARS(Distribution-Aware Routing Supervision)を提案する。
論文 参考訳(メタデータ) (2026-06-05T05:42:00Z) - The Routing Plateau: Understanding and Breaking the Accuracy Limits of LLM Routers [19.847272668359707]
LLMルーティングは、各クエリのモデルを動的に選択することで、LLMサービスのコスト品質トレードオフを改善するための一般的なアプローチである。
最近の研究では、クラスタリングベースのルータ、学習された分類器、ペアワイズランキング、信頼に基づくアプローチなど、幅広いルーティング方法が検討されている。
kNNを含む多くの手法は、非常によく似た精度を達成し、オラクルルータよりはるかに低い狭い性能範囲に収束する。
論文 参考訳(メタデータ) (2026-05-27T19:29:01Z) - Route Before Retrieve: Activating Latent Routing Abilities of LLMs for RAG vs. Long-Context Selection [57.3886742625188]
Pre-Routeは、応答前に構造化推論を実行するプロアクティブなルーティングフレームワークである。
本研究は, (i) LLMは, ガイドラインを確実に適用可能な遅延ルーティング能力を有すること, (ii) 線形プローブにより, 表現空間における最適ルーティングの分離性を高めること, (iii) 蒸留により, この推論構造を, 軽量展開のためのより小さなモデルに伝達すること,の3つの重要な知見を示す。
論文 参考訳(メタデータ) (2026-05-11T09:10:55Z) - DiSRouter: Distributed Self-Routing for LLM Selections [23.38983740640377]
集中制御から分散ルーティングへ移行する新しいパラダイムであるDiS(Distributed Self-)を紹介する。
DiS では、クエリは LLM エージェントのネットワークを横切り、それぞれが自身の自己認識に基づいて他のエージェントに答えるかどうかを独立に決定する。
大規模な実験により、DiSは様々なシナリオで既存のルーティング方法よりも優れていることが示された。
論文 参考訳(メタデータ) (2025-10-22T03:36:40Z) - RCR-Router: Efficient Role-Aware Context Routing for Multi-Agent LLM Systems with Structured Memory [57.449129198822476]
RCRは、マルチエージェント大言語モデル(LLM)システムのためのロールアウェアコンテキストルーティングフレームワークである。
役割とタスクステージに基づいて、各エージェントに対して意味的に関連するメモリサブセットを動的に選択する。
軽量スコアリングポリシは、メモリ選択をガイドし、エージェント出力を共有メモリストアに統合する。
論文 参考訳(メタデータ) (2025-08-06T21:59:34Z) - RAGRouter: Learning to Route Queries to Multiple Retrieval-Augmented Language Models [45.58601993849455]
Retrieval-Augmented Generation (RAG) は、知識集約タスクにおけるLarge Language Models (LLM) の性能を大幅に向上させる。
既存のルーティング手法はRAGシナリオで最適以下の性能を示すのに対し,外部文書はLLMのクエリ応答能力に動的に影響を及ぼす。
本稿では、文書埋め込みとRAG機能埋め込みを利用して知識表現シフトを捉えるパラメトリックなRAG対応ルーティング設計であるRAGを提案する。
論文 参考訳(メタデータ) (2025-05-29T03:44:56Z) - Learning to Route Queries Across Knowledge Bases for Step-wise Retrieval-Augmented Reasoning [60.84901522792042]
Multimodal Retrieval-Augmented Generation (MRAG)は、マルチモーダル大言語モデル(MLLM)における幻覚の緩和を約束している。
進化する推論状態に基づいて知識をいつどこで取得するかを学習する新しいMRAGフレームワークであるR1を提案する。
R1-は多種多様なKBを適応的かつ効果的に利用でき、不要な検索を減らし、効率と精度を向上させる。
論文 参考訳(メタデータ) (2025-05-28T08:17:57Z) - Universal Model Routing for Efficient LLM Inference [69.86195589350264]
モデルルーティングは,大規模言語モデル(LLM)の推論コストを削減する手法である
動的ルーティング問題に対する新しいアプローチであるUniRouteを提案する。
これらは理論的に最適なルーティングルールの推定であり、過大なリスクバウンドによってそれらのエラーを定量化する。
論文 参考訳(メタデータ) (2025-02-12T20:30:28Z) - Confident or Seek Stronger: Exploring Uncertainty-Based On-device LLM Routing From Benchmarking to Generalization [61.02719787737867]
大規模言語モデル(LLM)はますますエッジデバイスにデプロイされ、民主化されている。
1つの有望な解決策は不確実性に基づくSLMルーティングであり、SLM上での低信頼応答が発生すると、高い要求を強いLCMにオフロードする。
我々は1500以上の設定でSLMからLLMへの不確実性駆動型ルーティング戦略のベンチマークと一般化を包括的に調査する。
論文 参考訳(メタデータ) (2025-02-06T18:59:11Z) - Smoothie: Label Free Language Model Routing [39.88041397482366]
大規模言語モデル(LLM)は、LLM入力が多くの異なるタスクにまたがるアプリケーションでますます使われている。
Smoothieは、ラベル付きデータを必要としない、監督にインスパイアされた弱いルーティング手法である。
SmoothieのLLMの品質スコアは、地上モデルの品質と相関している。
論文 参考訳(メタデータ) (2024-12-06T01:06:37Z) - RouterBench: A Benchmark for Multi-LLM Routing System [25.515453832224804]
パフォーマンスとコストのバランスをとる場合、すべてのタスクやアプリケーションに最適に対処できるモデルは存在しない。
この制限により、個々のLSMの制約を克服するために、様々なモデルの強みを組み合わせたLSMルーティングシステムの開発に繋がった。
本稿では LLM ルーティングシステムの有効性を体系的に評価する新しい評価フレームワークである RouterBench を提案する。
論文 参考訳(メタデータ) (2024-03-18T17:59:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。