論文の概要: VDAR-Router: Adaptive LLMs Routing via Verbalized Query Difficulty Analysis Retrieval
- arxiv url: http://arxiv.org/abs/2607.18098v1
- Date: Mon, 20 Jul 2026 16:00:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.69514
- Title: VDAR-Router: Adaptive LLMs Routing via Verbalized Query Difficulty Analysis Retrieval
- Title(参考訳): VDAR-Router: 言語クエリの難易度解析による適応型LLMルーティング
- Authors: Yu-Chien Tang, Jun-Chen Hung, Wen-Chih Peng, An-Zi Yen,
- Abstract要約: 難解検索に基づくルーティングフレームワークであるVDAR-theを提案する。
入力クエリ毎に、VDAR-theは明示的な難易度解析を生成する。
その後、同様の難易度プロファイルで過去の例を検索する。
- 参考スコア(独自算出の注目度): 16.067071673823417
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models are increasingly used in practical systems, making efficient model selection important for reducing deployment cost. LLM routing has emerged as a practical solution for allocating each input query to an appropriate model under a desired cost-performance trade-off. Existing routing methods often estimate model suitability from the surface semantics or embedding similarity of the input query. However, such methods may ignore the underlying difficulty of a query, leading to suboptimal routing decisions. To address the challenge, we propose VDAR-Router, a difficulty-aware retrieval-based routing framework. For each input query, VDAR-Router first generates an explicit difficulty analysis. It then retrieves historical examples with similar difficulty profiles. Based on the retrieved records, it estimates candidate model suitability and selects the model using a reward function that considers both performance and cost. Experiments on three datasets show that VDAR-Router consistently achieves better cost-performance trade-offs than existing baselines. These results demonstrate the effectiveness of difficulty-aware retrieval for training-free LLM routing. Case studies further show that explicit query analysis helps retrieve more relevant examples and supports more reliable routing decisions.
- Abstract(参考訳): 大規模言語モデルは実用システムにおいてますます使われており、デプロイコストを削減するために効率的なモデル選択が重要である。
LLMルーティングは、所望のコストパフォーマンストレードオフの下で、各入力クエリを適切なモデルに割り当てる実用的なソリューションとして登場した。
既存のルーティング手法では、サーフェスセマンティクスからモデル適合性を推定したり、入力クエリの類似性を埋め込んだりすることが多い。
しかし、そのような手法はクエリの根本的な難しさを無視し、最適以下のルーティング決定につながる可能性がある。
この課題に対処するために,難易度の高い検索ベースのルーティングフレームワークであるVDAR-Routerを提案する。
入力クエリ毎に、VDAR-Routerはまず明示的な難易度解析を生成する。
その後、同様の難易度プロファイルで過去の例を検索する。
得られたデータに基づいて、候補モデルの適合性を推定し、性能とコストの両方を考慮した報酬関数を用いてモデルを選択する。
3つのデータセットの実験は、VDAR-Routerが既存のベースラインよりもコストパフォーマンスのトレードオフを一貫して達成していることを示している。
これらの結果から,学習不要なLCMルーティングにおける難易度検索の有効性が示された。
ケーススタディでは、明示的なクエリ分析がより関連する例の検索に役立ち、より信頼性の高いルーティング決定をサポートすることが示されている。
関連論文リスト
- LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer? [69.71754384259167]
マルチモーダル大言語モデル(MLLM)は、OCR、チャート理解、空間的推論、視覚的質問応答、コスト、レイテンシにまたがるヘテロジニアスな強度を持つ。
本稿では,MLLMルーティングを実効的マルチモーダルユーティリティ予測として定式化するルータであるLatentを提案する。
MMR-BenchとVL-Benchの実験では、Latentは固定モデル、特徴レベル、学習ルータベースラインよりも優れていた。
論文 参考訳(メタデータ) (2026-05-11T22:42:12Z) - Route Before Retrieve: Activating Latent Routing Abilities of LLMs for RAG vs. Long-Context Selection [57.3886742625188]
Pre-Routeは、応答前に構造化推論を実行するプロアクティブなルーティングフレームワークである。
本研究は, (i) LLMは, ガイドラインを確実に適用可能な遅延ルーティング能力を有すること, (ii) 線形プローブにより, 表現空間における最適ルーティングの分離性を高めること, (iii) 蒸留により, この推論構造を, 軽量展開のためのより小さなモデルに伝達すること,の3つの重要な知見を示す。
論文 参考訳(メタデータ) (2026-05-11T09:10:55Z) - xRouter: Training Cost-Aware LLMs Orchestration System via Reinforcement Learning [104.63494870852894]
我々は,学習したルータが直接応答するか,あるいは1つ以上の外部モデルを呼び出すことができるツールコールベースのルーティングシステム x を提案する。
当社の実装には、報酬とコスト会計を含む、完全な強化学習フレームワークが含まれています。
さまざまなベンチマークで、xはコストパフォーマンスのトレードオフを強く達成します。
論文 参考訳(メタデータ) (2025-10-09T16:52:01Z) - RADAR: Reasoning-Ability and Difficulty-Aware Routing for Reasoning LLMs [51.88834210085435]
本稿では、軽量で解釈可能でスケーラブルなルーティングフレームワークRADAR(Reasoning-Ability and Difficulty-Aware Routing)を提案する。
心理測定にインスパイアされたRADARは、さまざまな予算を持つモデル応答から異なるクエリへのアイテム応答モデルを学ぶ。
我々は8つの広く使われている推論ベンチマークについて広範な実験を行い、最先端のルーティング手法と比較してRADARの優れた性能を実証した。
論文 参考訳(メタデータ) (2025-09-29T19:33:44Z) - RAGRouter: Learning to Route Queries to Multiple Retrieval-Augmented Language Models [45.58601993849455]
Retrieval-Augmented Generation (RAG) は、知識集約タスクにおけるLarge Language Models (LLM) の性能を大幅に向上させる。
既存のルーティング手法はRAGシナリオで最適以下の性能を示すのに対し,外部文書はLLMのクエリ応答能力に動的に影響を及ぼす。
本稿では、文書埋め込みとRAG機能埋め込みを利用して知識表現シフトを捉えるパラメトリックなRAG対応ルーティング設計であるRAGを提案する。
論文 参考訳(メタデータ) (2025-05-29T03:44:56Z) - Inverse Optimization for Routing Problems [3.282021317933024]
Inverse Optimization (IO) を用いたルーティング問題における意思決定者の行動学習手法を提案する。
提案手法の柔軟性と実世界の可能性を示し,ルーティング問題における意思決定者の判断から学ぶ。
論文 参考訳(メタデータ) (2023-07-14T14:03:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。