論文の概要: Most of the LLM Routing Gap Is Task Type
- arxiv url: http://arxiv.org/abs/2608.23023v2
- Date: Tue, 25 Aug 2026 02:36:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.203438
- Title: Most of the LLM Routing Gap Is Task Type
- Title(参考訳): LLMルーティングギャップのほとんどはタスクタイプです
- Authors: Janghoon Lee,
- Abstract要約: ルータはクエリ毎にどのモデルに答えるべきかを選択する。
全体として、どのモデルが一番良いのかは、いまだに間違っている。
プール内の別のモデルは、その多くを正しく取得します。
すべて同じ294の質問に当てはまり、ホールドアウトはない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: An LLM router picks which model should answer each query. The appeal is that models fail on different questions. Whatever single model is best overall still gets some wrong, and another model in the pool gets many of those right. Getting that choice right every time is the ceiling, and a router is an attempt to approach it. However, recent work reports that routers do not get close. Across 21 routing methods on five benchmarks, sharply different designs land within a fraction of a point of each other, and all of them stay far below that ceiling. Learned routers often fail to beat simply always calling the strongest model. We ask what those missed questions have in common. We set fourteen models to answer all 294 questions, with 7 task types across 3 languages: Korean, English and Hindi. We ran the whole matrix twice, changing nothing, but 5.37% of the 4,116 model-question pairs came out scored differently anyway. Run-to-run movement like that is normal, and we argue that a small win does not show that routing did anything, ours or anyone else's. Counting an answer correct only when the model got it right in both runs, 29 questions on this matrix can be improved with routing. Every correct-answer count here is on that rule. Task type accounts for most of them: assigning each task type one model in advance, chosen once and never updated, improves 21 of the 29. Splitting each task type by language improves 2 more and leaves 6 of 294 unoptimized. That handful is what a learned router would have been built for, and it is smaller than the run-to-run movement above, which is a share of pairs rather than of questions. The static table we adopted answers 262 of 294 questions at \$3.33 per run, against the best single model's 245 at \$7.69. All of this is fitted and scored on the same 294 questions with no holdout.
- Abstract(参考訳): LLMルータは、どのモデルを問合せに答えるべきかを選択する。
魅力は、モデルは異なる質問で失敗することです。
単一のモデルで何がベストかは、いまだに何らかの間違いを犯しており、プール内の別のモデルは、その多くを正しいものにしている。
その選択を毎回正しく行うことが天井であり、ルーターがそれに近づこうとする試みだ。
しかし、最近の研究報告ではルーターが接近していない。
5つのベンチマークで21を超えるルーティング方法、鮮明に異なる設計が互いにほんの少しの差で着地し、それらすべてが天井よりずっと低い位置に留まっている。
学習したルータは、常に最強のモデルを呼び出すのに失敗することが多い。
これらの欠落した質問の共通点について尋ねる。
私たちは、韓国語、英語、ヒンディー語という3つの言語にまたがる7つのタスクタイプで、294のすべての質問に答えるために14のモデルを設定しました。
我々はマトリックス全体を2回走らせ、何も変えなかったが、4,116のモデルクエストペアの5.37%は、いずれにせよ異なるスコアを得た。
このようなランニング・トゥ・ランのムーブメントは普通であり、小さな勝利はルーティングが私たちのもの、または他の誰のものでもないことを示すものではない、と私たちは主張します。
両方の実行でモデルが正しく取得された場合にのみ、正解をカウントすると、このマトリックスに関する29の質問がルーティングによって改善される。
ここでのすべての正解数は、その規則に則っている。
各タスクタイプを事前に1つのモデルに割り当て、一度だけ選択され、更新されることはない。
各タスクタイプを言語で分割すると、さらに294のうち6つが最適化されていない状態になる。
これは、学習したルーターが構築したもので、上記のランニング・トゥ・ラン運動よりも小さい。
静的テーブルでは、294問のうち262問が1ラン当たり3.33ドルで、最高のシングルモデルでは245問が7.69ドルでした。
すべて同じ294の質問に当てはまり、ホールドアウトはない。
関連論文リスト
- Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents [0.8491218071542773]
VisualWebArenaとWebArenaの8つのサイトモデルの組み合わせ(セル)の6つの観察モードを測定した。
次に、5つのルーティングポリシー(モードの選択、強いモードにいつ費やすかの決定、タスクテキストを読み取るゼロコストルール、信頼性カスケード、プールされたコスト層)をテストする。
たった1つのウェル・チョーゼン・モードを固定するだけじゃなく、たった1つの例外は、我々の最短の細胞に対する脆弱な結果です。
論文 参考訳(メタデータ) (2026-08-06T15:37:04Z) - DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers [0.0]
固定データセットではなく再利用可能なフレームワークであるDynamicMCPBenchを紹介する。
現実的な目標を生成し、それぞれの目標を追求し、成功軌道を記録し、その軌跡をパスに依存しない効果チェックポイントに蒸留し、最終的な答えにはない、それらの効果を再現するかどうかをエージェントにスコアする。
最強のエージェントでさえタスクの約半分しか解決せず、タスクの31%はモデル無しで解決され、必要なツールチェーンが長くなるにつれて精度が低下する。
論文 参考訳(メタデータ) (2026-07-10T12:25:57Z) - LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer? [69.71754384259167]
マルチモーダル大言語モデル(MLLM)は、OCR、チャート理解、空間的推論、視覚的質問応答、コスト、レイテンシにまたがるヘテロジニアスな強度を持つ。
本稿では,MLLMルーティングを実効的マルチモーダルユーティリティ予測として定式化するルータであるLatentを提案する。
MMR-BenchとVL-Benchの実験では、Latentは固定モデル、特徴レベル、学習ルータベースラインよりも優れていた。
論文 参考訳(メタデータ) (2026-05-11T22:42:12Z) - Select-then-Solve: Paradigm Routing as Inference-Time Optimization for LLM Agents [40.71556008019808]
Direct、CoT、ReAct、Plan-Execute、Re Reflection、ReCodeの6つの推論時パラダイムを比較します。
推論構造は、いくつかのタスクで劇的に役立つが、他のタスクに悪影響を及ぼす。
提案手法は,各タスクに応答する前に,軽量な埋め込み型ルータが最適なパラダイムを選択することである。
論文 参考訳(メタデータ) (2026-04-08T07:20:23Z) - No Single Best Model for Diversity: Learning a Router for Sample Diversity [69.53166985556759]
本稿では,有効な応答の集合を包括的に抽出する手法について検討する。
本稿では,各回答に割り当てられた品質スコアを計測する指標であるtextbfdiversity Cover を紹介する。
各プロンプトには、多様な回答セットを生成する際に、他のすべてのモデルよりも大幅に優れるモデルが存在する。
論文 参考訳(メタデータ) (2026-04-02T17:58:37Z) - Winning Amazon KDD Cup'24 [0.6967835043237027]
課題は、オンラインショッピングの分野における質問に答える便利なアシスタントを作ることだった。
コンペティションには57の多様なタスクが含まれ、5つの異なるタスクタイプと4つの異なるトラックにまたがる。
私たちのソリューションは、トラック毎にひとつのモデルです。トレーニングデータセットに基づいて、Qwen2-72B-インストラクションを微調整します。
論文 参考訳(メタデータ) (2024-08-05T14:40:04Z) - Musketeer: Joint Training for Multi-task Vision Language Model with Task Explanation Prompts [75.75548749888029]
本稿では,全てのタスクに対してパラメータを共同で訓練し,複数の異種タスク間で完全に共有する視覚言語モデルを提案する。
単一のモデルで、Musteteerは単一のタスクでトレーニングされた強いベースラインに匹敵する結果を得る。
論文 参考訳(メタデータ) (2023-05-11T17:57:49Z) - MultiModalQA: Complex Question Answering over Text, Tables and Images [52.25399438133274]
テキスト,テーブル,画像に対する共同推論を必要とするデータセットであるMultiModalQAを提案する。
大規模で複雑なマルチモーダル質問を生成するための新しいフレームワークを使用してMMQAを作成します。
次に、単一のモダリティから回答できる質問を受け取り、それらを組み合わせてクロスモーダルな質問を生成する形式言語を定義します。
論文 参考訳(メタデータ) (2021-04-13T09:14:28Z) - Few-Shot Question Answering by Pretraining Span Selection [58.31911597824848]
私たちは、数百のトレーニング例しか利用できない、より現実的な数ショット設定を探索します。
標準スパン選択モデルの性能が低下していることを示し,現在の事前学習目標が質問応答から遠ざかっていることを浮き彫りにした。
本研究は,事前学習方式とモデルアーキテクチャの注意深い設計が,数ショット設定における性能に劇的な影響を及ぼすことを示唆している。
論文 参考訳(メタデータ) (2021-01-02T11:58:44Z) - Controllable Pareto Multi-Task Learning [55.945680594691076]
マルチタスク学習システムは,複数のタスクを同時に解決することを目的としている。
固定されたモデルキャパシティでは、タスクは互いに衝突し、システムは通常、それらすべてを学ぶためにトレードオフをしなければならない。
本研究では,異なるタスク間のリアルタイムなトレードオフ制御を実現するための,新しい制御可能なマルチタスク学習フレームワークを提案する。
論文 参考訳(メタデータ) (2020-10-13T11:53:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。