論文の概要: Influence of Prompt Engineering on Small Language Models for Guarded Query Routing
- arxiv url: http://arxiv.org/abs/2607.24801v1
- Date: Mon, 06 Jul 2026 09:21:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.074294
- Title: Influence of Prompt Engineering on Small Language Models for Guarded Query Routing
- Title(参考訳): ガード付きクエリルーティングのための小言語モデルに対するプロンプトエンジニアリングの影響
- Abstract要約: 我々は,コンパクトなオープンウェイト・スモールランゲージ・モデル (SLM) が,遅延制約下で両タスクを共同で処理できるかどうかを検討する。
我々は、中規模のSLMが、はるかに低いレイテンシで、フロンティアモデルルーティング品質に近づくことを発見した。
その結果,SLMはモデルの重みを変化させることなく,適切な処理を行うことが可能であることが示唆された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study the problem of guarded query routing, where we assume that a user query first meets a router that either determines the ideal endpoint for in-distribution queries or rejects out-of-distribution queries that are potentially unsafe or out of the system's scope. We investigate whether compact open-weight Small Language Models (SLMs) can jointly handle both tasks under latency constraints. We evaluate 22 models on GQR-Bench and score them with the harmonic mean of in-distribution and out-of-distribution accuracy. We find that mid-scale SLMs come close to frontier model routing quality at much lower latency. Still, many compact models fail because they do not reliably follow the required output format. However, our results show that prompt optimization techniques enable SLMs to handle such cases gracefully, without changing the models' weights. Moreover, few-shot prompt optimization raises Mistral 7B from 81.79 to 90.87 GQR-Score and lifts Qwen3.5 9B to 95.74, the best optimized score in our study and within 0.3 points of the strongest unoptimized larger model: Gemma 3 27B at 96.01. The bare DSPy signature, without in-context exemplars, is the most effective strategy for Granite 4 Tiny, raising its score from 54.29 to 83.05. These results show that prompt optimization is a useful first step for guarded query routing, while weaker models may still need weight-level adaptation or schema-aware training
- Abstract(参考訳): ユーザクエリがまず,配信内クエリの理想的なエンドポイントを決定するルータに一致するか,あるいはシステムの範囲外あるいは潜在的に安全でないアウト・オブ・ディストリビューションクエリを拒否する,という,ガードされたクエリルーティングの問題について検討する。
我々は,コンパクトなオープンウェイト・スモールランゲージ・モデル (SLM) が,遅延制約下で両タスクを共同で処理できるかどうかを検討する。
我々は,GQR-Bench上で22種類のモデルを評価し,分布内分布と分布外分布精度の調和平均で評価した。
我々は、中規模のSLMが、はるかに低いレイテンシで、フロンティアモデルルーティング品質に近づくことを発見した。
しかし、多くのコンパクトモデルは要求された出力形式に確実に従わないため失敗する。
しかし,本研究の結果から,モデル重みを変化させることなく,SLMがこのようなケースを優雅に処理できることが示唆された。
さらに、少数のプロンプト最適化はMistral 7Bを81.79から90.87 GQR-Scoreに引き上げ、Qwen3.5 9Bを95.74に引き上げる。
素のDSPyシグネチャはコンテクストにないが、グラナイト4ティニーにとって最も効果的な戦略であり、スコアは54.29から83.05に引き上げられた。
これらの結果は、プロンプト最適化がガードされたクエリルーティングにとって有用な第1ステップであることを示している。
関連論文リスト
- Before Thinking, Learn to Decide: Proactive Routing for Efficient Visual Reasoning [87.18590662029432]
本稿では,プロアクティブルーティングパラダイムであるPRPを提案する。このパラダイムは,ドラフトモデルとターゲットモデルの両方の能力を評価することで,早期意思決定を可能にする。
筆者らの試案であるレーティング学習 (DRL) は内部信頼度推定器を内蔵し, 共同レーティング学習 (JRL) は対象モデルが与えられたクエリをどの程度処理できるかを予測する。
これらの評価により、詳細なインスタンスレベルの textbfProactive Routing が可能になり、全体的なパフォーマンスを損なうことなく、推論を大幅に高速化できる。
論文 参考訳(メタデータ) (2026-06-29T12:30:24Z) - Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning [51.88950852117154]
Chunk-Level Guided Generationは、既製の大規模言語モデルをプロセススコアラとして使用する、トレーニング不要の代替手段である。
本研究では,系統的な長さバイアスのため,大モデル確率の可変長推論ステップが信頼できないことを示す。
Chunk-Level Guided Generation は PRM guided search よりもかなり短い推論トレースを生成する。
論文 参考訳(メタデータ) (2026-06-01T04:43:36Z) - RouteLMT: Learned Sample Routing for Hybrid LLM Translation Deployment [57.588738943463646]
大規模言語モデル(LLM)は機械翻訳(MT)において顕著な性能を発揮した
大規模に展開するのは 違法に高価です
モデル内ルータである textbfRouteLMT を提案する。
論文 参考訳(メタデータ) (2026-04-24T13:02:45Z) - RouteMoA: Dynamic Routing without Pre-Inference Boosts Efficient Mixture-of-Agents [91.0187958746262]
RouteMoAは動的ルーティングを備えた効率的な混合エージェントフレームワークである。
軽量スコアラを使用して、クエリから粗い粒度のパフォーマンスを予測することで、初期スクリーニングを行う。
既存のモデル出力に基づいて、軽量な自己評価とクロスアセスメントによってこれらのスコアを洗練し、追加の推論なしで後部修正を提供する。
論文 参考訳(メタデータ) (2026-01-26T04:22:22Z) - Efficient Multi-Model Orchestration for Self-Hosted Large Language Models [2.3275796286410677]
Pick and Spinは、セルフホストのオーケストレーションと経済性を実現するフレームワークである。
統合されたHelmベースのデプロイメントシステム、適応型スケールツーゼロ自動化、ハイブリッドルーティングモジュールを統合している。
最大21.6%の成功率、30%のレイテンシ、クエリ毎のコストの33%削減を実現している。
論文 参考訳(メタデータ) (2025-12-26T22:42:40Z) - HuggingR$^{4}$: A Progressive Reasoning Framework for Discovering Optimal Model Companions [50.61510609116118]
HuggingR$4$は、Reasoning、Retrieval、Refinement、Reflectionを組み合わせて効率的にモデルを選択する新しいフレームワークである。
作業性率は92.03%、理性率は82.46%に達し、それぞれ26.51%、33.25%を超える。
論文 参考訳(メタデータ) (2025-11-24T03:13:45Z) - Reverse Preference Optimization for Complex Instruction Following [61.39734201711077]
本稿では,Reverse Preference Optimization (RPO) という,シンプルで効果的な手法を提案する。
選択された応答が完璧であることを保証するために、命令内の制約を動的に反転させることで、優先ペアのノイズを緩和する。
RPOはモデルサイズで効果的にスケールし、70B RPOモデルはGPT-4oを超える。
論文 参考訳(メタデータ) (2025-05-28T09:44:27Z) - Guarded Query Routing for Large Language Models [2.2349474636722317]
ガードドクエリルーティング問題について検討し、最初にガードドクエリルーティングベンチマーク(GQR-Bench)を導入する。
その結果,ドメイン外検出能力が向上したWideMLPでは,精度(88%)と速度(4ms)のトレードオフが最良であることがわかった。
本研究は,LLMを(保護された)クエリルーティングに自動的に依存させることに挑戦し,実用的なアプリケーションに具体的なレコメンデーションを提供する。
論文 参考訳(メタデータ) (2025-05-20T15:46:59Z) - Pruning Large Language Models via Accuracy Predictor [0.0]
数十億のパラメータ(あるいはそれ以上)を含む大規模言語モデル(LLM)は、様々なNLPタスクにおいて印象的な機能を示している。
まず,一定の数のアーキテクチャと精度のペアのトレーニングセットを構築し,非ニューラルネットワークモデルを精度予測器として訓練する。
論文 参考訳(メタデータ) (2023-09-18T06:38:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。