論文の概要: Runtime Burden Allocation for Structured LLM Routing in Agentic Expert Systems: A Full-Factorial Cross-Backend Methodology
- arxiv url: http://arxiv.org/abs/2604.01235v1
- Date: Thu, 26 Mar 2026 18:50:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-03 14:21:09.564684
- Title: Runtime Burden Allocation for Structured LLM Routing in Agentic Expert Systems: A Full-Factorial Cross-Backend Methodology
- Title(参考訳): エージェントエキスパートシステムにおける構造化LPMルーティングのための実行時バーデンアロケーション:フルファンクショナルクロスバックエンド手法
- Authors: Zhou Hanlin, Chan Huah Yong,
- Abstract要約: エージェントAIシステムにおいて、大規模言語モデル(LLM)がコアコントロールコンポーネントになるにつれて、信頼性の高い構造化ルーティングは、正確性、レイテンシ、実装コストのバランスをとる必要がある。
このバランスはプロンプトやスキーマだけでなく、生成スタック全体で構造的な作業がどのように割り当てられるかによっても形作られています。
この定式化は、48のデプロイメント構成と15,552のリクエストをOpenAI、Gemini、Llamaバックエンドでカバーする包括的なフルファクターベンチマークを通じて評価する。
- 参考スコア(独自算出の注目度): 16.053669481561354
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Structured LLM routing is often treated as a prompt-engineering problem. We argue that it is, more fundamentally, a systems-level burden-allocation problem. As large language models (LLMs) become core control components in agentic AI systems, reliable structured routing must balance correctness, latency, and implementation cost under real deployment constraints. We show that this balance is shaped not only by prompts or schemas, but also by how structural work is allocated across the generation stack: whether output structure is emitted directly by the model, compressed during transport, or reconstructed locally after generation. We evaluate this formulation through a comprehensive full-factorial benchmark covering 48 deployment configurations and 15,552 requests across OpenAI, Gemini, and Llama backends. Our central finding is consequential: there is no universal best routing mode. Instead, backend-specific interaction effects dominate performance. Modes that remain highly reliable on Gemini and OpenAI can suffer substantial correctness degradation on Llama, while efficiency gains from compressed realization are strongly backend-dependent. Rather than presenting another isolated model comparison, this work contributes a deployable framework for reasoning about structured routing under heterogeneous backend conditions. We provide a cross-backend evaluation methodology and practical deployment guidance for navigating the correctness-cost-latency frontier in production-grade agentic expert systems.
- Abstract(参考訳): 構造化LLMルーティングは、しばしばプロンプトエンジニアリング問題として扱われる。
より根本的には、システムレベルの重荷配分問題である、と我々は主張する。
エージェントAIシステムにおいて、大規模言語モデル(LLM)がコアコントロールコンポーネントになるにつれて、信頼性の高い構造化ルーティングは、実際のデプロイメント制約下での正確性、レイテンシ、実装コストのバランスをとる必要がある。
このバランスは、プロンプトやスキーマだけでなく、出力構造がモデルによって直接出力されるか、輸送中に圧縮されるか、あるいは生成後に局所的に再構築されるかといった、生成スタック全体の構造的作業がどのように割り当てられるかによっても表される。
この定式化は、48のデプロイメント構成と15,552のリクエストをOpenAI、Gemini、Llamaバックエンドでカバーする包括的なフルファクターベンチマークを通じて評価する。
我々の中心的な発見は連続的であり、普遍的な最良のルーティングモードは存在しない。
代わりに、バックエンド固有のインタラクション効果がパフォーマンスを支配します。
Gemini と OpenAI の信頼性が高いモードは Llama の精度低下に悩まされるが、圧縮された実現による効率向上はバックエンドに依存している。
この研究は、別の独立したモデル比較を示すのではなく、不均一なバックエンド条件下での構造化ルーティングを推論するためのデプロイ可能なフレームワークに貢献している。
運用レベルのエージェントエキスパートシステムにおいて,信頼性・コスト・レイテンシ・フロンティアをナビゲートするためのクロスバックエンド評価手法と実践的デプロイメントガイダンスを提供する。
関連論文リスト
- Efficient and Interpretable Multi-Agent LLM Routing via Ant Colony Optimization [58.59491516762626]
マルチエージェントシステム(MAS)のための効率的かつ解釈可能なルーティングフレームワークAMRO-Sを提案する。
AMRO-Sは、意味条件付き経路選択問題としてMASルーティングをモデル化し、3つのキーメカニズムを通してルーティング性能を向上させる。
5つの公開ベンチマークと高速ストレステストによる大規模な実験により、AMRO-Sは強いルーティングベースラインに対する品質-コストトレードオフを一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-03-13T12:26:05Z) - Relatron: Automating Relational Machine Learning over Relational Databases [50.94254514286021]
本稿では, RDL と DFS を共有設計空間に統合し, 多様な RDB タスクを対象としたアーキテクチャ中心の検索を行う。
RDLはDFSを一貫して上回り、高いタスク依存性を持つ。(2)タスク全体において単一のアーキテクチャが支配的であり、タスク認識モデル選択の必要性を強調し、精度は選択アーキテクチャの信頼性の低いガイドである。
論文 参考訳(メタデータ) (2026-02-26T02:45:22Z) - Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration [56.074760766965085]
PRISMは、モデルの既存の知識との認知的対立度に基づいてデータを調停する動的認識フレームワークを実現する。
この結果から,内部最適化方式に基づくデータ分離が,スケーラブルでロバストなエージェントアライメントに不可欠であることが示唆された。
論文 参考訳(メタデータ) (2026-01-12T05:43:20Z) - Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystem [90.17610617854247]
本稿では,エージェントモデルの生産パイプラインを最適化する基盤インフラであるエージェント学習エコシステム(ALE)を紹介する。
ALEは、重量最適化のためのトレーニング後のフレームワークであるROLL、軌道生成のためのサンドボックス環境マネージャであるROCK、効率的なコンテキストエンジニアリングのためのエージェントフレームワークであるiFlow CLIの3つのコンポーネントで構成されている。
ROMEはALEが基盤として100万件以上のトラジェクトリをトレーニングしたオープンソースエージェントです。
論文 参考訳(メタデータ) (2025-12-31T14:03:39Z) - Higress-RAG: A Holistic Optimization Framework for Enterprise Retrieval-Augmented Generation via Dual Hybrid Retrieval, Adaptive Routing, and CRAG [0.0]
Higress RAG MCP Serverは、AIデプロイメントのための、新しいエンタープライズ中心のアーキテクチャである。
システムは適応ルーティング、セマンティックキャッシュ、ハイブリッド検索、修正RAGを編成する。
Systemは、エンタープライズAIデプロイメントのためのスケーラブルで幻覚に強いソリューションを提供する。
論文 参考訳(メタデータ) (2025-12-30T05:28:05Z) - AgentBalance: Backbone-then-Topology Design for Cost-Effective Multi-Agent Systems under Budget Constraints [7.38359558170225]
大規模言語モデル(LLM)ベースのマルチエージェントシステム(MAS)は、Webスケールアプリケーションにとって必須のビルディングブロックになりつつある。
我々は、トークンコストと遅延の明確な予算の下で、コスト効率の良いMASを構築するためのフレームワークであるAgentBalanceを提案する。
論文 参考訳(メタデータ) (2025-12-12T10:08:03Z) - SCoTER: Structured Chain-of-Thought Transfer for Enhanced Recommendation [24.019381388104236]
本稿では,パターン発見と構造認識伝達を協調最適化問題として扱う統合フレームワークであるSCoTERを提案する。
具体的には、SCoTERは、自動パターン検出のためのGVMパイプラインと、ステップワイズロジックを効率的なモデルに転送する構造保存統合アーキテクチャという、2つの相乗的コンポーネントを通じてこれを運用する。
論文 参考訳(メタデータ) (2025-11-24T03:00:04Z) - Learning to Route: A Rule-Driven Agent Framework for Hybrid-Source Retrieval-Augmented Generation [55.47971671635531]
大言語モデル(LLM)は、一般質問回答(QA)において顕著な性能を示した。
Retrieval-Augmented Generation (RAG)は、LLMを外部知識で強化することで、この制限に対処する。
既存のシステムは、主に構造化されていないドキュメントに依存しているが、主にリレーショナルデータベースを見下ろしている。
論文 参考訳(メタデータ) (2025-09-30T22:19:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。