論文の概要: CacheRouter: A Dual-Path Tool Routing Architecture with Cache-Preserving Main-Model Isolation for Long-Tail Tool Discovery
- arxiv url: http://arxiv.org/abs/2608.22708v1
- Date: Mon, 24 Aug 2026 01:56:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.83093
- Title: CacheRouter: A Dual-Path Tool Routing Architecture with Cache-Preserving Main-Model Isolation for Long-Tail Tool Discovery
- Title(参考訳): CacheRouter: 長距離ツール発見のためのキャッシュ保存メインモデル分離を備えたデュアルパスツールルーティングアーキテクチャ
- Authors: Donghui Zha, Lingwei Xu, Linxiao Wu, Yixue Dong, Haochen Li,
- Abstract要約: 本稿では、トレードオフを要求アーキテクチャの問題として扱う。
ツールの選択とツール配信を別々のチャネルに割り当てる、デュアルパスルーティング設計を提案する。
- 参考スコア(独自算出の注目度): 6.202700601367706
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Tool use in LLM systems faces a structural trade-off. Progressive disclosure keeps the prompt small by showing only the tools relevant to the current task, while prompt caching rewards a request prefix that stays fixed across calls; every change to the visible tool list invalidates the cached prefix. This paper treats the trade-off as a problem of request architecture and proposes a dual-path routing design that assigns tool selection and tool delivery to separate channels. The main model always sees a small, fixed set of core tools, so the head of its request is unchanged across calls; all other tools are reached through an independent routing channel, in which a router sub-model searches the full tool list, selects one tool, executes it, and returns the result. Tool registration is automated from source code and supports runtime updates, so the tool set can grow without modifying the main model's request prefix. The design generalizes progressive disclosure: capabilities are disclosed through the routing channel, and the main model's prefix stays stable. A prototype implementation was exercised on 55 functional queries and a 30-turn dialogue; token-level cache hit rates reached 90.99% and 95.2%, cutting input cost to about 12.0% and 8.0% of a no-cache baseline under DeepSeek's pricing, where cache-hit input tokens cost roughly 1/30 of cache-miss tokens.
- Abstract(参考訳): LLMシステムにおけるツールの使用は、構造的なトレードオフに直面している。
プログレッシブ開示は、現在のタスクに関連するツールのみを表示することでプロンプトを小さく保ち、プロンプトキャッシングは呼び出し間で固定されているリクエストプレフィックスに報酬を与える。
本稿では、このトレードオフを要求アーキテクチャの問題として扱い、ツールの選択とツール配信を別々のチャネルに割り当てるデュアルパスルーティング設計を提案する。
メインモデルは、常に小さな固定されたコアツールのセットを見るので、リクエストの先頭は呼び出し間で変更されない。他のすべてのツールは、ルータのサブモデルが完全なツールリストを検索し、1つのツールを選択して実行し、結果を返す独立したルーティングチャネルを介して到達する。
ツール登録はソースコードから自動化され、ランタイム更新をサポートするため、ツールセットはメインモデルのリクエストプレフィックスを変更することなく成長することができる。
設計はプログレッシブな開示を一般化し、ルーティングチャネルを通じて機能を公開し、メインモデルのプレフィックスは安定している。
55の関数型クエリと30ターンの対話でプロトタイプ実装が実行され、トークンレベルのキャッシュヒット率は90.99%と95.2%に達した。
関連論文リスト
- KeyPooling: Measuring Where LLM API Relay Paths Collapse Prompt Cache Isolation [53.952294884822955]
大規模言語モデル(LLM)APIは、顧客の認証を別々に行うが、多くの場合、共有プロバイダ認証を通じて要求を転送する。
KeyPoolingは、キャッシュのルックアップと書き込みを通じて顧客のアイデンティティをトレースする測定方法である。
すべての顧客がプロバイダ強化されたドメインに入る必要があります。
論文 参考訳(メタデータ) (2026-08-18T08:12:34Z) - ToolAtlas: Learning Once, Reusing Everywhere with Tool-Side Memory [49.08868447320197]
大規模言語モデル(LLM)エージェントは、共有プロバイダが提供する外部ツールにますます依存している。
既存のアプローチでは、パラメータ更新、プロンプトリファインメント、エージェント側のメモリを通じて、エージェント側のツール使用を改善する。
グラフベースのフレームワークであるToolAtlasを紹介します。
論文 参考訳(メタデータ) (2026-07-13T06:01:41Z) - CacheWeaver: Cache-Aware Evidence Ordering for Efficient Grounded RAG Inference [4.3361375690943795]
vLLMのようなサービスエンジンのプリフィックスキャッシュは、リクエストが同じトークンプレフィックスを共有する場合にのみ、このコストを削減する。
キャッシュ対応エビデンスオーダの軽量なプロンプト層手法であるCacheWeaverを提案する。
論文 参考訳(メタデータ) (2026-06-18T00:38:46Z) - Tool Forge: A Validation-Carrying Toolchain for Governed Agentic Execution [3.2702644625831794]
本稿では,自然言語能力の意図をサンドボックスで検証されたツールアーティファクトに変換する検証用ツールチェーンであるTool Forgeを紹介する。
また、モデルコンテキストに完全なカタログスキーマをロードする代わりに、インテントスコープツールセッションを公開するルータも導入されている。
論文 参考訳(メタデータ) (2026-05-27T05:45:58Z) - Stateful Inference for Low-Latency Multi-Agent Tool Calling [0.0]
LLMベースのシステムでは,マルチエージェント・ツール・コールが主要なインタラクション・パターンになりつつある。
本稿では,従来のサービスにおける$O(n_t)=ターン当たりのコストを$O(_t)$デルタのみのコストに変換する,ステートフルな推論アーキテクチャを提案する。
論文 参考訳(メタデータ) (2026-05-25T19:27:49Z) - Tool Attention Is All You Need: Dynamic Tool Gating and Lazy Schema Loading for Eliminating the MCP/Tools Tax in Scalable Agentic Workflows [2.2228811750157482]
私たちは、"Attention Is All You Need"パラダイムを一般化するスケーラブルな層メカニズムであるTool Attentionを紹介します。
シミュレーションした120toolの6サーバベンチマークで、サーバ単位のトークン数を実際のMPPデプロイメントの公開監査に校正する。
ツールアテンションはターン当たりのツールトークンを95.0%(47.3k ->2.4k)に減らし、効果的なコンテキスト利用(トークン比の量)を24%から91%に引き上げる。
論文 参考訳(メタデータ) (2026-04-23T16:10:00Z) - IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse [68.18308357205586]
Longcontext Agenticは、大規模言語モデルの定義ユースケースとして登場した。
Sparseは、この課題を効果的に解決し、DeepSeek Sparse Attention(DSA)は、代表的なプロダクショングレードソリューションである。
我々は、レイヤを独自のインデクサを実行するフルレイヤの小さなセットと、最も近いフルレイヤのトップkインデックスを単純に再利用する共有レイヤの大多数に分割することで、層間の冗長性を利用するIndexCacheを紹介します。
論文 参考訳(メタデータ) (2026-03-12T17:27:21Z) - MCP-Zero: Active Tool Discovery for Autonomous LLM Agents [13.005899769943442]
ツール発見の自律性を LLM 自体に復元する,アクティブエージェントフレームワークである MCP-Zero を紹介する。
すべての利用可能なツールで圧倒的なモデルを使用する代わりに、CP-Zeroはエージェントが能率ギャップを積極的に識別し、特定のツールをオンデマンドで要求することを可能にする。
公式の Model-Context-Protocol リポジトリから 308 の MCP サーバと 2,797 ツールの包括的なデータセットである MCP-tools を構築した。
論文 参考訳(メタデータ) (2025-06-01T15:48:53Z) - Advancing and Benchmarking Personalized Tool Invocation for LLMs [66.39214525683425]
パーソナライズされたツール呼び出しの概念を導入し、ツールの優先度とプロファイルに依存したクエリという2つの重要なタスクを定義します。
これらの課題に対処するために、パーソナライズされたツール呼び出し用に設計されたデータ合成フレームワークであるPToolを提案する。
パーソナライズされたツール呼び出しを評価するための最初のベンチマークである textbfPTBench を構築した。
論文 参考訳(メタデータ) (2025-05-07T02:25:20Z) - Re-Invoke: Tool Invocation Rewriting for Zero-Shot Tool Retrieval [47.81307125613145]
Re-Invokeは、トレーニングなしで大規模ツールセットに効果的にスケールするために設計された教師なしツール検索手法である。
我々は、クエリ毎に最も関連性の高いツールを特定するために、意図に基づいて、新しいマルチビュー類似度ランキング戦略を採用する。
評価の結果、Re-Invokeはシングルツールとマルチツールの両方のシナリオにおいて、最先端の代替よりも大幅に優れていた。
論文 参考訳(メタデータ) (2024-08-03T22:49:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。