論文の概要: RouteGuard: Certifying Routing Gain in LLM Multi-Agent Systems When Complementarity Is Not Enough
- arxiv url: http://arxiv.org/abs/2608.07583v1
- Date: Wed, 05 Aug 2026 05:01:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.448213
- Title: RouteGuard: Certifying Routing Gain in LLM Multi-Agent Systems When Complementarity Is Not Enough
- Title(参考訳): RouteGuard: 相補性が不十分な場合、LLMマルチエージェントシステムにおけるルーティングゲインの認証
- Authors: Anchen Sun, Kaiqi Yang,
- Abstract要約: RouteGuardはルータのデプロイメント認証フレームワークである。
有限サンプル認証ブラケットは、ル・カムの下限、固定活性クラス上の定数シャープ、ロバストネス相転移を備える。
このプロトコルは$m ge mstar$の真のゲインを認証し、真のnullを認証しない。
- 参考スコア(独自算出の注目度): 0.8089404951115918
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Multi-agent LLM systems route among model-backed advisors, yet a deployer rarely knows before shipping whether routing will help at all. Prevailing routers optimize a gate's AUC and presume that advisor complementarity suffices. We show that neither determines the deployable gain. We introduce RouteGuard, a deployment-certification framework. Routing gain decomposes as $G = πΔ_E$, and the achievable gain is governed by a conditional-regret functional $Φ$, not by AUC. A finite-sample certification bracket comes with a matching Le Cam lower bound, constant-sharp over the fixed-activity class, and a robustness phase transition. On two benchmarks the framework acts as a guardrail. On RouterBench (11 cross-family models) the verdict depends on the sampling unit: the protocol certifies a gain over GPT-4 under prompt-level sampling and withholds it under workload-cluster resampling, because the gain rests on 3 of 86 workload cells. On OpenRCA (three Gemini advisors) the advisors are statistically redundant: the realized oracle sits at or below the independence baseline in all pools we tested (221 RouterBench pools and three OpenRCA distributions), so the protocol correctly refuses to certify. A pre-registered semi-synthetic control confirms calibration: the protocol certifies a genuine gain once $m \ge m^\star$ and does not certify a true null. Code and frozen artifacts will be released with the published version.
- Abstract(参考訳): モデル支援のアドバイザの間ではマルチエージェントのLLMシステムがルートされるが、ルーティングが役に立つかどうかを出荷する前に、デプロイ者が知ることは滅多にない。
一般的なルータはゲートのAUCを最適化し、アドバイザーの相補性が十分であると仮定する。
いずれの場合も、デプロイ可能な利益は決定できません。
デプロイメント認証フレームワークであるRouteGuardを紹介します。
ルーティングゲインは$G = πΔ_E$として分解され、取得可能なゲインは AUC ではなく条件付き関数 $ $ によって支配される。
有限サンプル認証ブラケットは、ル・カムの下限、固定活性クラス上の定数シャープ、ロバストネス相転移を備える。
2つのベンチマークでは、フレームワークはガードレールとして機能する。
RouterBench (11 のクロスファミリーモデル) では、判定はサンプリング単位に依存している。プロトコルは、プロンプトレベルのサンプリングの下で GPT-4 よりも利得を証明し、それをワークロードクラスタ再サンプリングで保持する。
OpenRCA(3つのGeminiアドバイザ)では、アドバイザは統計的に冗長である – 実際に実現されたオラクルは、テストしたすべてのプール(221つのRouterBenchプールと3つのOpenRCAディストリビューション)の独立ベースライン内またはそれより下に位置するため、プロトコルは正しく認証を拒否する。
このプロトコルは$m \ge m^\star$に対して真に利得を証明し、真のnullを証明しない。
コードと凍結したアーティファクトは、公開されたバージョンでリリースされる。
関連論文リスト
- Multi-Agent Routing as Set-Valued Prediction: A WildChat Benchmark and Cost-Aware Evaluation [0.0]
ここで導入されたベンチマークには、固定された12エージェントカタログに3000のプロンプトが含まれている。
評価プロトコルは、設定レベルメトリクス(Precision, Recall, F1, Jaccard, Exact Match)、レイテンシ、実行指向の能力被覆シミュレーション、制約付き重み付け設定を組み合わせる。
論文 参考訳(メタデータ) (2026-06-27T13:59:46Z) - Brain-Prompt Injection: A Route-Safety Audit for BCI-LLM Agents [0.0]
BCI-to-agentパイプラインは、デコードされた神経活動をツール使用エージェントの認可チャネルに変える。
強調的なデュアルデコーダ攻撃は、EEG側またはテキスト側モニターが盲目のままである間、ルートされたアクションを全て変更できる。
このスタックのルート安全性は、監査ログが監視できるものに依存し、デコーダの正確性や合意のみに依存しない。
論文 参考訳(メタデータ) (2026-06-08T10:19:34Z) - From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents [56.31499185764872]
教師の長い軌道上の監督された微調整(SFT)は、オープンソフトウェアエンジニアリング(SWE)エージェントに調査と推論を浸透させる主要な方法である。
本稿では,P2T (Patches-to-Trajectories) を提案する。P2T (Patches-to-Trajectories) は,P2T (Patches-to-Trajectories) において,P2T (Patches-to-Trajectories) とP2T (Patches-to-Trajectories) の2つの最適化法である。
論文 参考訳(メタデータ) (2026-05-21T04:54:55Z) - Conformal Selective Acting: Anytime-Valid Risk Control for RLVR-Trained LLMs [13.385373310554327]
Conformal Selective Actingは、デプロイ要求によって強制される空のセルを埋める。
CSAは、すべての細胞に経路的妥当性と非抵抗的展開を満足する10種類の比較のうち唯一の方法である。
論文 参考訳(メタデータ) (2026-05-18T22:20:32Z) - Representation Without Reward: A JEPA Audit for LLM Fine-Tuning [1.2691047660244335]
JEPA(Joint-embedding predictive Architectures)は、モデルが観測された出力よりも遅延表現を予測できるように訓練された時に、より有用な抽象化を学ぶべきであることを提案している。
自己回帰型言語モデルの微調整には、この原理はより厳密な要件を必要とする。
我々は、Llama-3.2-1B-Instruct LoRA を用いて、自然言語からレジェックス生成におけるその要件を検証した。
論文 参考訳(メタデータ) (2026-05-14T20:27:32Z) - SCALE-LoRA: Auditing Post-Retrieval LoRA Composition with Residual Merging and View Reliability [2.9388795721577328]
低ランク適応(LoRA)アダプタはパラメータ効率適応の実用的な副産物になりつつある。
オープンプール LoRA 再利用のための監査・構成フレームワークである Sparse-Composition Agreement Layer (SCALE) を導入する。
実験項目では,詳細なスコア,ペア監査,パスコスト記録が報告されている。
論文 参考訳(メタデータ) (2026-05-02T13:00:05Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications [51.56484100374058]
評価をデプロイメント決定ワークフローに変換するLLMおよびRAGアプリケーションのための準備性ハーネスを提案する。
このシステムは、最小限のAPI契約の下で、自動ベンチマーク、OpenTelemetryオブザーバビリティ、CI品質ゲートを組み合わせる。
チケットルーティングとBEIRタスクのハーネスを、完全なAzureマトリックスカバレッジで評価する。
論文 参考訳(メタデータ) (2026-03-28T18:03:32Z) - From Score Distributions to Balance: Plug-and-Play Mixture-of-Experts Routing [52.01745035243826]
Mixture-of-Experts (MoE)モデルは、各トークンを専門家のサブセットにルーティングすることで、パラメータキャパシティをスケールすることができる。
条件付きルーティングは、推論メモリの負荷をシフトし、デバイスごとに専門家の数を制限する。
本稿では,精度を保ちながら負荷のバランスをとるプラグイン・アンド・プレイ型推論時ルーティングアルゴリズムLASERを提案する。
論文 参考訳(メタデータ) (2025-09-29T16:29:17Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。