論文の概要: ContinuityBench: A Benchmark and Systems Study of Stateful Failover in Multi-Provider LLM Routing
- arxiv url: http://arxiv.org/abs/2607.15899v1
- Date: Fri, 17 Jul 2026 12:12:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.846601
- Title: ContinuityBench: A Benchmark and Systems Study of Stateful Failover in Multi-Provider LLM Routing
- Title(参考訳): ContinuityBench: マルチプロバイダLLMルーティングにおけるステートフルフェールオーバのベンチマークとシステムスタディ
- Authors: Vishal Pandey, Gopal Singh,
- Abstract要約: 運用用の大規模言語モデル(LLM)デプロイメントでは、高可用性保証は会話の連続性に相当しない。
CPR(Continuity Preservation Rate)とCLO(Continuity Overhead)の2つの新しい指標を紹介します。
この結果は、堅牢で状態保存型マルチモデル推論システムを構築するための原則的な基盤を提供する。
- 参考スコア(独自算出の注目度): 0.6117371161379209
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In production large language model (LLM) deployments, high API availability guarantees do not equate to conversational continuity. When a primary provider experiences an outage or strict rate-limiting, naive stateless failover mechanisms successfully maintain uptime but silently discard conversation history, severely disrupting the user experience. To rigorously quantify and resolve this failure mode, we introduce two novel metrics: Continuity Preservation Rate (CPR) and Continuity Latency Overhead (CLO). We propose a stateful, multi-provider proxy architecture utilizing a History-Forwarding strategy to seamlessly reconstruct conversational state across heterogeneous LLM endpoints during failover events. Furthermore, we release continuity-bench, https://github.com/Vishal-sys-code/continuity-bench, an open evaluation harness designed to stress-test context preservation under high-concurrency provider failure conditions. Our empirical evaluation ($N=750$ failover events) demonstrates that our stateful proxy achieves a 99.20\% CPR [95\% CI: 98.27\%, 99.63\%], cleanly transferring deep conversational context to fallback providers, compared to a near-0\% preservation rate for standard stateless architectures. Finally, we characterize failover latency distributions, identifying the critical necessity of asynchronous exponential backoff with jitter to prevent cascading retry storms against strict-limit fallback APIs. Our results provide a principled foundation for building robust, state-preserving multi-model inference systems.
- Abstract(参考訳): 運用用の大規模言語モデル(LLM)デプロイメントでは、高可用性保証は会話の連続性に相当しない。
プライマリプロバイダが障害あるいは厳格なレート制限を経験すると、ナイーブなステートレスフェールオーバ機構は、アップタイムを維持しながら、会話履歴を静かに破棄し、ユーザエクスペリエンスを著しく破壊する。
この障害モードを厳密に定量化し、解決するために、連続保存率(CPR)と連続待ち時間オーバーヘッド(CLO)という2つの新しい指標を導入します。
フェールオーバイベント中における異種LLMエンドポイント間の会話状態をシームレスに再構築するための履歴フォワード方式を用いたステートフル・マルチプロデューサプロキシアーキテクチャを提案する。
さらに、高速なプロバイダ障害条件下でのコンテキスト保存のストレステストを目的とした、オープンな評価手法であるContinity-bench, https://github.com/Vishal-sys-code/Continuity-benchをリリースする。
私たちの実証的な評価(N=750$フェイルオーバーイベント)は、ステートフルプロキシが99.20\% CPR[95\% CI:98.27\%, 99.63\%]を達成したことを実証しています。
最後に、フェールオーバのレイテンシ分布を特徴付け、厳格なフォールバックAPIに対するカスケードリトライ嵐を防止するためにjitterによる非同期指数的バックオフが不可欠であることを特定する。
この結果は、堅牢で状態保存型マルチモデル推論システムを構築するための原則的な基盤を提供する。
関連論文リスト
- DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation [69.8840101036735]
投機的復号化はLarge Language Model (LLM)推論を加速させる。
最近の並列起草者は、1つの前方通過で長いトークン列を効率的に提案するが、トークン間の依存関係が欠如しているため、急速に受け入れが低下する。
我々はDSparkという投機的復号化フレームワークを導入し、高いスループットの並列生成を適応的かつロードアウェアな検証と統合する。
論文 参考訳(メタデータ) (2026-07-06T14:28:06Z) - Beyond the Prompt: Jailbreaking Function-Calling LLMs via Simulated Moderation Traces [32.850551109913845]
大規模言語モデル(LLM)の安全なデプロイにとって、ジェイルブレイク攻撃は依然として重要な脅威である
このプロンプト中心のパラダイムは、ステートフルで関数呼び出し環境における構造的脆弱性を見落としていることを示す。
我々は、シミュレートされたモデレーショントレースに基づくブラックボックス攻撃フレームワークであるSMTを通じて、このアーキテクチャ欠陥を利用する。
論文 参考訳(メタデータ) (2026-07-01T06:08:07Z) - Governed Shared Memory for Multi-Agent LLM Systems [1.2178992475191557]
本稿では,フリートメモリの問題を定式化し,基礎的障害モードを4つ同定する。
システムレベルの明示的なプリミティブを定義する。スコープ付き検索,時間的スーパーセッション,プロファイランストラッキング,ポリシが支配するメモリ伝搬である。
これらのプリミティブは、プロダクションマルチテナントメモリサービスであるMemClawで実装され、ArgusFleet経由で評価される。
論文 参考訳(メタデータ) (2026-06-23T13:04:14Z) - Decoupling Inference from State Updates in Low-Latency Feature Engines via Probabilistic Thinning [6.081561157196023]
確率的シンニングにより、ストリーミング機械学習パイプラインにおける状態永続性からの推論を分離する。
我々は、高頻度のインメモリ制御プレーンやクロスワーカーを使わずに、永続パス制御が実現可能であることを示す。
実験全体では、最大90%のイベントが保存中の永続化パスから除外され、場合によっては下流のユーティリティを改善している。
論文 参考訳(メタデータ) (2026-06-15T17:18:05Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - FERA: Uncertainty-Aware Federated Reasoning for Large Language Models [60.52562148874846]
我々は、サーバがプライベートなデモンストレーションを行う異種クライアントと協調することで、多段階推論を改善するフェデレーション推論について研究する。
重要な課題は、クライアントの信頼性がクエリ依存であるのに対して、サーバはクライアントデータを検査して、どのコントリビューションが信頼できるかを判断できません。
本稿では,サーバクライアントの反復的コリファインメントに基づくトレーニングフリーフレームワークである Uncertainty-Aware Federated Reasoning (FERA) を提案する。
論文 参考訳(メタデータ) (2026-05-11T07:04:51Z) - CSR: Infinite-Horizon Real-Time Policies with Massive Cached State Representations [0.1104960878651584]
これらの特性の実用的なインスタンス化として,Cached State Representation (CSR) フレームワークを紹介した。
ASR(Asynchronous State Reconciliation)アルゴリズムは、状態メモリの解放を並列計算リソースにオフロードし、遅延スパイクを排除する。
オンプレミスのGPUサーバにワイヤレスで接続された物理ロボットでは、CSRは120Kトークンコンテキストに対して26倍のレイテンシ低減(14.67sから0.56s)を達成する。
論文 参考訳(メタデータ) (2026-05-08T06:30:44Z) - CORE: Context-Robust Remasking for Diffusion Language Models [51.59514489363897]
我々は、推論時リビジョンのためのトレーニング不要フレームワークであるContext-Robust Remasking (CORE)を提案する。
静的トークンの確率を信頼するのではなく、COREは、ターゲットとなるマスク付きコンテキストの摂動に対する感受性を示すことによって、コンテキスト不安定なトークンを識別する。
LLaDA-8B-Baseでは、COREは推論とコードベンチマークの間で一貫した改善を行い、計算に適合したベースラインを上回り、MBPPを最大9.2%改善した。
論文 参考訳(メタデータ) (2026-02-04T00:12:30Z) - LATTEO: A Framework to Support Learning Asynchronously Tempered with Trusted Execution and Obfuscation [6.691450146654845]
本稿では,ネットワークエッジにおける非同期FLアグリゲーションをセキュアにするための,勾配難読化機構とTEE(Trusted Execution Environments)を組み合わせたプライバシー保護フレームワークを提案する。
我々のメカニズムは、クライアントが暗黙的にTEEベースのアグリゲーションサービスを確認し、オンデマンドのクライアント参加を効果的に処理し、非同期接続の増加とともにシームレスにスケールできるようにする。
論文 参考訳(メタデータ) (2025-02-07T01:21:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。