論文の概要: Cascadia: A Control-Plane-Free Alternative to Hyperconverged AI Infrastructure
- arxiv url: http://arxiv.org/abs/2609.38697v1
- Date: Wed, 30 Sep 2026 00:25:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.876272
- Title: Cascadia: A Control-Plane-Free Alternative to Hyperconverged AI Infrastructure
- Title(参考訳): Cascadia: ハイパーコンバージドAIインフラストラクチャのコントロールプレーンフリーな代替手段
- Abstract要約: Cascadiaは、コモディティなIntel AIPC上で大きな言語モデルを提供するシステムである。
各ノードは入力、スケジューリング、実行を組み込み、推論要求は専用のルーティングコントロールプレーンを必要としない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present Cascadia, a system for serving large language models on fleets of commodity Intel AIPCs using their CPU, integrated-GPU, and NPU resources. Every node embeds ingress, scheduling, and execution; inference requests require no dedicated routing control plane. Nodes join a libp2p QUIC mesh using CA-issued ed25519 admission certificates, gossip signed capabilities, exchange live load over direct peer streams, and route OpenAI-compatible requests to eligible peers. An operator-run certificate authority handles admission and fleet management outside the inference path. Three serving modes share one interface: whole-model execution on one node, load-balanced replicas, and pipeline-sharded chains using the compilation and speculative decoding mechanism of our companion paper. Optional KV-cache mobility reuses compatible conversation prefixes after a routing move, with cold recomputation on a miss. Signed response receipts and hash-chained logs support provenance and audit. A three-node Phi-3.5-mini NPU testbed delivered 3.10x the response throughput of its one-node configuration under ten concurrent requests; a separate four-node deployment recorded 4.06x the throughput of direct single-node serving. Paired latency observations, runtime measurements, and internal functional checks characterize the tested configurations. We compare Cascadia with IBM, Nutanix, VMware, and HPE platforms on deployment footprint, hardware requirements, scheduling, scaling, licensing, and trust, using vendor documentation. The paper repository provides benchmark scripts, curated measurements, and a claim-to-evidence map.
- Abstract(参考訳): 我々は、CPU、集積GPU、NPUリソースを使用して、コモディティなIntel AIPCのフリート上で大規模な言語モデルを提供するシステムであるCascadiaを紹介する。
各ノードは入力、スケジューリング、実行を組み込み、推論要求は専用のルーティングコントロールプレーンを必要としない。
ノードは、CA発行のed25519アクセプション証明書を使用してlibp2p QUICメッシュに結合し、ゴシップ署名機能を使用し、直接ピアストリーム上でライブロードを交換し、OpenAI互換のリクエストを資格のあるピアにルーティングする。
オペレーターが運営する認証局は、推論パス外の入場および艦隊管理を処理する。
3つのサービスモードは、1つのノード上でのモデル全体の実行、ロードバランスのレプリカ、コンパニオンペーパーのコンパイルと投機的復号機構を用いたパイプラインシャードチェーンの3つのインターフェースを共有している。
任意のKV-cacheモビリティは、経路移動後に互換性のある会話プレフィックスを再利用する。
署名された応答レシートとハッシュチェーンログは、証明と監査をサポートする。
3ノードのPhi-3.5-mini NPUテストベッドは、1ノード構成のレスポンススループットの3.10倍を10の同時要求で提供した。
テスト済みの設定を特徴付けるのは、レイテンシの監視、ランタイムの測定、内部機能チェックである。
CascadiaとIBM、Nuntanix、VMware、HPEのプラットフォームを比較して、デプロイメントのフットプリント、ハードウェア要件、スケジューリング、スケーリング、ライセンス、信頼について、ベンダのドキュメントを使って説明します。
ペーパーリポジトリは、ベンチマークスクリプト、キュレートされた測定、クレーム・トゥ・エビデンス・マップを提供する。
関連論文リスト
- A Dynamic-Kernel/QPacket Executable for Quantum Repeater Chains in Q2NS/ns-3 [4.376469285036708]
本稿では、層を越えたプロトコルスイートからDynamic Kernel/QPacketロジックの最初の実行可能な特殊化について述べる。
この実装は、ns-3 App Storeから利用可能なns-3ベースの量子ネットワークシミュレーションモジュールであるQ2NS上に構築されている。
論文 参考訳(メタデータ) (2026-08-25T07:14:08Z) - TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference [47.62941623025392]
本稿では,非侵入的でログ対応なLLM推論フレームワークであるTELLERについて紹介する。
TELLERはモデルバイナリを変更することなく、NVTX/CUPTIトレースとサービスログを収集する。
リクエスト毎のコールチェーンツリーを再構築し、ログ行と対応する実行ステップをアライメントする。
これらの表現に加えて、TELLERは数値的候補のローカライゼーションとマルチモーダルな根起因モデルを組み合わせる。
論文 参考訳(メタデータ) (2026-08-03T09:39:11Z) - Profiling-Driven Adaptive Distributed Transformer Inference on Embedded Edge Deployment [60.442064966340524]
本稿では、WiFi経由で接続されたNVIDIA Jetson Orin Nanoデバイスに関するプロトタイプ研究を行う。
主な発見は、主なボトルネックは、ネットワーク帯域幅だけでなく、通信中のCPU-GPUステージングである。
実験によると、この戦略はフルテンソル交換と比較して遅延を65%-77%減らし、エネルギー消費を34%-52%減らしている。
論文 参考訳(メタデータ) (2026-05-25T10:39:28Z) - TIP: A Decentralized Intent-Based Protocol for Declarative IoT Interoperability and Sandboxed Schema Adaptation [0.0]
本稿では,分散型宣言型ネットワークプロトコルであるTIP(The Intent Protocol)を提案する。
特定の物理的エンドポイントに対処する代わりに、ノードは望ましい機能、スキーマ、QoS(Quality of Service)制約を指定する抽象的なインテントを送信します。
選択は、ネットワークレイテンシ、過去の評価、契約遵守を組み込んだマルチ基準スコアリングアルゴリズムによって最適化される。
セキュリティは、Ed25519署名、X25519鍵交換、Cha20-PolyWAS 1305ペイロード暗号化によって強制される。
論文 参考訳(メタデータ) (2026-05-25T01:28:12Z) - QuPort: Topology-, Port-, and Congestion-Aware Compilation for Modular Multi-QPU Quantum Systems [0.0]
QuPortはPythonとQiskitベースのコンパイルフレームワークである。
重み付けされた論理的相互作用グラフ、有向物理的カップリングマップ、および無向QPUレベルの相互接続グラフを通して設定を研究する。
このフレームワークには、ヘビーエッジクラスタリング、バランスの取れたグレディパーティショニング、シミュレートされたアニーリング改善、通信ポート対応レイアウト、リモート2ビット操作の抽出が含まれる。
論文 参考訳(メタデータ) (2026-05-12T17:12:30Z) - From Inference Routing to Agent Orchestration: Declarative Policy Compilation with Cross-Layer Verification [10.651054435747385]
Semantic Router DSLは、要求ごとの推論のために本番環境にデプロイされる非チューリング完全ポリシー言語である。
本稿では、ステートレスな要求ごとのルーティングからマルチステップのエージェントルーティングまで、同じ言語を拡張した。
論文 参考訳(メタデータ) (2026-03-28T15:04:31Z) - Not All Prompts Are Made Equal: Prompt-based Pruning of Text-to-Image Diffusion Models [59.16287352266203]
本稿では,テキスト・ツー・イメージ(T2I)モデルのための新しいプロンプトベースのプルーニング手法であるAdaptive Prompt-Tailored Pruning (APTP)を紹介する。
APTPは入力テキストプロンプトに必要な容量を決定することを学び、それをアーキテクチャコードにルーティングする。
APTPはFID、CLIP、CMMDスコアの点でシングルモデルプルーニングベースラインを上回っている。
論文 参考訳(メタデータ) (2024-06-17T19:22:04Z) - Few-shot Reranking for Multi-hop QA via Language Model Prompting [56.454088569241534]
オープンドメイン質問を用いたマルチホップQAにおける数点のリランクについて検討した。
本稿では,マルチホップパスの再ランク付けを促す大規模言語モデルに依存するPromptRankを提案する。
PromptRankは、HotpotQA上で128のトレーニング例で強力な検索性能を得る。
論文 参考訳(メタデータ) (2022-05-25T10:45:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。