論文の概要: Fine-Grained Computation Offload for Off-the-Shelf Servers in Tens of Lines
- arxiv url: http://arxiv.org/abs/2607.02630v1
- Date: Thu, 02 Jul 2026 13:39:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.370197
- Title: Fine-Grained Computation Offload for Off-the-Shelf Servers in Tens of Lines
- Title(参考訳): 10行のオフ・ザ・シェルフサーバの微粒化計算負荷
- Abstract要約: ハードウェアアクセラレーターは今や、オンラインサービスにとって重要な道のりにある。
このレシピは22-138行を追加し、少なくとも1行は修正し、実際のハードウェア上で1.2-5.4倍のリカバリを行う。
- 参考スコア(独自算出の注目度): 0.3951796994513004
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Hardware accelerators now sit on the critical path of online serving. GPUs, FPGAs, and increasingly remote services such as hardware security modules, post-quantum KEMs, and inference servers. For fine-grained offloads (microseconds to a few milliseconds) the classic responses to the resulting stall both fail: a context switch costs as much as the offload, and a busy-wait burns the core. Overlapping the offload with other requests is the fix, and prior systems obtain it by adding concurrency: an async-framework rewrite, a new runtime or dataplane OS, or a hand-tuned point integration. We observe that the concurrency already exists: serving concurrent requests is suspending and resuming them, so every server ships the machinery overlap needs. Overlap is then a routing problem, not a rewrite problem: submit the offload to an executor, suspend the request with the server's own deferred-response primitive, resume it on completion. Across ten off-the-shelf servers spanning every production concurrency model, this recipe takes 22-138 lines added, at most one modified, and recovers 1.2-5.4x on real hardware; the server's concurrency model and the offload's weight predict both numbers in advance, and the win is bounded by device throughput and the server's own overlap capacity. At the limit, an LD_PRELOAD fiber runtime injects the reroute into an unmodified thread-per-connection binary (17.3x) within a characterized envelope. Rerouting suspends run-to-completion atomicity; a measured taxonomy confines the hazard to unlocked shared aggregates, and a transparent page-protection detector guards exactly those, validated on stock Redis.
- Abstract(参考訳): ハードウェアアクセラレーターは今や、オンラインサービスにとって重要な道のりにある。
GPU、FPGA、ハードウェアセキュリティモジュール、量子後KEM、推論サーバなど、ますますリモート化が進んでいる。
きめ細かいオフロード(マイクロ秒から数ミリ秒)の場合、結果として発生する停止に対する古典的な応答はどちらも失敗する。
非同期フレームワークの書き直し、新しいランタイムやデータプレーンOS、手動で調整されたポイント統合などだ。
同時リクエストの処理は停止し、それを再開するので、すべてのサーバは、マシンが重複する要求を出荷します。
オフロードをエグゼキュータに送信し、サーバ自身のdeferred-Responseプリミティブでリクエストを一時停止し、完了時に再開する。
このレシピでは、実際のハードウェア上で22-138行の追加と1.2-5.4xのリカバリを行う。サーバの並行性モデルとオフロードの重み付けは、事前に両方の数値を予測し、勝利はデバイススループットとサーバ自身の重複容量によって制限される。
LD_PRELOADファイバランタイムは、特徴エンベロープ内の未修正スレッド毎接続バイナリ(17.3x)に再帰を注入する。
Reroutingはラン・トゥ・コンプリート・アトミックを停止し、測定された分類法は、アンロックされた共有集合体に対するハザードを制限し、透明なページ保護検出器はRedisで検証されている。
関連論文リスト
- Lower Bounds for PIR with Preprocessing from Blackbox Cryptography [57.20693707878285]
プリプロセッシングによるシングルサーバプライベート情報検索(PIR)の限界について検討する。
本研究は,プリプロセッシングを伴うシングルサーバPIRに対して,計算の低いバウンダリを提示する。
論文 参考訳(メタデータ) (2026-07-07T16:12:48Z) - DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation [69.8840101036735]
投機的復号化はLarge Language Model (LLM)推論を加速させる。
最近の並列起草者は、1つの前方通過で長いトークン列を効率的に提案するが、トークン間の依存関係が欠如しているため、急速に受け入れが低下する。
我々はDSparkという投機的復号化フレームワークを導入し、高いスループットの並列生成を適応的かつロードアウェアな検証と統合する。
論文 参考訳(メタデータ) (2026-07-06T14:28:06Z) - CoAgent: Concurrency Control for Multi-Agent Systems [3.127039011380953]
本稿では、古典的なトランザクションに欠ける能力に基づいて制御を構築する。
起動時にシリアライズ順序を修正し、各順序フィルタリングされた値を読み出し、投機的に書き込みを適用する。
オンラインの25ツールライブラリを成長させ、タスクパスレートを45/71から63/71に引き上げる。
論文 参考訳(メタデータ) (2026-06-13T16:15:14Z) - ZeRO-Prefill: Zero Redundancy Overheads in MoE Prefill Serving [18.574823955774207]
本稿では,ZeRO-Prefillを提案する。ZeRO-Prefillはプリフィルのみのサービスシステムで,バックエンドはアクティベーションによってルーティングするのではなく,専門家を重みに集める。
Qwen3-235B-A22Bでは、4つのハードウェア/精度構成でZeRO-Prefillは1.35-1.37倍のスループットを提供する。
論文 参考訳(メタデータ) (2026-05-03T03:10:24Z) - Efficient Training on Multiple Consumer GPUs with RoundPipe [6.9987546217738945]
コンシューマグレードのGPU上での微調整大型言語モデルは、コスト効率が高いが、限られたGPUメモリと遅いPCIeインターコネクトによって制限されている。
本稿では,コンシューマGPUサーバの重み付け制約を破る新たなパイプラインスケジュールであるRoundPipeを提案する。
RoundPipeは1.7Bから32Bモデルに微調整した場合、最先端のベースラインよりも1.48--2.16$times$のスピードアップを実現している。
論文 参考訳(メタデータ) (2026-04-29T18:26:13Z) - Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start [33.16822047715293]
コールドスタートのレイテンシは、現代のLLMサービスプロバイダにとって依然として大きなボトルネックである。
既存のアプローチは脆いカーネル固有のパッチや実行可能なプロセスコンテキストに依存している。
本稿では、グラフトポロジと実行コンテキストの両方を永続化する、Foundryテンプレートベースのグラフ実体化システムを提案する。
論文 参考訳(メタデータ) (2026-04-08T04:31:34Z) - HALO: Semantic-Aware Distributed LLM Inference in Lossy Edge Network [50.33808558714122]
エッジでの大規模言語モデル(LLM)推論は、ユーザのプライバシを保護すると同時に、サービスの応答性を促進する。
損失エッジネットワークにおける分散LLM推論を向上する新しいフレームワークであるHALOを提案する。
Raspberry Piクラスタによる実験の結果、HALOは信頼性の低いネットワーク条件下でLLaMAシリーズLLMの3.41倍のエンドツーエンドのスピードアップを達成した。
論文 参考訳(メタデータ) (2026-01-16T07:37:23Z) - RelayGR: Scaling Long-Sequence Generative Recommendation via Cross-Stage Relay-Race Inference [46.66085102313264]
リアルタイムレコメンデータシステムは、厳密なテールレイテンシSLOの下でカスケード(検索、前処理、きめ細かいランキング)を実行する。
本稿では,GRのHBMリレートレース推論を可能にする生産システムであるRelayGRについて述べる。
RelayGRは1.5$times$より長いシーケンスをサポートし、SLO準拠のスループットを最大3.6$times$に改善する。
論文 参考訳(メタデータ) (2026-01-05T01:34:06Z) - ConServe: Fine-Grained GPU Harvesting for LLM Online and Offline Co-Serving [61.35068981176018]
ConServeは、高いスループットと強力なオンラインレイテンシ保証を実現する大規模言語モデル(LLM)サービスシステムである。
我々は,ConServeが平均2.2$times$高スループットを実現し,オンラインサービステールのレイテンシを最先端システムと比較して平均2.9$times$削減することを示した。
論文 参考訳(メタデータ) (2024-10-02T04:12:13Z) - Asynchronous Multi-Server Federated Learning for Geo-Distributed Clients [4.6792910030704515]
フェデレートラーニング(FL)システムは、複数のクライアントが単一のサーバで中間モデルの重みを同期的に交換することで、機械学習モデルを反復的にトレーニングすることができる。
このようなFLシステムのスケーラビリティは、同期通信によるサーバアイドル時間と、ひとつのサーバがボトルネックになるリスクの2つの要因によって制限することができる。
本稿では,完全に非同期な新しいFLアーキテクチャを提案する。
論文 参考訳(メタデータ) (2024-06-03T15:29:46Z) - RelayAttention for Efficient Large Language Model Serving with Long System Prompts [59.50256661158862]
本稿では,長いシステムプロンプトを含むLCMサービスの効率を向上させることを目的とする。
これらのシステムプロンプトの処理には、既存の因果注意アルゴリズムにおいて、大量のメモリアクセスが必要である。
本稿では,DRAMから入力トークンのバッチに対して,DRAMから隠れた状態を正確に1回読み取ることのできるアテンションアルゴリズムであるRelayAttentionを提案する。
論文 参考訳(メタデータ) (2024-02-22T18:58:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。