論文の概要: FusionML: Prefill, Not Decode - Mechanism and Boundaries of CPU+GPU Co-Execution on Unified-Memory Apple Silicon
- arxiv url: http://arxiv.org/abs/2607.22785v1
- Date: Fri, 24 Jul 2026 11:42:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.877961
- Title: FusionML: Prefill, Not Decode - Mechanism and Boundaries of CPU+GPU Co-Execution on Unified-Memory Apple Silicon
- Title(参考訳): FusionML: プリフィルでデコードではない - CPU+GPUの共同実行のメカニズムとバウンダリ
- Abstract要約: 私たち自身を含む以前の試みは、失敗に終わり、あるいは正確で確立された勝利を生み出しました。
MLXの遅延グラフスケジューラは、クロスストリーム作業を行う CPU ストリーム操作が1つの評価グラフ内で非マテリアル化された GPU 結果を消費する場合、行分割行列は、物質化された入力で x1.38 を高速に実行する。
デコードでは利益が得られず、共有帯域幅によるバウンドは追加されない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Apple-Silicon SoCs share CPU, GPU, and Neural Engine over one unified memory system, raising the question of whether transformer inference can be accelerated by splitting single operators across units. Prior attempts, including our own, failed or produced precision-confounded wins. We identify the cause: MLX's lazy-graph scheduler \emph{serializes} cross-stream work whenever a CPU-stream operation consumes an unmaterialized GPU result inside one evaluation graph, so a row-split matmul that runs \x{1.38} faster with materialized inputs runs \x{0.66} slower than GPU-only inside a lazy graph; an eager materialization boundary restores concurrency (\x{1.34}). \sys{} implements a per-layer, contention-aware CPU+GPU row split for transformer prefill built on this fix. Evaluated across five chips and three Apple-Silicon generations, community-replicated, the split accelerates Llama-shaped decoder-block prefill by \x{1.15}--\x{1.38}, unchanged at full 32-block depth, and reaches \x{1.18}--\x{1.25} faster time-to-first-token on a real Qwen2.5-7B checkpoint served through stock MLX-LM, with token-identical outputs and unchanged decode throughput. We characterize the boundaries equally carefully: decode cannot benefit, bound by shared bandwidth co-execution does not add; precision-matched training loses \x{0.86}--\x{0.97} on all five chips; ANE dispatch overhead excludes it at layer granularity; and a no-regression runtime gate becomes self-defeating under memory pressure, where probing an alternative mode evicts the active mode's working set. Code, raw results, and generation transcripts are released.
- Abstract(参考訳): Apple-Silicon SoCはCPU、GPU、Neural Engineを1つの統一メモリシステムで共有する。
それまでの試行は、私たち自身を含め、失敗に終わったり、正確で確立された勝利を生んだりしました。
MLXの遅延グラフスケジューラ \emph{serializes} クロスストリーム作業は、CPUストリーム操作が1つの評価グラフ内で非マテリアル化されたGPU結果を消費するたびに行われる。
\sys{}は、この修正で構築されたトランスフォーマープリフィルのために、層ごとの競合対応CPU+GPU行スプリットを実装している。
5つのチップと3つのApple-Silicon世代で評価され、コミュニティが複製され、スプリットはLlama型のデコーダブロックプリフィルを \x{1.15}--\x{1.38} で加速し、32ブロックの深さで変化せず、実際のQwen2.5-7Bチェックポイントで、トークン識別出力とデコードスループットが変化した。
共有帯域のコエグゼクションが加わらない場合、デコードでは利益が得られず、精度にマッチしたトレーニングでは、すべての5つのチップで \x{0.86}--\x{0.97} を失う。
コード、生の結果、および生成書き起こしがリリースされる。
関連論文リスト
- VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention [47.30761996669105]
トレーニング不要な低ビットアテンションフレームワークであるVC-Attentionを提案する。
V-Smoothは、オンラインの軽量クラスタリングによってバリュートークンを再注文するので、融合ハードウェアブロック内のトークンは、共に量子化される。
ログドメインのスコアを直接E4M3確率符号に1つの融合乗算加算でマッピングし、FP32指数関数とフォーマット変換を排除した。
論文 参考訳(メタデータ) (2026-09-14T16:17:35Z) - Pre-Compiled Pipeline Shards for Distributed LLM Inference on Intel AI PC Fleets [0.0]
私たちは、少数のAIPCが、単一のAIPCの能力を超えたモデルを提供できることを示しています。
Intel Tiber Cloud上のLunar Lake AI PCの4ノードデプロイは、対話的な速度で単一のユーザに提供する。
論文 参考訳(メタデータ) (2026-08-19T17:33:28Z) - Ready Cohorts: Bounding GPU Opportunity and Avoiding Host Round Trips in LLM-Agent Control [0.0]
固定シェアF, 正確なオフラインシェアP*, ローカルアッパーバウンドU, オンライン達成シェアAを用いて, 既定コホート境界を定式化する。
別のメカニズムの研究では、4バイトをホストに返さずに、GPUで計算されたバイナリ決定をデバイスに保持している。
論文 参考訳(メタデータ) (2026-08-12T14:42:15Z) - Meganeura: Portable GPU Training and Inference through Vulkan and Metal [0.0]
Meganeura氏は、ひとつのコンパクトなネイティブコンパイラが、コンシューマGPU上の両方のフェーズにまたがることができるかどうかを尋ねている。
NVIDIAとAMDの離散GPUで、マッチした5つのワークロードとPyTorchを比較した。
その結果,一般消費者のグラフィクスAPIは,コンパクトな共有トレイン・ツー・デプロイスタックを,時としてベンダ・コンペティティブなパフォーマンスでサポートできることが示唆された。
論文 参考訳(メタデータ) (2026-08-03T00:42:55Z) - DMax: Aggressive Parallel Decoding for dLLMs [77.24184219948337]
効率的な拡散言語モデル(dLLM)のための新しいパラダイムであるDMaxを提案する。
並列デコードにおけるエラーの蓄積を軽減し、生成品質を維持しながらアグレッシブデコードを可能にする。
当社のアプローチの核心は、マスクと均一なdLLMを効率的に統合する新しいトレーニング戦略であるOn-Policy Uniform Trainingである。
論文 参考訳(メタデータ) (2026-04-09T14:35:42Z) - ParaCodex: A Profiling-Guided Autonomous Coding Agent for Reliable Parallel Code Generation and Translation [5.103450268268085]
ParaCodexは、Codexベースのエージェントを自律的なOpenMPオフロードシステムに変換するHPCエンジニアリングワークフローである。
我々は、HeCBench, Rodinia, NAS上で、シリアルCPUカーネルからOpenMPオフロードカーネルへの変換を評価する。
我々は HeCBench 上の 3x と Rodinia 上の 5x の幾何平均スピードアップを達成し、全てのスイートにおいてゼロショットコーデックスベースラインを上回ります。
論文 参考訳(メタデータ) (2026-01-07T19:04:53Z) - FuseSampleAgg: Fused Neighbor Sampling and Aggregation for Mini-batch GNNs [51.56484100374058]
FuseSampleAggは、隣人の平均アグリゲーションをGraphSAGEの1つのパスにフューズし、サンプリングする。
Operatorは決定論的であり、標準のPyTorchと統合され、CSVログからすべてのテーブルとフィギュアを再現するスクリプトが同梱されている。
論文 参考訳(メタデータ) (2025-11-17T17:57:18Z) - Nexus:Proactive Intra-GPU Disaggregation of Prefill and Decode in LLM Serving [4.309392302169281]
エンジンレベルのプリフィル・デコード(PD)デアグリゲーションは干渉を避けるが、高いハードウェアと調整オーバーヘッドを引き起こす。
PDは、最大2.2倍のスループット、20倍のTTFT、2.5倍のTBTを達成する。
論文 参考訳(メタデータ) (2025-07-09T07:27:18Z) - A Simple Linear Patch Revives Layer-Pruned Large Language Models [58.056251480151104]
大規模言語モデル(LLM)の圧縮技術として広く使われているレイヤプルーニング(Layer pruning)が登場している。
textscLinearPatchはプルーニングインターフェイスで2つの操作を1つの行列に乗算する。
パッチはメモリ効率の悪いオフライン蒸留によって5Kの未ラベルのサンプルでさらに洗練され、1つのGPUでわずか30分で95.16%に保留できる。
論文 参考訳(メタデータ) (2025-05-30T15:06:08Z) - Minute-Long Videos with Dual Parallelisms [57.22737565366549]
Diffusion Transformer (DiT)ベースのビデオ拡散モデルは、大規模に高品質なビデオを生成するが、長いビデオの処理遅延とメモリコストは禁じられている。
我々はDualParalと呼ばれる新しい分散推論戦略を提案する。
1つのGPUでビデオ全体を生成する代わりに、時間フレームとモデルレイヤの両方をGPU間で並列化します。
論文 参考訳(メタデータ) (2025-05-27T11:55:22Z) - Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation [84.00166854547241]
拡散変換器(DiT)はビデオ生成に必須であるが,注意の2次複雑さにより遅延が著しく低下する。
SVG2は,識別精度を最大化し,無駄を最小化する学習自由フレームワークである。
論文 参考訳(メタデータ) (2025-05-24T21:30:29Z) - Hardware-Aware Parallel Prompt Decoding for Memory-Efficient Acceleration of LLM Inference [23.633481089469836]
LLM(Large Language Models)の自動回帰デコーディングは、ハードウェアの性能に大きなオーバーヘッドをもたらす。
トレーニング可能なパラメータを0.0002$%しか必要とせず,A100-40GBのGPUをたった16時間で効率的にトレーニングできる並列プロンプトデコーディングを提案する。
我々のアプローチでは、最大2.49$times$ スピードアップを示し、最小のメモリオーバーヘッドは0.0004$%である。
論文 参考訳(メタデータ) (2024-05-28T22:19:30Z) - Hybrid Models for Learning to Branch [81.93868699246214]
我々はCPUマシン上で効率的な分岐を行うための新しいハイブリッドアーキテクチャを提案する。
提案アーキテクチャは,GNNの表現力と分岐処理のための計算コストの低い多層パーセプトロン(MLP)を組み合わせる。
論文 参考訳(メタデータ) (2020-06-26T21:03:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。