論文の概要: Accelerator Choice Is Not Enough: AlphaFold2 Inference on Cloud TPUs
- arxiv url: http://arxiv.org/abs/2609.34818v1
- Date: Mon, 28 Sep 2026 10:17:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.773732
- Title: Accelerator Choice Is Not Enough: AlphaFold2 Inference on Cloud TPUs
- Title(参考訳): Accelerator Choice:AlphaFold2のクラウドTPU推論
- Abstract要約: Colab CPUランタイム、NVIDIA T4 GPU、専用8チップのCloud TPU v5eスライスで1つのAlphaFold2推論ワークロードを実行しています。
TPUのハードウェア上の大きな利点は、T4の13.1秒に対して1回の呼び出しで0.47秒の安定した状態にあることにある。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AlphaFold2 is written in JAX, so the same inference code compiles and runs unchanged on CPUs, GPUs and Google Cloud TPUs. That portability makes the accelerator look like the main decision a user has to make. We show that it is not. Running one AlphaFold2 inference workload across a Colab CPU runtime, an NVIDIA T4 GPU and a dedicated eight-chip Cloud TPU v5e slice, we find a large hardware advantage for the TPU, 0.47 s per call in steady state on a single chip against 13.1 s on the T4 in the same measurement campaign, and three ways in which the software layer decides how much of it a user actually gets. The default execution path uses one chip of the eight, and at list prices the idle capacity makes the slice cost about as much per prediction as the GPU. Batching with jax.vmap never exceeds single-query throughput, while mapping queries across chips with jax.pmap gives eight chips 6.5-7.9x the throughput of one on a matched grid; automatic sharding leaves the per-chip footprint unchanged, consistent with replication, most plausibly because AlphaFold2 carries no sharding annotations. Our retained trace analysis of a first call at a new input shape reports about three quarters of the traced span in JAX tracing and compilation rather than execution. Reruns five weeks later reproduced neither cloud baseline, the GPU one off by roughly a factor of two, so the hardware ratio above is specific to one campaign.
- Abstract(参考訳): AlphaFold2はJAXで記述されているので、同じ推論コードがコンパイルされ、CPU、GPU、Google Cloud TPU上では動作しない。
このポータビリティにより、アクセラレーターはユーザーがやらなければならない主な決定のように見える。
私たちはそうではないことを示します。
ひとつのAlphaFold2推論ワークロードをColab CPUランタイム、NVIDIA T4 GPU、専用の8チップのCloud TPU v5eスライスで実行すると、TPUに対する大きなハードウェア上のアドバンテージが得られます。
デフォルトの実行パスは8つのチップの1つを使用し、リストの価格ではアイドル容量はGPUと同じくらいのコストがかかる。
jax.vmap によるバッチはシングルクエリのスループットを超えることはないが、jax.pmap によるチップ間のクエリのマッピングでは、マッチしたグリッド上の1つのスループットの6.5-7.9倍のスループットが得られる。
新しい入力フォームでの最初の呼び出しのトレース分析は、JAXトレースとコンパイルにおいて、実行ではなく、トレースされたスパンの約4分の3を報告します。
5週間後のリランでは、クラウドベースラインもGPUもほぼ2倍になったため、上記のハードウェア比は1つのキャンペーンに比例する。
関連論文リスト
- Validating Memory-Optimal Transformer Kernels on Real Hardware: From Formal Derivation to Measured Performance Across Two HPC Clusters [0.0]
我々は、アレーの数学(MoA)を用いて導出したトランスフォーマーカーネルのメモリ最適コスト関数を検証する。
本稿では,CPUとGPUの2つのHPCクラスタ上での測定性能に対して,これらの予測を検証した。
論文 参考訳(メタデータ) (2026-09-27T20:52:05Z) - PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud [19.027069678233655]
PhyAIは、単一のランタイムを持つ物理AI推論エンジンである。
単一のまたは複数のGPU上でビジョン言語アクション(VLA)モデルとワールドアクションモデル(WAM)を実行する。
pi0、pi0.5、GR00T N1.7、MiniCPM-Robotの公式実装よりも1.40x-4.65xのスピードアップを実現している。
論文 参考訳(メタデータ) (2026-08-04T13:53:48Z) - Meganeura: Portable GPU Training and Inference through Vulkan and Metal [0.0]
Meganeura氏は、ひとつのコンパクトなネイティブコンパイラが、コンシューマGPU上の両方のフェーズにまたがることができるかどうかを尋ねている。
NVIDIAとAMDの離散GPUで、マッチした5つのワークロードとPyTorchを比較した。
その結果,一般消費者のグラフィクスAPIは,コンパクトな共有トレイン・ツー・デプロイスタックを,時としてベンダ・コンペティティブなパフォーマンスでサポートできることが示唆された。
論文 参考訳(メタデータ) (2026-08-03T00:42:55Z) - FusionML: Prefill, Not Decode - Mechanism and Boundaries of CPU+GPU Co-Execution on Unified-Memory Apple Silicon [0.0]
私たち自身を含む以前の試みは、失敗に終わり、あるいは正確で確立された勝利を生み出しました。
MLXの遅延グラフスケジューラは、クロスストリーム作業を行う CPU ストリーム操作が1つの評価グラフ内で非マテリアル化された GPU 結果を消費する場合、行分割行列は、物質化された入力で x1.38 を高速に実行する。
デコードでは利益が得られず、共有帯域幅によるバウンドは追加されない。
論文 参考訳(メタデータ) (2026-07-24T11:42:17Z) - Minute-Long Videos with Dual Parallelisms [57.22737565366549]
Diffusion Transformer (DiT)ベースのビデオ拡散モデルは、大規模に高品質なビデオを生成するが、長いビデオの処理遅延とメモリコストは禁じられている。
我々はDualParalと呼ばれる新しい分散推論戦略を提案する。
1つのGPUでビデオ全体を生成する代わりに、時間フレームとモデルレイヤの両方をGPU間で並列化します。
論文 参考訳(メタデータ) (2025-05-27T11:55:22Z) - MARLIN: Mixed-Precision Auto-Regressive Parallel Inference on Large Language Models [58.3342517278868]
本稿では,Mixed-precision AutoRegressive LINearカーネルの設計について述べる。
バッチサイズは16-32までサポートでき、量子化のスピードアップが最大 (4times$) になる。
MarLINは非同期メモリアクセス、複雑なタスクスケジューリング、パイプライン化といったテクニックを組み合わせてこれを実現している。
論文 参考訳(メタデータ) (2024-08-21T16:10:41Z) - QUIK: Towards End-to-End 4-Bit Inference on Generative Large Language
Models [57.04178959678024]
重み付けとアクティベーションの両方を4ビットにキャストすることで、大きな生成モデルに対する推論計算の大部分が実行可能であることを示す。
これをQUIKと呼ばれるハイブリッド量子化戦略により実現し、重みとアクティベーションの大部分を4ビットに圧縮する。
我々は、QUIKフォーマットを高効率なレイヤワイドランタイムに適合させるGPUカーネルを提供し、これにより、エンドツーエンドのスループットが3.4倍に向上する。
論文 参考訳(メタデータ) (2023-10-13T17:15:05Z) - Efficient Visual Tracking via Hierarchical Cross-Attention Transformer [82.92565582642847]
本稿では,HCAT と呼ばれる階層型クロスアテンショントランスを用いた効率的な追跡手法を提案する。
当社のモデルは、GPUで約195fps、CPUで45fps、NVidia Jetson AGX XavierのエッジAIプラットフォームで55fpsで動作します。
論文 参考訳(メタデータ) (2022-03-25T09:45:27Z) - PLSSVM: A (multi-)GPGPU-accelerated Least Squares Support Vector Machine [68.8204255655161]
Support Vector Machines (SVM) は機械学習で広く使われている。
しかし、現代的で最適化された実装でさえ、最先端ハードウェア上の大きな非自明な高密度データセットにはうまくスケールしない。
PLSSVMはLVMのドロップイン代替として使用できる。
論文 参考訳(メタデータ) (2022-02-25T13:24:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。