3 ms·Normally people split up the model across multiple GPUs, i.e. model/tensor parallelism.by ioedward 4y agoNormally people split up the model across multiple GPUs, i.e. model/tensor parallelism.