4 ms·How we made one of our largest inference workloads 4.7× more GPU-efficient1 points by aray07 9d ago