4 ms·DGX does parallel inference with llamacpp/vLLM much better than AMD GPU at 128GB VRAM.by mycall 2mo agoDGX does parallel inference with llamacpp/vLLM much better than AMD GPU at 128GB VRAM.