4 ms·text to video models need training data in form of videos and captions (prompts)by generativeai 2y agotext to video models need training data in form of videos and captions (prompts)