3 ms·
I believe it uses something like image to text to provide general understanding of image to LLM, maybe in form of vector floats even... making it good at under
by netdur 3y ago
I believe it uses something like image to text to provide general understanding of image to LLM, maybe in form of vector floats even... making it good at understanding content of image but cannot do ops you listed.