3 ms·
2B is pretty small... No 100B+ param (certainly no 2T+ param) models have been trained natively to quantize down to 1.58b.
by onlyrealcuzzo 2mo ago
2B is pretty small...
No 100B+ param (certainly no 2T+ param) models have been trained natively to quantize down to 1.58b.