7 ms·
I'm not very well versed, but i believe that training requires more memory to store intermediate computations so that you can calculate gradients for each layer
by quadrature 1y ago
I'm not very well versed, but i believe that training requires more memory to store intermediate computations so that you can calculate gradients for each layer.