7 ms·Fusing a 27B ternary LLM's whole decode step into one CUDA kernel3 points by Jr23_xd 2mo agogenxy 2mo ago[dead]