El chip M4 Max de Apple Mac Studio ha mostrado un rendimiento de throughput de decodificación más alto que Nvidia GB10 y AMD Strix Halo. Este rendimiento fue posible gracias a la banda ancha de memoria de 546 GB/s y la GPU de 40 núcleos del chip.
La principal razón de la alta performance del M4 Max es que la fase de decodificación es secuencial. Cada token debe pasar por cada capa del modelo, por lo que los pesos del modelo deben fluir rápidamente desde la memoria de la GPU. Por esta razón, los sistemas con grandes pools de memoria y alta banda ancha de memoria se vuelven más atractivos.
Sin embargo, el rendimiento del M4 Max no se limita solo a la banda ancha de memoria. La GPU de 40 núcleos del chip es bastante grande en escala, con 5,120 ALU de sombreadores. Sin embargo, como la velocidad del reloj no se conoce, es difícil especular sobre los FLOPS teóricos u otros criterios de rendimiento.
