Cloudflare ha desarrollado tres nuevas técnicas para optimizar el uso de memoria GPU en modelos grandes como Kimi y GLM. Estas técnicas son la compresión de KV cache, la compresión de pesos de modelos y la preservación de la integridad de KV cache. Estas optimizaciones se han realizado para apoyar a más clientes con costos más bajos y no afectan la precisión del modelo.

La compresión de KV cache reduce el uso de memoria al pasar de una precisión de 16 bits a 8 bits float (FP8, e4m3), reduciendo el uso de memoria a la mitad. Esto aumenta la capacidad de retención de contexto en el modelo Kimi K2.6 de aproximadamente 686.000 tokens a 1.37 millones de tokens. La compresión de pesos de modelos reduce el tamaño del modelo al pasar de 8 bits float a 4 bits integer (INT4) para GLM 5.2, reduciendo el tamaño del modelo de 705 GB a 421 GB y disminuyendo el uso de memoria GPU.

Estas técnicas aumentan la eficiencia al permitir que más solicitudes compartan la misma memoria GPU. El control de integridad de KV cache añade una capa para asegurar que las páginas de memoria se utilicen correctamente. Aunque este control tiene un impacto mínimo en el rendimiento, aumenta la seguridad.