Meta presentó el modelo Muse Glimmer de 30 mil millones de parámetros. El modelo puede funcionar en una sola GPU de consumo mediante compresión y un modelo auxiliar, acelerando los tiempos de respuesta. Muse Glimmer se comprimió para funcionar en tarjetas gráficas de 24GB o 32GB y utiliza el modelo DFlash drafter para acelerar los tiempos de respuesta.
Muse Glimmer utiliza compresión para ajustar un modelo de 30 mil millones de parámetros a 20GB de memoria. Esto permite que funcione en tarjetas gráficas de 24GB o 32GB. Además, el modelo DFlash drafter se utiliza para acelerar los tiempos de respuesta.
El modelo de Meta puede verse como una respuesta a la superioridad de los modelos de IA de pesos abiertos de China. Los modelos chinos han liderado el uso global de tokens durante las últimas 15 semanas.
