Se desarrollaron dos nuevas técnicas que reducen los costos del método de transferencia de conocimiento utilizado para reducir modelos de inteligencia artificial manteniendo su rendimiento. Los investigadores eliminaron la necesidad de almacenar en memoria al precomputar los 100 tokens más probables del modelo maestro y dividieron la función de pérdida Kullback-Leibler (KL) en partes, reduciendo significativamente el uso de memoria. Estos cambios permitieron procesar textos extensos con una sola GPU y disminuyeron el costo de experimentos a gran escala.

El método de transferencia de conocimiento más común, la transferencia en línea, requiere que el modelo maestro y el modelo estudiante se mantengan simultáneamente en memoria. Esto implica recalcular el modelo maestro en cada paso y un gran consumo de memoria. En los nuevos métodos, la salida del modelo maestro se precomputa y almacena, y el modelo estudiante se entrena con esos datos almacenados. De este modo, ya no es necesario mantener el modelo maestro en memoria y el uso de memoria se reduce considerablemente.

Los investigadores indican que estas nuevas técnicas permiten procesar textos de hasta 32 K de longitud con una sola GPU y reducen el costo de experimentos a gran escala. Sin embargo, estos métodos también presentan algunas limitaciones.