Yapay zekâ modellerinin performansını koruyarak küçültülmesi için kullanılan bilgi aktarımı yönteminin maliyetlerini düşüren iki yeni teknik geliştirildi. Araştırmacılar, öğretmen modelin en olası 100 token'ını önceden hesaplayarak bellekte tutma gereksinimini ortadan kaldırdılar ve Kullback-Leibler (KL) kayıp fonksiyonunu parçalara ayarak bellek kullanımını önemli ölçüde azalttılar. Bu değişiklikler, tek bir GPU ile uzun metinlerin işlenmesini mümkün kıldı ve büyük ölçekli deneylerin maliyetini düşürdü.

Bilgi aktarımının en yaygın yöntemi olan çevrimiçi aktarım, öğretmen ve öğrenci modelin aynı anda bellekte tutulmasını gerektiriyor. Bu, her adımda öğretmen modelin yeniden hesaplanmasını ve büyük bir bellek kullanımını gerektiriyor. Yeni yöntemlerde, öğretmen modelin çıktısı önceden hesaplanıp saklanıyor ve öğrenci model bu saklanan verilerle eğitiliyor. Bu sayede, öğretmen modelin bellekte tutulmasına gerek kalmıyor ve bellek kullanımı önemli ölçüde azalıyor.

Araştırmacılar, bu yeni yöntemlerin, tek bir GPU ile 32K uzunluğundaki metinlerin işlenmesini mümkün kıldığını ve büyük ölçekli deneylerin maliyetini düşürdüğünü belirtiyor. Ancak, bu yöntemlerin de bazı sınırlamaları var.