Cloudflare, Kimi ve GLM gibi büyük modellerin GPU bellek kullanımını optimize etmek için üç yeni teknik geliştirdi. Bu teknikler, KV cache'i sıkıştırma, model ağırlıklarını sıkıştırma ve KV cache bütünlüğünü koruma olarak belirlenmiştir. Bu optimizasyonlar, daha fazla müşteriyi daha düşük maliyetlerle desteklemek için yapılmıştır ve model doğruluğunu etkilemiyor.

KV cache'i sıkıştırma, 16-bit hassasiyetten 8-bit float'a (FP8, e4m3) geçiş yaparak bellek kullanımını yarıya indiriyor. Bu, Kimi K2.6 modelinde yaklaşık 686.000 token'dan 1.37 milyon tokene kadar kontekst tutma kapasitesini artırıyor. Model ağırlıklarını sıkıştırma, GLM 5.2 için 8-bit float'tan 4-bit integer'a (INT4) geçiş yaparak model boyutunu 705 GB'dan 421 GB'a indiriyor ve GPU bellek kullanımını da azaltıyor.

Bu teknikler, daha fazla isteği aynı GPU belleği üzerinde paylaşarak verimliliği artırıyor. KV cache bütünlüğü kontrolü, bellek sayfalarının doğru şekilde kullanıldığından emin olmak için bir katman ekliyor. Bu kontrol, performans üzerinde minimal bir etkisi olmasına rağmen, güvenliği artırıyor.