Un desarrollador llamado Andrew creó un sistema que utiliza GPU Tesla V100 de 2017 para soportar modelos de lenguaje grande (LLM) que pueden ejecutarse localmente. Estos GPU, gracias a su memoria de alta velocidad, pueden ejecutar modelos como Gemma 4 26B y Qwen3 35B localmente. Gemma funciona más rápido porque cabe completamente en la memoria del GPU, pero Qwen3 es más sensible a la escasez de recursos.

Andrew construyó una tarjeta PCI que puede albergar dos GPU V100, lo que permite que modelos más grandes se alojan completamente en la memoria. Aunque este sistema no alcanza el rendimiento de los modelos de última generación en línea, es notablemente capaz al ejecutarse localmente. Con más hardware de centros de datos disponible en el mercado de segunda mano, estas soluciones locales podrían volverse más comunes.

En el proyecto de Andrew, se abordaron los detalles de la ejecución de la pila de software. Un proyecto anterior había adoptado un enfoque basado en hardware utilizando los mismos GPU.