Andrew adlı bir geliştirici, 2017 model Tesla V100 GPU'larını kullanarak yerel olarak çalıştırılabilen modern büyük dil modellerini (LLM) destekleyen bir sistem oluşturdu. Bu GPU'lar, yüksek hızlı bellekleri sayesinde Gemma 4 26B ve Qwen3 35B gibi modelleri yerel olarak çalıştırabiliyor. Gemma, GPU belleğine tamamen sığdığı için daha hızlı çalışıyor, ancak Qwen3 daha kaynak açlığını hissettiriyor.
Andrew, iki V100 GPU'sunu barındırabilen bir PCI kartı inşa etti, böylece daha büyük modellerin tamamı bellekte yer alabiliyor. Bu sistem, en son üst düzey çevrimiçi modellerin performansına ulaşmasa da, yerel olarak çalıştığı için şaşırtıcı derecede yetenekli. İkinci el pazarında daha fazla veri merkezi donanımının kullanılabilir hale gelmesiyle, bu tür yerel çözümler daha da yaygınlaşabilir.
Andrew'ın bu projesinde, yazılım yığınını çalıştırma detayları ele alınmış. Daha önceki bir proje ise aynı GPU'ları kullanarak donanım odaklı bir yaklaşım sunmuştu.
