Hot Chips 2026’da Nvidia’nın donanım vice başkanı Igor Arsovski, Groq 3 LPX raf mimarisini tanıttı ve rafın hâlihazırda üretimde olduğunu belirtti. Raf, geçen Aralık’taki 20 milyar dolarlık Groq alımıyla elde edilen LP30 çipi üzerine kurulu.
Artificial Analysis, 100 KB bağlamlı Gemma 4 31B modelinde rafın saniyede 3 431 token ürettiğini raporladı; bu, bir sonraki en hızlı halka açık uç noktasının (870 tps) yaklaşık dört katı. Nvidia sahnedeki kendi ölçümü ise 10 996 tps gösterdi (kendi raporu). 256 LP30 çipi, çip başına ~500 MB SRAM, toplam 128 GB bellek, 40 PB/s bant genişliği ve 315 PFLOPS FP8 hesaplama sunuyor; çip‑çip gecikmesi 350 ns.
SRAM‑only tasarım, bellek erişim gecikmesini ortadan kaldırsa da kapasite sınırlaması nedeniyle LPX daha çok token çözümleme (decode) için tasarlandı; büyük modeller çok sayıda LPU gerektirir. Ölçüm tek istek üzerinden yapıldığı için çok‑kullanıcılı hizmetlerle doğrudan kıyaslanamıyor. Nvidia, bu rafı Rubin GPU’larıyla birleştirerek ön‑dolgu ve çözümleme aşamalarını bölmeyi hedefliyor.
