En Hot Chips 2026, el vicepresidente de hardware de Nvidia, Igor Arsovski, presentó la arquitectura Groq 3 LPX y señaló que ya está en producción. La arquitectura se basa en el chip LP30 adquirido en la compra de Groq por 20 mil millones de dólares en diciembre pasado.

Artificial Analysis informó que, con el modelo Gemma 4 31B de 100 KB de contexto, la arquitectura produce 3 431 tokens por segundo, aproximadamente cuatro veces la velocidad del siguiente punto público más rápido (870 tps). La propia medición de Nvidia mostraba 10 996 tps (según su informe). La configuración de 256 chips LP30 ofrece alrededor de 500 MB de SRAM por chip, un total de 128 GB de memoria, ancho de banda de 40 PB/s y 315 PFLOPS de cálculo FP8; la latencia entre chips es de 350 ns.

Aunque el diseño solo‑SRAM elimina la latencia de acceso a la memoria, la limitación de capacidad hace que el LPX esté pensado principalmente para la decodificación de tokens; los modelos grandes requieren muchas LPU. Dado que la medición se realizó con una única solicitud, no es directamente comparable con servicios multiusuario. Nvidia planea combinar esta arquitectura con GPUs Rubin para dividir las fases de pre‑relleno y decodificación.