Zhipu AI explicó la semana pasada que el modelo Ox Alpha es en realidad su GLM‑5.3‑Flash, que fue probado de forma anónima en OpenRouter y OpenCode, y que todo el tráfico se procesó en chips de IA fabricados en China.
GLM‑5.3‑Flash reduce el tamaño de la caché KV en aproximadamente 4,4 veces y el cálculo de atención en tres veces; esto es posible gracias a la combinación de mecanismos de atención lineal y dispersa, un IndexPool denso y el protocolo Manifold‑Constrained Hyper‑Connections dirigido por el algoritmo Sinkhorn‑Knopp.
El modelo sigue siendo un poco más grande que los competidores Kimi‑K3 y DeepSeek‑V4‑Flash en cuanto al tamaño de la caché KV, lo que indica margen de mejora; una carga de trabajo diaria de aproximadamente 100 billones de tokens se realizó en una prueba de una semana sobre GPU de la clase Huawei Ascend, y con 30 billones de tokens de datos multimodales de pre‑entrenamiento alcanzó un rendimiento comparable a Claude Opus‑4.8 a una décima parte del costo.
