NVIDIA presentó un nuevo modelo de mezcla de expertos (MoE) de pesos abiertos llamado Nemotron 3.5 Lightning. Este modelo tiene 30 mil millones de parámetros (3 mil millones de parámetros activos) y está diseñado para coordinar agentes que gestionan tareas continuas. El modelo hace que la velocidad de producción de tokens sea 4 veces más rápida que los modelos de tamaño similar, pero solo logra un aumento del 30% en las tareas de agentes. Esto indica que el cuello de botella real está en la capa de orquestación.
Nemotron 3.5 Lightning combina cuatro elementos arquitectónicos principales: una arquitectura híbrida Mamba-Transformer, predicción de múltiples tokens (MTP), mezcla de expertos latentes (MoE) y decodificación especulativa. Estas características están diseñadas para mejorar el rendimiento del modelo y acelerar la velocidad de producción de tokens. Sin embargo, la puntuación de 24 del modelo en el Artificial Analysis Intelligence Index, aunque es una mejora significativa con respecto al modelo Nemotron 3 Nano anterior, muestra que el aumento de velocidad en las tareas de agentes es limitado.
El modelo Nemotron 3.5 Lightning de NVIDIA logra un aumento significativo en la velocidad de producción de tokens, pero el aumento limitado de velocidad en las tareas de agentes indica que la capa de orquestación y la gestión de agentes son el verdadero cuello de botella.
