Intel lanzó la versión beta 0.21.0-b3 de LLM-Scaler-vLLM, proporcionando soporte el mismo día para el nuevo modelo Muse Glimmer 30B de Meta. Este modelo puede funcionar en dispositivos como Arc Pro B70 con cuantización FP8 en línea. Además, se añadió soporte DFlash para Muse-Glimmer-30B y Qwen3.6-27B, y se mejoró el rendimiento del primer token para los modelos Gemma-4-31B y Gemma-4-26B-A4B-it.
También se lanzó la versión beta 0.2.0-b1 de LLM-Scaler-Omni. Esta versión actualizó el stack XPU de ComfyUI 0.31, añadió producción de video local MiniMax H3, soporte Wan Animate 2 y otros modelos que funcionan en dispositivos Arc Pro B70 y B60. Además, se extendió el alcance optimizado para modelos como Wan 2.2 14B T2V Turbo, LTX-2, Z-Image / Lumina y Krea2.
La actualización incluye soporte gestionado GGUF Q4_1 e integración ComfyUI-GGUF-XPU. Estas novedades mejoran el stack vLLM para gráficos Intel y ofrecen un mejor rendimiento para diversos modelos.
