Meta publicó como código abierto el modelo Muse Glimmer de 30 mil millones de parámetros. El modelo está compuesto por un codificador de imágenes de 2 mil millones de parámetros y un codificador de texto de 28 mil millones de parámetros. Muse Glimmer se destaca por sus capacidades de procesamiento de imágenes y video.
Muse Glimmer puede procesar imágenes y videos mediante un codificador de imágenes de 2 mil millones de parámetros. El modelo utiliza una torre de visión de 50 capas y un mecanismo de atención 2D RoPE. Además, incorpora un mecanismo Gated Grouped-Query Attention que reduce el uso de memoria en 16 veces.
Muse Glimmer es compatible con bibliotecas como transformers, llama.cpp y vLLM. El modelo funciona con GPU de NVIDIA, AMD e Intel. Para usar el modelo es necesario disponer de la versión más reciente de la biblioteca transformers.
