Liquid AI ha presentado el modelo LFM2.5-VL-3B, que ofrece cuatro mejoras significativas en las capacidades de comprensión del lenguaje visual: comprensión de pantalla, detección de objetos con consultas de lenguaje natural, procesamiento de múltiples imágenes y llamadas a funciones. El modelo ha sido preentrenado en 34 billones de tokens y mejorado con cuatro veces más datos visuales.
El LFM2.5-VL-3B combina un codificador visual SigLIP2 NaFlex de 400 millones de parámetros con la columna vertebral preentrenada del modelo de texto LFM2.5-2.6B. El modelo admite scripts no latinos con un vocabulario de 128 mil palabras. El entrenamiento se realiza en dos etapas: ajuste fino supervisado y aprendizaje por refuerzo con múltiples recompensas.
El modelo ha demostrado un rendimiento exitoso en pruebas visuales y textuales, destacando especialmente en comprensión de pantalla, lectura de documentos y llamadas a funciones. El LFM2.5-VL-3B proporciona inteligencia en el dispositivo para operaciones de alto volumen en dispositivos móviles.
