Liquid AI, LFM2.5-VL-3B modelini tanıtarak görsel dil anlama yeteneklerinde dört büyük iyileştirme sağladı: ekran anlama, doğal dil sorgularıyla nesne tespiti, çoklu görüntü işleme ve işlev çağrısı. Model, 34 trilyon token üzerinde ön eğitim gördü ve 4 kat daha fazla görsel veri ile geliştirildi.
LFM2.5-VL-3B, 400 milyon parametreli SigLIP2 NaFlex görsel kodlayıcıyı ve LFM2.5-2.6B metin modelinin ön eğitimli omurgusunu birleştirir. Model, 128 bin kelimelik sözlüğüyle non-Latin betikleri destekler. Eğitim iki aşamalı: denetimli ince ayar ve çok ödül pekiştirme öğrenmesi.
Model, görsel ve metinsel testlerde başarılı performans gösterdi. Özellikle ekran anlama, doküman okuma ve işlev çağrısı alanlarında öne çıktı. LFM2.5-VL-3B, mobil cihazlarda yüksek hacimli işlemler için on-device zeka sağlar.
