Liquid AIはLFM2.5-VL-3Bモデルを発表し、視覚言語理解能力において4つの主要な改善を実現した。スクリーン理解、自然言語クエリによるオブジェクト検出、複数画像処理、関数呼び出しである。このモデルは34兆トークンで事前学習され、4倍の視覚データで強化された。

LFM2.5-VL-3Bは4億パラメータのSigLIP2 NaFlex視覚エンコーダとLFM2.5-2.6Bテキストモデルの事前学習済みバックボーンを統合する。12万8000語の辞書を備え、非ラテン文字をサポートする。トレーニングは2段階で行われる。教師あり微調整と多報酬強化学習である。

このモデルは視覚的および言語的テストで優れたパフォーマンスを示した。特にスクリーン理解、ドキュメント読み取り、関数呼び出しの分野で優位性を発揮した。LFM2.5-VL-3Bはモバイル端末で大量の処理をオンデバイスで実現するAIを提供する。