Liquid AI выпустила LFM2.5-VL-3B: визуально-языковую модель на 3 млрд параметров, которая читает экраны, локализует объекты и вызывает инструменты на устройстве
Вчера компания Liquid AI выпустила LFM2.5-VL-3B. Это мультимодальная модель для работы с изображениями и языком с 3,1 млрд параметров, созданная для развертывания на устройствах. Модель считывает цифровые экраны на мобильных устройствах, в веб-браузерах и на компьютерах. Она привязывает объекты к координатам, анализирует документы и графики, а также вызывает инструменты на основе текстового или графического ввода. Liquid AI сообщает о среднем результате 69,4 по 28 бенчмаркам для компьютерного зрения. Это соответствует показателю InternVL-3.5-4B и на 0,7 пункта ниже Qwen3.5-4B — обе модели имеют по 4,7 млрд параметров. Модель не использует рассуждения, поэтому отвечает напрямую и сохраняет низкую задержку. Ей требуется около 3 ГБ памяти, а скорость декодирования на Apple M5 Max составляет 228 токенов/с.
Можно ли ее развернуть?
Да, чекпойнт доступен в четырех форматах: native, GGUF, ONNX и MLX. Уже в день релиза доступны среды выполнения llama.cpp, MLX, vLLM, SGLang и ONNX. Модели требуется около 3 ГБ памяти.
- Для компаний какого уровня: LFM Open License v1.0 основана на Apache-2.0 с одним изменением: бесплатное коммерческое использование прекращается, когда годовая выручка компании достигает 10 млн долларов США. Таким образом, независимые разработчики, стартапы и малые и средние предприятия с выручкой ниже этого порога могут бесплатно выпускать коммерческие продукты. Компании с более высокой выручкой должны заключить коммерческую лицензию с Liquid AI. Для исследований, образования и некоммерческого использования ограничений по выручке нет.
- Отрасли: потребительская электроника, автомобильная промышленность, промышленность и робототехника, финансовые услуги, здравоохранение и электронная коммерция. Также поставщики решений для контроля качества и RPA, автоматизирующие графические интерфейсы.
- Применения: экранные агенты на устройствах, автоматизация тестирования графических интерфейсов, преобразование PDF в структурированный текст с метками разметки, распознавание счетов и чеков, обнаружение объектов в транспортных средствах почти в реальном времени, офлайн-перевод меню и дорожных знаков, а также сравнение нескольких изображений.
Итак, что нового?
LFM2.5-VL-3B развивает возможности LFM2-VL-3B по четырем направлениям.
- Понимание экранов и пользовательских интерфейсов: средний результат модели на ScreenSpot-v2 составляет 80,7: 78,7 на настольных компьютерах, 81,2 на мобильных устройствах и 82,2 в веб-среде. Liquid AI сообщает, что Gemma-4-E4B набирает 51,2, а Qwen3.5-4B — 78,5; более крупная InternVL-3.5-4B опережает их с результатом 84,1.
- Вызов функций: это новая возможность для линейки VL. Результат ToolSandbox вырос с 26,4 до 59,5. Показатель BFCL v4 увеличился с 20,5 до 32,5. Вызовы инструментов выдаются в виде вызовов в стиле Python между токенами
<|tool_call_start|>и<|tool_call_end|>. - Привязка объектов: точность precision@1 на RefCOCO-avg выросла с 57,1 до 87,9 — прирост составил 30 пунктов благодаря увеличению объема синтетических данных для привязки объектов.
- Ввод нескольких изображений: результат BLINK улучшился с 50,2 до 61,5, а MuirBench — с 34,9 до 58,3.
Архитектура и обучение
Языковой основой служит LFM2.5-2.6B. Визуальный модуль — оптимизированный по форме 400-миллионный энкодер SigLIP2 NaFlex. NaFlex обрабатывает изображения в исходном разрешении, разделяя большие изображения на неперекрывающиеся фрагменты размером 512×512 пикселей и уменьшая целое изображение до миниатюры. Длина контекста составляет 32 768 токенов, поддерживается 16 языков.
В ходе предварительного обучения использовалось около 34 трлн токенов. Размер словаря был удвоен до 128 тыс. токенов путем расширения существующего токенизатора без его замены, что улучшает поддержку нелатинских письменностей. Объем визуальных данных для предварительного обучения был увеличен в четыре раза по числу токенов; использовались отобранные и синтетические данные для создания описаний, OCR, привязки объектов и следования инструкциям.
Последующее обучение включает SFT с дистилляцией знаний от более крупной модели-учителя и обучение Antidoom, за которыми следует обучение с подкреплением на основе нескольких вознаграждений.
Модель не использует рассуждения. Она отвечает напрямую — именно это решение лежит в основе ее характеристик задержки.
Бенчмарки
Liquid AI провела оценку по 28 бенчмаркам для компьютерного зрения с использованием vLLM 0.26.0 в режиме без рассуждений. Средний результат LFM2.5-VL-3B составляет 69,4, что соответствует показателю InternVL-3.5-4B (69,4) и на 0,7 пункта ниже Qwen3.5-4B (70,1). Обе сравнительные модели имеют по 4,7 млрд параметров.
Примечательные отдельные результаты: RealWorldQA — 73,1 против 67,7 у InternVL-3.5-4B, TextVQA — 84,3 против 81,2 у Qwen3.5-4B, MMStar — 63,3, MathVista-mini — 68,5, ChartQA — 81,3, DocVQA — 91,1, а OCRBench v1 — 84,2. Результат CountBenchQA снизился до 87,3 с 92,2 в предыдущем релизе.
В оценке только по тексту показатель IFEval достиг 82,3 против 72,9 ранее. Однако Gemma-4-E4B по-прежнему лидирует с результатом 87,9.
Основные выводы
- LFM2.5-VL-3B получила средний результат 69,4 по 28 бенчмаркам для компьютерного зрения, сравнявшись с моделями класса 4,7 млрд параметров.
- Показатель ScreenSpot-v2 вырос до 80,7, а RefCOCO-avg — до 87,9 против 57,1 в предыдущем релизе.
- Вызов функций впервые появился в линейке VL: ToolSandbox — с 26,4 до 59,5, BFCL v4 — с 20,5 до 32,5.
- Модель работает примерно при 3 ГБ памяти, декодируя 228 токенов/с на M5 Max и 20 токенов/с на Galaxy S26 Ultra.
- LFM Open License v1.0 разрешает бесплатное коммерческое использование только компаниям с годовой выручкой менее 10 млн долларов.
Ознакомьтесь с разделами «Технические детали» и «Веса модели». Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с аудиторией 150 тыс.+ и подписаться на нашу рассылку. Постойте! Вы пользуетесь Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами в продвижении вашего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.