Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Liquid AI випустила LFM2.5-VL-3B: 3B-модель для роботи із зображеннями й мовою, що читає екрани, локалізує об’єкти та викликає інструменти на пристрої

Учора Liquid AI випустила LFM2.5-VL-3B. Це мультимодальна модель бачення-мови з 3,1 млрд параметрів, створена для розгортання на пристроях. Модель читає цифрові екрани на мобільних пристроях, у вебсередовищі та на настільних комп’ютерах. Вона прив’язує об’єкти до координат, аналізує документи й діаграми та викликає інструменти з текстового або графічного введення. Liquid AI повідомляє про середній результат 69,4 у 28 тестах для моделей бачення. Це відповідає показнику InternVL-3.5-4B і на 0,7 бала менше, ніж у Qwen3.5-4B — обидві моделі мають по 4,7 млрд параметрів. Модель не використовує міркування, тому відповідає безпосередньо й забезпечує низьку затримку. Вона потребує приблизно 3 ГБ пам’яті та декодує 228 токенів/с на Apple M5 Max.

Чи придатна вона для розгортання?

Так, контрольна точка доступна у чотирьох форматах: власному, GGUF, ONNX і MLX. Середовище виконання, доступне вже в день релізу: llama.cpp, MLX, vLLM, SGLang і ONNX. Вона потребує приблизно 3 ГБ пам’яті.

  • Для яких компаній підходить: LFM Open License v1.0 базується на Apache-2.0, але має одну відмінність: безкоштовне комерційне використання припиняється, коли річний дохід компанії досягає 10 млн доларів США. Отже, незалежні розробники, стартапи та малі й середні підприємства з доходом нижче цього порога можуть безкоштовно випускати комерційні продукти. Великі компанії, що перевищують цей поріг, мають укласти комерційну ліцензійну угоду з Liquid AI. Для дослідницького, освітнього та неприбуткового використання обмеження за доходом відсутні.
  • Галузі: споживча електроніка, автомобільна промисловість, промисловість і робототехніка, фінансові послуги, охорона здоров’я та електронна комерція. Також постачальники рішень для контролю якості та RPA, які автоматизують графічні інтерфейси.
  • Застосування: екранні агенти на пристроях, автоматизація тестування графічних інтерфейсів, перетворення PDF на структурований текст із позначками структури, розпізнавання рахунків і чеків, виявлення об’єктів у транспортних засобах майже в реальному часі, офлайн-переклад меню та дорожніх знаків, а також порівняння кількох зображень.

Отже, що нового?

LFM2.5-VL-3B розширює можливості LFM2-VL-3B за чотирма напрямами.

  • Розуміння екранів і інтерфейсів: середній результат моделі на ScreenSpot-v2 становить 80,7: для настільних комп’ютерів — 78,7, мобільних пристроїв — 81,2, вебсередовища — 82,2. Liquid AI повідомляє, що Gemma-4-E4B набирає 51,2, а Qwen3.5-4B — 78,5, тоді як більша InternVL-3.5-4B випереджає їх із результатом 84,1.
  • Виклик функцій: для лінійки VL це нова можливість. Результат ToolSandbox зріс із 26,4 до 59,5. BFCL v4 зріс із 20,5 до 32,5. Виклики інструментів генеруються у форматі викликів Python між токенами <|tool_call_start|> і <|tool_call_end|>.
  • Прив’язка до об’єктів: точність precision@1 у RefCOCO-avg зросла з 57,1 до 87,9 — приріст на 30 пунктів, зумовлений масштабуванням синтетичних даних для прив’язки об’єктів.
  • Введення кількох зображень: результат BLINK покращився з 50,2 до 61,5, а MuirBench — із 34,9 до 58,3.

Архітектура та навчання

Мовною основою є LFM2.5-2.6B. Візуальний модуль — оптимізований за формою 400-мільйонний енкодер SigLIP2 NaFlex. NaFlex працює з оригінальною роздільною здатністю, розділяючи великі зображення на неперекривні фрагменти розміром 512×512, а також додаючи зменшену мініатюру всього зображення. Довжина контексту становить 32 768 токенів, підтримується 16 мов.

Під час попереднього навчання було використано приблизно 34 трлн токенів. Словник було збільшено вдвічі — до 128 тисяч токенів — шляхом розширення наявного токенізатора безпосередньо, що покращує підтримку нелатинських систем письма. Обсяг даних для попереднього навчання зображень було збільшено в 4 рази за кількістю токенів завдяки підібраним і синтетичним даним для створення підписів, OCR, прив’язки об’єктів і виконання інструкцій.

Післянавчання передбачає SFT із дистиляцією знань від більшої моделі-вчителя та навчання Antidoom, після чого застосовується підкріплювальне навчання з кількома винагородами.

Модель не використовує міркування. Вона відповідає безпосередньо — саме це є конструктивним рішенням, що визначає її показники затримки.

Результати тестів

Liquid AI провела оцінювання за 28 тестами для моделей бачення, використовуючи vLLM 0.26.0 у режимі без міркувань. Середній результат LFM2.5-VL-3B становить 69,4 — стільки ж, скільки в InternVL-3.5-4B (69,4), і на 0,7 бала менше, ніж у Qwen3.5-4B (70,1). Обидві моделі для порівняння мають по 4,7 млрд параметрів.

Помітні окремі результати: RealWorldQA — 73,1 проти 67,7 у InternVL-3.5-4B, TextVQA — 84,3 проти 81,2 у Qwen3.5-4B, MMStar — 63,3, MathVista-mini — 68,5, ChartQA — 81,3, DocVQA — 91,1, а OCRBench v1 — 84,2. Результат CountBenchQA знизився до 87,3 із 92,2 у попередньому релізі.

Під час оцінювання лише тексту показник IFEval досяг 82,3 проти 72,9 раніше. Водночас Gemma-4-E4B і далі лідирує з результатом 87,9.

Основні висновки

  • LFM2.5-VL-3B досягає середнього результату 69,4 у 28 тестах для моделей бачення, відповідаючи моделям класу 4,7 млрд параметрів.
  • Результат ScreenSpot-v2 зріс до 80,7, а RefCOCO-avg — до 87,9 проти 57,1 у попередньому релізі.
  • Виклик функцій — нова можливість для лінійки VL: ToolSandbox 26,4 → 59,5, BFCL v4 20,5 → 32,5.
  • Модель працює приблизно з 3 ГБ пам’яті, декодуючи 228 токенів/с на M5 Max і 20 токенів/с на Galaxy S26 Ultra.
  • LFM Open License v1.0 дозволяє безкоштовне комерційне використання лише компаніям із річним доходом до 10 млн доларів.

Ознайомтеся з технічними деталями та вагами моделі. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання з понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібно стати нашим партнером для просування вашого репозиторію GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини