Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Liquid AI пусна LFM2.5-VL-3B: 3B модел за зрение и език, която анализира екрани, локализира обекти и извиква инструменти на устройството

Вчера Liquid AI пусна LFM2.5-VL-3B. Това е модел за зрение и език с 3,1 млрд. параметъра, създаден за внедряване на устройството. Моделът разчита цифрови екрани на мобилни устройства, в уеб и на настолни компютри. Той локализира обекти по координати, анализира документи и диаграми и извиква инструменти от текстов или графичен вход. Liquid AI отчита среден резултат от 69,4 точки в 28 бенчмарка за зрение. Това съответства на InternVL-3.5-4B и е с 0,7 точки под Qwen3.5-4B — и двата модела са с 4,7 млрд. параметъра. Моделът не използва разсъждение, затова отговаря директно и поддържа ниска латентност. Необходима е приблизително 3 GB памет, а скоростта на декодиране достига 228 токена/секунда на Apple M5 Max.

Може ли да бъде внедрен?

Да, контролният пункт се предлага в четири формата: native, GGUF, ONNX и MLX. Средите за изпълнение, налични още от първия ден, включват llama.cpp, MLX, vLLM, SGLang и ONNX. Необходима е приблизително 3 GB памет.

  • За кои компании се отнася: LFM Open License v1.0 е базиран на Apache-2.0, с една промяна: безплатното търговско използване приключва, когато годишните приходи на компанията достигнат 10 млн. щатски долара. Така независими разработчици, стартъпи и малки и средни предприятия под този праг могат да предлагат продукта си търговски безплатно. По-големите предприятия трябва да договорят търговски лиценз с Liquid AI. За научни, образователни и нестопански цели няма ограничение на приходите.
  • Индустрии: Потребителска електроника, автомобилна индустрия, индустриална и роботика, финансови услуги, здравеопазване и електронна търговия. Също така доставчици на QA и RPA решения, които автоматизират графични интерфейси.
  • Приложения: Агенти за работа с екрани на устройството, автоматизация на тестването на графични интерфейси, преобразуване на PDF файлове в структуриран текст с етикети за оформление, OCR на фактури и касови бележки, откриване на обекти почти в реално време в превозни средства, офлайн превод на менюта и пътни знаци и сравнение на множество изображения.

И така, какво е новото?

LFM2.5-VL-3B разширява LFM2-VL-3B в четири направления.

  • Разбиране на екрани и потребителски интерфейси: Моделът постига средно 80,7 в ScreenSpot-v2 за настолни компютри (78,7), мобилни устройства (81,2) и уеб (82,2). Liquid AI отчита 51,2 за Gemma-4-E4B и 78,5 за Qwen3.5-4B, докато по-големият InternVL-3.5-4B е начело с 84,1.
  • Извикване на функции: Това е новост за серията VL. ToolSandbox се повишава от 26,4 на 59,5. BFCL v4 се повишава от 20,5 на 32,5. Извикванията на инструменти се генерират като Python-подобни извиквания между токените <|tool_call_start|> и <|tool_call_end|>.
  • Локализиране: Прецизността@1 на RefCOCO-avg нараства от 57,1 на 87,9 — ръст от 30 точки, дължащ се на мащабираните синтетични данни за локализиране.
  • Вход с множество изображения: BLINK се подобрява от 50,2 на 61,5, а MuirBench — от 34,9 на 58,3.

Архитектура и обучение

Езиковият гръбнак е LFM2.5-2.6B. Зрителната кула е оптимизиран по форма 400M енкодер SigLIP2 NaFlex. NaFlex обработва естествената разделителна способност, като разделя големите изображения на неприпокриващи се фрагменти с размер 512×512 пиксела, допълнени от преоразмерена миниатюра на цялото изображение. Дължината на контекста е 32 768 токена, а се поддържат 16 езика.

Предварителното обучение използва приблизително 34 трлн. токена. Речникът е удвоен до 128 хил. токена чрез разширяване на съществуващия токенизатор на място, което подобрява покритието на нелатинските писмености. Предварителното обучение на зрителния компонент е увеличено 4 пъти по отношение на броя токени, като са използвани подбрани и синтетични данни за надписи, OCR, локализиране и следване на инструкции.

Обучението след предварителното обучение представлява SFT с дистилация на знания от по-голям учител и обучение Antidoom, последвани от многоревардно обучение с подсилване.

Моделът не използва разсъждение. Той отговаря директно — проектно решение, което стои зад неговия профил на латентност.

Бенчмаркове

Liquid AI оцени модела в 28 бенчмарка за зрение чрез vLLM 0.26.0 в режим без разсъждение. LFM2.5-VL-3B постига средно 69,4, наравно с InternVL-3.5-4B (69,4) и с 0,7 точки зад Qwen3.5-4B (70,1). И двата сравнителни модела имат 4,7 млрд. параметъра.

Сред забележителните индивидуални резултати са: RealWorldQA 73,1 спрямо 67,7 за InternVL-3.5-4B, TextVQA 84,3 спрямо 81,2 за Qwen3.5-4B, MMStar 63,3, MathVista-mini 68,5, ChartQA 81,3, DocVQA 91,1 и OCRBench v1 84,2. CountBenchQA регресира до 87,3 спрямо 92,2 при предишното издание.

При оценката само на текст IFEval достига 82,3 спрямо 72,9 преди. Gemma-4-E4B все още води там с 87,9.

Основни изводи

  • LFM2.5-VL-3B постига средно 69,4 в 28 бенчмарка за зрение, наравно с моделите от класа с 4,7 млрд. параметъра.
  • ScreenSpot-v2 се повишава до 80,7, а RefCOCO-avg — до 87,9 спрямо 57,1 при предишното издание.
  • Извикването на функции е новост за серията VL: ToolSandbox 26,4 → 59,5, BFCL v4 20,5 → 32,5.
  • Работи с около 3 GB памет, декодира 228 токена/секунда на M5 Max и 20 токена/секунда на Galaxy S26 Ultra.
  • LFM Open License v1.0 позволява безплатно търговско използване само при годишни приходи под 10 млн. щатски долара.

Разгледайте техническите подробности и теглата на модела. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face, ИЛИ продуктово издание, ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини