LFM2.5-VL-3B за по-добри и по-бързи визуални възможности за периферни устройства
LFM2.5-VL-3B разширява възможностите за зрение и език на предишните ни версии с четири основни подобрения:
- Разбиране на екрани/потребителски интерфейси: Отлично разбиране на цифрови екрани на различни устройства.
- Локализиране: Подобрено локализиране и откриване на обекти чрез заявки на естествен език.
- Вход с множество изображения: Подобрено разсъждение върху множество изображения.
- Извикване на функции: Значително по-добри възможности за извикване на функции в ситуации само с текст и със зрение и текст.
Как обучихме най-способния си модел за зрение и език
LFM2.5-VL-3B комбинира визуален енкодер SigLIP2 400M NaFlex със същия предварително обучен гръбнак като текстовия ни модел LFM2.5-2.6B. Той е предварително обучен върху около 34 трилиона токена, с четири пъти повече визуални данни от преди, извлечени от подбрани и синтетични набори от изображения и надписи, OCR, локализиране и следване на инструкции. За да поддържаме нелатински писмености, удвоихме речника до 128K, като разширихме токенизатора на място, вместо да го обучаваме от нулата.
Дообучаването протича на два етапа: първият е контролирано дообучаване (SFT) с дистилация на знания от по-голям учител и обучение Antidoom. Вторият е обучение с подсилване (RL) с множество награди.
Резултати от сравнителните тестове
Оценихме LFM2.5-VL-3B както по визуални, така и по текстови сравнителни тестове.
Визуалните сравнителни тестове обхващат многоезично визуално разбиране, следване на инструкции, визуална математика и научно разсъждение, разбиране на документи, откриване на обекти, разбиране на множество изображения и разбиране на екрани. LFM2.5-VL-3B е водещ в своя размерен клас при задачи с изображения от реалния свят, като същевременно чете добре цифрово съдържание — от документи и диаграми до елементи на потребителски интерфейси на екрана.
| Задача | Сравнителен тест | LFM2.5-VL-3B (3.1B) | LFM2-VL-3B (3.1B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | InternVL 3.5 2B (2.4B) | InternVL 3.5 4B (4.7B) | Qwen3.5-2B (2.3B) | Qwen3.5-4B (4.7B) |
|---|---|---|---|---|---|---|---|---|---|
| Общи | MMStar | 63.3 | 57.7 | 45.3 | 52.9 | 57.7 | 65.5 | 55.1 | 59.3 |
| MME | 73.1 | 73.0 | 54.9 | 67.6 | 73.6 | 81.0 | 76.2 | 79.5 | |
| RealWorldQA | 73.1 | 71.1 | 60.0 | 64.3 | 61.6 | 67.7 | 65.1 | 67.1 | |
| SimpleVQA | 35.4 | 33.0 | 27.3 | 30.4 | 30.5 | 33.7 | 35.2 | 40.7 | |
| SEED-Bench (изображение) | 77.7 | 76.6 | 71.4 | 75.3 | 75.4 | 76.4 | 75.8 | 76.1 | |
| MMBench (dev EN v1.1) | 81.0 | 80.0 | 64.2 | 71.6 | 76.2 | 81.1 | 73.1 | 78.4 | |
| CountBenchQA | 87.3 | 92.2 | 70.4 | 80.5 | 70.4 | 82.5 | 83.8 | 86.7 | |
| Многоезични | MMMB | 83.0 | 81.9 | 73.3 | 80.4 | 76.3 | 81.5 | 75.9 | 82.0 |
| Многоезичен MMBench | 79.5 | 76.3 | 62.8 | 71.2 | 70.9 | 76.6 | 69.9 | 77.0 | |
| Мултимодален IF | MM-IFEval | 60.6 | 51.4 | 65.6 | 68.2 | 47.1 | 54.5 | 55.4 | 63.1 |
| STEM | LogicVista | 37.4 | 32.2 | 29.5 | 34.5 | 30.9 | 36.2 | 34.0 | 37.6 |
| MathVista (мини) | 68.5 | 62.1 | 37.8 | 45.2 | 56.8 | 67.1 | 48.7 | 63.6 | |
| MMMU-Pro | 30.5 | 28.7 | 26.9 | 32.6 | 21.3 | 22.7 | 24.9 | 36.0 | |
| MMMU (val) | 48.4 | 45.6 | 41.1 | 49.3 | 52.0 | 60.7 | 44.1 | 50.3 | |
| Документи, OCR и диаграми | ChartQA (test) | 81.3 | 80.4 | 43.2 | 42.1 | 81.7 | 86.2 | 78.4 | 84.2 |
| DocVQA (val) | 91.1 | 89.8 | 85.7 | 87.4 | 88.4 | 91.8 | 92.6 | 94.8 | |
| InfographicVQA (val) | 70.2 | 67.8 | 54.4 | 60.9 | 69.3 | 76.9 | 73.5 | 80.3 | |
| OCRBench v1 | 84.2 | 81.7 | 70.2 | 73.5 | 83.9 | 82.0 | 84.4 | 85.6 | |
| OCRBench v2 (En) | 47.5 | 43.9 | 44.4 | 48.8 | 45.5 | 49.1 | 47.7 | 58.7 | |
| TextVQA (val) | 84.3 | 83.0 | 62.5 | 69.0 | 76.6 | 77.5 | 77.3 | 81.2 | |
| Локализиране | RefCOCO-avg | 87.9 | 57.1 | 67.3 | 72.1 | 82.9 | 88.8 | 78.5 | 86.6 |
| Множество изображения | BLINK | 61.5 | 50.2 | 45.2 | 52.2 | 52.0 | 57.2 | 48.6 | 58.7 |
| MuirBench | 58.3 | 34.9 | 32.9 | 51.8 | 45.0 | 53.5 | 48.2 | 62.0 | |
| Халюцинации | HallusionBench | 47.2 | 46.4 | 41.8 | 49.8 | 47.6 | 52.1 | 49.3 | 51.7 |
| POPE | 88.7 | 89.2 | 84.0 | 86.9 | 88.0 | 88.9 | 88.6 | 86.0 | |
| GUI | ScreenSpot-v2 Desktop | 78.7 | 6.0 | 28.1 | 45.8 | 79.9 | 82.0 | 63.8 | 76.3 |
| ScreenSpot-v2 Mobile | 81.2 | 7.6 | 42.9 | 60.3 | 86.2 | 87.8 | 69.7 | 81.4 | |
| ScreenSpot-v2 Web | 82.2 | 2.5 | 22.4 | 47.6 | 79.9 | 82.6 | 65.9 | 77.8 | |
| Средно | - | 69.4 | 57.2 | 52.0 | 59.7 | 64.6 | 69.4 | 63.7 | 70.1 |
*Всички стойности в таблицата са нормализирани до 0–100. Оценяването е извършено с vLLM 0.26.0 и препоръчителните параметри за генериране на всеки модел, когато са налични. Навсякъде е използван режим без разсъждение, а на моделите е зададено да отговарят директно, без разсъждение.
Оценихме LFM2.5-VL-3B и по текстови сравнителни тестове за следване на инструкции и използване на инструменти. Следването на инструкции се подобрява във всички направления, а използването на инструменти се подобрява значително. При използването на инструменти LFM2.5-VL-3B е наравно с Gemma-4-E2B и Qwen3.5-2B.
| Задача | Сравнителен тест | LFM2.5-VL-3B (3.1B) | LFM2-VL-3B (3.1B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | InternVL 3.5 2B (2.4B) | InternVL 3.5 4B (4.7B) | Qwen3.5-2B (2.3B) | Qwen3.5-4B (4.7B) |
|---|---|---|---|---|---|---|---|---|---|
| Следване на инструкции | IFEval | 82.3 | 72.9 | 83.0 | 87.9 | 32.4 | 35.4 | 73.6 | 86.2 |
| IFBench | 25.8 | 20.8 | 34.1 | 39.2 | 24.4 | 24.5 | 28.9 | 33.5 | |
| Multi-IF | 59.4 | 46.5 | 69.4 | 77.4 | 16.3 | 16.9 | 53.5 | 66.7 | |
| Използване на инструменти и извикване на функции | ToolSandbox | 59.5 | 26.4 | 56.5 | 61.6 | N/A | N/A | 47.7 | 65.0 |
| BFCL V4 | 32.5 | 20.5 | 33.2 | 40.0 | N/A | N/A | 33.9 | 53.6 |
*Моделите InternVL 3.5 не поддържат извикване на функции.
Тези резултати показват, че LFM2.5-VL-3B е силен модел за зрение и език с общо предназначение. Той обхваща ежедневни задачи (генериране на надписи, визуални въпроси и отговори, разбиране на документи) и е особено добър в локализирането на обекти, четенето на екрани и документи и извикването на инструменти.
Скорост на инференция върху CPU и GPU
LFM2.5-VL-3B се предлага с поддръжка още от първия ден в цялата екосистема за инференция, включително llama.cpp, MLX, vLLM, SGLang и ONNX.
Инференция на устройството. LFM2.5-VL-3B декодира 228 токена/сек на M5 Max и 116 токена/сек на Ryzen AI Max+ 395 и заема около 3 GB памет. Той достига дори 20 токена/сек на Galaxy S26 Ultra, така че можете да го изпълнявате изцяло на устройството.
GPU инференция. LFM2.5-VL-3B поддържа постоянно ниска латентност и е най-бързият при входове с множество кадри.
LFM2.5-VL-3B е и най-бързият по пропускателна способност при генериране на изход сред всички тествани от нас модели, като достига около 11K токена в секунда при висока конкурентност. Това е приблизително два пъти повече от по-големите модели от клас 4B и изпреварва дори по-малките модели от клас 2B, което се равнява на почти 1 милиард генерирани изходни токена дневно на един H100.
Как се използва LFM2.5-VL-3B
Изберете LFM2.5-VL-3B, когато се нуждаете от интелигентност на устройството за работни натоварвания с голям обем.
Инсталирайте най-новата версия на transformers (съвместима с transformers>=5.0.0):
%pip install -q torch torchvision accelerate "transformers>=5.10.1"
След това заредете и стартирайте модела:
import torch
from transformers.image_utils import load_image
from transformers import AutoModelForImageTextToText, AutoProcessor
from IPython.display import display
MODEL_ID = "LiquidAI/LFM2.5-VL-3B"
processor = AutoProcessor.from_pretrained(MODEL_ID)
model = AutoModelForImageTextToText.from_pretrained(
MODEL_ID,
device_map="auto",
dtype="bfloat16",
)
img_url = "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/coco_sample.png"
input_image = load_image(img_url)
display(input_image)
messages = [
{
"role": "user",
"content": [
{"type": "image", "image": input_image},
{"type": "text", "text": "Опишете това изображение с две кратки изречения."},
],
}
]
inputs = processor.apply_chat_template(
messages,
add_generation_prompt=True,
tokenize=True,
return_dict=True,
return_tensors="pt",
).to(model.device)
with torch.inference_mode():
outputs = model.generate(
**inputs,
do_sample=True,
temperature=0.2,
top_k=50,
repetition_penalty=1.0,
max_new_tokens=256,
)
output = processor.batch_decode(outputs[:, inputs["input_ids"].shape[1]:], skip_special_tokens=True)[0]
print(output)
Две котки спят на розов диван с два дистанционни пулта.
Още практически примери за използване на LFM2.5-VL3B с входове от множество изображения, локализиране, OCR, извикване на инструменти и други ще намерите в нашата документация. Разгледайте блога за представянето ни за видео примери.
Демонстрация на LFM2.5-VL-3B
Разгледайте тази браузърна демонстрация на чат интерфейс с визуални възможности, задвижван от LFM2.5-VL-3B. Тя ви позволява да заснемате или качвате множество изображения и да взаимодействате с тях чрез модела, включително за локализиране, OCR и използване на инструменти.
Първи стъпки
LFM2.5-VL-3B е наличен в Hugging Face още днес.
С LFM2.5 реализираме визията си за AI, който работи навсякъде. Тези модели са:
- Изтегляне: LFM2.5-VL-3B в Hugging Face.
- Изпробване: стартирайте демонстрацията WebGPU във вашия браузър, без да е необходима настройка.
- Дообучаване: адаптирайте LFM2.5-VL-3B към вашата задача с нашите уроци за дообучаване.
Нямаме търпение да видим какво ще създадете.
Цитиране
Моля, цитирайте тази статия, както следва:
Liquid AI, "LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge", Liquid AI Blog, Aug 2026.
Или използвайте цитата във формат BibTeX:
@article{liquidAI2026VL3B,
author = {Liquid AI},
title = {LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/lfm2-5-vl-3b},
}
Модели, споменати в тази статия 2
Пространства, споменати в тази статия 1
Общност
· Регистрирайте се или влезте, за да коментирате
Модели, споменати в тази статия 2
Пространства, споменати в тази статия 1
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.






