LFM2.5-VL-3B для кращих і швидших можливостей комп’ютерного зору для периферійних пристроїв
LFM2.5-VL-3B розширює можливості роботи із зображеннями та мовою, представлені в наших попередніх релізах, завдяки чотирьом основним покращенням:
- Розуміння екранів та інтерфейсів: Високий рівень розуміння цифрових екранів на різних пристроях.
- Визначення розташування: Покращене визначення розташування та виявлення об’єктів за допомогою запитів природною мовою.
- Введення кількох зображень: Покращене міркування на основі кількох зображень.
- Виклик функцій: Значно кращі результати під час виклику функцій у текстових і візуально-текстових ситуаціях.
Як ми навчали нашу найпотужнішу модель для роботи із зображеннями та мовою
LFM2.5-VL-3B поєднує візуальний енкодер SigLIP2 400M NaFlex із тією самою попередньо навченою базовою моделлю, що й наша текстова модель LFM2.5-2.6B. Вона попередньо навчалася приблизно на 34 трильйонах токенів, причому обсяг візуальних даних був у 4 рази більшим, ніж раніше, і складався з відібраних та синтетичних наборів зображень і підписів, OCR, визначення розташування та виконання інструкцій. Для підтримки нелатинських писемностей ми подвоїли словник до 128 тисяч токенів, розширивши токенізатор на місці, а не перенавчаючи його з нуля.
Післянавчання відбувається у два етапи: перший — контрольоване донавчання (SFT) із дистиляцією знань від більшої моделі-вчителя та навчанням Antidoom. Другий — навчання з підкріпленням на основі кількох винагород (RL).
Результати бенчмарків
Ми оцінювали LFM2.5-VL-3B за візуальними й текстовими бенчмарками.
Візуальні бенчмарки охоплюють багатомовне розуміння зображень, виконання інструкцій, візуальні математичні та наукові міркування, розуміння документів, виявлення об’єктів, розуміння кількох зображень і розуміння екранів. LFM2.5-VL-3B є лідером у своєму класі за розміром у завданнях із реальними зображеннями, а також добре читає цифровий контент — від документів і діаграм до елементів інтерфейсу на екрані.
| Завдання | Бенчмарк | LFM2.5-VL-3B (3.1B) | LFM2-VL-3B (3.1B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | InternVL 3.5 2B (2.4B) | InternVL 3.5 4B (4.7B) | Qwen3.5-2B (2.3B) | Qwen3.5-4B (4.7B) |
|---|---|---|---|---|---|---|---|---|---|
| Загальні | MMStar | 63.3 | 57.7 | 45.3 | 52.9 | 57.7 | 65.5 | 55.1 | 59.3 |
| MME | 73.1 | 73.0 | 54.9 | 67.6 | 73.6 | 81.0 | 76.2 | 79.5 | |
| RealWorldQA | 73.1 | 71.1 | 60.0 | 64.3 | 61.6 | 67.7 | 65.1 | 67.1 | |
| SimpleVQA | 35.4 | 33.0 | 27.3 | 30.4 | 30.5 | 33.7 | 35.2 | 40.7 | |
| SEED-Bench (зображення) | 77.7 | 76.6 | 71.4 | 75.3 | 75.4 | 76.4 | 75.8 | 76.1 | |
| MMBench (dev EN v1.1) | 81.0 | 80.0 | 64.2 | 71.6 | 76.2 | 81.1 | 73.1 | 78.4 | |
| CountBenchQA | 87.3 | 92.2 | 70.4 | 80.5 | 70.4 | 82.5 | 83.8 | 86.7 | |
| Багатомовні | MMMB | 83.0 | 81.9 | 73.3 | 80.4 | 76.3 | 81.5 | 75.9 | 82.0 |
| Багатомовний MMBench | 79.5 | 76.3 | 62.8 | 71.2 | 70.9 | 76.6 | 69.9 | 77.0 | |
| Мультимодальне виконання інструкцій | MM-IFEval | 60.6 | 51.4 | 65.6 | 68.2 | 47.1 | 54.5 | 55.4 | 63.1 |
| STEM | LogicVista | 37.4 | 32.2 | 29.5 | 34.5 | 30.9 | 36.2 | 34.0 | 37.6 |
| MathVista (міні) | 68.5 | 62.1 | 37.8 | 45.2 | 56.8 | 67.1 | 48.7 | 63.6 | |
| MMMU-Pro | 30.5 | 28.7 | 26.9 | 32.6 | 21.3 | 22.7 | 24.9 | 36.0 | |
| MMMU (перевірка) | 48.4 | 45.6 | 41.1 | 49.3 | 52.0 | 60.7 | 44.1 | 50.3 | |
| Документи, OCR і діаграми | ChartQA (тест) | 81.3 | 80.4 | 43.2 | 42.1 | 81.7 | 86.2 | 78.4 | 84.2 |
| DocVQA (перевірка) | 91.1 | 89.8 | 85.7 | 87.4 | 88.4 | 91.8 | 92.6 | 94.8 | |
| InfographicVQA (перевірка) | 70.2 | 67.8 | 54.4 | 60.9 | 69.3 | 76.9 | 73.5 | 80.3 | |
| OCRBench v1 | 84.2 | 81.7 | 70.2 | 73.5 | 83.9 | 82.0 | 84.4 | 85.6 | |
| OCRBench v2 (En) | 47.5 | 43.9 | 44.4 | 48.8 | 45.5 | 49.1 | 47.7 | 58.7 | |
| TextVQA (перевірка) | 84.3 | 83.0 | 62.5 | 69.0 | 76.6 | 77.5 | 77.3 | 81.2 | |
| Визначення розташування | RefCOCO-avg | 87.9 | 57.1 | 67.3 | 72.1 | 82.9 | 88.8 | 78.5 | 86.6 |
| Кілька зображень | BLINK | 61.5 | 50.2 | 45.2 | 52.2 | 52.0 | 57.2 | 48.6 | 58.7 |
| MuirBench | 58.3 | 34.9 | 32.9 | 51.8 | 45.0 | 53.5 | 48.2 | 62.0 | |
| Галюцинації | HallusionBench | 47.2 | 46.4 | 41.8 | 49.8 | 47.6 | 52.1 | 49.3 | 51.7 |
| POPE | 88.7 | 89.2 | 84.0 | 86.9 | 88.0 | 88.9 | 88.6 | 86.0 | |
| Графічний інтерфейс | ScreenSpot-v2 Desktop | 78.7 | 6.0 | 28.1 | 45.8 | 79.9 | 82.0 | 63.8 | 76.3 |
| ScreenSpot-v2 Mobile | 81.2 | 7.6 | 42.9 | 60.3 | 86.2 | 87.8 | 69.7 | 81.4 | |
| ScreenSpot-v2 Web | 82.2 | 2.5 | 22.4 | 47.6 | 79.9 | 82.6 | 65.9 | 77.8 | |
| Середнє | - | 69.4 | 57.2 | 52.0 | 59.7 | 64.6 | 69.4 | 63.7 | 70.1 |
*Усі значення в таблиці нормалізовано до діапазону 0–100. Оцінювання виконано за допомогою vLLM 0.26.0 і рекомендованих параметрів генерації кожної моделі, якщо вони доступні. Усюди використовується режим без міркувань, а моделям пропонується відповідати безпосередньо, не демонструючи міркувань.
Ми також оцінили LFM2.5-VL-3B за текстовими бенчмарками для виконання інструкцій і використання інструментів. Виконання інструкцій покращилося за всіма напрямами, а використання інструментів — суттєво. У використанні інструментів LFM2.5-VL-3B не поступається Gemma-4-E2B і Qwen3.5-2B.
| Завдання | Бенчмарк | LFM2.5-VL-3B (3.1B) | LFM2-VL-3B (3.1B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | InternVL 3.5 2B (2.4B) | InternVL 3.5 4B (4.7B) | Qwen3.5-2B (2.3B) | Qwen3.5-4B (4.7B) |
|---|---|---|---|---|---|---|---|---|---|
| Виконання інструкцій | IFEval | 82.3 | 72.9 | 83.0 | 87.9 | 32.4 | 35.4 | 73.6 | 86.2 |
| IFBench | 25.8 | 20.8 | 34.1 | 39.2 | 24.4 | 24.5 | 28.9 | 33.5 | |
| Multi-IF | 59.4 | 46.5 | 69.4 | 77.4 | 16.3 | 16.9 | 53.5 | 66.7 | |
| Використання інструментів і виклик функцій | ToolSandbox | 59.5 | 26.4 | 56.5 | 61.6 | N/A | N/A | 47.7 | 65.0 |
| BFCL V4 | 32.5 | 20.5 | 33.2 | 40.0 | N/A | N/A | 33.9 | 53.6 |
*Моделі InternVL 3.5 не підтримують виклик функцій.
Ці результати демонструють, що LFM2.5-VL-3B — потужна універсальна модель для роботи із зображеннями та мовою. Вона охоплює повсякденні завдання (створення підписів, відповіді на запитання за зображеннями, розуміння документів) і особливо добре визначає розташування об’єктів, читає екрани та документи й викликає інструменти.
Швидкість виведення на CPU і GPU
LFM2.5-VL-3B від першого дня підтримується всією екосистемою виведення, зокрема llama.cpp, MLX, vLLM, SGLang і ONNX.
Виведення на пристрої. LFM2.5-VL-3B декодує 228 токенів/с на M5 Max і 116 токенів/с на Ryzen AI Max+ 395 та займає близько 3 ГБ пам’яті. Вона навіть досягає швидкості 20 токенів/с на Galaxy S26 Ultra, тож її можна повністю запускати на пристрої.
Виведення на GPU. LFM2.5-VL-3B забезпечує стабільно низьку затримку й є найшвидшою для вхідних даних із кількох кадрів.
LFM2.5-VL-3B також є найшвидшою за пропускною здатністю виведення серед усіх протестованих нами моделей, досягаючи близько 11 тисяч токенів на секунду за високої паралельності. Це приблизно вдвічі більше, ніж у більших моделей класу 4B, і більше, ніж у навіть менших моделей класу 2B, що дає майже 1 мільярд вихідних токенів на день на одному H100.
Як використовувати LFM2.5-VL-3B
Обирайте LFM2.5-VL-3B, коли вам потрібен інтелект на пристрої для високонавантажених робочих процесів.
Встановіть останню версію transformers (сумісну з transformers>=5.0.0):
%pip install -q torch torchvision accelerate "transformers>=5.10.1"
Потім завантажте та запустіть модель:
import torch
from transformers.image_utils import load_image
from transformers import AutoModelForImageTextToText, AutoProcessor
from IPython.display import display
MODEL_ID = "LiquidAI/LFM2.5-VL-3B"
processor = AutoProcessor.from_pretrained(MODEL_ID)
model = AutoModelForImageTextToText.from_pretrained(
MODEL_ID,
device_map="auto",
dtype="bfloat16",
)
img_url = "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/coco_sample.png"
input_image = load_image(img_url)
display(input_image)
messages = [
{
"role": "user",
"content": [
{"type": "image", "image": input_image},
{"type": "text", "text": "Describe this image in two concise sentences."},
],
}
]
inputs = processor.apply_chat_template(
messages,
add_generation_prompt=True,
tokenize=True,
return_dict=True,
return_tensors="pt",
).to(model.device)
with torch.inference_mode():
outputs = model.generate(
**inputs,
do_sample=True,
temperature=0.2,
top_k=50,
repetition_penalty=1.0,
max_new_tokens=256,
)
output = processor.batch_decode(outputs[:, inputs["input_ids"].shape[1]:], skip_special_tokens=True)[0]
print(output)
Двоє котів сплять на рожевому дивані, поруч із ними лежать два пульти дистанційного керування.
Більше практичних прикладів використання LFM2.5-VL3B для введення кількох зображень, визначення розташування, OCR, виклику інструментів та іншого можна знайти в нашій документації. Відвідайте блог із релізом, щоб переглянути відеоприклади.
Демонстрація LFM2.5-VL-3B
Перегляньте цю браузерну демонстрацію чат-інтерфейсу з підтримкою роботи із зображеннями на основі LFM2.5-VL-3B. Вона дає змогу зробити або завантажити кілька зображень і взаємодіяти з ними за допомогою моделі, зокрема визначати розташування, виконувати OCR і використовувати інструменти.
Початок роботи
LFM2.5-VL-3B уже доступна на Hugging Face.
З LFM2.5 ми втілюємо наше бачення ШІ, який працює будь-де. Ці моделі:
- Завантажити: LFM2.5-VL-3B на Hugging Face.
- Спробувати: запустіть демонстрацію WebGPU у своєму браузері без додаткового налаштування.
- Донавчити: адаптуйте LFM2.5-VL-3B до свого завдання за допомогою наших посібників із донавчання.
Ми з нетерпінням чекаємо, що ви створите.
Цитування
Будь ласка, цитуйте цю статтю так:
Liquid AI, "LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge", Liquid AI Blog, Aug 2026.
Або скористайтеся цитуванням у форматі BibTeX:
@article{liquidAI2026VL3B,
author = {Liquid AI},
title = {LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/lfm2-5-vl-3b},
}
Моделі, згадані в цій статті 2
Простори, згадані в цій статті 1
Спільнота
· Зареєструйтеся або увійдіть, щоб залишити коментар
Моделі, згадані в цій статті 2
Простори, згадані в цій статті 1
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.






