Sakhanda Wire
NVDA $223.20 +2.62% MSFT $495.28 -1.69% GOOGL $342.68 -0.33% META $587.37 -1.96% AMZN $270.56 -0.63%
← До новин

LFM2.5-VL-3B для кращих і швидших можливостей комп’ютерного зору для периферійних пристроїв

LFM2.5-VL-3B для кращих і швидших можливостей роботи із зображеннями на периферійних пристроях
Команда Стаття
Опубліковано 12 серпня 2026 року
LFM2.5-VL-3B — наша найпотужніша модель для роботи із зображеннями та мовою, яку можна запускати на власному обладнанні. Вона однаково добре розуміє документи й екрани, визначає розташування об’єктів і може викликати інструменти. Вона відповідає безпосередньої генерації міркувань, тому відповіді залишаються швидкими в реальному часі та в додатках на пристрої.

LFM2.5-VL-3B розширює можливості роботи із зображеннями та мовою, представлені в наших попередніх релізах, завдяки чотирьом основним покращенням:

  • Розуміння екранів та інтерфейсів: Високий рівень розуміння цифрових екранів на різних пристроях.
  • Визначення розташування: Покращене визначення розташування та виявлення об’єктів за допомогою запитів природною мовою.
  • Введення кількох зображень: Покращене міркування на основі кількох зображень.
  • Виклик функцій: Значно кращі результати під час виклику функцій у текстових і візуально-текстових ситуаціях.

lfm2_5_vl_3b_task_group_averages

Як ми навчали нашу найпотужнішу модель для роботи із зображеннями та мовою

LFM2.5-VL-3B поєднує візуальний енкодер SigLIP2 400M NaFlex із тією самою попередньо навченою базовою моделлю, що й наша текстова модель LFM2.5-2.6B. Вона попередньо навчалася приблизно на 34 трильйонах токенів, причому обсяг візуальних даних був у 4 рази більшим, ніж раніше, і складався з відібраних та синтетичних наборів зображень і підписів, OCR, визначення розташування та виконання інструкцій. Для підтримки нелатинських писемностей ми подвоїли словник до 128 тисяч токенів, розширивши токенізатор на місці, а не перенавчаючи його з нуля.

Післянавчання відбувається у два етапи: перший — контрольоване донавчання (SFT) із дистиляцією знань від більшої моделі-вчителя та навчанням Antidoom. Другий — навчання з підкріпленням на основі кількох винагород (RL).

Результати бенчмарків

Ми оцінювали LFM2.5-VL-3B за візуальними й текстовими бенчмарками.

Візуальні бенчмарки охоплюють багатомовне розуміння зображень, виконання інструкцій, візуальні математичні та наукові міркування, розуміння документів, виявлення об’єктів, розуміння кількох зображень і розуміння екранів. LFM2.5-VL-3B є лідером у своєму класі за розміром у завданнях із реальними зображеннями, а також добре читає цифровий контент — від документів і діаграм до елементів інтерфейсу на екрані.

Завдання Бенчмарк LFM2.5-VL-3B (3.1B) LFM2-VL-3B (3.1B) gemma-4-E2B-it (5.1B) gemma-4-E4B-it (8B) InternVL 3.5 2B (2.4B) InternVL 3.5 4B (4.7B) Qwen3.5-2B (2.3B) Qwen3.5-4B (4.7B)
Загальні MMStar 63.357.745.352.957.765.555.159.3
MME 73.173.054.967.673.681.076.279.5
RealWorldQA 73.171.160.064.361.667.765.167.1
SimpleVQA 35.433.027.330.430.533.735.240.7
SEED-Bench (зображення) 77.776.671.475.375.476.475.876.1
MMBench (dev EN v1.1) 81.080.064.271.676.281.173.178.4
CountBenchQA 87.392.270.480.570.482.583.886.7
Багатомовні MMMB 83.081.973.380.476.381.575.982.0
Багатомовний MMBench 79.576.362.871.270.976.669.977.0
Мультимодальне виконання інструкцій MM-IFEval 60.651.465.668.247.154.555.463.1
STEM LogicVista 37.432.229.534.530.936.234.037.6
MathVista (міні) 68.562.137.845.256.867.148.763.6
MMMU-Pro 30.528.726.932.621.322.724.936.0
MMMU (перевірка) 48.445.641.149.352.060.744.150.3
Документи, OCR і діаграми ChartQA (тест) 81.380.443.242.181.786.278.484.2
DocVQA (перевірка) 91.189.885.787.488.491.892.694.8
InfographicVQA (перевірка) 70.267.854.460.969.376.973.580.3
OCRBench v1 84.281.770.273.583.982.084.485.6
OCRBench v2 (En) 47.543.944.448.845.549.147.758.7
TextVQA (перевірка) 84.383.062.569.076.677.577.381.2
Визначення розташування RefCOCO-avg 87.957.167.372.182.988.878.586.6
Кілька зображень BLINK 61.550.245.252.252.057.248.658.7
MuirBench 58.334.932.951.845.053.548.262.0
Галюцинації HallusionBench 47.246.441.849.847.652.149.351.7
POPE 88.789.284.086.988.088.988.686.0
Графічний інтерфейс ScreenSpot-v2 Desktop 78.76.028.145.879.982.063.876.3
ScreenSpot-v2 Mobile 81.27.642.960.386.287.869.781.4
ScreenSpot-v2 Web 82.22.522.447.679.982.665.977.8
Середнє - 69.457.252.059.764.669.463.770.1

*Усі значення в таблиці нормалізовано до діапазону 0–100. Оцінювання виконано за допомогою vLLM 0.26.0 і рекомендованих параметрів генерації кожної моделі, якщо вони доступні. Усюди використовується режим без міркувань, а моделям пропонується відповідати безпосередньо, не демонструючи міркувань.

Ми також оцінили LFM2.5-VL-3B за текстовими бенчмарками для виконання інструкцій і використання інструментів. Виконання інструкцій покращилося за всіма напрямами, а використання інструментів — суттєво. У використанні інструментів LFM2.5-VL-3B не поступається Gemma-4-E2B і Qwen3.5-2B.

Завдання Бенчмарк LFM2.5-VL-3B (3.1B) LFM2-VL-3B (3.1B) gemma-4-E2B-it (5.1B) gemma-4-E4B-it (8B) InternVL 3.5 2B (2.4B) InternVL 3.5 4B (4.7B) Qwen3.5-2B (2.3B) Qwen3.5-4B (4.7B)
Виконання інструкцій IFEval 82.372.983.087.932.435.473.686.2
IFBench 25.820.834.139.224.424.528.933.5
Multi-IF 59.446.569.477.416.316.953.566.7
Використання інструментів і виклик функцій ToolSandbox 59.526.456.561.6N/AN/A47.765.0
BFCL V4 32.520.533.240.0N/AN/A33.953.6

*Моделі InternVL 3.5 не підтримують виклик функцій.

Ці результати демонструють, що LFM2.5-VL-3B — потужна універсальна модель для роботи із зображеннями та мовою. Вона охоплює повсякденні завдання (створення підписів, відповіді на запитання за зображеннями, розуміння документів) і особливо добре визначає розташування об’єктів, читає екрани та документи й викликає інструменти.

Швидкість виведення на CPU і GPU

LFM2.5-VL-3B від першого дня підтримується всією екосистемою виведення, зокрема llama.cpp, MLX, vLLM, SGLang і ONNX.

Виведення на пристрої. LFM2.5-VL-3B декодує 228 токенів/с на M5 Max і 116 токенів/с на Ryzen AI Max+ 395 та займає близько 3 ГБ пам’яті. Вона навіть досягає швидкості 20 токенів/с на Galaxy S26 Ultra, тож її можна повністю запускати на пристрої.

lfm2_5_vl_3b_on-device_inference_TTFT

Виведення на GPU. LFM2.5-VL-3B забезпечує стабільно низьку затримку й є найшвидшою для вхідних даних із кількох кадрів.

lfm2_5_vl_3b_ttft

LFM2.5-VL-3B також є найшвидшою за пропускною здатністю виведення серед усіх протестованих нами моделей, досягаючи близько 11 тисяч токенів на секунду за високої паралельності. Це приблизно вдвічі більше, ніж у більших моделей класу 4B, і більше, ніж у навіть менших моделей класу 2B, що дає майже 1 мільярд вихідних токенів на день на одному H100.

lfm2_5_vl_3b_throughput

Як використовувати LFM2.5-VL-3B

Обирайте LFM2.5-VL-3B, коли вам потрібен інтелект на пристрої для високонавантажених робочих процесів.

Встановіть останню версію transformers (сумісну з transformers>=5.0.0):

%pip install -q torch torchvision accelerate "transformers>=5.10.1"

Потім завантажте та запустіть модель:

import torch
from transformers.image_utils import load_image
from transformers import AutoModelForImageTextToText, AutoProcessor
from IPython.display import display

MODEL_ID = "LiquidAI/LFM2.5-VL-3B" 

processor = AutoProcessor.from_pretrained(MODEL_ID)
model = AutoModelForImageTextToText.from_pretrained(
    MODEL_ID,
    device_map="auto",
    dtype="bfloat16",
)

img_url = "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/coco_sample.png"
input_image = load_image(img_url)
display(input_image)

messages = [
    {
        "role": "user",
        "content": [
            {"type": "image", "image": input_image},
            {"type": "text", "text": "Describe this image in two concise sentences."},
        ],
    }
]

inputs = processor.apply_chat_template(
    messages,
    add_generation_prompt=True,
    tokenize=True,
    return_dict=True,
    return_tensors="pt",
).to(model.device)

with torch.inference_mode():
    outputs = model.generate(
        **inputs,
        do_sample=True,
        temperature=0.2,
        top_k=50,
        repetition_penalty=1.0,
        max_new_tokens=256,
    )

output = processor.batch_decode(outputs[:, inputs["input_ids"].shape[1]:], skip_special_tokens=True)[0]
print(output)

cats_image

Двоє котів сплять на рожевому дивані, поруч із ними лежать два пульти дистанційного керування.

Більше практичних прикладів використання LFM2.5-VL3B для введення кількох зображень, визначення розташування, OCR, виклику інструментів та іншого можна знайти в нашій документації. Відвідайте блог із релізом, щоб переглянути відеоприклади.

Демонстрація LFM2.5-VL-3B

Перегляньте цю браузерну демонстрацію чат-інтерфейсу з підтримкою роботи із зображеннями на основі LFM2.5-VL-3B. Вона дає змогу зробити або завантажити кілька зображень і взаємодіяти з ними за допомогою моделі, зокрема визначати розташування, виконувати OCR і використовувати інструменти.

Початок роботи

LFM2.5-VL-3B уже доступна на Hugging Face.

З LFM2.5 ми втілюємо наше бачення ШІ, який працює будь-де. Ці моделі:

Ми з нетерпінням чекаємо, що ви створите.

Цитування

Будь ласка, цитуйте цю статтю так:

Liquid AI, "LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge", Liquid AI Blog, Aug 2026.

Або скористайтеся цитуванням у форматі BibTeX:

@article{liquidAI2026VL3B,
  author  = {Liquid AI},
  title   = {LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge},
  journal = {Liquid AI Blog},
  year    = {2026},
  note    = {www.liquid.ai/blog/lfm2-5-vl-3b},
}

Моделі, згадані в цій статті 2

Простори, згадані в цій статті 1

Спільнота

Завантажуйте зображення, аудіо та відео, перетягуючи їх у поле введення тексту, вставляючи або натискаючи тут.
Натисніть або вставте сюди, щоб завантажити зображення

· Зареєструйтеся або увійдіть, щоб залишити коментар

Моделі, згадані в цій статті 2

Простори, згадані в цій статті 1

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням Hugging Face

Читати оригінал на Hugging Face ↗

Текст і зображення належать Hugging Face і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини