LFM2.5-VL-3B для улучшения и ускорения возможностей компьютерного зрения на периферии
LFM2.5-VL-3B расширяет возможности компьютерного зрения и работы с языком, представленные в наших предыдущих релизах, благодаря четырём основным улучшениям:
- Понимание экранов и интерфейсов: глубокое понимание цифровых экранов на различных устройствах.
- Определение положения объектов: улучшенные возможности определения положения и обнаружения объектов с помощью запросов на естественном языке.
- Ввод нескольких изображений: улучшенное рассуждение по нескольким изображениям.
- Вызов функций: значительно более эффективный вызов функций как в текстовых, так и в зрительно-текстовых сценариях.
Как мы обучали нашу самую функциональную зрительно-языковую модель
LFM2.5-VL-3B объединяет зрительный энкодер SigLIP2 400M NaFlex с той же предварительно обученной базовой моделью, что и текстовая модель LFM2.5-2.6B. Она предварительно обучена примерно на 34 трлн токенов, причём объём данных о зрении в четыре раза больше, чем раньше; данные взяты из отобранных и синтетических наборов изображений с подписями, OCR, определения положения объектов и следования инструкциям. Для поддержки нелатинских письменностей мы вдвое увеличили словарь до 128 тысяч токенов, расширив токенизатор на месте, а не обучая его с нуля.
Дообучение проходит в два этапа. Первый — supervised fine-tuning (SFT), включающий дистилляцию знаний от более крупной модели-учителя и обучение Antidoom. Второй — обучение с подкреплением (RL) с несколькими функциями вознаграждения.
Результаты тестирования
Мы оценили LFM2.5-VL-3B по тестам как для зрения, так и для текста.
Тесты для зрения охватывают многоязычное понимание изображений, следование инструкциям, визуальные математические и научные рассуждения, понимание документов, обнаружение объектов, работу с несколькими изображениями и понимание экранов. LFM2.5-VL-3B лидирует среди моделей своего размера в задачах с реальными изображениями, а также хорошо читает цифровой контент — от документов и диаграмм до элементов пользовательского интерфейса на экране.
| Задача | Тест | LFM2.5-VL-3B (3.1B) | LFM2-VL-3B (3.1B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | InternVL 3.5 2B (2.4B) | InternVL 3.5 4B (4.7B) | Qwen3.5-2B (2.3B) | Qwen3.5-4B (4.7B) |
|---|---|---|---|---|---|---|---|---|---|
| Общие | MMStar | 63.3 | 57.7 | 45.3 | 52.9 | 57.7 | 65.5 | 55.1 | 59.3 |
| MME | 73.1 | 73.0 | 54.9 | 67.6 | 73.6 | 81.0 | 76.2 | 79.5 | |
| RealWorldQA | 73.1 | 71.1 | 60.0 | 64.3 | 61.6 | 67.7 | 65.1 | 67.1 | |
| SimpleVQA | 35.4 | 33.0 | 27.3 | 30.4 | 30.5 | 33.7 | 35.2 | 40.7 | |
| SEED-Bench (изображения) | 77.7 | 76.6 | 71.4 | 75.3 | 75.4 | 76.4 | 75.8 | 76.1 | |
| MMBench (dev EN v1.1) | 81.0 | 80.0 | 64.2 | 71.6 | 76.2 | 81.1 | 73.1 | 78.4 | |
| CountBenchQA | 87.3 | 92.2 | 70.4 | 80.5 | 70.4 | 82.5 | 83.8 | 86.7 | |
| Многоязычные | MMMB | 83.0 | 81.9 | 73.3 | 80.4 | 76.3 | 81.5 | 75.9 | 82.0 |
| Многоязычный MMBench | 79.5 | 76.3 | 62.8 | 71.2 | 70.9 | 76.6 | 69.9 | 77.0 | |
| Мультимодальное следование инструкциям | MM-IFEval | 60.6 | 51.4 | 65.6 | 68.2 | 47.1 | 54.5 | 55.4 | 63.1 |
| STEM | LogicVista | 37.4 | 32.2 | 29.5 | 34.5 | 30.9 | 36.2 | 34.0 | 37.6 |
| MathVista (mini) | 68.5 | 62.1 | 37.8 | 45.2 | 56.8 | 67.1 | 48.7 | 63.6 | |
| MMMU-Pro | 30.5 | 28.7 | 26.9 | 32.6 | 21.3 | 22.7 | 24.9 | 36.0 | |
| MMMU (val) | 48.4 | 45.6 | 41.1 | 49.3 | 52.0 | 60.7 | 44.1 | 50.3 | |
| Документы, OCR и диаграммы | ChartQA (test) | 81.3 | 80.4 | 43.2 | 42.1 | 81.7 | 86.2 | 78.4 | 84.2 |
| DocVQA (val) | 91.1 | 89.8 | 85.7 | 87.4 | 88.4 | 91.8 | 92.6 | 94.8 | |
| InfographicVQA (val) | 70.2 | 67.8 | 54.4 | 60.9 | 69.3 | 76.9 | 73.5 | 80.3 | |
| OCRBench v1 | 84.2 | 81.7 | 70.2 | 73.5 | 83.9 | 82.0 | 84.4 | 85.6 | |
| OCRBench v2 (En) | 47.5 | 43.9 | 44.4 | 48.8 | 45.5 | 49.1 | 47.7 | 58.7 | |
| TextVQA (val) | 84.3 | 83.0 | 62.5 | 69.0 | 76.6 | 77.5 | 77.3 | 81.2 | |
| Определение положения объектов | RefCOCO-avg | 87.9 | 57.1 | 67.3 | 72.1 | 82.9 | 88.8 | 78.5 | 86.6 |
| Несколько изображений | BLINK | 61.5 | 50.2 | 45.2 | 52.2 | 52.0 | 57.2 | 48.6 | 58.7 |
| MuirBench | 58.3 | 34.9 | 32.9 | 51.8 | 45.0 | 53.5 | 48.2 | 62.0 | |
| Галлюцинации | HallusionBench | 47.2 | 46.4 | 41.8 | 49.8 | 47.6 | 52.1 | 49.3 | 51.7 |
| POPE | 88.7 | 89.2 | 84.0 | 86.9 | 88.0 | 88.9 | 88.6 | 86.0 | |
| GUI | ScreenSpot-v2 Desktop | 78.7 | 6.0 | 28.1 | 45.8 | 79.9 | 82.0 | 63.8 | 76.3 |
| ScreenSpot-v2 Mobile | 81.2 | 7.6 | 42.9 | 60.3 | 86.2 | 87.8 | 69.7 | 81.4 | |
| ScreenSpot-v2 Web | 82.2 | 2.5 | 22.4 | 47.6 | 79.9 | 82.6 | 65.9 | 77.8 | |
| Среднее | - | 69.4 | 57.2 | 52.0 | 59.7 | 64.6 | 69.4 | 63.7 | 70.1 |
*Все значения в таблице нормированы к диапазону 0–100. Оценка выполняется с использованием vLLM 0.26.0 и рекомендуемых для каждой модели параметров генерации, если они доступны. Во всех случаях используется режим без рассуждений, а моделям предлагается отвечать напрямую, не приводя рассуждения.
Мы также оценили LFM2.5-VL-3B по текстовым тестам на следование инструкциям и использование инструментов. Следование инструкциям улучшилось по всем направлениям, а применение инструментов заметно усилилось. В использовании инструментов LFM2.5-VL-3B сопоставима с Gemma-4-E2B и Qwen3.5-2B.
| Задача | Тест | LFM2.5-VL-3B (3.1B) | LFM2-VL-3B (3.1B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | InternVL 3.5 2B (2.4B) | InternVL 3.5 4B (4.7B) | Qwen3.5-2B (2.3B) | Qwen3.5-4B (4.7B) |
|---|---|---|---|---|---|---|---|---|---|
| Следование инструкциям | IFEval | 82.3 | 72.9 | 83.0 | 87.9 | 32.4 | 35.4 | 73.6 | 86.2 |
| IFBench | 25.8 | 20.8 | 34.1 | 39.2 | 24.4 | 24.5 | 28.9 | 33.5 | |
| Multi-IF | 59.4 | 46.5 | 69.4 | 77.4 | 16.3 | 16.9 | 53.5 | 66.7 | |
| Использование инструментов и вызов функций | ToolSandbox | 59.5 | 26.4 | 56.5 | 61.6 | N/A | N/A | 47.7 | 65.0 |
| BFCL V4 | 32.5 | 20.5 | 33.2 | 40.0 | N/A | N/A | 33.9 | 53.6 |
*Модели InternVL 3.5 не поддерживают вызов функций.
Эти результаты показывают, что LFM2.5-VL-3B — мощная универсальная зрительно-языковая модель. Она справляется с повседневными задачами (создание подписей, ответы на вопросы по изображениям, понимание документов) и особенно хорошо определяет положение объектов, читает экраны и документы, а также вызывает инструменты.
Скорость вывода на CPU и GPU
LFM2.5-VL-3B с первого дня поддерживается всей экосистемой вывода, включая llama.cpp, MLX, vLLM, SGLang и ONNX.
Вывод на устройстве. LFM2.5-VL-3B декодирует 228 токенов/с на M5 Max и 116 токенов/с на Ryzen AI Max+ 395, занимая около 3 ГБ памяти. Она достигает даже 20 токенов/с на Galaxy S26 Ultra, поэтому её можно полностью запускать на устройстве.
Вывод на GPU. LFM2.5-VL-3B стабильно обеспечивает низкую задержку и является самой быстрой моделью при обработке нескольких кадров.
LFM2.5-VL-3B также демонстрирует самую высокую пропускную способность вывода среди всех протестированных нами моделей — около 11 тыс. токенов в секунду при высокой параллельной нагрузке. Это примерно в два раза больше, чем у более крупных моделей класса 4B, и выше, чем даже у меньших моделей класса 2B, что соответствует почти 1 млрд выходных токенов в день на одном H100.
Как использовать LFM2.5-VL-3B
Выбирайте LFM2.5-VL-3B, когда вам нужен интеллект на устройстве для высоконагруженных рабочих процессов.
Установите последнюю версию transformers (совместимую с transformers>=5.0.0):
%pip install -q torch torchvision accelerate "transformers>=5.10.1"
Затем загрузите и запустите модель:
import torch
from transformers.image_utils import load_image
from transformers import AutoModelForImageTextToText, AutoProcessor
from IPython.display import display
MODEL_ID = "LiquidAI/LFM2.5-VL-3B"
processor = AutoProcessor.from_pretrained(MODEL_ID)
model = AutoModelForImageTextToText.from_pretrained(
MODEL_ID,
device_map="auto",
dtype="bfloat16",
)
img_url = "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/coco_sample.png"
input_image = load_image(img_url)
display(input_image)
messages = [
{
"role": "user",
"content": [
{"type": "image", "image": input_image},
{"type": "text", "text": "Опишите это изображение двумя краткими предложениями."},
],
}
]
inputs = processor.apply_chat_template(
messages,
add_generation_prompt=True,
tokenize=True,
return_dict=True,
return_tensors="pt",
).to(model.device)
with torch.inference_mode():
outputs = model.generate(
**inputs,
do_sample=True,
temperature=0.2,
top_k=50,
repetition_penalty=1.0,
max_new_tokens=256,
)
output = processor.batch_decode(outputs[:, inputs["input_ids"].shape[1]:], skip_special_tokens=True)[0]
print(output)
Две кошки спят на розовом диване, рядом с ними лежат два пульта дистанционного управления.
Больше практических примеров использования LFM2.5-VL3B для работы с несколькими изображениями, определения положения объектов, OCR, вызова инструментов и других задач можно найти в нашей документации. Примеры видео доступны в нашем блоге о выпуске.
Демонстрация LFM2.5-VL-3B
Попробуйте браузерную демонстрацию LFM2.5-VL-3B, где модель обеспечивает работу интерфейса чата с поддержкой зрения. Она позволяет сделать или загрузить несколько изображений и взаимодействовать с ними с помощью модели, включая определение положения объектов, OCR и использование инструментов.
Начало работы
LFM2.5-VL-3B уже доступна на Hugging Face.
С LFM2.5 мы воплощаем наше видение ИИ, работающего где угодно. Эти модели можно:
- Скачать: LFM2.5-VL-3B на Hugging Face.
- Попробовать: запустить демонстрацию WebGPU в браузере без настройки.
- Дообучить: адаптировать LFM2.5-VL-3B под свою задачу с помощью наших руководств по дообучению.
Нам не терпится увидеть, что вы создадите.
Цитирование
Пожалуйста, цитируйте эту статью следующим образом:
Liquid AI, "LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge", Liquid AI Blog, Aug 2026.
Или используйте цитирование в формате BibTeX:
@article{liquidAI2026VL3B,
author = {Liquid AI},
title = {LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/lfm2-5-vl-3b},
}
Модели, упомянутые в этой статье 2
Пространства, упомянутые в этой статье 1
Сообщество
· Зарегистрируйтесь или войдите, чтобы оставить комментарий
Модели, упомянутые в этой статье 2
Пространства, упомянутые в этой статье 1
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.






