Sakhanda Wire
NVDA $223.20 +2.62% MSFT $495.28 -1.69% GOOGL $342.68 -0.33% META $587.37 -1.96% AMZN $270.56 -0.63%
← К новостям

LFM2.5-VL-3B для улучшения и ускорения возможностей компьютерного зрения на периферии

LFM2.5-VL-3B: улучшенные и более быстрые возможности компьютерного зрения для периферийных устройств
Команда Статья
Опубликовано 12 августа 2026 г.
LFM2.5-VL-3B — наша самая функциональная зрительно-языковая модель, которую можно запускать на собственном оборудовании. Она одинаково хорошо понимает документы и экраны, определяет положение объектов и умеет вызывать инструменты. Модель отвечает напрямую, не выполняя рассуждения, поэтому её ответы остаются быстрыми в приложениях реального времени и на устройствах.

LFM2.5-VL-3B расширяет возможности компьютерного зрения и работы с языком, представленные в наших предыдущих релизах, благодаря четырём основным улучшениям:

  • Понимание экранов и интерфейсов: глубокое понимание цифровых экранов на различных устройствах.
  • Определение положения объектов: улучшенные возможности определения положения и обнаружения объектов с помощью запросов на естественном языке.
  • Ввод нескольких изображений: улучшенное рассуждение по нескольким изображениям.
  • Вызов функций: значительно более эффективный вызов функций как в текстовых, так и в зрительно-текстовых сценариях.

lfm2_5_vl_3b_task_group_averages

Как мы обучали нашу самую функциональную зрительно-языковую модель

LFM2.5-VL-3B объединяет зрительный энкодер SigLIP2 400M NaFlex с той же предварительно обученной базовой моделью, что и текстовая модель LFM2.5-2.6B. Она предварительно обучена примерно на 34 трлн токенов, причём объём данных о зрении в четыре раза больше, чем раньше; данные взяты из отобранных и синтетических наборов изображений с подписями, OCR, определения положения объектов и следования инструкциям. Для поддержки нелатинских письменностей мы вдвое увеличили словарь до 128 тысяч токенов, расширив токенизатор на месте, а не обучая его с нуля.

Дообучение проходит в два этапа. Первый — supervised fine-tuning (SFT), включающий дистилляцию знаний от более крупной модели-учителя и обучение Antidoom. Второй — обучение с подкреплением (RL) с несколькими функциями вознаграждения.

Результаты тестирования

Мы оценили LFM2.5-VL-3B по тестам как для зрения, так и для текста.

Тесты для зрения охватывают многоязычное понимание изображений, следование инструкциям, визуальные математические и научные рассуждения, понимание документов, обнаружение объектов, работу с несколькими изображениями и понимание экранов. LFM2.5-VL-3B лидирует среди моделей своего размера в задачах с реальными изображениями, а также хорошо читает цифровой контент — от документов и диаграмм до элементов пользовательского интерфейса на экране.

Задача Тест LFM2.5-VL-3B (3.1B) LFM2-VL-3B (3.1B) gemma-4-E2B-it (5.1B) gemma-4-E4B-it (8B) InternVL 3.5 2B (2.4B) InternVL 3.5 4B (4.7B) Qwen3.5-2B (2.3B) Qwen3.5-4B (4.7B)
Общие MMStar 63.357.745.352.957.765.555.159.3
MME 73.173.054.967.673.681.076.279.5
RealWorldQA 73.171.160.064.361.667.765.167.1
SimpleVQA 35.433.027.330.430.533.735.240.7
SEED-Bench (изображения) 77.776.671.475.375.476.475.876.1
MMBench (dev EN v1.1) 81.080.064.271.676.281.173.178.4
CountBenchQA 87.392.270.480.570.482.583.886.7
Многоязычные MMMB 83.081.973.380.476.381.575.982.0
Многоязычный MMBench 79.576.362.871.270.976.669.977.0
Мультимодальное следование инструкциям MM-IFEval 60.651.465.668.247.154.555.463.1
STEM LogicVista 37.432.229.534.530.936.234.037.6
MathVista (mini) 68.562.137.845.256.867.148.763.6
MMMU-Pro 30.528.726.932.621.322.724.936.0
MMMU (val) 48.445.641.149.352.060.744.150.3
Документы, OCR и диаграммы ChartQA (test) 81.380.443.242.181.786.278.484.2
DocVQA (val) 91.189.885.787.488.491.892.694.8
InfographicVQA (val) 70.267.854.460.969.376.973.580.3
OCRBench v1 84.281.770.273.583.982.084.485.6
OCRBench v2 (En) 47.543.944.448.845.549.147.758.7
TextVQA (val) 84.383.062.569.076.677.577.381.2
Определение положения объектов RefCOCO-avg 87.957.167.372.182.988.878.586.6
Несколько изображений BLINK 61.550.245.252.252.057.248.658.7
MuirBench 58.334.932.951.845.053.548.262.0
Галлюцинации HallusionBench 47.246.441.849.847.652.149.351.7
POPE 88.789.284.086.988.088.988.686.0
GUI ScreenSpot-v2 Desktop 78.76.028.145.879.982.063.876.3
ScreenSpot-v2 Mobile 81.27.642.960.386.287.869.781.4
ScreenSpot-v2 Web 82.22.522.447.679.982.665.977.8
Среднее - 69.457.252.059.764.669.463.770.1

*Все значения в таблице нормированы к диапазону 0–100. Оценка выполняется с использованием vLLM 0.26.0 и рекомендуемых для каждой модели параметров генерации, если они доступны. Во всех случаях используется режим без рассуждений, а моделям предлагается отвечать напрямую, не приводя рассуждения.

Мы также оценили LFM2.5-VL-3B по текстовым тестам на следование инструкциям и использование инструментов. Следование инструкциям улучшилось по всем направлениям, а применение инструментов заметно усилилось. В использовании инструментов LFM2.5-VL-3B сопоставима с Gemma-4-E2B и Qwen3.5-2B.

Задача Тест LFM2.5-VL-3B (3.1B) LFM2-VL-3B (3.1B) gemma-4-E2B-it (5.1B) gemma-4-E4B-it (8B) InternVL 3.5 2B (2.4B) InternVL 3.5 4B (4.7B) Qwen3.5-2B (2.3B) Qwen3.5-4B (4.7B)
Следование инструкциям IFEval 82.372.983.087.932.435.473.686.2
IFBench 25.820.834.139.224.424.528.933.5
Multi-IF 59.446.569.477.416.316.953.566.7
Использование инструментов и вызов функций ToolSandbox 59.526.456.561.6N/AN/A47.765.0
BFCL V4 32.520.533.240.0N/AN/A33.953.6

*Модели InternVL 3.5 не поддерживают вызов функций.

Эти результаты показывают, что LFM2.5-VL-3B — мощная универсальная зрительно-языковая модель. Она справляется с повседневными задачами (создание подписей, ответы на вопросы по изображениям, понимание документов) и особенно хорошо определяет положение объектов, читает экраны и документы, а также вызывает инструменты.

Скорость вывода на CPU и GPU

LFM2.5-VL-3B с первого дня поддерживается всей экосистемой вывода, включая llama.cpp, MLX, vLLM, SGLang и ONNX.

Вывод на устройстве. LFM2.5-VL-3B декодирует 228 токенов/с на M5 Max и 116 токенов/с на Ryzen AI Max+ 395, занимая около 3 ГБ памяти. Она достигает даже 20 токенов/с на Galaxy S26 Ultra, поэтому её можно полностью запускать на устройстве.

lfm2_5_vl_3b_on-device_inference_TTFT

Вывод на GPU. LFM2.5-VL-3B стабильно обеспечивает низкую задержку и является самой быстрой моделью при обработке нескольких кадров.

lfm2_5_vl_3b_ttft

LFM2.5-VL-3B также демонстрирует самую высокую пропускную способность вывода среди всех протестированных нами моделей — около 11 тыс. токенов в секунду при высокой параллельной нагрузке. Это примерно в два раза больше, чем у более крупных моделей класса 4B, и выше, чем даже у меньших моделей класса 2B, что соответствует почти 1 млрд выходных токенов в день на одном H100.

lfm2_5_vl_3b_throughput

Как использовать LFM2.5-VL-3B

Выбирайте LFM2.5-VL-3B, когда вам нужен интеллект на устройстве для высоконагруженных рабочих процессов.

Установите последнюю версию transformers (совместимую с transformers>=5.0.0):

%pip install -q torch torchvision accelerate "transformers>=5.10.1"

Затем загрузите и запустите модель:

import torch
from transformers.image_utils import load_image
from transformers import AutoModelForImageTextToText, AutoProcessor
from IPython.display import display

MODEL_ID = "LiquidAI/LFM2.5-VL-3B" 

processor = AutoProcessor.from_pretrained(MODEL_ID)
model = AutoModelForImageTextToText.from_pretrained(
    MODEL_ID,
    device_map="auto",
    dtype="bfloat16",
)

img_url = "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/coco_sample.png"
input_image = load_image(img_url)
display(input_image)

messages = [
    {
        "role": "user",
        "content": [
            {"type": "image", "image": input_image},
            {"type": "text", "text": "Опишите это изображение двумя краткими предложениями."},
        ],
    }
]

inputs = processor.apply_chat_template(
    messages,
    add_generation_prompt=True,
    tokenize=True,
    return_dict=True,
    return_tensors="pt",
).to(model.device)

with torch.inference_mode():
    outputs = model.generate(
        **inputs,
        do_sample=True,
        temperature=0.2,
        top_k=50,
        repetition_penalty=1.0,
        max_new_tokens=256,
    )

output = processor.batch_decode(outputs[:, inputs["input_ids"].shape[1]:], skip_special_tokens=True)[0]
print(output)

cats_image

Две кошки спят на розовом диване, рядом с ними лежат два пульта дистанционного управления.

Больше практических примеров использования LFM2.5-VL3B для работы с несколькими изображениями, определения положения объектов, OCR, вызова инструментов и других задач можно найти в нашей документации. Примеры видео доступны в нашем блоге о выпуске.

Демонстрация LFM2.5-VL-3B

Попробуйте браузерную демонстрацию LFM2.5-VL-3B, где модель обеспечивает работу интерфейса чата с поддержкой зрения. Она позволяет сделать или загрузить несколько изображений и взаимодействовать с ними с помощью модели, включая определение положения объектов, OCR и использование инструментов.

Начало работы

LFM2.5-VL-3B уже доступна на Hugging Face.

С LFM2.5 мы воплощаем наше видение ИИ, работающего где угодно. Эти модели можно:

Нам не терпится увидеть, что вы создадите.

Цитирование

Пожалуйста, цитируйте эту статью следующим образом:

Liquid AI, "LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge", Liquid AI Blog, Aug 2026.

Или используйте цитирование в формате BibTeX:

@article{liquidAI2026VL3B,
  author  = {Liquid AI},
  title   = {LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge},
  journal = {Liquid AI Blog},
  year    = {2026},
  note    = {www.liquid.ai/blog/lfm2-5-vl-3b},
}

Модели, упомянутые в этой статье 2

Пространства, упомянутые в этой статье 1

Сообщество

Загружайте изображения, аудио и видео, перетаскивая их в поле ввода текста, вставляя или нажимая здесь.
Нажмите или вставьте сюда, чтобы загрузить изображения

· Зарегистрируйтесь или войдите, чтобы оставить комментарий

Модели, упомянутые в этой статье 2

Пространства, упомянутые в этой статье 1

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием Hugging Face

Читать оригинал на Hugging Face ↗

Текст и изображения принадлежат Hugging Face и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости