Sakhanda Wire
NVDA $223.20 +2.62% MSFT $495.28 -1.69% GOOGL $342.68 -0.33% META $587.37 -1.96% AMZN $270.56 -0.63%
← Към новините

LFM2.5-VL-3B за по-добри и по-бързи визуални възможности за периферни устройства

LFM2.5-VL-3B за по-добри и по-бързи визуални възможности за периферни устройства
Екип Статия
Публикувано 12 август 2026 г.
LFM2.5-VL-3B е най-способният ни модел за зрение и език, който можете да стартирате на собствения си хардуер. Той разбира както документи, така и екрани, локализира обекти и може да извиква инструменти. Отговаря директно, вместо да разсъждава, така че отговорите остават бързи в приложенията за работа в реално време и на устройството.

LFM2.5-VL-3B разширява възможностите за зрение и език на предишните ни версии с четири основни подобрения:

  • Разбиране на екрани/потребителски интерфейси: Отлично разбиране на цифрови екрани на различни устройства.
  • Локализиране: Подобрено локализиране и откриване на обекти чрез заявки на естествен език.
  • Вход с множество изображения: Подобрено разсъждение върху множество изображения.
  • Извикване на функции: Значително по-добри възможности за извикване на функции в ситуации само с текст и със зрение и текст.

lfm2_5_vl_3b_task_group_averages

Как обучихме най-способния си модел за зрение и език

LFM2.5-VL-3B комбинира визуален енкодер SigLIP2 400M NaFlex със същия предварително обучен гръбнак като текстовия ни модел LFM2.5-2.6B. Той е предварително обучен върху около 34 трилиона токена, с четири пъти повече визуални данни от преди, извлечени от подбрани и синтетични набори от изображения и надписи, OCR, локализиране и следване на инструкции. За да поддържаме нелатински писмености, удвоихме речника до 128K, като разширихме токенизатора на място, вместо да го обучаваме от нулата.

Дообучаването протича на два етапа: първият е контролирано дообучаване (SFT) с дистилация на знания от по-голям учител и обучение Antidoom. Вторият е обучение с подсилване (RL) с множество награди.

Резултати от сравнителните тестове

Оценихме LFM2.5-VL-3B както по визуални, така и по текстови сравнителни тестове.

Визуалните сравнителни тестове обхващат многоезично визуално разбиране, следване на инструкции, визуална математика и научно разсъждение, разбиране на документи, откриване на обекти, разбиране на множество изображения и разбиране на екрани. LFM2.5-VL-3B е водещ в своя размерен клас при задачи с изображения от реалния свят, като същевременно чете добре цифрово съдържание — от документи и диаграми до елементи на потребителски интерфейси на екрана.

Задача Сравнителен тест LFM2.5-VL-3B (3.1B) LFM2-VL-3B (3.1B) gemma-4-E2B-it (5.1B) gemma-4-E4B-it (8B) InternVL 3.5 2B (2.4B) InternVL 3.5 4B (4.7B) Qwen3.5-2B (2.3B) Qwen3.5-4B (4.7B)
Общи MMStar 63.357.745.352.957.765.555.159.3
MME 73.173.054.967.673.681.076.279.5
RealWorldQA 73.171.160.064.361.667.765.167.1
SimpleVQA 35.433.027.330.430.533.735.240.7
SEED-Bench (изображение) 77.776.671.475.375.476.475.876.1
MMBench (dev EN v1.1) 81.080.064.271.676.281.173.178.4
CountBenchQA 87.392.270.480.570.482.583.886.7
Многоезични MMMB 83.081.973.380.476.381.575.982.0
Многоезичен MMBench 79.576.362.871.270.976.669.977.0
Мултимодален IF MM-IFEval 60.651.465.668.247.154.555.463.1
STEM LogicVista 37.432.229.534.530.936.234.037.6
MathVista (мини) 68.562.137.845.256.867.148.763.6
MMMU-Pro 30.528.726.932.621.322.724.936.0
MMMU (val) 48.445.641.149.352.060.744.150.3
Документи, OCR и диаграми ChartQA (test) 81.380.443.242.181.786.278.484.2
DocVQA (val) 91.189.885.787.488.491.892.694.8
InfographicVQA (val) 70.267.854.460.969.376.973.580.3
OCRBench v1 84.281.770.273.583.982.084.485.6
OCRBench v2 (En) 47.543.944.448.845.549.147.758.7
TextVQA (val) 84.383.062.569.076.677.577.381.2
Локализиране RefCOCO-avg 87.957.167.372.182.988.878.586.6
Множество изображения BLINK 61.550.245.252.252.057.248.658.7
MuirBench 58.334.932.951.845.053.548.262.0
Халюцинации HallusionBench 47.246.441.849.847.652.149.351.7
POPE 88.789.284.086.988.088.988.686.0
GUI ScreenSpot-v2 Desktop 78.76.028.145.879.982.063.876.3
ScreenSpot-v2 Mobile 81.27.642.960.386.287.869.781.4
ScreenSpot-v2 Web 82.22.522.447.679.982.665.977.8
Средно - 69.457.252.059.764.669.463.770.1

*Всички стойности в таблицата са нормализирани до 0–100. Оценяването е извършено с vLLM 0.26.0 и препоръчителните параметри за генериране на всеки модел, когато са налични. Навсякъде е използван режим без разсъждение, а на моделите е зададено да отговарят директно, без разсъждение.

Оценихме LFM2.5-VL-3B и по текстови сравнителни тестове за следване на инструкции и използване на инструменти. Следването на инструкции се подобрява във всички направления, а използването на инструменти се подобрява значително. При използването на инструменти LFM2.5-VL-3B е наравно с Gemma-4-E2B и Qwen3.5-2B.

Задача Сравнителен тест LFM2.5-VL-3B (3.1B) LFM2-VL-3B (3.1B) gemma-4-E2B-it (5.1B) gemma-4-E4B-it (8B) InternVL 3.5 2B (2.4B) InternVL 3.5 4B (4.7B) Qwen3.5-2B (2.3B) Qwen3.5-4B (4.7B)
Следване на инструкции IFEval 82.372.983.087.932.435.473.686.2
IFBench 25.820.834.139.224.424.528.933.5
Multi-IF 59.446.569.477.416.316.953.566.7
Използване на инструменти и извикване на функции ToolSandbox 59.526.456.561.6N/AN/A47.765.0
BFCL V4 32.520.533.240.0N/AN/A33.953.6

*Моделите InternVL 3.5 не поддържат извикване на функции.

Тези резултати показват, че LFM2.5-VL-3B е силен модел за зрение и език с общо предназначение. Той обхваща ежедневни задачи (генериране на надписи, визуални въпроси и отговори, разбиране на документи) и е особено добър в локализирането на обекти, четенето на екрани и документи и извикването на инструменти.

Скорост на инференция върху CPU и GPU

LFM2.5-VL-3B се предлага с поддръжка още от първия ден в цялата екосистема за инференция, включително llama.cpp, MLX, vLLM, SGLang и ONNX.

Инференция на устройството. LFM2.5-VL-3B декодира 228 токена/сек на M5 Max и 116 токена/сек на Ryzen AI Max+ 395 и заема около 3 GB памет. Той достига дори 20 токена/сек на Galaxy S26 Ultra, така че можете да го изпълнявате изцяло на устройството.

lfm2_5_vl_3b_on-device_inference_TTFT

GPU инференция. LFM2.5-VL-3B поддържа постоянно ниска латентност и е най-бързият при входове с множество кадри.

lfm2_5_vl_3b_ttft

LFM2.5-VL-3B е и най-бързият по пропускателна способност при генериране на изход сред всички тествани от нас модели, като достига около 11K токена в секунда при висока конкурентност. Това е приблизително два пъти повече от по-големите модели от клас 4B и изпреварва дори по-малките модели от клас 2B, което се равнява на почти 1 милиард генерирани изходни токена дневно на един H100.

lfm2_5_vl_3b_throughput

Как се използва LFM2.5-VL-3B

Изберете LFM2.5-VL-3B, когато се нуждаете от интелигентност на устройството за работни натоварвания с голям обем.

Инсталирайте най-новата версия на transformers (съвместима с transformers>=5.0.0):

%pip install -q torch torchvision accelerate "transformers>=5.10.1"

След това заредете и стартирайте модела:

import torch
from transformers.image_utils import load_image
from transformers import AutoModelForImageTextToText, AutoProcessor
from IPython.display import display

MODEL_ID = "LiquidAI/LFM2.5-VL-3B" 

processor = AutoProcessor.from_pretrained(MODEL_ID)
model = AutoModelForImageTextToText.from_pretrained(
    MODEL_ID,
    device_map="auto",
    dtype="bfloat16",
)

img_url = "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/coco_sample.png"
input_image = load_image(img_url)
display(input_image)

messages = [
    {
        "role": "user",
        "content": [
            {"type": "image", "image": input_image},
            {"type": "text", "text": "Опишете това изображение с две кратки изречения."},
        ],
    }
]

inputs = processor.apply_chat_template(
    messages,
    add_generation_prompt=True,
    tokenize=True,
    return_dict=True,
    return_tensors="pt",
).to(model.device)

with torch.inference_mode():
    outputs = model.generate(
        **inputs,
        do_sample=True,
        temperature=0.2,
        top_k=50,
        repetition_penalty=1.0,
        max_new_tokens=256,
    )

output = processor.batch_decode(outputs[:, inputs["input_ids"].shape[1]:], skip_special_tokens=True)[0]
print(output)

cats_image

Две котки спят на розов диван с два дистанционни пулта.

Още практически примери за използване на LFM2.5-VL3B с входове от множество изображения, локализиране, OCR, извикване на инструменти и други ще намерите в нашата документация. Разгледайте блога за представянето ни за видео примери.

Демонстрация на LFM2.5-VL-3B

Разгледайте тази браузърна демонстрация на чат интерфейс с визуални възможности, задвижван от LFM2.5-VL-3B. Тя ви позволява да заснемате или качвате множество изображения и да взаимодействате с тях чрез модела, включително за локализиране, OCR и използване на инструменти.

Първи стъпки

LFM2.5-VL-3B е наличен в Hugging Face още днес.

С LFM2.5 реализираме визията си за AI, който работи навсякъде. Тези модели са:

Нямаме търпение да видим какво ще създадете.

Цитиране

Моля, цитирайте тази статия, както следва:

Liquid AI, "LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge", Liquid AI Blog, Aug 2026.

Или използвайте цитата във формат BibTeX:

@article{liquidAI2026VL3B,
  author  = {Liquid AI},
  title   = {LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge},
  journal = {Liquid AI Blog},
  year    = {2026},
  note    = {www.liquid.ai/blog/lfm2-5-vl-3b},
}

Модели, споменати в тази статия 2

Пространства, споменати в тази статия 1

Общност

Качвайте изображения, аудио и видеоклипове, като ги плъзнете в текстовото поле, поставите ги или кликнете тук.
Докоснете или поставете тук, за да качите изображения

· Регистрирайте се или влезте, за да коментирате

Модели, споменати в тази статия 2

Пространства, споменати в тази статия 1

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от Hugging Face на

Прочетете оригинала в Hugging Face ↗

Текстът и изображенията са собственост на Hugging Face и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини