Alibaba Qwen пуска Qwen-Image-2.1: 7B модел с отворени тегла за генериране и редактиране на изображения
Екипът Qwen на Alibaba пусна Qwen-Image-2.1 — унифициран модел за генериране на изображения от текст и редактиране на изображения. Компонентът за визуална генерация има 7B параметъра в 32 еднопоточни DiT слоя. Един checkpoint обхваща генериране на изображения от текст, редактиране с множество референции, локални редакции и прозрачен RGBA изход.
Може ли да бъде внедрен? Да, за изследвания и оценка. Поддръжката още от деня на пускането обхваща Diffusers, ComfyUI, vLLM-Omni, SGLang и LightX2V. За комерсиално внедряване е необходим отделен лиценз от Qwen.
От 20B до 7B
Оригиналният Qwen-Image беше пуснат през август 2025 г. като модел с 20B параметъра под лиценза Apache 2.0. Редактирането се извършваше от отделен checkpoint Qwen-Image-Edit. Qwen-Image-2.1 обединява двете функции в един модел с приблизително една трета от размера. Екипът на Qwen го нарича най-балансирания и икономически ефективен модел в серията Qwen-Image. Тук е важно да се отбележи за планирането на капацитета: стойността 7B обхваща само дифузионния трансформатор. Конвейерът зарежда и 8B енкодер Qwen3-VL.
Архитектура
GitHub хранилището изброява 4 компонента:
- Трансформатор: 32 слоя, 7B параметъра, еднопоточен дизайн с блоково-каузално внимание.
- Текстов енкодер: Qwen3-VL 8B, който кодира текстовите инструкции и условните изображения в едно представяне.
- VAE: 64-канален RGBA автоенкодер с 16x пространствена компресия и естествена прозрачност.
- Планировчик: Flow Matching с дискретно планиране на Euler и динамично изместване.
Маската за внимание е източникът на скоростта. Текстовите токени използват каузална маска на ниво токени. Токените на изображението използват двупосочна маска на ниво блок в рамките на всяко изображение. Qwen нарича това внимание със смесена гранулярност. Префиксът с условието стои преди шумния латентен вектор, така че никога не се обръща към него. Затова неговите ключове и стойности остават фиксирани по време на стъпките на премахване на шума. Моделът изчислява текста и входните изображения веднъж, при първата стъпка. След това използва повторно KV кеша на този префикс за всяка следваща стъпка. Спестяванията се увеличават с броя на референтните изображения, което обяснява твърдението за висока скорост при работа с множество изображения.
Какво може да прави
- Естествена прозрачност: Генерира RGBA изображения от текст, редактира прозрачни слоеве и извлича обекти от снимки. Qwen препоръчва фиксиран шаблон на подканата за прозрачен изход.
- Редактиране с множество референции: Приема до 10 референтни изображения. Примерите в README включват групова снимка от 6 портрета и облекло от 5 референции.
- Локален контрол: Редакциите могат да насочват към области чрез кръгове, рисувани анотации или отделни маски. Идентичността се запазва при хора и продукти.
- Естествена 2K резолюция: По подразбиране използва 2048 x 2048, с 7 поддържани съотношения на страните до 2752 x 1536.
- Естетика: Подобрена типография, осветление на портрети и фини детайли. Qwen акцентира върху панорами, инфографики, сторибордове и виртуално пробване на дрехи.
Бенчмарк: Собствената класация на Qwen
Изследователският екип сравнява моделите чрез Qwen-Image-Bench — вътрешен бенчмарк на Qwen. В тази класация Qwen-Image-2.1 получава общ резултат 60.28. Това го поставя над Nano Banana 2.0 с 59.82 и над всички посочени модели с отворени тегла. FLUX 2 Max, модел с отворени тегла и 32B параметъра, получава 55.33. 6 затворени модела постигат по-високи резултати, начело с GPT Image 2.5 Sunburst с 67.01.
Интерактивно обяснение
Стартиране
Инсталирайте PyTorch 2.4.0 или по-нова версия, transformers 5.17 или по-нова версия, Diffusers от изходния код, accelerate и pillow. След това:
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A neon shop sign that reads \"QWEN IMAGE 2.1\", rainy night",
num_inference_steps=40,
).images[0]
image.save("t2i.png")Същият конвейер обработва редактиране, когато подадете image= с 1 или повече референции. При по-малки графични процесори pipe.enable_model_cpu_offload() намалява натоварването на паметта.
За обслужване vLLM-Omni добавя FP8 квантизация, кеширане на префиксния KV кеш, декодиране с CUDA Graph и тензорен паралелизъм. SGLang добавя Cache-DiT, CUDA графи, многографичен паралелизъм и разтоварване на компоненти. ComfyUI предлага естествени възли и конвертирани тегла. Освен NVIDIA, пускането обхваща графични процесори AMD Radeon чрез ROCm и 8 чипови платформи чрез FlagOS.
Екипът на Qwen пусна и 2 модела за пренаписване на подкани — дообучени checkpoint-и Qwen3.5-VL 9B за генериране на изображения от текст и редактиране. Те разширяват кратките подкани в подробни и могат да изберат съотношение на страните.
Основни изводи
- Qwen-Image-2.1 обединява генерирането и редактирането в 7B DiT с енкодер Qwen3-VL 8B.
- Естественият RGBA изход и до 10 референтни изображения са достъпни от един checkpoint.
- Повторното използване на префиксния KV кеш изчислява текста и референтните изображения веднъж за всяка генерация.
- Получава 60.28 в собствения бенчмарк на Qwen — първо място сред посочените модели с отворени тегла.
- Лицензът Qwen Research забранява комерсиална употреба без отделно споразумение.
Разгледайте теглата на модела, GitHub хранилището и техническите подробности. Всички заслуги са за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Имате нужда да си партнирате с нас за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово издание, уебинар и др.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.