Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Alibaba Qwen пуска Qwen-Image-2.1: 7B модел с отворени тегла за генериране и редактиране на изображения

Екипът Qwen на Alibaba пусна Qwen-Image-2.1 — унифициран модел за генериране на изображения от текст и редактиране на изображения. Компонентът за визуална генерация има 7B параметъра в 32 еднопоточни DiT слоя. Един checkpoint обхваща генериране на изображения от текст, редактиране с множество референции, локални редакции и прозрачен RGBA изход.

Може ли да бъде внедрен? Да, за изследвания и оценка. Поддръжката още от деня на пускането обхваща Diffusers, ComfyUI, vLLM-Omni, SGLang и LightX2V. За комерсиално внедряване е необходим отделен лиценз от Qwen.

От 20B до 7B

Оригиналният Qwen-Image беше пуснат през август 2025 г. като модел с 20B параметъра под лиценза Apache 2.0. Редактирането се извършваше от отделен checkpoint Qwen-Image-Edit. Qwen-Image-2.1 обединява двете функции в един модел с приблизително една трета от размера. Екипът на Qwen го нарича най-балансирания и икономически ефективен модел в серията Qwen-Image. Тук е важно да се отбележи за планирането на капацитета: стойността 7B обхваща само дифузионния трансформатор. Конвейерът зарежда и 8B енкодер Qwen3-VL.

Архитектура

GitHub хранилището изброява 4 компонента:

  • Трансформатор: 32 слоя, 7B параметъра, еднопоточен дизайн с блоково-каузално внимание.
  • Текстов енкодер: Qwen3-VL 8B, който кодира текстовите инструкции и условните изображения в едно представяне.
  • VAE: 64-канален RGBA автоенкодер с 16x пространствена компресия и естествена прозрачност.
  • Планировчик: Flow Matching с дискретно планиране на Euler и динамично изместване.

Маската за внимание е източникът на скоростта. Текстовите токени използват каузална маска на ниво токени. Токените на изображението използват двупосочна маска на ниво блок в рамките на всяко изображение. Qwen нарича това внимание със смесена гранулярност. Префиксът с условието стои преди шумния латентен вектор, така че никога не се обръща към него. Затова неговите ключове и стойности остават фиксирани по време на стъпките на премахване на шума. Моделът изчислява текста и входните изображения веднъж, при първата стъпка. След това използва повторно KV кеша на този префикс за всяка следваща стъпка. Спестяванията се увеличават с броя на референтните изображения, което обяснява твърдението за висока скорост при работа с множество изображения.

Какво може да прави

  • Естествена прозрачност: Генерира RGBA изображения от текст, редактира прозрачни слоеве и извлича обекти от снимки. Qwen препоръчва фиксиран шаблон на подканата за прозрачен изход.
  • Редактиране с множество референции: Приема до 10 референтни изображения. Примерите в README включват групова снимка от 6 портрета и облекло от 5 референции.
  • Локален контрол: Редакциите могат да насочват към области чрез кръгове, рисувани анотации или отделни маски. Идентичността се запазва при хора и продукти.
  • Естествена 2K резолюция: По подразбиране използва 2048 x 2048, с 7 поддържани съотношения на страните до 2752 x 1536.
  • Естетика: Подобрена типография, осветление на портрети и фини детайли. Qwen акцентира върху панорами, инфографики, сторибордове и виртуално пробване на дрехи.

Бенчмарк: Собствената класация на Qwen

Изследователският екип сравнява моделите чрез Qwen-Image-Bench — вътрешен бенчмарк на Qwen. В тази класация Qwen-Image-2.1 получава общ резултат 60.28. Това го поставя над Nano Banana 2.0 с 59.82 и над всички посочени модели с отворени тегла. FLUX 2 Max, модел с отворени тегла и 32B параметъра, получава 55.33. 6 затворени модела постигат по-високи резултати, начело с GPT Image 2.5 Sunburst с 67.01.

Интерактивно обяснение

Стартиране

Инсталирайте PyTorch 2.4.0 или по-нова версия, transformers 5.17 или по-нова версия, Diffusers от изходния код, accelerate и pillow. След това:

Копиране на кодаКопираноИзползвайте друг браузър
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A neon shop sign that reads \"QWEN IMAGE 2.1\", rainy night",
    num_inference_steps=40,
).images[0]
image.save("t2i.png")

Същият конвейер обработва редактиране, когато подадете image= с 1 или повече референции. При по-малки графични процесори pipe.enable_model_cpu_offload() намалява натоварването на паметта.

За обслужване vLLM-Omni добавя FP8 квантизация, кеширане на префиксния KV кеш, декодиране с CUDA Graph и тензорен паралелизъм. SGLang добавя Cache-DiT, CUDA графи, многографичен паралелизъм и разтоварване на компоненти. ComfyUI предлага естествени възли и конвертирани тегла. Освен NVIDIA, пускането обхваща графични процесори AMD Radeon чрез ROCm и 8 чипови платформи чрез FlagOS.

Екипът на Qwen пусна и 2 модела за пренаписване на подкани — дообучени checkpoint-и Qwen3.5-VL 9B за генериране на изображения от текст и редактиране. Те разширяват кратките подкани в подробни и могат да изберат съотношение на страните.

Основни изводи

  • Qwen-Image-2.1 обединява генерирането и редактирането в 7B DiT с енкодер Qwen3-VL 8B.
  • Естественият RGBA изход и до 10 референтни изображения са достъпни от един checkpoint.
  • Повторното използване на префиксния KV кеш изчислява текста и референтните изображения веднъж за всяка генерация.
  • Получава 60.28 в собствения бенчмарк на Qwen — първо място сред посочените модели с отворени тегла.
  • Лицензът Qwen Research забранява комерсиална употреба без отделно споразумение.

Разгледайте теглата на модела, GitHub хранилището и техническите подробности. Всички заслуги са за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.

Имате нужда да си партнирате с нас за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово издание, уебинар и др.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини