Alibaba Qwen випустила Qwen-Image-2.1: модель із відкритими вагами на 7B параметрів для генерації та редагування зображень
Команда Qwen компанії Alibaba випустила Qwen-Image-2.1 — уніфіковану модель для генерації зображень за текстом і редагування зображень. Її компонент візуальної генерації має 7B параметрів у 32 одно потокових шарах DiT. Один чекпойнт охоплює генерацію зображень за текстом, редагування за кількома референсами, локальне редагування та виведення з прозорістю RGBA.
Чи придатна вона для розгортання? Так, для досліджень і оцінювання. Підтримка з першого дня охоплює Diffusers, ComfyUI, vLLM-Omni, SGLang і LightX2V. Для комерційного розгортання потрібна окрема ліцензія від Qwen.
Від 20B до 7B
Оригінальна модель Qwen-Image вийшла в серпні 2025 року як модель із 20B параметрів за ліцензією Apache 2.0. Редагування було реалізоване в окремому чекпойнті Qwen-Image-Edit. Qwen-Image-2.1 об’єднує обидва завдання в одній моделі, розмір якої приблизно втричі менший. Команда Qwen називає її найбільш збалансованою та економічно ефективною моделлю в серії Qwen-Image. Тут важливо врахувати під час планування ресурсів: показник 7B стосується лише дифузійного трансформера. Пайплайн також завантажує енкодер Qwen3-VL із 8B параметрів.
Архітектура
У репозиторії GitHub перелічено 4 компоненти:
- Трансформер: 32 шари, 7B параметрів, одно потокова архітектура з блоково-каузальною увагою.
- Текстовий енкодер: Qwen3-VL 8B, який кодує текстові інструкції та зображення-умови в єдине представлення.
- VAE: 64-канальний RGBA-автоенкодер із просторовою компресією 16x і вбудованою підтримкою прозорості.
- Планувальник: Flow Matching із дискретним плануванням Ейлера та динамічним зсувом.
Саме маска уваги забезпечує швидкість. Текстові токени використовують каузальну маску на рівні токенів. Токени зображення використовують двонапрямлену маску на рівні блоків у межах кожного зображення. Qwen називає це увагою зі змішаною гранулярністю. Префікс умови розташований перед зашумленим латентним представленням, тому він ніколи не звертається до нього. Отже, його ключі та значення залишаються незмінними на всіх кроках денойзингу. Модель обчислює текст і вхідні зображення один раз, на першому кроці. Для кожного наступного кроку вона повторно використовує кеш префікса KV. Економія зростає зі збільшенням кількості референсних зображень, що пояснює заяву про швидкість під час роботи з кількома зображеннями.
Що вона вміє
- Вбудована підтримка прозорості: Генерує зображення RGBA за текстом, редагує прозорі шари та виділяє об’єкти на фотографіях. Для виведення з прозорістю Qwen рекомендує фіксований шаблон запиту.
- Редагування за кількома референсами: Приймає до 10 референсних зображень. Приклади в README містять групове фото з 6 портретів і образ, створений за 5 референсами.
- Локальний контроль: Редагування може охоплювати певні області, позначені колами, намальованими анотаціями або окремими масками. Ідентичність людей і товарів зберігається.
- Вбудована підтримка 2K: Типовий розмір становить 2048 x 2048, доступно 7 співвідношень сторін — до 2752 x 1536.
- Естетика: Покращено типографіку, освітлення портретів і дрібні деталі. Qwen особливо відзначає панорами, інфографіку, розкадровки та віртуальну примірку.
Бенчмарк: власна діаграма Qwen
Дослідницька команда порівнює моделі на Qwen-Image-Bench — внутрішньому бенчмарку Qwen. Згідно з цією діаграмою, Qwen-Image-2.1 набирає 60.28 бала загалом. Це ставить її вище за Nano Banana 2.0 із результатом 59.82 і за всі перелічені моделі з відкритими вагами. FLUX 2 Max, відкрита модель із 32B параметрів, набирає 55.33. Вищі результати мають 6 закритих моделей; очолює список GPT Image 2.5 Sunburst із показником 67.01.
Інтерактивне пояснення
Запуск моделі
Встановіть PyTorch 2.4.0 або новішої версії, transformers 5.17 або новішої версії, Diffusers із вихідного коду, accelerate та pillow. Потім:
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A neon shop sign that reads \"QWEN IMAGE 2.1\", rainy night",
num_inference_steps=40,
).images[0]
image.save("t2i.png")Той самий пайплайн виконує редагування, якщо передати image= з одним або кількома референсами. На менших GPU pipe.enable_model_cpu_offload() зменшує навантаження на пам’ять.
Для обслуговування vLLM-Omni додає квантизацію FP8, кешування префікса KV, декодування CUDA Graph і тензорний паралелізм. SGLang додає Cache-DiT, графи CUDA, паралелізм між кількома GPU та вивантаження компонентів. ComfyUI постачається з нативними вузлами та конвертованими вагами. Окрім NVIDIA, реліз охоплює графічні процесори AMD Radeon через ROCm і 8 платформ на чипах через FlagOS.
Команда Qwen також випустила 2 моделі для перезапису запитів — чекпойнти Qwen3.5-VL 9B, донавчені для генерації зображень за текстом і редагування. Вони розширюють короткі запити до детальних і можуть вибирати співвідношення сторін.
Основні висновки
- Qwen-Image-2.1 об’єднує генерацію та редагування в одному DiT із 7B параметрів і енкодером Qwen3-VL 8B.
- Вбудована підтримка виведення RGBA та до 10 референсних зображень доступна в одному чекпойнті.
- Повторне використання кешу префікса KV дає змогу обчислювати текст і референсні зображення один раз для кожної генерації.
- Модель набирає 60.28 бала на власному бенчмарку Qwen і посідає перше місце серед перелічених моделей із відкритими вагами.
- Ліцензія Qwen Research License забороняє комерційне використання без окремої угоди.
Ознайомтеся з вагами моделі, репозиторієм GitHub і технічними деталями. Уся подяка досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабредіту 150k+ ML та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.