Alibaba Qwen випустила Qwen-Image-2.1-Turbo — 7B-модель зображень із 8 кроками
Команда Qwen компанії Alibaba випустила Qwen-Image-2.1-Turbo — прискорений чекпойнт її моделі з відкритими вагами Qwen-Image-2.1. Він генерує та редагує зображення за 8 кроків денойзингу замість стандартних 40 кроків базової моделі. Для розробників це означає у 5 разів менше кроків денойзингу на тій самій архітектурі 7B, а також можливість використання розміщеного API.
Коротко
- Розмір: 7B параметрів у візуальному генераторі в поєднанні з текстовим енкодером Qwen3-VL 8B.
- Працює на: CUDA GPU у BF16 через Diffusers. Qwen не публікує мінімальні вимоги до VRAM для Turbo. За оцінкою Unsloth, базова модель працює на 11 ГБ VRAM із GGUF і 24 ГБ з INT8/FP8.
- Продуктивність: ті самі можливості генерації та редагування зображень у роздільній здатності 2K, що й у Qwen-Image-2.1, але за 8 кроків замість 40.
- Найкраще: базова Qwen-Image-2.1 набирає 60,28 бала в Qwen-Image-Bench — найвищий результат серед моделей із відкритими вагами, про який повідомляє Qwen.
- Підсумок (перевага): генерація та редагування зображень у 2K за 8 кроків в одному відкритому чекпойнті.
- Підсумок (недолік): лише дослідницька ліцензія, тому для комерційного самостійного розгортання потрібен окремий дозвіл.
Що таке Qwen-Image-2.1-Turbo?
Qwen-Image-2.1-Turbo — це чекпойнт для генерації та редагування зображень за 8 кроків від команди Qwen компанії Alibaba. Він створений на основі Qwen-Image-2.1. Turbo зберігає ту саму архітектуру візуального генератора 7B. Він безпосередньо завантажується через QwenImage21Pipeline у Diffusers.
Чекпойнт постачається зі збереженим усередині рекомендованим розкладом семплінгу на 8 кроків. За замовчуванням генерація використовує CFG=1. Префіксне KV-кешування повторно використовує контекст тексту та референсного зображення на різних кроках денойзингу.
Як працює Qwen-Image-2.1-Turbo?
Базова архітектура — це однотоковий DiT із 32 шарами та 7B параметрів. Вона використовує блоково-каузальну увагу. Текстові токени отримують каузальну маску на рівні токенів, тоді як зображення використовують двонапрямлену маску на рівні блоків.
- Текстовий енкодер: Qwen3-VL 8B кодує як інструкції, так і зображення-умови.
- VAE: RGBA-автоенкодер із 64 каналами та просторовою компресією 16x, що забезпечує вбудовану підтримку прозорості.
- Планувальник: Flow Matching із дискретним плануванням Euler і динамічним зсувом.
Саме дизайн механізму уваги забезпечує роботу префіксного кешування. Вхідні зображення та текст обчислюються на першому кроці лише один раз. На кожному наступному кроці цей кеш використовується повторно. За наявності лише 8 кроків кешований префікс охоплює більшу частину вартості обробки умов.
Що вона може генерувати та редагувати?
Демонстрація в картці моделі Turbo охоплює 8 категорій. Серед них — портрети, пози людей, прозорі зображення, типографіка та постери, а також макети інтерфейсів. Приклади редагування включають трансформацію одного зображення, композицію з кількох референсів і композицію інтер’єру з 4 зображень. Базова модель підтримує до 10 референсних зображень і локальне редагування за допомогою кіл, намальованих анотацій або масок.
Як запустити Qwen-Image-2.1-Turbo?
Налаштування потребує Diffusers із вихідного коду, а також transformers>=5.17.0. Для чекпойнта потрібен запит на злиття Diffusers №14950, який додає сігми семплінгу, налаштовані через конфігурацію пайплайна.
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A ceramic teapot on a wooden table, soft window light",
width=2048, height=2048, use_kv_cache=True,
).images[0]Для редагування передайте image=input_image разом із текстовою інструкцією. Підтримувані пресети варіюються від квадратного формату 2048×2048 до 2752×1536 із співвідношенням сторін 16:9.
Тут варто звернути увагу на один момент. Саме встановлення num_inference_steps не перевизначає збережений розклад. Це може зробити лише явний аргумент sigmas, причому Qwen зазначає, що інші розклади не тестувалися.
Скільки коштує API?
Alibaba Cloud Model Studio тепер розміщує і Turbo, і Pro. qwen-image-2.1-turbo коштує 0,1 юаня КНР за зображення в більшості регіонів, з обмеженням 120 RPM. qwen-image-2.1-pro коштує 0,25 юаня КНР за зображення, з обмеженням 20 RPM. Turbo у 2,5 раза дешевша за зображення і допускає в 6 разів вищу частоту запитів.
Qwen-Image-2.1-Turbo у порівнянні з конкуруючими швидкими моделями зображень
| Характеристика | Qwen-Image-2.1-Turbo | Qwen-Image-2.1 | Z-Image-Turbo | FLUX.2 klein 9B |
|---|---|---|---|---|
| Організація | Alibaba Qwen | Alibaba Qwen | Alibaba Tongyi-MAI | Black Forest Labs |
| Розмір генератора | 7B | 7B | 6B | 9B |
| Текстовий енкодер | Qwen3-VL 8B | Qwen3-VL 8B | Не розкрито | Qwen3 8B |
| Стандартна кількість кроків | 8 | 40 | 8 NFE | 4 |
| Редагування | Так, кілька референсів | Так, до 10 референсів | Ні (окрема модель Edit) | Так, кілька референсів |
| Прозорий вихід RGBA | Так | Так | Не розкрито | Не розкрито |
| Вбудована роздільна здатність | 2K (2048×2048) | 2K (2048×2048) | 1024×1024 у прикладах | 1024×1024 у прикладах |
| Рекомендації щодо обладнання | Не розкрито | 11 ГБ GGUF / 24 ГБ FP8 (Unsloth) | Працює на 16 ГБ VRAM | ~29 ГБ VRAM, RTX 4090+ |
| Ліцензія | Qwen Research License | Qwen Research License | Apache 2.0 | FLUX Non-Commercial |
| Qwen-Image-Bench | Не розкрито | 60,28 (за даними розробника) | Не розкрито | Не розкрито |
| Розміщене API | 0,1 юаня КНР/зображення | Pro: 0,25 юаня КНР/зображення | Не розкрито | BFL API |
Ключові висновки
- Qwen-Image-2.1-Turbo скорочує кількість кроків денойзингу з 40 до 8 у тій самій архітектурі 7B.
- Один чекпойнт підтримує генерацію тексту в зображення у 2K, редагування з кількома референсами та прозорий вихід RGBA.
- API коштує 0,1 юаня КНР за зображення — у 2,5 раза дешевше за Pro.
- Ваги поширюються за дослідницькою ліцензією, тому для комерційного самостійного розгортання потрібен окремий дозвіл.
- Спеціального бенчмарку для Turbo ще немає; базова Qwen-Image-2.1 набирає 60,28 бала в Qwen-Image-Bench.
Перегляньте сторінку ModelScope, сторінку Hugging Face, Pro API і Turbo API. Уся заслуга належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання з понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.