Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← Към новините

Alibaba Qwen представи Qwen-Image-2.1-Turbo — 7B модел за изображения с 8 стъпки

Екипът на Qwen на Alibaba пусна Qwen-Image-2.1-Turbo – ускорена версия на модела с отворени тегла Qwen-Image-2.1. Той генерира и редактира изображения за 8 стъпки на премахване на шума вместо стандартните за базовия модел 40 стъпки. За разработчиците това означава 5 пъти по-малко стъпки на премахване на шума при същата 7B архитектура, както и опция за хостван API.

Накратко

  • Размер: 7B параметъра във визуалния генератор, съчетани с текстов енкодер Qwen3-VL 8B.
  • Работи на: CUDA GPU в BF16 чрез Diffusers. Qwen не посочва минимално количество VRAM за Turbo. Unsloth изчислява, че базовият модел работи с 11 GB VRAM с GGUF и 24 GB с INT8/FP8.
  • Производителност: Същите 2K изход и функции за редактиране като Qwen-Image-2.1, но за 8 вместо 40 стъпки.
  • Най-доброто: Базовият Qwen-Image-2.1 постига 60.28 точки в Qwen-Image-Bench – най-високият резултат при модели с отворени тегла, отчетен от Qwen.
  • Извод (най-доброто): Генериране и редактиране в 2K за 8 стъпки в един модел с отворени тегла.
  • Извод (най-лошото): Лицензът е само за изследователски цели, така че за самостоятелно хостване с търговска цел е необходимо отделно разрешение.

Какво представлява Qwen-Image-2.1-Turbo?

Qwen-Image-2.1-Turbo е модел за генериране и редактиране на изображения за 8 стъпки от екипа на Qwen на Alibaba. Той е изграден върху Qwen-Image-2.1. Turbo запазва същата 7B архитектура за визуално генериране. Зарежда се директно чрез QwenImage21Pipeline в Diffusers.

Моделът се доставя със запазен вътре препоръчителен график за семплиране от 8 стъпки. По подразбиране генерирането използва CFG=1. Кеширането на Prefix KV преизползва контекста на текста и референтното изображение между стъпките за премахване на шума.

Как работи Qwen-Image-2.1-Turbo?

Базовата архитектура е еднопоточен DiT с 32 слоя и 7B параметъра. Тя използва блоково-каузално внимание. Текстовите токени получават каузална маска на ниво токен, докато изображенията използват двупосочна маска на ниво блок.

  • Текстов енкодер: Qwen3-VL 8B кодира както инструкциите, така и изображенията за условие.
  • VAE: RGBA автоенкодер с 64 канала и 16-кратно пространствено компресиране, което позволява естествена прозрачност.
  • Планировчик: Flow Matching с дискретно планиране на Euler и динамично изместване.

Именно дизайнът на механизма за внимание прави възможно кеширането на префикса. Входните изображения и текстът се изчисляват веднъж при първата стъпка. Всяка следваща стъпка използва повторно този кеш. При само 8 стъпки кешираният префикс покрива по-голямата част от разходите за условието.

Какво може да генерира и редактира?

Представянето на модела Turbo обхваща 8 категории. Сред тях са портрети, човешки пози, прозрачни изображения, типография и плакати, както и оформления на потребителски интерфейси. Примерите за редактиране включват трансформация на едно изображение, композиция с множество референции и интериорна композиция от 4 изображения. Базовият модел поддържа до 10 референтни изображения и локални редакции чрез кръгове, нарисувани анотации или маски.

Как се стартира Qwen-Image-2.1-Turbo?

Настройката изисква Diffusers от изходния код, както и transformers>=5.17.0. Моделът изисква Diffusers PR #14950, който добавя сигми за семплиране, конфигурирани в pipeline.

Копиране на кодаКопираноИзползвайте друг браузър
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A ceramic teapot on a wooden table, soft window light",
    width=2048, height=2048, use_kv_cache=True,
).images[0]

За редактиране подайте image=input_image с инструкция в prompt. Поддържаните предварително зададени формати варират от квадратен 2048×2048 до 2752×1536 при съотношение 16:9.

Тук трябва да се отбележи едно нещо. Самото задаване на num_inference_steps не отменя запазения график. Това може да стане само чрез изричен аргумент sigmas, а Qwen отбелязва, че други графици не са тествани.

Колко струва API?

Alibaba Cloud Model Studio вече хоства както Turbo, така и Pro. qwen-image-2.1-turbo струва 0,1 китайски юана на изображение в повечето региони, с ограничение от 120 RPM. qwen-image-2.1-pro струва 0,25 китайски юана на изображение, с 20 RPM. Turbo е 2,5 пъти по-евтин на изображение и позволява 6 пъти по-висока честота на заявките.

Qwen-Image-2.1-Turbo срещу конкурентни бързи модели за изображения

ФункцияQwen-Image-2.1-TurboQwen-Image-2.1Z-Image-TurboFLUX.2 klein 9B
ОрганизацияAlibaba QwenAlibaba QwenAlibaba Tongyi-MAIBlack Forest Labs
Размер на генератора7B7B6B9B
Текстов енкодерQwen3-VL 8BQwen3-VL 8BНе е оповестенQwen3 8B
Стъпки по подразбиране8408 NFE4
РедактиранеДа, с множество референцииДа, до 10 референцииНе (отделен Edit модел)Да, с множество референции
Прозрачен RGBA изходДаДаНе е оповестеноНе е оповестено
Естествена разделителна способност2K (2048×2048)2K (2048×2048)1024×1024 в примерите1024×1024 в примерите
Хардуерни изискванияНе са оповестени11 GB GGUF / 24 GB FP8 (Unsloth)Работи с 16 GB VRAM~29 GB VRAM, RTX 4090+
ЛицензQwen Research LicenseQwen Research LicenseApache 2.0FLUX Non-Commercial
Qwen-Image-BenchНе е оповестен60.28 (доставчик)Не е оповестенНе е оповестен
Хостван API0,1 китайски юана/изображениеPro: 0,25 китайски юана/изображениеНе е оповестенBFL API

Основни изводи

  • Qwen-Image-2.1-Turbo намалява премахването на шума от 40 на 8 стъпки при същата 7B архитектура.
  • Един модел поддържа текст-към-изображение в 2K, редактиране с множество референции и прозрачен RGBA изход.
  • API струва 0,1 китайски юана на изображение – 2,5 пъти по-евтино от Pro.
  • Теглата са лицензирани за изследователски цели, така че за самостоятелно хостване с търговска цел е необходимо отделно разрешение.
  • Все още няма специфичен бенчмарк за Turbo; базовият Qwen-Image-2.1 постига 60.28 точки в Qwen-Image-Bench.

Разгледайте страницата в ModelScope, страницата в Hugging Face, Pro API и Turbo API. Всички заслуги са за изследователя на този проект. Също така не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини