Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Alibaba Qwen выпустила Qwen-Image-2.1: модель с открытыми весами на 7B параметров для генерации и редактирования изображений

Команда Qwen от Alibaba выпустила Qwen-Image-2.1 — унифицированную модель для генерации изображений по тексту и редактирования изображений. Компонент визуальной генерации включает 7 млрд параметров в 32 одно потоковых слоях DiT. Одна контрольная точка поддерживает генерацию изображений по тексту, редактирование по нескольким референсам, локальное редактирование и вывод с прозрачностью RGBA.

Можно ли её развернуть? Да, для исследований и оценки. С самого первого дня поддерживаются Diffusers, ComfyUI, vLLM-Omni, SGLang и LightX2V. Для коммерческого развёртывания требуется отдельная лицензия от Qwen.

От 20B к 7B

Оригинальная модель Qwen-Image вышла в августе 2025 года как модель с 20 млрд параметров под лицензией Apache 2.0. Редактирование выполнялось отдельной контрольной точкой Qwen-Image-Edit. Qwen-Image-2.1 объединяет обе задачи в одной модели размером примерно в треть от исходного. Команда Qwen называет её наиболее сбалансированной и экономичной моделью в серии Qwen-Image. Здесь важно отметить для планирования ресурсов: показатель 7B относится только к диффузионному трансформеру. В конвейер также загружается энкодер Qwen3-VL с 8 млрд параметров.

Архитектура

В репозитории GitHub перечислены 4 компонента:

  • Трансформер: 32 слоя, 7 млрд параметров, одно потоковая архитектура с блочно-каузальным вниманием.
  • Текстовый энкодер: Qwen3-VL 8B, который кодирует текстовые инструкции и условные изображения в единое представление.
  • VAE: 64-канальный RGBA-автоэнкодер с пространственным сжатием 16x и нативной поддержкой прозрачности.
  • Планировщик: Flow Matching с дискретным планированием Euler и динамическим сдвигом.

Именно маска внимания обеспечивает прирост скорости. Для текстовых токенов используется маска причинности на уровне токенов. Для токенов изображения применяется двунаправленная маска на уровне блоков внутри каждого изображения. Qwen называет это вниманием со смешанной гранулярностью. Префикс условия находится перед зашумлённым латентным представлением, поэтому он никогда не обращается к нему. Следовательно, его ключи и значения остаются неизменными на протяжении шагов удаления шума. Модель вычисляет текст и входные изображения один раз, на первом шаге. Затем она повторно использует KV-кэш этого префикса на каждом последующем шаге. Экономия растёт с увеличением количества референсных изображений, что объясняет заявленное ускорение при работе с несколькими изображениями.

Что она умеет

  • Нативная прозрачность: генерирует изображения RGBA по тексту, редактирует прозрачные слои и извлекает объекты из фотографий. Для вывода с прозрачностью Qwen рекомендует использовать фиксированный шаблон запроса.
  • Редактирование по нескольким референсам: принимает до 10 референсных изображений. В примерах README показаны групповая фотография из 6 портретов и наряд, созданный по 5 референсам.
  • Локальное управление: редактирование может применяться к отдельным областям с помощью кругов, нарисованных аннотаций или отдельных масок. Идентичность людей и товаров сохраняется.
  • Нативное разрешение 2K: по умолчанию используется разрешение 2048 x 2048, поддерживается 7 соотношений сторон вплоть до 2752 x 1536.
  • Эстетика: улучшены типографика, освещение портретов и мелкие детали. Qwen выделяет панорамы, инфографику, раскадровки и виртуальную примерку.

Бенчмарк: собственная диаграмма Qwen

Исследовательская команда сравнивает модели на Qwen-Image-Bench — внутреннем бенчмарке Qwen. Согласно этой диаграмме, Qwen-Image-2.1 набирает 60.28 балла в общем зачёте. Это ставит её выше Nano Banana 2.0 с результатом 59.82 и всех представленных моделей с открытыми весами. FLUX 2 Max, открытая модель с 32 млрд параметров, получает 55.33. 6 закрытых моделей набирают больше, лидирует GPT Image 2.5 Sunburst с результатом 67.01.

Интерактивное объяснение

Запуск модели

Установите PyTorch 2.4.0 или более позднюю версию, transformers 5.17 или более позднюю версию, Diffusers из исходного кода, accelerate и pillow. Затем:

Копировать кодСкопированоИспользовать другой браузер
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A neon shop sign that reads \"QWEN IMAGE 2.1\", rainy night",
    num_inference_steps=40,
).images[0]
image.save("t2i.png")

Этот же конвейер поддерживает редактирование, если передать image= с 1 или более референсами. На менее мощных GPU вызов pipe.enable_model_cpu_offload() снижает нагрузку на память.

Для обслуживания vLLM-Omni добавляет FP8-квантизацию, кэширование префиксного KV, декодирование с помощью CUDA Graph и тензорный параллелизм. SGLang добавляет Cache-DiT, графы CUDA, параллелизм на нескольких GPU и выгрузку компонентов. ComfyUI поставляется с нативными узлами и конвертированными весами. Помимо NVIDIA, релиз поддерживает GPU AMD Radeon через ROCm и 8 аппаратных платформ через FlagOS.

Команда Qwen также выпустила 2 модели для переформулирования запросов — дообученные контрольные точки Qwen3.5-VL 9B для генерации изображений по тексту и редактирования. Они превращают короткие запросы в подробные и могут выбирать соотношение сторон.

Ключевые выводы

  • Qwen-Image-2.1 объединяет генерацию и редактирование в 7B DiT с энкодером Qwen3-VL 8B.
  • Нативный вывод RGBA и поддержка до 10 референсных изображений доступны в одной контрольной точке.
  • Повторное использование префиксного KV-кэша позволяет вычислять текст и референсные изображения один раз для каждой генерации.
  • Она набирает 60.28 балла на собственном бенчмарке Qwen, занимая первое место среди представленных моделей с открытыми весами.
  • Лицензия Qwen Research License запрещает коммерческое использование без отдельного соглашения.

Ознакомьтесь с весами модели, репозиторием GitHub и техническими подробностями. Вся благодарность исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости