Модель Alibaba Qwen-Image-2.1 с открытыми весами утверждает, что превосходит закрытые модели в генерации изображений всего с 7 млрд параметров
Команда Alibaba, занимающаяся ИИ Qwen, выпустила Qwen-Image-2.1 — модель с открытыми весами для генерации и редактирования изображений. Компонент визуальной генерации содержит всего 7 миллиардов параметров, но, по утверждению команды, превосходит большинство закрытых моделей в собственном бенчмарке Qwen, хотя независимые оценки пока не проводились. Модель работает на достаточно мощных потребительских GPU, например на 3090.

Модель изначально генерирует и редактирует прозрачные изображения (RGBA), позволяя пользователям изолировать объекты или изменять текст на прозрачных слоях. Она одновременно обрабатывает до десяти эталонных изображений для групповых портретов, виртуальной примерки или дизайна помещений, а круги, маски и нарисованные отметки позволяют направлять локальные изменения. Qwen сообщает, что изменения в архитектуре и повторное использование KV-кэша ускоряют вывод, особенно при работе с несколькими эталонными изображениями.
Qwen-Image-2.1 доступна на Hugging Face, GitHub и Model Scope, а также в виде демоверсии на Hugging Face. Её исследовательская лицензия запрещает коммерческое использование, поэтому бизнес-пользователям необходимо обратиться к Qwen за отдельной лицензией.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER и получите чтение без рекламы, еженедельную рассылку об ИИ, наш эксклюзивный отчёт о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.