Qwen-Image-2.1 с отворени тегла на Alibaba твърди, че превъзхожда затворени модели при генериране на изображения само със 7 милиарда параметъра
Екипът на Alibaba за изкуствен интелект Qwen пусна Qwen-Image-2.1 — модел с отворени тегла за генериране и редактиране на изображения. Компонентът му за визуално генериране има само 7 милиарда параметъра, но според екипа превъзхожда повечето затворени модели в собствения бенчмарк на Qwen, въпреки че независими бенчмаркове все още не са налични. Моделът работи на мощни потребителски графични процесори като 3090.

Моделът генерира и редактира изображения с прозрачен фон (RGBA) директно, което позволява на потребителите да изолират обекти или да променят текст върху прозрачни слоеве. Той обработва до десет референтни изображения едновременно за групови портрети, виртуално пробване на дрехи или дизайн на помещения, а кръгове, маски или нарисувани обозначения насочват локалните редакции. Qwen твърди, че промените в архитектурата и повторното използване на KV кеша ускоряват извеждането, особено при множество референтни изображения.
Qwen-Image-2.1 е достъпен в Hugging Face, GitHub и Model Scope, както и чрез демо в Hugging Face. Неговият лиценз за изследователски цели забранява търговската употреба, така че бизнес потребителите трябва да кандидатстват пред Qwen за отделен лиценз.
Новини за изкуствения интелект без сензации – подбрани от хора
Абонирайте се за THE DECODER, за да четете без реклами, да получавате седмичен бюлетин за изкуствения интелект и нашия ексклузивен годишен доклад „AI Radar“ за водещите разработки, публикуван шест пъти годишно, както и пълен достъп до архива и секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.