Модель Alibaba Qwen-Image-2.1 із відкритими вагами стверджує, що перевершує закриті моделі в генерації зображень, маючи лише 7 мільярдів параметрів
Команда Alibaba Qwen AI випустила Qwen-Image-2.1 — відкритовагову модель для створення та редагування зображень. Її компонент візуальної генерації має лише 7 мільярдів параметрів, однак, за твердженням команди, перевершує більшість закритих моделей у власному бенчмарку Qwen, хоча незалежні результати тестування ще очікуються. Модель працює на потужних споживчих графічних процесорах, як-от 3090.

Модель нативно створює та редагує прозорі зображення (RGBA), даючи змогу користувачам ізолювати об’єкти або змінювати текст на прозорих шарах. Вона одночасно обробляє до десяти референсних зображень для групових портретів, віртуальної примірки чи дизайну кімнат, а кола, маски або намальовані позначки спрямовують локальні редагування. Qwen стверджує, що зміни в архітектурі та повторне використання кешу KV пришвидшують інференс, особливо під час роботи з кількома референсними зображеннями.
Qwen-Image-2.1 доступна на Hugging Face, GitHub і Model Scope, а також має демоверсію на Hugging Face. Її дослідницька ліцензія забороняє комерційне використання, тому бізнес-користувачі мають звернутися до Qwen для отримання окремої ліцензії.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний розширений звіт «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.