Alibaba представила Qwen3.8-Flash-Next, орієнтовану на «максимальну економічну ефективність»
Команда Qwen компанії Alibaba представляє Qwen3.8-Flash-Next — мультимодальну модель із сумішшю експертів, яка є демонстрацією архітектури Qwen4. Вона прагне зрівнятися з набагато більшими моделями, витрачаючи лише частину коштів на навчання.
Загалом модель має 125 мільярдів параметрів, але для кожного токена активує лише 6 мільярдів. Вона також містить 51 мільярд параметрів у новому шарі N-грамних вбудовувань — одній з архітектурних інновацій, запланованих для Qwen4. Цей шар зберігає поширені групи слів як окремі записи у своєрідному «словнику фраз» і може працювати у звичайній системній оперативній пам’яті, а не на GPU, за «відносно невеликих додаткових витрат».

Модель нативно підтримує контекстне вікно на 262 144 токени, а за допомогою YaRN його можна розширити до одного мільйона токенів. Технічний звіт доступний на GitHub, а ваги — на Hugging Face і ModelScope. Робоча версія постачається як Qwen3.8-Flash через QwenCloud за ціною $0,16 за мільйон вхідних токенів і $0,47 за мільйон вихідних токенів. За даними Qwen, API має запрацювати найближчим часом.
У дев’ять разів нижча вартість навчання, кращі результати
Qwen3.8-Flash-Next забезпечує кращі результати, ніж Qwen3.7-Plus, приблизно за одну дев’яту вартості навчання, за словами команди Qwen, причому найбільший прогрес спостерігається у програмуванні та офісних завданнях. Qwen3.7-Plus має 397 мільярдів параметрів, з яких для кожного токена активуються 17 мільярдів — майже втричі більше, ніж у Flash-Next.
Опубліковані Alibaba результати тестування порівнюють модель із DeepSeek-V4-Flash (284 мільярди параметрів, 13 мільярдів активованих) та Claude Opus 4.6 (Max) від Anthropic. Попри те, що обидві моделі значно більші або дорожчі, Flash-Next лідирує у більшості перевірених завдань.
Схоже, модель оптимізована для бенчмарків агентного програмування, у яких ШІ має самостійно знаходити й виправляти помилки у справжніх програмних проєктах. Flash-Next набрала 58,7 бала в DeepSWE та 62,5 бала в SWE-bench Pro, випередивши DeepSeek-V4-Flash і Claude Opus 4.6.
Розрив у завданнях для офісу та продуктивності ще більший. Flash-Next набрала 73,9 бала в CoWorkBench, тоді як DeepSeek-V4-Flash — лише 45,1. У JobBench, тесті професійних робочих процесів, Flash-Next отримала 55,7 бала — майже вдвічі більше, ніж Qwen3.7-Plus із результатом 27,6. У науковому міркуванні (GPQA Diamond: 91,7) та змагальному програмуванні (LiveCodeBench v6: 91,9) моделі показують близькі результати.
| Бенчмарк | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek-V4-Flash-0731 | Claude-Opus-4.6 (Max) |
|---|---|---|---|---|---|
| Параметри (загалом) | 125B | 27B | 397B | 284B | -- |
| Активовані параметри | 6B | 27B | 17B | 13B | -- |
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Останній іспит агентів (результат) | 51.2 | 42.9 | 33.6 | -- | -- |
| Toolathlon Verified (Pass@1) | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Claude Opus 4.6 випереджає конкурентів лише в Humanity's Last Exam — тесті, побудованому на надзвичайно складних міждисциплінарних завданнях, — але це також «старіша» модель Anthropic, випущена в лютому 2026 року. Як завжди, результати бенчмарків і продуктивність у реальних умовах можуть відрізнятися.
Ціни продовжують тиснути на конкурентів
На початку серпня Alibaba представила Qwen3.8-Max як свою актуальну флагманську модель, що конкурує з Claude Opus 4.8, Gemini 3.1 Pro та GPT5.6 Sol. Flash-Next працює трохи гірше за флагманську модель, але коштує приблизно в дванадцять разів дешевше: різниця в ціні для вхідних і вихідних токенів становить близько 12 разів.
| Qwen3.8-Max | Qwen3.8-Flash-Next | |
|---|---|---|
| Вхідні (за 1 млн токенів) | $2.00 | 0.16 USD |
| Вихідні (за 1 млн токенів) | 6.00 USD | 0.47 USD |
Таке ціноутворення дедалі посилює тиск на OpenAI та Anthropic. Qwen3.8-27B також останнім часом користується популярністю, оскільки може працювати локально й забезпечує високу продуктивність майже без витрат, якщо у вас є відповідне обладнання. Нещодавно OpenAI відповіла значними знижками на свою нову лінійку моделей GPT-5.6. Для користувачів це добре, але для стрімкого зростання доходів, необхідного постачальникам ШІ для підтримки інвестиційного наративу, — погано.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний квартальний звіт про передові розробки «AI Radar», повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.