Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Alibaba представила Qwen3.8-Flash-Next, орієнтовану на «максимальну економічну ефективність»

Alibaba випускає Qwen3.8-Flash-Next, орієнтовану на «максимальну економічну ефективність»
Маттіас Бастіан
26 серпня 2026 року

Команда Qwen компанії Alibaba представляє Qwen3.8-Flash-Next — мультимодальну модель із сумішшю експертів, яка є демонстрацією архітектури Qwen4. Вона прагне зрівнятися з набагато більшими моделями, витрачаючи лише частину коштів на навчання.

Загалом модель має 125 мільярдів параметрів, але для кожного токена активує лише 6 мільярдів. Вона також містить 51 мільярд параметрів у новому шарі N-грамних вбудовувань — одній з архітектурних інновацій, запланованих для Qwen4. Цей шар зберігає поширені групи слів як окремі записи у своєрідному «словнику фраз» і може працювати у звичайній системній оперативній пам’яті, а не на GPU, за «відносно невеликих додаткових витрат».

Шар N-грамних вбудовувань (унизу, фіолетовий) передає інформацію на рівні фраз на початок мережі. На нього припадає 51 мільярд параметрів, але він працює у системній оперативній пам’яті, а не у пам’яті GPU. | Зображення: Alibaba / Qwen

Модель нативно підтримує контекстне вікно на 262 144 токени, а за допомогою YaRN його можна розширити до одного мільйона токенів. Технічний звіт доступний на GitHub, а ваги — на Hugging Face і ModelScope. Робоча версія постачається як Qwen3.8-Flash через QwenCloud за ціною $0,16 за мільйон вхідних токенів і $0,47 за мільйон вихідних токенів. За даними Qwen, API має запрацювати найближчим часом.

У дев’ять разів нижча вартість навчання, кращі результати

Qwen3.8-Flash-Next забезпечує кращі результати, ніж Qwen3.7-Plus, приблизно за одну дев’яту вартості навчання, за словами команди Qwen, причому найбільший прогрес спостерігається у програмуванні та офісних завданнях. Qwen3.7-Plus має 397 мільярдів параметрів, з яких для кожного токена активуються 17 мільярдів — майже втричі більше, ніж у Flash-Next.

Опубліковані Alibaba результати тестування порівнюють модель із DeepSeek-V4-Flash (284 мільярди параметрів, 13 мільярдів активованих) та Claude Opus 4.6 (Max) від Anthropic. Попри те, що обидві моделі значно більші або дорожчі, Flash-Next лідирує у більшості перевірених завдань.

Схоже, модель оптимізована для бенчмарків агентного програмування, у яких ШІ має самостійно знаходити й виправляти помилки у справжніх програмних проєктах. Flash-Next набрала 58,7 бала в DeepSWE та 62,5 бала в SWE-bench Pro, випередивши DeepSeek-V4-Flash і Claude Opus 4.6.

Розрив у завданнях для офісу та продуктивності ще більший. Flash-Next набрала 73,9 бала в CoWorkBench, тоді як DeepSeek-V4-Flash — лише 45,1. У JobBench, тесті професійних робочих процесів, Flash-Next отримала 55,7 бала — майже вдвічі більше, ніж Qwen3.7-Plus із результатом 27,6. У науковому міркуванні (GPQA Diamond: 91,7) та змагальному програмуванні (LiveCodeBench v6: 91,9) моделі показують близькі результати.

Бенчмарк Qwen3.8-Flash-Next Qwen3.8-27B Qwen3.7-Plus DeepSeek-V4-Flash-0731 Claude-Opus-4.6 (Max)
Параметри (загалом) 125B 27B 397B 284B --
Активовані параметри 6B 27B 17B 13B --
DeepSWE 1.1 58.7 42.2 16.5 54.4 --
SWE-bench Pro 62.5 61.7 55.8 56.0 53.4
SWE-bench Multilingual 81.0 73.8 75.8 -- 77.5
NL2Repo-Bench 48.1 42.3 41.1 54.2 47.6
CoWorkBench 73.9 70.7 65.1 45.1 68.2
JobBench 55.7 33.4 27.6 41.3 36.6
Останній іспит агентів (результат) 51.2 42.9 33.6 -- --
Toolathlon Verified (Pass@1) 73.5 67.1 50.6 70.3 --
IFBench 81.3 79.5 79.1 79.2 62.5
GPQA Diamond 91.7 89.2 90.3 90.8 91.3
HLE 35.9 30.8 34.7 33.8 40.0
LiveCodeBench v6 91.9 90.3 89.6 90.6 88.8

Claude Opus 4.6 випереджає конкурентів лише в Humanity's Last Exam — тесті, побудованому на надзвичайно складних міждисциплінарних завданнях, — але це також «старіша» модель Anthropic, випущена в лютому 2026 року. Як завжди, результати бенчмарків і продуктивність у реальних умовах можуть відрізнятися.

Ціни продовжують тиснути на конкурентів

На початку серпня Alibaba представила Qwen3.8-Max як свою актуальну флагманську модель, що конкурує з Claude Opus 4.8, Gemini 3.1 Pro та GPT5.6 Sol. Flash-Next працює трохи гірше за флагманську модель, але коштує приблизно в дванадцять разів дешевше: різниця в ціні для вхідних і вихідних токенів становить близько 12 разів.

Qwen3.8-Max Qwen3.8-Flash-Next
Вхідні (за 1 млн токенів) $2.00 0.16 USD
Вихідні (за 1 млн токенів) 6.00 USD 0.47 USD

Таке ціноутворення дедалі посилює тиск на OpenAI та Anthropic. Qwen3.8-27B також останнім часом користується популярністю, оскільки може працювати локально й забезпечує високу продуктивність майже без витрат, якщо у вас є відповідне обладнання. Нещодавно OpenAI відповіла значними знижками на свою нову лінійку моделей GPT-5.6. Для користувачів це добре, але для стрімкого зростання доходів, необхідного постачальникам ШІ для підтримки інвестиційного наративу, — погано.

Новини ШІ без хайпу — відібрані людьми

Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний квартальний звіт про передові розробки «AI Radar», повний доступ до архіву та доступ до розділу коментарів.

Джерело: Qwen

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням The Decoder

Читати оригінал на The Decoder ↗

Текст і зображення належать The Decoder і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини