Alibaba представи Qwen3.8-Flash-Next с цел „максимална икономическа ефективност“
Екипът на Qwen на Alibaba представя Qwen3.8-Flash-Next — мултимодален модел от смесени експерти, който служи като архитектурен преглед на Qwen4. Целта му е да се сравнява с много по-големи модели на малка част от разходите за обучение.
Моделът разполага с общо 125 милиарда параметъра, но активира само 6 милиарда на токен. Той включва и 51 милиарда параметъра в нов слой за N-грамови вграждания — една от архитектурните иновации, планирани за Qwen4. Този слой съхранява често срещани групи от думи като самостоятелни записи в своеобразен „речник на фразите“ и може да се намира в обикновената системна RAM памет, а не в графичния процесор, при „сравнително ниски допълнителни разходи“.

Моделът поддържа нативно контекстен прозорец от 262 144 токена и може да се мащабира до един милион токена чрез YaRN. Техническият доклад е публикуван в GitHub, а теглата са налични в Hugging Face и ModelScope. Производствената версия се предлага като Qwen3.8-Flash чрез QwenCloud на цена от 0,16 долара за милион входни токени и 0,47 долара за милион изходни токени. Според Qwen API ще заработи скоро.
Една девета от разходите за обучение, по-добри резултати
Qwen3.8-Flash-Next постига по-добри резултати от Qwen3.7-Plus при приблизително една девета от разходите за обучение, според екипа на Qwen, като най-големите подобрения са в програмирането и офис задачите. Qwen3.7-Plus има 397 милиарда параметъра, от които 17 милиарда се активират на токен — почти три пъти повече от активния брой при Flash-Next.
Публикуваните от Alibaba бенчмаркове сравняват модела с DeepSeek-V4-Flash (284 милиарда параметъра, 13 милиарда активирани) и Claude Opus 4.6 (Max) на Anthropic. Въпреки че и двата модела са много по-големи или по-скъпи, Flash-Next води в повечето тествани задачи.
Моделът изглежда оптимизиран за бенчмаркове за агентно програмиране, които изискват от изкуствения интелект самостоятелно да открива и поправя грешки в реални софтуерни проекти. Flash-Next получи 58,7 на DeepSWE и 62,5 на SWE-bench Pro, изпреварвайки както DeepSeek-V4-Flash, така и Claude Opus 4.6.
Разликата при офис задачите и задачите за продуктивност е още по-голяма. Flash-Next постигна 73,9 на CoWorkBench, докато DeepSeek-V4-Flash успя да достигне едва 45,1. На JobBench — тест за професионални работни процеси — Flash-Next получи 55,7, почти двойно повече от Qwen3.7-Plus с 27,6. При научното разсъждение (GPQA Diamond: 91,7) и състезателното програмиране (LiveCodeBench v6: 91,9) моделите са близки по резултати.
| Бенчмарк | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek-V4-Flash-0731 | Claude-Opus-4.6 (Max) |
|---|---|---|---|---|---|
| Параметри (общо) | 125B | 27B | 397B | 284B | -- |
| Активирани параметри | 6B | 27B | 17B | 13B | -- |
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Agents' Last Exam (Score) | 51.2 | 42.9 | 33.6 | -- | -- |
| Toolathlon Verified (Pass@1) | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Claude Opus 4.6 излиза напред само на Humanity's Last Exam — тест, изграден около изключително трудни мултидисциплинарни задачи, но това е и „по-стар“ модел на Anthropic от февруари 2026 г. Както винаги, резултатите от бенчмаркове и представянето в реалния свят могат да се различават.
Цената продължава да оказва натиск върху конкурентите
Alibaba представи Qwen3.8-Max като своя настоящ водещ модел едва в началото на август, конкурирайки се с модели като Claude Opus 4.8, Gemini 3.1 Pro и GPT5.6 Sol. Flash-Next се представя малко по-слабо от водещия модел, но струва около една дванадесета от неговата цена, с приблизително 12-кратна разлика в цената както на входните, така и на изходните токени.
| Qwen3.8-Max | Qwen3.8-Flash-Next | |
|---|---|---|
| Вход (за 1 млн. токена) | $2.00 | 0.16 USD |
| Изход (за 1 млн. токена) | 6.00 USD | 0.47 USD |
Този тип ценообразуване продължава да засилва натиска върху OpenAI и Anthropic. Qwen3.8-27B също се радва на популярност напоследък, тъй като може да работи локално и предлага силно представяне на почти никаква цена, ако разполагате с необходимия хардуер. Наскоро OpenAI отговори с големи отстъпки за новата си линия модели GPT-5.6. Това е добре за потребителите, но е лошо за бързия ръст на приходите, от който доставчиците на AI услуги се нуждаят, за да поддържат инвестиционната си история.
AI новини без сензации – подбрани от хора
Абонирайте се за THE DECODER за четене без реклами, седмичен AI бюлетин, нашия ексклузивен шест пъти годишно доклад за водещите модели „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.