Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Alibaba представи Qwen3.8-Flash-Next с цел „максимална икономическа ефективност“

Alibaba пускает Qwen3.8-Flash-Next, насочен към „максимална разходна ефективност“
Matthias Bastian
26 авг. 2026 г.

Екипът на Qwen на Alibaba представя Qwen3.8-Flash-Next — мултимодален модел от смесени експерти, който служи като архитектурен преглед на Qwen4. Целта му е да се сравнява с много по-големи модели на малка част от разходите за обучение.

Моделът разполага с общо 125 милиарда параметъра, но активира само 6 милиарда на токен. Той включва и 51 милиарда параметъра в нов слой за N-грамови вграждания — една от архитектурните иновации, планирани за Qwen4. Този слой съхранява често срещани групи от думи като самостоятелни записи в своеобразен „речник на фразите“ и може да се намира в обикновената системна RAM памет, а не в графичния процесор, при „сравнително ниски допълнителни разходи“.

Слоят за N-грамови вграждания (долу, в лилаво) подава информация на ниво фрази към началото на мрежата. Той отговаря за 51 милиарда параметъра, но работи в системната RAM памет вместо в паметта на графичния процесор. | Изображение: Alibaba / Qwen

Моделът поддържа нативно контекстен прозорец от 262 144 токена и може да се мащабира до един милион токена чрез YaRN. Техническият доклад е публикуван в GitHub, а теглата са налични в Hugging Face и ModelScope. Производствената версия се предлага като Qwen3.8-Flash чрез QwenCloud на цена от 0,16 долара за милион входни токени и 0,47 долара за милион изходни токени. Според Qwen API ще заработи скоро.

Една девета от разходите за обучение, по-добри резултати

Qwen3.8-Flash-Next постига по-добри резултати от Qwen3.7-Plus при приблизително една девета от разходите за обучение, според екипа на Qwen, като най-големите подобрения са в програмирането и офис задачите. Qwen3.7-Plus има 397 милиарда параметъра, от които 17 милиарда се активират на токен — почти три пъти повече от активния брой при Flash-Next.

Публикуваните от Alibaba бенчмаркове сравняват модела с DeepSeek-V4-Flash (284 милиарда параметъра, 13 милиарда активирани) и Claude Opus 4.6 (Max) на Anthropic. Въпреки че и двата модела са много по-големи или по-скъпи, Flash-Next води в повечето тествани задачи.

Моделът изглежда оптимизиран за бенчмаркове за агентно програмиране, които изискват от изкуствения интелект самостоятелно да открива и поправя грешки в реални софтуерни проекти. Flash-Next получи 58,7 на DeepSWE и 62,5 на SWE-bench Pro, изпреварвайки както DeepSeek-V4-Flash, така и Claude Opus 4.6.

Разликата при офис задачите и задачите за продуктивност е още по-голяма. Flash-Next постигна 73,9 на CoWorkBench, докато DeepSeek-V4-Flash успя да достигне едва 45,1. На JobBench — тест за професионални работни процеси — Flash-Next получи 55,7, почти двойно повече от Qwen3.7-Plus с 27,6. При научното разсъждение (GPQA Diamond: 91,7) и състезателното програмиране (LiveCodeBench v6: 91,9) моделите са близки по резултати.

Бенчмарк Qwen3.8-Flash-Next Qwen3.8-27B Qwen3.7-Plus DeepSeek-V4-Flash-0731 Claude-Opus-4.6 (Max)
Параметри (общо) 125B 27B 397B 284B --
Активирани параметри 6B 27B 17B 13B --
DeepSWE 1.1 58.7 42.2 16.5 54.4 --
SWE-bench Pro 62.5 61.7 55.8 56.0 53.4
SWE-bench Multilingual 81.0 73.8 75.8 -- 77.5
NL2Repo-Bench 48.1 42.3 41.1 54.2 47.6
CoWorkBench 73.9 70.7 65.1 45.1 68.2
JobBench 55.7 33.4 27.6 41.3 36.6
Agents' Last Exam (Score) 51.2 42.9 33.6 -- --
Toolathlon Verified (Pass@1) 73.5 67.1 50.6 70.3 --
IFBench 81.3 79.5 79.1 79.2 62.5
GPQA Diamond 91.7 89.2 90.3 90.8 91.3
HLE 35.9 30.8 34.7 33.8 40.0
LiveCodeBench v6 91.9 90.3 89.6 90.6 88.8

Claude Opus 4.6 излиза напред само на Humanity's Last Exam — тест, изграден около изключително трудни мултидисциплинарни задачи, но това е и „по-стар“ модел на Anthropic от февруари 2026 г. Както винаги, резултатите от бенчмаркове и представянето в реалния свят могат да се различават.

Цената продължава да оказва натиск върху конкурентите

Alibaba представи Qwen3.8-Max като своя настоящ водещ модел едва в началото на август, конкурирайки се с модели като Claude Opus 4.8, Gemini 3.1 Pro и GPT5.6 Sol. Flash-Next се представя малко по-слабо от водещия модел, но струва около една дванадесета от неговата цена, с приблизително 12-кратна разлика в цената както на входните, така и на изходните токени.

Qwen3.8-Max Qwen3.8-Flash-Next
Вход (за 1 млн. токена) $2.00 0.16 USD
Изход (за 1 млн. токена) 6.00 USD 0.47 USD

Този тип ценообразуване продължава да засилва натиска върху OpenAI и Anthropic. Qwen3.8-27B също се радва на популярност напоследък, тъй като може да работи локално и предлага силно представяне на почти никаква цена, ако разполагате с необходимия хардуер. Наскоро OpenAI отговори с големи отстъпки за новата си линия модели GPT-5.6. Това е добре за потребителите, но е лошо за бързия ръст на приходите, от който доставчиците на AI услуги се нуждаят, за да поддържат инвестиционната си история.

AI новини без сензации – подбрани от хора

Абонирайте се за THE DECODER за четене без реклами, седмичен AI бюлетин, нашия ексклузивен шест пъти годишно доклад за водещите модели „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.

Източник: Qwen

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини