Alibaba выпустила Qwen3.8-Flash-Next, нацеленную на «максимальную экономическую эффективность»
Команда Qwen компании Alibaba представляет Qwen3.8-Flash-Next — мультимодальную модель со смесью экспертов, которая служит архитектурным прообразом Qwen4. Она призвана сравниться с гораздо более крупными моделями при значительно меньших затратах на обучение.
Всего модель содержит 125 миллиардов параметров, но для каждого токена активируются лишь 6 миллиардов. В нее также входит 51 миллиард параметров в новом слое N-граммовых эмбеддингов — одной из архитектурных инноваций, запланированных для Qwen4. Этот слой хранит распространенные группы слов как отдельные элементы в своего рода «словаре фраз» и может размещаться в обычной системной оперативной памяти, а не на GPU, при «относительно низких дополнительных затратах».

Модель изначально поддерживает контекстное окно размером 262 144 токена и может масштабироваться до одного миллиона токенов с использованием YaRN. Технический отчет опубликован на GitHub, а веса доступны на Hugging Face и ModelScope. Производственная версия предоставляется как Qwen3.8-Flash через QwenCloud по цене 0,16 доллара за миллион входных токенов и 0,47 доллара за миллион выходных токенов. По данным Qwen, API должен заработать в ближайшее время.
В девять раз дешевле в обучении и с лучшими результатами
По данным команды Qwen, Qwen3.8-Flash-Next показывает лучшие результаты, чем Qwen3.7-Plus, при затратах на обучение примерно в девять раз ниже; наиболее заметный прирост наблюдается в задачах программирования и офисной работы. Qwen3.7-Plus содержит 397 миллиардов параметров, из которых на каждый токен активируются 17 миллиардов — почти втрое больше, чем у Flash-Next.
В опубликованных Alibaba тестах модель сравнивается с DeepSeek-V4-Flash (284 миллиарда параметров, 13 миллиардов активных) и Claude Opus 4.6 (Max) от Anthropic. Несмотря на то что обе модели значительно крупнее или дороже, Flash-Next лидирует в большинстве протестированных задач.
Похоже, модель оптимизирована под бенчмарки агентного программирования, в которых ИИ должен самостоятельно находить и исправлять ошибки в реальных программных проектах. Flash-Next набрала 58,7 балла в DeepSWE и 62,5 в SWE-bench Pro, опередив DeepSeek-V4-Flash и Claude Opus 4.6.
Разрыв в задачах офисной работы и продуктивности еще больше. Flash-Next набрала 73,9 в CoWorkBench, тогда как DeepSeek-V4-Flash смогла набрать лишь 45,1. В JobBench — тесте профессиональных рабочих процессов — Flash-Next получила 55,7 балла, почти вдвое больше, чем Qwen3.7-Plus с результатом 27,6. В научном рассуждении (GPQA Diamond: 91,7) и соревновательном программировании (LiveCodeBench v6: 91,9) модели показали близкие результаты.
| Бенчмарк | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek-V4-Flash-0731 | Claude-Opus-4.6 (Max) |
|---|---|---|---|---|---|
| Параметры (всего) | 125B | 27B | 397B | 284B | -- |
| Активные параметры | 6B | 27B | 17B | 13B | -- |
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Agents' Last Exam (Score) | 51.2 | 42.9 | 33.6 | -- | -- |
| Toolathlon Verified (Pass@1) | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Claude Opus 4.6 опережает конкурентов только в Humanity's Last Exam — тесте, построенном на чрезвычайно сложных междисциплинарных задачах, — но это также «более старая» модель Anthropic, выпущенная в феврале 2026 года. Как всегда, результаты бенчмарков и эффективность в реальных условиях могут различаться.
Цены продолжают усиливать давление на конкурентов
В начале августа Alibaba представила Qwen3.8-Max в качестве своей текущей флагманской модели, составив конкуренцию Claude Opus 4.8, Gemini 3.1 Pro и GPT5.6 Sol. Flash-Next показывает результаты чуть ниже флагманской модели, но стоит примерно в двенадцать раз дешевле: разница в цене как для входных, так и для выходных токенов составляет около 12 раз.
| Qwen3.8-Max | Qwen3.8-Flash-Next | |
|---|---|---|
| Ввод (за 1 млн токенов) | $2.00 | 0.16 USD |
| Вывод (за 1 млн токенов) | 6.00 USD | 0.47 USD |
Такая ценовая политика продолжает усиливать давление на OpenAI и Anthropic. Qwen3.8-27B также в последнее время пользуется популярностью, поскольку может работать локально и обеспечивает высокую производительность практически бесплатно — при наличии подходящего оборудования. Недавно OpenAI ответила значительными скидками на новую линейку моделей GPT-5.6. Для пользователей это хорошо, но плохо для стремительного роста выручки, необходимого поставщикам ИИ, чтобы поддерживать инвестиционный нарратив.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER и получите чтение без рекламы, еженедельную рассылку об ИИ, наш эксклюзивный шесть раз в год публикуемый отчет о передовых разработках «AI Radar», полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.