Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Alibaba выпустила Qwen3.8-Flash-Next, нацеленную на «максимальную экономическую эффективность»

Alibaba выпускает Qwen3.8-Flash-Next, нацеленную на «максимальную экономическую эффективность»
Маттиас Бастиан
26 авг. 2026

Команда Qwen компании Alibaba представляет Qwen3.8-Flash-Next — мультимодальную модель со смесью экспертов, которая служит архитектурным прообразом Qwen4. Она призвана сравниться с гораздо более крупными моделями при значительно меньших затратах на обучение.

Всего модель содержит 125 миллиардов параметров, но для каждого токена активируются лишь 6 миллиардов. В нее также входит 51 миллиард параметров в новом слое N-граммовых эмбеддингов — одной из архитектурных инноваций, запланированных для Qwen4. Этот слой хранит распространенные группы слов как отдельные элементы в своего рода «словаре фраз» и может размещаться в обычной системной оперативной памяти, а не на GPU, при «относительно низких дополнительных затратах».

Слой N-граммовых эмбеддингов (внизу, фиолетовый) передает информацию на уровне фраз в начало сети. На него приходится 51 миллиард параметров, но он работает в системной памяти, а не в памяти GPU. | Изображение: Alibaba / Qwen

Модель изначально поддерживает контекстное окно размером 262 144 токена и может масштабироваться до одного миллиона токенов с использованием YaRN. Технический отчет опубликован на GitHub, а веса доступны на Hugging Face и ModelScope. Производственная версия предоставляется как Qwen3.8-Flash через QwenCloud по цене 0,16 доллара за миллион входных токенов и 0,47 доллара за миллион выходных токенов. По данным Qwen, API должен заработать в ближайшее время.

В девять раз дешевле в обучении и с лучшими результатами

По данным команды Qwen, Qwen3.8-Flash-Next показывает лучшие результаты, чем Qwen3.7-Plus, при затратах на обучение примерно в девять раз ниже; наиболее заметный прирост наблюдается в задачах программирования и офисной работы. Qwen3.7-Plus содержит 397 миллиардов параметров, из которых на каждый токен активируются 17 миллиардов — почти втрое больше, чем у Flash-Next.

В опубликованных Alibaba тестах модель сравнивается с DeepSeek-V4-Flash (284 миллиарда параметров, 13 миллиардов активных) и Claude Opus 4.6 (Max) от Anthropic. Несмотря на то что обе модели значительно крупнее или дороже, Flash-Next лидирует в большинстве протестированных задач.

Похоже, модель оптимизирована под бенчмарки агентного программирования, в которых ИИ должен самостоятельно находить и исправлять ошибки в реальных программных проектах. Flash-Next набрала 58,7 балла в DeepSWE и 62,5 в SWE-bench Pro, опередив DeepSeek-V4-Flash и Claude Opus 4.6.

Разрыв в задачах офисной работы и продуктивности еще больше. Flash-Next набрала 73,9 в CoWorkBench, тогда как DeepSeek-V4-Flash смогла набрать лишь 45,1. В JobBench — тесте профессиональных рабочих процессов — Flash-Next получила 55,7 балла, почти вдвое больше, чем Qwen3.7-Plus с результатом 27,6. В научном рассуждении (GPQA Diamond: 91,7) и соревновательном программировании (LiveCodeBench v6: 91,9) модели показали близкие результаты.

Бенчмарк Qwen3.8-Flash-Next Qwen3.8-27B Qwen3.7-Plus DeepSeek-V4-Flash-0731 Claude-Opus-4.6 (Max)
Параметры (всего) 125B 27B 397B 284B --
Активные параметры 6B 27B 17B 13B --
DeepSWE 1.1 58.7 42.2 16.5 54.4 --
SWE-bench Pro 62.5 61.7 55.8 56.0 53.4
SWE-bench Multilingual 81.0 73.8 75.8 -- 77.5
NL2Repo-Bench 48.1 42.3 41.1 54.2 47.6
CoWorkBench 73.9 70.7 65.1 45.1 68.2
JobBench 55.7 33.4 27.6 41.3 36.6
Agents' Last Exam (Score) 51.2 42.9 33.6 -- --
Toolathlon Verified (Pass@1) 73.5 67.1 50.6 70.3 --
IFBench 81.3 79.5 79.1 79.2 62.5
GPQA Diamond 91.7 89.2 90.3 90.8 91.3
HLE 35.9 30.8 34.7 33.8 40.0
LiveCodeBench v6 91.9 90.3 89.6 90.6 88.8

Claude Opus 4.6 опережает конкурентов только в Humanity's Last Exam — тесте, построенном на чрезвычайно сложных междисциплинарных задачах, — но это также «более старая» модель Anthropic, выпущенная в феврале 2026 года. Как всегда, результаты бенчмарков и эффективность в реальных условиях могут различаться.

Цены продолжают усиливать давление на конкурентов

В начале августа Alibaba представила Qwen3.8-Max в качестве своей текущей флагманской модели, составив конкуренцию Claude Opus 4.8, Gemini 3.1 Pro и GPT5.6 Sol. Flash-Next показывает результаты чуть ниже флагманской модели, но стоит примерно в двенадцать раз дешевле: разница в цене как для входных, так и для выходных токенов составляет около 12 раз.

Qwen3.8-Max Qwen3.8-Flash-Next
Ввод (за 1 млн токенов) $2.00 0.16 USD
Вывод (за 1 млн токенов) 6.00 USD 0.47 USD

Такая ценовая политика продолжает усиливать давление на OpenAI и Anthropic. Qwen3.8-27B также в последнее время пользуется популярностью, поскольку может работать локально и обеспечивает высокую производительность практически бесплатно — при наличии подходящего оборудования. Недавно OpenAI ответила значительными скидками на новую линейку моделей GPT-5.6. Для пользователей это хорошо, но плохо для стремительного роста выручки, необходимого поставщикам ИИ, чтобы поддерживать инвестиционный нарратив.

Новости ИИ без шумихи — отобраны людьми

Подпишитесь на THE DECODER и получите чтение без рекламы, еженедельную рассылку об ИИ, наш эксклюзивный шесть раз в год публикуемый отчет о передовых разработках «AI Radar», полный доступ к архиву и доступ к разделу комментариев.

Источник: Qwen

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости