Mistral AI выпустила Mistral Large 4 (Le Chonk): мультимодальная MoE-модель с 1,05 трлн параметров
Mistral AI только что объявила о выпуске Mistral Large 4 (ML4), внутри компании получившей прозвище Le Chonk, в виде общедоступной предварительной версии. ML4 — это разреженная модель смеси экспертов с общим числом параметров 1,05 трлн, 49 млрд активных параметров на токен, зрительным энкодером на 1,6 млрд параметров и контекстным окном в 1 млн токенов, согласно документации модели. Она обучалась с нуля на 3 800 графических процессорах NVIDIA Grace Blackwell в собственных европейских дата-центрах Mistral.
Кратко
Mistral AI выпустила Mistral Large 4 («Le Chonk») в виде общедоступной предварительной версии 6 октября 2026 года: это разреженная MoE-модель с 1,05 трлн параметров, 49 млрд активных параметров на токен, нативным вводом изображений и контекстным окном в 1 млн токенов, обученная с нуля на 3 800 графических процессорах NVIDIA Grace Blackwell в собственных дата-центрах Mistral в ЕС. API уже доступен по цене 1,36 доллара за 1 млн входных токенов и 4,18 доллара за 1 млн выходных токенов, однако веса будут выпущены только в конце октября, поэтому самостоятельное размещение пока невозможно. Наиболее выдающиеся результаты модель показывает в сфере кибербезопасности: Mistral сообщает о результатах 93% на Cybench и 82% на CyberGym-E2E и отмечает, что несколько закрытых передовых моделей набирают почти нулевые баллы, поскольку отказываются выполнять задачу.
Какова архитектура?
ML4 — это гибридная MoE-модель для выполнения инструкций и рассуждений, которая нативно принимает изображения на вход. На каждый токен активируется лишь около 4,7% весов, благодаря чему модель класса 1 трлн параметров можно предоставлять по цене среднего уровня. Все 1,05 трлн параметров по-прежнему должны находиться в памяти, поэтому количество активных параметров определяет вычислительную нагрузку, а не стоимость вашего оборудования.
Mistral пока не опубликовала количество экспертов, стратегию маршрутизации top-k или структуру слоёв; эти сведения появятся вместе с весами. Данные для обучения охватывали более 160 языков, включая все официальные языки ЕС.
Интерактивное объяснение
Каковы результаты?
В сфере кибербезопасности Mistral сообщает о результате 93% на Cybench и 82% на CyberGym-E2E, что помещает ML4 в глобальную пятёрку лучших по индексу кибербезопасности Artificial Analysis. Более интересным является структурное утверждение: Mistral заявляет, что несколько закрытых передовых моделей набирают почти нулевые баллы на CyberGym-E2E, поскольку полностью отказываются выполнять задачу. Воспроизведение уязвимости для подтверждения её реальности — стандартная работа в сфере защиты, а отказы на уровне провайдера блокируют её выполнение.
В сфере агентного программирования Mistral сообщает о результатах 61,7% на DeepSWE v1.1, 59,4% на SWE-Atlas-QnA и 28,3% на Terminal-Bench 4.0; совокупный результат в индексе агентов-программистов Artificial Analysis составляет 49,8%. Mistral отмечает, что эти показатели оценивались в частном порядке до публикации тестового комплекса, поэтому пока не могут быть независимо воспроизведены.
Более честным показателем является слепая оценка людьми, проведённая совместно с Surge AI. Профессиональные аннотаторы оценили ML4 Preview на 3,74 балла из 5 — второе место среди 5 моделей, впереди GLM-5.3 (3,60) и Kimi K3 (3,59), но позади Claude Opus 5 с результатом 4,22.
В плане безопасности ML4 отражает 93,3% атак в тесте B3 от Lakera и набирает 1,691 из максимально возможных 2,0 балла в KORABench.
Как она сравнивается с ближайшими конкурентами с открытыми весами?
| Характеристика | Mistral Large 4 | DeepSeek V4 Pro | Kimi K3 | GLM-5.3 |
|---|---|---|---|---|
| Общее число параметров | 1,05 трлн | 1,6 трлн | 2,8 трлн | Официально не опубликовано |
| Активных на токен | 49 млрд | 49 млрд | ~104 млрд | Официально не опубликовано |
| Контекстное окно | 1 млн | 1 млн | 1 млн | 1 млн |
| Нативный ввод изображений | Да | Нет | Да | Нет |
| Доступность весов | Пока нет, ожидаются к концу октября 2026 года | Да, на Hugging Face | Да, с 27 июля 2026 года | Да, согласно Artificial Analysis |
| Лицензия | Пока не объявлена | MIT | Изменённая MIT | Лицензия GLM-5.3 |
| Цена API за 1 млн входных/выходных токенов | 1,36 / 4,18 доллара | Зависит от провайдера | 3,00 / 15,00 долларов | 1,40 / 4,40 доллара |
| Дата выпуска | 6 октября 2026 года | Август 2026 года (сборка 0813) | 16 июля 2026 года | 14 августа 2026 года |
Что можно создать с её помощью уже сегодня?
Предварительная версия API поддерживает вызов функций, структурированные выходные данные, ответы на вопросы по документам, пакетную обработку, а также конечные точки Agents и Conversations. Кэшированный ввод стоит 0,14 доллара за 1 млн токенов, что существенно меняет экономику агентских циклов с длинным контекстом при окне в 1 млн токенов.
Основные выводы
- 1,05 трлн параметров всего, 49 млрд активных на токен, контекст в 1 млн токенов, зрительный энкодер на 1,6 млрд параметров.
- Обучена на 3 800 графических процессорах Grace Blackwell в собственных дата-центрах Mistral в ЕС.
- Предварительная версия API уже доступна по цене 1,36 доллара за 1 млн входных и 4,18 доллара за 1 млн выходных токенов.
- Веса обещаны к концу октября 2026 года, поэтому самостоятельное размещение пока невозможно.
- Наиболее сильные результаты — в сфере кибербезопасности, где закрытые модели часто отказываются выполнять задачу.
Ознакомьтесь с объявлением Mistral Large 4, документацией по модели Mistral Large 4 и сравнениями моделей Artificial Analysis. Все заслуги принадлежат исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Постойте! Вы пользуетесь Telegram? теперь к нам можно присоединиться и в Telegram.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.