Mistral AI представила Mistral Large 4 (Le Chonk): мультимодальну MoE-модель із 1,05 трлн параметрів
Mistral AI щойно оголосила про випуск Mistral Large 4 (ML4), внутрішнє кодове ім’я якого — Le Chonk, у форматі публічної попередньої версії. ML4 — це гранулярна модель Mixture of Experts із загальною кількістю 1,05 трильйона параметрів, 49 мільярдами активних параметрів на токен, візуальним енкодером на 1,6 мільярда параметрів і контекстним вікном на 1 мільйон токенів, згідно з документацією моделі. Її навчали з нуля на 3 800 графічних процесорах NVIDIA Grace Blackwell у власних європейських дата-центрах Mistral.
Коротко
Mistral AI випустила Mistral Large 4 («Le Chonk») у форматі публічної попередньої версії 6 жовтня 2026 року: гранулярна MoE-модель із 1,05 трильйона параметрів, 49 мільярдами активних параметрів на токен, нативним введенням зображень і контекстним вікном на 1 мільйон токенів, навчена з нуля на 3 800 графічних процесорах NVIDIA Grace Blackwell у власних дата-центрах Mistral у ЄС. API вже доступний за ціною 1,36 долара за 1 мільйон вхідних і 4,18 долара за 1 мільйон вихідних токенів, але ваги будуть опубліковані лише наприкінці жовтня, тож самостійне розгортання поки неможливе. Найкращі результати модель демонструє у сфері кібербезпеки: Mistral повідомляє про 93% у Cybench і 82% у CyberGym-E2E та зазначає, що кілька закритих передових моделей набирають майже нуль балів, оскільки відмовляються виконувати завдання.
Яка архітектура?
ML4 — це гібридна MoE-модель для виконання інструкцій і міркувань, яка нативно приймає зображення. На кожен токен активується лише близько 4,7% ваг, завдяки чому модель класу 1 трильйон параметрів можна обслуговувати за ціною середнього сегмента. Усі 1,05 трильйона параметрів усе одно мають зберігатися в пам’яті, тому кількість активних параметрів визначає обчислювальне навантаження, а не витрати на ваше обладнання.
Mistral поки не опублікувала кількість експертів, параметр top-k маршрутизації чи структуру шарів; ці дані з’являться разом із вагами. Дані для навчання охоплювали понад 160 мов, зокрема всі офіційні мови ЄС.
Інтерактивне пояснення
Як вона працює?
У сфері кібербезпеки Mistral повідомляє про результат 93% у Cybench і 82% у CyberGym-E2E, що виводить ML4 до глобальної п’ятірки в індексі кібербезпеки Artificial Analysis. Цікавішим є структурне твердження: Mistral заявляє, що кілька передових закритих моделей набирають майже нуль балів у CyberGym-E2E, оскільки категорично відмовляються виконувати завдання. Відтворення вразливості, щоб довести її реальність, є стандартною захисною практикою, а відмови на рівні провайдера блокують її.
У сфері агентного програмування Mistral повідомляє про 61,7% у DeepSWE v1.1, 59,4% у SWE-Atlas-QnA і 28,3% у Terminal-Bench 4.0, що дає сукупний показник 49,8% в індексі агентів програмування Artificial Analysis. Mistral зазначає, що ці оцінювання проводилися приватно до відкриття тестового середовища, тому їх поки неможливо незалежно відтворити.
Сліпе оцінювання людьми, проведене спільно із Surge AI, є більш чесним показником. Професійні оцінювачі поставили ML4 Preview 3,74 бала з 5 — друге місце серед 5 моделей, попереду GLM-5.3 (3,60) і Kimi K3 (3,59), але позаду Claude Opus 5 із результатом 4,22.
Щодо безпеки, ML4 протистоїть 93,3% атак у тесті B3 від Lakera і набирає 1,691 бала з максимальних 2,0 у KORABench.
Як вона порівнюється з найближчими конкурентами з відкритими вагами?
| Характеристика | Mistral Large 4 | DeepSeek V4 Pro | Kimi K3 | GLM-5.3 |
|---|---|---|---|---|
| Загальна кількість параметрів | 1,05T | 1,6T | 2,8T | Офіційно не опубліковано |
| Активних на токен | 49B | 49B | ~104B | Офіційно не опубліковано |
| Контекстне вікно | 1M | 1M | 1M | 1M |
| Нативне введення зображень | Так | Ні | Так | Ні |
| Доступність ваг | Ще ні, очікуються до кінця жовтня 2026 року | Так, на Hugging Face | Так, із 27 липня 2026 року | Так, за даними Artificial Analysis |
| Ліцензія | Ще не оголошено | MIT | Modified MIT | Ліцензія GLM-5.3 |
| Ціна API за 1M вхідних/вихідних токенів | $1.36 / $4.18 | Залежить від провайдера | $3.00 / $15.00 | $1.40 / $4.40 |
| Випуск | 6 жовтня 2026 року | Серпень 2026 року (збірка 0813) | 16 липня 2026 року | 14 серпня 2026 року |
Що можна створити з нею вже сьогодні?
API попередньої версії підтримує виклик функцій, структуровані результати, відповіді на запитання за документами, пакетну обробку, а також кінцеві точки Agents і Conversations. Кешований ввід коштує 0,14 долара за 1 мільйон токенів, що суттєво змінює економіку агентних циклів із довгим контекстом у вікні на 1 мільйон токенів.
Основні висновки
- 1,05T загальних параметрів, 49B активних на токен, контекст на 1M, візуальний енкодер на 1,6B параметрів.
- Навчена на 3 800 графічних процесорах Grace Blackwell у власних дата-центрах Mistral у ЄС.
- API попередньої версії вже доступний за ціною 1,36 долара за 1 мільйон вхідних і 4,18 долара за 1 мільйон вихідних токенів.
- Ваги обіцяють опублікувати до кінця жовтня 2026 року, тож самостійне розгортання поки неможливе.
- Найкращі результати — у кібербезпеці, де закриті моделі часто відмовляються виконувати завдання.
Ознайомтеся з анонсом Mistral Large 4, документацією моделі Mistral Large 4 і порівняннями моделей Artificial Analysis. Уся подяка належить досліднику цього проєкту. Також не соромтеся підписатися на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання зі 150 тисячами підписників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.