SpaceXAI выпустила Grok 4.6: передовую модель с контекстом 500K, оптимизированную для длительно работающих агентов, кодинга и интеллектуальной работы
SpaceXAI только что выпустила Grok 4.6. Релиз представляет собой обновление этапа постобучения по сравнению с Grok 4.5, а не более крупную базовую модель. SpaceXAI сохранила основу неизменной и направила улучшения на более длительный дополнительный этап обучения, повторно сгенерированные траектории обучения с учителем и обучение с подкреплением в агентных средах. Агенты, которые сохраняют фокус на задаче на протяжении множества шагов и не отклоняются от неё. Grok 4.6 набирает 61 балл в Artificial Analysis Intelligence Index — на пять баллов больше, чем Grok 4.5, и столько же, сколько GPT-5.6 Sol Max. Модель поддерживает контекст объёмом 500 000 токенов, уже доступна в Cursor и Grok Build, а также добавляет новый уровень усилий при рассуждении xhigh, расположенный выше уровней, с которыми поставлялась Grok 4.5.
Готова ли она к развёртыванию?
Да, в продакшене, для ограниченного набора задач. Модель в целом доступна через API xAI под именем grok-4.6, является моделью по умолчанию в Grok Build, поставляется в Cursor на всех тарифах и доступна для маршрутизации через OpenRouter, Vercel и Cloudflare. Версии с открытыми весами и возможности самостоятельного хостинга нет, поэтому развёртывание в изолированных средах исключено.
- Этап развития компании: Команды на посевной стадии и независимые разработчики могут внедрить её немедленно, поскольку Cursor и Grok Build не требуют работы над инфраструктурой. Наиболее подходящим вариантом являются инженерные организации среднего бизнеса: документированы интеграция только через API, аутентификация mTLS, пакетная обработка и приоритетная обработка. Регулируемым предприятиям следует сначала провести пилотный проект — история бренда поставщика является актуальным вопросом при закупках в ряде комитетов.
- Отрасли: разработка программного обеспечения и инструменты для разработчиков, проектирование полупроводников и ядер операционных систем, разработка аппаратного обеспечения и дизайн, смежный с CAD, финансовые исследования и юридический анализ. В обучающей выборке явно делался акцент на нескольких из этих направлений.
- Применения: рефакторинг репозиториев целиком, агенты для миграции, конвейеры исследований и синтеза на корпусах объёмом 500 тыс. токенов, создание первого варианта приложения на основе описания продукта, оптимизация ядер GPU и работа со знаниями на основе большого количества документов.
Что именно изменилось
Grok 4.6 не является более крупной базовой моделью. SpaceXAI описывает более длительный дополнительный этап обучения по сравнению с тем, который прошла Grok 4.5, с использованием отобранных данных, сгенерированных моделями, для рассуждений и продвинутых технических концепций, высококачественных инженерных данных, а также улучшенного оптимизатора и схемы обучения.
Затем Grok 4.5 использовали для повторной генерации траекторий обучения с учителем на разных уровнях усилий при рассуждении, в агентных средах и предметных областях, охватывающих STEM, разработку программного обеспечения и интеллектуальную работу; проблемные трассировки отфильтровывались с помощью проверок на основе моделей. После этого проводилось обучение с подкреплением в агентных средах, охватывающих интеллектуальную работу, общее программирование, веб-разработку, автоматизированное проектирование и оптимизацию ядер.
Важный вывод о поведении модели заключается в следующем: на более длинных траекториях SpaceXAI отмечает больше самопроверок и верификации — модель проверяет собственную работу, прежде чем двигаться дальше. Это наблюдение поставщика, сделанное в ходе внутреннего тестирования, а не результат независимого измерения.
Модель поддерживает контекст объёмом 500 000 токенов, принимает текстовые и графические данные на входе и выдаёт только текст, не имеет заявленного ограничения на объём текстового вывода и использует срез знаний по состоянию на 1 февраля 2026 года. Параметр reasoning_effort теперь поддерживает значения low, medium, high (по умолчанию) и новый уровень xhigh. SpaceXAI не раскрыла количество параметров Grok 4.6.
Бенчмарки: сначала изучите результаты, где модель уступает
В таблице запуска xAI Grok 4.6 (High) набирает 61 балл в Artificial Analysis Intelligence Index — против 56 у Grok 4.5 и столько же, сколько GPT-5.6 Sol Max. Она возглавляет таблицу в GDPval-AA v2 (1753 Elo против 1526 у Grok 4.5), AA-Briefcase (1577 против 1313) и Harvey LAB.
Однако в результатах по программированию, наиболее важных для инженерных команд, она уступает. В DeepSWE v1.1 результат составляет 65,9% — на 11,9 процентного пункта больше по сравнению с предыдущим поколением, но ниже, чем 73% у GPT-5.6 Sol Max. В Terminal-Bench v3.0 достигнуто 26% — почти вдвое больше, чем 15,7% у Grok 4.5, но это по-прежнему последний результат среди четырёх представленных моделей. В CursorBench v3.2 результат составляет 69,9%, в FrontierCode v1.1 Extended — 61,3%, а в APEX-Agents — 57,5%.
При оценке следует отметить два момента. Во-первых, выделенные в таблице победы в GDPval-AA v2 и AA-Briefcase находятся внутри опубликованных компанией Artificial Analysis доверительных интервалов — это статистические ничьи, а не лидерство. Во-вторых, в наборе сравнения отсутствует Claude Opus 5 от Anthropic, которая в настоящее время возглавляет этот индекс. Раскрытые результаты, в которых модель уступает, являются более надёжным сигналом.
Цены и доступ
Согласно примечаниям к релизу, Grok 4.6 стоит $2 / $0,50 / $6 за 1 млн токенов (ввод / кэшированный ввод / вывод) при количестве входных токенов запроса менее 200 тыс., и $4 / $1 / $12 выше этого порога. На странице запуска также упоминается более быстрая версия по двойной цене, однако отдельный идентификатор модели не опубликован. В течение первой недели Grok Build и Cursor предлагают вдвое больший включённый объём использования.
Командам следует задавать prompt_cache_key (или заголовок x-grok-conv-id при использовании Chat Completions). Без этого запросы распределяются между серверами, а попадания в кэш становятся ненадёжными, поэтому применяется полная стоимость входных данных.
Интерактивное объяснение
Основные выводы
- Grok 4.6 — это обновление этапа постобучения Grok 4.5, а не более крупная базовая модель.
- Контекст объёмом 500 тыс. токенов, ввод текста и изображений, а также новый уровень усилий при рассуждении
xhigh. - Делит с GPT-5.6 Sol Max первое место с результатом 61 балл в AA Intelligence Index, но уступает в DeepSWE и Terminal-Bench.
- Та же заявленная цена $2 / $6, при этом тарифы удваиваются для запросов с более чем 200 тыс. входных токенов.
- Доступна уже сегодня через API, Cursor и Grok Build — открытых весов и самостоятельного хостинга нет.
Ознакомьтесь с ПОЛНЫМИ ТЕХНИЧЕСКИМИ ПОДРОБНОСТЯМИ здесь. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту ML с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.