Sakhanda Wire
NVDA $224.09 +3.03% MSFT $492.43 -2.26% GOOGL $343.54 -0.08% META $578.85 -3.38% AMZN $267.28 -1.83%
← К новостям

SpaceXAI выпустила Grok 4.6: передовую модель с контекстом 500K, оптимизированную для длительно работающих агентов, кодинга и интеллектуальной работы

SpaceXAI только что выпустила Grok 4.6. Релиз представляет собой обновление этапа постобучения по сравнению с Grok 4.5, а не более крупную базовую модель. SpaceXAI сохранила основу неизменной и направила улучшения на более длительный дополнительный этап обучения, повторно сгенерированные траектории обучения с учителем и обучение с подкреплением в агентных средах. Агенты, которые сохраняют фокус на задаче на протяжении множества шагов и не отклоняются от неё. Grok 4.6 набирает 61 балл в Artificial Analysis Intelligence Index — на пять баллов больше, чем Grok 4.5, и столько же, сколько GPT-5.6 Sol Max. Модель поддерживает контекст объёмом 500 000 токенов, уже доступна в Cursor и Grok Build, а также добавляет новый уровень усилий при рассуждении xhigh, расположенный выше уровней, с которыми поставлялась Grok 4.5.

Готова ли она к развёртыванию?

Да, в продакшене, для ограниченного набора задач. Модель в целом доступна через API xAI под именем grok-4.6, является моделью по умолчанию в Grok Build, поставляется в Cursor на всех тарифах и доступна для маршрутизации через OpenRouter, Vercel и Cloudflare. Версии с открытыми весами и возможности самостоятельного хостинга нет, поэтому развёртывание в изолированных средах исключено.

  • Этап развития компании: Команды на посевной стадии и независимые разработчики могут внедрить её немедленно, поскольку Cursor и Grok Build не требуют работы над инфраструктурой. Наиболее подходящим вариантом являются инженерные организации среднего бизнеса: документированы интеграция только через API, аутентификация mTLS, пакетная обработка и приоритетная обработка. Регулируемым предприятиям следует сначала провести пилотный проект — история бренда поставщика является актуальным вопросом при закупках в ряде комитетов.
  • Отрасли: разработка программного обеспечения и инструменты для разработчиков, проектирование полупроводников и ядер операционных систем, разработка аппаратного обеспечения и дизайн, смежный с CAD, финансовые исследования и юридический анализ. В обучающей выборке явно делался акцент на нескольких из этих направлений.
  • Применения: рефакторинг репозиториев целиком, агенты для миграции, конвейеры исследований и синтеза на корпусах объёмом 500 тыс. токенов, создание первого варианта приложения на основе описания продукта, оптимизация ядер GPU и работа со знаниями на основе большого количества документов.

Что именно изменилось

Grok 4.6 не является более крупной базовой моделью. SpaceXAI описывает более длительный дополнительный этап обучения по сравнению с тем, который прошла Grok 4.5, с использованием отобранных данных, сгенерированных моделями, для рассуждений и продвинутых технических концепций, высококачественных инженерных данных, а также улучшенного оптимизатора и схемы обучения.

Затем Grok 4.5 использовали для повторной генерации траекторий обучения с учителем на разных уровнях усилий при рассуждении, в агентных средах и предметных областях, охватывающих STEM, разработку программного обеспечения и интеллектуальную работу; проблемные трассировки отфильтровывались с помощью проверок на основе моделей. После этого проводилось обучение с подкреплением в агентных средах, охватывающих интеллектуальную работу, общее программирование, веб-разработку, автоматизированное проектирование и оптимизацию ядер.

Важный вывод о поведении модели заключается в следующем: на более длинных траекториях SpaceXAI отмечает больше самопроверок и верификации — модель проверяет собственную работу, прежде чем двигаться дальше. Это наблюдение поставщика, сделанное в ходе внутреннего тестирования, а не результат независимого измерения.

Модель поддерживает контекст объёмом 500 000 токенов, принимает текстовые и графические данные на входе и выдаёт только текст, не имеет заявленного ограничения на объём текстового вывода и использует срез знаний по состоянию на 1 февраля 2026 года. Параметр reasoning_effort теперь поддерживает значения low, medium, high (по умолчанию) и новый уровень xhigh. SpaceXAI не раскрыла количество параметров Grok 4.6.

Бенчмарки: сначала изучите результаты, где модель уступает

В таблице запуска xAI Grok 4.6 (High) набирает 61 балл в Artificial Analysis Intelligence Index — против 56 у Grok 4.5 и столько же, сколько GPT-5.6 Sol Max. Она возглавляет таблицу в GDPval-AA v2 (1753 Elo против 1526 у Grok 4.5), AA-Briefcase (1577 против 1313) и Harvey LAB.

Однако в результатах по программированию, наиболее важных для инженерных команд, она уступает. В DeepSWE v1.1 результат составляет 65,9% — на 11,9 процентного пункта больше по сравнению с предыдущим поколением, но ниже, чем 73% у GPT-5.6 Sol Max. В Terminal-Bench v3.0 достигнуто 26% — почти вдвое больше, чем 15,7% у Grok 4.5, но это по-прежнему последний результат среди четырёх представленных моделей. В CursorBench v3.2 результат составляет 69,9%, в FrontierCode v1.1 Extended — 61,3%, а в APEX-Agents — 57,5%.

При оценке следует отметить два момента. Во-первых, выделенные в таблице победы в GDPval-AA v2 и AA-Briefcase находятся внутри опубликованных компанией Artificial Analysis доверительных интервалов — это статистические ничьи, а не лидерство. Во-вторых, в наборе сравнения отсутствует Claude Opus 5 от Anthropic, которая в настоящее время возглавляет этот индекс. Раскрытые результаты, в которых модель уступает, являются более надёжным сигналом.

Цены и доступ

Согласно примечаниям к релизу, Grok 4.6 стоит $2 / $0,50 / $6 за 1 млн токенов (ввод / кэшированный ввод / вывод) при количестве входных токенов запроса менее 200 тыс., и $4 / $1 / $12 выше этого порога. На странице запуска также упоминается более быстрая версия по двойной цене, однако отдельный идентификатор модели не опубликован. В течение первой недели Grok Build и Cursor предлагают вдвое больший включённый объём использования.

Командам следует задавать prompt_cache_key (или заголовок x-grok-conv-id при использовании Chat Completions). Без этого запросы распределяются между серверами, а попадания в кэш становятся ненадёжными, поэтому применяется полная стоимость входных данных.

Интерактивное объяснение

Основные выводы

  • Grok 4.6 — это обновление этапа постобучения Grok 4.5, а не более крупная базовая модель.
  • Контекст объёмом 500 тыс. токенов, ввод текста и изображений, а также новый уровень усилий при рассуждении xhigh.
  • Делит с GPT-5.6 Sol Max первое место с результатом 61 балл в AA Intelligence Index, но уступает в DeepSWE и Terminal-Bench.
  • Та же заявленная цена $2 / $6, при этом тарифы удваиваются для запросов с более чем 200 тыс. входных токенов.
  • Доступна уже сегодня через API, Cursor и Grok Build — открытых весов и самостоятельного хостинга нет.

Ознакомьтесь с ПОЛНЫМИ ТЕХНИЧЕСКИМИ ПОДРОБНОСТЯМИ здесь. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту ML с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости