Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

SpaceXAI выпустила Grok 4.7: более крупная базовая модель по той же цене $2/$6, что и Grok 4.6

SpaceXAI выпустила Grok 4.7 — свою новую флагманскую модель для программирования, агентских задач и интеллектуальной работы. Grok 4.7 создана на основе более крупной базовой модели и обучалась дольше с использованием обучения с подкреплением. При этом она по-прежнему предлагается по той же цене и с той же скоростью, что и Grok 4.6.

Можно ли её развернуть? Да, в качестве размещённой модели. Уже сегодня можно вызывать grok-4.7 через API xAI, Cursor, Grok Build, OpenRouter, Vercel и Cloudflare.

Что изменилось внутри

SpaceXAI перечисляет 4 изменения по сравнению с Grok 4.6:

  1. Новая, более крупная базовая модель: Grok 4.7 не использует базовую модель Grok 4.6 повторно.
  2. Более длительное обучение с подкреплением на сложных задачах: набор задач смещён в сторону проблем, решение которых занимает много часов.
  3. Улучшенная самопроверка и работа с длинным контекстом: компания утверждает, что модель более тщательно проверяет собственную работу.
  4. Нативная поддержка оболочки Grok Bot: модель обучали понимать оболочку Grok Bot для диалоговой и интеллектуальной работы.

В документации для разработчиков указаны спецификации API:

СвойствоЗначение
Название моделиgrok-4.7
Контекстное окно500 000 токенов
Дата отсечения знаниймай 2026 года
МодальностиВвод текста и изображений, вывод текста
Уровень рассужденийнизкий, средний, высокий (по умолчанию), xhigh
APIResponses API, Chat Completions
ИнструментыВызов функций, веб-поиск, поиск в X, выполнение кода

Бенчмарки

В таблице запуска сравниваются Grok 4.7 с уровнем усилий xHigh, Grok 4.6 с уровнем High, GPT-5.6 Sol Max и Fable 5.1 Max. Результат Grok 4.7 в DeepSWE получен при высоком уровне усилий. Все результаты предоставлены производителями.

БенчмаркGrok 4.7 xHighGrok 4.6 HighGPT-5.6 Sol MaxFable 5.1 Max
Цена ввода ($/млн)$2$2$4$10
Цена вывода ($/млн)$6$6$20$50
CursorBench 4.046.3%40.4%41.7%51.8%
DeepSWE v1.171.0%*65.2%72.7%70.0%
EEBench64.0%53.0%39.4%56.4%
AA Briefcase v1.11 6571 5461 4871 678
Terminal-Bench 4.038.0%20.3%37.3%57.9%
Harvey Legal Agent Benchmark19.6%15.8%2.5%6.7%
HealthBench Professional56.7%48.5%60.5%62.1%

*Высокий уровень усилий

Grok 4.7 превосходит Grok 4.6 в каждой строке. Самый значительный рост отмечен в Terminal-Bench 4.0 — с 20.3% до 38.0%. Результат EEBench вырос на 11 пунктов, достигнув 64.0% — это лучший показатель в таблице. В бенчмарке юридических агентов Harvey Grok 4.7 набрала 19.6% против 6.7% у Fable 5.1 Max.

Grok 4.7 не лидирует по всем показателям. Fable 5.1 Max занимает первое место в 4 из 7 бенчмарков, включая результат 57.9% в Terminal-Bench. GPT-5.6 Sol Max показывает лучший результат в DeepSWE v1.1 — 72.7%.

Другим важным параметром является цена. Fable 5.1 Max стоит в 5 раз дороже за ввод и примерно в 8,3 раза дороже за вывод. GPT-5.6 Sol Max стоит в 2 раза дороже за ввод и примерно в 3,3 раза дороже за вывод. На графике зависимости стоимости задачи от результата в CursorBench 4.0 SpaceXAI помещает Grok 4.7 на передовую позицию по соотношению цены и производительности.

В GDPval, который проверяет профессиональную интеллектуальную работу, Grok 4.7 xhigh получила 1 695 Elo. Это выше результата Grok 4.6 high, составившего 1 605. Fable 5.1 max лидирует с результатом 1 735, а GPT-6 Astra max набрала 1 542. SpaceXAI также утверждает, что Grok 4.7 лучше создаёт документы и презентации.

Безопасность и кибербезопасность

Grok 4.7 поставляется с полностью новым набором защитных механизмов. SpaceXAI называет её самой сильной моделью из протестированных компанией с точки зрения отказов и устойчивости к джейлбрейкам. В биобезопасностном бенчмарке LatchBio модель заняла первое место с результатом 62.4%.

В HackerBench v0.3 — собственном бенчмарке SpaceXAI для рискованных и вредоносных киберзадач — модель пропустила 3.3% рискованных запросов двойного назначения. Компания утверждает, что редко блокирует легитимную работу в сфере безопасности. Избранные партнёры по кибербезопасности теперь получают доступ по приглашениям к возможностям красной команды для исследований в области защиты.

Цена и доступность

Grok 4.7 стоит $2 за миллион входных токенов и $6 за миллион выходных токенов. Она доступна в Cursor на всех тарифах и является моделью по умолчанию в Grok Build. Она также предоставляется через Grok API, OpenRouter, Vercel и Cloudflare.

Grok 4.7 Fast — это та же модель на более быстрой инфраструктуре, с удвоенной скоростью вывода и вдвое большей ценой. В документации указано, что она работает только в Cursor и Grok Build, но не в общедоступном API xAI. Она также недоступна в бесплатном тарифе Grok Build.

Региональная конечная точка в США по адресу https://us.api.x.ai/v1 обеспечивает выполнение запросов в Соединённых Штатах с наценкой 10%. SpaceXAI рекомендует задавать prompt_cache_key для надёжного использования кэшированных результатов.

Копировать кодСкопированоИспользовать другой браузер
import os
from xai_sdk import Client
from xai_sdk.chat import user

client = Client(api_key=os.getenv("XAI_API_KEY"))
chat = client.chat.create(model="grok-4.7")
chat.append(user("Explain this repo."))
print(chat.sample().content)

Интерактивное объяснение

Основные выводы

  • Grok 4.7 сохраняет цены Grok 4.6: $2 за ввод и $6 за вывод на миллион токенов.
  • Она лидирует в таблице запуска по EEBench (64.0%) и Harvey Legal Agent Benchmark (19.6%).
  • Fable 5.1 Max по-прежнему лидирует в 4 из 7 бенчмарков, включая Terminal-Bench 4.0.
  • API предлагает контекстное окно размером 500 000 токенов и 4 уровня рассуждений вплоть до xhigh.
  • В собственном HackerBench v0.3 компании SpaceXAI прошли только 3.3% рискованных запросов двойного назначения.

Ознакомьтесь с анонсом, документацией и публикацией в X. Все заслуги принадлежат исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости