SpaceXAI випустила Grok 4.6: передову модель із контекстом 500K, оптимізовану для агентів із тривалим виконанням, програмування та роботи зі знаннями
SpaceXAI щойно випустила Grok 4.6. Реліз є оновленням післятренування порівняно з Grok 4.5, а не більшою базовою моделлю. SpaceXAI залишила фундамент незмінним, спрямувала покращення на довший додатковий цикл навчання, повторно згенеровані траєкторії керованого донавчання та навчання з підкріпленням в агентних середовищах. Агенти, які виконують завдання протягом багатьох кроків, не відхиляючись від нього. Grok 4.6 набирає 61 бал за Artificial Analysis Intelligence Index — на п’ять балів більше, ніж Grok 4.5, і стільки ж, скільки GPT-5.6 Sol Max. Модель підтримує 500 000 контекстних токенів, уже доступна сьогодні в Cursor і Grok Build, а також додає новий рівень зусиль міркування xhigh, що розташований вище за шкалу, з якою вийшла Grok 4.5.
Чи придатна вона до розгортання?
Так, у продакшені, для обмеженого набору робочих навантажень. Модель загальнодоступна через API xAI під назвою grok-4.6, є моделлю за замовчуванням у Grok Build, доступна в Cursor на всіх тарифах, а також маршрутизується через OpenRouter, Vercel і Cloudflare. Відкритої версії з вагами немає, як і можливості самостійного хостингу, тож розгортання в ізольованих мережах неможливе.
- Етап компанії: Команди на посівній стадії та незалежні розробники можуть одразу впровадити модель, оскільки Cursor і Grok Build не потребують роботи над обв’язкою. Найкраще вона підходить для інженерних організацій середнього ринку: інтеграція лише через API, автентифікація mTLS, пакетна обробка та пріоритетна обробка задокументовані. Регульованим підприємствам варто спочатку провести пілот — історія бренду постачальника є актуальним питанням під час закупівель у кількох комітетах.
- Галузі: Програмне забезпечення та інструменти для розробників, проєктування напівпровідників і ядер, апаратне забезпечення та дизайн, суміжний із CAD, фінансові дослідження й юридичний аналіз. Навчальний набір даних явно охоплював кілька з цих напрямів.
- Застосування: Рефакторинг у масштабах усього репозиторію, агенти для міграції, конвеєри дослідження та синтезу на корпусах обсягом 500 тисяч токенів, первинне створення каркаса застосунку на основі опису продукту, оптимізація ядер GPU та робота зі знаннями у великій кількості документів.
Що насправді змінилося
Grok 4.6 не є більшою базовою моделлю. SpaceXAI описує довший додатковий цикл навчання, ніж той, який отримала Grok 4.5, із використанням відібраних даних, згенерованих моделлю, для міркування та складних технічних концепцій, високоякісних інженерних даних, а також покращеного оптимізатора й рецепта навчання.
Потім Grok 4.5 використали для повторної генерації траєкторій керованого донавчання на різних рівнях зусиль міркування, агентних обв’язках і доменах, що охоплювали STEM, програмну інженерію та роботу зі знаннями; проблемні траєкторії відфільтрували за допомогою перевірок на основі моделей. Після цього відбулося навчання з підкріпленням в агентних середовищах, що охоплювали роботу зі знаннями, загальне програмування, веброзробку, автоматизоване проєктування та оптимізацію ядер.
Поведінкове спостереження є важливим: на довших траєкторіях SpaceXAI повідомляє про більше самотестування та перевірок, коли модель перевіряє власну роботу, перш ніж рухатися далі. Це спостереження постачальника за результатами внутрішнього тестування, а не незалежно виміряний результат.
Модель підтримує 500 000 контекстних токенів, приймає текстові та графічні вхідні дані, генеруючи лише текст, не має заявленого обмеження на обсяг тексту у вихідних даних і має дату завершення бази знань 1 лютого 2026 року. Параметр reasoning_effort тепер підтримує значення low, medium, high (за замовчуванням) і новий рівень xhigh. SpaceXAI не оприлюднила кількість параметрів Grok 4.6.
Бенчмарки: спочатку зверніть увагу на програші
У таблиці запуску xAI Grok 4.6 (High) набирає 61 бал за Artificial Analysis Intelligence Index — проти 56 у Grok 4.5 і стільки ж, скільки GPT-5.6 Sol Max. Вона очолює таблицю в GDPval-AA v2 (1753 Elo проти 1526 у Grok 4.5), AA-Briefcase (1577 проти 1313) та Harvey LAB.
Вона поступається в рядках, пов’язаних із програмуванням, які мають найбільше значення для інженерних команд. DeepSWE v1.1 досягає 65,9% — на 11,9 пункту більше порівняно з попереднім поколінням, але нижче за 73% у GPT-5.6 Sol Max. Terminal-Bench v3.0 досягає 26%, майже вдвічі більше за 15,7% у Grok 4.5, але все ще є найнижчим результатом серед чотирьох наведених моделей. CursorBench v3.2 становить 69,9%, FrontierCode v1.1 Extended — 61,3%, а APEX-Agents — 57,5%.
Під час оцінювання варто звернути увагу на дві речі. По-перше, виділені жирним шрифтом перемоги в GDPval-AA v2 та AA-Briefcase перебувають у межах опублікованих Artificial Analysis довірчих інтервалів — це статистичні нічиї, а не перевага. По-друге, набір порівняння не включає Claude Opus 5 від Anthropic, яка наразі очолює цей індекс. Розкриті програші є надійнішим сигналом.
Ціни та доступ
Згідно з примітками до релізу, Grok 4.6 коштує $2 / $0,50 / $6 за 1 млн токенів (вхідні дані / кешовані вхідні дані / вихідні дані) для запитів обсягом до 200 тисяч токенів, а понад цей поріг — $4 / $1 / $12. На сторінці запуску також згадується швидший варіант із подвійною ціною, але окремий ідентифікатор моделі не опубліковано. Grok Build і Cursor пропонують подвоєний обсяг включеного використання протягом першого тижня.
Командам слід встановлювати prompt_cache_key (або заголовок x-grok-conv-id у Chat Completions). Без цього запити розподіляються між серверами, а влучання в кеш стають ненадійними, тому застосовується повна ціна за вхідні дані.
Інтерактивне пояснення
Основні висновки
- Grok 4.6 — це оновлення післятренування Grok 4.5, а не більша базова модель.
- Контекст обсягом 500 тисяч токенів, текстові та графічні вхідні дані й новий рівень зусиль міркування
xhigh. - Нічия з GPT-5.6 Sol Max із результатом 61 за AA Intelligence Index; поступається в DeepSWE та Terminal-Bench.
- Та сама основна ціна $2 / $6, із подвоєнням тарифів понад 200 тисяч токенів у запиті.
- Доступна вже сьогодні через API, Cursor і Grok Build — без відкритих ваг і без самостійного хостингу.
Ознайомтеся з ПОВНИМИ ТЕХНІЧНИМИ ДЕТАЛЯМИ тут. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту ML із понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.