SpaceXAI представи Grok 4.6: граничен модел с контекст от 500K, оптимизиран за дълго работещи агенти, програмиране и работа със знания
SpaceXAI току-що пусна Grok 4.6. Новата версия е надграждане чрез дообучаване спрямо Grok 4.5, а не по-голям базов модел. SpaceXAI запази основата непроменена и насочи подобренията към по-дълъг допълнителен тренировъчен процес, повторно генерирани траектории за контролирано дообучаване и обучение с подсилване в агентни среди. Агентите могат да се придържат към дадена задача в продължение на много стъпки, без да се отклоняват. Grok 4.6 получава 61 точки в Artificial Analysis Intelligence Index — с пет повече от Grok 4.5 и наравно с GPT-5.6 Sol Max. Моделът поддържа 500 000 контекстни токена, наличен е още днес в Cursor и Grok Build и добавя ново ниво на усилие за разсъждение xhigh над йерархията, с която беше пуснат Grok 4.5.
Може ли да бъде внедрен?
Да, в продукционна среда, при ограничен набор от работни натоварвания. Моделът е общодостъпен чрез xAI API като grok-4.6, е моделът по подразбиране в Grok Build, предлага се в Cursor при всички планове и може да бъде използван чрез OpenRouter, Vercel и Cloudflare. Няма версия с отворени тегла и възможност за самостоятелно хостване, така че внедряванията в изолирани среди не са възможни.
- Етап на компанията: Екипите на етап seed и независимите разработчици могат да го внедрят незабавно, тъй като Cursor и Grok Build не изискват работа по допълнителна инфраструктура. Инженерните организации от средния пазар са най-подходящи: интеграция само чрез API, удостоверяване с mTLS, пакетна обработка и обработка с приоритет са документирани. Регулираните предприятия трябва първо да проведат пилотен проект — историята на марката на доставчика е реален въпрос при избора в няколко комитета по закупуване.
- Индустрии: Софтуер и инструменти за разработчици, полупроводници и разработка на ядра, хардуерен дизайн и дизайн, свързан с CAD, финансови изследвания и правен анализ. Тренировъчният набор изрично е насочен към няколко от тези области.
- Приложения: Рефакториране на ниво цяло хранилище, агенти за миграция, изследователски и синтезиращи процеси върху корпуси от 500 000 токена, първоначално изграждане на приложения по продуктово задание, оптимизация на GPU ядра и работа със знания, базирана на множество документи.
Какво всъщност се промени
Grok 4.6 не е по-голям базов модел. SpaceXAI описва по-дълъг допълнителен тренировъчен процес от този, на който е бил подложен Grok 4.5, използвайки подбрани данни, генерирани от модела, за разсъждение и усъвършенствани технически концепции, висококачествени инженерни данни, както и подобрен оптимизатор и тренировъчна рецепта.
След това Grok 4.5 е използван за повторно генериране на траектории за контролирано дообучаване при различни нива на усилие за разсъждение, агентни среди и области, обхващащи STEM, софтуерното инженерство и работата със знания, като проблемните следи са филтрирани чрез проверки, базирани на модели. Следва обучение с подсилване в агентни среди, обхващащи работа със знания, общо програмиране, уеб разработка, компютърно подпомаган дизайн и оптимизация на ядра.
Поведенческото наблюдение е важно: при по-дълги траектории SpaceXAI отчита повече самотестване и проверка, като моделът проверява собствената си работа, преди да продължи. Това е наблюдение на доставчика от вътрешни тестове, а не независимо измерен резултат.
Моделът поддържа 500 000 контекстни токена, приема текстови и графични входни данни и генерира само текстов изход, няма посочено ограничение за дължината на текстовия изход и има праг на знанията към 1 февруари 2026 г. reasoning_effort вече поддържа low, medium, high (по подразбиране) и ново ниво xhigh. SpaceXAI не е публикувала броя параметри на Grok 4.6.
Бенчмаркове: първо разгледайте загубите
В таблицата на xAI за представянето при пускането Grok 4.6 (High) получава 61 точки в Artificial Analysis Intelligence Index — спрямо 56 за Grok 4.5 и наравно с GPT-5.6 Sol Max. Той води в таблицата при GDPval-AA v2 (1753 Elo спрямо 1526 за Grok 4.5), AA-Briefcase (1577 спрямо 1313) и Harvey LAB.
Изостава при редовете за програмиране, които са най-важни за инженерните екипи. DeepSWE v1.1 достига 65,9% — с 11,9 процентни пункта повече спрямо предишното поколение, но зад GPT-5.6 Sol Max със 73%. Terminal-Bench v3.0 достига 26%, почти двойно повече от 15,7% на Grok 4.5, но все още е последен сред четирите посочени модела. CursorBench v3.2 е 69,9%, FrontierCode v1.1 Extended е 61,3%, а APEX-Agents е 57,5%.
Има две неща, които трябва да се имат предвид при оценяването. Първо, отбелязаните с удебелен шрифт победи при GDPval-AA v2 и AA-Briefcase попадат в публикуваните от Artificial Analysis доверителни интервали — това са статистически равенства, а не водещи резултати. Второ, наборът за сравнение изключва Claude Opus 5 на Anthropic, който в момента оглавява този индекс. Разкритите загуби са по-надеждният сигнал.
Цени и достъп
Според бележките към изданието Grok 4.6 се таксува по $2 / $0,50 / $6 за 1 млн. токена (вход / кеширан вход / изход) при под 200 000 входни токена, а над този праг цената е $4 / $1 / $12. Страницата за пускането също посочва по-бърз вариант на двойна цена, без публикуван отделен идентификатор на модела. Grok Build и Cursor предлагат 2 пъти повече включено използване през първата седмица.
Екипите трябва да зададат prompt_cache_key (или хедъра x-grok-conv-id при Chat Completions). Без него заявките се разпределят между сървъри и попаденията в кеша стават ненадеждни, така че се прилага пълната цена за входа.
Интерактивно обяснение
Основни изводи
- Grok 4.6 е надграждане чрез дообучаване на Grok 4.5, а не по-голям базов модел.
- Контекст от 500 000 токена, текстови и графични входни данни и ново ниво
xhighза усилието при разсъждение. - Наравно е с GPT-5.6 Sol Max с 61 точки в AA Intelligence Index; изостава при DeepSWE и Terminal-Bench.
- Същата водеща цена от $2 / $6, като тарифите се удвояват над 200 000 входни токена.
- Наличен още днес чрез API, Cursor и Grok Build — без отворени тегла и без самостоятелно хостване.
Вижте ПЪЛНИТЕ ТЕХНИЧЕСКИ ПОДРОБНОСТИ тук. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризирането на вашето GitHub хранилище ИЛИ страница в Hugging Face, ИЛИ продуктово издание, ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.