SpaceXAI выпустила ИИ-модель Grok 4.6 для решения сложных многоступенчатых задач
Компания SpaceXAI (xAI) 12 августа 2026 года представила крупное обновление своей флагманской линейки — языковую модель Grok 4.6. Новинка позиционируется как инструмент для автономной «долгой» работы агентов, способных в течение длительного времени решать поставленные задачи, самостоятельно перезапускаться и продвигаться к цели через множество этапов. По словам разработчиков, модель не уступает по возможностям флагманам GPT-5.6 Sol от OpenAI и Claude Fable 5 компании Anthropic. 
Технические характеристики и режимы работы
Grok 4.6 получила контекстное окно до 500 000 токенов (примерно 375 страниц текста). Модель принимает текст и изображения, возвращает текст и поддерживает четыре уровня рассуждения: низкий, средний, высокий и сверхвысокий (xhigh). По умолчанию включен высокий уровень. Через API доступны вызовы функций, веб-поиск, поиск по X и выполнение кода. Дата отсечения знаний приходится на 1 февраля 2026 года — свежие события без поисковых инструментов модель не узнает. 
Улучшения обучения и архитектуры
По сравнению с Grok 4.5 (вышла в июле 2026 года), новая версия прошла более длительный дополнительный цикл обучения. В данных использовались инженерные задачи, технические рассуждения и траектории агентов в разных средах. Затем модель дообучали с подкреплением на программировании, работе со знаниями, оптимизации ядер, веб-разработке и проектировании. Разработчики отмечают, что на длинных прогонах модель чаще проверяет собственную работу и исправляет найденные ошибки прямо в процессе генерации до выдачи результата пользователю.
Результаты бенчмарков и сравнение с конкурентами
В сводном индексе Artificial Analysis Intelligence Index Grok 4.6 набрала 61 балл (+5 пунктов к версии 4.5), сравнявшись с максимальным уровнем рассуждений GPT-5.6 Sol и отставая на один балл от Fable 5 Max. Китайская модель с открытыми весами Kimi K3 обогнана.
Детальная картина по тестам:
- CursorBench v3.2 (режим Extra High): 70,8% — опередила GPT-5.6 Sol (67,2%) и чуть превзошла Fable 5 Max (70,5%) и Opus 5 Max (70%). При этом средняя стоимость задания составила $2,81 против $17,32 у Fable 5 Max, $8,23 у Opus 5 Max и $5,69 у GPT-5.6 Sol. Grok сделал 46 шагов против 72, 78 и 48 у конкурентов.
- FrontierCode v1.1: 61,3% правильных ответов против 56,6% у Grok 4.5. Fable 5 показывает более высокий результат.
- DeepSWE: 65,9% (было 54%) против 73% у GPT-5.6 Sol и 70% у Fable 5.
- Terminal-Bench: 26% (было 15,7%) против 34,6% и 34,1% у лидеров.
- APEX-Agents: 57,5% (было 47,1%).
- GDPVal-AA: 1753 пункта — первое место в таблице xAI.
- Harvey LAB (юридическая работа): 15,8% — лидирует.
Cursor предупреждает, что близкие результаты в CursorBench могут быть статистически незначимыми, так как тест описывает связку модели с системным промптом, инструментами и управлением контекстом. Компания также участвовала в запуске модели, а в обучении использовались траектории из разных агентных сред. 
Сильные и слабые стороны
По стартовым цифрам Grok 4.6 особенно интересна для работы со знаниями, широких задач в кодовой базе и длительных процессов. Модель демонстрирует значительное превосходство над предшественником в разработке кода, работе в терминале, работе с информацией и производительности агентов. Терминальные сценарии и часть сложных программных тестов (FrontierCode, APEX-SWE) пока остаются слабее лидеров — Fable 5 и GPT-5.6 Sol.
Цены и доступность
Стоимость API зафиксирована на уровне $2 за 1 млн входных токенов и $6 за 1 млн выходных токенов — это делает модель вариантом средней ценовой категории по сравнению с ведущими проприетарными и открытыми решениями. Кэшированный вход стоит $0,50 за 1 млн токенов. Быстрая версия модели обходится вдвое дороже. После 200 000 токенов контекста тариф удваивается.
На старте Grok 4.6 доступна в среде разработки Cursor, платформе Grok Build, официальном API SpaceXAI, а также у партнеров: OpenRouter, Vercel и Cloudflare. Первую неделю Cursor и Grok Build предоставляют двойной включенный объём использования. 