Репортаж от Wedoany,12 августа американская компания в области искусственного интеллекта SpaceXAI представила новое поколение флагманской модели Grok 4.6, сделав основной акцент на улучшении возможностей долгосрочных агентов, разработки программного обеспечения, интеллектуальной работы и создания интерактивных приложений. Модель уже доступна через Grok Build, Cursor и SpaceXAI API, а также интегрирована с партнёрскими платформами OpenRouter, Vercel и Cloudflare.

Grok 4.6 поддерживает ввод текста и изображений, вывод текста, контекстное окно объёмом 500 тысяч токенов, возможность вызова функций, поиска в интернете, поиска на платформе X и инструментов выполнения кода, а также поддерживает структурированный вывод. Разработчики могут вызывать модель через Responses API и интерфейс Chat Completions, при этом интенсивность рассуждений может быть установлена на четыре уровня: низкий, средний, высокий и сверхвысокий, по умолчанию используется высокий режим рассуждений.
В SpaceXAI заявили, что Grok 4.6 в первую очередь ориентирована на сложные задачи, требующие последовательного выполнения нескольких шагов, включая междисциплинарные исследования, анализ информации, обработку крупных кодовых баз, разработку программных прототипов и создание рабочих результатов. По сравнению с Grok 4.5, новая модель выполняет больше самопроверок и проверок результатов в длительных задачах, а также усиливает способность генерации от концепции продукта до начальной версии интерактивного приложения.
В плане обучения Grok 4.6 использовала более длительный процесс дополнительного обучения по сравнению с предыдущим поколением; данные включают сгенерированные моделью данные для рассуждений и продвинутых технических концепций, а также инженерные данные. Затем SpaceXAI с помощью Grok 4.5 заново сгенерировала траектории контролируемой тонкой настройки, охватывающие различные уровни интенсивности рассуждений, агентные фреймворки, научные, инженерные, математические области и разработку программного обеспечения, а также отфильтровала проблемные обучающие записи с помощью проверок моделей. Модель также прошла обучение с подкреплением на агентных задачах, включая интеллектуальную работу, общее программирование, оптимизацию ядра, веб-разработку и автоматизированное проектирование.
Согласно опубликованным SpaceXAI данным, Grok 4.6 набрала 61 балл в комплексном тесте Artificial Analysis Intelligence Index, что на 5 баллов выше, чем 56 баллов у Grok 4.5, сравнявшись с GPT-5.6 Sol и уступив 1 балл Claude Fable 5. Этот индекс объединяет девять тестов, включая научные, программирование и финансовые услуги, однако результаты тестов в основном отражают производительность модели в определённых условиях и не могут напрямую приравниваться к возможностям во всех реальных бизнес-сценариях.
В тестах агентов и разработки программного обеспечения Grok 4.6 показала 69,9% в CursorBench 3.2, 65,9% в DeepSWE 1.1 и 61,3% в расширенном тесте FrontierCode 1.1. Её результат APEX-Agents составил 57,5%, что выше 47,1% у Grok 4.5; в тесте AA-Briefcase, оценивающем сложные интеллектуальные рабочие способности, она набрала 1577 баллов, также превысив 1313 баллов предыдущего поколения.
Базовая цена API стандартной версии Grok 4.6 составляет 2 доллара за миллион входных токенов, 0,5 доллара за миллион кэшированных входных токенов и 6 долларов за миллион выходных токенов. Когда входной контекст превышает 200 тысяч токенов, официально применяется более высокий тариф; SpaceXAI также предлагает более быструю версию по цене примерно вдвое выше стандартной. Grok Build и Cursor предоставляют удвоенный объём использования в первую неделю после выпуска модели.
В SpaceXAI заявили, что новая модель прошла самый широкий на сегодняшний день комплекс предварительных проверок возможностей и безопасности перед развёртыванием, и компания продолжит проводить пост-развёртывающие и сторонние тесты. Тем не менее, большинство официально опубликованных показателей производительности получены из собственных тестов компании или ссылаются на публичные результаты других разработчиков моделей, и они всё ещё требуют дальнейшей проверки посредством независимых оценок и реального корпоративного развёртывания.





















