Новости ИИЗнаков 7674Время чтения20 мин

Grok 4.6 ориентирован на долгосрочных агентов: меньше вызовов инструментов и фиксированные цены API

Grok 4.6 от SpaceXAI улучшает бенчмарки агентов с длинным горизонтом, сохраняет цены $2/$6 и предлагает API-контекст на 500,000 токенов.

SpaceXAI выпустила Grok 4.6 12 августа, позиционируя модель для долгосрочных агентов, которые исследуют темы, работают с кодовыми базами, используют инструменты и дорабатывают результат за несколько шагов. Релиз значительно превосходит Grok 4.5 в нескольких оценках агентов, сохраняя заявленные цены API: $2 за миллион входных токенов и $6 за миллион выходных токенов.

Наиболее примечательный результат получен в бенчмарке AA-Briefcase от Artificial Analysis для интеллектуальной работы с длинным горизонтом. Grok 4.6 выполнил задачи примерно за 53 шага и использовал около 500 миллионов входных токенов за всю оценку, тогда как Claude Opus 5 при максимальном усилии потребовал примерно 103 шага и два миллиарда входных токенов. Это сравнение подтверждает конкретное заявление об эффективности: в этом бенчмарке Grok потребовал примерно вдвое меньше шагов и вчетверо меньше входных токенов.

Этот вывод уже первоначального описания в социальных сетях о том, что Grok 4.6 использует вдвое меньше шагов, чем «другие ведущие модели». Artificial Analysis опубликовала подробное сравнение с Claude Opus 5 Max, а не со всеми конкурирующими передовыми моделями. Тем не менее результат существенен, поскольку длинные циклы агентов многократно повторно отправляют или накапливают контекст, из-за чего число шагов напрямую влияет на задержку и стоимость.

1. Grok 4.6 продолжает линию обучения Grok 4.5

SpaceXAI описывает Grok 4.6 как продолжение Grok 4.5, а не как новую раскрытую архитектуру. Компания не опубликовала число параметров, объём вычислений на обучение или подробную архитектурную спецификацию релиза.

Модель прошла более длительный дополнительный цикл обучения, чем Grok 4.5. По словам SpaceXAI, на этом этапе использовались отобранные материалы, сгенерированные моделью, для рассуждений и продвинутых технических концепций, высококачественные инженерные данные, а также улучшенные оптимизатор и рецепт обучения.

Затем Grok 4.5 использовалась для повторной генерации траекторий контролируемой тонкой настройки при нескольких настройках усилия рассуждений, агентных обвязках и в областях, включая STEM, программную инженерию и интеллектуальную работу. Проверки на основе моделей отфильтровывали проблемные траектории до того, как полученный чекпойнт переходил к обучению с подкреплением.

Среды обучения с подкреплением охватывали общее программирование и интеллектуальную работу, а также более специализированные задачи, связанные с оптимизацией ядра, веб-разработкой и автоматизированным проектированием. SpaceXAI заявляет, что более длинные тестовые траектории также дали больше случаев, когда модель тестировала и проверяла собственную работу перед продолжением.

Данные Cursor относятся к этой линии моделей, но доступные раскрытия требуют осторожных формулировок. Cursor сообщила, что Grok 4.5 совместно обучалась с SpaceXAI как модель mixture-of-experts с использованием триллионов токенов данных Cursor. Этот материал охватывал как взаимодействия с кодовыми базами, так и обмены между разработчиками, агентами и программными инструментами.

В анонсе Grok 4.6 говорится, что новая модель основана на Grok 4.5 и получила дополнительные инженерные данные, но не указывается, сколько новых данных Cursor было добавлено именно для версии 4.6. Утверждать, что Grok 4.6 выигрывает от основы, обученной на данных Cursor, обоснованно; заявлять о новом раскрытом объёме данных Cursor для дополнительного цикла 4.6 — нет.

2. Бенчмарки агентов показывают крупный прирост, но не безоговорочное лидерство

Grok 4.6 набрал 61 балл в версии 4.1.1 Artificial Analysis Intelligence Index — на пять баллов выше Grok 4.5 и столько же, сколько GPT-5.6 Sol Max, в сравнении при запуске SpaceXAI. Fable 5 Max набрал 62. Индекс объединяет девять оценок, охватывающих агентную работу, задачи в терминале, науку, общие знания и рассуждения.

Наиболее заметные улучшения релиза проявляются в тестах, ориентированных на агентов:

ОценкаGrok 4.6 HighGrok 4.5 HighGPT-5.6 Sol MaxFable 5 Max
GDPVal-AA v21,7531,5261,7281,741
CursorBench v3.269.9%66.7%67.2%70.5%
DeepSWE v1.165.9%54.0%73.0%70.0%
FrontierCode v1.1 Extended61.3%56.6%60.6%63.6%
APEX-Agents57.5%47.1%56.7%59.2%
Terminal-Bench v3.026.0%15.7%34.6%34.1%
AA-Briefcase1,5771,3131,5021,574

GDPVal-AA v2 оценивает экономически ценные профессиональные задачи. Artificial Analysis независимо сообщила, что результат Grok 4.6 уступал только Claude Opus 5 и статистически не отличался от Fable 5 и Qwen3.8 Max, поскольку их доверительные интервалы перекрывались.

AA-Briefcase показал сопоставимый результат по качеству, но с более необычным профилем эффективности. Grok 4.6 достиг рейтинга Elo 1,577, немного превысив 1,574 для Fable 5 Max и заметно опередив 1,502 у GPT-5.6 Sol Max в таблице SpaceXAI. Artificial Analysis охарактеризовала результаты Grok как стабильно конкурентоспособные по соблюдению критериев, представлению и аналитическому качеству.

Результаты не доказывают, что Grok 4.6 является сильнейшей моделью для каждой агентной нагрузки. GPT-5.6 Sol Max опередил её на 7.1 процентного пункта в DeepSWE v1.1 и на 8.6 пункта в Terminal-Bench v3.0. Fable 5 Max также сохранял преимущество в CursorBench, FrontierCode, APEX-Agents, Terminal-Bench и APEX-SWE в таблице запуска.

Условия бенчмарков различаются в зависимости от обвязки и настройки рассуждений, а SpaceXAI отмечает, что показатели конкурентов были взяты из опубликованных поставщиками system cards или публичных таблиц лидеров. Поэтому таблица свидетельствует о конкурентоспособных результатах в нескольких средах, а не является контролируемым утверждением, что одна модель доминирует во всех агентных системах.

3. Меньшее число шагов меняет расчёт стоимости

Artificial Analysis измерила среднюю стоимость $0.84 на задачу при оценке Grok 4.6 в своём Intelligence Index. Она поместила модель на границу стоимости и производительности для каждой агентной оценки, включённой в этот индекс.

Экономическое преимущество возникает из двух отдельных факторов. У Grok 4.6 опубликованные цены на токены ниже, чем у нескольких близких передовых моделей, а её запуски AA-Briefcase накапливали меньше контекста, поскольку использовали меньше шагов. Долгосрочный агент может после каждого действия отправлять модели инструкции, историю диалога, извлечённые документы и результаты работы инструментов. Поэтому сокращение числа циклов может снизить расход входных токенов, даже если итоговый ответ аналогичен.

Это не означает, что каждое применение Grok 4.6 будет стоить $0.84 или использовать вдвое меньше шагов. Эти показатели описывают конфигурацию оценки Artificial Analysis. Фактическая стоимость зависит от усилия рассуждений, дизайна инструментов, кэширования промптов, роста контекста, повторных попыток и того, завершит ли агент задачу успешно.

Ещё одно ограничение — необработанная скорость. Artificial Analysis измерила примерно 62 выходных токена в секунду и 44.82 секунды до первого токена через API SpaceXAI; оба показателя медленнее медиан сравнения, приведённых на странице модели. Эффективность по числу шагов может сократить длительность всего рабочего процесса, не делая быстрым каждый отдельный ответ.

4. Развёртывания API и Cursor имеют разные ограничения

Нативный API SpaceXAI использует идентификатор модели grok-4.6. Он принимает текст и изображения, возвращает текст и поддерживает низкое, среднее, высокое и xhigh усилие рассуждений; по умолчанию используется высокое. Документированные инструменты включают вызов функций, поиск в интернете и X, а также выполнение кода.

SpaceXAI документирует контекстное окно в 500,000 токенов, отсечку знаний 1 февраля 2026 года и отсутствие заявленного ограничения на текстовый вывод. При промптах менее 200,000 токенов цены API составляют $2 за миллион входных токенов, $0.50 за миллион кэшированных входных токенов и $6 за миллион выходных токенов. Как только промпт превышает 200,000 токенов, эти ставки удваиваются до $4, $1 и $12.

Компания рекомендует назначать диалогу стабильный ключ кэша промпта, чтобы последующие запросы попадали на тот же сервер и могли повторно использовать кэшированный контекст. Она также рекомендует сжатие контекста для длинных циклов агентов. Оба механизма важны, поскольку заявленная ёмкость контекста не отменяет стоимости многократной обработки растущей истории.

Развёртывание Cursor предоставляет меньшее документированное контекстное окно — 256,000 токенов. Оно даёт Grok 4.6 доступ к инструментам Cursor для поиска файлов, доступа к интернету, чтения и редактирования файлов, терминала, браузера, генерации изображений и извлечения правил. Стандартные тарифы по запросу соответствуют нижнему уровню API, тогда как опция Cursor Fast стоит $4 за миллион входных токенов, $1 за миллион кэшированных входных токенов и $12 за миллион выходных токенов.

На момент запуска Grok 4.6 была доступна через Cursor, Grok Build, API SpaceXAI, OpenRouter, Vercel и Cloudflare. Cursor и Grok Build предлагали двойной включённый объём использования в течение первой недели, но это была ограниченная по времени акция к запуску, а не постоянное условие ценообразования.

Частые вопросы

Когда была выпущена Grok 4.6?

SpaceXAI выпустила Grok 4.6 12 августа 2026 года.

Всегда ли Grok 4.6 использует вдвое меньше шагов агента?

Нет. Сравнение примерно 53 и 103 шагов относится конкретно к оценке AA-Briefcase от Artificial Analysis в сравнении с Claude Opus 5 Max.

Обучалась ли Grok 4.6 на данных Cursor?

Её основа Grok 4.5 обучалась с использованием триллионов токенов данных Cursor. SpaceXAI не раскрыла, какой дополнительный объём данных Cursor, если он вообще был, использовался именно в дополнительном цикле Grok 4.6.

Сколько стоит API Grok 4.6?

При промптах менее 200,000 токенов документированные ставки составляют $2 за миллион входных токенов, $0.50 за миллион кэшированных входных токенов и $6 за миллион выходных токенов. Выше этого порога ставки удваиваются.

Одинаково ли контекстное окно Grok 4.6 в Cursor и API?

Нет. SpaceXAI документирует 500,000 токенов для своего API, тогда как Cursor документирует контекстное окно в 256,000 токенов для своего развёртывания.

Источники

Share

Поделиться статьёй