Новости ИИЗнаков 7898Время чтения20 мин

Groq развернёт NVIDIA Groq 3 LPX и Vera Rubin NVL72 совместно с Dell

Groq планирует добавить мощности NVIDIA Groq 3 LPX и Vera Rubin NVL72 в GroqCloud благодаря партнёрству с Dell по развертыванию.

1. Groq делает ставку на новую инференс-платформу NVIDIA

Groq планирует развернуть NVIDIA Groq 3 LPX вместе с NVIDIA Vera Rubin NVL72 в GroqCloud, что позволит независимому провайдеру инференса предлагать новейшую низколатентную архитектуру NVIDIA через существующую облачную платформу. Dell Technologies предоставит инфраструктуру для развертывания и поддержит масштабное внедрение систем.

Объявление было сделано 24 августа 2026 года — в тот же день, когда NVIDIA сообщила о выходе Groq 3 LPX на полную производственную мощность. Groq назвала себя «среди первых внедряющих», но не первой: NVIDIA назвала Nebius первым ИИ-облаком, которое должно вывести эту платформу в промышленную эксплуатацию, а Groq — ещё одним ранним провайдером.

Это различие важно, поскольку ни одна из компаний не заявила, что мощности LPX Groq уже доступны клиентам. Groq не раскрыла дату активации, регион развертывания, количество стоек, список поддерживаемых моделей, конфигурацию API, порядок резервирования или цену токенов. В её объявлении доступ клиентов последовательно описывается в будущем времени.

После ввода мощностей в эксплуатацию Groq намерена предоставить к ним доступ через инфраструктуру, уже используемую для промышленного инференса. Компания утверждает, что GroqCloud обслуживает более шести миллионов разработчиков и тысячи компаний, ориентированных на ИИ, обрабатывает триллионы токенов каждую неделю и эксплуатирует дата-центры в Северной Америке, Европе, на Ближнем Востоке и в Азиатско-Тихоокеанском регионе. Эти операционные показатели раскрыты самой компанией, а не подтверждены независимым аудитом.

Заявленная роль Dell — помочь превратить архитектуру стоек NVIDIA в готовую к развертыванию инфраструктуру, используя свои возможности в вычислениях, сетях, интеграции и цепочках поставок. Стороны не назвали конкретные задействованные системы Dell и не опубликовали коммерческие условия соглашения.

2. Что Groq 3 LPX добавляет к Vera Rubin

NVIDIA Groq 3 LPX — это инференс-ускоритель уровня стойки, построенный на 256 чипах Groq 3 LPU. Это не самостоятельная замена Vera Rubin NVL72: он разработан для работы рядом со стойкой GPU и специализируется на чувствительной к задержкам генерации токенов.

Полная стойка LPX содержит 32 1U-вычислительных лотка с жидкостным охлаждением, каждый из которых несёт восемь LPU. NVIDIA указывает 315 петафлопс инференс-вычислений FP8, 128 GB совокупной встроенной SRAM, 40 петабайт в секунду пропускной способности SRAM и 640 терабайт в секунду пропускной способности scale-up на стойку. Каждый LPU предоставляет 500 MB SRAM, 150 TB/s пропускной способности SRAM и 2.5 TB/s пропускной способности scale-up.

Использование SRAM является центральным элементом этой архитектуры. SRAM предлагает значительно меньшую ёмкость, чем HBM, подключённая к современным GPU для дата-центров, но обеспечивает исключительно высокую пропускную способность и предсказуемое время доступа. Архитектура Groq с планированием компилятором также заранее планирует вычисления, перемещение памяти и межчиповую связь, стремясь снизить разброс задержек, который становится заметен во время интерактивной генерации.

Vera Rubin NVL72 обеспечивает более универсальную и требующую больше памяти часть системы. NVIDIA описывает три способа разделения инференс-работы между стойками.

При традиционном разделении prefill и decode Vera Rubin обрабатывает промпт и создаёт кэш ключей и значений, после чего передаёт этот кэш LPX для генерации токенов. При разделении attention и feed-forward GPU Rubin сохраняют кэш и выполняют attention, тогда как LPX исполняет feed-forward-слои или слои mixture-of-experts. LPX также может выполнять меньшую черновую модель для спекулятивного декодирования, пока более крупная модель на Vera Rubin проверяет предложенные токены.

Эти конфигурации предназначены для передачи обработки больших контекстов и гибких высокопроизводительных нагрузок GPU, а предсказуемой, чувствительной к задержкам генерации — LPU. Такое разделение особенно актуально для агентов программирования и других систем, которые неоднократно изучают контекст, формируют ответ, вызывают инструмент, наблюдают результат и начинают следующий инференс-цикл.

3. Опубликованные данные о производительности

Наиболее конкретный результат по производительности — тест, проведённый Artificial Analysis на системе NVIDIA Groq 3 LPX под управлением NVIDIA. При использовании 31-миллиардопараметрической модели Gemma 4 со 100,000 входных токенов система выдала медианные 3,431 выходных токенов в секунду.

В своём объявлении NVIDIA округлила этот результат до 3,400 токенов в секунду и описала его как примерно в четыре раза превышающий результат 870 токенов в секунду у самого быстрого публичного endpoint в сравнении. При более коротком контексте в 10,000 токенов система LPX зафиксировала медианные 3,382 выходных токенов в секунду против 1,402 у самого быстрого публичного endpoint, включённого в эту диаграмму.

Artificial Analysis и NVIDIA также сообщили, что в протестированных выходных данных не наблюдалось потери точности или качества модели при конфигурации бенчмарка. Однако измерения LPX были получены на системе, работающей в собственных дата-центрах NVIDIA, а не на общедоступном endpoint GroqCloud. Следовательно, они демонстрируют потенциальную скорость аппаратной конфигурации, а не цену, ёмкость, поведение при перегрузке или сквозную задержку, которую клиенты получат от Groq.

Отдельно NVIDIA запустила open-source-нагрузку для программирования SPEED-Bench на той же модели. Она сообщила о медианной скорости генерации 4,767 выходных токенов в секунду и результате P80 в 5,520 токенов в секунду. Этот результат для программирования был получен самим поставщиком, в отличие от измерения Artificial Analysis, и его следует оценивать соответствующим образом.

Скорость выходных токенов измеряет только фазу генерации после того, как система начинает возвращать токены. Общее время ответа приложения всё ещё включает обработку промпта, ожидание в очереди, сетевую задержку, выполнение инструментов, рассуждения модели и любые передачи между стойками Rubin и LPX. Более быстрое декодирование может существенно сократить циклы агентов, когда узким местом является генерация, но не делает каждый этап агентной задачи пропорционально быстрее.

4. Почему это развертывание меняет GroqCloud

Планируемое внедрение углубляет отношения, начавшиеся с неисключительного соглашения Groq и NVIDIA о лицензировании технологий инференса в декабре 2025 года. По этому соглашению основатель Groq Джонатан Росс, занимавший тогда должность президента Санни Мадра и другие члены команды присоединились к NVIDIA для развития лицензированной технологии. Groq осталась независимой компанией, а GroqCloud продолжила работу.

Впоследствии NVIDIA включила эту технологию в платформу NVIDIA Groq 3 LPU и LPX под брендом NVIDIA. 12 августа 2026 года Groq присоединилась к программе NVIDIA Cloud Partner, получив сертификацию на проектирование и эксплуатацию инфраструктуры ускоренных вычислений NVIDIA в соответствии с референсными архитектурами и операционными стандартами NVIDIA.

Новое объявление переводит эти отношения от лицензирования технологий и сертификации к обозначенному промышленному развертыванию. Groq, которая строила идентичность своего облака вокруг собственной инфраструктуры LPU, теперь планирует эксплуатировать коммерческую реализацию NVIDIA лицензированной технологии Groq совместно с GPU Vera Rubin.

Для разработчиков практическое изменение заключается в перспективе получить доступ к этому гетерогенному оборудованию через существующее облако Groq, а не покупать и эксплуатировать полные системы уровня стойки. Groq ранее заявляла, что клиенты получат будущие мощности NVIDIA без изменения кода приложений, но пока не документировала, будет ли LPX использовать существующие идентификаторы моделей и API endpoint или потребует отдельного уровня сервиса.

Это решение также расширяет GroqCloud за пределы единой аппаратной линии. Оно позволяет Groq сочетать опыт эксплуатации LPU для инференса с экосистемой GPU, сетей, оркестрации и систем уровня стойки NVIDIA, тогда как Dell берёт на себя часть физического пути развертывания.

Коммерчески важные вопросы остаются неподтверждёнными. Groq не объявила, когда разработчики смогут отправлять промышленные запросы на LPX, какие модели будут поддерживаться, будет ли доступ общедоступным или зарезервированным, а также как её цена и гарантии уровня сервиса будут соотноситься с существующими предложениями GroqCloud. Заявление NVIDIA о том, что LPX находится в полном производстве, означает, что платформа достигла масштаба производства; это не означает, что сервис Groq уже запущен.

Частые вопросы

Groq — первый облачный провайдер, развёртывающий NVIDIA Groq 3 LPX?

Нет. NVIDIA назвала Nebius первым ИИ-облаком, выводящим платформу в промышленную эксплуатацию. Groq заявляет, что будет среди самых ранних внедряющих.

Когда Groq 3 LPX станет доступна в GroqCloud?

Groq не объявила дату запуска. Она также не раскрыла начальные регионы, мощность, поддерживаемые модели или требования к доступу.

Что предоставляет Dell Technologies?

Dell помогает Groq масштабно развернуть инфраструктуру LPX и Vera Rubin NVL72, включая интегрированные вычисления, сети и поддержку цепочек поставок. Точная конфигурация систем не была опубликована.

Является ли Groq 3 LPX заменой Vera Rubin NVL72?

Нет. LPX разработан для работы совместно с Vera Rubin NVL72, ускоряя чувствительную к задержкам генерацию токенов, тогда как GPU Rubin обрабатывают дополняющие инференс-задачи.

Представляет ли бенчмарк в 3,431 токенов в секунду производительность GroqCloud?

Нет. Artificial Analysis измерила систему LPX под управлением NVIDIA. Groq не опубликовала производительность промышленного endpoint или цены для планируемого развертывания.

Источники

Share

Поделиться статьёй