Groq, Dell과 함께 NVIDIA Groq 3 LPX 및 Vera Rubin NVL72 배포 예정
Groq는 Dell과의 배포 파트너십을 통해 NVIDIA Groq 3 LPX 및 Vera Rubin NVL72 용량을 GroqCloud에 추가할 계획이다.
1. Groq, NVIDIA의 새로운 추론 플랫폼 도입
Groq는 NVIDIA Groq 3 LPX를 NVIDIA Vera Rubin NVL72와 함께 GroqCloud에 배포할 계획이다. 이에 따라 독립 추론 제공업체인 Groq는 기존 클라우드 플랫폼을 통해 NVIDIA의 최신 저지연 아키텍처를 제공할 수 있는 경로를 확보하게 된다. Dell Technologies는 배포 인프라를 공급하고 시스템의 대규모 도입을 지원한다.
이 발표는 NVIDIA가 Groq 3 LPX가 양산 단계에 진입했다고 밝힌 2026년 8월 24일에 나왔다. Groq는 자사를 최초가 아닌 “among the first adopters”라고 설명했다. NVIDIA는 Nebius를 이 플랫폼을 최초로 프로덕션에 도입할 예정인 AI 클라우드로 지목했으며, Groq는 그 뒤를 잇는 또 다른 초기 제공업체다.
이 구분은 두 회사 모두 Groq의 LPX 용량이 이미 고객에게 제공되고 있다고 밝히지 않았기 때문에 중요하다. Groq는 활성화 날짜, 배포 지역, 랙 수, 지원 모델 목록, API 구성, 예약 절차 또는 토큰 가격을 공개하지 않았다. 발표문은 일관되게 고객 액세스를 미래형으로 서술한다.
용량이 온라인 상태가 되면 Groq는 이미 프로덕션 추론에 사용 중인 인프라를 통해 이를 제공할 계획이다. 회사는 GroqCloud가 600만 명 이상의 개발자와 수천 개의 AI 네이티브 기업에 서비스를 제공하고, 매주 수조 개의 토큰을 처리하며, 북미·유럽·중동·아시아태평양 전역에서 데이터센터를 운영한다고 밝혔다. 이러한 운영 수치는 독립 감사를 받은 측정치가 아니라 회사가 공개한 수치다.
Dell의 공식 역할은 컴퓨팅, 네트워킹, 통합 및 공급망 역량을 활용해 NVIDIA 랙 아키텍처를 배포 가능한 인프라로 전환하는 데 도움을 주는 것이다. 당사자들은 관련된 구체적인 Dell 시스템이나 계약의 상업적 조건을 밝히지 않았다.
2. Groq 3 LPX가 Vera Rubin에 추가하는 요소
NVIDIA Groq 3 LPX는 256개의 Groq 3 LPU 칩을 중심으로 구성된 랙 스케일 추론 가속기다. Vera Rubin NVL72를 단독으로 대체하는 제품이 아니라, GPU 랙과 함께 작동하며 지연 시간에 민감한 토큰 생성을 전문적으로 처리하도록 설계됐다.
완전한 LPX 랙은 액체 냉각 방식의 1U 컴퓨트 트레이 32개로 구성되며, 각 트레이에는 8개의 LPU가 탑재된다. NVIDIA는 랙당 315 FP8 페타플롭스의 추론 컴퓨팅 성능, 총 128 GB의 온칩 SRAM, 초당 40페타바이트의 SRAM 대역폭, 초당 640테라바이트의 스케일업 대역폭을 제시한다. 각 LPU는 500 MB의 SRAM, 150 TB/s의 SRAM 대역폭, 2.5 TB/s의 스케일업 대역폭을 제공한다.
SRAM의 사용은 이 설계의 핵심이다. SRAM은 최신 데이터센터 GPU에 연결된 HBM보다 용량은 훨씬 작지만, 매우 높은 대역폭과 예측 가능한 액세스 시간을 제공한다. Groq의 컴파일러 스케줄링 아키텍처는 연산, 메모리 이동, 칩 간 통신을 사전에 계획해 대화형 생성 중 드러나는 지연 시간 변동을 줄이는 것을 목표로 한다.
Vera Rubin NVL72는 시스템에서 보다 범용적이고 메모리 집약적인 측면을 담당한다. NVIDIA는 랙들이 추론 작업을 분할하는 세 가지 방식을 설명한다.
일반적인 프리필-디코드 분할에서는 Vera Rubin이 프롬프트를 처리하고 키-값 캐시를 생성한 다음, 토큰 생성을 위해 해당 캐시를 LPX로 전송한다. 어텐션-피드포워드 분할에서는 Rubin GPU가 캐시를 유지하고 어텐션을 실행하는 반면 LPX는 피드포워드 또는 전문가 혼합 레이어를 실행한다. LPX는 Vera Rubin에서 실행되는 더 큰 모델이 제안된 토큰을 검증하는 동안, 사변적 디코딩을 위한 더 작은 초안 모델을 실행할 수도 있다.
이러한 구성은 대규모 컨텍스트 처리와 유연한 고처리량 워크로드를 GPU에 할당하고, 예측 가능하며 지연 시간에 민감한 생성을 LPU로 보내기 위한 것이다. 이 구분은 특히 컨텍스트를 반복적으로 검사하고, 응답을 생성하고, 도구를 호출하고, 결과를 관찰한 뒤 또 다른 추론 턴을 시작하는 코딩 에이전트 및 기타 시스템과 관련성이 높다.
3. 공개된 성능 근거
가장 구체적인 성능 결과는 Artificial Analysis가 NVIDIA 운영 Groq 3 LPX 시스템에서 수행한 테스트다. 입력 토큰 100,000개를 사용한 310억 파라미터 Gemma 4 모델에서, 이 시스템은 초당 중앙값 3,431개의 출력 토큰을 생성했다.
NVIDIA는 발표에서 이 결과를 초당 3,400개 토큰으로 반올림했으며, 비교 대상 중 가장 빠른 공개 엔드포인트의 초당 870개 토큰 결과보다 약 4배라고 설명했다. 더 짧은 10,000토큰 컨텍스트에서 LPX 시스템은 초당 중앙값 3,382개의 출력 토큰을 기록했으며, 해당 차트에 포함된 가장 빠른 공개 엔드포인트는 1,402개였다.
Artificial Analysis와 NVIDIA는 테스트된 출력이 벤치마크 구성에서 모델 정밀도나 품질을 잃지 않았다고도 보고했다. 그러나 LPX 측정치는 일반적으로 이용 가능한 GroqCloud 엔드포인트가 아니라 NVIDIA 자체 데이터센터에서 실행된 시스템에서 나왔다. 따라서 이는 하드웨어 구성의 잠재적 속도를 입증할 뿐, 고객이 Groq에서 받게 될 가격, 용량, 혼잡 특성 또는 엔드투엔드 지연 시간을 입증하는 것은 아니다.
NVIDIA는 같은 모델에서 오픈소스 SPEED-Bench 코딩 워크로드도 별도로 실행했다. 초당 중앙값 4,767개의 출력 토큰 생성 속도와 P80 기준 초당 5,520개 토큰을 보고했다. 이 코딩 결과는 Artificial Analysis 측정과 달리 공급업체가 직접 실행한 것이므로, 그에 맞게 해석해야 한다.
출력 토큰 속도는 시스템이 토큰 반환을 시작한 뒤의 생성 단계만 측정한다. 애플리케이션의 전체 응답 시간에는 여전히 프롬프트 처리, 큐잉, 네트워크 지연, 도구 실행, 모델 추론, Rubin 랙과 LPX 랙 간 전송이 포함된다. 생성이 병목일 때 더 빠른 디코드는 에이전트 루프를 크게 단축할 수 있지만, 에이전트 작업의 모든 단계를 비례해서 더 빠르게 만들지는 않는다.
4. 이 배포가 GroqCloud를 바꾸는 이유
계획된 도입은 Groq와 NVIDIA가 2025년 12월 체결한 비독점 추론 기술 라이선스 계약에서 시작된 관계를 심화한다. 이 계약에 따라 Groq 창립자 Jonathan Ross, 당시 사장 Sunny Madra 및 다른 팀원들은 라이선스된 기술을 발전시키기 위해 NVIDIA에 합류했다. Groq는 독립 회사로 남았고 GroqCloud도 계속 운영됐다.
NVIDIA는 이후 이 기술을 NVIDIA 브랜드의 Groq 3 LPU 및 LPX 플랫폼에 통합했다. Groq는 2026년 8월 12일 NVIDIA Cloud Partner 프로그램에 가입해 NVIDIA 레퍼런스 아키텍처와 운영 표준에 따라 NVIDIA 가속 컴퓨팅 인프라를 설계하고 운영할 수 있는 인증을 받았다.
새 발표는 이 관계를 기술 라이선싱과 인증 단계에서 명시된 프로덕션 배포 단계로 옮긴다. 자체 LPU 인프라를 중심으로 클라우드 정체성을 구축한 Groq는 이제 라이선스된 Groq 기술의 NVIDIA 상용 구현을 Vera Rubin GPU와 함께 운영할 계획이다.
개발자에게 실질적인 변화는 완전한 랙 스케일 시스템을 구매하고 운영하는 대신, Groq의 기존 클라우드를 통해 이 이기종 하드웨어에 액세스할 수 있게 될 가능성이다. Groq는 앞서 고객이 애플리케이션 코드를 변경하지 않고 미래의 NVIDIA 용량을 이용하게 될 것이라고 밝혔지만, LPX가 기존 모델 식별자와 API 엔드포인트를 사용할지 또는 별도의 서비스 티어를 요구할지는 아직 문서화하지 않았다.
이 결정은 또한 GroqCloud를 단일 하드웨어 계보 너머로 확장한다. Groq는 LPU 추론 운영 경험을 NVIDIA의 GPU, 네트워킹, 오케스트레이션 및 랙 스케일 생태계와 결합할 수 있으며, Dell은 물리적 배포 경로의 일부를 담당한다.
여전히 확인되지 않은 사항은 상업적으로 중요하다. Groq는 개발자가 언제 LPX에 프로덕션 요청을 보낼 수 있는지, 어떤 모델이 지원되는지, 액세스가 일반적으로 제공될지 또는 예약 방식일지, 가격과 서비스 수준 보장이 기존 GroqCloud 제품과 어떻게 비교될지를 발표하지 않았다. NVIDIA가 LPX가 양산 단계에 진입했다고 선언한 것은 플랫폼이 제조 규모에 도달했다는 의미이며, Groq의 서비스가 이미 라이브 상태라는 뜻은 아니다.
자주 묻는 질문
Groq는 NVIDIA Groq 3 LPX를 배포하는 최초의 클라우드 제공업체인가요?
아니다. NVIDIA는 이 플랫폼을 프로덕션에 도입하는 최초의 AI 클라우드로 Nebius를 지목했다. Groq는 가장 이른 도입업체 중 하나가 될 것이라고 밝혔다.
Groq 3 LPX는 언제 GroqCloud에서 이용할 수 있나요?
Groq는 출시일을 발표하지 않았다. 초기 지역, 용량, 지원 모델 또는 액세스 요건도 공개하지 않았다.
Dell Technologies는 무엇을 제공하나요?
Dell은 통합 컴퓨팅, 네트워킹 및 공급망 지원을 포함해 Groq가 LPX 및 Vera Rubin NVL72 인프라를 대규모로 배포하도록 지원한다. 정확한 시스템 구성은 공개되지 않았다.
Groq 3 LPX는 Vera Rubin NVL72를 대체하나요?
아니다. LPX는 Vera Rubin NVL72와 함께 작동하도록 설계됐으며, Rubin GPU가 상호 보완적인 추론 작업을 처리하는 동안 지연 시간에 민감한 토큰 생성을 가속한다.
초당 3,431토큰 벤치마크는 GroqCloud 성능을 나타내나요?
아니다. Artificial Analysis는 NVIDIA가 운영한 LPX 시스템을 측정했다. Groq는 계획된 배포에 관한 프로덕션 엔드포인트 성능이나 가격을 공개하지 않았다.
참고 자료
- X의 Groq 원문 발표
- Groq: NVIDIA Groq 3 LPX 및 Vera Rubin NVL72를 시장에 가장 먼저 선보이는 기업 중 하나
- NVIDIA: Groq 3 LPX, 이제 양산 단계 진입
- NVIDIA 기술 블로그: Groq 3 LPX의 롱 컨텍스트 성능
- NVIDIA 기술 블로그: Groq 3 LPX 아키텍처 내부
- Groq: NVIDIA Cloud Partner 발표
- Groq: 비독점 NVIDIA 라이선스 계약
- SiliconANGLE: Groq 3 LPX, 양산 단계 진입
- Tom’s Hardware: Groq 3 LPU 및 LPX, Rubin 플랫폼에 합류
Share