Groq Sẽ Triển Khai NVIDIA Groq 3 LPX và Vera Rubin NVL72 Cùng Dell
Groq dự kiến bổ sung năng lực NVIDIA Groq 3 LPX và Vera Rubin NVL72 vào GroqCloud thông qua quan hệ đối tác triển khai với Dell.
1. Groq Cam Kết Với Nền Tảng Suy Luận Mới Của NVIDIA
Groq dự kiến triển khai NVIDIA Groq 3 LPX cùng NVIDIA Vera Rubin NVL72 trong GroqCloud, mở ra lộ trình để nhà cung cấp suy luận độc lập này cung cấp kiến trúc độ trễ thấp mới nhất của NVIDIA thông qua nền tảng đám mây hiện có. Dell Technologies sẽ cung cấp hạ tầng triển khai và hỗ trợ mở rộng việc đưa các hệ thống này vào vận hành.
Thông báo được đưa ra vào ngày 24 tháng 8 năm 2026, cùng ngày NVIDIA cho biết Groq 3 LPX đã bước vào giai đoạn sản xuất toàn diện. Groq tự mô tả là “among the first adopters,” chứ không phải đơn vị đầu tiên: NVIDIA xác định Nebius là đám mây AI đầu tiên được lên lịch đưa nền tảng này vào sản xuất, với Groq theo sau như một nhà cung cấp sớm khác.
Sự phân biệt này quan trọng vì không công ty nào cho biết năng lực LPX của Groq đã sẵn sàng cho khách hàng. Groq không công bố ngày kích hoạt, khu vực triển khai, số lượng rack, danh sách mô hình được hỗ trợ, cấu hình API, quy trình đặt trước hoặc giá token. Thông báo của hãng nhất quán mô tả quyền truy cập của khách hàng ở thì tương lai.
Khi năng lực này đi vào hoạt động, Groq dự định cung cấp nó thông qua hạ tầng vốn đã được sử dụng cho suy luận sản xuất. Công ty cho biết GroqCloud phục vụ hơn sáu triệu nhà phát triển và hàng nghìn công ty AI-native, xử lý hàng nghìn tỷ token mỗi tuần, đồng thời vận hành các trung tâm dữ liệu tại Bắc Mỹ, châu Âu, Trung Đông và châu Á - Thái Bình Dương. Các số liệu vận hành này là thông tin do công ty công bố, không phải các phép đo được kiểm toán độc lập.
Vai trò Dell nêu ra là giúp biến kiến trúc rack của NVIDIA thành hạ tầng có thể triển khai, bằng năng lực tính toán, mạng, tích hợp và chuỗi cung ứng của mình. Các bên không xác định những hệ thống Dell cụ thể liên quan hoặc công bố các điều khoản thương mại của thỏa thuận.
2. Groq 3 LPX Bổ Sung Gì Cho Vera Rubin
NVIDIA Groq 3 LPX là bộ tăng tốc suy luận ở quy mô rack, được xây dựng quanh 256 chip Groq 3 LPU. Thay vì là sản phẩm thay thế độc lập cho Vera Rubin NVL72, nó được thiết kế để hoạt động bên cạnh rack GPU và chuyên xử lý việc sinh token nhạy cảm với độ trễ.
Một rack LPX hoàn chỉnh gồm 32 khay tính toán 1U làm mát bằng chất lỏng, mỗi khay mang tám LPU. NVIDIA liệt kê 315 petaflop FP8 năng lực tính toán suy luận, 128 GB SRAM trên chip tổng hợp, 40 petabyte mỗi giây băng thông SRAM và 640 terabyte mỗi giây băng thông scale-up cho mỗi rack. Mỗi LPU cung cấp 500 MB SRAM, 150 TB/s băng thông SRAM và 2.5 TB/s băng thông scale-up.
Việc sử dụng SRAM là cốt lõi của thiết kế. SRAM có dung lượng thấp hơn nhiều so với HBM gắn trên các GPU trung tâm dữ liệu hiện đại, nhưng cung cấp băng thông cực cao và thời gian truy cập có thể dự đoán. Kiến trúc do trình biên dịch lập lịch của Groq cũng lập kế hoạch trước cho tính toán, di chuyển bộ nhớ và giao tiếp giữa các chip, nhằm giảm biến thiên độ trễ vốn trở nên rõ rệt trong quá trình sinh nội dung tương tác.
Vera Rubin NVL72 đảm nhiệm phần tổng quát hơn và đòi hỏi bộ nhớ nhiều hơn của hệ thống. NVIDIA mô tả ba cách các rack có thể phân chia công việc suy luận.
Trong cách phân tách prefill và decode thông thường, Vera Rubin xử lý prompt và tạo bộ đệm key-value, sau đó chuyển bộ đệm đó sang LPX để sinh token. Trong cách phân tách attention và feed-forward, GPU Rubin giữ bộ đệm và chạy attention, còn LPX thực thi các lớp feed-forward hoặc mixture-of-experts. LPX cũng có thể chạy một mô hình draft nhỏ hơn cho speculative decoding, trong khi mô hình lớn hơn trên Vera Rubin xác minh các token được đề xuất.
Các cấu hình này nhằm giao việc xử lý ngữ cảnh lớn cùng khối lượng công việc linh hoạt, thông lượng cao cho GPU, đồng thời hướng việc sinh nội dung có thể dự đoán, nhạy cảm với độ trễ đến LPU. Sự phân chia này đặc biệt phù hợp với các tác tử lập trình và những hệ thống khác liên tục kiểm tra ngữ cảnh, tạo phản hồi, gọi công cụ, quan sát kết quả rồi bắt đầu một lượt suy luận khác.
3. Bằng Chứng Hiệu Năng Đã Công Bố
Kết quả hiệu năng cụ thể nhất là thử nghiệm do Artificial Analysis thực hiện trên một hệ thống NVIDIA Groq 3 LPX do NVIDIA vận hành. Khi sử dụng mô hình Gemma 4 31 tỷ tham số với 100,000 token đầu vào, hệ thống tạo ra trung vị 3,431 token đầu ra mỗi giây.
NVIDIA làm tròn kết quả đó thành 3,400 token mỗi giây trong thông báo của mình và mô tả đây là xấp xỉ gấp bốn lần kết quả 870 token mỗi giây của endpoint công khai nhanh nhất trong phép so sánh. Ở ngữ cảnh ngắn hơn gồm 10,000 token, hệ thống LPX ghi nhận trung vị 3,382 token đầu ra mỗi giây, so với 1,402 của endpoint công khai nhanh nhất có trong biểu đồ đó.
Artificial Analysis và NVIDIA cũng báo cáo rằng đầu ra được thử nghiệm không làm mất độ chính xác hoặc chất lượng mô hình theo cấu hình benchmark. Tuy nhiên, các phép đo LPX đến từ một hệ thống chạy trong các trung tâm dữ liệu riêng của NVIDIA, thay vì một endpoint GroqCloud được cung cấp rộng rãi. Do đó, chúng xác lập tốc độ tiềm năng của cấu hình phần cứng, chứ không phải giá, năng lực, hành vi khi tắc nghẽn hoặc độ trễ đầu cuối mà khách hàng sẽ nhận được từ Groq.
NVIDIA cũng chạy khối lượng công việc lập trình SPEED-Bench mã nguồn mở trên cùng mô hình. Hãng báo cáo tốc độ sinh trung vị 4,767 token đầu ra mỗi giây và kết quả P80 là 5,520 token mỗi giây. Kết quả lập trình này do nhà cung cấp tự chạy, không giống phép đo của Artificial Analysis, và cần được đánh giá theo bối cảnh đó.
Tốc độ token đầu ra cũng chỉ đo giai đoạn sinh sau khi hệ thống bắt đầu trả token. Tổng thời gian phản hồi của một ứng dụng vẫn bao gồm xử lý prompt, xếp hàng, độ trễ mạng, thực thi công cụ, suy luận của mô hình và mọi lần chuyển dữ liệu giữa các rack Rubin và LPX. Decode nhanh hơn có thể rút ngắn đáng kể các vòng lặp tác tử khi sinh nội dung là nút thắt, nhưng không khiến mọi bước của một tác vụ tác tử nhanh hơn theo tỷ lệ tương ứng.
4. Vì Sao Việc Triển Khai Thay Đổi GroqCloud
Việc triển khai dự kiến này làm sâu sắc thêm mối quan hệ bắt đầu với thỏa thuận cấp phép công nghệ suy luận không độc quyền giữa Groq và NVIDIA vào tháng 12 năm 2025. Theo thỏa thuận đó, nhà sáng lập Groq Jonathan Ross, chủ tịch khi đó Sunny Madra và các thành viên khác trong nhóm đã gia nhập NVIDIA để thúc đẩy công nghệ được cấp phép. Groq vẫn là công ty độc lập và GroqCloud tiếp tục vận hành.
Sau đó, NVIDIA đã tích hợp công nghệ này vào nền tảng Groq 3 LPU và LPX mang thương hiệu NVIDIA. Groq gia nhập chương trình NVIDIA Cloud Partner vào ngày 12 tháng 8 năm 2026, được chứng nhận để thiết kế và vận hành hạ tầng điện toán tăng tốc của NVIDIA theo các kiến trúc tham chiếu và tiêu chuẩn vận hành của NVIDIA.
Thông báo mới chuyển mối quan hệ đó từ cấp phép công nghệ và chứng nhận sang một triển khai sản xuất đã được xác định. Groq, công ty xây dựng danh tính đám mây quanh hạ tầng LPU của riêng mình, giờ dự kiến vận hành hiện thực thương mại của NVIDIA đối với công nghệ Groq được cấp phép cùng các GPU Vera Rubin.
Đối với nhà phát triển, thay đổi thực tế là triển vọng truy cập phần cứng không đồng nhất này qua đám mây hiện có của Groq, thay vì mua và vận hành các hệ thống hoàn chỉnh ở quy mô rack. Groq trước đây cho biết khách hàng sẽ nhận được năng lực NVIDIA trong tương lai mà không cần thay đổi mã ứng dụng, nhưng hãng chưa ghi nhận liệu LPX sẽ sử dụng các định danh mô hình và endpoint API hiện có hay yêu cầu một tầng dịch vụ riêng biệt.
Quyết định này cũng mở rộng GroqCloud vượt khỏi một dòng phần cứng duy nhất. Nó cho phép Groq kết hợp kinh nghiệm vận hành suy luận LPU với hệ sinh thái GPU, mạng, điều phối và quy mô rack của NVIDIA, trong khi Dell đảm trách một phần con đường triển khai vật lý.
Những điều vẫn chưa được xác nhận có ý nghĩa thương mại quan trọng. Groq chưa công bố khi nào nhà phát triển có thể gửi yêu cầu sản xuất đến LPX, những mô hình nào sẽ được hỗ trợ, quyền truy cập có được cung cấp rộng rãi hay theo hình thức đặt trước, hoặc giá và bảo đảm mức dịch vụ sẽ so sánh thế nào với các dịch vụ GroqCloud hiện có. Việc NVIDIA tuyên bố LPX đã ở giai đoạn sản xuất toàn diện nghĩa là nền tảng đã đạt quy mô sản xuất; điều đó không có nghĩa dịch vụ của Groq đã hoạt động.
Câu hỏi thường gặp
Groq có phải nhà cung cấp đám mây đầu tiên triển khai NVIDIA Groq 3 LPX không?
Không. NVIDIA gọi Nebius là đám mây AI đầu tiên đưa nền tảng này vào sản xuất. Groq cho biết họ sẽ thuộc nhóm các đơn vị áp dụng sớm nhất.
Khi nào Groq 3 LPX sẽ có mặt trên GroqCloud?
Groq chưa công bố ngày ra mắt. Hãng cũng chưa tiết lộ các khu vực ban đầu, năng lực, mô hình được hỗ trợ hoặc yêu cầu truy cập.
Dell Technologies cung cấp gì?
Dell đang hỗ trợ Groq triển khai hạ tầng LPX và Vera Rubin NVL72 ở quy mô lớn, bao gồm hỗ trợ tính toán, mạng và chuỗi cung ứng tích hợp. Cấu hình hệ thống chính xác chưa được công bố.
Groq 3 LPX có thay thế Vera Rubin NVL72 không?
Không. LPX được thiết kế để hoạt động cùng Vera Rubin NVL72, tăng tốc việc sinh token nhạy cảm với độ trễ trong khi GPU Rubin xử lý công việc suy luận bổ trợ.
Benchmark 3,431 token mỗi giây có đại diện cho hiệu năng GroqCloud không?
Không. Artificial Analysis đo một hệ thống LPX do NVIDIA vận hành. Groq chưa công bố hiệu năng endpoint sản xuất hoặc giá cho việc triển khai dự kiến của mình.
Tham khảo nguồn
- Thông báo Groq gốc trên X
- Groq: Groq thuộc nhóm đầu tiên đưa NVIDIA Groq 3 LPX và Vera Rubin NVL72 ra thị trường
- NVIDIA: Groq 3 LPX hiện đã sản xuất toàn diện
- Blog kỹ thuật NVIDIA: Hiệu năng Groq 3 LPX ở ngữ cảnh dài
- Blog kỹ thuật NVIDIA: Bên trong kiến trúc Groq 3 LPX
- Groq: Thông báo NVIDIA Cloud Partner
- Groq: Thỏa thuận cấp phép không độc quyền với NVIDIA
- SiliconANGLE: Groq 3 LPX bước vào sản xuất toàn diện
- Tom’s Hardware: Groq 3 LPU và LPX gia nhập nền tảng Rubin
Share