Marin Bắt đầu huấn luyện mở một mô hình MoE 535B tham số
Marin đã bắt đầu một lượt huấn luyện MoE 535B tham số công khai trên 18,75 nghìn tỷ token, với mã nguồn, nhật ký và dự báo mở rộng được công bố công khai.
1. Một lượt chạy 535B tham số được thực hiện công khai
Marin đã bắt đầu huấn luyện Marin 535B-A23B, một mô hình ngôn ngữ mixture-of-experts với khoảng 535 tỷ tham số tổng cộng và 23 tỷ tham số hoạt động cho mỗi token. Dự án dự kiến xử lý 18,75 nghìn tỷ token bằng 11 hệ thống NVIDIA GB200 NVL72 trong khoảng ba tháng.
Kế hoạch được công bố phân bổ 80% ngân sách token cho tiền huấn luyện và 20% cho huấn luyện trung gian. Huấn luyện hậu kỳ sẽ diễn ra sau đó, nhưng Marin chưa công bố công thức hoặc thời biểu hậu huấn luyện cuối cùng. Dự án ước tính lượt chạy chính sẽ cần khoảng \(2.7 \times 10^{24}\) phép toán dấu phẩy động.
Mỗi GB200 NVL72 là một hệ thống quy mô rack, gồm 72 GPU Blackwell và 36 CPU Grace. Mười một hệ thống như vậy tương ứng với quy mô phần cứng 792 GPU, mặc dù báo cáo triển khai expert-parallel của Marin mô tả một miền expert-parallel 64 GPU bên trong mỗi rack huấn luyện.
Đây không phải là đợt phát hành mô hình. Tính đến ngày 24 tháng 8, quá trình huấn luyện đang diễn ra, nên chưa có trọng số cuối cùng, kết quả benchmark hoặc đánh giá hậu huấn luyện để xem xét. Ý nghĩa trước mắt của nó là quyết định công khai một nỗ lực huấn luyện ở quy mô này ngay trong khi nó diễn ra, thay vì chỉ công bố báo cáo kỹ thuật sau khi đã chọn được các kết quả thành công.
Issue công khai của Marin cho lượt chạy này được mở vào ngày 18 tháng 8. Nó gồm kế hoạch vận hành, rủi ro kỹ thuật, phương pháp mở rộng, đề xuất kéo dài ngữ cảnh và quy trình dự phòng. Một báo cáo Weights & Biases được liên kết cung cấp giao diện theo dõi trực tiếp của dự án.
Thông báo nêu rõ 18,75 nghìn tỷ token, trong khi tiêu đề issue trên GitHub viết tắt lượt chạy là “18T tokens.” Con số chính xác hơn là con số được sử dụng trong kế hoạch voyage công khai; dự án chưa trình bày tiêu đề ngắn hơn này như một ngân sách đã được sửa đổi.
2. Cách tổ chức mô hình thưa
Marin 535B-A23B sử dụng 48 khối transformer. Mỗi khối kết hợp một nhánh attention với một nhánh MoE thưa chứa 384 expert được định tuyến. Router chọn tám expert cho mỗi token, trong khi hai expert dùng chung vẫn cục bộ và xử lý mọi token độc lập với đường định tuyến.
Trạng thái mô hình rộng 6.144 giá trị. Trước khi các kích hoạt được định tuyến được trao đổi giữa các GPU, một phép chiếu latent nén chúng xuống 3.072 giá trị. Marin cho biết điều này giảm một nửa chiều rộng của lưu lượng kích hoạt đi qua phép all-to-all expert-parallel. Đầu ra được chiếu trở lại chiều rộng mô hình trước khi kết hợp với đường expert dùng chung.
Bài toán truyền tải này là đáng kể. Với 384 expert được định tuyến phân bố trên một miền expert-parallel 64 GPU, mỗi GPU lưu trữ sáu expert được định tuyến. Việc gửi các buffer có kích thước riêng cho từng expert sẽ tạo ra yêu cầu bộ nhớ khó xử lý và các mẫu giao tiếp động.
Thay vào đó, Marin đã phát triển một triển khai all-to-all pooled-wave cố định cho JAX và XLA. Một bên gửi tạo một pool cố định cho mỗi GPU đích, thay vì một buffer cho từng expert. Việc truyền diễn ra trong ba wave tuần tự với hình dạng mảng giống hệt nhau, còn mã định danh expert được đóng gói vào payload kích hoạt. Cách này tránh phải trao đổi riêng số lượng token hoặc metadata định tuyến.
Triển khai sử dụng hai giới hạn dung lượng. Hệ số dung lượng bên gửi 1,10 giới hạn lượng lưu lượng gửi từ một nguồn tới một đích, trong khi hệ số dung lượng bên nhận 1,15 giới hạn số hàng được gán cho một expert cục bộ riêng lẻ. Các phép gán vượt quá một trong hai buffer cố định đều bị loại bỏ và được báo cáo riêng.
Một gate 20 bước trên một rack đã hoàn tất mà không gặp lỗi hết bộ nhớ và ghi nhận thông lượng trung vị 250.691 token mỗi giây từ bước hai đến bước 19. Marin nhấn mạnh rằng phép thử ngắn này không xác lập tỷ lệ loại token cuối cùng. Đây là kết quả kiểm định kỹ thuật, không phải benchmark chất lượng huấn luyện hay phép đo của toàn bộ lượt chạy 11 rack.
Báo cáo cũng ghi nhận các cấu hình thất bại. Một thiết kế expert-cell cố định trực tiếp tạo ra ước tính bộ nhớ XLA 192,65 GiB và thất bại khi cấp phát CUDA 123,49 GiB. Một bank bên nhận sáu expert cũng hết bộ nhớ, trong khi việc chia công việc thành ba wave chỉ duy trì hoạt động một phần của bank đó tại một thời điểm. Các kết quả âm này là một phần trong hồ sơ thiết kế được công bố của dự án.
3. Một thang mở rộng có trước lượt chạy chính
Trước khi khởi chạy mô hình 535B, Marin đã huấn luyện một thang mở rộng bốn nấc. Thang này bắt đầu với một MoE 1,6B tham số, kích hoạt 61 triệu tham số và được huấn luyện trên 48 tỷ token. Nấc lớn nhất chứa 27,7 tỷ tham số tổng cộng, kích hoạt 1,2 tỷ tham số và xử lý 926 tỷ token.
Thang này vừa đóng vai trò dự báo vừa là tham chiếu chẩn đoán. Marin có thể so sánh loss, chuẩn gradient, việc loại token và quỹ đạo đánh giá của lượt chạy chính với các mẫu quan sát ở quy mô nhỏ hơn. Một sai lệch đáng kể có thể kích hoạt điều tra trước khi lượt chạy đầy đủ tiêu tốn nhiều tháng tính toán.
Theo dự án, thang này tiêu tốn khoảng 1% lượng tính toán của lượt chạy chính. Marin xem chi phí đó là một dạng kiểm soát rủi ro: nó kiểm tra liệu kiến trúc đã chọn, hỗn hợp dữ liệu, thiết lập optimizer và thời hạn huấn luyện có hành xử nhất quán khi kích thước mô hình tăng lên hay không.
Dự án cho biết một thang trước đó đã phát hiện chuẩn gradient tăng vượt bốn khi chân trời token được mở rộng. Phát hiện đó dẫn đến việc sử dụng logit z-loss. Các ablation sau đó được cho là đã chỉ ra rằng một số cấu hình batch lớn có thể phân kỳ trong quá trình huấn luyện nếu không có biện pháp này.
Các lượt chạy nhỏ hơn không bảo đảm mô hình 535B sẽ đi theo dự báo của chúng. Ngoại suy vẫn là một trong những bất định trung tâm của thí nghiệm. Giá trị thực tiễn của chúng là Marin đã công bố một đường cơ sở để người ngoài có thể đánh giá các can thiệp được thực hiện trong lượt chạy khoảng 100 ngày.
Marin cũng đã ghi lại một phương án dự phòng cho trường hợp chậm trễ hạ tầng hoặc mức sử dụng FLOP mô hình thấp hơn dự kiến. Trong khoảng quý đầu tiên của ngân sách token, phản hồi mặc định sẽ là rút ngắn chân trời token, điều chỉnh hỗn hợp dữ liệu và điều chỉnh lại thời điểm suy giảm learning rate tuyến tính để nó vẫn đạt 5% mức cực đại tại điểm kết thúc đã sửa đổi. Điều này có nghĩa lịch trình được công bố vẫn là một kế hoạch vận hành thay vì một đặc tả bất biến.
4. Ngữ cảnh dài phụ thuộc vào việc giải quyết loại token
Mô hình bắt đầu tiền huấn luyện với độ dài chuỗi 4.096 token. Lượt chạy lớn trước đó của Marin bắt đầu ở 8K, mở rộng lên 65K cho một nghìn tỷ token và được lên lịch cho một lần mở rộng 262K về sau. Trở lại 4K giúp mỗi batch có số chuỗi riêng lẻ gấp đôi so với 8K, điều này sẽ phân bổ token đồng đều hơn giữa các expert.
Lựa chọn đó xử lý một điểm yếu trong triển khai expert-parallel hiện tại. Trong các thử nghiệm trước đây, tỷ lệ loại token tăng từ khoảng 7% ở ngữ cảnh 4K lên khoảng 40% ở 65K. Marin báo cáo rằng thiết kế pooled-wave mới hơn của họ loại khoảng 3% ở 4K, nhưng dự kiến tỷ lệ tại 65K vẫn có thể quá cao.
Các phép gán bị loại không nhất thiết có nghĩa toàn bộ token biến mất. Hai expert dùng chung tiếp tục xử lý mọi token, và tám expert được định tuyến được chọn là bổ sung cho đường dùng chung đó. Marin cho biết các expert dùng chung cung cấp một xương sống dày đặc hơn khi các phép gán được định tuyến vượt quá dung lượng sẵn có, nhưng tỷ lệ loại cao vẫn có thể làm giảm lợi ích của các expert thưa và thay đổi hành vi huấn luyện.
Dự án dự kiến thực hiện một cooldown sớm kéo dài một đến hai ngày vào khoảng 10 đến 20 ngày sau khi bắt đầu lượt chạy. Nhánh này nhằm cung cấp một checkpoint quy mô đầy đủ cho các thí nghiệm reinforcement learning và kiểm tra tác động của ngữ cảnh dài hơn tới việc định tuyến mà không làm thay đổi quỹ đạo huấn luyện chính.
Nếu thí nghiệm đó ổn định, lịch trình ngữ cảnh tạm thời sẽ chuyển từ 4K lên 8K ở giữa quá trình huấn luyện, từ 8K lên 65K ở khoảng 95%, rồi tới giai đoạn 262K mục tiêu gần cuối. Đây là các mục tiêu có điều kiện, không phải các năng lực đã được xác nhận của một mô hình hoàn chỉnh.
Marin liệt kê ba phương án thay thế nếu việc loại token vẫn quá cao: áp dụng triển khai all-to-all ragged không loại token, tăng hệ số dung lượng và chấp nhận chi phí bộ nhớ đi kèm, hoặc đưa vào cân bằng ở cấp độ chuỗi. Phương án cuối có thể buộc các expert chuyên biệt hóa lại trong khi huấn luyện, nên dự án hiện xem đây là phương án dự phòng.
5. Điều khiến lượt chạy này trở thành một cột mốc phát triển mở
Marin phân biệt phát triển mở với việc phát hành trọng số sau huấn luyện. Quy trình chuẩn của họ bắt đầu bằng một GitHub issue ghi lại các giả thuyết và mục tiêu của thí nghiệm. Phần triển khai được gửi dưới dạng mã nguồn có thể review, việc thực thi được liên kết với telemetry công khai, và quá trình phân tích—bao gồm cả những lần thử thất bại—được đưa trở lại issue.
Với lượt chạy 535B, hồ sơ công khai đã bao gồm issue hero-run, báo cáo theo dõi trực tiếp, kho mã nguồn và một bản tường trình chi tiết về triển khai truyền tải expert. Báo cáo truyền tải tách biệt các kết quả đo được khỏi những đánh giá kỹ thuật, đồng thời chỉ rõ kết luận nào chỉ dựa trên các lượt profiling ngắn.
Hồ sơ đó mang lại cho các nhà nghiên cứu một cách để đánh giá liệu dự báo mở rộng có đứng vững khi tiếp xúc với mô hình đầy đủ hay không. Nó cũng phơi bày những quyết định mà model card cuối cùng thường cô đọng thành vài dòng: vì sao lượt chạy bắt đầu ở ngữ cảnh 4K, các phép gán token bị loại ở đâu, các ràng buộc bộ nhớ đã thay đổi thiết kế truyền tải như thế nào và nhóm dự kiến làm gì nếu việc huấn luyện chậm tiến độ.
Tài liệu mở không khiến thí nghiệm chính trở nên rẻ để tái tạo. Việc lặp lại một lượt chạy 11 rack vẫn vượt quá nguồn lực của hầu hết nhà nghiên cứu độc lập. Các hiện vật dễ tiếp cận hơn là mã nguồn, các lượt chạy mở rộng nhỏ hơn, phân tích thất bại, lựa chọn cấu hình và các phép đo trực tiếp có thể được kiểm tra hoặc thử nghiệm ở quy mô thu nhỏ.
Do đó, trạng thái của dự án cần được mô tả một cách hẹp: Marin đã bắt đầu một lượt huấn luyện quy mô frontier được ghi chép công khai. Dự án chưa chứng minh chất lượng của mô hình cuối cùng, hành vi ngữ cảnh dài, hiệu năng hậu huấn luyện hoặc việc phát hành hiện vật cuối cùng.
Câu hỏi thường gặp
“535B-A23B” nghĩa là gì?
Mô hình có khoảng 535 tỷ tham số tổng cộng, trong khi khoảng 23 tỷ tham số hoạt động cho mỗi token. Định tuyến thưa chọn tám trong số 384 expert được định tuyến tại mỗi khối transformer.
Hiện có thể tải xuống mô hình đã hoàn thiện không?
Không. Quá trình huấn luyện vẫn đang diễn ra, và Marin chưa phát hành trọng số cuối cùng hoặc đánh giá hậu huấn luyện cho lượt chạy này.
Vì sao quá trình huấn luyện chỉ bắt đầu với ngữ cảnh 4K?
Độ dài chuỗi 4K đặt nhiều chuỗi riêng biệt hơn vào mỗi batch, giúp cân bằng expert tốt hơn. Marin đang thử nghiệm các ngữ cảnh dài hơn vì những triển khai trước đó đã gặp tình trạng loại token tăng mạnh ở 65K.
Các nhà nghiên cứu có thể theo dõi lượt chạy bằng cách nào?
Marin cung cấp một GitHub issue công khai, kho mã nguồn, báo cáo thiết kế expert-parallel và một trang theo dõi Weights & Biases được liên kết.
Độ dài ngữ cảnh 262K có được đảm bảo không?
Không. Các phần mở rộng được đề xuất lên 8K, 65K và 262K phụ thuộc vào kết quả từ các thí nghiệm cooldown sớm và loại token.
Tham khảo nguồn
Share