Marin, 5,350억 파라미터 MoE 모델의 공개 학습 시작
Marin이 공개 코드, 로그, 스케일링 예측을 갖춘 18.75조 토큰 규모의 5,350억 파라미터 MoE 학습을 시작했다.
1. 공개적으로 진행되는 5,350억 파라미터 학습
Marin은 총 약 5,350억 개의 파라미터와 토큰당 230억 개의 활성 파라미터를 갖춘 Mixture-of-Experts 언어 모델 Marin 535B-A23B의 학습을 시작했다. 이 프로젝트는 약 3개월에 걸쳐 NVIDIA GB200 NVL72 시스템 11대를 사용해 18.75조 토큰을 처리할 계획이다.
공개된 계획은 토큰 예산의 80%를 사전학습에, 20%를 중간학습에 배정한다. 이후 사후학습이 진행될 예정이지만, Marin은 아직 최종 사후학습 레시피나 일정을 공개하지 않았다. 프로젝트는 주요 학습에 약 \(2.7 \times 10^{24}\)회의 부동소수점 연산이 필요할 것으로 추정한다.
각 GB200 NVL72는 Blackwell GPU 72개와 Grace CPU 36개를 포함하는 랙 규모 시스템이다. 이런 시스템 11대는 GPU 792개 규모의 하드웨어 구성이지만, Marin의 전문가 병렬 구현 보고서는 각 학습 랙 내 64-GPU 전문가 병렬 도메인을 설명한다.
이 학습은 모델 출시가 아니다. 8월 24일 기준으로 학습이 진행 중이므로, 평가할 최종 가중치, 벤치마크 결과, 사후학습 평가는 없다. 당장의 중요성은 성공적인 결과를 선택한 뒤에만 기술 보고서를 내는 대신, 이 정도 규모의 학습 작업을 진행 중에 공개하기로 한 결정에 있다.
Marin의 해당 학습 공개 이슈는 8월 18일에 열렸다. 여기에는 운영 계획, 엔지니어링 위험, 스케일링 방법론, 컨텍스트 확장 제안, 비상 절차가 담겨 있다. 연결된 Weights & Biases 보고서는 프로젝트의 실시간 추적 화면을 제공한다.
발표문은 18.75조 토큰을 명시하는 반면, GitHub 이슈 제목은 이 학습을 “18T tokens”로 축약한다. 더 정확한 수치는 공개 voyage 계획에서 사용된 것이며, 프로젝트는 더 짧은 제목을 수정된 예산으로 제시하지 않았다.
2. 희소 모델의 구성 방식
Marin 535B-A23B는 48개의 트랜스포머 블록을 사용한다. 모든 블록은 어텐션 분기와 384개의 라우팅 전문가를 포함하는 희소 MoE 분기를 결합한다. 라우터는 토큰마다 8개의 전문가를 선택하며, 2개의 공유 전문가는 로컬에 남아 라우팅 경로와 무관하게 모든 토큰을 처리한다.
모델 상태의 폭은 6,144개 값이다. 라우팅된 활성화가 GPU 간에 교환되기 전에 잠재 투영이 이를 3,072개 값으로 압축한다. Marin은 이것이 전문가 병렬 all-to-all 연산을 통과하는 활성화 트래픽의 폭을 절반으로 줄인다고 말한다. 출력은 공유 전문가 경로와 결합되기 전에 다시 모델 폭으로 투영된다.
이 전송 문제는 상당하다. 64-GPU 전문가 병렬 도메인에 384개의 라우팅 전문가가 분산되므로, 각 GPU는 라우팅 전문가 6개를 호스팅한다. 전문가별로 크기가 다른 버퍼를 전송하면 까다로운 메모리 요구 사항과 동적인 통신 패턴이 발생한다.
대신 Marin은 JAX와 XLA를 위한 고정 풀드 웨이브 all-to-all 구현을 개발했다. 송신자는 전문가마다 하나의 버퍼를 만드는 대신 목적지 GPU마다 하나의 고정 풀을 만든다. 전송은 동일한 배열 형태로 세 개의 순차적 웨이브로 발생하며, 전문가 식별자는 활성화 페이로드에 패킹된다. 이는 토큰 수나 라우팅 메타데이터를 별도로 교환할 필요를 없앤다.
이 구현은 두 가지 용량 제한을 사용한다. 송신자 용량 계수 1.10은 한 소스에서 한 목적지로 전송되는 트래픽 양을 제한하고, 수신자 용량 계수 1.15는 개별 로컬 전문가에 할당되는 행 수를 제한한다. 두 고정 버퍼 중 어느 하나를 초과하는 할당은 드롭되며 별도로 보고된다.
20스텝, 단일 랙 게이트는 메모리 부족 실패 없이 완료되었으며, 스텝 2부터 19까지 초당 250,691토큰의 중앙 처리량을 기록했다. Marin은 이 짧은 테스트가 최종 토큰 드롭률을 확립하지는 않는다고 명시적으로 경고한다. 이는 학습 품질 벤치마크나 전체 11랙 학습의 측정치가 아니라 엔지니어링 적격성 결과다.
보고서는 실패한 구성도 기록한다. 직접적인 고정 전문가 셀 설계는 192.65 GiB의 XLA 메모리 추정치를 산출했고 123.49 GiB CUDA 할당에서 실패했다. 6전문가 수신자 뱅크도 메모리 부족이 발생한 반면, 작업을 세 개의 웨이브로 나누면 그 뱅크의 일부만 한 번에 활성화할 수 있었다. 이러한 부정적 결과도 프로젝트의 공개 설계 기록에 포함된다.
3. 주요 학습에 앞선 스케일링 사다리
535B 모델을 시작하기 전에 Marin은 4단계 스케일링 사다리를 학습했다. 이는 6,100만 파라미터를 활성화하는 16억 파라미터 MoE에서 시작해 480억 토큰으로 학습했다. 가장 큰 단계는 총 277억 파라미터로 구성됐고, 12억 파라미터를 활성화했으며, 9,260억 토큰을 처리했다.
이 사다리는 예측이자 진단 기준으로 작동한다. Marin은 주요 학습의 손실, 그래디언트 노름, 토큰 드롭, 평가 추이를 더 작은 규모에서 관측한 패턴과 비교할 수 있다. 큰 편차가 발생하면 전체 학습이 수개월치 컴퓨팅을 소모하기 전에 조사를 시작할 수 있다.
프로젝트에 따르면, 이 사다리의 비용은 주요 학습 컴퓨팅의 약 1%다. Marin은 이 비용을 위험 관리의 한 형태로 본다. 즉, 선택한 아키텍처, 데이터 혼합, 옵티마이저 설정, 학습 기간이 모델 크기가 커져도 일관되게 동작하는지를 검증한다.
프로젝트는 이전 사다리에서 토큰 기간이 늘어날수록 그래디언트 노름이 4를 넘어서 증가하는 현상을 발견했다고 말한다. 이 발견으로 logit z-loss를 사용하게 됐다. 이후 절제 실험에서는 일부 고배치 구성이 그렇지 않으면 학습 중 발산할 수 있음이 나타났다고 보고됐다.
더 작은 학습이 535B 모델이 그 예측을 따를 것이라고 보장하지는 않는다. 외삽은 여전히 실험의 핵심 불확실성 중 하나다. 실질적인 가치는 Marin이 약 100일간의 학습 중 이뤄지는 개입을 외부인이 평가할 수 있는 기준선을 공개했다는 데 있다.
Marin은 인프라 지연이나 예상보다 낮은 모델 FLOP 활용률에 대한 비상 계획도 문서화했다. 토큰 예산의 대략 첫 4분의 1 동안에는 기본 대응으로 토큰 기간을 단축하고, 데이터 혼합을 조정하며, 수정된 종료 시점에서도 학습률이 피크 값의 5%에 도달하도록 선형 학습률 감쇠 시점을 재조정한다. 이는 발표된 일정이 불변의 사양이 아니라 운영 계획임을 의미한다.
4. 긴 컨텍스트는 토큰 드롭 문제 해결에 달려 있다
모델은 4,096토큰 시퀀스 길이로 사전학습을 시작한다. Marin의 이전 대규모 학습은 8K에서 시작해 1조 토큰 동안 65K로 확장됐고, 이후 262K 확장이 예정돼 있었다. 4K로 돌아가면 각 배치에 8K보다 두 배 많은 개별 시퀀스가 들어가므로, 토큰을 전문가들에게 더 균등하게 분배할 수 있다.
이 선택은 현재 전문가 병렬 구현의 약점을 다룬다. 이전 테스트에서 토큰 드롭은 4K 컨텍스트에서 약 7%였으나 65K에서는 약 40%로 증가했다. Marin은 새 풀드 웨이브 설계가 4K에서 약 3%를 드롭한다고 보고하지만, 65K에서의 비율은 여전히 과도할 수 있다고 예상한다.
드롭된 할당이 반드시 전체 토큰이 사라진다는 뜻은 아니다. 두 공유 전문가는 계속해서 모든 토큰을 처리하고, 선택된 8개의 라우팅 전문가는 그 공유 경로에 추가된다. Marin은 라우팅된 할당이 가용 용량을 초과할 때 공유 전문가가 더 조밀한 백본을 제공한다고 말하지만, 높은 드롭률은 여전히 희소 전문가의 이점을 줄이고 학습 동작을 바꿀 수 있다.
프로젝트는 학습 시작 후 약 10~20일 시점에 1~2일간의 조기 쿨다운을 계획하고 있다. 이 분기는 강화학습 실험을 위한 전체 규모 체크포인트를 제공하고, 주요 학습 궤적을 바꾸지 않으면서 더 긴 컨텍스트가 라우팅에 미치는 영향을 시험하기 위한 것이다.
그 실험이 안정적이라면, 잠정 컨텍스트 일정은 학습 중간에 4K에서 8K로, 약 95% 지점에 8K에서 65K로, 그리고 종료 무렵 목표 262K 단계로 이동한다. 이는 완료된 모델의 확정된 기능이 아니라 조건부 목표다.
Marin은 토큰 드롭이 계속 너무 높을 경우 세 가지 대안을 나열한다. 드롭리스 ragged all-to-all 구현을 채택하거나, 용량 계수를 높이고 그에 따른 메모리 비용을 감수하거나, 시퀀스 수준 밸런싱을 도입하는 것이다. 마지막 옵션은 학습 중 전문가가 다시 특화되도록 강제할 수 있으므로, 프로젝트는 현재 이를 대안책으로 취급한다.
5. 이 학습이 공개 개발의 이정표인 이유
Marin은 공개 개발을 학습 후 가중치를 공개하는 것과 구분한다. 표준 워크플로는 실험의 가설과 목표를 기록하는 GitHub 이슈에서 시작한다. 구현은 검토 가능한 코드로 제출되고, 실행은 공개 텔레메트리에 연결되며, 실패한 시도를 포함한 분석은 이슈로 다시 반환된다.
535B 학습의 경우 공개 기록에는 이미 hero-run 이슈, 실시간 추적 보고서, 소스 리포지터리, 전문가 전송 구현에 대한 상세한 설명이 포함된다. 전송 보고서는 측정된 결과와 엔지니어링 판단을 구분하고, 어떤 결론이 짧은 프로파일링 실행에만 근거하는지 명시한다.
이 기록은 연구자들이 스케일링 예측이 전체 모델과 맞닥뜨렸을 때도 유지되는지를 평가할 방법을 제공한다. 또한 최종 모델 카드에서 흔히 몇 줄로 압축되는 결정들을 드러낸다. 예를 들어 학습이 4K 컨텍스트에서 시작하는 이유, 토큰 할당이 어디서 드롭되는지, 메모리 제약이 전송 설계를 어떻게 바꿨는지, 학습이 일정에 뒤처질 경우 팀이 무엇을 할 계획인지가 이에 해당한다.
공개 문서화가 주요 실험을 저렴하게 재현할 수 있게 만드는 것은 아니다. 11랙 학습을 복제하는 일은 여전히 대부분의 독립 연구자가 보유한 자원을 넘어선다. 더 접근하기 쉬운 산출물은 축소된 규모에서 검사하거나 테스트할 수 있는 코드, 더 작은 스케일링 학습, 실패 분석, 구성 선택, 실시간 측정치다.
따라서 프로젝트의 상태는 제한적으로 설명해야 한다. Marin은 공개적으로 문서화된 프런티어 규모 학습을 시작했다. 아직 최종 모델의 품질, 긴 컨텍스트 동작, 사후학습 성능, 최종 산출물 공개를 입증하지는 않았다.
자주 묻는 질문
“535B-A23B”는 무엇을 의미하나요?
이 모델은 총 약 5,350억 개의 파라미터를 가지며, 토큰마다 약 230억 개가 활성화된다. 희소 라우팅은 각 트랜스포머 블록에서 384개의 라우팅 전문가 중 8개를 선택한다.
완성된 모델을 지금 다운로드할 수 있나요?
아니요. 학습은 아직 진행 중이며, Marin은 이번 학습의 최종 가중치나 사후학습 평가를 공개하지 않았다.
왜 학습은 4K 컨텍스트에서 시작하나요?
4K 시퀀스 길이는 각 배치에 더 많은 별도 시퀀스를 배치해 전문가 밸런싱을 개선한다. Marin은 이전 구현에서 65K에서 토큰 드롭이 급격히 높아졌기 때문에 더 긴 컨텍스트를 시험하고 있다.
연구자들은 이 학습을 어떻게 추적할 수 있나요?
Marin은 공개 GitHub 이슈, 소스 리포지터리, 전문가 병렬 설계 보고서, 연결된 Weights & Biases 추적 페이지를 제공한다.
262K 컨텍스트 길이는 보장되나요?
아니요. 8K, 65K, 262K로의 제안된 확장은 조기 쿨다운과 토큰 드롭 실험의 결과에 달려 있다.
참고 자료
Share