Новости ИИЗнаков 10242Время чтения26 мин

Marin начинает открытое обучение MoE-модели с 535 млрд параметров

Marin начала открытый запуск обучения MoE-модели с 535 млрд параметров на 18,75 трлн токенов, публикуя код, логи и прогнозы масштабирования.

1. Публичный запуск на 535 млрд параметров

Marin начала обучение Marin 535B-A23B — языковой модели типа mixture-of-experts с приблизительно 535 млрд совокупных параметров и 23 млрд параметров, активируемых для каждого токена. Проект планирует обработать 18,75 трлн токенов с использованием 11 систем NVIDIA GB200 NVL72 примерно за три месяца.

Опубликованный план отводит 80% бюджета токенов на предобучение и 20% — на промежуточное обучение. Затем последует постобучение, однако Marin пока не опубликовала окончательный рецепт или график постобучения. По оценке проекта, основной запуск потребует приблизительно \(2.7 \times 10^{24}\) операций с плавающей точкой.

Каждая GB200 NVL72 — это стоечная система, содержащая 72 GPU Blackwell и 36 CPU Grace. Одиннадцать таких систем образуют аппаратную инфраструктуру из 792 GPU, хотя отчёт Marin о реализации экспертного параллелизма описывает домен экспертного параллелизма из 64 GPU внутри каждой обучающей стойки.

Этот запуск не является релизом модели. По состоянию на 24 августа обучение продолжается, поэтому отсутствуют окончательные веса, результаты бенчмарков и оценки после постобучения. Его непосредственная значимость состоит в решении раскрыть процесс обучения такого масштаба по ходу работы, а не публиковать технический отчёт лишь после отбора успешных результатов.

Публичный issue Marin для этого запуска был открыт 18 августа. Он содержит операционный план, инженерные риски, методологию масштабирования, предложение по расширению контекста и процедуры на случай непредвиденных обстоятельств. Связанный отчёт Weights & Biases предоставляет поверхность для отслеживания проекта в реальном времени.

В анонсе указаны 18,75 трлн токенов, тогда как заголовок GitHub issue сокращённо называет запуск «18T tokens». Более точная цифра используется в публичном плане запуска; проект не представлял сокращённый заголовок как пересмотренный бюджет.

2. Как организована разреженная модель

Marin 535B-A23B использует 48 трансформерных блоков. Каждый блок объединяет ветвь внимания с разреженной ветвью MoE, содержащей 384 маршрутизируемых эксперта. Маршрутизатор выбирает восемь экспертов для каждого токена, тогда как два общих эксперта остаются локальными и обрабатывают каждый токен независимо от маршрутизируемого пути.

Состояние модели имеет ширину 6 144 значения. Перед обменом маршрутизируемыми активациями между GPU латентная проекция сжимает их до 3 072 значений. Marin заявляет, что это вдвое сокращает ширину трафика активаций, проходящего через операцию all-to-all экспертного параллелизма. Затем выход проецируется обратно до ширины модели, прежде чем объединяется с путём общих экспертов.

Эта задача передачи данных существенна. При распределении 384 маршрутизируемых экспертов по домену экспертного параллелизма из 64 GPU на каждом GPU размещаются шесть маршрутизируемых экспертов. Отправка отдельно выделенных буферов для каждого эксперта создала бы сложные требования к памяти и динамические схемы обмена данными.

Вместо этого Marin разработала реализацию fixed pooled-wave all-to-all для JAX и XLA. Отправитель создаёт один фиксированный пул для каждого GPU-получателя, а не один буфер для каждого эксперта. Передачи происходят в трёх последовательных волнах с идентичными формами массивов, а идентификаторы экспертов упаковываются в полезную нагрузку активаций. Это исключает отдельный обмен числом токенов или метаданными маршрутизации.

Реализация использует два ограничения ёмкости. Коэффициент ёмкости отправителя 1,10 ограничивает объём трафика, отправляемого от одного источника одному получателю, а коэффициент ёмкости получателя 1,15 ограничивает число строк, назначаемых отдельному локальному эксперту. Назначения, выходящие за пределы любого фиксированного буфера, отбрасываются и учитываются отдельно.

20-шаговая проверка на одной стойке завершилась без ошибки нехватки памяти и зафиксировала медианную пропускную способность 250 691 токен в секунду на шагах со второго по 19-й. Marin прямо предупреждает, что этот краткий тест не устанавливает итоговую долю отброшенных токенов. Это результат инженерной квалификации, а не бенчмарк качества обучения или измерение полного запуска на 11 стойках.

В отчёте также задокументированы неудачные конфигурации. Прямая конструкция с фиксированными ячейками экспертов дала оценку памяти XLA в 192,65 GiB и завершилась неудачей при выделении CUDA 123,49 GiB. Банк получателя с шестью экспертами также исчерпал память, тогда как разделение работы на три волны позволяло одновременно поддерживать активной лишь часть этого банка. Эти отрицательные результаты являются частью опубликованной проектной документации.

3. Основному запуску предшествовала лестница масштабирования

Перед запуском модели на 535 млрд параметров Marin обучила лестницу масштабирования из четырёх ступеней. Она началась с MoE-модели на 1,6 млрд параметров, активировавшей 61 млн параметров и обученной на 48 млрд токенов. Крупнейшая ступень содержала 27,7 млрд совокупных параметров, активировала 1,2 млрд параметров и обработала 926 млрд токенов.

Лестница служит одновременно прогнозом и диагностическим ориентиром. Marin может сопоставлять loss основного запуска, нормы градиентов, отбрасывание токенов и траекторию оценок с закономерностями, наблюдавшимися в меньших масштабах. Существенное отклонение может инициировать расследование до того, как полный запуск израсходует месяцы вычислений.

По данным проекта, лестница стоит около 1% вычислений основного запуска. Marin рассматривает эти расходы как форму контроля рисков: они проверяют, ведут ли себя выбранная архитектура, смесь данных, настройки оптимизатора и горизонт обучения последовательно по мере увеличения размера модели.

Проект сообщает, что более ранняя лестница выявила рост нормы градиентов выше четырёх по мере расширения горизонта токенов. Это наблюдение привело к использованию z-loss логитов. Последующие абляции, как сообщается, показали, что некоторые конфигурации с большими батчами в противном случае могут расходиться в ходе обучения.

Меньшие запуски не гарантируют, что модель на 535 млрд параметров последует их прогнозу. Экстраполяция остаётся одной из центральных неопределённостей эксперимента. Их практическая ценность состоит в том, что Marin опубликовала базовую линию, по которой внешние наблюдатели могут оценивать вмешательства, выполняемые во время приблизительно 100-дневного запуска.

Marin также задокументировала план действий на случай задержек инфраструктуры или более низкой, чем ожидалось, утилизации FLOP модели. В течение приблизительно первой четверти бюджета токенов реакцией по умолчанию будет сокращение горизонта токенов, корректировка смеси данных и пересчёт сроков линейного затухания скорости обучения, чтобы она всё ещё достигала 5% пиковой скорости на пересмотренной конечной точке. Это означает, что объявленный график остаётся операционным планом, а не неизменной спецификацией.

4. Длинный контекст зависит от решения проблемы отбрасывания токенов

Модель начинает предобучение с длиной последовательности 4 096 токенов. Предыдущий крупный запуск Marin начинался с 8K, расширялся до 65K на один трлн токенов и был запланирован для последующего расширения до 262K. Возврат к 4K даёт каждому батчу вдвое больше отдельных последовательностей, чем 8K, что должно распределять токены между экспертами более равномерно.

Этот выбор устраняет слабость текущей реализации экспертного параллелизма. В более ранних тестах отбрасывание токенов выросло приблизительно с 7% при контексте 4K до около 40% при 65K. Marin сообщает, что её более новая pooled-wave конструкция отбрасывает примерно 3% при 4K, однако ожидает, что показатель при 65K всё ещё может быть чрезмерным.

Отброшенные назначения не обязательно означают исчезновение всего токена. Два общих эксперта продолжают обрабатывать каждый токен, а восемь выбранных маршрутизируемых экспертов дополняют этот общий путь. Marin заявляет, что общие эксперты обеспечивают более плотную основу, когда маршрутизируемые назначения превышают доступную ёмкость, однако высокий уровень отбрасывания всё равно может уменьшить пользу разреженных экспертов и изменить поведение обучения.

Проект планирует ранний cooldown продолжительностью от одного до двух дней приблизительно через 10–20 дней после начала запуска. Эта ветвь предназначена для получения полноразмерной контрольной точки для экспериментов с обучением с подкреплением и проверки того, как более длинный контекст влияет на маршрутизацию, не меняя основную траекторию обучения.

Если этот эксперимент будет стабильным, предварительный график контекста предполагает переход с 4K на 8K в середине обучения, с 8K на 65K приблизительно при 95%, а затем целевую фазу 262K ближе к концу. Это условные цели, а не подтверждённые возможности завершённой модели.

Marin перечисляет три альтернативы, если отбрасывание токенов останется слишком высоким: внедрить dropless ragged all-to-all, увеличить коэффициент ёмкости и принять сопутствующие затраты памяти либо ввести балансировку на уровне последовательностей. Последний вариант может вынудить экспертов повторно специализироваться во время обучения, поэтому проект пока рассматривает его как резервный.

5. Что делает запуск вехой открытой разработки

Marin отличает открытую разработку от выпуска весов после обучения. Её стандартный рабочий процесс начинается с GitHub issue, в котором фиксируются гипотезы и цели эксперимента. Реализация вносится в виде кода, доступного для ревью, выполнение связано с публичной телеметрией, а анализ — включая неудачные попытки — возвращается в issue.

Для запуска на 535 млрд параметров публичная документация уже включает issue основного запуска, отчёт с отслеживанием в реальном времени, исходный репозиторий и подробное описание реализации транспорта экспертов. Отчёт о транспорте отделяет измеренные результаты от инженерных суждений и указывает, какие выводы опираются лишь на короткие профилировочные запуски.

Эта документация даёт исследователям способ оценить, выдержит ли прогноз масштабирования столкновение с полной моделью. Она также раскрывает решения, которые итоговые карточки моделей часто сжимают до нескольких строк: почему запуск начинается с контекста 4K, где отбрасываются назначения токенов, как ограничения памяти изменили конструкцию транспорта и что команда планирует делать, если обучение отстанет от графика.

Открытая документация не делает основной эксперимент недорогим для воспроизведения. Повторение запуска на 11 стойках остаётся за пределами ресурсов большинства независимых исследователей. Более доступные артефакты — это код, меньшие запуски масштабирования, анализы сбоев, конфигурационные решения и измерения в реальном времени, которые можно изучать или тестировать в уменьшенном масштабе.

Поэтому статус проекта следует описывать узко: Marin начала открыто документируемый запуск обучения фронтирного масштаба. Она ещё не продемонстрировала качество финальной модели, поведение при длинном контексте, производительность после постобучения или итоговый выпуск артефактов.

Частые вопросы

Что означает «535B-A23B»?

Модель имеет приблизительно 535 млрд совокупных параметров, тогда как для каждого токена активируется около 23 млрд. Разреженная маршрутизация выбирает восемь из 384 маршрутизируемых экспертов в каждом трансформерном блоке.

Можно ли уже скачать готовую модель?

Нет. Обучение всё ещё продолжается, и Marin не выпустила окончательные веса или оценки после постобучения для этого запуска.

Почему обучение начинается только с контекста 4K?

Длина последовательности 4K размещает в каждом батче больше отдельных последовательностей, улучшая балансировку экспертов. Marin тестирует более длинные контексты, поскольку в предыдущих реализациях наблюдалось резко более высокое отбрасывание токенов при 65K.

Как исследователи могут следить за запуском?

Marin предоставляет публичный GitHub issue, исходный репозиторий, отчёт о конструкции экспертного параллелизма и связанную страницу отслеживания Weights & Biases.

Гарантирована ли длина контекста 262K?

Нет. Предлагаемые расширения до 8K, 65K и 262K зависят от результатов раннего cooldown и экспериментов по отбрасыванию токенов.

Источники

Share

Поделиться статьёй