OpenBMB выпустила MiniCPM5-2B с весами Apache-2.0 и данными для обучения агентов
MiniCPM5-2B сочетает контекстное окно 128K со скачиваемыми весами, квантованными сборками, промежуточными чекпойнтами и датасетами для обучения агентов.
Содержание · 12
- 1. Что выпустила OpenBMB
- 2. Результат бенчмарка — и важное изменение версии
- 3. Почему важны агентные возможности
- 4. Релиз обучения выходит за рамки весов модели
- 5. Что меняется для локальной разработки ИИ
- Частые вопросы
- Действительно ли MiniCPM5-2B — модель с двумя миллиардами параметров?
- Какова её текущая оценка Artificial Analysis?
- Может ли она работать без подключения к интернету?
- Воспроизводим ли полный процесс обучения по релизу?
- Поддерживает ли MiniCPM5-2B function calling?
- Источники
7 сентября 2026 года OpenBMB выпустила MiniCPM5-2B, сделав свою компактную языковую модель доступной с весами Apache-2.0, несколькими квантованными форматами, промежуточными чекпойнтами, документацией по развёртыванию и значительной частью обучающих данных.
Релиз примечателен сочетанием небольшого размера для развёртывания с измеримыми агентными возможностями. Artificial Analysis сейчас присваивает MiniCPM5-2B оценку 15 по Intelligence Index версии 4.2 — это наивысший результат для модели с открытыми весами и менее чем четырьмя миллиардами параметров в сумме. Этот независимый результат ставит её на четыре пункта выше Granite 4.2 3B и на один уровень с существенно более крупной конфигурацией рассуждений Qwen3.5 9B.
Оценка 23, распространявшаяся в анонсе OpenBMB и исходном посте в X, не является текущей оценкой модели в индексе. Она была получена в Artificial Analysis Intelligence Index v4.1.1. Впоследствии провайдер оценки изменил набор бенчмарков и веса в v4.2, снизив заявленную для MiniCPM5-2B оценку до 15. Результаты этих двух версий напрямую несопоставимы.
1. Что выпустила OpenBMB
MiniCPM5-2B — плотная текстовая каузальная языковая модель на основе стандартной архитектуры LlamaForCausalLM. Несмотря на название продукта, чекпойнт содержит в сумме 2,516,756,480 параметров, из которых 1,981,982,720 не относятся к эмбеддингам. Поэтому Artificial Analysis относит её к моделям с 2.6 миллиарда параметров.
Архитектура включает 42 слоя, attention с grouped-query, 16 головами запросов и двумя головами ключей-значений, а нативная длина контекста составляет 131,072 токена. Стандартная реализация, совместимая с Llama, означает, что распространённые фреймворки инференса могут загружать её без отдельной архитектурной ветки или кастомного ядра.
OpenBMB выпустила не только один чекпойнт, дообученный на инструкциях. Доступные артефакты включают финальную модель BF16, базовый чекпойнт только предобучения, чекпойнт середины обучения, чекпойнт только SFT до reinforcement learning и дистилляции, 4-битную сборку GPTQ, 4-битную сборку MLX, ориентированную на Apple Silicon, а также файлы GGUF для llama.cpp, Ollama и LM Studio.
Официальный репозиторий GGUF содержит файл F16 размером 5.04 GB, квантование Q8_0 размером 2.68 GB и квантование Q4_K_M размером 1.56 GB. Такие размеры делают полностью локальную работу практичной на многих потребительских системах. OpenBMB позиционирует модель как подходящую для edge- и on-device-использования, хотя материалы релиза не содержат независимо проверенных измерений скорости, памяти, батареи или тепловых характеристик, специфичных для телефонов. Само по себе размещение файла модели в хранилище телефона не доказывает приемлемую мобильную производительность на разных устройствах или при длинных контекстах.
Также существует черновая модель DSpark для speculative decoding. При использовании с MiniCPM5-2B через SGLang она предлагает блоки токенов, которые проверяет целевая модель, чтобы ускорить генерацию без изменения принятого вывода целевой модели.
На момент публикации Hugging Face не указывает хостинг-провайдера инференса для основного чекпойнта. Поэтому непосредственный способ доступа — скачать и самостоятельно хостить модель, а не покупать вызовы официального API.
2. Результат бенчмарка — и важное изменение версии
OpenBMB сообщает среднюю оценку 53.9 по 34 оценкам, охватывающим код, математику, следование инструкциям, знания, понимание длинного контекста, использование инструментов и несколько типов агентов. В сравнительной таблице разработчика наивысшая средняя оценка среди перечисленных более крупных эталонных моделей составляет 51.1 у Qwen3.5-4B.
Показатель 53.9 следует воспринимать как составную оценку, заявленную разработчиком, а не как универсальный рейтинг модели. Он усредняет разные бенчмарки и включает множество результатов, воспроизведённых внутри OpenBMB. Среди выбранных заявленных оценок: 69.1 на LiveCodeBench v6, 86.5 на AIME 2026, 66.6 на BFCL v4, 46.4 на SWE-bench Verified, 88.7 на подмножестве GAIA Text-103 и 20.8 на τ³-Bench Banking. OpenBMB отмечает, какие значения получены из Artificial Analysis, а какие воспроизведены с помощью собственной конфигурации оценки.
Artificial Analysis даёт наиболее сильное независимое подтверждение положения модели в её размерном классе. В Intelligence Index v4.2 MiniCPM5-2B получает 15, в сравнении с 11 у Granite 4.2 3B и оценочными 14 у Qwen3.5-4B с поддержкой рассуждений. Ling 3.0 Tiny набирает на один пункт больше — 16, но имеет примерно втрое больше параметров в сумме.
Независимые результаты также определяют ограничения модели. MiniCPM5-2B набрала 9% на Humanity’s Last Exam, 9% на Terminal-Bench v2.1, 0% на CritPt, 26% на SciCode и 59% на оценке рассуждений в длинном контексте от Artificial Analysis. Эти показатели не позволяют считать модель универсальной заменой более крупным передовым системам.
Её агентные результаты более конкурентоспособны. MiniCPM5-2B достигла Elo 831 на GDPval-AA v2, где 1,000 представляет человеческий базовый уровень, используемый оценкой. Она получила 21% на τ³-Banking и Elo 438 на AA-Briefcase. Artificial Analysis определяет свой Agentic Index как взвешенное среднее этих трёх оценок.
Модель использовала примерно 19,000 выходных токенов на задачу Intelligence Index, включая около 11,000 токенов рассуждений. Это сравняло её с Granite 4.2 3B по наименьшему использованию выходных токенов в наборе сравнения и составило примерно треть от 56,000 токенов Ling 3.0 Tiny. Число токенов особенно важно для локального развёртывания, поскольку более длинные трассы рассуждений повышают задержку, давление на память и энергопотребление.
Один необычный результат требует осторожности: относительно благоприятная оценка MiniCPM5-2B на AA-Omniscience в значительной степени обусловлена воздержанием от ответа. Она попыталась ответить только на 29% вопросов, достигнув 78% отсутствия галлюцинаций, но лишь 8% точности. Этот результат указывает на консервативное поведение при ответах в данном тесте, а не на широкое фактическое владение знаниями.
3. Почему важны агентные возможности
MiniCPM5-2B явно обучена использованию инструментов, программированию, поиску и многошаговым агентным рабочим процессам, а не является лишь компактной чат-моделью. Она генерирует вызовы инструментов в XML-подобном формате. OpenBMB рекомендует SGLang для function calling, поскольку его парсер minicpm5 преобразует этот вывод в совместимые с OpenAI tool_calls.
Выпущенный датасет для instruction tuning агентов делает этот фокус необычно конкретным. UltraData-SFT-Agent-2609 содержит 483,661 траекторий: 311,006 примеров общих агентов, 82,760 примеров использования инструментов, 69,895 примеров кодовых агентов и 20,000 примеров поисковых агентов.
Это многоходовые траектории, а не изолированные пары запроса и ответа. Они могут включать определения инструментов, вызовы, ответы окружения, шаги верификации, ошибки, повторные попытки и финальные результаты. Охватываемые задачи варьируются от function calling и операций с базами данных до программной инженерии, веб-поиска, обработки файлов, офисных рабочих процессов и многоходовой памяти.
Датасет не является полной коллекцией исполняемых агентных окружений. OpenBMB заявляет, что он не содержит исходных окружений, реализаций инструментов, тестов или кода сэмплирования, а многие виртуальные API, представленные в траекториях, не существуют в реальных развёртываниях. Исследователи могут изучать и повторно использовать записи взаимодействий, но не могут автоматически воспроизвести каждую траекторию только по выпущенным файлам.
Для разработчиков практическое изменение заключается в том, что небольшую локальную модель теперь можно оценивать как компонент принятия решений агента, не отправляя запросы, исходный код или результаты инструментов удалённому провайдеру моделей. Достаточно ли она надёжна для конкретного рабочего процесса, всё ещё зависит от тестирования на уровне приложения, разрешений, валидации и логики восстановления.
4. Релиз обучения выходит за рамки весов модели
OpenBMB описывает процесс обучения MiniCPM5-2B в трёх широких этапах: базовое обучение, обучение в середине процесса и post-training. Затем post-training проходит через supervised fine-tuning, reinforcement learning и on-policy distillation.
Выпущенный датасет UltraData-RL-2609 содержит 85,995 образцов с проверяемым вознаграждением. Его четыре категории: математика с 32,412 образцами, код с 23,665, задачи с длинным контекстом с 18,046 и научные рассуждения или рассуждения на знаниях с 11,872.
Механизм вознаграждения различается по категориям. В задачах по математике и знаниям используются извлекаемые эталонные ответы; образцы с длинным контекстом требуют обоснованного ответа в предоставленном контексте; а отправленные решения кода запускаются на тестовых случаях. OpenBMB сообщает, что метки проверялись методами, включая консенсус нескольких моделей, сравнение ответов и валидацию тестовыми случаями, а задачи, которые инициализационная модель уже стабильно решала, были исключены.
OpenBMB обучила специализированные reinforcement-learning модели-учителя для областей, включающих математику, код, написание текстов и агентные задачи. Затем она использовала on-policy distillation, чтобы объединить 16 экспертных моделей, включая пять специалистов по агентам, в выпущенный чекпойнт. В каждой позиции ответа метод использует обратную KL-дивергенцию между распределениями токенов ученика и учителя в качестве сигнала преимущества.
Согласно результатам абляции OpenBMB, reinforcement learning вместе с on-policy distillation улучшили оценки рассуждений и общие оценки в среднем на 10.96 пункта, а агентные оценки — на 6.96 пункта относительно чекпойнта SFT. Это измерения разработчика, однако доступность чекпойнтов до RL и финальных чекпойнтов даёт внешним исследователям возможность проверить заявленное улучшение.
Репозиторий модели и веса используют Apache 2.0. Сопутствующие датасеты требуют дополнительной осторожности: в их документации сказано, что продолжают действовать вышестоящие лицензии, а также содержатся ограничения на несанкционированное неизменённое зеркалирование или коммерческую перепаковку. Организациям, планирующим распространять данные, следует изучить условия каждого датасета, а не предполагать, что лицензия на веса модели регулирует каждый обучающий артефакт.
5. Что меняется для локальной разработки ИИ
MiniCPM5-2B следует за чекпойнтом MiniCPM5 1B, выпущенным в мае 2026 года, но повышает потолок полезных возможностей, не выходя из класса потребительских устройств. 1.56 GB 4-битный файл, стандартная архитектура, длинный контекст и документированная поддержка llama.cpp, Ollama, LM Studio, MLX, Transformers, vLLM и SGLang уменьшают объём интеграционной работы, обычно связанный с новым семейством моделей.
Релиз особенно актуален там, где важны локальность данных или прерывистое подключение. Скачанный чекпойнт может работать без отправки последующих запросов в OpenBMB, а лицензия модели Apache-2.0 разрешает модификацию и коммерческое использование при соблюдении условий лицензии.
Наиболее убедительный подтверждённый вывод не в том, что модель класса 2B теперь соответствует крупным системам в каждой задаче. Это не так. Вместо этого данные показывают, что агентное использование инструментов, программирование и структурированные рассуждения можно сжать в модель примерно с двумя миллиардами параметров вне эмбеддингов, сохранив конкурентоспособность с несколькими более крупными моделями с открытыми весами. Скачиваемые промежуточные чекпойнты и обучающие датасеты также делают этот результат более проверяемым, чем бенчмарк-заявление, привязанное лишь к финальным весам.
Частые вопросы
Действительно ли MiniCPM5-2B — модель с двумя миллиардами параметров?
Она имеет 2.52 миллиарда параметров в сумме и 1.98 миллиарда параметров вне эмбеддингов. «2B» относится к классу модели и масштабу параметров вне эмбеддингов.
Какова её текущая оценка Artificial Analysis?
MiniCPM5-2B набирает 15 в Intelligence Index v4.2. Широко цитируемая оценка 23 была получена в v4.1.1 и не может напрямую сравниваться с обновлённым индексом.
Может ли она работать без подключения к интернету?
Да. После скачивания весов и среды выполнения версии GGUF, MLX, GPTQ или полной точности можно запускать локально. Фактические требования к скорости и памяти зависят от оборудования, квантования и длины контекста.
Воспроизводим ли полный процесс обучения по релизу?
Лишь частично. OpenBMB выпустила поэтапные чекпойнты, рецепты и значительные датасеты SFT и RL, но датасет агентов не включает все окружения, реализации инструментов, тесты или инфраструктуру сэмплирования.
Поддерживает ли MiniCPM5-2B function calling?
Да. Она генерирует вызовы инструментов в XML-подобном формате, а OpenBMB рекомендует парсер minicpm5 из SGLang для преобразования их в объекты вызовов инструментов, совместимые с OpenAI.
Источники
- Исходный пост в X от @itsPaulAi
- GitHub-репозиторий MiniCPM от OpenBMB и документация по релизу
- Карточка модели и веса MiniCPM5-2B
- Файлы GGUF MiniCPM5-2B и размеры квантований
- Artificial Analysis: результаты MiniCPM5-2B в Intelligence Index v4.2
- Документация датасета UltraData-SFT-Agent-2609
- Документация датасета UltraData-RL-2609
Share