AI News글자 수 4020읽는 시간11

OpenBMB, Apache-2.0 가중치와 에이전트 학습 데이터를 포함한 MiniCPM5-2B 공개

MiniCPM5-2B는 128K 컨텍스트 윈도우에 다운로드 가능한 가중치, 양자화 빌드, 단계별 체크포인트, 에이전트 학습 데이터셋을 결합했다.

목차 · 12
  1. 1. OpenBMB가 공개한 내용
  2. 2. 벤치마크 결과와 중요한 버전 변경
  3. 3. 에이전트 역량이 중요한 이유
  4. 4. 학습 공개는 모델 가중치를 넘어선다
  5. 5. 로컬 AI 개발에서 달라지는 점
  6. 자주 묻는 질문
  7. MiniCPM5-2B는 정말 20억 파라미터 모델인가요?
  8. 현재 Artificial Analysis 점수는 얼마인가요?
  9. 인터넷 연결 없이 실행할 수 있나요?
  10. 공개 자료만으로 전체 학습 과정을 재현할 수 있나요?
  11. MiniCPM5-2B는 함수 호출을 지원하나요?
  12. 참고 자료

OpenBMB는 2026년 9월 7일 MiniCPM5-2B를 공개하며, 이 소형 언어 모델을 Apache-2.0 가중치, 여러 양자화 형식, 중간 체크포인트, 배포 문서, 그리고 상당 부분의 학습 데이터와 함께 제공했다.

이 릴리스는 작은 배포 풋프린트와 측정 가능한 에이전트 역량을 결합했다는 점에서 주목할 만하다. Artificial Analysis는 현재 MiniCPM5-2B에 버전 4.2 기준 Intelligence Index 점수 15를 부여하고 있으며, 이는 총 파라미터 40억 미만 오픈 웨이트 모델 중 가장 높은 결과다. 이 독립 평가 결과는 Granite 4.2 3B보다 4점 앞서며, 훨씬 큰 Qwen3.5 9B 추론 구성과 같은 수준에 놓인다.

OpenBMB의 발표와 원래 X 게시물에서 유통된 23점은 모델의 현재 인덱스 점수가 아니다. 이 점수는 Artificial Analysis Intelligence Index v4.1.1에서 나온 것이다. 이후 평가 제공업체는 v4.2를 위해 벤치마크 구성과 가중치를 변경했고, MiniCPM5-2B의 보고 점수는 15로 낮아졌다. 두 버전의 결과는 직접 비교할 수 없다.

1. OpenBMB가 공개한 내용

MiniCPM5-2B는 표준 LlamaForCausalLM 아키텍처를 기반으로 한 밀집형 텍스트 전용 인과 언어 모델이다. 제품명과 달리 이 체크포인트는 총 2,516,756,480개의 파라미터를 포함하며, 그중 1,981,982,720개는 임베딩 외 파라미터다. 따라서 Artificial Analysis는 이를 26억 파라미터 모델로 분류한다.

아키텍처는 42개 레이어, 16개의 쿼리 헤드와 2개의 키-값 헤드를 갖는 그룹드 쿼리 어텐션, 그리고 131,072토큰의 네이티브 컨텍스트 길이로 구성된다. 표준 Llama 호환 구현이므로 일반적인 추론 프레임워크는 모델별 아키텍처 포크나 커스텀 커널 없이 이를 로드할 수 있다.

OpenBMB는 단일 인스트럭션 튜닝 체크포인트보다 더 많은 것을 공개했다. 제공되는 아티팩트에는 최종 BF16 모델, 사전 학습 전용 베이스 체크포인트, 중간 학습 체크포인트, 강화학습과 증류 이전의 SFT 전용 체크포인트, 4비트 GPTQ 빌드, Apple Silicon 지향 4비트 MLX 빌드, 그리고 llama.cpp, Ollama, LM Studio용 GGUF 파일이 포함된다.

공식 GGUF 리포지터리는 5.04 GB F16 파일, 2.68 GB Q8_0 양자화, 1.56 GB Q4_K_M 양자화를 제공한다. 이 크기라면 많은 소비자용 시스템에서 완전한 로컬 실행이 가능하다. OpenBMB는 이 모델을 엣지 및 온디바이스 사용에 적합하다고 제시하지만, 릴리스 자료에는 독립적으로 검증된 휴대폰별 속도, 메모리, 배터리 또는 발열 측정치는 제공되지 않는다. 모델 파일이 휴대폰 저장 공간에 들어간다는 사실만으로는 여러 기기나 긴 컨텍스트에서 허용 가능한 모바일 성능을 입증하지 못한다.

추측 디코딩을 위한 DSpark 드래프트 모델도 있다. SGLang을 통해 MiniCPM5-2B와 함께 사용하면 대상 모델이 검증할 토큰 블록을 제안하며, 대상 모델이 수용한 출력을 바꾸지 않고 생성 속도를 높이는 것이 목적이다.

게시 시점에 Hugging Face는 기본 체크포인트용 호스팅 추론 제공업체를 나열하지 않는다. 따라서 즉시 이용할 수 있는 경로는 공식 API 호출을 구매하는 것이 아니라 모델을 다운로드해 자체 호스팅하는 방식이다.

2. 벤치마크 결과와 중요한 버전 변경

OpenBMB는 코드, 수학, 지시 이행, 지식, 긴 컨텍스트 이해, 도구 사용, 여러 유형의 에이전트를 아우르는 34개 평가에서 평균 53.9점을 보고했다. 개발사의 비교 표에서 나열된 더 큰 참조 모델 가운데 가장 높은 평균은 Qwen3.5-4B의 51.1이다.

이 53.9라는 수치는 보편적인 모델 등급이 아니라 개발사가 보고한 종합 점수로 읽어야 한다. 서로 다른 벤치마크를 평균한 것이며, OpenBMB가 내부적으로 재현한 많은 결과를 포함한다. 보고된 일부 점수는 LiveCodeBench v6 69.1, AIME 2026 86.5, BFCL v4 66.6, SWE-bench Verified 46.4, GAIA Text-103 하위 집합 88.7, τ³-Bench Banking 20.8이다. OpenBMB는 어떤 항목이 Artificial Analysis에서 나온 것이고 어떤 항목이 자체 평가 설정을 통해 재현된 것인지 표시한다.

Artificial Analysis는 해당 크기 등급 내 모델의 위치에 대한 가장 강력한 독립 확인을 제공한다. Intelligence Index v4.2에서 MiniCPM5-2B는 15점을 기록했으며, Granite 4.2 3B는 11점, 추론 기능이 활성화된 Qwen3.5-4B는 추정 14점이다. Ling 3.0 Tiny는 16점으로 1점 더 높지만 총 파라미터 수는 약 3배다.

독립 결과는 이 모델의 한계도 보여 준다. MiniCPM5-2B는 Humanity’s Last Exam에서 9%, Terminal-Bench v2.1에서 9%, CritPt에서 0%, SciCode에서 26%, Artificial Analysis의 긴 컨텍스트 추론 평가에서 59%를 기록했다. 이 수치들은 이 모델을 더 큰 프런티어 시스템의 범용 대체재로 간주하는 것을 뒷받침하지 않는다.

에이전트 결과는 더 경쟁력 있다. MiniCPM5-2B는 GDPval-AA v2에서 Elo 점수 831에 도달했으며, 이 평가에서 1,000은 사람이 기준선으로 사용된다. τ³-Banking에서는 21%, AA-Briefcase에서는 Elo 438을 기록했다. Artificial Analysis는 Agentic Index를 이 세 평가의 가중 평균으로 정의한다.

이 모델은 Intelligence Index 과제당 약 19,000개의 출력 토큰을 사용했으며, 여기에는 약 11,000개의 추론 토큰이 포함된다. 이는 비교 집합에서 가장 적은 출력 토큰 사용량으로 Granite 4.2 3B와 동률이었고, Ling 3.0 Tiny의 56,000토큰의 약 3분의 1이었다. 더 긴 추론 트레이스는 지연 시간, 메모리 압박, 에너지 소비를 늘리므로 토큰 수는 특히 로컬 배포에서 중요하다.

한 가지 이례적인 결과에는 주의가 필요하다. MiniCPM5-2B의 비교적 양호한 AA-Omniscience 점수는 주로 답변 보류에서 나왔다. 질문의 29%만 시도해 비환각률 78%를 냈지만 정확도는 8%에 그쳤다. 이 결과는 광범위한 사실 지식 숙달이 아니라 해당 테스트에서의 보수적인 답변 행동을 나타낸다.

3. 에이전트 역량이 중요한 이유

MiniCPM5-2B는 단순한 소형 채팅 모델이 아니라 도구 사용, 코딩, 검색, 다단계 에이전트 워크플로를 위해 명시적으로 학습됐다. 이 모델은 XML 스타일 형식으로 도구 호출을 출력한다. OpenBMB는 SGLang의 minicpm5 파서가 이 출력을 OpenAI 호환 tool_calls로 변환하므로 함수 호출에 SGLang을 권장한다.

공개된 에이전트 인스트럭션 튜닝 데이터셋은 이러한 초점을 이례적으로 구체적으로 보여 준다. UltraData-SFT-Agent-2609에는 483,661개의 트래젝터리가 포함된다. 일반 에이전트 예제 311,006개, 도구 사용 예제 82,760개, 코드 에이전트 예제 69,895개, 검색 에이전트 예제 20,000개다.

이는 분리된 프롬프트-응답 쌍이 아니라 멀티턴 트래젝터리다. 도구 정의, 호출, 환경 응답, 검증 단계, 오류, 재시도, 최종 결과를 포함할 수 있다. 다루는 과제는 함수 호출과 데이터베이스 작업부터 소프트웨어 엔지니어링, 웹 검색, 파일 처리, 오피스 워크플로, 멀티턴 메모리까지 이른다.

이 데이터셋은 실행 가능한 에이전트 환경의 완전한 모음은 아니다. OpenBMB는 원래 환경, 도구 구현, 테스트 또는 샘플링 코드를 포함하지 않으며, 트래젝터리에 표현된 많은 가상 API가 실제 배포 환경에는 존재하지 않는다고 밝혔다. 연구자는 상호작용 기록을 검토하고 재사용할 수 있지만, 공개된 파일만으로 모든 트래젝터리를 자동 재실행할 수는 없다.

개발자에게 실질적인 변화는 프롬프트, 소스 코드 또는 도구 결과를 원격 모델 제공업체에 보내지 않고도 소형 로컬 모델을 에이전트의 의사결정 구성 요소로 평가할 수 있게 됐다는 점이다. 특정 워크플로에 충분히 신뢰할 수 있는지는 여전히 애플리케이션 수준의 테스트, 권한, 검증, 복구 로직에 달려 있다.

4. 학습 공개는 모델 가중치를 넘어선다

OpenBMB는 MiniCPM5-2B의 학습 과정을 베이스 학습, 중간 학습, 사후 학습의 세 가지 큰 단계로 설명한다. 사후 학습은 이후 지도 미세 조정, 강화학습, 온폴리시 증류를 거쳐 진행된다.

공개된 UltraData-RL-2609 데이터셋에는 검증 가능한 보상 샘플 85,995개가 포함된다. 네 가지 범주는 수학 32,412개, 코드 23,665개, 긴 컨텍스트 과제 18,046개, 과학 또는 지식 추론 11,872개다.

보상 메커니즘은 범주에 따라 다르다. 수학과 지식 과제는 추출 가능한 참조 답변을 사용하고, 긴 컨텍스트 샘플은 제공된 컨텍스트 안에서 뒷받침되는 답변을 요구하며, 코드 제출물은 테스트 케이스에 대해 실행된다. OpenBMB는 멀티모델 합의, 답변 비교, 테스트 케이스 검증 등의 방법으로 레이블을 점검했으며, 초기화 모델이 이미 일관되게 해결한 과제는 제거했다고 밝혔다.

OpenBMB는 수학, 코드, 글쓰기, 에이전트 과제를 포함한 도메인용 특화 강화학습 교사를 학습했다. 이후 온폴리시 증류를 사용해 5개의 에이전트 전문 모델을 포함한 16개의 전문가 모델을 공개 체크포인트에 결합했다. 각 응답 위치에서 이 방법은 학생과 교사 토큰 분포 간의 역 KL 발산을 어드밴티지 신호로 사용한다.

OpenBMB의 제거 실험 결과에 따르면, 강화학습과 온폴리시 증류는 SFT 체크포인트 대비 추론 및 일반 평가를 평균 10.96점, 에이전트 평가를 6.96점 향상시켰다. 이는 개발사 측정치이지만, 강화학습 이전 체크포인트와 최종 체크포인트가 제공되므로 외부 연구자는 주장된 개선을 검증할 방법을 갖게 된다.

모델 리포지터리와 가중치는 Apache 2.0을 사용한다. 함께 제공되는 데이터셋은 추가적인 주의가 필요하다. 문서에는 업스트림 라이선스가 계속 적용된다고 명시되어 있으며, 무단 변경 없는 미러링 또는 상업적 재패키징에 대한 제한도 포함한다. 데이터를 재배포하려는 조직은 모델 가중치 라이선스가 모든 학습 아티팩트에 적용된다고 가정하지 말고 각 데이터셋의 약관을 검토해야 한다.

5. 로컬 AI 개발에서 달라지는 점

MiniCPM5-2B는 2026년 5월 공개된 1B MiniCPM5 체크포인트를 잇지만, 소비자 기기 등급을 벗어나지 않으면서 유용한 역량의 상한을 높였다. 1.56 GB 4비트 파일, 표준 아키텍처, 긴 컨텍스트, 그리고 llama.cpp, Ollama, LM Studio, MLX, Transformers, vLLM, SGLang에 대한 문서화된 지원은 새 모델 계열에 일반적으로 수반되는 통합 작업을 줄인다.

이 릴리스는 데이터 지역성이나 간헐적 연결이 중요한 환경에서 특히 관련성이 높다. 다운로드한 체크포인트는 이후 프롬프트를 OpenBMB에 보내지 않고 동작할 수 있으며, Apache-2.0 모델 라이선스는 라이선스 조건에 따라 수정과 상업적 사용을 허용한다.

가장 강하게 검증된 사례는 이제 2B급 모델이 모든 과제에서 대형 시스템과 맞먹는다는 것이 아니다. 그렇지 않다. 대신 증거는 약 20억 개의 임베딩 외 파라미터를 가진 모델에 에이전트형 도구 사용, 코딩, 구조화된 추론을 압축하면서도 여러 더 큰 오픈 웨이트 모델과 경쟁력을 유지할 수 있음을 보여 준다. 다운로드 가능한 중간 체크포인트와 학습 데이터셋은 이 결과를 최종 가중치에만 연결된 벤치마크 주장보다 더 자세히 검토할 수 있게 한다.

자주 묻는 질문

MiniCPM5-2B는 정말 20억 파라미터 모델인가요?

총 25.2억 개의 파라미터와 19.8억 개의 임베딩 외 파라미터를 갖는다. “2B”는 모델 등급과 임베딩 외 규모를 가리킨다.

현재 Artificial Analysis 점수는 얼마인가요?

MiniCPM5-2B는 Intelligence Index v4.2에서 15점을 기록한다. 널리 인용되는 23점은 v4.1.1에서 나온 것이며, 업데이트된 인덱스와 직접 비교할 수 없다.

인터넷 연결 없이 실행할 수 있나요?

그렇다. 가중치와 런타임을 다운로드한 뒤에는 GGUF, MLX, GPTQ 또는 완전 정밀도 버전을 로컬에서 실행할 수 있다. 실제 속도와 메모리 요구 사항은 하드웨어, 양자화, 컨텍스트 길이에 따라 달라진다.

공개 자료만으로 전체 학습 과정을 재현할 수 있나요?

부분적으로만 가능하다. OpenBMB는 단계별 체크포인트, 레시피, 상당량의 SFT 및 RL 데이터셋을 공개했지만, 에이전트 데이터셋에는 모든 환경, 도구 구현, 테스트 또는 샘플링 인프라가 포함되지 않는다.

MiniCPM5-2B는 함수 호출을 지원하나요?

그렇다. XML 스타일 도구 호출을 생성하며, OpenBMB는 이를 OpenAI 호환 도구 호출 객체로 변환하기 위해 SGLang의 minicpm5 파서를 권장한다.

참고 자료

Share

이 글 공유