Tin tức AISố chữ 5011Thời gian đọc13 phút

OpenBMB phát hành MiniCPM5-2B với trọng số Apache-2.0 và dữ liệu huấn luyện tác tử

MiniCPM5-2B kết hợp cửa sổ ngữ cảnh 128K với trọng số có thể tải về, các bản lượng tử hóa, checkpoint theo giai đoạn và bộ dữ liệu huấn luyện tác tử.

Mục lục · 12
  1. 1. OpenBMB đã phát hành gì
  2. 2. Kết quả benchmark — và thay đổi phiên bản quan trọng
  3. 3. Vì sao các năng lực tác tử quan trọng
  4. 4. Bản phát hành huấn luyện vượt ngoài trọng số mô hình
  5. 5. Điều gì thay đổi đối với phát triển AI cục bộ
  6. Câu hỏi thường gặp
  7. MiniCPM5-2B có thực sự là mô hình hai tỷ tham số không?
  8. Điểm Artificial Analysis hiện tại của nó là bao nhiêu?
  9. Nó có thể chạy mà không cần kết nối internet không?
  10. Toàn bộ quá trình huấn luyện có thể tái lập từ bản phát hành không?
  11. MiniCPM5-2B có hỗ trợ function calling không?
  12. Tham khảo nguồn

OpenBMB đã phát hành MiniCPM5-2B vào ngày 7 tháng 9 năm 2026, đưa mô hình ngôn ngữ gọn nhẹ của mình ra mắt cùng trọng số Apache-2.0, nhiều định dạng lượng tử hóa, các checkpoint trung gian, tài liệu triển khai và phần đáng kể dữ liệu huấn luyện.

Bản phát hành đáng chú ý vì kết hợp dấu ấn triển khai nhỏ với các năng lực tác tử có thể đo lường. Artificial Analysis hiện chấm MiniCPM5-2B 15 điểm trên Intelligence Index theo phiên bản 4.2, mức cao nhất dành cho một mô hình trọng số mở có dưới bốn tỷ tham số tổng. Kết quả độc lập này đặt nó cao hơn Granite 4.2 3B bốn điểm và ngang với cấu hình suy luận Qwen3.5 9B lớn hơn nhiều.

Điểm số 23 được lan truyền trong thông báo của OpenBMB và bài đăng X ban đầu không phải là điểm chỉ số hiện tại của mô hình. Con số này đến từ Artificial Analysis Intelligence Index v4.1.1. Nhà cung cấp đánh giá sau đó đã thay đổi tổ hợp benchmark và trọng số cho v4.2, khiến điểm được báo cáo của MiniCPM5-2B giảm xuống 15. Kết quả từ hai phiên bản không thể so sánh trực tiếp.

1. OpenBMB đã phát hành gì

MiniCPM5-2B là mô hình ngôn ngữ nhân quả dày đặc, chỉ văn bản, dựa trên kiến trúc chuẩn LlamaForCausalLM. Dù tên sản phẩm như vậy, checkpoint chứa tổng cộng 2,516,756,480 tham số, trong đó 1,981,982,720 là tham số không nhúng. Vì vậy, Artificial Analysis phân loại nó là mô hình 2.6 tỷ tham số.

Kiến trúc có 42 lớp, attention truy vấn theo nhóm với 16 đầu truy vấn và hai đầu khóa-giá trị, cùng độ dài ngữ cảnh gốc 131,072 token. Việc triển khai tương thích Llama tiêu chuẩn cho phép các framework suy luận phổ biến tải mô hình mà không cần nhánh kiến trúc riêng cho mô hình hoặc kernel tùy chỉnh.

OpenBMB đã phát hành nhiều hơn một checkpoint tinh chỉnh theo chỉ dẫn. Các artifact hiện có gồm mô hình BF16 cuối cùng, checkpoint nền chỉ tiền huấn luyện, checkpoint giữa quá trình huấn luyện, checkpoint chỉ SFT trước reinforcement learning và distillation, bản GPTQ bốn bit, bản MLX bốn bit hướng đến Apple Silicon, cùng các tệp GGUF dành cho llama.cpp, Ollama và LM Studio.

Kho GGUF chính thức cung cấp tệp F16 5.04 GB, bản lượng tử hóa Q8_0 2.68 GB và bản lượng tử hóa Q4_K_M 1.56 GB. Những kích thước này khiến việc vận hành hoàn toàn cục bộ trở nên thực tế trên nhiều hệ thống tiêu dùng. OpenBMB giới thiệu mô hình là phù hợp cho sử dụng biên và trên thiết bị, mặc dù tài liệu phát hành không cung cấp các số đo độc lập đã xác minh về tốc độ, bộ nhớ, pin hoặc nhiệt độ dành riêng cho điện thoại. Một tệp mô hình vừa với bộ nhớ điện thoại tự nó không chứng minh hiệu năng di động chấp nhận được trên các thiết bị hoặc ngữ cảnh dài khác nhau.

Ngoài ra còn có mô hình nháp DSpark dành cho giải mã suy đoán. Khi ghép cặp với MiniCPM5-2B thông qua SGLang, nó đề xuất các khối token để mô hình đích xác minh, với mục tiêu tăng tốc sinh mà không thay đổi đầu ra được chấp nhận của mô hình đích.

Tại thời điểm xuất bản, Hugging Face không liệt kê nhà cung cấp suy luận lưu trữ nào cho checkpoint chính. Vì vậy, con đường truy cập tức thời là tải xuống và tự lưu trữ mô hình thay vì mua các lệnh gọi tới một API chính thức.

2. Kết quả benchmark — và thay đổi phiên bản quan trọng

OpenBMB báo cáo điểm trung bình 53.9 trên 34 đánh giá bao gồm mã, toán học, tuân thủ chỉ dẫn, kiến thức, hiểu ngữ cảnh dài, sử dụng công cụ và nhiều dạng tác tử. Trong bảng so sánh của nhà phát triển, điểm trung bình cao nhất trong số các mô hình tham chiếu lớn hơn được liệt kê là 51.1 của Qwen3.5-4B.

Con số 53.9 đó nên được đọc như một chỉ số tổng hợp do nhà phát triển báo cáo, không phải xếp hạng phổ quát cho mô hình. Nó lấy trung bình các benchmark khác nhau và bao gồm nhiều kết quả được OpenBMB tái lập nội bộ. Các điểm được báo cáo chọn lọc gồm 69.1 trên LiveCodeBench v6, 86.5 trên AIME 2026, 66.6 trên BFCL v4, 46.4 trên SWE-bench Verified, 88.7 trên tập con GAIA Text-103 và 20.8 trên τ³-Bench Banking. OpenBMB ghi rõ mục nào đến từ Artificial Analysis và mục nào được tái lập thông qua thiết lập đánh giá riêng của họ.

Artificial Analysis cung cấp xác nhận độc lập mạnh nhất về vị thế của mô hình trong lớp kích thước này. Theo Intelligence Index v4.2, MiniCPM5-2B đạt 15 điểm, so với 11 của Granite 4.2 3B và ước tính 14 của Qwen3.5-4B có khả năng suy luận. Ling 3.0 Tiny cao hơn một điểm với 16 nhưng có tổng số tham số nhiều gấp khoảng ba lần.

Các kết quả độc lập cũng xác định giới hạn của mô hình. MiniCPM5-2B đạt 9% trên Humanity’s Last Exam, 9% trên Terminal-Bench v2.1, 0% trên CritPt, 26% trên SciCode và 59% trên đánh giá suy luận ngữ cảnh dài của Artificial Analysis. Các số liệu đó không ủng hộ việc xem mô hình như một sự thay thế tổng quát cho các hệ thống frontier lớn hơn.

Kết quả tác tử của nó cạnh tranh hơn. MiniCPM5-2B đạt điểm Elo 831 trên GDPval-AA v2, nơi 1,000 đại diện cho mức nền con người được đánh giá sử dụng. Nó đạt 21% trên τ³-Banking và Elo 438 trên AA-Briefcase. Artificial Analysis định nghĩa Agentic Index là trung bình có trọng số của ba đánh giá đó.

Mô hình đã sử dụng khoảng 19,000 token đầu ra cho mỗi tác vụ Intelligence Index, bao gồm khoảng 11,000 token suy luận. Con số này ngang Granite 4.2 3B ở mức sử dụng token đầu ra thấp nhất trong tập so sánh và bằng khoảng một phần ba 56,000 token của Ling 3.0 Tiny. Số lượng token đặc biệt liên quan đến triển khai cục bộ vì các vết suy luận dài hơn làm tăng độ trễ, áp lực bộ nhớ và mức tiêu thụ năng lượng.

Một kết quả bất thường cần thận trọng: điểm AA-Omniscience tương đối thuận lợi của MiniCPM5-2B phần lớn đến từ việc kiềm chế trả lời. Nó chỉ thử trả lời 29% câu hỏi, tạo ra tỷ lệ không ảo giác 78% nhưng độ chính xác chỉ 8%. Kết quả cho thấy hành vi trả lời thận trọng trong bài kiểm tra đó, không phải năng lực làm chủ kiến thức thực tế rộng.

3. Vì sao các năng lực tác tử quan trọng

MiniCPM5-2B được huấn luyện rõ ràng cho sử dụng công cụ, lập trình, tìm kiếm và quy trình tác tử nhiều bước thay vì chỉ là một mô hình chat gọn nhẹ. Nó sinh các lời gọi công cụ theo định dạng kiểu XML. OpenBMB khuyến nghị SGLang cho function calling vì parser minicpm5 của nó chuyển các đầu ra này thành tool_calls tương thích OpenAI.

Bộ dữ liệu tinh chỉnh theo chỉ dẫn cho tác tử được phát hành khiến trọng tâm này trở nên cụ thể một cách khác thường. UltraData-SFT-Agent-2609 chứa 483,661 quỹ đạo: 311,006 ví dụ tác tử tổng quát, 82,760 ví dụ sử dụng công cụ, 69,895 ví dụ tác tử lập trình và 20,000 ví dụ tác tử tìm kiếm.

Đây là các quỹ đạo nhiều lượt thay vì các cặp prompt-và-trả lời riêng lẻ. Chúng có thể bao gồm định nghĩa công cụ, lời gọi, phản hồi môi trường, bước xác minh, lỗi, lần thử lại và kết quả cuối cùng. Các tác vụ được bao phủ trải từ function calling và vận hành cơ sở dữ liệu đến kỹ nghệ phần mềm, truy xuất web, xử lý tệp, quy trình văn phòng và bộ nhớ nhiều lượt.

Bộ dữ liệu không phải là tập hợp đầy đủ các môi trường tác tử có thể thực thi. OpenBMB nêu rằng bộ này không bao gồm các môi trường gốc, triển khai công cụ, bài kiểm tra hoặc mã lấy mẫu, và nhiều API ảo được thể hiện trong các quỹ đạo không tồn tại trong các triển khai thực tế. Nhà nghiên cứu có thể kiểm tra và tái sử dụng bản ghi tương tác, nhưng không thể tự động phát lại mọi quỹ đạo chỉ từ các tệp được phát hành.

Đối với nhà phát triển, thay đổi thực tế là một mô hình cục bộ nhỏ giờ đây có thể được đánh giá như thành phần ra quyết định của một tác tử mà không cần gửi prompt, mã nguồn hoặc kết quả công cụ tới nhà cung cấp mô hình từ xa. Việc nó có đủ đáng tin cậy cho một quy trình cụ thể hay không vẫn phụ thuộc vào kiểm thử ở cấp ứng dụng, quyền hạn, xác thực và logic khôi phục.

4. Bản phát hành huấn luyện vượt ngoài trọng số mô hình

OpenBMB mô tả quá trình huấn luyện của MiniCPM5-2B theo ba giai đoạn lớn: huấn luyện nền, huấn luyện giữa kỳ và hậu huấn luyện. Hậu huấn luyện sau đó diễn ra thông qua tinh chỉnh có giám sát, reinforcement learning và on-policy distillation.

Bộ dữ liệu UltraData-RL-2609 được phát hành chứa 85,995 mẫu phần thưởng có thể xác minh. Bốn danh mục của nó là toán học với 32,412 mẫu, mã với 23,665, tác vụ ngữ cảnh dài với 18,046 và suy luận khoa học hoặc kiến thức với 11,872.

Cơ chế phần thưởng khác nhau theo danh mục. Tác vụ toán học và kiến thức sử dụng câu trả lời tham chiếu có thể trích xuất; mẫu ngữ cảnh dài yêu cầu câu trả lời được hỗ trợ trong ngữ cảnh cung cấp; còn bài nộp mã được thực thi với các trường hợp kiểm thử. OpenBMB cho biết nhãn được kiểm tra qua các phương pháp gồm đồng thuận đa mô hình, so sánh câu trả lời và xác thực bằng trường hợp kiểm thử, đồng thời loại bỏ các tác vụ mà mô hình khởi tạo đã giải nhất quán.

OpenBMB đã huấn luyện các giáo viên reinforcement-learning chuyên biệt cho những miền gồm toán học, mã, viết và tác vụ tác tử. Sau đó, họ sử dụng on-policy distillation để kết hợp 16 mô hình chuyên gia — bao gồm năm chuyên gia tác tử — vào checkpoint được phát hành. Tại mỗi vị trí phản hồi, phương pháp sử dụng độ phân kỳ KL ngược giữa phân phối token của học sinh và giáo viên làm tín hiệu advantage.

Theo kết quả ablation của OpenBMB, reinforcement learning cộng với on-policy distillation đã cải thiện trung bình 10.96 điểm cho các đánh giá suy luận và tổng quát, và 6.96 điểm cho đánh giá tác tử so với checkpoint SFT. Đây là các số đo của nhà phát triển, nhưng việc cung cấp checkpoint trước RL và checkpoint cuối cho phép các nhà nghiên cứu bên ngoài kiểm tra mức cải thiện được tuyên bố.

Kho mô hình và trọng số sử dụng Apache 2.0. Các bộ dữ liệu đi kèm đòi hỏi thận trọng hơn: tài liệu của chúng nêu rằng giấy phép thượng nguồn vẫn tiếp tục áp dụng và bao gồm các hạn chế đối với việc phản chiếu không thay đổi trái phép hoặc đóng gói lại vì mục đích thương mại. Các tổ chức dự định phân phối lại dữ liệu nên xem xét điều khoản của từng bộ dữ liệu thay vì giả định rằng giấy phép trọng số mô hình chi phối mọi artifact huấn luyện.

5. Điều gì thay đổi đối với phát triển AI cục bộ

MiniCPM5-2B tiếp nối checkpoint MiniCPM5 1B được phát hành vào tháng 5 năm 2026, nhưng nâng trần năng lực hữu ích mà không rời khỏi lớp thiết bị tiêu dùng. Tệp bốn bit 1.56 GB, kiến trúc tiêu chuẩn, ngữ cảnh dài và hỗ trợ được tài liệu hóa cho llama.cpp, Ollama, LM Studio, MLX, Transformers, vLLM và SGLang giảm bớt công việc tích hợp thường gắn với một họ mô hình mới.

Bản phát hành đặc biệt phù hợp trong những trường hợp tính cục bộ của dữ liệu hoặc kết nối không ổn định là quan trọng. Một checkpoint đã tải xuống có thể hoạt động mà không gửi các prompt tiếp theo tới OpenBMB, trong khi giấy phép mô hình Apache-2.0 cho phép sửa đổi và sử dụng thương mại theo các điều kiện của giấy phép.

Trường hợp được xác minh mạnh nhất không phải là một mô hình lớp 2B giờ đây sánh ngang các hệ thống lớn trong mọi tác vụ. Điều đó không đúng. Thay vào đó, bằng chứng cho thấy sử dụng công cụ mang tính tác tử, lập trình và suy luận có cấu trúc có thể được nén vào một mô hình với khoảng hai tỷ tham số không nhúng, đồng thời vẫn cạnh tranh với một số mô hình trọng số mở lớn hơn. Các checkpoint trung gian và bộ dữ liệu huấn luyện có thể tải xuống cũng khiến kết quả đó dễ kiểm chứng hơn so với một tuyên bố benchmark chỉ gắn với trọng số cuối.

Câu hỏi thường gặp

MiniCPM5-2B có thực sự là mô hình hai tỷ tham số không?

Nó có 2.52 tỷ tham số tổng và 1.98 tỷ tham số không nhúng. “2B” đề cập đến lớp mô hình và quy mô không nhúng của nó.

Điểm Artificial Analysis hiện tại của nó là bao nhiêu?

MiniCPM5-2B đạt 15 điểm trên Intelligence Index v4.2. Điểm 23 được trích dẫn rộng rãi đến từ v4.1.1 và không thể so sánh trực tiếp với chỉ số đã cập nhật.

Nó có thể chạy mà không cần kết nối internet không?

Có. Sau khi trọng số và runtime được tải xuống, các phiên bản GGUF, MLX, GPTQ hoặc độ chính xác đầy đủ có thể chạy cục bộ. Tốc độ và yêu cầu bộ nhớ thực tế phụ thuộc vào phần cứng, lượng tử hóa và độ dài ngữ cảnh.

Toàn bộ quá trình huấn luyện có thể tái lập từ bản phát hành không?

Chỉ một phần. OpenBMB đã phát hành checkpoint theo giai đoạn, recipe, cùng các bộ dữ liệu SFT và RL đáng kể, nhưng bộ dữ liệu tác tử không bao gồm toàn bộ môi trường, triển khai công cụ, bài kiểm tra hoặc hạ tầng lấy mẫu.

MiniCPM5-2B có hỗ trợ function calling không?

Có. Nó tạo các lời gọi công cụ kiểu XML, và OpenBMB khuyến nghị parser minicpm5 của SGLang để chuyển chúng thành các đối tượng lời gọi công cụ tương thích OpenAI.

Tham khảo nguồn

Share

Chia sẻ bài viết