OpenBMB 發布配備 Apache-2.0 權重及代理訓練資料的 MiniCPM5-2B
MiniCPM5-2B 結合 128K 上下文視窗、可下載權重、量化版本、分階段檢查點及代理訓練資料集。
文章目錄 · 12
OpenBMB 於 2026 年 9 月 7 日發布 MiniCPM5-2B,並以 Apache-2.0 權重、多種量化格式、中間檢查點、部署文件,以及大部分訓練資料,提供這款緊湊型語言模型。
此發布值得留意之處,在於將小型部署佔用空間與可量度的代理能力結合。Artificial Analysis 目前在 4.2 版下給予 MiniCPM5-2B 15 分的 Intelligence Index 分數,是總參數少於 40 億的開放權重模型中最高的成績。這項獨立結果使其領先 Granite 4.2 3B 四分,並與規模大得多的 Qwen3.5 9B 推理配置持平。
OpenBMB 的公告及原始 X 帖子中流傳的 23 分,並非模型目前的指數分數。該分數來自 Artificial Analysis Intelligence Index v4.1.1。評估供應商其後為 v4.2 更改基準測試組合及權重,令 MiniCPM5-2B 報告的分數降至 15。兩個版本的結果不可直接比較。
一、OpenBMB 發布了甚麼
MiniCPM5-2B 是基於標準 LlamaForCausalLM 架構的密集型、純文字因果語言模型。儘管其產品名稱如此,該檢查點合共包含 2,516,756,480 個參數,其中 1,981,982,720 個為非嵌入參數。因此,Artificial Analysis 將其歸類為 26 億參數模型。
該架構有 42 層,採用分組查詢注意力機制,配備 16 個查詢頭及兩個鍵值頭,原生上下文長度為 131,072 個詞元。其標準 Llama 相容實作意味常見推理框架毋須特定模型架構分支或自訂核心即可載入。
OpenBMB 發布的不止一個經指令微調的檢查點。可取得的項目包括最終 BF16 模型、僅用於預訓練的基礎檢查點、中期訓練檢查點、強化學習及蒸餾前的僅 SFT 檢查點、四位元 GPTQ 版本、面向 Apple Silicon 的四位元 MLX 版本,以及供 llama.cpp、Ollama 和 LM Studio 使用的 GGUF 檔案。
官方 GGUF 儲存庫提供 5.04 GB 的 F16 檔案、2.68 GB 的 Q8_0 量化版本,以及 1.56 GB 的 Q4_K_M 量化版本。這些大小令不少消費級系統可以實際完全在本機運行。OpenBMB 將此模型定位為適合邊緣及裝置端使用,惟發布資料並未提供經獨立驗證、針對手機的速度、記憶體、電池或散熱量度。模型檔案可放入手機儲存空間,本身並不能證明其在各種裝置或長上下文下均有可接受的流動裝置效能。
另有一個供推測式解碼使用的 DSpark 草稿模型。透過 SGLang 與 MiniCPM5-2B 配對時,它會提出一批詞元,由目標模型驗證,目的是在不改變目標模型已接受輸出的情況下加快生成速度。
截至發布時,Hugging Face 並未為主要檢查點列出任何託管推理供應商。因此,最直接的存取方式是下載並自行託管模型,而非購買官方 API 呼叫。
二、基準測試結果及重要的版本變更
OpenBMB 報告指出,在涵蓋程式碼、數學、指令遵循、知識、長上下文理解、工具使用及多種類型代理的 34 項評估中,平均得分為 53.9。在開發者的比較表中,所列較大參考模型的最高平均分為 Qwen3.5-4B 的 51.1。
這個 53.9 的數字應視為開發者報告的綜合分數,而非通用模型評級。它平均了不同基準測試,並包括許多由 OpenBMB 內部重現的結果。部分報告分數包括:LiveCodeBench v6 為 69.1、AIME 2026 為 86.5、BFCL v4 為 66.6、SWE-bench Verified 為 46.4、GAIA Text-103 子集為 88.7,以及 τ³-Bench Banking 為 20.8。OpenBMB 標示哪些項目來自 Artificial Analysis,哪些透過其自設評估環境重現。
Artificial Analysis 為該模型在其規模類別中的位置提供最有力的獨立確認。在 Intelligence Index v4.2 下,MiniCPM5-2B 得分 15,相比 Granite 4.2 3B 的 11 分,以及具推理功能 Qwen3.5-4B 的估計 14 分。Ling 3.0 Tiny 高一分,得 16 分,但其總參數約為三倍。
獨立結果亦界定了模型的限制。MiniCPM5-2B 在 Humanity’s Last Exam 得分 9%、在 Terminal-Bench v2.1 得分 9%、在 CritPt 得分 0%、在 SciCode 得分 26%,以及在 Artificial Analysis 的長上下文推理評估得分 59%。這些數字不支持將該模型視為大型前沿系統的通用替代品。
其代理結果則較具競爭力。MiniCPM5-2B 在 GDPval-AA v2 達到 831 的 Elo 分數,而該評估以 1,000 代表人類基準。它在 τ³-Banking 得分 21%,並在 AA-Briefcase 取得 438 的 Elo 分數。Artificial Analysis 將其 Agentic Index 定義為這三項評估的加權平均。
該模型在每項 Intelligence Index 任務約使用 19,000 個輸出詞元,包括約 11,000 個推理詞元。這與 Granite 4.2 3B 並列比較組中最低的輸出詞元使用量,約為 Ling 3.0 Tiny 的 56,000 個詞元的三分之一。詞元數量對本機部署尤其重要,因為較長的推理軌跡會增加延遲、記憶體壓力及能源消耗。
有一項不尋常的結果需要審慎看待:MiniCPM5-2B 相對較佳的 AA-Omniscience 分數,主要來自棄答。它只嘗試回答 29% 的問題,得出 78% 的非幻覺率,但準確率只有 8%。該結果反映其在該測試中的保守作答行為,而非廣泛的事實掌握能力。
三、代理能力為何重要
MiniCPM5-2B 明確針對工具使用、程式編寫、搜尋及多步代理工作流程訓練,而不僅是一個緊湊型聊天模型。它以 XML 風格格式輸出工具呼叫。OpenBMB 建議將 SGLang 用於函式呼叫,因為其 minicpm5 解析器會把這些輸出轉換為與 OpenAI 相容的 tool_calls。
已發布的代理指令微調資料集,令這個重點變得格外具體。UltraData-SFT-Agent-2609 包含 483,661 條軌跡:311,006 個通用代理範例、82,760 個工具使用範例、69,895 個程式碼代理範例,以及 20,000 個搜尋代理範例。
這些是多輪軌跡,而非獨立的提示與回答配對。它們可包括工具定義、呼叫、環境回應、驗證步驟、錯誤、重試及最終結果。涵蓋的工作範圍從函式呼叫及資料庫操作,到軟件工程、網絡檢索、檔案處理、辦公室工作流程及多輪記憶。
該資料集並非可執行代理環境的完整集合。OpenBMB 表示,它不包括原始環境、工具實作、測試或取樣程式碼,而軌跡中呈現的許多虛擬 API 在實際部署中並不存在。研究人員可檢視及重用互動記錄,但無法單憑已發布檔案自動重播每一條軌跡。
對開發者而言,實際變化是,小型本機模型現可作為代理的決策組件進行評估,而毋須將提示、原始碼或工具結果傳送至遙距模型供應商。它是否足夠可靠以應付特定工作流程,仍取決於應用程式層面的測試、權限、驗證及復原邏輯。
四、訓練發布不止模型權重
OpenBMB 將 MiniCPM5-2B 的訓練流程描述為三個大致階段:基礎訓練、中期訓練及後訓練。後訓練其後經由監督式微調、強化學習及在策略蒸餾進行。
已發布的 UltraData-RL-2609 資料集包含 85,995 個可驗證獎勵樣本。其四個類別分別為:數學 32,412 個樣本、程式碼 23,665 個、長上下文任務 18,046 個,以及科學或知識推理 11,872 個。
獎勵機制按類別而異。數學及知識任務使用可擷取的參考答案;長上下文樣本要求在所提供上下文中有支持依據的答案;程式碼提交則會針對測試案例執行。OpenBMB 表示,標籤透過包括多模型共識、答案比較及測試案例驗證等方法檢查,而初始化模型已能穩定解答的任務則被移除。
OpenBMB 為包括數學、程式碼、寫作及代理任務在內的範疇,訓練了專門的強化學習教師模型。其後,它透過在策略蒸餾,將 16 個專家模型——包括五個代理專家——合併至已發布的檢查點。在每個回應位置,該方法使用學生及教師詞元分佈之間的反向 KL 散度作為優勢訊號。
根據 OpenBMB 的消融結果,與 SFT 檢查點相比,強化學習加上在策略蒸餾令推理及通用評估平均提升 10.96 分,代理評估則提升 6.96 分。這些是開發者的量度,但提供強化學習前及最終檢查點,讓外部研究人員可測試所聲稱的改進。
模型儲存庫及權重採用 Apache 2.0。隨附資料集則需要額外留意:其文件指出上游授權仍然適用,並包括禁止未經授權的原樣鏡像或商業重新包裝的限制。計劃重新分發資料的機構,應審閱每個資料集的條款,而非假設模型權重授權管限所有訓練項目。
五、對本機 AI 開發有何改變
MiniCPM5-2B 緊接於 2026 年 5 月發布的 1B MiniCPM5 檢查點,但在不脫離消費級裝置類別的情況下,提高了實用能力上限。1.56 GB 四位元檔案、標準架構、長上下文,以及對 llama.cpp、Ollama、LM Studio、MLX、Transformers、vLLM 和 SGLang 的文件化支援,減少了新模型系列通常所需的整合工作。
此發布在資料本地性或間歇性連線重要的情況下尤其相關。下載後的檢查點可在不將其後提示傳送給 OpenBMB 的情況下運作,而 Apache-2.0 模型授權容許在符合授權條件下作出修改及商業使用。
最有力的經驗證情況,並非一個 2B 級模型現已在每項任務上匹敵大型系統。它並非如此。證據反而顯示,代理式工具使用、程式編寫及結構化推理可壓縮至一個約有 20 億非嵌入參數的模型,同時仍能與數個較大的開放權重模型競爭。可下載的中間檢查點及訓練資料集,亦令此結果比僅附於最終權重的基準測試聲稱更容易檢視。
常見問題
MiniCPM5-2B 真的是一個 20 億參數模型嗎?
它有 25.2 億個總參數及 19.8 億個非嵌入參數。「2B」指其模型類別及非嵌入規模。
它目前的 Artificial Analysis 分數是多少?
MiniCPM5-2B 在 Intelligence Index v4.2 得分 15。廣泛引用的 23 分來自 v4.1.1,不能與更新後的指數直接比較。
它可以在沒有網絡連線的情況下運行嗎?
可以。下載權重及運行環境後,GGUF、MLX、GPTQ 或全精度版本均可在本機運行。實際速度及記憶體需求取決於硬件、量化方式及上下文長度。
完整訓練流程能否從此次發布重現?
只能部分重現。OpenBMB 發布了分階段檢查點、配方及大量 SFT 和 RL 資料集,但代理資料集並不包括所有環境、工具實作、測試或取樣基礎設施。
MiniCPM5-2B 支援函式呼叫嗎?
支援。它會生成 XML 風格的工具呼叫,而 OpenBMB 建議使用 SGLang 的 minicpm5 解析器,將其轉換為與 OpenAI 相容的工具呼叫物件。
參考來源
Share