AI News字數 2782閱讀時長7 分鐘

Microsoft 推出 MAI-Image-2.6-Flash,加快並降低圖像生成成本

Microsoft 以預覽形式推出 MAI-Image-2.6-Flash,聲稱其速度為 GPT-Image-2-Medium 的 2.8 倍,GPU 效率高出 72%。

文章目錄 · 12
  1. 一、Microsoft 按品質與吞吐量劃分 MAI-Image-2.6 模型家族
  2. 二、速度與效率聲稱需要精確解讀
  3. 三、Flash 支援生成、編輯、參考圖像及網絡接地
  4. 四、以計量收費的 Foundry 預覽形式開放存取
  5. 五、Microsoft 披露規模,但未披露完整訓練語料
  6. 常見問題
  7. MAI-Image-2.6-Flash 是甚麼?
  8. 它比 GPT-Image-2 快多少?
  9. MAI-Image-2.6-Flash 是否已正式推出?
  10. 該模型支援圖像編輯嗎?
  11. 72% 的 GPU 效率數字是否已獲獨立驗證?
  12. 參考來源

Microsoft AI 推出 MAI-Image-2.6-Flash,這是其旗艦模型 MAI-Image-2.6 的最佳化版本,專為低延遲、高產量的圖像生成及編輯而設。該模型於 2026 年 9 月 4 日透過 Microsoft Foundry 進入公開預覽,同時向開發者開放旗艦模型的存取權限。

Microsoft 表示,MAI-Image-2.6-Flash 的圖像生成速度較 OpenAI 的 GPT-Image-2-Medium 快 2.8 倍,效率高出 72%。Microsoft AI 行政總裁 Mustafa Suleyman 在 X 上的公告則以另一種方式概括這項比較,稱該模型較 GPT-Image-2 快兩倍,GPU 使用效率高出 72%。

此發布讓開發者可選用比 MAI-Image-2.6 成本更低的替代方案,同時保留該模型家族的核心功能:文字生成圖像、可控圖像編輯、多張參考圖像、網絡接地,以及由模型選擇的長寬比。

一、Microsoft 按品質與吞吐量劃分 MAI-Image-2.6 模型家族

MAI-Image-2.6 是 Microsoft AI 以品質為重點的圖像模型,而 Flash 版本則定位為適合更重視延遲及服務成本的應用程式。Microsoft 將 Flash 描述為同一模型的最佳化版本,而非獨立架構。

兩款模型均採用以流匹配為訓練目標的擴散式架構。它們會逐步將雜訊轉化為符合文字提示的圖像,亦可接收圖像作為編輯工作流程的輸入。Microsoft 的模型卡列出,該模型家族有 200 億個非嵌入參數,以及 32,000 個 token 的上下文長度。

旗艦 MAI-Image-2.6 於 2026 年 8 月 14 日發布,Flash 則於 9 月 4 日推出。Microsoft 的文件將兩款模型的 Foundry 版本標示為 2026-07-31;這是開發者部署模型時所選用的版本識別碼,而非公開發布日期。

先前的 MAI 圖像產品線已在 2.5 世代中包含獨立的標準、Flash 及 Pro 版本。MAI-Image-2.6-Flash 延續這個結構,同時加入較新模型家族的網絡接地生成及自動長寬比選擇功能。

Microsoft 表示,該公司公布 Foundry 發布時,旗艦模型在 Arena 的文字生成圖像及圖像編輯排行榜均位列第二。Arena 於 9 月 4 日的文字生成圖像排行榜中,MAI-Image-2.6 以 1,332 分位列第二,落後於 1,382 分的 GPT-Image-2-Medium。此排名適用於旗艦 MAI-Image-2.6,並不會自動適用於 Flash 版本。

二、速度與效率聲稱需要精確解讀

Microsoft AI 的正式公告提供了最具體的比較:MAI-Image-2.6-Flash 的圖像生成速度較 GPT-Image-2-Medium 快 2.8 倍,效率高出 72%。Suleyman 在 X 的帖文中則將速度聲稱約為兩倍,並較概括地提及 GPT-Image-2。

這些說法不應視為兩項獨立的基準測試結果。它們均來自同一供應商的發布,而 Microsoft 尚未公布測試硬件、提示集、輸出設定、樣本數量、延遲分布,或效率數字所採用的計算方式。

「效率高出 72%」亦不一定表示 Flash 為每張圖像消耗的 GPU 時間少 72%。效率可能衡量每單位運算資源的吞吐量、使用率,或其他內部服務指標。若沒有 Microsoft 的方法論,這個數字可支持服務需求下降的方向性說法,但不能用作精確估算客戶端的 GPU 消耗。

Microsoft 稱 MAI-Image-2.6-Flash 是其價格與品質比最佳的產品,並表示其成本不足旗艦模型的一半。其公告亦進一步將 MAI-Image-2.6 模型家族描述為具備業界最佳每 Elo 價格表現。

Artificial Analysis 在其公開品質與價格比較中納入 MAI-Image-2.6-Flash,並將該模型置於所顯示的 Pareto 前沿上。其比較框架結合盲選偏好 Elo 分數,以及每 1,000 張圖像的代表性 API 價格。由於隨著票數及供應商資料累積,這些排名及價格會有所變動,它們只是快照,而非模型的永久特性。

對生產環境買家而言,可量度的問題因而較「某個模型是否具備『最佳』全球性價格效能比」更為狹窄。團隊需要以自身的提示比較端對端延遲、可用圖像率、編輯成功率、輸出尺寸、重試次數及 token 消耗。

三、Flash 支援生成、編輯、參考圖像及網絡接地

MAI-Image-2.6-Flash 同時接受文字及圖像輸入。Microsoft 列出其支援的編輯操作,包括移除物件、替換物件、變更屬性、局部重繪、調整版面、替換文字及清理瑕疵。該模型旨在保留構圖及視覺一致性,同時套用針對性的改動。

多參考圖像編輯讓單一請求可結合來自不同圖像的元素,例如人物、產品、風格及場景。這對廣告及設計流程尤其相關,因為生成的構圖可能需要保留產品外觀,同時借鑑另一份參考素材的視覺方向。

可選的 web_grounding 參數讓模型可在生成圖像前,透過 Bing Search 擷取最新資訊。Microsoft 表示,這可改善涉及現實世界實體、地點、活動或其他可能在訓練後有所改變的細節之請求。除非開發者啟用,否則接地功能會維持停用。

auto_aspect_ratio 選項讓模型可按提示、構圖及提供的圖像選擇輸出形狀。Microsoft 的模型卡指出,底層模型家族最多可生成 2,359,296 像素,相當於 1536×1536,而發布公告則宣傳最高達 1.5K 的解析度。

現時的 Foundry API 文件描述了限制較多的生成介面:寬度及高度均不得低於 768 像素,其乘積不得超過 1,048,576 像素,而回傳圖像一律為在回應中以 base64 編碼的 PNG。因此,開發者應遵從已部署 API 的限制,即使模型卡描述了更高的模型家族層級上限。

四、以計量收費的 Foundry 預覽形式開放存取

MAI-Image-2.6-Flash 可透過公開的 MAI Playground 使用,亦作為 Microsoft Foundry 的預覽模型提供。Foundry 存取需要付費 Azure 訂閱、位於受支援地區的專案,以及建立模型部署所需的適當 Azure 角色。

可用的部署類型為 Global Standard。Microsoft 公布的配額表未向免費層分配請求額度,而付費容量由每分鐘兩個請求起。所列較高層級每次以每分鐘兩個請求遞增,最高至每分鐘 12 個請求,而提高配額須經獨立申請流程處理。

這些限制對一款主打高吞吐量工作負載的模型十分重要。該架構可能減少每張圖像的延遲及運算需求,但預覽客戶不能假定可獲得不受限制的生產容量。供應情況仍取決於地區、訂閱層級、部署配額及 Microsoft 的審批程序。

該模型使用專屬的 MAI 圖像生成及圖像編輯端點,而非一般的 chat-completions 介面。應用程式會傳送部署名稱及提示;編輯請求另會附上圖像,並在 JSON 回應內接收生成的 PNG。

對現有 MAI-Image-2.5 用戶而言,實際改變不僅限於原始速度。2.6 模型家族新增對網絡接地生成及模型主導長寬比的明確支援,同時 Microsoft 聲稱其文字渲染、人像、三維圖像、寫實感及商業設計輸出均有所改善。

五、Microsoft 披露規模,但未披露完整訓練語料

Microsoft 的模型卡報告,MAI-Image-2.6 及 Flash 於 2026 年 4 月 17 日至 7 月 22 日期間訓練。相關資料摘要指出,圖像語料庫包含逾 10 億張圖像,而文字部分則介乎 10 億至 10 兆個 token 的廣泛範圍內。

文字訓練資料為英文材料。Microsoft 表示,資料集包括大規模圖像說明集合、合成說明、取得的材料、開源內容及公開可得圖像,收集日期最遲延至 2026 年 5 月。該公司特別指出 Wikipedia,但未公布每個資料集的逐項清單。

Microsoft 表示已篩選訓練資料中的敏感內容,並部署額外的系統層級分類器。然而,其模型卡仍警告,圖像生成器仍可能生成有害或出乎意料的材料,包括暴力圖像、色情內容、公眾人物的描繪,以及受保護材料的複製品。

所列明的非適用用途包括欺騙性或誤導性內容、冒充真人、非法材料,以及違反 Microsoft 服務政策的內容。對於採用 Flash 進行自動化、高產量工作流程的開發者而言,這些保障措施仍然重要,因為更快的生成速度亦會增加可能需要審核及檢視的輸出數量。

常見問題

MAI-Image-2.6-Flash 是甚麼?

它是 Microsoft AI 為文字生成圖像及可控圖像編輯而設、速度更快且成本更低的 MAI-Image-2.6 版本。

它比 GPT-Image-2 快多少?

Microsoft 的正式公告聲稱,其生成速度為 GPT-Image-2-Medium 的 2.8 倍。Mustafa Suleyman 則較概括地形容它比 GPT-Image-2 快 2 倍。

MAI-Image-2.6-Flash 是否已正式推出?

否。它正透過 Microsoft Foundry 進行公開預覽,亦可在 MAI Playground 互動測試。

該模型支援圖像編輯嗎?

支援。它支援的操作包括移除及替換物件、局部重繪、更新文字、改變版面,以及清理瑕疵。

72% 的 GPU 效率數字是否已獲獨立驗證?

沒有公開的獨立方法論證實這個特定數字。Microsoft 並未披露足夠的測試細節,無法將其換算為每個客戶請求的 GPU 用量確切減幅。

參考來源

Share

分享這篇文章