AI News字数 2841阅读时长8 分钟

微软发布 MAI-Image-2.6-Flash,实现更快、更低成本的图像生成

微软以预览版形式发布 MAI-Image-2.6-Flash,声称其速度为 GPT-Image-2-Medium 的 2.8 倍,GPU 效率提高 72%。

文章目录 · 12
  1. 一、微软围绕质量与吞吐量划分 MAI-Image-2.6 系列
  2. 二、速度与效率声明需要准确解读
  3. 三、Flash 支持生成、编辑、参考图像与网络接地
  4. 四、访问以按量计费的 Foundry 预览版开始
  5. 五、微软披露训练规模,但未公布完整训练语料库
  6. 常见问题
  7. 什么是 MAI-Image-2.6-Flash?
  8. 它比 GPT-Image-2 快多少?
  9. MAI-Image-2.6-Flash 是否已正式上线?
  10. 该模型支持图像编辑吗?
  11. 72% 的 GPU 效率数据是否经过独立验证?
  12. 参考来源

微软 AI 已发布 MAI-Image-2.6-Flash,这是其旗舰 MAI-Image-2.6 模型的优化版本,旨在实现更低延迟、更高吞吐量的图像生成与编辑。该模型于 2026 年 9 月 4 日通过 Microsoft Foundry 进入公开预览,同时开发者也可访问旗舰模型。

微软表示,MAI-Image-2.6-Flash 的图像生成速度是 OpenAI GPT-Image-2-Medium 的 2.8 倍,效率提高 72%。微软 AI 首席执行官 Mustafa Suleyman 在 X 上的公告中以不同方式概括了这一比较,称该模型比 GPT-Image-2 快两倍,GPU 使用效率提高 72%。

此次发布为开发者提供了比 MAI-Image-2.6 成本更低的替代方案,同时保留了该系列的核心功能:文本生成图像、可控图像编辑、多参考图像、网络接地以及由模型选择宽高比。

一、微软围绕质量与吞吐量划分 MAI-Image-2.6 系列

MAI-Image-2.6 是微软 AI 注重质量的图像模型,而 Flash 版本则面向更看重延迟和服务成本的应用。微软将 Flash 描述为同一模型的优化版本,而非独立架构。

两款模型均采用基于扩散的架构,并使用流匹配训练目标。它们会逐步将噪声转化为与文本提示词一致的图像,也可将图像作为输入,用于编辑工作流。微软的模型卡显示,该系列拥有 200 亿个非嵌入参数,以及 32,000 个 token 的上下文长度。

旗舰 MAI-Image-2.6 于 2026 年 8 月 14 日发布,Flash 随后于 9 月 4 日发布。微软文档将两款模型的 Foundry 版本标识为 2026-07-31;开发者部署时选择的是这一版本标识,而非公开发布日期。

此前的 MAI 图像产品线在 2.5 代中已包含独立的标准版、Flash 版和 Pro 版。MAI-Image-2.6-Flash 延续了这一结构,同时增加了新一代系列的网络接地图像生成和自动宽高比选择功能。

微软表示,在公司宣布 Foundry 发布时,旗舰模型在 Arena 的文本生成图像和图像编辑两项排名中均位列第二。Arena 9 月 4 日的文本生成图像排行榜显示,MAI-Image-2.6 以 1,332 分排名第二,仅次于 1,382 分的 GPT-Image-2-Medium。这一排名适用于旗舰 MAI-Image-2.6,并不自动适用于 Flash 变体。

二、速度与效率声明需要准确解读

微软 AI 的正式公告提供了最具体的比较:MAI-Image-2.6-Flash 的图像生成速度是 GPT-Image-2-Medium 的 2.8 倍,效率提高 72%。Suleyman 在 X 上的帖子将速度声明四舍五入为两倍,并更笼统地提及 GPT-Image-2。

这些说法不应被视为两项独立的基准测试结果。它们来自同一份厂商发布材料,微软尚未公布测试硬件、提示词集、输出配置、样本数量、延迟分布,或效率指标的计算方法。

“效率提高 72%”也不必然意味着 Flash 对每张图像消耗的 GPU 时间减少 72%。效率可能衡量单位算力的吞吐量、利用率或其他内部服务指标。在缺少微软方法论的情况下,这一数据支持服务需求降低的方向性说法,但不能据此精确估算客户侧的 GPU 消耗。

微软称 MAI-Image-2.6-Flash 是其性价比最佳的产品,并表示其成本不到旗舰模型的一半。其公告还将 MAI-Image-2.6 系列描述为拥有业内最佳每 Elo 分价格表现的模型。

Artificial Analysis 在其公开的质量与价格比较中纳入了 MAI-Image-2.6-Flash,并将该模型置于所展示的帕累托前沿。其比较框架结合了盲测偏好 Elo 分数与每 1,000 张图像的代表性 API 价格。由于这些排名和价格会随着投票及服务商数据的累积而变化,它们只是快照,而非模型的永久特征。

因此,对于生产环境采购方而言,可衡量的问题比某个模型是否拥有“最佳”全球性价比更具体。团队需要根据自身提示词比较端到端延迟、可用图像率、编辑成功率、输出尺寸、重试次数和 token 消耗。

三、Flash 支持生成、编辑、参考图像与网络接地

MAI-Image-2.6-Flash 同时接受文本和图像输入。微软列出的支持编辑操作包括对象移除、对象替换、属性修改、局部重绘、布局适配、文本替换和瑕疵清理。该模型旨在应用针对性修改的同时保留构图和视觉一致性。

多参考编辑允许一个请求组合来自不同图像的人物、产品、风格和场景等元素。这对于广告和设计流程尤其重要,因为生成的构图可能需要保留产品外观,同时借鉴其他参考材料中的视觉方向。

可选的 web_grounding 参数允许模型在生成图像前通过 Bing 搜索检索最新信息。微软表示,这可以改善涉及现实世界实体、地点、事件或其他可能在训练后发生变化的细节的请求。除非开发者启用,否则接地功能默认关闭。

auto_aspect_ratio 选项允许模型根据提示词、构图和提供的图像选择输出形状。微软模型卡指出,底层系列最多可生成 2,359,296 像素,相当于 1536×1536;发布公告则宣传最高可达 1.5K 的分辨率。

当前 Foundry API 文档描述了一个限制更严格的生成接口:宽度和高度均须至少为 768 像素,两者的乘积不得超过 1,048,576 像素,返回的图像始终为以 base64 编码并包含在响应中的 PNG。因此,开发者应遵循已部署 API 的限制,即使模型卡描述了更高的系列级最大值。

四、访问以按量计费的 Foundry 预览版开始

MAI-Image-2.6-Flash 可通过公开的 MAI Playground 使用,也可作为 Microsoft Foundry 中的预览模型使用。Foundry 访问需要付费 Azure 订阅、受支持区域内的项目,以及创建模型部署所需的相应 Azure 角色。

可用的部署类型为 Global Standard。微软公布的配额表未向免费层提供请求额度,付费容量起始为每分钟两次请求。列出的更高层级以每次增加两次请求的方式提升,最高为每分钟 12 次请求;增加配额需通过单独的申请流程处理。

对于一款面向高吞吐量工作负载推广的模型而言,这些限制很重要。其架构可能降低单张图像的延迟和算力需求,但预览版客户不能假设拥有不受限制的生产容量。可用性仍取决于区域、订阅层级、部署配额以及微软的审批流程。

该模型使用专用的 MAI 图像生成和图像编辑端点,而非通用的聊天补全接口。应用发送部署名称和提示词,编辑请求还会附带图像,并在 JSON 响应中接收生成的 PNG。

对于现有的 MAI-Image-2.5 用户而言,实际变化并不局限于原始速度。2.6 系列新增了对网络接地图像生成和模型引导宽高比的明确支持;同时,微软声称其在文本渲染、人像、三维图像、照片级真实感和商业设计输出方面有所改进。

五、微软披露训练规模,但未公布完整训练语料库

微软的模型卡称,MAI-Image-2.6 和 Flash 的训练时间为 2026 年 4 月 17 日至 7 月 22 日。相关数据摘要显示,图像语料库包含超过 10 亿张图像,而文本部分则处于 10 亿至 10 万亿 token 的宽泛范围内。

文本训练数据为英语材料。微软表示,数据集包括大规模图像字幕集合、合成字幕、购得材料、开源内容和公开可用图像,收集日期最晚延续至 2026 年 5 月。该公司特别提及 Wikipedia,但未公布每个数据集的逐项清单。

微软表示,其已对训练数据进行敏感内容过滤,并部署了额外的系统级分类器。不过,模型卡仍警告,图像生成器仍可能生成有害或意外的材料,包括暴力图像、色情内容、公众人物描绘以及受保护材料的复制品。

所列出的超出适用范围的用途包括欺骗性或误导性内容、冒充真实人物、违法材料,以及违反微软服务政策的内容。对于在自动化、高吞吐量工作流中采用 Flash 的开发者而言,这些保障措施仍然重要,因为更快的生成速度也会增加可能需要审核与审查的输出数量。

常见问题

什么是 MAI-Image-2.6-Flash?

它是微软 AI 面向文本生成图像和可控图像编辑推出的 MAI-Image-2.6 更快、成本更低的版本。

它比 GPT-Image-2 快多少?

微软正式公告称,其生成速度是 GPT-Image-2-Medium 的 2.8 倍。Mustafa Suleyman 则更笼统地称其比 GPT-Image-2 快 2 倍。

MAI-Image-2.6-Flash 是否已正式上线?

没有。它目前通过 Microsoft Foundry 处于公开预览阶段,也可在 MAI Playground 中进行交互式测试。

该模型支持图像编辑吗?

支持。它支持包括对象移除与替换、局部重绘、文本更新、布局修改和瑕疵清理在内的操作。

72% 的 GPU 效率数据是否经过独立验证?

没有公开的独立方法论证实这一具体数据。微软尚未披露足够的测试细节,无法将其换算为每次客户请求的 GPU 使用量的确切降低幅度。

参考来源

Share

分享这篇文章