Tin tức AISố chữ 4446Thời gian đọc12 phút

Microsoft Ra Mắt MAI-Image-2.6-Flash để Tạo Ảnh Nhanh Hơn, Chi Phí Thấp Hơn

Microsoft phát hành MAI-Image-2.6-Flash ở dạng xem trước, tuyên bố tốc độ nhanh gấp 2,8 lần GPT-Image-2-Medium và hiệu suất GPU cao hơn 72%.

Mục lục · 12
  1. 1. Microsoft Phân Tách Dòng MAI-Image-2.6 Theo Chất Lượng và Thông Lượng
  2. 2. Các Tuyên Bố về Tốc Độ và Hiệu Suất Cần Được Đọc Chính Xác
  3. 3. Flash Hỗ Trợ Tạo Ảnh, Chỉnh Sửa, Ảnh Tham Chiếu và Web Grounding
  4. 4. Quyền Truy Cập Bắt Đầu Dưới Dạng Xem Trước Foundry Có Tính Phí Theo Mức Sử Dụng
  5. 5. Microsoft Công Bố Quy Mô Nhưng Không Công Bố Toàn Bộ Tập Dữ Liệu Huấn Luyện
  6. Câu hỏi thường gặp
  7. MAI-Image-2.6-Flash là gì?
  8. Nó nhanh hơn GPT-Image-2 bao nhiêu?
  9. MAI-Image-2.6-Flash đã được phát hành rộng rãi chưa?
  10. Mô hình có hỗ trợ chỉnh sửa ảnh không?
  11. Con số hiệu suất GPU 72% đã được xác minh độc lập chưa?
  12. Tham khảo nguồn

Microsoft AI đã phát hành MAI-Image-2.6-Flash, phiên bản được tối ưu hóa của mô hình chủ lực MAI-Image-2.6, được thiết kế cho việc tạo và chỉnh sửa ảnh độ trễ thấp, khối lượng lớn. Mô hình bước vào giai đoạn xem trước công khai thông qua Microsoft Foundry vào ngày 4 tháng 9 năm 2026, cùng với quyền truy cập dành cho nhà phát triển vào mô hình chủ lực.

Microsoft cho biết MAI-Image-2.6-Flash tạo ảnh nhanh gấp 2,8 lần GPT-Image-2-Medium của OpenAI, đồng thời đạt hiệu suất cao hơn 72%. Mustafa Suleyman, CEO của Microsoft AI, diễn đạt phép so sánh khác đi trong thông báo của ông trên X, nói rằng mô hình nhanh gấp đôi GPT-Image-2 và hiệu quả hơn 72% về mức sử dụng GPU.

Bản phát hành mang đến cho các nhà phát triển một lựa chọn chi phí thấp hơn MAI-Image-2.6 mà không loại bỏ các tính năng cốt lõi của dòng mô hình: tạo ảnh từ văn bản, chỉnh sửa ảnh có kiểm soát, nhiều ảnh tham chiếu, web grounding và tỷ lệ khung hình do mô hình tự chọn.

1. Microsoft Phân Tách Dòng MAI-Image-2.6 Theo Chất Lượng và Thông Lượng

MAI-Image-2.6 là mô hình hình ảnh tập trung vào chất lượng của Microsoft AI, còn bản Flash được định vị cho các ứng dụng nơi độ trễ và chi phí phục vụ quan trọng hơn. Microsoft mô tả Flash là một phiên bản tối ưu hóa của cùng mô hình, thay vì một kiến trúc riêng biệt.

Cả hai mô hình đều sử dụng kiến trúc dựa trên diffusion với mục tiêu huấn luyện flow-matching. Chúng dần biến đổi nhiễu thành hình ảnh phù hợp với lời nhắc văn bản và cũng có thể nhận ảnh làm đầu vào cho các quy trình chỉnh sửa. Model card của Microsoft liệt kê 20 tỷ tham số không bao gồm embedding và độ dài ngữ cảnh 32.000 token cho dòng mô hình này.

MAI-Image-2.6 chủ lực được phát hành vào ngày 14 tháng 8 năm 2026. Flash theo sau vào ngày 4 tháng 9. Tài liệu của Microsoft xác định phiên bản Foundry của cả hai mô hình là 2026-07-31, đây là mã định danh phiên bản mà nhà phát triển chọn khi triển khai, thay vì ngày phát hành công khai.

Dòng mô hình ảnh MAI trước đó đã có các biến thể standard, Flash và Pro riêng biệt trong thế hệ 2.5. MAI-Image-2.6-Flash tiếp tục cấu trúc đó, đồng thời bổ sung khả năng tạo ảnh có web grounding và tự động chọn tỷ lệ khung hình của dòng mới hơn.

Microsoft cho biết mô hình chủ lực xếp hạng hai ở cả tạo ảnh từ văn bản lẫn chỉnh sửa ảnh trên Arena khi công ty công bố bản phát hành Foundry. Bảng xếp hạng text-to-image ngày 4 tháng 9 của Arena xếp MAI-Image-2.6 thứ hai với điểm 1.332, sau GPT-Image-2-Medium với 1.382 điểm. Thứ hạng đó áp dụng cho MAI-Image-2.6 chủ lực, không tự động áp dụng cho biến thể Flash.

2. Các Tuyên Bố về Tốc Độ và Hiệu Suất Cần Được Đọc Chính Xác

Thông báo chính thức của Microsoft AI đưa ra phép so sánh cụ thể nhất: MAI-Image-2.6-Flash tạo ảnh nhanh gấp 2,8 lần GPT-Image-2-Medium và đạt hiệu suất cao hơn 72%. Bài đăng trên X của Suleyman làm tròn tuyên bố về tốc độ thành gấp hai lần và đề cập khái quát hơn đến GPT-Image-2.

Không nên coi các tuyên bố đó là hai kết quả benchmark độc lập. Chúng xuất phát từ cùng một bản phát hành của nhà cung cấp, và Microsoft chưa công bố phần cứng thử nghiệm, bộ lời nhắc, cấu hình đầu ra, số lượng mẫu, phân phối độ trễ hoặc cách tính được sử dụng cho con số hiệu suất.

“Hiệu suất cao hơn 72%” cũng không nhất thiết có nghĩa Flash tiêu thụ ít hơn 72% thời gian GPU cho mỗi ảnh. Hiệu suất có thể đo thông lượng trên mỗi đơn vị tính toán, mức sử dụng hoặc một chỉ số phục vụ nội bộ khác. Không có phương pháp luận của Microsoft, con số này hỗ trợ một tuyên bố định hướng về việc giảm yêu cầu phục vụ, nhưng không phải ước tính chính xác phía khách hàng về mức tiêu thụ GPU.

Microsoft gọi MAI-Image-2.6-Flash là lựa chọn tốt nhất về tỷ lệ giá trên chất lượng và cho biết nó có chi phí chưa bằng một nửa mô hình chủ lực. Thông báo của hãng cũng mô tả dòng MAI-Image-2.6 có hiệu năng giá trên mỗi Elo tốt nhất ngành.

Artificial Analysis đưa MAI-Image-2.6-Flash vào so sánh công khai về chất lượng so với giá và đặt mô hình trên đường biên Pareto được hiển thị. Khung so sánh của họ kết hợp điểm Elo dựa trên lựa chọn mù với mức giá API đại diện cho mỗi 1.000 ảnh. Vì các bảng xếp hạng và mức giá đó thay đổi khi phiếu bầu và dữ liệu nhà cung cấp tích lũy, chúng là ảnh chụp tại thời điểm nhất định thay vì đặc tính vĩnh viễn của mô hình.

Đối với bên mua dùng trong sản xuất, câu hỏi có thể đo lường vì vậy hẹp hơn việc liệu một mô hình có tỷ lệ giá-hiệu năng toàn cầu “tốt nhất” hay không. Các nhóm cần so sánh độ trễ đầu cuối, tỷ lệ ảnh sử dụng được, mức độ thành công của chỉnh sửa, kích thước đầu ra, số lần thử lại và mức tiêu thụ token trên chính các lời nhắc của họ.

3. Flash Hỗ Trợ Tạo Ảnh, Chỉnh Sửa, Ảnh Tham Chiếu và Web Grounding

MAI-Image-2.6-Flash chấp nhận cả đầu vào văn bản và hình ảnh. Microsoft liệt kê xóa đối tượng, thay thế đối tượng, thay đổi thuộc tính, inpainting, điều chỉnh bố cục, thay thế văn bản và làm sạch lỗi ảnh trong số các thao tác chỉnh sửa được hỗ trợ. Mô hình được thiết kế để giữ nguyên bố cục và tính nhất quán thị giác trong khi áp dụng các thay đổi có mục tiêu.

Chỉnh sửa với nhiều ảnh tham chiếu cho phép một yêu cầu kết hợp các yếu tố như con người, sản phẩm, phong cách và khung cảnh được lấy từ nhiều ảnh khác nhau. Điều này đặc biệt phù hợp với các quy trình quảng cáo và thiết kế, nơi một bố cục được tạo ra có thể cần giữ lại diện mạo của sản phẩm trong khi vay mượn định hướng thị giác từ tài liệu tham chiếu riêng biệt.

Tham số tùy chọn web_grounding cho phép mô hình truy xuất thông tin hiện tại qua Bing Search trước khi tạo ảnh. Microsoft cho biết điều này có thể cải thiện các yêu cầu liên quan đến thực thể trong thế giới thực, địa điểm, sự kiện hoặc những chi tiết khác có thể đã thay đổi sau khi huấn luyện. Grounding bị tắt trừ khi nhà phát triển bật nó.

Tùy chọn auto_aspect_ratio cho phép mô hình chọn hình dạng đầu ra theo lời nhắc, bố cục và các ảnh được cung cấp. Model card của Microsoft nêu rằng dòng mô hình cơ sở có thể tạo tối đa 2.359.296 pixel, tương đương 1536×1536, và thông báo ra mắt quảng bá độ phân giải lên đến 1.5K.

Tài liệu API Foundry hiện tại mô tả một giao diện tạo ảnh bị giới hạn hơn: chiều rộng và chiều cao đều phải ít nhất 768 pixel, tích của chúng không được vượt quá 1.048.576 pixel và ảnh trả về luôn là PNG được mã hóa base64 trong phản hồi. Do đó, nhà phát triển nên tuân theo giới hạn của API đã triển khai, dù model card mô tả mức tối đa cao hơn ở cấp dòng mô hình.

4. Quyền Truy Cập Bắt Đầu Dưới Dạng Xem Trước Foundry Có Tính Phí Theo Mức Sử Dụng

MAI-Image-2.6-Flash khả dụng qua MAI Playground công khai và dưới dạng mô hình xem trước trong Microsoft Foundry. Quyền truy cập Foundry yêu cầu một gói đăng ký Azure trả phí, một dự án ở khu vực được hỗ trợ và vai trò Azure phù hợp để tạo triển khai mô hình.

Loại triển khai khả dụng là Global Standard. Bảng hạn ngạch do Microsoft công bố không cấp yêu cầu nào cho tầng miễn phí và bắt đầu năng lực trả phí ở hai yêu cầu mỗi phút. Các tầng cao hơn được liệt kê tăng theo từng mức hai yêu cầu, lên đến 12 yêu cầu mỗi phút; việc tăng hạn ngạch được xử lý thông qua một quy trình yêu cầu riêng.

Những giới hạn này quan trọng đối với một mô hình được tiếp thị hướng tới khối lượng công việc thông lượng cao. Kiến trúc có thể giảm độ trễ và yêu cầu tính toán trên mỗi ảnh, nhưng khách hàng dùng bản xem trước không thể giả định năng lực sản xuất không giới hạn. Khả dụng vẫn phụ thuộc vào khu vực, tầng đăng ký, hạn ngạch triển khai và quy trình phê duyệt của Microsoft.

Mô hình sử dụng các endpoint chuyên biệt cho tạo và chỉnh sửa ảnh MAI, thay vì giao diện chat-completions tổng quát. Ứng dụng gửi tên triển khai và lời nhắc, cùng một ảnh đối với yêu cầu chỉnh sửa, rồi nhận PNG được tạo trong phản hồi JSON.

Đối với người dùng MAI-Image-2.5 hiện hữu, các thay đổi thực tế không chỉ giới hạn ở tốc độ thuần túy. Dòng 2.6 bổ sung hỗ trợ rõ ràng cho tạo ảnh có web grounding và tỷ lệ khung hình do mô hình định hướng, trong khi Microsoft tuyên bố các cải thiện về hiển thị văn bản, ảnh chân dung, hình ảnh ba chiều, tính chân thực như ảnh chụp và đầu ra thiết kế thương mại.

5. Microsoft Công Bố Quy Mô Nhưng Không Công Bố Toàn Bộ Tập Dữ Liệu Huấn Luyện

Model card của Microsoft cho biết MAI-Image-2.6 và Flash được huấn luyện từ ngày 17 tháng 4 đến ngày 22 tháng 7 năm 2026. Bản tóm tắt dữ liệu liên quan cho biết kho dữ liệu ảnh chứa hơn một tỷ ảnh, trong khi thành phần văn bản nằm trong phạm vi rộng từ một tỷ đến 10 nghìn tỷ token.

Dữ liệu huấn luyện văn bản là tài liệu bằng tiếng Anh. Microsoft cho biết các tập dữ liệu bao gồm bộ sưu tập ảnh-chú thích quy mô lớn, chú thích tổng hợp, tài liệu được mua lại, nội dung mã nguồn mở và ảnh công khai, với thời điểm thu thập kéo dài đến tháng 5 năm 2026. Công ty nêu cụ thể Wikipedia nhưng không công bố danh sách chi tiết từng tập dữ liệu.

Microsoft cho biết họ đã lọc dữ liệu huấn luyện để loại nội dung nhạy cảm và triển khai thêm các bộ phân loại ở cấp hệ thống. Tuy vậy, model card của hãng vẫn cảnh báo rằng trình tạo ảnh có thể tạo ra nội dung có hại hoặc không mong muốn, bao gồm hình ảnh bạo lực, nội dung tình dục, mô tả nhân vật công chúng và bản sao của tài liệu được bảo hộ.

Các mục đích sử dụng ngoài phạm vi được nêu bao gồm nội dung lừa dối hoặc gây hiểu lầm, mạo danh người thật, tài liệu bất hợp pháp và nội dung vi phạm chính sách dịch vụ của Microsoft. Những biện pháp bảo vệ đó vẫn có liên quan với các nhà phát triển áp dụng Flash cho quy trình tự động, khối lượng lớn, nơi tốc độ tạo ảnh nhanh hơn cũng làm tăng số lượng đầu ra có thể cần kiểm duyệt và rà soát.

Câu hỏi thường gặp

MAI-Image-2.6-Flash là gì?

Đây là phiên bản nhanh hơn, chi phí thấp hơn của MAI-Image-2.6 do Microsoft AI phát triển, dành cho tạo ảnh từ văn bản và chỉnh sửa ảnh có kiểm soát.

Nó nhanh hơn GPT-Image-2 bao nhiêu?

Thông báo chính thức của Microsoft tuyên bố tốc độ tạo ảnh gấp 2,8 lần GPT-Image-2-Medium. Mustafa Suleyman mô tả khái quát hơn là nhanh gấp 2 lần GPT-Image-2.

MAI-Image-2.6-Flash đã được phát hành rộng rãi chưa?

Chưa. Mô hình đang ở giai đoạn xem trước công khai qua Microsoft Foundry và cũng khả dụng để thử nghiệm tương tác trong MAI Playground.

Mô hình có hỗ trợ chỉnh sửa ảnh không?

Có. Mô hình hỗ trợ các thao tác gồm xóa và thay thế đối tượng, inpainting, cập nhật văn bản, thay đổi bố cục và làm sạch lỗi ảnh.

Con số hiệu suất GPU 72% đã được xác minh độc lập chưa?

Chưa có phương pháp luận độc lập công khai nào xác nhận con số cụ thể đó. Microsoft chưa công bố đủ chi tiết thử nghiệm để quy đổi nó thành mức giảm chính xác về sử dụng GPU cho mỗi yêu cầu của khách hàng.

Tham khảo nguồn

Share

Chia sẻ bài viết