Новости ИИЗнаков 9195Время чтения23 мин

Microsoft выпускает MAI-Image-2.6-Flash для более быстрой и дешёвой генерации изображений

Microsoft выпускает MAI-Image-2.6-Flash в предварительной версии, заявляя скорость в 2.8× выше, чем у GPT-Image-2-Medium, и на 72% более высокую эффективность GPU.

Содержание · 12
  1. 1. Microsoft разделяет семейство MAI-Image-2.6 по качеству и пропускной способности
  2. 2. Заявления о скорости и эффективности требуют точного прочтения
  3. 3. Flash поддерживает генерацию, редактирование, референсы и веб-заземление
  4. 4. Доступ начинается как тарифицируемая предварительная версия Foundry
  5. 5. Microsoft раскрывает масштаб, но не полный обучающий корпус
  6. Частые вопросы
  7. Что такое MAI-Image-2.6-Flash?
  8. Насколько она быстрее GPT-Image-2?
  9. MAI-Image-2.6-Flash уже общедоступна?
  10. Поддерживает ли модель редактирование изображений?
  11. Независимо ли подтверждён показатель эффективности GPU в 72%?
  12. Источники

Microsoft AI выпустила MAI-Image-2.6-Flash — оптимизированную версию своей флагманской модели MAI-Image-2.6, предназначенную для генерации и редактирования изображений с меньшей задержкой и в больших объёмах. Модель стала доступна в публичной предварительной версии через Microsoft Foundry 4 сентября 2026 года одновременно с доступом разработчиков к флагманской модели.

Microsoft заявляет, что MAI-Image-2.6-Flash генерирует изображения в 2.8 раза быстрее, чем GPT-Image-2-Medium от OpenAI, обеспечивая при этом на 72% более высокую эффективность. Генеральный директор Microsoft AI Мустафа Сулейман иначе сформулировал сравнение в своём анонсе на X: по его словам, модель вдвое быстрее GPT-Image-2 и на 72% эффективнее использует GPU.

Релиз даёт разработчикам более дешёвую альтернативу MAI-Image-2.6, не лишая модельное семейство его ключевых возможностей: генерации изображений по тексту, управляемого редактирования изображений, работы с несколькими референсными изображениями, веб-заземления и выбора соотношения сторон самой моделью.

1. Microsoft разделяет семейство MAI-Image-2.6 по качеству и пропускной способности

MAI-Image-2.6 — ориентированная на качество модель изображений Microsoft AI, тогда как версия Flash предназначена для приложений, в которых важнее задержка и стоимость обслуживания. Microsoft описывает Flash как оптимизированную версию той же модели, а не отдельную архитектуру.

Обе модели используют архитектуру на основе диффузии с целью обучения flow matching. Они постепенно преобразуют шум в изображение, соответствующее текстовому запросу, а также могут принимать изображения на вход для сценариев редактирования. В карточке модели Microsoft указаны 20 миллиардов параметров, не относящихся к эмбеддингам, и длина контекста 32,000 токенов для семейства.

Флагманская MAI-Image-2.6 была выпущена 14 августа 2026 года. Flash последовала 4 сентября. Документация Microsoft определяет версию обеих моделей в Foundry как 2026-07-31 — именно этот идентификатор версии разработчики выбирают при развёртывании, а не дату публичного релиза.

Предыдущая линейка изображений MAI уже включала отдельные варианты Standard, Flash и Pro в поколении 2.5. MAI-Image-2.6-Flash продолжает эту структуру, добавляя веб-заземлённую генерацию и автоматический выбор соотношения сторон из более нового семейства.

Microsoft сообщает, что флагманская модель заняла второе место как в генерации изображений по тексту, так и в редактировании изображений на Arena, когда компания анонсировала релиз в Foundry. В рейтинге Arena по генерации изображений по тексту от 4 сентября MAI-Image-2.6 заняла второе место с оценкой 1,332, уступив GPT-Image-2-Medium с 1,382. Этот рейтинг относится к флагманской MAI-Image-2.6, а не автоматически к варианту Flash.

2. Заявления о скорости и эффективности требуют точного прочтения

Официальный анонс Microsoft AI приводит наиболее конкретное сравнение: MAI-Image-2.6-Flash генерировала изображения в 2.8 раза быстрее GPT-Image-2-Medium и достигала на 72% более высокой эффективности. В публикации на X Сулейман округлил заявление о скорости до двух раз и более обобщённо упомянул GPT-Image-2.

Эти утверждения не следует считать двумя независимыми результатами бенчмарков. Они исходят из одного релиза поставщика, а Microsoft не опубликовала сведения о тестовом оборудовании, наборе запросов, конфигурации вывода, количестве образцов, распределении задержек или способе расчёта показателя эффективности.

Фраза «на 72% более высокая эффективность» также не обязательно означает, что Flash потребляет на 72% меньше времени GPU для каждого изображения. Эффективность может измерять пропускную способность на единицу вычислительных ресурсов, загрузку или другой внутренний показатель обслуживания. Без методологии Microsoft этот показатель подтверждает направленное утверждение о снижении требований к обслуживанию, но не точную оценку потребления GPU со стороны клиента.

Microsoft называет MAI-Image-2.6-Flash своим лучшим предложением по соотношению цены и качества и заявляет, что она стоит менее половины цены флагманской модели. В анонсе также семейство MAI-Image-2.6 описывается как обладающее лучшей в отрасли производительностью по цене за Elo.

Artificial Analysis включает MAI-Image-2.6-Flash в своё публичное сравнение качества и цены и размещает модель на показанной границе Парето. Его методика сравнения объединяет Elo-оценки слепых предпочтений с репрезентативной API-ценой за 1,000 изображений. Поскольку эти рейтинги и цены меняются по мере накопления голосов и данных поставщиков, они представляют собой снимки, а не постоянные характеристики моделей.

Для покупателей, использующих модель в производстве, измеримый вопрос поэтому уже, чем вопрос о том, какая модель обладает «лучшим» глобальным соотношением цены и производительности. Командам необходимо сравнивать сквозную задержку, долю пригодных изображений, успешность редактирования, размеры вывода, повторные попытки и потребление токенов на собственных запросах.

3. Flash поддерживает генерацию, редактирование, референсы и веб-заземление

MAI-Image-2.6-Flash принимает как текстовые, так и графические входные данные. Microsoft относит к поддерживаемым операциям редактирования удаление объектов, замену объектов, изменение атрибутов, инпейтинг, адаптацию компоновки, замену текста и очистку артефактов. Модель предназначена для сохранения композиции и визуальной согласованности при внесении точечных изменений.

Редактирование с несколькими референсами позволяет одному запросу объединять такие элементы, как человек, продукт, стиль и сцена, взятые из разных изображений. Это особенно актуально для рекламных и дизайнерских конвейеров, где сгенерированная композиция должна сохранять внешний вид продукта, одновременно заимствуя визуальное направление из отдельных референсных материалов.

Необязательный параметр web_grounding позволяет модели получать актуальную информацию через Bing Search перед генерацией изображения. Microsoft заявляет, что это может улучшить запросы, связанные с объектами реального мира, местами, событиями или другими деталями, которые могли измениться после обучения. Заземление отключено, пока разработчик его не включит.

Параметр auto_aspect_ratio позволяет модели выбирать форму вывода в соответствии с запросом, композицией и предоставленными изображениями. В карточке модели Microsoft указано, что базовое семейство может создавать до 2,359,296 пикселей, что соответствует 1536×1536, а в анонсе запуска заявлены разрешения до 1.5K.

Текущая документация Foundry API описывает более ограниченный интерфейс генерации: ширина и высота должны быть не менее 768 пикселей каждая, их произведение не может превышать 1,048,576 пикселей, а возвращаемое изображение всегда представляет собой PNG, закодированный в ответе как base64. Поэтому разработчикам следует руководствоваться ограничениями развёрнутого API, хотя карточка модели описывает более высокий максимум на уровне семейства.

4. Доступ начинается как тарифицируемая предварительная версия Foundry

MAI-Image-2.6-Flash доступна через публичную MAI Playground и как предварительная модель в Microsoft Foundry. Для доступа к Foundry необходимы платная подписка Azure, проект в поддерживаемом регионе и соответствующая роль Azure для создания развёртывания модели.

Доступный тип развёртывания — Global Standard. В опубликованной Microsoft таблице квот для бесплатного уровня не предусмотрено запросов, а платная ёмкость начинается с двух запросов в минуту. Перечисленные более высокие уровни увеличиваются с шагом в два запроса вплоть до 12 запросов в минуту, а повышение квоты оформляется через отдельный процесс запроса.

Эти ограничения важны для модели, продвигаемой для высокопроизводительных нагрузок. Архитектура может снижать задержку на изображение и требования к вычислениям, но пользователи предварительной версии не могут предполагать неограниченную производственную ёмкость. Доступность всё ещё зависит от региона, уровня подписки, квоты развёртывания и процесса одобрения Microsoft.

Модель использует выделенные конечные точки MAI для генерации и редактирования изображений, а не общий интерфейс chat-completions. Приложения отправляют имя развёртывания и запрос, а для запросов на редактирование — также изображение, и получают сгенерированный PNG внутри JSON-ответа.

Для существующих пользователей MAI-Image-2.5 практические изменения не ограничиваются чистой скоростью. Семейство 2.6 добавляет явную поддержку веб-заземлённой генерации и соотношений сторон, задаваемых моделью, а Microsoft заявляет об улучшениях в рендеринге текста, портретах, трёхмерных изображениях, фотореализме и коммерческом дизайнерском выводе.

5. Microsoft раскрывает масштаб, но не полный обучающий корпус

В карточке модели Microsoft сообщается, что MAI-Image-2.6 и Flash обучались с 17 апреля по 22 июля 2026 года. Связанная сводка данных указывает, что корпус изображений содержал более одного миллиарда изображений, тогда как текстовый компонент находился в широком диапазоне от одного миллиарда до 10 триллионов токенов.

Текстовые обучающие данные были англоязычными материалами. Microsoft сообщает, что наборы данных включали крупномасштабные коллекции изображений с подписями, синтетические подписи, приобретённые материалы, контент с открытым исходным кодом и общедоступные изображения, а даты сбора доходили до мая 2026 года. Компания отдельно называет Wikipedia, но не публикует детализированный список каждого набора данных.

Microsoft заявляет, что фильтровала обучающие данные на предмет чувствительного контента и развёртывает дополнительные классификаторы на системном уровне. Тем не менее карточка модели предупреждает, что генераторы изображений всё ещё могут создавать вредоносный или неожиданный материал, включая насильственные изображения, сексуальный контент, изображения публичных лиц и воспроизведения защищённых материалов.

К заявленным случаям использования вне области применения относятся обманный или вводящий в заблуждение контент, имитация реальных людей, незаконные материалы и контент, нарушающий правила сервисов Microsoft. Эти меры защиты остаются актуальными для разработчиков, внедряющих Flash в автоматизированные высокообъёмные рабочие процессы, где более быстрая генерация также увеличивает число результатов, которые могут потребовать модерации и проверки.

Частые вопросы

Что такое MAI-Image-2.6-Flash?

Это более быстрая и дешёвая версия MAI-Image-2.6 от Microsoft AI для генерации изображений по тексту и управляемого редактирования изображений.

Насколько она быстрее GPT-Image-2?

В официальном анонсе Microsoft заявляет скорость генерации в 2.8× выше, чем у GPT-Image-2-Medium. Мустафа Сулейман более обобщённо описал её как в 2× более быструю, чем GPT-Image-2.

MAI-Image-2.6-Flash уже общедоступна?

Нет. Она находится в публичной предварительной версии через Microsoft Foundry и также доступна для интерактивного тестирования в MAI Playground.

Поддерживает ли модель редактирование изображений?

Да. Она поддерживает, среди прочего, удаление и замену объектов, инпейтинг, обновление текста, изменение компоновки и очистку артефактов.

Независимо ли подтверждён показатель эффективности GPU в 72%?

Нет, публичной независимой методологии, подтверждающей этот конкретный показатель, нет. Microsoft не раскрыла достаточно подробностей тестирования, чтобы перевести его в точное снижение использования GPU для каждого клиентского запроса.

Источники

Share

Поделиться статьёй