Microsoft、より高速・低コストな画像生成向けにMAI-Image-2.6-Flashをリリース
MicrosoftはMAI-Image-2.6-Flashをプレビューでリリースし、GPT-Image-2-Mediumの2.8倍の速度と72%高いGPU効率を主張している。
目次 · 12
- 一、Microsoft、品質とスループットに基づきMAI-Image-2.6ファミリーを分化
- 二、速度と効率の主張には正確な読み取りが必要
- 三、Flashは生成、編集、参照画像、Webグラウンディングをサポート
- 四、アクセスは従量制Foundryプレビューとして開始
- 五、Microsoftは規模を開示するが完全な学習コーパスは開示しない
- よくある質問
- MAI-Image-2.6-Flashとは何ですか?
- GPT-Image-2と比べてどの程度高速ですか?
- MAI-Image-2.6-Flashは一般提供されていますか?
- モデルは画像編集をサポートしていますか?
- 72%のGPU効率という数値は独立して検証されていますか?
- 参考ソース
Microsoft AIは、低レイテンシかつ大量の画像生成・編集向けに設計された主力モデルMAI-Image-2.6の最適化版、MAI-Image-2.6-Flashをリリースした。このモデルは、主力モデルへの開発者アクセスとともに、2026年9月4日からMicrosoft Foundryでパブリックプレビューに入った。
Microsoftによると、MAI-Image-2.6-FlashはOpenAIのGPT-Image-2-Mediumより2.8倍高速に画像を生成し、72%高い効率を実現する。Microsoft AIのCEOであるMustafa Suleymanは、Xでの発表ではこの比較を異なる形で要約し、同モデルはGPT-Image-2の2倍高速で、GPU使用量の効率が72%高いと述べた。
このリリースにより、開発者はMAI-Image-2.6より低コストの選択肢を得る一方、テキストから画像への生成、制御可能な画像編集、複数の参照画像、Webグラウンディング、モデルが選択するアスペクト比という同ファミリーの中核機能は維持される。
一、Microsoft、品質とスループットに基づきMAI-Image-2.6ファミリーを分化
MAI-Image-2.6はMicrosoft AIの品質重視の画像モデルであり、Flashエディションはレイテンシとサービングコストの重要性がより高いアプリケーション向けに位置付けられている。MicrosoftはFlashを別アーキテクチャではなく、同じモデルの最適化版として説明している。
両モデルは、フローマッチングの学習目標を用いる拡散ベースのアーキテクチャを採用している。ノイズをテキストプロンプトに沿った画像へ段階的に変換し、編集ワークフローでは画像を入力として受け取ることもできる。Microsoftのモデルカードには、このファミリーについて埋め込みを除くパラメータ数が200億、コンテキスト長が32,000トークンと記載されている。
主力モデルMAI-Image-2.6は2026年8月14日にリリースされた。Flashは9月4日に続いた。Microsoftのドキュメントでは、両モデルのFoundry版を2026-07-31としており、これは公開リリース日ではなく、開発者がデプロイ時に選択するバージョン識別子である。
従来のMAI画像ラインアップには、2.5世代ですでに標準、Flash、Proの各バリアントが含まれていた。MAI-Image-2.6-Flashはその構成を継承しつつ、新しいファミリーのWebグラウンディング生成と自動アスペクト比選択を追加している。
Microsoftによると、同社がFoundryでのリリースを発表した時点で、主力モデルはArenaにおけるテキストから画像への生成と画像編集の両方で2位だった。Arenaの9月4日付テキストから画像へのリーダーボードでは、MAI-Image-2.6は1,332点で、1,382点のGPT-Image-2-Mediumに次ぐ2位となった。この順位は主力モデルMAI-Image-2.6に適用されるものであり、Flashバリアントに自動的に適用されるものではない。
二、速度と効率の主張には正確な読み取りが必要
Microsoft AIの公式発表は最も具体的な比較を示している。MAI-Image-2.6-FlashはGPT-Image-2-Mediumより2.8倍高速に画像を生成し、72%高い効率を達成したという。SuleymanのX投稿では、速度の主張を2倍に丸め、より一般的にGPT-Image-2に言及している。
これらの記述を、2つの独立したベンチマーク結果として扱うべきではない。同じベンダーによるリリースに基づくものであり、Microsoftはテスト用ハードウェア、プロンプトセット、出力設定、サンプル数、レイテンシ分布、または効率値の算出方法を公開していない。
「72%高い効率」は、Flashがすべての画像でGPU時間を72%少なく消費することを必ずしも意味しない。効率は、計算リソース単位当たりのスループット、利用率、または別の内部サービング指標を測定している可能性がある。Microsoftの方法論がなければ、この数値はサービング要件の低減という方向性の主張を裏付けるにとどまり、顧客側のGPU消費量を正確に見積もる根拠にはならない。
MicrosoftはMAI-Image-2.6-Flashを、価格対品質で最良の提供物と呼び、主力モデルの半額未満であるとしている。同社の発表ではさらに、MAI-Image-2.6ファミリーは業界最高のElo当たり価格性能を持つと説明している。
Artificial Analysisは、公開している品質対価格比較にMAI-Image-2.6-Flashを含め、このモデルを表示されたパレートフロンティア上に位置付けている。同社の比較フレームワークは、ブラインド選好のEloスコアと、1,000枚当たりの代表的なAPI価格を組み合わせる。投票とプロバイダーデータの蓄積に伴い、これらの順位と価格は変化するため、恒久的なモデル特性ではなくスナップショットである。
したがって、本番導入の購入者にとって測定可能な問いは、あるモデルがグローバルな価格性能比で「最良」かどうかより狭い。チームは、自らのプロンプトでエンドツーエンドのレイテンシ、利用可能な画像の割合、編集成功率、出力寸法、再試行、トークン消費量を比較する必要がある。
三、Flashは生成、編集、参照画像、Webグラウンディングをサポート
MAI-Image-2.6-Flashはテキストと画像の両方を入力として受け取る。Microsoftは、サポートする編集操作として、オブジェクトの削除、オブジェクトの置換、属性の変更、インペインティング、レイアウト適応、テキスト置換、アーティファクトのクリーンアップを挙げている。このモデルは、対象を絞った変更を適用しながら、構図と視覚的な一貫性を維持することを意図している。
複数参照による編集では、人物、製品、スタイル、シーンなど、異なる画像から得た要素を1つのリクエストに組み合わせられる。これは、生成された構図が製品の外観を維持しつつ、別の参照素材から視覚的な方向性を取り入れる必要がある広告およびデザインのパイプラインにとって特に重要である。
任意のweb_groundingパラメータにより、モデルは画像を生成する前にBing Searchを通じて最新情報を取得できる。Microsoftによると、これにより、現実世界のエンティティ、場所、イベント、または学習後に変化している可能性があるその他の詳細を含むリクエストを改善できる。開発者が有効化しない限り、グラウンディングは無効である。
auto_aspect_ratioオプションでは、モデルがプロンプト、構図、提供された画像に応じて出力形状を選択できる。Microsoftのモデルカードでは、基盤となるファミリーは1536×1536に相当する最大2,359,296ピクセルを生成できるとされ、ローンチ発表では最大1.5Kの解像度が案内されている。
現在のFoundry APIドキュメントでは、より制限の厳しい生成インターフェースが説明されている。幅と高さはそれぞれ少なくとも768ピクセルである必要があり、その積は1,048,576ピクセルを超えることはできず、返される画像は常にレスポンス内でbase64としてエンコードされたPNGである。したがって、モデルカードがファミリー全体としてより高い上限を説明していても、開発者はデプロイ済みAPIの制限に従うべきである。
四、アクセスは従量制Foundryプレビューとして開始
MAI-Image-2.6-Flashは、公開MAI PlaygroundおよびMicrosoft Foundryのプレビューモデルとして利用できる。Foundryへのアクセスには、有料Azureサブスクリプション、サポート対象リージョンのプロジェクト、モデルデプロイの作成に適したAzureロールが必要である。
利用可能なデプロイタイプはGlobal Standardである。Microsoftが公開したクォータ表では、無料枠にリクエストは割り当てられておらず、有料容量は毎分2リクエストから始まる。上位の記載ティアでは、毎分12リクエストまで2リクエスト刻みで増加し、クォータ増加は別の申請プロセスを通じて処理される。
これらの制限は、高スループットのワークロード向けに販売されるモデルにとって重要である。アーキテクチャは画像当たりのレイテンシと計算要件を低減する可能性があるが、プレビュー顧客は無制限の本番容量を想定できない。利用可能性は依然として、リージョン、サブスクリプションティア、デプロイクォータ、Microsoftの承認プロセスに依存する。
このモデルは、一般的なchat-completionsインターフェースではなく、専用のMAI画像生成および画像編集エンドポイントを使用する。アプリケーションはデプロイ名とプロンプトに加え、編集リクエストでは画像を送信し、JSONレスポンス内に生成されたPNGを受け取る。
既存のMAI-Image-2.5ユーザーにとって、実用上の変更は生の速度だけに限定されない。2.6ファミリーは、Webグラウンディング生成とモデル主導のアスペクト比を明示的にサポートし、Microsoftはテキストレンダリング、ポートレート、3次元画像、フォトリアリズム、商用デザイン出力の改善を主張している。
五、Microsoftは規模を開示するが完全な学習コーパスは開示しない
Microsoftのモデルカードによると、MAI-Image-2.6およびFlashは2026年4月17日から7月22日にかけて学習された。関連するデータサマリーでは、画像コーパスは10億枚超の画像を含み、テキストコンポーネントは10億から10兆トークンという広い範囲に収まるとされている。
テキスト学習データは英語の素材だった。Microsoftによると、データセットには大規模な画像キャプションコレクション、合成キャプション、取得済み素材、オープンソースコンテンツ、公開画像が含まれ、収集日は2026年5月まで及ぶ。同社はWikipediaを明示的に特定しているが、すべてのデータセットの項目別リストは公開していない。
Microsoftは、機微なコンテンツについて学習データをフィルタリングし、追加のシステムレベル分類器を展開していると述べている。それでもモデルカードは、画像生成器が暴力的な画像、性的コンテンツ、公人の描写、保護対象素材の複製を含む、有害または予期しない素材を生成する可能性があると警告している。
明示された対象外の用途には、欺瞞的または誤解を招くコンテンツ、実在人物のなりすまし、違法な素材、Microsoftのサービスポリシーに違反するコンテンツが含まれる。これらの安全対策は、生成速度の向上によりモデレーションとレビューを必要とする出力数も増加する可能性がある、自動化された大規模ワークフローにFlashを採用する開発者にとって引き続き重要である。
よくある質問
MAI-Image-2.6-Flashとは何ですか?
これは、テキストから画像への生成と制御可能な画像編集向けに提供される、Microsoft AIのMAI-Image-2.6のより高速・低コストなバージョンである。
GPT-Image-2と比べてどの程度高速ですか?
Microsoftの公式発表では、GPT-Image-2-Mediumの2.8倍の生成速度を主張している。Mustafa Suleymanは、より広くGPT-Image-2より2倍高速と説明した。
MAI-Image-2.6-Flashは一般提供されていますか?
いいえ。Microsoft Foundryでパブリックプレビュー中であり、MAI Playgroundでもインタラクティブにテストできる。
モデルは画像編集をサポートしていますか?
はい。オブジェクトの削除と置換、インペインティング、テキスト更新、レイアウト変更、アーティファクトのクリーンアップを含む操作をサポートしている。
72%のGPU効率という数値は独立して検証されていますか?
この特定の数値を確認する公開された独立方法論はない。Microsoftは、顧客リクエスト当たりのGPU使用量が正確にどの程度低減するかへ換算するには不十分なテスト詳細しか開示していない。
参考ソース
- XにおけるMustafa SuleymanのMAI-Image-2.6-Flash発表
- Microsoft AI:MAI-Image-2.6で品質とコストのフロンティアを押し広げる
- Microsoft AI:MAI-Image-2.6モデルファミリー
- Microsoft Foundryドキュメント:MAI画像モデルのデプロイと使用
- Microsoft Foundryモデルカタログ:MAI-Image-2.6-Flash
- Microsoft AI:MAI-Image-2.6およびMAI-Image-2.6-Flashモデルカード
- Microsoft AI:MAI-Image-2.6およびMAI-Image-2.6-Flashデータサマリー
- Arenaテキストから画像へのリーダーボード
- Artificial Analysis画像モデル比較
Share