マイクロソフトの第一パーティ AI モデルフライホイールは今や自己強化型になっている。今週の証拠:MAI-Transcribe-2 が FLEURS 60言語テストで平均単語誤り率(WER)5.2% で1位を獲得、MAI-Image-2.6 が Arena テキスト生成画像リーダーボードでデビュー即2位、MAI-Code-1.1-Flash が GitHub Copilot のデフォルトコーディングモデルに——前世代から75%のコスト削減。同時に、一世代的な視覚パイプラインを支えていた旧 Azure Vision API は9月13日に 410 Gone を返すようになった。
エンジニアリングリーダーにとって、戦略的全体像は明確になりつつある。マイクロソフトはもはや第一パーティモデルを第三者選択肢の代替としてリリースしているのではない——生産トラフィックをデフォルトで第一パーティにルーティングし、攻撃的な価格設定で競合を抑え込み、競合パスが依存するインフラを段階的に廃止している。今号では過去2週間にリリースされた3つの MAI モデル、Copilot の第一パーティルーティング切り替え、Azure Vision API 廃止の影響、そして Windows チームが今計画すべき Aion 移行タイムラインを取り上げる。
MAI-Transcribe-2:最速・最安・最精度の高い音声認識
MAI-Transcribe-2 は2026年9月3日にパブリックプレビューに入った。マイクロソフトの主張は大胆だ:FLEURS 60言語で1位・平均WER 5.2%、Artificial Analysis AA-WER で2位・WER 2.0%、速度は GPT-Transcribe の約10倍、Scribe v2 の7倍、Gemini 3.5 Transcribe の5倍。価格は攻撃的:音声1時間あたり $0.10、2026年末までの限定価格。
このモデルはネイティブで話者分離と単語レベルタイムスタンプをサポートしており、後処理パイプラインが不要。大規模な文字起こしワークロード(コールセンター分析、会議記録、メディアインデックス作成)を実行するチームにとって、経済的意義は大きい。$0.10/時間で計算すると、10,000時間の音声転録は $1,000——同等のクラウド音声 API の費用のごく一部。60言語を単一モデルでカバーし、既存パイプラインを悩ませるマルチモデルルーティングの複雑さを排除する。
注意点:これらはマイクロソフト自己申告のベンチマーク結果。API アクセスの拡大に伴い独立検証が行われる。ただし価格は Microsoft Foundry で今日直接検証可能であり、パフォーマンスの主張は MAI-Transcribe-1 および1.5の軌跡と一致している。
MAI-Image-2.6:Arena 2位、GPU コスト84%削減
MAI-Image-2.6 は2026年8月10日にローンチ、9月4日に完全公開。主要数字:Arena テキスト生成画像リーダーボードで2位(バージョン2.5から+79 Elo)、Artificial Analysis 画像編集で1位。Flash バリアントは GPT-Image-2-Medium より2.8倍速く、72%効率的。
コスト面が本番デプロイで最も注目すべき点。マイクロソフトは本番ワークロードで GPT-Image-2 に対し GPU コスト84%削減を報告している。このモデルはマルチ画像参照編集、ウェブグラウンディングによる事実確認付き画像生成、動的アスペクト比をサポート——これらは以前は別々のパイプラインが必要だった機能。
Microsoft Foundry 価格:MAI-Image-2.5 ティアは $19.50(Flash)、$47(標準)、$106(Pro) per 100万画像出力。大規模に画像を生成する組織——マーケティングチーム、ECカタログ、コンテンツ制作——にとって、GPU コスト削減はインフラ支出に直接反映される。画像編集能力が Arena で5位から3位へ上昇(+19 Elo)したことは、これが単なる生成モデルではなく信頼できる編集ツールであることを意味する。
MAI-Code-1.1-Flash:コスト75%削減、Copilot 全線でデフォルトに
MAI-Code-1.1-Flash は2026年8月11日に一般提供開始、直ちに全ティア(Free〜Max)で GitHub Copilot のデフォルトコーディングモデルになった。価格:入力 $0.20/100万トークン、出力 $1.20/100万トークン、元の MAI-Code-1-Flash から75%のコスト削減。トークンストリーミング速度25%向上、タスクあたりトークン消費25%削減、画像入力でダイアグラムからコードへのシナリオをサポート。
前世代の MAI-Code-1-Flash は2026年9月10日に廃止。同モデルを対象とした固定プロンプトや評価ハーネスは1.1-Flash に移行する必要がある。GPT-4 Turbo はフォールバックオプションとして2026年11月まで利用可能、その後 MAI-Code-1.1-Flash はマイクロソフトの Maia 200 アクセラレータ上でのみ稼働する。
ルーティングの現実:Bloomberg が Microsoft 365 Copilot で Excel と Outlook のプロンプトが MAI モデルにルーティングされていることを確認。Copilot は単一モデルではなく、タスク分類ルーターを持つオーケストレーションレイヤー。メール作成、要約、Excel 数式生成、構造化データ抽出は MAI にルーティング。エージェントコーディングは MAI-Code-1.1-Flash に。画像生成は MAI-Image-2.5 および2.6に。Teams 文字起こしは MAI-Transcribe に。セキュリティスキャンは MAI-Cyber-1-Flash に。複雑な多段推論とスタイル判断を要するクリエイティブ生成のみが第三者フロンティアモデルにルーティングされ続ける。
アーキテクチャ計画への示唆:第一パーティルーティングが拡大する前提で予算を組む。マイクロソフトは2026年末までに大部分の日常的 Copilot タスクが MAI で実行されると予測している。
Azure Vision API 廃止:昨日 410 Gone に
2026年9月13日、旧 Azure Vision API(バージョン1.0〜3.1)のハード廃止日だった。これらのエンドポイントを呼び出しているアプリケーションは今や 410 Gone レスポンスを受け取る。これはソフト廃止ではない——段階的ランプダウンも延長猶予期間もない。
移行先は Florence-2 ベースの Image Analysis 4.0 SDK。Florence-2 は引き続きマイクロソフトのビジョン基盤モデル:統一された sequence-to-sequence アーキテクチャで、単一の重みセットで12以上の視覚タスクを処理——検出、セグメンテーション、キャプショニング、高密度領域キャプショニング、視覚的グラウンディング、164言語の OCR。大バリアント(7.71億パラメータ)は本番級、ベースバリアント(2.32億)は標準 CPU で実行可能。両者とも MIT ライセンスで Hugging Face に公開、月間ダウンロード数はそれぞれ約266万と81.3万。
Florence-3 の計画はない。マイクロソフトはビジョン基盤層でリリース速度よりも安定性を優先している。Image Analysis 4.0 自体は2028年9月25日に廃止——チームに2年の計画ウィンドウを与える。
まだ移行していない場合、これは本番影響のある停止。今すぐ旧視覚エンドポイントへの呼び出しが残っていないかアプリケーションを監査すること。
Aion 1.0:Phi Silica 切り替えタイムライン
Aion 1.0 は Phi Silica の置き換えとなるオンデバイスモデルで、Build 2026 で発表。2つのバリアント:Aion 1.0 Instruct(要約、書き換え、意図分類用の軽量 SLM——CPU、GPU、NPU で実行可能、専用ハードウェア不要)と Aion 1.0 Plan(140億パラメータ、32K コンテキスト、Windows Agent Framework 経由でオンデバイスエージェント推理用)。
移行には明確な日付がある:
- 2026年10月1日: スタンドアロン Aion Instruct テストパッケージ、LoRA 訓練サポート付き。
- 2026年10月23日: Windows Insiders ロールアウト——Phi Silica と Aion が共存、Controlled Feature Rollout でデバイスごとにアクティブモデルを選択。
- 2026年11月24日: 一般提供開始——Aion Instruct が本番モデルとなり、Phi Silica は小売デバイスから削除。
重要な計画事項:既存の Phi Silica LoRA アダプタは Aion に移行できない。チームがカスタム Phi Silica ファインチューニングに投資している場合、今すぐ再訓練を開始すること。LanguageModel API と ImageDescription API の互換性は維持されるが、基盤モデルの重みは異なる。最終的な GPU 互換性リストと必要な NVIDIA ドライババージョンはまだ未公開——10月の日付までに注視すること。
Phi-4:オープンウェイトの主力は継続
MAI がクラウドフロンティアを主導する一方、Phi-4 は引き続きマイクロソフトのエッジおよび IoT 向けオープンウェイト小規模言語モデルファミリー。最新リリース Phi-4-reasoning-vision-15B(2026年3月)は Phi-4-reasoning バックボーンと SigLIP-2 ビジョンエンコーダを組み合わせたマルチモーダル推論モデル——150億パラメータ、MIT ライセンス、動的思考アクティベーション。Phi-4-mini は2026年7月に Windows 12 Copilot+ PC に搭載、Snapdragon X Elite で約3GB VRAM で42トークン/秒のオフラインコード補完とローカル画像編集を実現。
Phi ファミリーの実力以上のパフォーマンスは継続:Phi-4(140億パラメータ)は数学と推論ベンチマークで自身の5倍のサイズを持つモデルを上回る。これはパラメータ数ではなく合成データ品質と洗練された訓練カリキュラムによる。オンプレミスまたはエアギャップ環境が必要なチームにとって、Phi-4 は依然としてベンチマークである。
Turing:廃止済みとして扱う
Turing モデルファミリーは2025〜2026年に意味のある更新がない。MAI が Turing がサービスを提供していたすべての本番ワークロードを吸収した。アーキテクチャ図にまだ Turing モデルが残っている場合、その図は歴史的文書となっている——置き換えを計画すること。
来週の注目ポイント
- 10月1日: Aion 1.0 Instruct スタンドアロン テストパッケージ。
- 10月23日: Aion 1.0 Instruct が Windows Insiders に到達。
- 11月24日: Aion 1.0 一般提供開始;Phi Silica が小売 Windows から削除。
- 2026年11月: GPT-4 Turbo フォールバック終了——MAI-Code-1.1-Flash が唯一のデフォルトに。
- ウォッチリスト: MAI-Realtime(全二重音声)が MAI Playground で確認されたが正式発表なし——ローンチが間近の可能性。MAI-Thinking-1 の独立ベンチマークはより広い API アクセスを待つ必要あり。
マイクロソフトの第一パーティフライホイールは自身の勢いで回っている:新モデル、攻撃的価格設定、Copilot のデフォルトルーティング、そして競合インフラのハード廃止日。エンジニアリングチームの務実な姿勢は、今すぐ日常的ワークロード向けに MAI モデルの評価を始めること——経済性と統合の深さは、マイクロソフトプラットフォーム上で第三者選択肢が匹敵できない構造的優位性になりつつある。
これらのモデルがリリースされる際のリアルタイム分析は https://x.com/kkaminsk でフォローしてください。