兩天內兩項發表。MAI-Code-1.1-Flash 於 8 月 11 日推出,成本較前代降低 75%,並新增影像輸入支援。MAI-Image-2.6 於 8 月 10 日上線,在 Arena 文生圖排行榜上躍居第二名,領先 Google、Meta 與 xAI。兩者皆為 Microsoft 第一方模型——內部自行訓練、經由 Copilot 路由,並在 Azure Foundry 與各級 GitHub Copilot 方案中全面提供。
訊號再明確不過:MAI 系列正以驚人速度迭代,足以在成本敏感的工作負載上取代第三方模型,同時持續提升品質。
MAI-Code-1.1-Flash:更快、更便宜、多模態
標題數字相當驚人。與 MAI-Code-1-Flash(6 月於 Build 2026 發表)相比,1.1 版帶來:
- 成本降低 75%: $0.20/1M 輸入、$0.02/1M 快取、$1.20/1M 輸出——從 $0.75/$0.075/$4.50 大幅下調
- Token 串流速度快 25%,每個任務的 Token 用量少 25%
- Terminal-Bench 2.1(GitHub Copilot CLI)提升 +22%: 51.7% → 62.9%
- .NET 任務提升 +15%,程式碼留存率 +4%、回訪率 +9%
- SWE-Bench Verified 達 72.6%,每個解題任務平均僅 8.6K Token
- 影像輸入——MAI-Code 系列首見,支援截圖轉程式碼(screenshot-to-code)工作流程
架構維持稀疏 MoE,總參數 138B / 啟用約 5B,具備 256K 上下文與 128K 最大輸出,並以 200 萬筆合成任務與 15 萬個 RL 環境訓練。它現在已是所有 GitHub Copilot 方案(Free 至 Enterprise,Business/Enterprise 需管理員開啟)的正式生產模型。MAI-Code-1-Flash 將於 9 月 10 日退役;GPT-4 Turbo 備援則運作至 11 月。若你直接透過 Azure Foundry 呼叫 MAI-Code,請立即更新端點。
MAI-Image-2.6:在 Arena 上追趕 OpenAI
MAI-Image-2.6 於 8 月 10 日推出,旋即登上文生圖 Arena 排行榜第二名——僅次於 OpenAI,領先所有其他競爭對手。相較 MAI-Image-2.5 的提升相當全面:整體 Elo +79、文字渲染 Elo 更達 +91,人像、3D 影像與寫實商業輸出的表現也更強。
現已可在 Arena 使用;MAI Playground、Foundry 及其他介面將在未來數週陸續上線。Microsoft 在 2.x 系列維持 API 相容性,因此從 MAI-Image-2.5($47/1M)或 Flash($19.50/1M)升級的路徑十分直接。實際意義:Microsoft 內部數據顯示,生產環境中 GPU 成本較 GPT-Image-2 降低 84%。對大規模影像生成而言,這是不可忽視的成本項目。
MAI-Thinking-1:公開預覽上線,獨立基準測試仍待觀察
旗艦推理模型(約 1T 總參數 / 約 35B 啟用參數的稀疏 MoE,256K 上下文)於 8 月 12 日在 Azure Foundry 進入公開預覽。Microsoft 公佈的基準測試成績依然亮眼:AIME 2025 達 97.0%、AIME 2026 達 94.5%、SWE-Bench Pro 達 52.8%,並在 Surge 的 1,276 個任務中盲測偏好勝過 Claude Sonnet 4.6。
但獨立基準測試仍然稀缺。Foundry 公開預覽代表你已可取用 API 自行評估——在下定決心之前,先跑你自己的基準測試。
Phi-4:邊緣運算故事漸趨成熟
Phi-4 家族現已涵蓋 10 多個 MIT 授權的變體,規模從 3.8B 到 15B 不等。本週關鍵進展:
Azure AI Studio 整合(7 月 25 日)將 Phi-4 帶上雲端,支援 128K 上下文與 Azure ML 微調——適合同一模型同時在裝置端與雲端執行的混合部署。
Phi-4-mini-flash-reasoning 採用 SambaY 架構(Mamba 狀態空間 + 滑動視窗注意力 + Gated Memory Units),相較 Phi-4-mini-reasoning 吞吐量提升 10 倍、延遲改善 2–3 倍。如果你的邊緣 AI 路線圖尚未考量非 Transformer 架構,這值得你關注。
Phi-4-reasoning-vision-15B(2026 年 3 月)目前被推薦用於新的多模態推理工作負載——GUI 定位在 ScreenSpot v2 達 88.2%,具備雙推理模式,是需要推理能力的 Florence-2 有效替代方案。
Florence-2:硬性期限僅剩 28 天
舊版 Azure Vision API(v1.0–3.1)將於 2026 年 9 月 13 日 退役——距今天僅 28 天。各組織必須遷移至基於 Florence-2 的 Image Analysis 4.0 SDK。這是硬性截止,不是軟性棄用。
目前並未宣布 Florence-3。策略很明確:純視覺任務留在 Florence-2,推理加視覺則移往 Phi-4-reasoning-vision-15B。兩者皆為 MIT 授權;透過 LoRA 微調,在專業資料集上可達 >98% 的精確度。
Aion 1.0:Phi Silica 的黃昏
Aion 1.0 Instruct 已進入開發者預覽(Edge Canary/Dev 150.0.4070+),將取代 Phi Silica 成為 Windows 的裝置端模型。轉型時程如下:
- 10 月 1 日: 獨立 Aion Instruct 測試套件
- 10 月 23 日: Windows Insider 部署(Phi Silica 仍保留,可透過 CFR 選擇模型)
- 11 月 24 日: 正式上市(GA)——Aion Instruct 成為生產模型,Phi Silica 從零售裝置移除
Aion 1.0 Plan(14B、32K 上下文)是更具企圖心的版本——一個裝置端代理執行環境,透過 Windows Agent Framework 支援工具呼叫與子代理協調,需配備 ≥40 TOPS NPU 或符合資格的獨立 GPU。關鍵在於,Aion Instruct 不像 Phi Silica 需要 LAF token——移除了開發者實際遇到的痛點。Phi Silica 在 PowerToys v0.101(8 月 10 日)獲得最後一次更新,但如果你現在仍以它進行開發,請立即開始你的 Aion 遷移規劃。
Copilot 路由的現實檢視
CNBC 於 8 月 5 日報導,Microsoft 內部預設將員工使用的 GitHub Copilot 導向 OpenAI GPT-5.6 Sol,同時提供 MAI 模型作為選項。這並非矛盾——而是策略照設計運作。Copilot 的任務分類層會將一般任務導向 MAI 模型以節省成本;複雜推理與創意生成則交給前沿模型。箇中差異:第一方模型在高量、成本敏感的任務上勝出,前沿模型則在複雜推理上勝出。你的架構應同時支援兩者——Copilot 的路由層已經自動做到這點。
行動清單
- 更新 MAI-Code 部署: 若透過 Azure Foundry 呼叫 MAI-Code,請在 9 月 10 日 v1.0 退役前遷移至 1.1-Flash。
- 評估 MAI-Image-2.6: 大規模影像生成——與你目前的供應商進行基準比較。成本優勢相當有說服力。
- 自行執行 MAI-Thinking-1 基準測試: 公開預覽已在 Foundry 上線。別只依賴廠商公佈的數字。
- Florence-2 遷移: 9 月 13 日截止。只剩 28 天。現在就行動。
- Aion 遷移規劃: 若以 Phi Silica 進行開發,10 月 1 日的測試套件只剩四週。請準備 LoRA 訓練資料。
- 重新檢視 Copilot 路由假設: 你的 Copilot 依賴計畫應反映 MAI/第三方模型的分工,而非假設一切皆由 OpenAI 提供。
Microsoft 的第一方技術棧涵蓋客製晶片(Maia 200)、雲端模型(MAI)、開放權重邊緣模型(Phi-4)、裝置端模型(Aion)、視覺基礎模型(Florence-2)與編排層(Copilot)。一週內兩項重大模型發表——這已經不是研究專案了。這是一個生產級平台。
本文為 Microsoft AI Weekly 系列 的一部分。歡迎追蹤 x.com/kkaminsk 獲取持續分析。