上週我們報導了彭博社證實微軟正將生產環境的 Copilot 流量導向其自有的 MAI 模型。本週,更完整的輪廓浮現:微軟已組建了一套完整的第一方 AI 堆疊,涵蓋客製化晶片、前沿雲端模型、開放權重邊緣模型、裝置端代理,以及將這一切串聯起來的編排層。定義第一波 Copilot 的 OpenAI 依賴正在退場——並非出於交惡,而是有計劃的架構性替換。

對於 IT 領導者而言,本週是理解微軟模型組合全貌的關鍵時刻。從現在開始所做的架構決策——該標準化哪些模型、在何處執行推論、如何管理代理身份——將在未來數年內深受此堆疊的影響。

1. MAI 家族:七大模型,零蒸餾

MAI(Microsoft AI)家族於 Build 2026 大會亮相,是微軟迄今最大手筆的內部 AI 投資。共七個模型,全部由 Mustafa Suleyman 的 AI 超級智慧團隊使用內部「Hill-Climbing Machine」訓練管線從頭訓練完成。無需從 OpenAI 或任何第三方蒸餾。無合成訓練資料。僅使用人類生成、經商業授權的內容,並經過去汙染基準測試。

MAI-Thinking-1 是旗艦推理模型——採用稀疏混合專家(sparse MoE)架構,約 1T 總參數中約 35B 活躍參數,256K 上下文視窗,在 SWE-Bench Pro 上與 Claude Opus 4.6 匹敵(約 53%)。AIME 2025 得分 97.0%,AIME 2026 得分 94.5%。微軟聲稱其 token 效率約為 GPT-5.5 的 10 倍。該模型目前在 Microsoft Foundry 上提供私人預覽,在 GitHub Models 上提供免費層級存取,並可在 OpenRouter、Fireworks AI 和 Baseten 上使用——這是微軟首次在非 Azure 推論平台上推出第一方模型。

MAI-Code-1-Flash 將是多數企業最先接觸到的模型。透過稀疏 MoE 約 137B 總參數中約 5B 活躍參數,它在 SWE-Bench Pro 上獲得 51.2%——領先 Claude Haiku 4.5 的 35.2% 達 16 個百分點——同時使用最多減少 60% 的 token。該模型自 6 月 26 日起已全面在 GitHub Copilot 所有層級中正式推出,預計在 2026 年 8 月取代 GPT-4 Turbo 成為 Copilot 的預設模型。三個月的 GPT-4 Turbo 降級緩衝期將持續至 2026 年 11 月,之後 MAI-Code-1-Flash 將在微軟的 Maia 200 加速器上成為預設模型。

該家族的範圍超越推理與程式碼。MAI-Image-2.5 在 Arena AI 影像編輯排行榜排名第二,已整合至 PowerPoint 和 OneDrive。MAI-Transcribe-1.5 涵蓋 43 種語言,在 FLEURS 基準測試上字錯誤率僅 4.86%——為所有競爭對手中最低——速度約為競爭模型的 5 倍,正整合至 Copilot、Teams 和 Dynamics 365 Contact Centre。MAI-Voice-2 支援 15 種以上語言,可從 5-60 秒的參考音訊進行零樣本語音複製,相較前代產品的盲測偏好率達 72%。

對 IT 領導者的意義: MAI 家族並非研究專案——它是生產基礎設施。MAI-Code-1-Flash 已在 GitHub Copilot 中正式上線。MAI-Transcribe-1.5 正整合至 Teams 和 Copilot。MAI-Image-2.5 已在 PowerPoint 中上線。Copilot 內部的模型路由層正逐漸傾向於這些第一方模型,原因在於成本與延遲。企業應預期,大多數常規 Copilot 任務——草擬、摘要、轉錄、圖片生成——將在 2026 年底前由 MAI 模型執行,而 GPT-5.6 和 Claude 等前沿模型則保留給複雜推理場景。

2. Phi-4:超規格表現的開放權重 SLM

Phi-4 家族現已擴展至 10 個以上模型,參數量從 3.8B 到 15B 不等,全部採用 MIT 授權。其核心主題是密度——14B 模型在數學和程式碼基準測試上與 70B 級別模型競爭。

Phi-4-reasoning-plus(14B)在 AIME 2025 上獲得 82.5%,在 HumanEval+ 以 0.929 位居開源模型第一,與 DeepSeek-R1-Distill-Llama-70B 競爭但大小僅為其五分之一。Phi-4-mini(3.8B)可在 Raspberry Pi 5 上運行,MMLU 達 73%——超越許多 8B 級別模型。Phi-4-mini-flash-reasoning 採用 SambaY 架構(Mamba 狀態空間模型、滑動視窗注意力與閘控記憶體單元的混合體),吞吐量最高可達 Phi-4-mini-reasoning 的 10 倍,延遲降低 2-3 倍。這是真正的架構性突破,而非僅是縮小版 Transformer。

近期最重要的新增是 Phi-4-reasoning-vision-15B(2026 年 3 月),它將文字生成與深度視覺理解及鏈式推理相結合。在 ScreenSpot v2 的 GUI 定位基準上獲得 88.2%,MathVista 獲得 75.2%,AI2D 科學圖表獲得 84.8%。它使用 SigLIP-2 視覺編碼器,具備雙重模式——推理模式用於複雜分析,直接回答模式用於簡單查詢。該模型有效地取代了 Florence 視覺產品線的新多模態應用場景。

對 IT 領導者的意義: Phi-4 模型是邊緣部署的核心方案。它們可在標準筆電、智慧型手機,甚至透過 WebLLM 在瀏覽器中運行。對於正在建立裝置端 AI 能力的組織——離線轉錄、文件分析、本地程式碼輔助——Phi-4 提供了無授權成本的生產級模型。MIT 授權意味著無商業使用限制。Phi-4-mini-flash-reasoning 中的 SambaY 架構對於 IoT 和重視延遲的嵌入式場景尤為值得關注。

3. Aion 1.0:無限量裝置端智慧

Aion 1.0 是微軟最新的裝置端模型家族,專為 Windows 和 Edge 設計,代表「無限量智慧」——本地 AI 處理,零雲端依賴,每次推論的邊際成本為零。

Aion 1.0 Instruct 是一款輕量級 SLM,用於日常文字任務——摘要、改寫、意圖分類。可在 CPU、GPU 或 NPU 上運行,無需專用 GPU。現已在 Edge Canary/Dev 中提供,支援 Prompt API 和 Writing Assistance API,開放權重預計於 2026 年 7 月在 Hugging Face 上發布。它還透過 Edge 150+ 中的 WebSpeech API 驅動裝置端語音轉文字功能。

Aion 1.0 Plan 是更具雄心的模型——14B 參數,32K 上下文視窗,專為裝置端代理工作流程設計,包括推理、工具呼叫、檔案管理和子代理編排。它作為 Windows Agent Framework 的一部分,隨支援的 Windows 裝置內建出貨,該框架已在 Build 2026 開源。這不是聊天機器人;它是一個代理運行時,能夠推理使用者意圖並在本地編排子代理。

硬體路徑十分明確:NPU 路徑需要最低 40 TOPS NPU 的 Copilot+ PC(Snapdragon X Elite、Intel Lunar Lake),GPU 路徑需要 NVIDIA RTX 30+ 或 AMD Radeon RX 9060+,以及標準 Windows 11 CPU 降級方案。先前的裝置端模型 Phi Silica 也已從僅 NPU 擴展至支援 GPU。

對 IT 領導者的意義: Aion 補全了微軟從裝置到雲端的模型堆疊:Aion 負責裝置端輕量任務,Phi-4 負責中量級邊緣推理,MAI 負責雲端前沿推論。對於關注資料落地、延遲或雲端推論成本的組織,裝置端堆疊正變得足以應付實際工作負載。Windows Agent Framework 意味著 Windows 本身正在成為代理平台——IT 團隊應開始評估哪些代理工作負載可在本地運行,哪些需要雲端推論,並據此更新裝置管理政策。

4. Copilot 的多模型架構:編排器模式

Microsoft 365 Copilot 並非單一模型——它是一個編排層。任務分類層會根據任務類型、複雜度和品質要求對每次使用者互動進行分類,然後路由至適當的模型。

目前的路由邏輯將工作負載劃分為兩類:MAI 模型處理高流量常規推論,GPT-5.6 和 Anthropic Claude 等前沿模型處理複雜任務。MAI 負責電子郵件回覆草擬、對話串與會議摘要、試算表公式生成、結構化資料擷取以及代理式程式設計。前沿模型負責跨長篇非結構化文件的新穎分析、具複雜依賴關係的多步驟推理,以及需要風格判斷的創意生成。

值得注意的是,Copilot Cowork——微軟的自動化代理產品——主要運行在 Anthropic Claude(Opus 4.8 和 Sonnet 4.6)上,而非 MAI。微軟自家微調的「Cowork 1」模型雖已發布,但尚未在產品推出時驅動該代理。這是一個務實的選擇:Anthropic 的模型目前在代理任務上領先,微軟不會為了模型民族主義而犧牲產品品質。

GPT-5.6 於 7 月 9 日被宣布為 M365 Copilot 的「首選模型」,但「首選」並非「獨占」。該架構的設計目的是隨著模型能力通過驗證,逐步擴大 MAI 的路由佔比。

對 IT 領導者的意義: 多模型架構是優勢而非限制。它意味著 Copilot 會自動為每個任務選擇最佳模型,無需使用者干預。但這也意味隨著微軟調整路由策略,模型品質和成本可能在不經意間發生變化。企業應監控 Copilot 的遙測資料,了解哪些模型正在處理哪些任務,並驗證隨著路由轉向 MAI,服務品質仍維持一致。

5. Maia 200:晶片層

支撐整個 MAI 戰略的是微軟的客製化晶片。Maia 200 是一顆 3nm AI 加速器,擁有 1400 億個電晶體、216GB HBM3e 記憶體、7 TB/s 頻寬,每美元效能較上一代提升 30%。叢集最高可擴展至 6,144 顆加速器。

Maia 200 專為推論而設計——具體而言,是在 Azure 資料中心高效運行 MAI 模型。GitHub Copilot 中 MAI-Code-1-Flash 的預設上線將運行在 Maia 200 上,而非 NVIDIA 硬體。這代表微軟正全面掌握整個推論堆疊:晶片、模型架構、訓練管線和應用層。

對 IT 領導者的意義: 晶片層不太可能直接影響您的日常營運,但它正是微軟模型獨立性的經濟基礎。客製化晶片意味著微軟能以低於租用 NVIDIA GPU 容量運行第三方模型的成本來運行自家模型。這種成本優勢將逐步反映在 Copilot 的定價和路由決策上。

6. Florence-2 與視覺基礎設施層

即便 Phi-4-reasoning-vision-15B 已拿下多模態推理的桂冠,Florence-2 仍是純電腦視覺領域的企業級標準。目前沒有 Florence-3 的開發路線圖。Florence-2(基礎版 0.23B,大型版 0.77B)持續驅動 Azure AI Vision Image Analysis 4.0,透過單一提示式介面支援 164 種語言的 OCR、物體偵測、分割與密集標註,涵蓋 12 項以上視覺任務。

其生態系統已相當成熟:提供 C#/.NET NuGet 套件供本地 ONNX 執行、NVIDIA DeepStream 整合實現即時邊緣影片分析,以及 LoRA 微調在專用資料集上達到 98% 以上的精確度。Florence-2 是基礎設施——它穩定運作、已部署上線,沒有理由去擾動它。

對 IT 領導者的意義: 如果您正在 Azure 上建置電腦視覺管線,Florence-2 仍然是正確的選擇。對於融合文字與視覺推理的新多模態應用場景,Phi-4-reasoning-vision-15B 則是更佳選項。這兩個模型服務不同目的,在可預見的未來將在微軟的產品組合中並存。

戰略下一步

  1. 為 MAI-Code-1-Flash 成為預設模型做好準備——2026 年 8 月的轉換僅剩數週。清查您的 GitHub Copilot 使用情況,並在新的預設模型成為強制選項前,先用新模型對開發者體驗進行基準測試
  2. 評估 Phi-4 在邊緣部署的應用——如果您有需要裝置端 AI 的場景(離線、低延遲、資料主權),採用 MIT 授權的 Phi-4 家族已達到生產就緒,可免費部署
  3. 規劃 Windows Agent Framework——Aion 1.0 Plan 隨支援的 Windows 裝置出貨,可實現本地代理編排。更新您的裝置管理政策,以因應裝置端 AI 代理的到來
  4. 監控 Copilot 模型路由——隨著微軟將更多流量轉向 MAI 模型,透過 Copilot 分析工具追蹤品質指標,確保任務執行效能保持一致
  5. 關注 Aion 開放權重的發布——預計 2026 年 7 月在 Hugging Face 上線,Aion 1.0 Instruct 的開放權重將使自訂裝置端 AI 場景無需授權成本
  6. 規劃您的模型策略——了解您的工作負載適合 Aion(裝置端)、Phi-4(邊緣)還是 MAI(雲端)層級,並開始為多層級模型部署進行架構設計,而非依賴單一雲端端點

微軟的第一方模型堆疊現已完整:底層是 Maia 200 晶片,雲端是 MAI 前沿模型,邊緣是 Phi-4 開放權重模型,Windows 裝置端是 Aion 模型,而 Copilot 則作為編排層。對 IT 領導者而言,問題不再是微軟能否在沒有 OpenAI 的情況下建立具競爭力的 AI——他們已經證明了這一點。問題在於,您的組織能多快適應一個多層級、多模型的世界——在這樣的世界中,每個任務的最佳模型可能運行在不同的裝置、不同的資料中心,甚至完全不同的晶片架構上。