上週我們報導了 Bloomberg 證實 Microsoft 正將生產環境的 Office 工作負載導向其自有 MAI 模型。本週,整體輪廓更加清晰:Microsoft 的第一方 AI 堆疊已不再是願景藍圖,而是從裝置端到雲端、以完整垂直架構部署、定價並運作的現實。對於 CTO 與工程負責人而言,問題已從「Microsoft 的模型準備好了嗎?」轉變為「當一家廠商同時掌控晶片、模型與應用程式時,我們該如何規劃架構?」

完整的第一方堆疊

Microsoft 現已成為 Google 與 Apple 之外,唯一擁有完整全端 AI 產品組合的廠商。以下是截至 2026 年 7 月的架構:

裝置端(Aion 1.0): 適用於摘要、改寫與意圖分類的輕量推論 — 在 Edge 與 Windows 的 CPU、GPU 或 NPU 上執行。140 億參數的 Aion 1.0 Plan 變體可透過 Windows Agent Framework 處理具工具呼叫與子代理協調的自主工作流程。開放權重預計本月於 Hugging Face 上架。

邊緣端(Phi-4 系列): 十款 MIT 授權模型,參數量從 3.8B 到 15B 不等。Phi-4-mini 可在 Raspberry Pi 5 上執行。Phi-4-mini-flash-reasoning 採用 SambaY 混合架構(Mamba + 滑動窗口注意力 + Gated Memory Units),實現 10 倍吞吐量提升。Phi-4-reasoning-vision-15B 配備 SigLIP-2 視覺編碼器,可處理多模態推理。

雲端前沿(MAI 系列): 於 Build 2026 發表七款模型,涵蓋推理(MAI-Thinking-1)、自主編碼(MAI-Code-1-Flash)、圖像生成(MAI-Image-2.5 與 Flash)、語音轉文字(MAI-Transcribe-1.5)以及文字轉語音(MAI-Voice-2 與 Flash)。所有模型均以商用授權資料從頭訓練,完全不依賴第三方模型的蒸餾技術。

晶片(Maia 200): 3nm 製程、1,400 億顆電晶體、216GB HBM3e。目前已正式投入 MAI 推論生產環境。MAI-Code-1-Flash 預計於 2026 年 8 月全面遷移至 Maia 200。

基礎模型(MAI-1-preview): Microsoft 首個端到端訓練的基礎模型,目前正在 LMArena 上測試。公開資訊有限,但此舉明確顯示 Microsoft 有意在前沿模型層級競爭 — 而不僅止於任務特定模型。

這並非零散解決方案的集合,而是一套經過深思熟慮的架構堆疊,每一層皆為下一層提供支撐。

Copilot 路由架構深度解析

過去兩週最具戰略意義的細節並非新模型的發表,而是 Microsoft 365 Copilot 流量路由機制的揭露。Copilot 並非單一模型的產品,它採用任務分類層,根據任務類型、複雜度與品質要求對每次互動進行分類,再選取合適的模型。

路由至 MAI(第一方、高流量):

  • 依據郵件串脈絡草擬回覆(Outlook)
  • 郵件串與會議摘要生成
  • 從自然語言產生試算表公式(Excel)
  • 主旨與標頭生成
  • 從固定格式文件中提取結構化資料
  • 從會議記錄中提取任務與行動項目
  • VS Code 與 GitHub Copilot CLI 中的自主編碼(MAI-Code-1-Flash)
  • PowerPoint 與 OneDrive 中的圖像生成與編輯(MAI-Image-2.5)

路由至第三方前沿模型:

  • 針對長篇非結構化文件進行新穎分析
  • 涉及複雜依賴關係的多步驟推理
  • 需要風格判斷的創意生成
  • 錯誤成本較高的敏感或模糊任務

路由機制是動態的。隨著 MAI 模型持續進步,路由範疇也會持續擴大。Microsoft 有充分誘因將更多流量導向其自有模型 — 每筆在 Maia 200 上路由至 MAI 的查詢,都消除了支付給 OpenAI 或 Anthropic 的每 token 利潤。

值得留意的是,Microsoft 於 6 月 16 日推出的自主代理產品 Copilot Cowork,目前運行於 Anthropic Claude(Opus 4.8 與 Sonnet 4.6),而非 MAI。Microsoft 自家的 Cowork 1 微調模型雖已發表,但尚未投入實際代理運作。這是一個誠實的訊號:MAI 模型在常規推論上已達生產水準,但 Microsoft 承認第三方前沿模型在特定領域仍具優勢。

MAI 定價:單位經濟效益解析

Microsoft 已在 Foundry 上公布 MAI 模型的定價,這些數字值得任何進行成本模型評估的團隊仔細檢視:

  • MAI-Transcribe-1: 每小時 $0.36 的語音轉錄(43 種語言,FLEURS 字元錯誤率 4.86% — 業界最低)
  • MAI-Voice-1: 每 100 萬字元 $22(15 種以上語言,支援語音調適與情緒控制)
  • MAI-Image-2.5: 每 100 萬文字輸入 token $5、每 100 萬圖像輸入 token $8、每 100 萬圖像輸出 token $47
  • MAI-Code-1-Flash: 定價低於 Claude Haiku,同時在 SWE-Bench Pro 上取得 51.2% 的成績(Haiku 為 35.2%),且 token 用量減少 60%

定價策略相當積極。Microsoft 並未將 MAI 定價與第三方競品拉齊,而是以更低價格提供更佳基準測試表現。對於高用量工作負載(語音轉錄、圖像生成、程式碼補全),成本差異會迅速累積。

這裡的發行管道同樣值得關注。MAI 模型可透過 Microsoft Foundry、MAI Playground(免費網頁測試)以及 — 值得注意的是 — OpenRouter、Fireworks AI 與 Baseten 取得。這是 Microsoft 首次在非 Azure 推論平台上提供第一方模型。鎖定其他雲端供應商的企業團隊,如今無需 Azure 承諾即可使用 MAI 模型。

Florence-2:穩健勝於炒作

雖然 Phi-4-reasoning-vision-15B 作為多模態後繼者搶盡版面,Florence-2 仍是純電腦視覺領域的企業主力模型。目前並無 Florence-3 的開發計畫。取而代之的是,Microsoft 持續投入生態系成熟度:推出 C#/.NET NuGet 套件以支援本機 ONNX 執行、NVIDIA DeepStream 整合以實現即時邊緣影像分析,以及具備 164 種語言 OCR 能力的 Azure AI Vision Image Analysis 4.0 SDK。

Florence-2 統一的提示式架構 — 以單一權重透過文字提示處理 12 種以上視覺任務 — 在架構上依然優雅簡潔。對於建置生產級電腦視覺管線的團隊而言,選擇十分明確:輕量、高吞吐量的視覺任務使用 Florence-2;需要語言生成與逐步推理的多模態任務則選用 Phi-4-reasoning-vision-15B。

Phi-4 密度策略

評估邊緣 AI 的工程負責人應特別關注 Phi-4 系列。其核心論點是密度 — 以 140 億參數的模型在數學與程式碼基準上與 700 億參數等級的模型競爭。

Phi-4-reasoning-plus 在 AIME 2025 上獲得 82.5%,與 DeepSeek-R1-Distill-Llama-70B 相當,但體積僅為其五分之一。Phi-4-mini(3.8B)在 MMLU 上擊敗許多 8B 等級的模型,擁有 20 萬 token 詞彙量與支援 22 種以上語言的原生函式呼叫能力。SimpleQA 的侷限值得注意 — Phi-4 在事實查核上僅獲得 3.0 分,若不搭配檢索增強,不適合做為通用知識助手。

Phi-4-mini-flash-reasoning 在架構創新上最為突出。SambaY 架構 — 結合 Mamba 狀態空間模型、滑動窗口注意力與 Gated Memory Units — 是對傳統 Transformer 的根本性突破。10 倍吞吐量提升搭配 2 至 3 倍延遲降低,並非漸進式優化,而是足以改變邊緣 AI 部署經濟學的架構變革。

這對企業策略的意義

對於本季進行基礎設施決策的 CTO,以下三點建議:

1. 供應商鎖定的計算邏輯已改變。 Microsoft 從晶片到模型再到應用程式的垂直整合,過去被視為供應商鎖定的隱憂;到了 2026 年,這已成為成本削減策略。在 Maia 晶片上運行的 MAI 模型消除了第三方利潤。問題在於:成本節省是否足以證明架構承諾的合理性。

2. 模型評估應以工作負載為導向。 Microsoft 在 Copilot 內部的路由架構正是最佳範本。不要為所有任務標準化使用單一模型。將常規推論(摘要、結構化提取、公式生成)導向 MAI 等成本效益模型,將複雜推理導向前沿模型。節省的關鍵在於路由策略,而非模型選擇。

3. Phi-4 開放權重系列是最安全的邊緣部署選擇。 MIT 授權、10 種以上變體,從 Raspberry Pi 到 NVIDIA Jetson 皆可執行。無供應商鎖定、無授權風險,且效能可比肩體積大五倍的模型。對於不論是基於成本、延遲或資料主權考量而部署本機推論的團隊,Phi-4 是預設首選。

Microsoft 在 2026 年的 AI 策略,並非追趕 OpenAI 或 Anthropic,而是打造一套完整的垂直整合堆疊,讓 Microsoft 掌控每一個層級。模型已就緒,晶片已就緒。企業買家需要回答的問題是:整合的溢價是否值得靈活性的取捨。

關注最新動態,請追蹤 X:https://x.com/kkaminski