微軟第一方 AI 模型戰略已經到了這樣的節點:各項成果不只是陸續推出,而是正在生產環境中取代第三方模型。本週的轉折點:MAI-Code-1-Flash 現已成為 GitHub Copilot 全線的預設編碼模型,取代 GPT-4 Turbo,並設有為期三個月的回退視窗、於 2026 年 11 月結束。

對工程負責人而言,問題已從「微軟能不能自己造模型?」轉變為「我該以多大力度把工作負載遷移到第一方 MAI,還是繼續使用 GPT-5.6 和 Claude?」本期涵蓋 Copilot 的路由切換、Aion 1.0 端側時程、六天後到期的 Azure Vision API 停用,以及正悄然為開源權重多模態推理樹立新標竿的 Phi-4-reasoning-vision。

MAI-Code-1-Flash:Copilot 預設模型正式換成第一方

MAI-Code-1-Flash 於 6 月 26 日在所有 Copilot 層級(Free 至 Max)正式發布,並於 2026 年 8 月成為預設編碼模型。其架構為稀疏混合專家(MoE)設計——總參數 1,370 億、激活參數 50 億、上下文視窗 256K——並針對 VS Code 與 GitHub Copilot CLI 工作流做了最佳化。

SWE-Bench Pro 達到 51.2%,以最高 60% 更少的 token 用量領先 Claude Haiku 4.5 達 16 個百分點(35.2%)。定價:輸入 $0.75/百萬 token、輸出 $4.50/百萬 token——顯著低於同類第三方選項。該模型直接在 GitHub Copilot 生產工作流與授權程式碼庫上訓練,這正是其代理型編碼能力強勁的原因。

切換計畫對在生產環境運行 Copilot 的團隊至關重要:GPT-4 Turbo 作為回退選項保留至 2026 年 11 月,此後 MAI-Code-1-Flash 將完全運行在微軟 Maia 200 加速器上。如果你有依賴 GPT-4 Turbo 行為的提示詞工程或評測管道,現在就是針對 MAI-Code-1-Flash 進行測試的時候。

Copilot 路由:哪些任務走 MAI,哪些仍用第三方

彭博社證實 Microsoft 365 Copilot 現在將 Excel 與 Outlook 的提示詞路由至 MAI 模型。目前的路由劃分:

日常任務——Outlook 郵件回覆草擬、會議總結、Excel 公式生成、VS Code 編碼(MAI-Code-1-Flash)、PowerPoint 與 OneDrive 影像生成(MAI-Image-2.5)、Teams 逐字稿(MAI-Transcribe-1.5)——均路由至第一方 MAI。對長篇非結構化文件的新穎分析、複雜多步推理,以及需要風格判斷的創意生成,仍路由至 GPT-5.6 與 Claude;GPT-5.6 仍是 Microsoft 365 Copilot 的首選模型,但在經濟性允許的場景下路由日益偏向第一方。

趨勢很清晰:到 2026 年底,大多數例行 Copilot 任務將運行在 MAI 模型上。請按第一方路由將持續擴大(而非收縮)的假設為 Microsoft 365 Copilot 部署做預算。

Aion 1.0:Windows 端側 AI 時程明確

Aion 1.0 於 Build 2026 大會發布,是微軟「不限量智慧」的佈局——零雲端依賴、零邊際推理成本。它將取代 Phi Silica 成為 Windows 的端側模型,共有兩個變體:

Aion 1.0 Instruct 在 CPU、GPU 或 NPU 上處理摘要、改寫、意圖分類與無障礙任務——無需專用硬體。開發者預覽現已在 Edge Canary 與 Dev 版本中提供(edge://flags,“Enable prerelease on-device language model”)。

Aion 1.0 Plan 是重量級變體:140 億參數、32K 上下文,專為端側代理型推理設計,包括工具呼叫、檔案管理與子代理編排。它將透過微軟在 Build 2026 開源的 Windows Agent Framework 預載到具備能力的 Windows 裝置上。硬體需求:搭載 40+ TOPS NPU 的 Copilot+ PC(Snapdragon X Elite、Intel Lunar Lake),或 NVIDIA RTX 30+ / AMD Radeon RX 9060+ GPU。

時程:10 月 1 日發布獨立測試包,10 月 23 日向 Windows Insiders 推送,2026 年 11 月 24 日正式發布——Phi Silica 同一天從零售裝置上移除。現有 Phi Silica LoRA 適配器無法遷移到 Aion——請立即規劃重新訓練。

Azure Vision API:六天後硬性停用

本週最緊急:舊版 Azure Vision API(1.0–3.1 版)將於 2026 年 9 月 13 日停用——是硬性停用,而非軟性淘汰。任何仍在呼叫這些端點的應用程式都將收到 410 Gone 回應。

遷移目標是基於 Florence-2 的 Image Analysis 4.0 SDK。Florence-2 仍是微軟的視覺基礎模型:統一的 seq2seq 架構,以單一權重集處理 12+ 項視覺任務,包括物體偵測、分割、影像描述、164 種語言的 OCR 與視覺定位。large 變體(7.7 億參數)達到生產級;base 變體(2.3 億參數)可在標準 CPU 上運行。

採用數據印證了它的穩定性:截至 2026 年 7 月,base 模型在 Hugging Face 上每月約 266 萬次下載,large 模型約 81.3 萬次。Florence-3 尚無消息。9 月 13 日之後,經由 Image Analysis 4.0 的 Florence-2 是在 Azure 上建立新視覺管線的唯一受支援路徑。

Phi-4-Reasoning-Vision-15B:開源權重多模態的突破

Phi-4-reasoning-vision-15B 於 2026 年 3 月 4 日以 MIT 授權發布,是今年最重要的 Phi 版本。它將 Phi-4-reasoning 語言骨幹與 SigLIP-2 視覺編碼器以中段融合方式結合,總參數約 150 億,輸入視窗 16,384 token。

最突出的特色:動態推理啟動。模型僅在任務需要鏈式思考推理時輸出思考區塊——對於 OCR、影像描述、定位等感知任務,它直接給出答案。開發者可用 thinknothink 標籤強制行為。機制:混合模式資料集——20% 思考樣本、80% 無思考樣本。

對於一個 15B 開源權重模型,其基準成績相當亮眼:ScreenSpot v2 達 88.2%(此前 Phi-4-multimodal-instruct 僅 28.5%),MathVista 75.2,AI2D 84.8,ChartQA 83.3。訓練僅耗時四天,使用 240 塊 NVIDIA B200 GPU、約 2,000 億精心篩選的多模態 token。

對於評估本地多模態推理方案的 CTO 來說,該模型處於甜蜜點:在視覺推理基準上勝過大 10 倍的模型,同時硬體需求單一團隊即可配置。它與 Florence-2 互補而非取代——Florence-2 是高吞吐視覺基礎設施層,Phi-4-reasoning-vision 是其上的推理層。

Phi-Ground-Any-4B:面向電腦操作的 GUI 定位

Phi-Ground-Any-4B 由微軟亞洲研究院於 2026 年 5 月發布,是一個 40 億參數的 GUI 定位模型,由 Phi-3.5-vision-instruct 微調而來。它從螢幕截圖直接輸出點擊座標以支撐電腦操作代理管道,在 100 億參數以下類別中取得家族最佳成績:ScreenSpot-Pro 約 55.0,UI-Vision 36.2。

該技術已整合到 Windows Copilot 的「Vision Highlighting」(視覺高亮)功能中。權重以 MIT 授權發布於 Hugging Face(microsoft/Phi-Ground-Any),推理約需 8GB+ 顯示卡記憶體。對於建置電腦操作代理的團隊,這是值得對照評測的開源權重模型。

VibeVoice:0.5B 參數、300 毫秒內出首字的即時 TTS

VibeVoice-Realtime-0.5B(MIT 授權)的串流文字轉語音首個可聽 token 延遲低於 300 毫秒。架構將 Qwen2.5-0.5B 骨幹與 sigma-VAE 聲學分詞器及擴散解碼頭相結合,支援英語及另外九種語言,在遠小於對手的規模上與 VALL-E 2、Voicebox 旗鼓相當。注意其 Qwen2.5 骨幹:這是混合血統模型,並非純粹微軟從零訓練——但 TTS 管道與訓練方法屬於微軟。

下週關注清單

  • 9 月 13 日: 舊版 Azure Vision API 停用——請今天就核驗遷移狀態。
  • 10 月 1 日: Aion 1.0 Instruct 獨立測試包。
  • 10 月 23 日: Aion 1.0 Instruct 開始推送 Windows Insiders。
  • 11 月 24 日: Aion 1.0 正式發布;Phi Silica 退出零售 Windows。
  • 2026 年 11 月: GPT-4 Turbo 回退視窗結束——MAI-Code-1-Flash 成為唯一預設。

這些事件的模式是一致的:微軟正在雲端、邊緣與端側各層,系統性地以第一方模型取代對第三方模型的依賴。這些模型並非總在領跑前沿——獨立測試認為 MAI-Thinking-1 大致處於 DeepSeek V3.2 等級——但成本經濟性與整合深度正成為結構性優勢。對工程團隊而言,務實的做法是:現在就為例行工作負載評估 MAI 模型,同時在品質差異仍足以支撐溢價的場景繼續保留第三方前沿模型。

歡迎在 https://x.com/kkaminsk 關注即時分析,追蹤這些模型的發布動態。