2026年年中是转折点,2026年8月则是它成为运营现实的时刻。彭博社证实,微软正在将数以万计的 Excel 和 Outlook 提示词路由到自研的 MAI 模型,而非第三方 API。GitHub Copilot 本月正在将 MAI-Code-1-Flash 切换为其默认后端。工程领导者的问题已从"微软能否构建前沿模型?“转变为"你应该以多快的速度围绕它们重构架构?"。
本周的分析涵盖截至2026年8月微软完整的自研模型技术栈——七个 MAI 云端模型、七个 Phi-4 边缘变体、Aion 端侧模型家族、Phi Silica 的迁移时间表、Florence-2 的退役截止日期,以及将所有这一切串联起来的 Copilot 编排层。
MAI 家族:从零构建
MAI(Microsoft AI)模型家族于6月的 Build 2026 大会上发布,是微软迄今最重要的内部 AI 投资。七个模型全部由 Mustafa Suleyman 领导的 AI 超级智能团队使用内部流水线(他们称之为"爬山机器”)从零训练。没有从 OpenAI、Anthropic 或任何第三方实验室蒸馏。训练数据达到企业级标准、经商业授权且可溯源——对于有合规要求的组织而言,这是一个关键区别。
MAI-Thinking-1:旗舰模型
这款推理旗舰采用稀疏混合专家(Mixture-of-Experts)架构,总参数约1T,激活参数约35B,上下文窗口为256K token。微软报告的基准测试成绩令人瞩目:AIME 2025 上达到97.0%,AIME 2026 上达到94.5%,SWE-Bench Pro 上约52.8%——与 Claude Opus 4.6 持平。在涵盖1,276项任务的盲测人工评估中,MAI-Thinking-1 的偏好度超过 Claude Sonnet 4.6。该模型目前正在 Azure Foundry 上进行私有预览,公开预览预计将在数周内推出。
MAI-Code-1-Flash:已投入生产
这是正在 GitHub Copilot 中逐步取代 GPT-4 Turbo 的模型。它于2026年6月26日全面上市,定价为输入每百万 token 0.75美元、输出每百万 token 4.50美元。它在 SWE-Bench Pro 上取得了51.2%的成绩——领先 Claude Haiku 4.5 达16个百分点——同时相比同类模型最多可节省60%的 token 用量。它已成为 VS Code 中的默认模型,并正在向所有 GitHub Copilot 层级推广。GPT-4 Turbo 在2026年11月之前仍可作为后备模型使用,但趋势已经显而易见。
图像、语音与转写模型
MAI-Image-2.5 在 Arena.ai 图像编辑排行榜上位列第2,超越了 Nano Banana Pro,并已集成到 PowerPoint 和 OneDrive 中。Flash 变体以约三分之一的成本提供生成能力。MAI-Transcribe-1.5 声称在43种语言中拥有业界最佳的词错误率(Word Error Rate),正在 Teams 转写功能中推广。MAI-Voice-2 是微软迄今表现力最强的 TTS 模型。这三款模型均已在 Azure Foundry 上全面上市。
前沿微调:客户自有模型
最具战略意义的或许是强化学习环境(Reinforcement Learning Environments,RLEs)能力,它允许组织使用自己的工作流数据微调 MAI 模型。微软报告称,其微调后的 Excel 模型可与 GPT-5.4 匹敌,同时效率最高提升10倍。微调后的模型归客户所有——机构知识由此成为模型本身的一部分。梅奥诊所(Mayo Clinic)已与微软合作共创医疗领域专用前沿模型,将去标识化的临床数据与微软的基础 AI 相结合。该模型将归梅奥诊所所有,首先部署在梅奥诊所的环境中,随后通过 Microsoft Foundry 对外提供。
Phi-4:边缘 SLM 组合
七个变体,全部采用 MIT 许可,覆盖推理、视觉、多模态和边缘场景。这是业界最具说服力的小语言模型组合。
基础版 Phi-4(14B)在 MMLU 上可与 Llama 3.3 70B 和 Qwen 2.5 72B 匹敌,而所需 VRAM 减少4–5倍。它基于4.8万亿 token 精选网络与代码数据训练,算力消耗比 GPT-4o mini 低85%。目前已集成到 Azure AI Studio,支持128K上下文,并可通过 Azure Machine Learning 进行微调。
Phi-4-mini(3.8B)可在8GB 内存的机器上运行,甚至在树莓派 5(Raspberry Pi 5)上以约3GB VRAM + Q4 量化运行。它于7月19日随 Windows 12 Copilot+ PC 出货,在 Snapdragon X Elite 上以42 token/秒的速度运行——支持离线代码补全和本地图像编辑。
推理变体尤其值得关注。Phi-4-reasoning 在大多数基准测试上优于 OpenAI 的 o1-mini 和 DeepSeek-R1-Distill-Llama-70B,在 AIME 2025 上可与完整的 DeepSeek-R1(671B 参数)相媲美。Phi-4-reasoning-plus 增加了强化学习增强。Phi-4-mini-reasoning(3.8B)基于由 DeepSeek R1 生成的约100万个合成数学问题训练——专为轻量设备上的嵌入式辅导场景设计。
Phi-4-reasoning-vision-15B 于2026年3月发布,将 SigLIP-2 视觉编码器与 Phi-4-Reasoning 主干相结合。它可在推理模式与非推理模式之间切换,支持屏幕接地(按坐标识别 UI 元素),是15B 参数规模下本地化视觉推理工作负载的最佳候选。如果你正在构建自主 UI 智能体或 RPA 工具,这就是你需要的模型。
Aion 1.0:端侧智能
Aion 1.0 在 Build 2026 上发布,代表了微软所称的"无计量智能"(unmetered intelligence)——零云端依赖,每次推理的边际成本为零。
Aion 1.0 Instruct 是一款轻量级 SLM,可在 CPU、GPU 或 NPU 上运行,无需专用 GPU。它可处理摘要、改写、意图分类和无障碍任务,目前通过 Edge Canary/Dev 渠道提供开发者预览。开放权重预计本月在 Hugging Face 上发布。关键在于,Aion Instruct 将于2026年11月24日取代 Phi Silica 成为生产环境的端侧模型——独立测试包将于10月1日提供,Windows Insiders 推送将于10月23日开始。
Aion 1.0 Plan(14B,32K 上下文)更具雄心。它不是聊天机器人——而是一个智能体运行时,可在本地推理用户意图并编排子智能体。它将作为 Windows Agent Framework 的一部分随具备相应能力的 Windows 设备预装,微软已在 Build 2026 上将该框架开源。它需要配备 ≥40 TOPS NPU 的 Copilot+ PC,或 NVIDIA RTX 30+ / AMD Radeon RX 9060+ GPU。对于正在构建本地优先智能体架构的组织来说,这是值得关注的平台。
Florence-2:视觉稳定,期限明确
目前尚未公布 Florence-3。微软选择以稳定性和广泛的企业实用性为先,而不是仓促的发布节奏。Florence-2 仍然是 Azure AI Vision Image Analysis 4.0 背后的视觉引擎,仅凭一组权重即可支持12+种视觉任务——目标检测、分割、图像描述、视觉接地、覆盖164种语言的 OCR。提供基础版(约0.23B,可部署于 CPU)和大号版(约0.77B,生产级)两种变体,均采用 MIT 许可。
关键截止日期:旧版 Azure Vision API(v1.0–3.1)将于2026年9月13日退役。如果你尚未迁移到基于 Florence-2 的 Image Analysis 4.0 SDK,这就是给你的30天预警。
Copilot:编排层,而非模型
Microsoft 365 Copilot 不是单一模型——它是一个编排层。任务分类层会按任务类型、复杂度和质量要求对每次交互进行分类,然后据此路由。
截至2026年7月,高吞吐量的常规任务——邮件起草、对话摘要、电子表格公式生成、VS Code 中的编码、PowerPoint 中的图像生成、Teams 转写——均路由到自研 MAI 模型。针对长篇幅非结构化文档的新颖分析、具有复杂依赖关系的多步推理,以及需要风格判断的创意生成,仍路由到 GPT-5.6 和 Claude 等第三方前沿模型。端侧推理使用 Phi Silica,并正在向 Aion 1.0 迁移。
这种路由架构是务实的做法。它在自研模型具有竞争力的高吞吐量任务上实现成本节约,同时在最需要前沿能力的地方保留对前沿模型的访问。到2026年底,大多数常规 Copilot 任务预计将完全由 MAI 模型运行。
Turing:已被取代
2025–2026年,Turing 模型家族没有重大更新或新版本。MAI 家族已接管生产工作负载。对新开发而言,Turing 实际上已经退役。
完整技术栈
微软现在是除 Google 和 Apple 之外唯一拥有覆盖所有层级完整 AI 产品组合的公司:
- 自研芯片: Maia 200 加速器(协同设计带来1.4倍效率提升)
- 云端前沿模型: MAI 家族(7个模型)
- 开放权重边缘模型: Phi-4 家族(7个变体,MIT 许可)
- 端侧模型: Aion 1.0 和 Phi Silica
- 视觉基础模型: Florence-2(MIT 许可)
- 编排层: Copilot 多模型路由
- 智能体框架: Windows Agent Framework(已开源)
对工程负责人的启示
三条可立即执行的建议:
规划你的 Copilot 模型迁移。 MAI-Code-1-Flash 本月将成为默认模型,GPT-4 Turbo 后备支持持续到11月。如果你有 Copilot 集成,请立即针对 MAI 模型进行测试,并在11月窗口关闭前更新你的后备策略。
在9月13日之前迁移旧版 Azure Vision API。 基于 Florence-2 的 Image Analysis 4.0 就是替代方案。30天时间很紧——今天就动手。
评估将 Phi-4 用于边缘和本地部署。 MIT 许可加上丰富的变体阵容,使 Phi-4 成为需要完全可控、能力强大 AI 模型的组织的首选。15B 参数的推理-视觉变体对于本地化视觉推理智能体工作负载尤其有吸引力。
MAI 时代不是将要到来——它已经到来。生产流量正在流动。技术栈已经齐备。问题在于,你的架构是否已经准备好。
本分析是 Big Hat Group 微软AI周报系列 的一部分。欢迎在 x.com/kkaminsk 关注后续评论。