上周我们报道了彭博社确认微软正在将生产环境中的 Copilot 流量路由至自研 MAI 模型。本周,更深的图景浮出水面:微软已构建起一套完整的自研 AI 栈,涵盖定制芯片、云端前沿模型、开放权重边缘模型、端侧智能体以及将它们串联在一起的编排层。定义 Copilot 第一波的 OpenAI 依赖正在收尾——并非出于交恶,而是通过深思熟虑的架构替换。
对于 IT 领导者而言,本周是理解微软模型组合全貌的关键窗口。现在就需做出的架构决策——标准化哪些模型、在何处运行推理、如何管理智能体身份——将在未来数年受此栈框架的深刻影响。
1. MAI 系列:七个模型,零蒸馏
在 Build 2026 上发布的 MAI(Microsoft AI)系列代表了微软最具分量的自研 AI 投入。七个模型全部由 Mustafa Suleyman 的 AI 超级智能团队使用内部"爬山机"训练流程从头训练。无任何来自 OpenAI 或第三方的蒸馏。无合成训练数据。仅使用人类生成的、经商业授权的内容,并经过基准测试污染净化。
MAI-Thinking-1 是旗舰推理模型——采用稀疏 MoE(混合专家)架构,约 35B 活跃参数(总参数约 1T),256K 上下文窗口,在 SWE-Bench Pro 上得分与 Claude Opus 4.6 相当(约 53%)。它在 AIME 2025 上得分 97.0%,在 AIME 2026 上得分 94.5%。微软声称其 Token 效率约为 GPT-5.5 的 10 倍。该模型目前已在 Microsoft Foundry 上提供私有预览,GitHub Models 上提供免费层访问,同时也在 OpenRouter、Fireworks AI 和 Baseten 上可用——这是微软首次在非 Azure 推理平台上发布自研模型。
MAI-Code-1-Flash 将是大多数企业最先遇到的模型。通过稀疏 MoE 架构,该模型拥有约 5B 活跃参数(总参数约 137B),在 SWE-Bench Pro 上得分 51.2%——领先 Claude Haiku 4.5(35.2%)16 个百分点——同时 Token 使用量降低多达 60%。该模型自 6 月 26 日起已在 GitHub Copilot 全部层级的通用版中可用,预计于 2026 年 8 月取代 GPT-4 Turbo 成为 Copilot 默认模型。GPT-4 Turbo 的三个月回退窗口将持续至 2026 年 11 月,此后 MAI-Code-1-Flash 将在微软 Maia 200 加速器上成为默认模型。
该系列不仅限于推理和代码。MAI-Image-2.5 在 Arena AI 图像编辑排行榜上排名第二,已集成至 PowerPoint 和 OneDrive。MAI-Transcribe-1.5 覆盖 43 种语言,在 FLEURS 基准测试上词错误率仅为 4.86%——是所有竞品中最低水平——速度约为竞品的 5 倍,正在集成至 Copilot、Teams 和 Dynamics 365 联系中心。MAI-Voice-2 支持 15 种以上语言,可从 5-60 秒参考音频实现零样本语音克隆,盲测偏好率达 72%,远超上一代产品。
对 IT 领导者的意义: MAI 系列并非研究项目——它是生产级基础设施。MAI-Code-1-Flash 已在 GitHub Copilot 中进入通用版。MAI-Transcribe-1.5 正在集成至 Teams 和 Copilot。MAI-Image-2.5 已在 PowerPoint 中上线。Copilot 内部的模型路由层正越来越多地因成本和延迟原因倾向于自研模型。各组织应预期,到 2026 年底,大多数常规 Copilot 任务——起草、总结、转录、图像生成——将由 MAI 模型运行,而 GPT-5.6 和 Claude 等前沿模型将预留给复杂推理场景。
2. Phi-4:超越参数级别的开放权重 SLM
Phi-4 系列现已涵盖从 3.8B 到 15B 参数的 10 余个模型,全部采用 MIT 许可。其主题是密度——14B 模型在数学和编程基准测试上可与 70B 级别模型竞争。
Phi-4-reasoning-plus(14B)在 AIME 2025 上得分 82.5%,在 HumanEval+ 上以 0.929 位列开源模型第一,与 DeepSeek-R1-Distill-Llama-70B 相比体积仅为后者的五分之一。Phi-4-mini(3.8B)可在 Raspberry Pi 5 上运行,MMLU 达 73%——超越许多 8B 级别模型。Phi-4-mini-flash-reasoning 采用 SambaY 架构(Mamba 状态空间模型、滑动窗口注意力与门控记忆单元的混合体),与 Phi-4-mini-reasoning 相比可实现高达 10 倍的吞吐量提升和 2-3 倍的延迟降低。这是对标准 Transformer 架构的真正创新,而不仅仅是更小的模型。
最近最重要的新增是 Phi-4-reasoning-vision-15B(2026 年 3 月),它将文本生成与深度视觉理解和思维链推理相融合。在 GUI 定位基准 ScreenSpot v2 上得分 88.2%,MathVista 得分 75.2%,AI2D 科学图表得分 84.8%。它采用 SigLIP-2 视觉编码器,具备双模式——用于复杂分析的推理模式和用于简单查询的直答模式。该模型实际上已取代 Florence 视觉系列,成为新的多模态用例选择。
对 IT 领导者的意义: Phi-4 模型是边缘部署的答案。它们可在标准笔记本电脑、智能手机甚至通过 WebLLM 在浏览器上运行。对于构建端侧 AI 能力的组织——离线转录、文档分析、本地代码辅助——Phi-4 提供了生产级模型且无许可成本。MIT 许可意味着无商业限制。Phi-4-mini-flash-reasoning 的 SambaY 架构对延迟敏感的物联网和嵌入式场景尤为值得关注。
3. Aion 1.0:不计量的端侧智能
Aion 1.0 是微软最新的端侧模型系列,专为 Windows 和 Edge 设计,代表着"不计量的智能"——零云依赖、每次推理零边际成本的本地 AI 处理。
Aion 1.0 Instruct 是一款轻量级 SLM,适用于日常文本任务——摘要、改写、意图分类。它可在 CPU、GPU 或 NPU 上运行,无需专用 GPU。现已可在 Edge Canary/Dev 中通过 Prompt API 和 Writing Assistance API 使用,预计开放权重将于 2026 年 7 月登陆 Hugging Face。它还通过 Edge 150+ 中的 WebSpeech API 提供端侧语音转文字功能。
Aion 1.0 Plan 是更具雄心的模型——14B 参数、32K 上下文窗口,专为端侧智能体工作流而设计,包括推理、工具调用、文件管理和子智能体编排。它随 Windows Agent Framework 预装在支持 Windows 设备中——该框架已在 Build 2026 上开源。这不是一个聊天机器人;它是一个能够推理用户意图并在本地编排子智能体的智能体运行时。
硬件路径清晰直接:NPU 路径需要最低 40 TOPS NPU 的 Copilot+ PC(Snapdragon X Elite、Intel Lunar Lake),GPU 路径需要 NVIDIA RTX 30+ 或 AMD Radeon RX 9060+,以及标准 Windows 11 CPU 回退方案。上一代端侧模型 Phi Silica 也已从仅支持 NPU 扩展为同时支持 GPU。
对 IT 领导者的意义: Aion 补全了微软从设备到云的模型栈:Aion 负责端侧轻量任务、Phi-4 负责中量级边缘推理、MAI 负责云端前沿推理。对于关注数据驻留、延迟或云端推理成本的组织而言,端侧栈正变得可用于实际工作负载。Windows Agent Framework 意味着 Windows 本身正成为一个智能体平台——IT 团队应开始评估哪些智能体工作负载可在本地运行而非依赖云端推理,并相应更新设备管理策略。
4. Copilot 的多模型架构:编排器范式
Microsoft 365 Copilot 并非单一模型——它是一个编排层。任务分类层将每次用户交互按任务类型、复杂度和质量要求进行分类,然后路由至相应模型。
当前的的路由逻辑将工作负载划分给 MAI 模型(用于高容量常规推理)和前沿模型(GPT-5.6、Anthropic Claude,用于复杂任务)。MAI 负责邮件回复草拟、线程和会议摘要、电子表格公式生成、结构化数据提取以及智能体编码。前沿模型负责跨长非结构化文档的创新分析、带复杂依赖的多步推理以及需要风格判断的创意生成。
值得注意的是,Copilot Cowork——微软的自主智能体产品——主要运行在 Anthropic Claude(Opus 4.8 和 Sonnet 4.6)上,而非 MAI。微软自研的"Cowork 1"微调模型已公布,但尚未在发布时为该智能体提供动力。这是一个务实的决策:Anthropic 的模型目前在智能体任务上领先,微软不会为了模型民族主义而牺牲产品质量。
GPT-5.6 于 7 月 9 日被宣布为 M365 Copilot 的"首选模型",但"首选"并非"排他"。该架构的设计宗旨是在模型能力经验证后逐步扩大 MAI 的路由份额。
对 IT 领导者的意义: 多模型架构是一项特性,而非限制。它意味着 Copilot 能为每项任务自动选择最佳模型,无需用户干预。但也意味着,随着微软调整路由策略,模型质量和成本可能悄然变化。各组织应监控 Copilot 遥测数据,了解哪些模型正在处理哪些任务,并验证随着路由逐步转向 MAI,质量是否保持稳定。
5. Maia 200:芯片层
支撑整个 MAI 战略的是微软的定制芯片。Maia 200 是一款 3nm AI 加速器,拥有 1400 亿个晶体管和 216GB HBM3e 内存,带宽达 7 TB/s,每美元性能比上一代提升 30%。集群可扩展至 6,144 个加速器。
Maia 200 专为推理而设计——具体而言,是在 Azure 数据中心高效运行 MAI 模型。MAI-Code-1-Flash 在 GitHub Copilot 中的默认部署将运行在 Maia 200 上,而非 NVIDIA 硬件。这是微软对完整推理栈的控制:芯片、模型架构、训练流水线和应用层。
对 IT 领导者的意义: 芯片层不太可能直接影响您的日常运营,但它是微软模型独立的经济基础。定制芯片意味着微软运行自研模型的成本低于租用 NVIDIA GPU 容量运行第三方模型。这一成本优势将越来越多地体现在 Copilot 定价和路由决策中。
6. Florence-2 与视觉基础设施层
Florence-2 仍然是纯计算机视觉领域的企业标准,尽管 Phi-4-reasoning-vision-15B 已夺得多模态推理桂冠。路线图中没有 Florence-3。相反,Florence-2(0.23B 基础版、0.77B 大版)继续为 Azure AI Vision Image Analysis 4.0 提供动力,通过统一的基于提示的接口支持 164 种语言的 OCR、目标检测、分割和密集描述等 12 种以上的视觉任务。
其生态系统已成熟:用于本地 ONNX 执行的 C#/.NET NuGet 包、用于实时边缘视频分析的 NVIDIA DeepStream 集成,以及在专业数据集上实现 98%+ 精度的 LoRA 微调。Florence-2 是基础设施——它运转良好,已大规模部署,没有任何理由去颠覆它。
对 IT 领导者的意义: 如果您正在 Azure 上构建计算机视觉流水线,Florence-2 仍然是正确选择。对于融合文本与视觉推理的新兴多模态用例,Phi-4-reasoning-vision-15B 是更好的选项。这两个模型服务于不同目的,将在可预见的未来在微软的产品组合中并存。
战略行动建议
- 为 MAI-Code-1-Flash 成为默认模型做好准备——2026 年 8 月的切换就在几周之后。盘点您的 GitHub Copilot 使用情况,在新模型成为强制之前对标开发体验
- 评估 Phi-4 用于边缘部署——如果您有需要端侧 AI 的场景(离线、低延迟、数据主权),采用 MIT 许可的 Phi-4 系列已可用于生产环境且可免费部署
- 规划 Windows Agent Framework——Aion 1.0 Plan 将预装在支持 Windows 设备上,实现本地智能体编排。更新您的设备管理策略以应对端侧 AI 智能体
- 监控 Copilot 模型路由——随着微软将更多流量转移至 MAI 模型,通过 Copilot 分析工具跟踪质量指标,确保任务性能保持一致
- 关注 Aion 开放权重——预计 2026 年 7 月登陆 Hugging Face,Aion 1.0 Instruct 的开放权重将使定制端侧 AI 场景成为可能,且无许可成本
- 规划您的模型策略——了解您的工作负载分别适合 Aion(端侧)、Phi-4(边缘)或 MAI(云端)哪个层级,并开始为多层模型部署进行架构设计,而非单一云端端点
微软的自研模型栈现已完整:底层是 Maia 200 芯片、云端是 MAI 前沿模型、边缘是 Phi-4 开放权重模型、Windows 端是 Aion 端侧模型、上层是 Copilot 编排层。IT 领导者面临的问题已不再是微软能否在没有 OpenAI 的情况下构建有竞争力的 AI——他们已经证明了这一点。问题在于,您的组织需要多快才能适应一个多层、多模型的世界——在这个世界里,每项任务的最佳模型可能运行在不同的设备、不同的数据中心或完全不同的芯片架构之上。