上周我们报道了 Bloomberg 确认微软正在将生产级 Office 工作负载路由到自有 MAI 模型的消息。而本周,整个图景更加清晰:微软的第一方 AI 堆栈已不再是纸上蓝图。它已部署完成,明确定价,并在架构上形成了一个从端侧到云端的完整垂直体系。对于 CTO 和工程负责人而言,问题已从"微软的模型准备好了吗?“转变为"我们该如何围绕一个由同一家厂商掌控芯片、模型和应用的堆栈来设计架构?”

完整的自有第一方堆栈

微软目前拥有除 Google 和 Apple 之外唯一的全栈 AI 组合。以下是截至 2026 年 7 月的架构:

**端侧设备(Aion 1.0):**轻量级推理,用于摘要生成、内容改写和意图分类——在 Edge 和 Windows 内部的 CPU、GPU 或 NPU 上运行。140 亿参数的 Aion 1.0 Plan 变体通过 Windows Agent Framework 处理包含工具调用和子代理编排的智能体工作流。开源权重预计本月在 Hugging Face 上线。

**边缘端(Phi-4 系列):**十个 MIT 许可模型,参数量从 38 亿到 150 亿不等。Phi-4-mini 可在 Raspberry Pi 5 上运行。Phi-4-mini-flash-reasoning 采用 SambaY 混合架构(Mamba + 滑窗注意力 + Gated Memory Units),吞吐量提升 10 倍。Phi-4-reasoning-vision-15B 搭载 SigLIP-2 视觉编码器,可执行多模态推理。

**云端前沿(MAI 系列):**在 Build 2026 上发布的七个模型,涵盖推理(MAI-Thinking-1)、智能体编码(MAI-Code-1-Flash)、图像生成(MAI-Image-2.5 和 Flash)、语音转文本(MAI-Transcribe-1.5)以及文本转语音(MAI-Voice-2 和 Flash)。所有模型均基于商业许可数据从头训练,不涉及对第三方模型的蒸馏。

**芯片(Maia 200):**3nm 工艺,1400 亿晶体管,216GB HBM3e 显存。已投入生产,用于运行 MAI 推理。MAI-Code-1-Flash 将于 2026 年 8 月全面迁移至 Maia 200。

**基础模型(MAI-1-preview):**微软首个端到端训练的基础模型,目前正在 LMArena 上测试。公开信息有限,但这表明微软有意在前沿模型层面展开竞争——而不仅限于特定任务的模型。

这并非一篮子零散的方案。这是一个精心设计的架构堆栈,每一层都为下一层提供支撑。

深入 Copilot 的路由架构

过去两周最具战略意义的细节并非某个模型的发布——而是 Microsoft 365 Copilot 如何路由流量的披露。Copilot 并非单一模型产品。它采用了一个任务分类层,根据任务类型、复杂度和质量要求对每次交互进行分类,然后再选择模型。

哪些任务路由到 MAI(第一方,高流量):

  • 根据邮件线索撰写回复草稿(Outlook)
  • 邮件线索与会议摘要生成
  • 基于自然语言生成电子表格公式(Excel)
  • 主题行与标题生成
  • 从固定格式文档中提取结构化数据
  • 从会议记录中提取任务和行动项
  • VS Code 和 GitHub Copilot CLI 中的智能体编码(MAI-Code-1-Flash)
  • PowerPoint 和 OneDrive 中的图像生成与编辑(MAI-Image-2.5)

哪些任务路由到前沿第三方模型:

  • 跨长篇幅非结构化文档的创新性分析
  • 涉及复杂依赖关系的多步推理
  • 需要风格判断的创意性生成
  • 错误成本较高的敏感或模糊任务

路由是动态的。随着 MAI 模型的持续改进,路由范围也在不断扩大。微软有充分动力将更多流量迁移到自有模型上——每一条在 Maia 200 上路由至 MAI 的查询,都省去了支付给 OpenAI 或 Anthropic 的每 Token 利润。

值得注意的是,Copilot Cowork——微软于 6 月 16 日推出的自主智能体产品——目前运行在 Anthropic Claude(Opus 4.8 和 Sonnet 4.6)之上,而非 MAI。微软自己的 Cowork 1 微调模型虽已发布,但尚未投入实际应用。这是一个诚实的信号:MAI 模型在通用推理方面已达到生产水平,但微软承认前沿第三方模型在某些方面仍具优势。

MAI 定价:单位经济学背后的故事

微软已在 Foundry 上公布了 MAI 模型的定价,这些数字值得任何做成本建模的团队仔细审视:

  • MAI-Transcribe-1:$0.36/小时的语音转录(支持 43 种语言,在 FLEURS 上 WER 为 4.86%——所有竞品中最低)
  • MAI-Voice-1:$22/百万字符(支持 15 种以上语言,具备声音适配和情感控制功能)
  • MAI-Image-2.5:$5/百万文本输入 Token,$8/百万图像输入 Token,$47/百万图像输出 Token
  • **MAI-Code-1-Flash:**定价低于 Claude Haiku,同时在 SWE-Bench Pro 上得分 51.2%(Haiku 为 35.2%),且 Token 使用量减少 60%

定价策略极为激进。微软并未将 MAI 定价与第三方替代方案持平——而是直接压价,同时声称在特定基准测试上性能更优。对于高负载工作负载(转录、图像生成、代码补全)而言,成本差异会迅速放大。

分发渠道同样值得关注。MAI 模型可通过 Microsoft Foundry、MAI Playground(免费在线测试)访问,值得注意的是——还可通过 OpenRouter、Fireworks AI 和 Baseten 访问。这是微软首次在非 Azure 推理平台上提供自有模型。已绑定其他云提供商的企业团队现在无需 Azure 承诺即可使用 MAI 模型。

Florence-2:稳健胜过喧嚣

当 Phi-4-reasoning-vision-15B 作为多模态继任者抢占头条时,Florence-2 仍然是纯计算机视觉领域的企业级主力模型。目前没有 Florence-3 的路线图。相反,微软正在投入生态系统的成熟度建设:用于本地 ONNX 执行的 C#/.NET NuGet 包、用于实时边缘视频分析的 NVIDIA DeepStream 集成,以及支持 164 种语言 OCR 的 Azure AI Vision Image Analysis 4.0 SDK。

Florence-2 统一的提示词驱动架构——通过文本提示词以一组权重处理 12 种以上的视觉任务——在架构上依然优雅。对于构建生产级计算机视觉管道的团队而言,选择很明确:轻量级、高吞吐的视觉任务使用 Florence-2;需要语言生成和思维链的多模态推理则使用 Phi-4-reasoning-vision-15B。

Phi-4 的密度打法

评估边缘 AI 的工程负责人应特别关注 Phi-4 系列。其核心主题是密度——140 亿参数的模型能够在数学和代码基准测试上与 700 亿参数级别的模型一较高下。

Phi-4-reasoning-plus 在 AIME 2025 上得分 82.5%,与 DeepSeek-R1-Distill-Llama-70B 相当,但体积仅为后者的五分之一。Phi-4-mini(38 亿参数)凭借 20 万 Token 词汇表和覆盖 22 种以上语言的本地函数调用能力,在 MMLU 上超越了众多 80 亿参数级别的模型。SimpleQA 的局限性值得注意——Phi-4 在事实召回上仅得 3.0 分,这意味着如果没有检索增强,它不适合作为通用知识助手。

Phi-4-mini-flash-reasoning 的架构创新最为突出。SambaY 架构——融合了 Mamba 状态空间模型、滑窗注意力和 Gated Memory Units——代表了对传统 Transformer 的真正突破。在延迟降低 2-3 倍的同时实现 10 倍的吞吐量提升,这绝非渐进式优化。这种架构层面的变革将彻底改变边缘 AI 的部署经济学。

这对企业战略意味着什么

对于正在做本季度基础设施决策的 CTO,有以下三点启示:

1. 供应商锁定格局已经改变。 微软的垂直整合——从芯片到模型再到应用——历来被视为锁定的隐忧。但在 2026 年,这已成为一项降本战略。Maia 芯片上的 MAI 模型消除了第三方利润。问题在于:成本优势是否足以证明架构承诺的价值。

2. 模型评估应因任务而异。 Copilot 内部的路由架构就是模板。不要对所有任务标准化采用单一模型。将通用推理(摘要生成、结构化提取、公式生成)路由到 MAI 这类高效模型。将复杂推理路由到前沿模型。真正的节省来自于路由决策,而非模型选择本身。

3. Phi-4 开源系列是边缘端最稳妥的选择。 MIT 许可协议、10 种以上变体、可运行在从 Raspberry Pi 到 NVIDIA Jetson 的各种设备上。没有供应商锁定,没有许可风险,性能足以匹敌体积大 5 倍的模型。对于因成本、延迟或数据主权而部署本地推理的团队而言,Phi-4 是默认首选。

微软在 2026 年的 AI 战略并非追赶 OpenAI 或 Anthropic。它要构建的是一个完整的、垂直整合的堆栈——从硬件到应用,每一层都在微软的掌控之中。模型已就绪。芯片已就绪。企业买家需要回答的问题是:整合带来的溢价是否值得牺牲灵活性。

关注最新动态,请访问 X:https://x.com/kkaminski