2026 年 8 月标志着微软第一方 AI 战略的转折点。公司不再仅仅是构建模型——而是在大规模地将生产环境 Copilot 流量路由到自有模型上。本月 MAI-Code-1-Flash 成为 GitHub Copilot 默认模型。MAI-Cyber-1-Flash 于 8 月 3 日通过 Project Perception 进入公开预览。MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash 均已进入公开预览。一个隐藏的全双工语音模型也在 MAI Playground 中被发现。

对于 CTO 和工程负责人来说,问题不再是微软是否有自己的模型——而是你的架构是否已为它们做好准备。

MAI 家族:从研究到生产

微软的 MAI 家族在 Build 2026 上发布,包含七款云端模型,全部使用"Hill-Climbing Machine"管线从零训练——零蒸馏来自 OpenAI、Anthropic 或任何第三方实验室。四个月后,这些模型正从展示走向生产工作负载。

MAI-Code-1-Flash:GitHub Copilot 的新默认模型

本月最具影响力的变化是 MAI-Code-1-Flash 成为所有层级 GitHub Copilot 的默认模型。这个 137B 总参数 / ~5B 激活参数的稀疏 MoE 模型在 SWE-Bench Pro 上达到 51.2%——领先 Claude Haiku 4.5 达 16 个百分点。微软报告在 VS Code 中代码接受率比 GPT-5.4 Mini 和 Claude Haiku 4.5 高约 10%,中位数 token 使用量低约 10%。

定价为每百万输入 token $0.75、每百万输出 token $4.50,经济性极具竞争力。GPT-4 Turbo 作为回退保留至 2026 年 11 月,之后 MAI-Code-1-Flash 成为唯一默认模型。同一检查点还驱动 Excel 公式生成,被称为"在大多数常见任务上与 GPT-5.6 相当"。该模型也可通过 OpenRouter、Fireworks AI 和 Baseten 获取——迁移路径存在。

MAI-Thinking-1:有前景但未经验证

旗舰推理模型(约 962B 总参数 / ~34.7B 激活,256K 上下文)仍在 Azure Foundry 私人预览中。自报告基准表现强劲——AIME 2025 上 97.0%,SWE-Bench Pro 上 52.8%,在 Surge 盲测中 1,276 项任务优于 Claude Sonnet 4.6。然而,彭博社和 ByteIota 的独立报道将其实际使用大致等同于 DeepSeek V3.2——有能力,但并非明确飞跃。公开预览预计"数周内"。CTO 应将基准视为有前景但未经验证,直到获得独立 API 访问。

MAI 扩展:图像、语音和安全

MAI-Image-2.5-Pro 与成本故事

MAI-Image-2.5-Pro 于 7 月 23 日进入公开预览,完成三层产品线:MAI-Image-2.5(正式可用,每百万图像输出 token $47)、Flash(正式可用,$19.50/百万)和 Pro(预览,$106/百万)。生产验证令人信服——PowerPoint 报告与 GPT-Image-2 相比 GPU 成本降低 84%,OneDrive 保存率提高 26%、P95 延迟降低 25%,Bing Image Creator 现已 100% 使用内部模型。

MAI-Voice-2-Flash 与 Realtime 惊喜

MAI-Voice-2-Flash 进入公开预览——速度为 MAI-Voice-2 的 2 倍,成本低 32%(每百万字符 $15)。同时,全双工语音模型 MAI Realtime 于 8 月 2 日在 MAI Playground 中被发现。它原生处理音频输入输出,无需中间文本步骤,支持 17 种语言。尚无官方公告,但表明微软正在将实时对话语音作为一流能力来构建。

MAI-Cyber-1-Flash 与 Project Perception

Project Perception 是微软基于 MAI-Cyber-1-Flash(137B / ~5B 激活,源自 MAI-Thinking-1 训练)的新型代理安全平台。在 CyberGym 上得分 95.95%——排名第一,以约一半的成本领先第二名 12 个百分点。平台部署红队(攻击)、蓝队(分诊)和绿队(补丁)代理。微软已在 90% 的内部漏洞扫描中使用,GPT-5.4 处理复杂升级。公开预览需审核——非一般开放。

Phi-4:开源边缘模型

Phi-4 家族在 3.8B–15B 范围内仍然无可匹敌。七款 MIT 许可模型覆盖从边缘部署到多模态推理。

Phi-4-mini(3.8B)于 7 月 19 日推送到 Windows 12 Copilot+ PC——Snapdragon X Elite 上每秒 42 token,Q4 量化下约 3GB VRAM,支持离线代码补全和本地图像编辑。对于数据主权和间歇性连接场景,这已具备生产能力。

Phi-4-mini-flash-reasoning 值得特别关注。它使用 SambaY 混合架构——Mamba 状态空间模型结合滑动窗口注意力、门控记忆单元和差分注意力——实现 10 倍吞吐量和 2-3 倍延迟改善,优于 Phi-4-mini-reasoning。这是对标准 Transformer 的真正架构突破,无需 RL 即可运行。如果你的边缘 AI 路线图假设标准 Transformer 经济学,这个模型改变了计算方式。

Phi-4-reasoning-vision-15B(2026 年 3 月)在多模态推理上有效取代 Florence-2。ScreenSpot v2(GUI 定位)上 88.2%,成为自主 UI 代理和 RPA 工具的基础。它根据任务动态切换推理模式,避免强制链式思考开销。

Aion 1.0:端侧转型

微软的端侧战略正围绕 Aion 1.0 整合。Aion 1.0 Instruct——可在 CPU/GPU/NPU 上运行的轻量级 SLM——处于开发者预览阶段,将取代 Phi Silica 成为生产环境端侧 Windows 模型。Aion 1.0 Plan(14B,32K 上下文)是更具雄心的发布:支持推理、工具调用和子代理编排的端侧代理运行时,通过 Windows Agent Framework。需要 ≥40 TOPS NPU 或合格分立 GPU。

转型时间表确定:10 月 1 日提供独立测试包,10 月 23 日推送 Windows Insiders,11 月 24 日正式发布——Phi Silica 从零售设备移除。关键是,Aion Instruct 不需要 LAF token,不同于 Phi Silica——消除了开发者的一个重大障碍。

Florence-2 与九月截止日期

Florence-2 作为纯计算机视觉的企业级主力模型保持稳定——目标检测、分割、字幕生成、覆盖 164 种语言的 OCR,单一权重集,MIT 许可。它驱动 Azure AI Vision Image Analysis 4.0。

紧急:旧版 Azure Vision API(v1.0–3.1)将于 2026 年 9 月 13 日退役——距今 35 天。仍在使用旧 API 的组织必须在此之前迁移。Image Analysis 4.0 本身计划退役日期为 2028 年 9 月 25 日。

Copilot 路由的现实

Copilot 不是单模型产品。任务分类层在选择模型前对每次交互进行分类。邮件起草、摘要、公式生成、图像生成、Teams 转录和安全扫描路由到 MAI 模型。复杂多步推理、创意生成和新颖文档分析路由到前沿第三方模型——GPT-5.6 仍是 Microsoft 365 Copilot 的首选模型。到 2026 年底,微软预计大多数日常 Copilot 任务将在 MAI 模型上运行。如果你的 Copilot 依赖计划假设一切使用 OpenAI 模型,它需要更新了。

行动事项

  1. GitHub Copilot 迁移: 为 11 月 MAI-Code-1-Flash 成为唯一默认模型做准备。趁 GPT-4 Turbo 回退仍可用时立即测试。
  2. Azure Vision API 迁移: 在 9 月 13 日前迁移到 Image Analysis 4.0。硬截止日期。
  3. 图像生成成本审查: 评估 MAI-Image-2.5 对比 GPT-Image-2——PowerPoint 中 84% 的 GPU 成本降低是强烈信号。
  4. 边缘 AI 架构: Windows 12 上的 Phi-4-mini 和 Phi-4-mini-flash-reasoning 的 SambaY 架构值得重新审视端侧经济学。
  5. 安全运营: 如果团队大规模处理漏洞扫描,申请 Project Perception 访问权限。
  6. 端侧规划: 如果你使用 Phi Silica 构建,Aion 转型从 10 月 1 日开始。开始 LoRA 训练准备。

微软现在是除 Google 和 Apple 之外唯一拥有完整 AI 产品组合的公司——涵盖定制芯片、云端前沿模型、开源边缘模型、端侧模型、视觉基础模型、编排和代理框架。对我们其他人来说,问题是我们要多快适应。


本文是 Microsoft AI 周刊系列 的一部分。在 x.com/kkaminsk 关注持续分析。