2026年中期标志着微软AI战略的一个转折点。该公司已构建起完整的第一方模型堆栈——从定制芯片到云端前沿模型,再到设备端Windows AI——而这已不再是理论设想。生产流量正在通过微软自有模型流转。

彭博社本月早些时候确认,微软正将来自OpenAI和Anthropic模型的数万条Excel和Outlook提示词路由至其自有MAI模型。到8月份,GitHub Copilot将过渡到以MAI-Code-1-Flash作为默认后端。Phi Silica通过Windows Update定期接收组件更新。工程负责人面临的问题不再是微软能否构建自有模型——而是你是否应该围绕这些模型进行构建。


MAI系列:从零训练,非蒸馏模型

在2026年Build大会上,微软AI首席执行官穆斯塔法·苏莱曼发布了包含七个模型的MAI系列,这标志着微软在AI独立性上最为强势的宣示。这些模型使用微软的"Hill-Climbing Machine"流水线和Maia 200加速器——拥有1400亿个晶体管和216GB HBM3e的3nm芯片——在商业许可、可溯源的数据上从零开始训练。

MAI-Thinking-1:前沿级,但尚未独立验证

旗舰推理模型采用稀疏混合专家架构,总计约1万亿参数,其中约350亿活跃参数,拥有256K tokens的上下文窗口。微软自报的基准测试数据表现强劲:AIME 2025得分97.0%,SWE-Bench Verified得分73.5%,在Surge盲测评估中,评估者在1,276项任务中更倾向于它而非Claude Sonnet 4.6。

需要注意:这些都是自报数据。彭博社和ByteIota的独立报道将MAI-Thinking-1定位为大致相当于DeepSeek V3.2——能力不俗,但并非对现有前沿模型的明显超越。目前仍处于私有预览阶段,未公布定价。就目前而言,这是一个有希望的信号,而非采购决策的依据。

MAI-Code-1-Flash:立即可见的企业影响

这才是当下真正重要的模型。约50亿活跃参数(总计1370亿),MAI-Code-1-Flash已在所有GitHub Copilot层级和Azure Foundry API上正式可用。它在SWE-Bench Pro上得分51.2%——领先Claude Haiku 4.5达16个百分点——同时使用的tokens最多减少60%。每百万输入tokens定价0.75美元,每百万输出tokens定价4.50美元,在规模化使用上比GPT-4o便宜约3倍。

微软已确认,MAI-Code-1-Flash将在2026年8月前成为Copilot的默认模型,并设置三个月的GPT-4 Turbo回退期至11月。如果你的工程团队正在使用GitHub Copilot,无论你是否已规划,这一过渡已经在你的路线图上了。

专业MAI模型:图像、转录、语音

其余MAI模型覆盖了文本和代码以外的模态:

  • MAI-Image-2.5 在Arena.ai图片编辑排行榜上位列第二,已集成至PowerPoint和OneDrive。Flash变体以约三分之一的价格提供更低成本的生成能力。
  • MAI-Transcribe-1.5 支持43种语言,FLEURS词错误率仅4.86%——在所有竞品中最低——速度约为竞品模型的5倍。已逐步在Teams、Copilot和Dynamics 365 Contact Centre中部署。
  • MAI-Voice-2 支持15种以上语言,具备自然听感的TTS、基于短样本的语音适配,以及针对语音克隆滥用的内置防护机制。

以上三个模型现已在Azure Foundry上正式可用。


Phi-4:SLM金牌标准

在3.8B到15B参数范围内,没有其他厂商能与微软的Phi-4系列匹敌。其变体的广度——涵盖推理、视觉、多模态和边缘场景的七个不同模型——结合MIT许可,使其成为业界最具吸引力的小型语言模型产品组合。

当前产品线

模型参数上下文最佳应用场景
Phi-414B16K数学、代码、推理
Phi-4-mini3.8B128K边缘设备、长上下文
Phi-4-multimodal5.6B128K文本+音频+视觉
Phi-4-reasoning14B逻辑、扩展推理
Phi-4-reasoning-plus14B强化学习增强推理
Phi-4-mini-reasoning3.8B32K–64K轻量级推理
Phi-4-reasoning-vision-15B15B多模态推理+视觉

Phi-4基础版在MMLU上得分84.8%——与Llama 3.3 70B和Qwen 2.5 72B相当,而所需VRAM减少4–5倍。Phi-4-mini可在8GB RAM机器和Raspberry Pi 5设备上运行,VRAM约3GB(Q4量化)。Phi-4-reasoning-plus在AIME 2025数学资格测试中优于OpenAI的o1-mini。

对企业架构师而言,最为突出的是Phi-4-reasoning-vision-15B。该模型于2026年3月发布,将SigLIP-2视觉编码器与Phi-4-Reasoning骨干网络相结合,可在推理模式和非推理模式之间切换——无需对每次输入强制使用思维链。其屏幕定位能力(通过坐标识别UI元素)使其成为自主UI代理和RPA工具的基础。以150亿参数与需要10倍计算资源的模型竞争,它是本地部署的视觉推理工作负载的有力候选。

一个值得注意的限制:Phi-4基础版拥有16K上下文窗口——同级别中偏短。如果需要长上下文处理,Phi-4-mini的128K窗口是更优选择,尽管其每参数质量略低。

Phi-3和Phi-3.5已正式被取代。微软建议所有新项目使用Phi-4-mini。旧版本在Hugging Face上仍以MIT许可提供,但已列入Foundry模型退役计划。


Aion 1.0:作为平台层的设备端AI

在2026年Build大会上发布的Aion 1.0是微软最新的设备端模型系列——它代表了一种截然不同的本地AI方法。

Aion 1.0 Instruct 是一个轻量级SLM,适用于摘要、改写、意图分类和无障碍功能。它可在CPU、GPU或NPU上运行,无需专用GPU,目前已在Edge Canary/Dev中可用,开放权重预计本月内上线Hugging Face。

Aion 1.0 Plan 是更具雄心的产品:一个140亿参数的模型,拥有32K上下文窗口,专为设备端代理工作流设计——涵盖推理、工具调用、文件管理和子代理编排。它作为Windows Agent Framework(在2026年Build大会上开源)的一部分内置于支持此功能的Windows设备中,需要Copilot+ PC(≥40 TOPS NPU,如Snapdragon X Elite、Intel Lunar Lake)或NVIDIA RTX 30+ / AMD Radeon RX 9060+ GPU。

关键区别在于:Aion 1.0 Plan不是聊天机器人。它是一个代理运行时环境,能够推理用户的意图并在本地编排子代理。对于构建Windows原生AI应用的工程团队而言,这是"无限量智能"的基础——零云依赖,每次推理零边际成本。


Phi Silica:可作为服务组件的Windows平台

Phi Silica值得关注,因为它代表了一种新的运营范式:AI模型作为操作系统组件。这款经NPU优化的Transformer模型随Windows Copilot+ PC一起提供,并通过Windows Update定期接收更新,附带版本号、变更日志和按芯片厂商区分的KB包。

2026年5月的更新(v1.2605.856.0)带来了AMD专属优化,声称设备端响应速度提升高达30%。实验性GPU路径现在将本地AI扩展到配备NVIDIA RTX 30+显卡(6GB VRAM)的非Copilot+ PC。开发者需要通过Windows App SDK获取Limited Access Feature解锁令牌。

如果贵组织正在部署Copilot+ PC,Phi Silica已经在运行——并且正在更新——无论你是否跟踪。IT团队应将其纳入资产清单和更新监控。


Florence-2:低调的主力引擎

Florence-3尚未发布。2024年6月推出的Florence-2仍然是微软Azure AI服务的事实视觉引擎——而且理由充分。其统一的、基于提示的序列到序列架构使用单一权重集处理12种以上的视觉任务:目标检测、分割、字幕生成、视觉定位、OCR和密集区域字幕生成。

从0.23B(基础版,可在CPU上部署)到0.77B(大版,生产级),Florence-2为Azure AI Vision Image Analysis 4.0提供支持,并支持164种语言的OCR。旧版Azure Vision API(v1.0–3.1)将于2026年9月13日退役——如果尚未迁移到基于Florence的Image Analysis 4.0 SDK,这一截止日期正在临近。

在专业数据集上使用LoRA进行微调已在特定领域应用中展示出超过98%的精确度。Hugging Face社区依然活跃,原生的C#/.NET NuGet包使得通过ONNX运行时的.NET集成变得简单直接。


MAI-DS-R1:开放权重的安全后训练

与从零训练的MAI-Thinking-1不同,MAI-DS-R1是微软对DeepSeek-R1(671B)进行后训练后的变体。微软AI团队针对安全性和响应性进行了修改:它对此前被屏蔽的提示词响应率达99.3%(提升2.2倍),在HarmBench上减少有害内容50%以上,同时保留了原始模型在数学、编码和通用知识方面的推理能力。

以MIT许可发布,提供托管API(Azure Foundry)和开放权重(Hugging Face)两种形式,还包括FP8量化变体以降低VRAM需求。对于希望在获得DeepSeek-R1推理能力的同时拥有企业级安全护栏的组织来说,这是需要评估的版本。


Copilot模型切换正在进行

多模型Copilot架构不是营销话术——它是生产级基础设施。截至2026年7月:

  • Microsoft 365 Copilot将Excel和Outlook提示词路由至MAI模型(彭博社已确认)
  • GitHub Copilot到2026年8月以MAI-Code-1-Flash为默认模型
  • PowerPoint和OneDrive中的图像生成使用MAI-Image-2.5
  • Teams转录正在逐步部署MAI-Transcribe-1.5
  • 设备端Windows推理使用Phi Silica和Aion 1.0
  • GPT-5.6仍是Microsoft 365 Copilot指定的"首选模型"(截至7月9日),但路由逻辑在经济效益允许的情况下越来越倾向于第一方模型

苏莱曼明确表示的目标:“我们向Anthropic支付了巨额费用——所以我们的目标是减少并最终消除这一成本。“趋势已清晰可见。


战略评估

微软现在是除Google和Apple之外唯一拥有完整AI产品组合的公司:定制芯片(Maia 200)、云端前沿模型(MAI)、边缘SLM(Phi-4)、设备端模型(Aion、Phi Silica)、视觉基础模型(Florence-2)和编排层(Copilot)。

对于CTO和工程负责人,实际操作层面的要点如下:

  1. MAI-Code-1-Flash是当下的决策点。 如果你在使用GitHub Copilot,模型切换即将到来。立即通过VS Code模型选择器进行测试,并评估对你团队工作流的影响。

  2. Phi-4仍然是本地或边缘部署的最佳SLM选择。 MIT许可、经过验证的基准测试,以及几乎涵盖每种用例的变体。从边缘场景的Phi-4-mini和视觉推理任务的Phi-4-reasoning-vision-15B开始。

  3. MAI-Thinking-1值得关注但尚未到投入承诺的阶段。 私有预览、自报基准、未公布定价。保持关注,如果与微软有合作关系可申请预览权限,但不要以此为基础制定2026年的架构决策。

  4. Florence-2迁移是硬性截止日期,而非可选项。 旧版Azure Vision API将于2026年9月13日退役。立即迁移至Image Analysis 4.0。

  5. 对于Windows原生应用,Aion 1.0 Plan是最值得关注的产品。 一个140亿参数的设备端代理运行时,具备工具调用和子代理编排能力,这是迈向本地代理AI的重要一步。根据Copilot+ PC的部署时间表进行评估。

  6. 无论你是否配置,Copilot中MAI模型的使用将会持续增加。 微软的成本激励与路由至自有模型的方向一致。请做好准备,Copilot体验将逐步远离OpenAI,更多地转向MAI。

全栈AI战略已不再是愿景。它正在交付——在生产环境中、在规模化下、以清晰的路径走向自给自足。

欢迎在 x.com/kkaminski 关注每周微软AI分析。