微软第一方 AI 模型战略已经到了这样的节点:各项成果不只是陆续发布,而是正在生产中取代第三方模型。本周的转折点:MAI-Code-1-Flash 现已成为 GitHub Copilot 全线的默认编码模型,取代 GPT-4 Turbo,并设有三个月回退窗口、于 2026 年 11 月结束。

对工程负责人而言,问题已从"微软能不能自己造模型?“转变为"我该以多大力度把工作负载迁移到第一方 MAI,还是继续使用 GPT-5.6 和 Claude?“本期涵盖 Copilot 的路由切换、Aion 1.0 端侧时间表、六天后到期的 Azure Vision API 停用,以及正悄然为开源权重多模态推理树立新标杆的 Phi-4-reasoning-vision。

MAI-Code-1-Flash:Copilot 默认模型正式换成第一方

MAI-Code-1-Flash 于 6 月 26 日在所有 Copilot 层级(Free 至 Max)正式发布,并于 2026 年 8 月成为默认编码模型。其架构为稀疏混合专家(MoE)设计——总参数 1370 亿、激活参数 50 亿、上下文窗口 256K——并针对 VS Code 与 GitHub Copilot CLI 工作流做了优化。

SWE-Bench Pro 达到 51.2%,以最高 60% 更少的 token 用量领先 Claude Haiku 4.5 达 16 个百分点(35.2%)。定价:输入 $0.75/百万 token、输出 $4.50/百万 token——显著低于同类第三方选项。该模型直接在 GitHub Copilot 生产工作流与授权代码仓库上训练,这正是其智能体编码能力强劲的原因。

切换计划对在生产环境运行 Copilot 的团队至关重要:GPT-4 Turbo 作为回退选项保留至 2026 年 11 月,此后 MAI-Code-1-Flash 将完全运行在微软 Maia 200 加速器上。如果你有依赖 GPT-4 Turbo 行为的提示词工程或评测管道,现在就是针对 MAI-Code-1-Flash 进行测试的时候。

Copilot 路由:哪些任务走 MAI,哪些仍用第三方

彭博社证实 Microsoft 365 Copilot 现在将 Excel 与 Outlook 的提示词路由至 MAI 模型。当前路由划分:

日常任务——Outlook 邮件回复草拟、会议总结、Excel 公式生成、VS Code 编码(MAI-Code-1-Flash)、PowerPoint 与 OneDrive 图像生成(MAI-Image-2.5)、Teams 转录(MAI-Transcribe-1.5)——均路由至第一方 MAI。对长篇幅非结构化文档的新颖分析、复杂多步推理,以及需要风格判断的创意生成,仍路由至 GPT-5.6 与 Claude;GPT-5.6 仍是 Microsoft 365 Copilot 的首选模型,但在经济性允许的场景下路由日益偏向第一方。

趋势很清晰:到 2026 年底,大多数常规 Copilot 任务将运行在 MAI 模型上。请按第一方路由将持续扩大(而非收缩)的假设为 Microsoft 365 Copilot 部署做预算。

Aion 1.0:Windows 端侧 AI 时间表明确

Aion 1.0 于 Build 2026 大会发布,是微软"不限量智能"的布局——零云依赖、零边际推理成本。它将取代 Phi Silica 成为 Windows 的端侧模型,共两个变体:

Aion 1.0 Instruct 在 CPU、GPU 或 NPU 上处理摘要、改写、意图分类与无障碍任务——无需专用硬件。开发者预览现已在 Edge Canary 与 Dev 版本中提供(edge://flags,“Enable prerelease on-device language model”)。

Aion 1.0 Plan 是重量级变体:140 亿参数、32K 上下文,专为端侧智能体推理设计,包括工具调用、文件管理与子智能体编排。它将通过微软在 Build 2026 开源的 Windows Agent Framework 预装到具备能力的 Windows 设备上。硬件要求:搭载 40+ TOPS NPU 的 Copilot+ PC(Snapdragon X Elite、Intel Lunar Lake),或 NVIDIA RTX 30+ / AMD Radeon RX 9060+ GPU。

时间表:10 月 1 日发布独立测试包,10 月 23 日向 Windows Insiders 推送,2026 年 11 月 24 日正式发布——Phi Silica 同一天从零售设备上移除。现有 Phi Silica LoRA 适配器无法迁移到 Aion——请现在就规划重新训练。

Azure Vision API:六天后硬性停用

本周最紧急:旧版 Azure Vision API(1.0–3.1 版)将于 2026 年 9 月 13 日停用——是硬性停用,而非软弃用。任何仍在调用这些端点的应用都将收到 410 Gone 响应。

迁移目标是基于 Florence-2 的 Image Analysis 4.0 SDK。Florence-2 仍是微软的视觉基础模型:统一的 seq2seq 架构,以单一权重集处理 12+ 项视觉任务,包括目标检测、分割、图像描述、164 种语言的 OCR 与视觉定位。large 变体(7.7 亿参数)达到生产级;base 变体(2.3 亿参数)可在标准 CPU 上运行。

采用数据印证了它的稳定性:截至 2026 年 7 月,base 模型在 Hugging Face 上每月约 266 万次下载,large 模型约 81.3 万次。Florence-3 尚无消息。9 月 13 日之后,经由 Image Analysis 4.0 的 Florence-2 是在 Azure 上构建新视觉管线的唯一受支持路径。

Phi-4-Reasoning-Vision-15B:开源权重多模态的突破

Phi-4-reasoning-vision-15B 于 2026 年 3 月 4 日以 MIT 许可发布,是今年最重要的 Phi 版本。它将 Phi-4-reasoning 语言骨干与 SigLIP-2 视觉编码器以中段融合方式结合,总参数约 150 亿,输入窗口 16,384 token。

最突出的特性:动态推理激活。模型仅在任务需要思维链推理时输出思考块——对于 OCR、图像描述、定位等感知任务,它直接给出答案。开发者可用 thinknothink 标签强制行为。机制:混合模式数据集——20% 思考样本、80% 无思考样本。

对于一个 15B 开源权重模型,其基准成绩相当亮眼:ScreenSpot v2 达 88.2%(此前 Phi-4-multimodal-instruct 仅 28.5%),MathVista 75.2,AI2D 84.8,ChartQA 83.3。训练仅耗时四天,使用 240 块 NVIDIA B200 GPU、约 2000 亿精心筛选的多模态 token。

对于评估本地多模态推理方案的 CTO 来说,该模型处于一个甜蜜点:在视觉推理基准上胜过大 10 倍的模型,同时硬件需求一个团队即可配置。它与 Florence-2 互补而非替代——Florence-2 是高吞吐视觉基础设施层,Phi-4-reasoning-vision 是其上的推理层。

Phi-Ground-Any-4B:面向计算机操作的 GUI 定位

Phi-Ground-Any-4B 由微软亚洲研究院于 2026 年 5 月发布,是一个 40 亿参数的 GUI 定位模型,从 Phi-3.5-vision-instruct 微调而来。它从截图中直接输出点击坐标以支撑计算机操作智能体管道,在 100 亿参数以下类别中取得家族最佳成绩:ScreenSpot-Pro 约 55.0,UI-Vision 36.2。

该技术已集成到 Windows Copilot 的"Vision Highlighting”(视觉高亮)功能中。权重以 MIT 许可发布在 Hugging Face(microsoft/Phi-Ground-Any),推理约需 8GB+ 显存。对于构建计算机操作智能体的团队,这是值得对标评测的开源权重模型。

VibeVoice:0.5B 参数、300 毫秒内出首字的实时 TTS

VibeVoice-Realtime-0.5B(MIT 许可)的流式文本转语音首个可听 token 延迟低于 300 毫秒。架构将 Qwen2.5-0.5B 骨干与 sigma-VAE 声学分词器及扩散解码头相结合,支持英语及另外九种语言,在远小于后者的规模上与 VALL-E 2、Voicebox 旗鼓相当。注意其 Qwen2.5 骨干:这是混合血统模型,并非纯粹的微软从零训练——但 TTS 管道与训练方法属于微软。

下周关注清单

  • 9 月 13 日: 旧版 Azure Vision API 停用——请今天就核验迁移状态。
  • 10 月 1 日: Aion 1.0 Instruct 独立测试包。
  • 10 月 23 日: Aion 1.0 Instruct 开始推送 Windows Insiders。
  • 11 月 24 日: Aion 1.0 正式发布;Phi Silica 退出零售 Windows。
  • 2026 年 11 月: GPT-4 Turbo 回退窗口结束——MAI-Code-1-Flash 成为唯一默认。

这些事件的模式是一致的:微软正在云、边缘与端侧各层,系统性地以第一方模型取代对第三方模型的依赖。这些模型并非总在领跑前沿——独立测试认为 MAI-Thinking-1 大致处于 DeepSeek V3.2 级别——但成本经济性与集成深度正成为结构性优势。对工程团队而言,务实的做法是:现在就为常规工作负载评估 MAI 模型,同时在质量差异仍足以支撑溢价的场景继续保留第三方前沿模型。

欢迎在 https://x.com/kkaminsk 关注实时分析,追踪这些模型的发布动态。