微软第一方 AI 模型飞轮现已自我强化。本周的证据:MAI-Transcribe-2 在 FLEURS 60 种语言测试中以 5.2% 平均词错率(WER)夺得第一,MAI-Image-2.6 在 Arena 文生图排行榜首秀即位列第二,MAI-Code-1.1-Flash 已成为 GitHub Copilot 默认编码模型——成本较前代降低 75%。与此同时,支撑了一代视觉管线的旧版 Azure Vision API 已于 9 月 13 日返回 410 Gone。
对工程负责人而言,战略图景正在清晰化。微软不再将第一方模型作为第三方选项的替代品发布——它正在将生产流量默认路由到第一方模型,以激进定价压制竞品,并逐步退役竞品路径所依赖的基础设施。本期涵盖过去两周发布的三个 MAI 模型、Copilot 第一方路由切换、Azure Vision API 退役影响,以及 Windows 团队现在必须规划的 Aion 过渡时间表。
MAI-Transcribe-2:最快、最便宜、最准确的语音识别
MAI-Transcribe-2 于 2026 年 9 月 3 日进入公开预览,微软的宣称十分大胆:FLEURS 60 种语言排名第一、平均词错率 5.2%,Artificial Analysis AA-WER 排名第二、词错率 2.0%,速度约为 GPT-Transcribe 的 10 倍、Scribe v2 的 7 倍、Gemini 3.5 Transcribe 的 5 倍。定价极具攻击性:每小时音频转录仅需 $0.10,为 2026 年底的限时价格。
该模型原生支持说话人分离和词级时间戳——无需后处理管线。对于运行大规模转录工作负载的团队(呼叫中心分析、会议记录、媒体索引),经济意义显著。以 $0.10/小时计算,转录 10,000 小时音频仅需 $1,000——仅为同类云语音 API 费用的一小部分。单一模型覆盖 60 种语言,消除了困扰现有管线的多模型路由复杂性。
需要注意的是:这些是微软自报的基准测试结果。随着 API 访问范围扩大,独立验证将随之而来。但定价可在 Microsoft Foundry 上直接验证,性能宣称与 MAI-Transcribe-1 和 1.5 的发展轨迹一致。
MAI-Image-2.6:Arena 第二,GPU 成本降低 84%
MAI-Image-2.6 于 2026 年 8 月 10 日上线,9 月 4 日完整发布。核心数据:Arena 文生图排行榜第二(较 2.5 版提升 79 Elo),Artificial Analysis 图像编辑排名第一。Flash 变体比 GPT-Image-2-Medium 快 2.8 倍、效率高 72%。
成本方面是生产部署中最值得关注的。微软报告称,在生产工作负载中 GPU 成本较 GPT-Image-2 降低 84%。该模型支持多图参考编辑、基于网络核验的事实性图像生成,以及动态纵横比——这些功能此前需要独立管线才能实现。
Microsoft Foundry 定价:MAI-Image-2.5 档位为 $19.50(Flash)、$47(标准版)、$106(Pro)每百万张图像输出。对于大规模生成图像的组织——营销团队、电商目录、内容生产——GPU 成本降低直接转化为基础设施支出的节省。图像编辑能力在 Arena 上从第五升至第三(+19 Elo),意味着这不仅仅是一个生成模型,它还是一个可信的编辑工具。
MAI-Code-1.1-Flash:成本降低 75%,已成为 Copilot 全线默认
MAI-Code-1.1-Flash 于 2026 年 8 月 11 日正式发布,并立即成为所有层级(Free 至 Max)GitHub Copilot 的默认编码模型。定价:输入 $0.20/百万 token、输出 $1.20/百万 token,较原版 MAI-Code-1-Flash 成本降低 75%。Token 流式传输速度提升 25%,每任务 token 消耗减少 25%,模型现支持图像输入用于图表转代码场景。
上一代 MAI-Code-1-Flash 已于 2026 年 9 月 10 日退役。针对该模型的固定提示词或评估测试集必须迁移到 1.1-Flash。GPT-4 Turbo 作为回退选项仍可用至 2026 年 11 月,届时 MAI-Code-1.1-Flash 将完全在微软 Maia 200 加速器上运行。
路由现实:彭博社确认 Microsoft 365 Copilot 现已在生产中将 Excel 和 Outlook 提示路由到 MAI 模型。Copilot 不是单一模型——它是一个编排层,带有任务分类路由器。邮件起草、摘要、Excel 公式生成和结构化数据提取路由到 MAI。智能体编码路由到 MAI-Code-1.1-Flash。图像生成路由到 MAI-Image-2.5 和 2.6。Teams 转录路由到 MAI-Transcribe。安全扫描路由到 MAI-Cyber-1-Flash。只有复杂多步推理和需要风格判断的创意生成仍路由到第三方前沿模型。
架构规划的启示:以第一方路由扩大而非收缩为前提做预算。微软预计到 2026 年底,大多数常规 Copilot 任务将在 MAI 上运行。
Azure Vision API 退役:昨日已返回 410 Gone
2026 年 9 月 13 日是旧版 Azure Vision API(版本 1.0 至 3.1)的硬性退役日。仍在调用这些端点的任何应用程序现在将收到 410 Gone 响应。这不是软性弃用——没有逐步降级,没有延长宽限期。
迁移目标是基于 Florence-2 的 Image Analysis 4.0 SDK。Florence-2 仍然是微软的视觉基础模型:统一的序列到序列架构,以单一权重集处理 12+ 项视觉任务——检测、分割、描述、密集区域描述、视觉定位,以及 164 种语言的 OCR。大变体(7.71 亿参数)为生产级;基础变体(2.32 亿)可在标准 CPU 上运行。两者均以 MIT 许可在 Hugging Face 上发布,月下载量分别约为 266 万和 81.3 万。
没有 Florence-3 的计划。微软在视觉基础层优先考虑稳定性而非发布速度。Image Analysis 4.0 本身将于 2028 年 9 月 25 日退役——给团队两年的规划窗口。
如果您尚未迁移,这是影响生产的中断。立即审计应用程序中是否有调用旧版视觉端点的残留。
Aion 1.0:Phi Silica 切换时间表
Aion 1.0 是微软取代 Phi Silica 的端侧模型,在 Build 2026 上发布。两个变体:Aion 1.0 Instruct(轻量 SLM,用于摘要、改写、意图分类——可在 CPU、GPU 或 NPU 上运行,无需专用硬件)和 Aion 1.0 Plan(140 亿参数,32K 上下文,用于通过 Windows Agent Framework 进行端侧智能体推理)。
过渡有明确日期:
- 2026 年 10 月 1 日: 独立 Aion Instruct 测试包,支持 LoRA 训练。
- 2026 年 10 月 23 日: Windows Insiders 推出——Phi Silica 和 Aion 共存,通过受控功能推出(CFR)按设备选择活跃模型。
- 2026 年 11 月 24 日: 正式发布——Aion Instruct 成为生产模型,Phi Silica 从零售设备中移除。
关键规划事项:现有 Phi Silica LoRA 适配器无法迁移到 Aion。如果您的团队已投入自定义 Phi Silica 微调,请立即开始重新训练。LanguageModel 和 ImageDescription API 的 API 兼容性得到保留,但底层模型权重不同。最终 GPU 兼容性列表和所需 NVIDIA 驱动版本尚未发布——在 10 月日期之前留意这些信息。
Phi-4:开源权重主力继续前行
MAI 主导云端前沿的同时,Phi-4 仍然是微软面向边缘和 IoT 的开源权重小语言模型系列。最新版本 Phi-4-reasoning-vision-15B(2026 年 3 月)将 Phi-4-reasoning 主干与 SigLIP-2 视觉编码器结合,实现多模态推理——150 亿参数,MIT 许可,动态思考激活。Phi-4-mini 于 2026 年 7 月搭载到 Windows 12 Copilot+ PC,在 Snapdragon X Elite 上以约 3GB VRAM 实现 42 token/秒的离线代码补全和本地图像编辑。
Phi 家族以小博大的故事仍在延续:Phi-4(140 亿参数)在数学和推理基准测试中超越 5 倍于自身规模的模型,这得益于合成数据质量和精细的训练课程,而非参数数量。对于需要本地部署或气隙环境的团队,Phi-4 仍然是标杆。
Turing:视为已退役
Turing 模型系列在 2025–2026 年没有任何实质性更新。MAI 已吸收 Turing 曾经服务的所有生产工作负载。如果您的架构图中仍有 Turing 模型,那些图现在已经是历史文献——请规划替换。
下周关注
- 10 月 1 日: Aion 1.0 Instruct 独立测试包。
- 10 月 23 日: Aion 1.0 Instruct 进入 Windows Insiders。
- 11 月 24 日: Aion 1.0 正式发布;Phi Silica 从零售 Windows 移除。
- 2026 年 11 月: GPT-4 Turbo 回退结束——MAI-Code-1.1-Flash 成为唯一默认。
- 关注列表: MAI-Realtime(全双工语音)已在 MAI Playground 中出现但未正式发布——上线可能临近。MAI-Thinking-1 独立基准测试仍待更广泛的 API 访问。
微软的第一方飞轮正以自身动能运转:新模型、激进定价、Copilot 默认路由、以及竞品基础设施的硬性退役日期。工程团队的务实立场是现在开始评估 MAI 模型用于常规工作负载——经济学和集成深度正在形成第三方替代方案在微软平台上无法匹敌的结构性优势。
请关注 https://x.com/kkaminsk 获取这些模型发布时的实时分析。