两天两场发布。MAI-Code-1.1-Flash 于 8 月 11 日发布,相比上一代成本降低 75%,并新增图像输入支持。MAI-Image-2.6 于 8 月 10 日上线,在 Arena 文生图排行榜上位居第二,领先 Google、Meta 和 xAI。两者都是微软自研模型——内部训练、经 Copilot 路由、可在 Azure Foundry 和各级 GitHub Copilot 中使用。

信号很明确:MAI 系列正在快速迭代,足以在成本敏感型工作负载上取代第三方模型,同时持续提升质量。

MAI-Code-1.1-Flash:更快、更便宜、多模态

核心数字非常醒目。与 MAI-Code-1-Flash(2026 年 6 月在 Build 2026 上发布)相比,1.1 版本带来:

  • 成本降低 75%:输入 $0.20/1M、缓存 $0.02/1M、输出 $1.20/1M——从 $0.75/$0.075/$4.50 下降
  • Token 流式输出提速 25%,每个任务 Token 消耗减少 25%
  • Terminal-Bench 2.1 提升 +22%(GitHub Copilot CLI):51.7% → 62.9%
  • .NET 任务提升 +15%,代码存活率 +4%,回访率 +9%
  • SWE-Bench Verified 得分 72.6%,每个解决任务平均消耗 8.6K Token
  • 图像输入——MAI-Code 系列首次支持,可实现截图转代码工作流

架构依然是稀疏 MoE,总参数量 138B / 激活约 5B,上下文 256K,最大输出 128K,基于 2M 个合成任务和 150K 个 RL 环境训练。它现在已成为所有 GitHub Copilot 级别的生产模型——从 Free 到 Enterprise(Business/Enterprise 需要管理员选择启用)。MAI-Code-1-Flash 将于 9 月 10 日弃用;GPT-4 Turbo 回退支持持续到 11 月。如果你直接通过 Azure Foundry 调用 MAI-Code,请立即更新端点。

MAI-Image-2.6:在 Arena 上追赶 OpenAI

MAI-Image-2.6 于 8 月 10 日发布,随即在文生图 Arena 排行榜上拿下第二——仅次于 OpenAI,领先所有其他竞争对手。相比 MAI-Image-2.5 的提升是全面的:总体 Elo +79,文字渲染 Elo 更是 +91,人像、3D 图像和写实商业输出均有更强表现。

现已可在 Arena 使用;MAI Playground、Foundry 及其他平台将在未来几周内陆续上线。微软在 2.x 系列保持了 API 兼容,因此从 MAI-Image-2.5($47/1M)或 Flash($19.50/1M)升级的路径非常直接。实际意义在于:微软内部数据显示,生产环境中 GPU 成本相比 GPT-Image-2 降低 84%。对于大规模图像生成,这是一笔不容忽视的开支。

MAI-Thinking-1:公开预览上线,独立基准测试仍待验证

旗舰推理模型(约 1T 总参数 / 约 35B 激活的稀疏 MoE,256K 上下文)于 8 月 12 日在 Azure Foundry 进入公开预览。微软公布的基准成绩依然亮眼:AIME 2025 达 97.0%,AIME 2026 达 94.5%,SWE-Bench Pro 达 52.8%,并通过 Surge 在 1,276 个任务上以盲测偏好胜出 Claude Sonnet 4.6。

但独立基准测试仍然稀缺。Foundry 上的公开预览意味着你可以通过 API 自行评估——在做出承诺之前,先跑一遍自己的基准测试。

Phi-4:边缘计算的故事走向成熟

Phi-4 系列现已覆盖 10 多个 MIT 许可的变体,参数量从 3.8B 到 15B。本周的关键进展:

Azure AI Studio 集成(7 月 25 日)将 Phi-4 带入云端,支持 128K 上下文和 Azure ML 微调——非常适合同一模型在端侧和云端运行的混合部署。

Phi-4-mini-flash-reasoning 采用 SambaY 架构(Mamba 状态空间 + 滑窗注意力 + 门控记忆单元),相比 Phi-4-mini-reasoning 带来 10 倍吞吐量和 2-3 倍延迟改善。如果你的边缘 AI 路线图还没有考虑非 Transformer 架构,这一点值得关注。

Phi-4-reasoning-vision-15B(2026 年 3 月)现已被推荐用于新的多模态推理工作负载——ScreenSpot v2 GUI 定位得分 88.2%,支持双推理模式,在需要推理的场景下可有效替代 Florence-2。

Florence-2:距离硬性截止日期仅剩 28 天

旧版 Azure Vision API(v1.0–3.1)将于 2026 年 9 月 13 日退役——距今天还有 28 天。各组织必须迁移到基于 Florence-2 的 Image Analysis 4.0 SDK。这是硬性截止,不是软性弃用。

目前没有发布 Florence-3 的消息。策略是:纯视觉任务继续使用 Florence-2,推理加视觉任务迁移到 Phi-4-reasoning-vision-15B。两者均为 MIT 许可;LoRA 微调在专用数据集上可实现 >98% 的精确度。

Aion 1.0:Phi Silica 的落幕

Aion 1.0 Instruct 已进入开发者预览(Edge Canary/Dev 150.0.4070+),将取代 Phi Silica 成为 Windows 的端侧模型。过渡时间线:

  • 10 月 1 日: 发布独立的 Aion Instruct 测试包
  • 10 月 23 日: Windows Insider 推送(Phi Silica 保留,通过 CFR 选择模型)
  • 11 月 24 日: GA——Aion Instruct 成为生产版本,Phi Silica 从零售设备中移除

Aion 1.0 Plan(14B,32K 上下文)是更具雄心的发布——一个端侧智能体运行时,通过 Windows Agent Framework 支持工具调用和子智能体编排,需要 ≥40 TOPS NPU 或符合资格的独立 GPU。关键在于,与 Phi Silica 不同,Aion Instruct 不要求 LAF token——消除了一个真实的开发者痛点。Phi Silica 在 PowerToys v0.101(8 月 10 日)中获得了最后一次更新,但如果你今天还在基于它构建,现在就开始制定 Aion 迁移计划吧。

Copilot 路由的现实检验

CNBC 于 8 月 5 日报道,微软内部已将 GitHub Copilot 默认设置为 OpenAI GPT-5.6 Sol 供员工使用,同时提供 MAI 模型作为选项。这并不矛盾——这正是策略按设计运转的体现。Copilot 的任务分类层将常规任务路由到 MAI 模型以节约成本;复杂推理和创意生成则交给前沿模型。细微之处在于:自研模型赢得高吞吐、成本敏感型任务,前沿模型赢得复杂推理任务。你的架构应该同时支持两者——Copilot 的路由层已经自动做到了这一点。

行动清单

  1. 更新 MAI-Code 部署: 如果通过 Azure Foundry 调用 MAI-Code,请在 9 月 10 日 v1.0 弃用前迁移到 1.1-Flash。
  2. 评估 MAI-Image-2.6: 大规模图像生成——与当前供应商做基准对比。成本优势很有说服力。
  3. 自行运行 MAI-Thinking-1 基准测试: 公开预览已在 Foundry 上线。不要只依赖厂商公布的数字。
  4. Florence-2 迁移: 9 月 13 日截止。还剩 28 天。立即行动。
  5. Aion 迁移规划: 如果正在基于 Phi Silica 构建,10 月 1 日的测试包还有四周就要到来。提前准备好 LoRA 训练数据。
  6. 重新审视 Copilot 路由假设: 你的 Copilot 依赖计划应反映 MAI/第三方模型的划分,而不是默认一切由 OpenAI 承担。

微软的自研技术栈涵盖定制芯片(Maia 200)、云端模型(MAI)、开放权重边缘模型(Phi-4)、端侧模型(Aion)、视觉基础模型(Florence-2)和编排层(Copilot)。一周内两款重磅模型发布——这不再是研究项目,而是生产平台。


本文属于 Microsoft AI Weekly 系列。欢迎在 x.com/kkaminsk 关注后续分析。