微软第一方 AI 技术栈刚刚跨越了一个门槛:每一层要么已投入生产,要么已进入公开预览。MAI 模型家族——完全在微软自有的 Maia 200 芯片上从零训练,未从 OpenAI、Anthropic 或任何第三方实验室进行任何蒸馏——在不到三个月内从 Build 2026 的发布公告变成了落地的现实。对于正在梳理供应商依赖关系的 CTO 来说,问题不再是"微软有没有自己的模型?",而是"它们到底有多强,我该在什么上做标准化?"
本周内容涵盖 MAI-Thinking-1 的公开预览、MAI-Code-1.1-Flash 与 MAI-Image-2.6 的成本经济学、两个硬性迁移截止日期,以及已确认的 Phi Silica 到 Aion 的过渡。
MAI-Thinking-1:首个完全自研的前沿推理模型
8 月 12 日,MAI-Thinking-1 在 Microsoft Foundry 上进入公开预览——这是微软首个完全从零训练的前沿推理模型。架构:稀疏混合专家(MoE),总参数约 1 万亿、激活参数 350 亿,上下文窗口 256K。
自报数据相当亮眼:AIME 2025 达 97.0%,AIME 2026 达 94.5%,SWE-Bench Pro 达 52.8%,与 Claude Opus 4.6 持平。微软还声称在 1,276 项任务上与 Claude Sonnet 4.6 的盲测偏好对比中胜出。
给工程团队的诚实提醒:独立基准测试仍然稀缺。彭博社和 ByteIota 的早期第三方分析认为,MAI-Thinking-1 在实际使用中大致与 DeepSeek V3.2 相当。这不是否定——而是背景信息。公开预览的意义就在于,你现在可以在 Foundry 上用它运行自己的评测套件,而不是轻信厂商数字。
MAI-Code-1.1-Flash:第一方代码模型的经济账
MAI-Code-1.1-Flash 于 8 月 11 日正式发布(GA),现已成为所有 GitHub Copilot 层级的默认编程模型。重点是成本:输入 $0.20/100 万 token、输出 $1.20/100 万 token——比原版 MAI-Code-1-Flash 降价 75%——同时 token 流式传输速度快 25%,每个任务消耗的 token 少 25%。
能力提升与价格同等重要。MAI-Code 系列首次加入原生图像输入,支持截图转代码工作流。SWE-Bench Verified 提升至 72.6%,Terminal-Bench 2.1 跃升 22% 至 62.9%,.NET 任务提升 15%。内部 ScreenShot2WebApp 得分 42.1% 说明视觉编程之路仍处于早期——但方向已经明确。
弃用提醒:MAI-Code-1-Flash 将于 9 月 10 日退役。如果你把提示词或评测固定在其上,请本周内完成迁移。
MAI-Image-2.6:竞技场排行榜第二名
MAI-Image-2.6 于 8 月 10 日发布,随即在 Arena 文生图排行榜上冲到第二名,领先 Google、Meta 和 xAI——仅次于 OpenAI。图像编辑排名第三。整体 Elo 较 2.5 提升 +79,文字渲染提升 +91,反映在排版、人像和照片级商业输出上的实质性质量跃升。
CTO 最该关注的数字:微软称生产中 GPU 成本较 GPT-Image-2 降低 84%。这就是 Maia 200 软硬件协同设计的故事——芯片与模型一起打造——也是 MAI-Code 降价的同一模式。第一方经济学正在成为结构性优势,而非营销话术。
专用安全模型:MAI-Cyber-1-Flash
MAI-Cyber-1-Flash 自 8 月 3 日起通过 Project Perception 进入公开预览,是微软进军专用安全 AI 的起点——用为任务训练的模型做漏洞检测,而不是把通用大模型指过去。对安全团队而言,这是对"万事皆微调"路线的第一方回答:一个具有安全专项训练的专用模型,通过 Copilot 编排层路由。
语音与转写
MAI-Voice-2 已 GA,支持 15 种语言和短样本声音克隆;MAI-Voice-2-Flash 在公开预览中提供 2 倍速度、成本降低 32%。MAI-Transcribe-1.5 支持 43 种语言,声称速度为竞品的 5 倍。值得注意的是,一个全双工的 MAI Realtime 语音模型已在 MAI Playground 中被发现,但尚未正式发布——这是未来方向的信号。
Phi-4:开源权重端侧组合
Phi-4 家族依然是业内最全面的开源权重小模型组合:七个 MIT 许可证变体,参数从 3.8B 到 15B。最新成员 Phi-4-reasoning-vision-15B(2026 年 3 月)将 SigLIP-2 视觉编码器与推理主干结合,支持屏幕接地(screen grounding),并可按需切换推理模式——是同尺寸下最佳的本地视觉推理候选。
两个数字在客户对话中反复出现:Phi-4(14B)以 84.8% 的 MMLU 追平 Llama 3.3 70B 级别,显存占用却少 4–5 倍;Phi-4-mini(3.8B)在 Intel Xeon 6 纯 CPU 模式下达到每秒 1,955 token。对于数据主权或气隙隔离部署,通往可用 AI 的入门路径依然没有比 MIT 许可的 Phi 权重更便宜的选择。
Florence-2:距离硬性切换还有 13 天
Florence-2 依然是 Azure AI Vision Image Analysis 4.0 背后的视觉引擎,用单一权重集处理 12 种以上视觉任务,包括 164 种语言的 OCR。微软已确认不计划推出 Florence-3——优先稳定性而非发布速度。
真正重要的截止日期:旧版 Azure Vision API(v1.0–3.1)将于 9 月 13 日硬性退役——只剩 13 天。如果还有任何工作负载在调用旧 API,迁移到基于 Florence-2 的 Image Analysis 4.0 SDK 就是本清单上优先级最高的事项。
Turing:事实上已退役
2025–2026 年没有任何实质性更新。MAI 已接管 Turing 服务的所有生产工作负载。如果你的架构图里还画着 Turing 模型,那这些图现在只是历史文档——请规划替代方案。
Aion 1.0:端侧过渡时间表已确定
Phi Silica 到 Aion 的过渡现在有了硬性日期:Aion Instruct 独立测试包 10 月 1 日,Windows Insider 推送 10 月 23 日,11 月 24 日正式发布(GA)——届时 Phi Silica 将从零售设备中移除。
Aion 1.0 Instruct 可在 CPU、GPU 或 NPU 上运行——无需专用 AI 硬件——预计开放权重,且不再需要 Limited Access Feature token。Aion 1.0 Plan(14B,32K 上下文)面向端侧智能体工作流:推理、工具调用、文件管理、子智能体编排。一个迁移坑:现有 Phi Silica LoRA 需要针对 Aion 重新训练。
Copilot:第一方编排层
Copilot 仍然是一个多供应商编排器——任务分类层将每次交互路由到最佳模型。MAI 负责邮件起草、摘要、电子表格、编程、图像生成、转写和安全扫描。GPT-5.6 与 Claude 继续参与复杂的多步推理和创意工作。微软的预测:到 2026 年底,大多数商品化 Copilot 任务将完全运行在 MAI 上。请围绕这一轨迹规划成本与数据驻留方案。
行动清单
- 在 9 月 10 日前将 MAI-Code-1-Flash 迁移到 1.1-Flash——降价 75% 且支持图像输入
- 在 9 月 13 日前将旧版 Azure Vision API 迁移到 Image Analysis 4.0——硬性退役
- 在 Foundry 上自行评测 MAI-Thinking-1——独立数据胜过厂商宣传
- 评估 MAI-Image-2.6 的成本账——若大规模生成图像,GPU 成本较 GPT-Image-2 降 84%
- 审计 Turing 依赖,并提前规划 Phi Silica LoRA 重训——应对 11 月 24 日 Aion 切换
Kevin Kaminski 是 Big Hat Group Inc. 创始人,一家专注于 AI 采用战略的微软合作伙伴。关注 https://x.com/kkaminsk 获取对微软 AI 模型生态的持续分析。