2026년 8월은 Microsoft의 자체 AI 전략에 있어 전환점입니다. 회사는 더 이상 모델을 구축하는 것에 그치지 않고 — 프로덕션 Copilot 트래픽을 대규모로 자체 모델로 라우팅하고 있습니다. 이번 달 MAI-Code-1-Flash가 GitHub Copilot의 기본 모델이 됩니다. MAI-Cyber-1-Flash는 8월 3일 Project Perception을 통해 공개 프리뷰에 진입했습니다. MAI-Image-2.5-Pro와 MAI-Voice-2-Flash 모두 공개 프리뷰에 도달했습니다. 그리고 숨겨진 전이중 음성 모델이 MAI Playground에서 발견되었습니다.
CTO와 엔지니어링 리더에게 더 이상의 질문은 Microsoft에 자체 모델이 있느냐가 아니라 — 여러분의 아키텍처가 이를 준비하고 있느냐입니다.
MAI 패밀리: 연구에서 프로덕션으로
Microsoft의 MAI 패밀리는 Build 2026에서 발표되었으며, “Hill-Climbing Machine” 파이프라인을 사용하여 처음부터 훈련된 7개의 클라우드 계층 모델로 구성되어 있습니다 — OpenAI, Anthropic, 또는 어떤 서드파티 랩으로부터의 증류도 제로입니다. 4개월 후, 이 모델들은 쇼케이스에서 프로덕션 워크로드로 이동하고 있습니다.
MAI-Code-1-Flash: GitHub Copilot의 새로운 기본 모델
이번 달 가장 영향력 있는 변화는 MAI-Code-1-Flash가 GitHub Copilot의 모든 등급의 기본 모델이 된 것입니다. 이 137B 총 파라미터 / ~5B 활성 파라미터의 희소 MoE 모델은 SWE-Bench Pro에서 51.2%를 달성하여 — Claude Haiku 4.5를 16포인트 앞서고 있습니다. Microsoft는 VS Code에서 코드 수락률이 GPT-5.4 Mini 및 Claude Haiku 4.5와 비교하여 약 10% 더 높고, 중위수 토큰 사용량이 약 10% 더 낮다고 보고합니다.
가격은 백만 입력 토큰당 $0.75, 백만 출력 토큰당 $4.50로 경제성이 매우 경쟁적입니다. GPT-4 Turbo는 2026년 11월까지 폴백으로 사용 가능하며, 이후 MAI-Code-1-Flash가 유일한 기본 모델이 됩니다. 동일한 체크포인트는 Excel 수식 생성도 구동하며 “가장 일반적인 작업에서 GPT-5.6과 동등"으로 설명됩니다. 이 모델은 OpenRouter, Fireworks AI, Baseten에서도 이용 가능 — 마이그레이션 경로가 존재합니다.
MAI-Thinking-1: 유망하지만 미검증
플래그십 추론 모델(약 962B 총 파라미터 / ~34.7B 활성, 256K 컨텍스트)은 현재도 Azure Foundry 프라이빗 프리뷰 중입니다. 자가 보고 벤치마크는 강력합니다 — AIME 2025에서 97.0%, SWE-Bench Pro에서 52.8%, Surge 블라인드 테스트에서 1,276개 작업에 걸쳐 Claude Sonnet 4.6보다 높은 사용자 선호도. 하지만 Bloomberg와 ByteIota의 독립 보도는 실제 사용에서 DeepSeek V3.2와 대략 동등하다고 평가합니다 — 유능하지만 명확한 도약은 아닙니다. 공개 프리뷰는 “수주 내"로 예정됩니다. CTO는 독립적인 API 액세스가 가능해질 때까지 벤치마크를 유망하지만 미검증으로 취급해야 합니다.
MAI 확장: 이미지, 음성, 보안
MAI-Image-2.5-Pro와 비용 스토리
MAI-Image-2.5-Pro는 7월 23일 공개 프리뷰에 진입하여 3계층 라인업을 완성했습니다: MAI-Image-2.5(GA, 백만 이미지 출력 토큰당 $47), Flash(GA, $19.50/백만), Pro(프리뷰, $106/백만). 프로덕션 증명은 설득력 있습니다 — PowerPoint는 GPT-Image-2 대비 GPU 비용 84% 감소, OneDrive는 저장률 26% 증가·P95 레이턴시 25% 감소, Bing Image Creator는 현재 100% 자체 모델 사용.
MAI-Voice-2-Flash와 Realtime 서프라이즈
MAI-Voice-2-Flash가 공개 프리뷰에 진입했습니다 — MAI-Voice-2의 2배 속도를 32% 낮은 비용(백만 문자당 $15)으로 제공합니다. 동시에, 전이중 음성 모델 MAI Realtime이 8월 2일 MAI Playground에서 발견되었습니다. 중간 텍스트 단계 없이 음성 입출력을 네이티브로 처리하며 17개 언어를 지원합니다. 공식 발표는 아직 없지만, Microsoft가 실시간 대화형 음성을 일급 기능으로 구축하고 있음을 시사합니다.
MAI-Cyber-1-Flash와 Project Perception
Project Perception은 MAI-Cyber-1-Flash(137B / ~5B 활성, MAI-Thinking-1 훈련에서 파생) 기반의 Microsoft의 새로운 에이전트 보안 플랫폼입니다. CyberGym에서 95.95%를 달성하여 — 1위, 약 절반의 비용으로 2위를 12포인트 앞서고 있습니다. 플랫폼은 레드(공격), 블루(트리아지), 그린(패치) 에이전트를 배포합니다. Microsoft는 이미 내부 취약점 스캐닝의 90%에서 사용 중이며, GPT-5.4가 복잡한 에스컬레이션을 처리합니다. 공개 프리뷰이지만 심사 필요 — 일반 공개 아님.
Phi-4: 오픈 웨이트 엣지 모델
Phi-4 패밀리는 3.8B–15B 파라미터 범위에서 여전히 무적입니다. 7개의 MIT 라이선스 모델이 엣지 배포부터 멀티모달 추론까지를 다룹니다.
Phi-4-mini(3.8B)는 7월 19일 Windows 12 Copilot+ PC에 배송되었습니다 — Snapdragon X Elite에서 초당 42 토큰, Q4 양자화에서 약 3GB VRAM으로 오프라인 코드 완성과 로컬 이미지 편집을 가능하게 합니다. 데이터 주권 및 간헐적 연결 시나리오에 대해 프로덕션 준비가 완료되었습니다.
Phi-4-mini-flash-reasoning은 특별한 주목이 필요합니다. SambaY 하이브리드 아키텍처를 사용합니다 — Mamba 상태 공간 모델과 슬라이딩 윈도우 어텐션, 게이티드 메모리 유닛, 차동 어텐션을 결합하여 — Phi-4-mini-reasoning 대비 10배 처리량 향상과 2-3배 레이턴시 개선을 달성합니다. 이는 표준 Transformer에서의 진정한 아키텍처적 출발이며, RL 없이 실행됩니다. 엣지 AI 로드맵이 표준 Transformer 경제성을 가정하고 있다면 이 모델이 계산법을 바꿉니다.
Phi-4-reasoning-vision-15B(2026년 3월)는 멀티모달 추론에서 사실상 Florence-2를 대체합니다. ScreenSpot v2(GUI 그라운딩)에서 88.2%를 달성하여 자율 UI 에이전트와 RPA 도구의 기반이 됩니다. 작업별로 추론 모드를 동적으로 전환하여 강제 체인오브생각의 오버헤드를 방지합니다.
Aion 1.0: 온디바이스 전환
Microsoft의 온디바이스 전략은 Aion 1.0 주변으로 통합되고 있습니다. Aion 1.0 Instruct — CPU/GPU/NPU에서 실행 가능한 경량 SLM — 은 개발자 프리뷰 단계이며, Phi Silica를 대체하여 프로덕션 온디바이스 Windows 모델이 됩니다. Aion 1.0 Plan(14B, 32K 컨텍스트)은 더 야심 찬 릴리스로, Windows Agent Framework를 통해 추론, 도구 호출, 서브에이전트 오케스트레이션을 지원하는 온디바이스 에이전트 런타임입니다. ≥40 TOPS NPU 또는 적격한 디스크리트 GPU가 필요합니다.
전환 타임라인은 확정되어 있습니다: 10월 1일 독립 테스트 패키지, 10월 23일 Windows Insiders 배포, 11월 24일 GA — Phi Silica는 소매 기기에서 제거됩니다. 핵심적으로, Phi Silica와 달리 Aion Instruct는 LAF 토큰이 필요하지 않습니다 — 개발자의 중요한 장애물을 제거합니다.
Florence-2와 9월 마감일
Florence-2는 순수 컴퓨터 비전의 엔터프라이즈 워크호스로 안정적입니다 — 객체 감지, 세분화, 캡셔닝, 164개 언어의 OCR을 단일 가중치 세트로 MIT 라이선스 하에 제공합니다. Azure AI Vision Image Analysis 4.0을 구동합니다.
긴급: 레거시 Azure Vision API(v1.0–3.1)는 2026년 9월 13일에 폐지 — 현재부터 35일입니다. 구 API를 사용하는 조직은 그날까지 마이그레이션해야 합니다. Image Analysis 4.0 자체의 예정 폐지일은 2028년 9월 25일입니다.
Copilot 라우팅의 현실
Copilot은 단일 모델 제품이 아닙니다. 작업 분류 레이어가 모델을 선택하기 전에 각 인터랙션을 분류합니다. 이메일 작성, 요약, 수식 생성, 이미지 생성, Teams 전사, 보안 스캐닝은 MAI 모델로 라우팅됩니다. 복잡한 다단계 추론, 크리에이티브 생성, 새로운 문서 분석은 프론티어 서드파티 모델로 라우팅됩니다 — GPT-5.6은 Microsoft 365 Copilot의 지정 우선 모델로 남아 있습니다. 2026년 말까지 Microsoft는 대부분의 일상 Copilot 작업이 MAI 모델에서 실행될 것으로 예상합니다. Copilot 종속성 계획이 모든 것에 OpenAI 모델을 가정하고 있다면 업데이트가 필요합니다.
액션 아이템
- GitHub Copilot 마이그레이션: 11월까지 MAI-Code-1-Flash가 유일한 기본 모델이 될 준비를 하세요. GPT-4 Turbo 폴백이 여전히 사용 가능한 동안 테스트하세요.
- Azure Vision API 마이그레이션: 9월 13일까지 Image Analysis 4.0으로 마이그레이션하세요. 하드 마감일입니다.
- 이미지 생성 비용 검토: GPT-Image-2 대비 MAI-Image-2.5를 평가하세요 — PowerPoint에서의 84% GPU 비용 감소는 강력한 신호입니다.
- 엣지 AI 아키텍처: Windows 12의 Phi-4-mini와 Phi-4-mini-flash-reasoning의 SambaY 아키텍처는 온디바이스 경제성을 재검토할 가치가 있습니다.
- 보안 운영: 팀이 대규모 취약점 스캐닝을 처리하는 경우 Project Perception 액세스를 신청하세요.
- 온디바이스 계획: Phi Silica를 사용 중이라면 Aion 전환 타임라인은 10월 1일에 시작됩니다. LoRA 훈련 준비를 시작하세요.
Microsoft는 이제 Google과 Apple을 제외하고 커스텀 실리콘, 클라우드 프론티어 모델, 오픈 웨이트 엣지 모델, 온디바이스 모델, 비전 파운데이션 모델, 오케스트레이션, 에이전트 프레임워크에 걸친 완전한 AI 포트폴리오를 가진 유일한 기업입니다. 우리 나머지에게 질문은 얼마나 빨리 적응하느냐입니다.
이 기사는 Microsoft AI 주간 시리즈의 일부입니다. 지속적인 분석은 x.com/kkaminsk에서 팔로우하세요.