2026년 8월은 Microsoft의 자체(first-party) AI 전략에 있어 중요한 전환점입니다. Microsoft가 자체 개발한 Maia 200 실리콘에서 전량 사내 훈련된 MAI 모델 제품군이 이제 프로덕션 Copilot 트래픽을 라우팅하고 있습니다. Phi-4는 MIT 라이선스로 7가지 엣지 시나리오를 커버합니다. Florence-2는 Azure AI Vision 전체의 기반을 이루는 모델이지만, 30일 안에 레거시 API 은퇴라는 중대한 시점을 맞이합니다. 그리고 Aion 1.0은 Windows의 온디바이스 모델로서 Phi Silica를 대체할 준비를 하고 있습니다. AI 의존성 그래프를 그리고 계신다면, 바로 이번 주가 ‘Copilot 기반(Copilot-powered)‘이 실제로 내부적으로 무엇을 의미하는지 재평가할 시점입니다.
MAI 제품군: 빌드 발표에서 프로덕션 트래픽까지
Build 2026에서 Microsoft AI CEO 무스타파 술레이만(Mustafa Suleyman)은 ‘Hill-Climbing Machine’ 파이프라인으로 처음부터 훈련된 7개 모델로 구성된 MAI 제품군을 공개했습니다. OpenAI, Anthropic 또는 어떤 타사 연구소로부터의 증류(distillation)는 전혀 없습니다. 모든 모델은 Maia 200 가속기에서 실행됩니다: 1,400억 개의 트랜지스터와 216GB HBM3e를 탑재한 3nm 칩입니다.
3개월이 지난 지금, 이는 더 이상 로드맵 이야기가 아닙니다. Bloomberg는 7월에 수만 건의 Excel 및 Outlook 프롬프트가 이제 타사 API 대신 MAI 모델로 라우팅되고 있음을 확인했습니다. Microsoft 365 Copilot은 작업 분류 오케스트레이션 레이어로 작동합니다 — 이메일 작성, 스레드 요약, 스프레드시트 수식, VS Code 코딩, 이미지 생성, 보안 스캐닝이 모두 MAI로 라우팅됩니다. GPT-5.6과 같은 프론티어 타사 모델은 복잡한 다단계 추론에서 여전히 ‘선호 모델(preferred model)‘로 남아 있지만, 이제 표준(commodity) 등급은 MAI의 몫입니다.
MAI-Code-1.1-Flash: 75% 저렴, 비전 네이티브
MAI-Code-1.1-Flash는 8월 11일에 전작 대비 75% 비용 절감으로 GA(일반 공개)를 달성했습니다 — 입력 100만 토큰당 $0.20, 캐시 100만 토큰당 $0.02, 출력 100만 토큰당 $1.20. 토큰 스트리밍은 25% 빨라졌고, 작업당 토큰 소비는 25% 줄었으며, 스크린샷-투-코드(screenshot-to-code) 워크플로를 위한 네이티브 비전 입력이 추가되었습니다. 벤치마크: SWE-Bench Verified 72.6%, Terminal-Bench 2.1 62.9%(22% 상승), .NET 작업 15% 향상. 모든 GitHub Copilot 등급에서 사용할 수 있습니다. MAI-Code-1-Flash는 9월 10일에 지원이 중단(deprecate)되므로 지금 마이그레이션하세요.
MAI-Thinking-1: 플래그십 추론 모델, 공개 미리보기 진입
MAI-Thinking-1은 8월 12일 Foundry에서 공개 미리보기(public preview)에 들어갔습니다. 총 약 962B / 활성 약 34.7B 파라미터, 256K 컨텍스트로 Microsoft의 프론티어 추론 모델입니다. 자체 보고 수치: AIME 2025 97.0%, AIME 2026 94.5%, SWE-Bench Pro 약 52.8% — Claude Opus 4.6과 견줄 만한 수준입니다. 가격은 미정(TBD)입니다.
MAI-Image-2.6 및 MAI-Cyber-1-Flash
MAI-Image-2.6은 8월 10일 비공개 미리보기(private preview)에 들어가면서 즉시 Arena 텍스트-투-이미지 부문 2위(1,336 Elo)와 3D 이미지 부문 1위를 차지했습니다 — 해당 카테고리에서 GPT Image 2를 제쳤습니다. 주목할 만한 상승: 텍스트 렌더링 +91 Elo, 2.5 대비 전체 +79 Elo.
MAI-Cyber-1-Flash는 Project Perception의 일환으로 8월 3일 공개 미리보기에 들어갔습니다. GPT-5.4의 절반 컴퓨팅 비용으로 취약점 스캐닝의 90%를 처리하며, CyberGym 점수는 88.4%에서 95.95%로 도약했습니다.
Phi-4: 더욱 두터워지는 엣지 포트폴리오
Phi-4 제품군은 여전히 업계에서 가장 포괄적인 소형 언어 모델(SLM) 포트폴리오입니다 — 3.8B~15B 파라미터 범위의 MIT 라이선스 변형 7종. 이 정도의 폭을 따라잡는 벤더는 없습니다.
Phi-4(14B)는 MMLU 84.8%로 Llama 3.3 70B에 맞서면서도 VRAM을 4~5배 덜 사용합니다. Phi-4-mini(3.8B)는 8GB RAM과 Raspberry Pi 5에서 실행되며, Windows 12 Copilot+ PC에 탑재되어 출시되었고, Intel Xeon 6에서 CPU 전용 모드로 초당 1,955 토큰을 달성했습니다. Phi-4-reasoning-vision-15B는 SigLIP-2 비전 인코더를 Phi-4-Reasoning 백본과 결합하고, 추론 모드 토글과 화면 그라운딩(screen grounding)을 지원합니다 — 15B 파라미터에서 최고의 온프레미스 비전-추론 후보입니다.
Azure 가격: 입력 100만 토큰당 $0.07, 출력 100만 토큰당 $0.14, 혼합(blended) 100만 토큰당 $0.088. Phi-4 비전 및 오디오 변형은 10월까지 출시될 예정입니다.
CTO를 위한 전략적 가치: 라이선스 마찰 없이 오프라인, 온프레미스, 데이터 주권(data sovereignty)을 지키는 AI 배포가 가능하다는 점입니다.
Florence-2: 레거시 API, 30일 데드라인
Florence-2는 Azure AI Vision Image Analysis 4.0을 구동하는 Microsoft의 비전 파운데이션 모델로 남아 있습니다. Florence-3은 계획되어 있지 않습니다 — Microsoft는 출시 속도보다 안정성을 우선시하고 있습니다. 이 모델은 단일 가중치 세트로 12개 이상의 비전 작업을 처리합니다: 검출(detection), 분할(segmentation), 캡셔닝(captioning), 그라운딩(grounding), 164개 언어에 걸친 OCR, 조밀 영역 캡셔닝(dense region captioning)까지.
중요: 레거시 Azure Vision API(v1.0~3.1)는 2026년 9월 13일 — 30일 후 — 은퇴합니다. 이 날짜 이전에 Florence-2 기반 Image Analysis 4.0 SDK로 마이그레이션하세요. Florence-2-large(770M)는 외부 OCR 없이 TextVQA에서 81.5%를 달성했으며, LoRA 파인튜닝은 특수 데이터셋에서 98% 이상의 정밀도를 보여줍니다. 네이티브 C#/.NET NuGet 패키지가 로컬 ONNX 실행을 지원합니다.
이는 소프트한 지원 중단(soft deprecation)이 아닌 하드 은퇴(hard retirement)입니다.
Aion 1.0: 온디바이스 전환
Aion 1.0은 Microsoft의 ‘무제한 지능(unmetered intelligence)’ 전략입니다 — 클라우드 의존성 제로, 추론당 한계 비용(marginal cost) 제로. Aion 1.0 Instruct(경량 SLM)는 전용 GPU 없이 CPU/GPU/NPU에서 실행되며, 지금 Edge Canary를 통해 개발자 미리보기를 시작하고, 10월 1일 독립 테스트, 11월 24일 GA를 앞두고 있습니다. 특히 개발자들에게 Phi Silica를 불편하게 만들었던 Limited Access Feature 토큰 요건이 제거되었습니다. Aion 1.0 Plan(14B, 32K 컨텍스트)은 추론, 도구 호출(tool-calling), 하위 에이전트 오케스트레이션 등 온디바이스 에이전틱 워크플로를 처리하며, Windows Agent Framework를 통해 Copilot+ PC에 기본 탑재됩니다.
Phi Silica는 단계적으로 폐지되고 있습니다: 5월의 AMD 최적화로 응답 속도가 30% 빨라졌지만, 모델은 11월 24일 소매 기기에서 제거됩니다. Microsoft는 LanguageModel 및 ImageDescription API 전반에서 API 호환성이 유지될 것이라고 밝혔습니다.
연구 릴리스: Orchard와 EvoLib
Microsoft Research는 이번 달 MIT 라이선스 프레임워크 2개를 출시했습니다. Orchard(8월 3일)는 AI 에이전트 훈련을 위한 Kubernetes 네이티브 프레임워크입니다 — 도메인 레시피는 활성 파라미터 약 3B로 SWE-bench Verified 69.7%, GUI 에이전트용 WebVoyager 74.1%를 달성했습니다. EvoLib(7월 30일)은 모델 가중치를 변경하지 않고 테스트 시점 학습(test-time learning)을 통해 수학, 코드, 에이전트 작업에서 11~20%의 성능 향상을 제공합니다. 두 프레임워크 모두 블랙박스 LLM을 중심으로 작동합니다.
전체 스택
Microsoft는 이제 (Google, Apple과 함께) 완전한 AI 포트폴리오를 보유한 3개 기업 중 하나입니다: 커스텀 실리콘(Maia 200), 클라우드 프론티어 모델(MAI), 오픈 가중치 엣지 SLM(Phi-4), 온디바이스 모델(Aion 1.0), 비전 파운데이션 모델(Florence-2), 오케스트레이션(Copilot 라우팅), 에이전트 프레임워크까지. 이 스택은 타사 의존성 없이 엔드투엔드로 평가할 수 있습니다 — 다만 대부분의 엔터프라이즈에서는 하이브리드 라우팅이 여전히 현실적인 선택입니다.
실행 항목
- 9월 10일 이전에 MAI-Code-1-Flash를 1.1-Flash로 마이그레이션하세요 — 75% 비용 절감 + 비전 입력
- 9월 13일 이전에 레거시 Azure Vision API를 Image Analysis 4.0으로 마이그레이션하세요 — 하드 은퇴
- Copilot 의존성 가정을 업데이트하세요 — MAI 모델이 이제 대부분의 표준 작업을 처리하므로 비용 및 데이터 레지던시 계획에 영향을 줍니다
- 온디바이스 시나리오에 Aion 1.0을 평가하세요 — 10월 1일 테스트 패키지 제공, Phi Silica 전환 마감은 11월 24일
- 오프라인/엣지 배포에 Phi-4-mini를 테스트하세요 — 지금도 8GB RAM 기업용 하드웨어에서 실사용 가능
Kevin Kaminski는 AI 도입 전략에 주력하는 Microsoft 파트너, Big Hat Group Inc.의 창립자입니다. Microsoft AI 모델 생태계에 대한 지속적인 분석은 https://x.com/kkaminsk 에서 팔로우하세요.