2026년 중반은 마이크로소프트 AI 전략의 전환점이다. 마이크로소프트는 커스텀 실리콘부터 클라우드 프론티어 모델, 온디바이스 Windows AI까지 완전한 퍼스트파티 모델 스택을 구축했으며, 이제 이론에 머물지 않는다. 프로덕션 트래픽이 마이크로소프트 자체 모델을 통해 흐르고 있다.
블룸버그는 이달 초 마이크로소프트가 Excel 및 Outlook 프롬프트 수만 건을 OpenAI 및 Anthropic 모델에서 자체 MAI 모델로 라우팅하기 시작했다고 확인했다. GitHub Copilot은 8월까지 기본 백엔드를 MAI-Code-1-Flash로 전환한다. Phi Silica는 Windows Update를 통해 정기적으로 구성 요소 업데이트를 수신한다. 엔지니어링 리더들에게 더 이상의 질문은 마이크로소프트가 자체 모델을 구축할 수 있느냐가 아니라, 이 모델들을 중심으로 구축해야 하느냐다.
MAI 제품군: 증류 아닌, 처음부터 구축
Build 2026에서 Microsoft AI CEO 무스타파 술레이만이 공개한 7개 모델로 구성된 MAI 제품군은 마이크로소프트의 AI 독립에 대한 가장 공격적인 선언이다. 이 모델들은 마이크로소프트의 “Hill-Climbing Machine” 파이프라인과 Maia 200 가속기(140억 개 트랜지스터, 216GB HBM3e를 탑재한 3nm 칩)를 사용하여 상용 라이선스가 부여된 추적 가능한 데이터로 처음부터 학습되었다.
MAI-Thinking-1: 프론티어급이지만, 아직 독립적으로 입증되지는 않음
주력 추론 모델은 총 약 1조 개의 파라미터 중 약 350억 개의 활성 파라미터를 가진 희소 Mixture-of-Experts 아키텍처로, 256K 토큰 컨텍스트 윈도우를 제공한다. 마이크로소프트가 자체 발표한 벤치마크는 강력하다: AIME 2025에서 97.0%, SWE-Bench Verified에서 73.5%, Surge 블라인드 인간 평가에서 1,276개 작업 전반에 걸쳐 평가자가 Claude Sonnet 4.6보다 선호했다.
단서: 이는 자체 발표 수치다. 블룸버그와 ByteIota의 독립 보도에 따르면 MAI-Thinking-1은 실제로 DeepSeek V3.2와 대략 동등한 수준이다 — 뛰어나지만 기존 프론티어 모델을 확실히 뛰어넘는 수준은 아니다. 여전히 비공개 프리뷰 상태이며 공개된 가격도 없다. 현재로서는 구매 결정이 아닌, 유망한 신호에 가깝다.
MAI-Code-1-Flash: 즉각적인 엔터프라이즈 영향
이 모델이 오늘날 중요하다. 약 50억 개의 활성 파라미터(총 1,370억 개)를 가진 MAI-Code-1-Flash는 이미 모든 GitHub Copilot 티어와 Azure Foundry API를 통해 일반 공급 중이다. SWE-Bench Pro에서 51.2%를 기록하며 Claude Haiku 4.5를 16포인트 앞서면서도 최대 60% 적은 토큰을 사용한다. 입력 토큰 100만 개당 $0.75, 출력 토큰 100만 개당 $4.50으로 대규모 사용 시 GPT-4o보다 약 3배 저렴하다.
마이크로소프트는 MAI-Code-1-Flash가 2026년 8월까지 기본 Copilot 모델이 될 것이며, 11월까지 3개월간 GPT-4 Turbo 폴백 윈도우가 제공된다고 확인했다. 엔지니어링 조직 전반에 GitHub Copilot을 사용 중이라면, 계획했든 안 했든 이 전환은 이미 로드맵에 올라와 있다.
전문화된 MAI 모델: 이미지, 전사, 음성
나머지 MAI 모델은 텍스트와 코드 외의 다양한 모달리티를 다룬다:
- MAI-Image-2.5는 Arena.ai 이미지 편집 리더보드에서 2위를 차지했으며 PowerPoint 및 OneDrive에 통합되었다. Flash 변형은 약 3분의 1 가격으로 저비용 생성을 제공한다.
- MAI-Transcribe-1.5는 43개 언어를 지원하며 FLEURS 단어 오류율 4.86%로 모든 경쟁사 중 가장 낮은 수준이고, 경쟁 모델 대비 약 5배 빠른 속도를 제공한다. Teams, Copilot, Dynamics 365 Contact Centre에 이미 롤아웃 중이다.
- MAI-Voice-2는 15개 이상의 언어를 지원하는 자연스러운 TTS, 짧은 샘플로 음성 적응, 음성 복제 오용에 대한 내장 보호 기능을 제공한다.
세 모델 모두 현재 Azure Foundry에서 일반 공급 중이다.
Phi-4: SLM의 황금 기준
38억~150억 파라미터 범위에서 마이크로소프트의 Phi-4 제품군에 필적하는 벤더는 없다. 추론, 비전, 멀티모달, 엣지 시나리오를 아우르는 7개의 개별 모델이라는 광범위한 변형과 MIT 라이선싱의 결합은 이 제품군을 업계에서 가장 매력적인 소형 언어 모델 포트폴리오로 만든다.
현재 라인업
| 모델 | 파라미터 | 컨텍스트 | 최적 용도 |
|---|---|---|---|
| Phi-4 | 14B | 16K | 수학, 코딩, 추론 |
| Phi-4-mini | 3.8B | 128K | 엣지 디바이스, 긴 컨텍스트 |
| Phi-4-multimodal | 5.6B | 128K | 텍스트 + 오디오 + 비전 |
| Phi-4-reasoning | 14B | — | 논리, 확장 추론 |
| Phi-4-reasoning-plus | 14B | — | RL 강화 추론 |
| Phi-4-mini-reasoning | 3.8B | 32K–64K | 경량 추론 |
| Phi-4-reasoning-vision-15B | 15B | — | 멀티모달 추론 + 비전 |
Phi-4 베이스는 MMLU에서 84.8%를 기록하며 Llama 3.3 70B 및 Qwen 2.5 72B에 필적하면서도 VRAM 요구량은 4~5배 적다. Phi-4-mini는 8GB RAM 머신과 Raspberry Pi 5 디바이스에서 약 3GB VRAM(Q4 양자화)으로 실행된다. Phi-4-reasoning-plus는 AIME 2025 수학 퀄리파이어에서 OpenAI의 o1-mini를 능가한다.
엔터프라이즈 아키텍트에게 가장 주목할 만한 모델은 Phi-4-reasoning-vision-15B다. 2026년 3월 출시된 이 모델은 SigLIP-2 비전 인코더를 Phi-4-Reasoning 백본과 결합했으며, 모든 입력에 강제 chain-of-thought 없이 추론 모드와 비추론 모드를 전환할 수 있다. 화면 그라운딩 기능(UI 요소를 좌표로 식별)은 자율 UI 에이전트 및 RPA 도구의 기반이 된다. 10배의 연산을 요구하는 모델과 150억 개 파라미터로 경쟁한다는 점에서 온프레미스 비전-추론 워크로드에 강력한 후보다.
한 가지 주목할 제한 사항: Phi-4 베이스의 컨텍스트 윈도우는 16K로, 동급 대비 짧은 편이다. 긴 컨텍스트 처리가 필요하다면 파라미터당 품질은 낮더라도 128K 윈도우의 Phi-4-mini가 더 나은 선택이다.
Phi-3 및 Phi-3.5는 공식적으로 대체되었다. 마이크로소프트는 모든 신규 프로젝트에 Phi-4-mini를 권장한다. 레거시 변형은 MIT 라이선스로 Hugging Face에 계속 제공되지만 Foundry 모델 사용 중단 일정에 포함되어 있다.
Aion 1.0: 플랫폼 레이어로서의 온디바이스 AI
Build 2026에서 발표된 Aion 1.0은 마이크로소프트의 최신 온디바이스 모델 제품군으로, 로컬 AI에 대한 근본적으로 다른 접근 방식을 대표한다.
Aion 1.0 Instruct는 요약, 재작성, 의도 분류, 접근성을 위한 경량 SLM이다. 전용 GPU 없이 CPU, GPU 또는 NPU에서 실행되며, 현재 Edge Canary/Dev에서 사용 가능하고 이번 달 Hugging Face에 오픈 웨이트가 공개될 예정이다.
Aion 1.0 Plan은 더 야심찬 제품이다: 온디바이스 에이전트 워크플로우(추론, 도구 호출, 파일 관리, 하위 에이전트 오케스트레이션)를 위해 설계된 140억 개 파라미터, 32K 컨텍스트 윈도우 모델이다. Windows Agent Framework(Build 2026에서 오픈소스로 공개)의 일부로 지원되는 Windows 디바이스에 기본 탑재되며, ≥40 TOPS NPU(Snapdragon X Elite, Intel Lunar Lake)를 갖춘 Copilot+ PC 또는 NVIDIA RTX 30+ / AMD Radeon RX 9060+ GPU가 필요하다.
핵심 차별점: Aion 1.0 Plan은 챗봇이 아니다. 사용자 의도를 추론하고 로컬에서 하위 에이전트를 오케스트레이션하는 에이전트 런타임이다. Windows 네이티브 AI 애플리케이션을 구축하는 엔지니어링 팀에게 이는 “무제한 지능"의 기초다 — 클라우드 의존성 제로, 추론당 한계 비용 제로.
Phi Silica: 서비스형 Windows 플랫폼 구성 요소
Phi Silica가 주목받는 이유는 새로운 운영 패러다임, 즉 OS 구성 요소로서의 AI 모델을 대표하기 때문이다. 이 NPU 최적화 Transformer 모델은 Windows Copilot+ PC와 함께 제공되며 Windows Update를 통해 정기적으로 업데이트되고, 버전 번호, 변경 로그, 실리콘 벤더별 KB 패키지가 함께 제공된다.
2026년 5월 업데이트(v1.2605.856.0)는 AMD 특화 최적화를 도입하여 온디바이스 응답 속도를 최대 30% 향상시켰다. 실험적 GPU 경로는 이제 NVIDIA RTX 30+ 카드(6GB VRAM)를 탑재한 비-Copilot+ PC로 로컬 AI를 확장한다. 개발자 액세스는 Windows App SDK를 통한 Limited Access Feature 잠금 해제 토큰이 필요하다.
조직 전체에 Copilot+ PC를 배포 중이라면 Phi Silica는 이미 실행 중이며 — 추적 여부와 관계없이 — 업데이트되고 있다. IT 팀은 이를 인벤토리 및 업데이트 모니터링에 추가해야 한다.
Florence-2: 조용한 업무용 말
Florence-3는 발표되지 않았다. 2024년 6월에 도입된 Florence-2는 마이크로소프트의 Azure AI 서비스 전반에 걸쳐 사실상의 비전 엔진으로 남아 있으며, 그 이유가 있다. 통합된 프롬프트 기반 시퀀스-투-시퀀스 아키텍처는 단일 가중치 세트로 객체 감지, 세그멘테이션, 캡셔닝, 비주얼 그라운딩, OCR, 밀집 영역 캡셔닝 등 12개 이상의 비전 작업을 처리한다.
0.23B(베이스, CPU 배포 가능)부터 0.77B(대규모, 프로덕션급)까지 다양한 변형을 갖춘 Florence-2는 Azure AI Vision Image Analysis 4.0을 구동하며 164개 언어의 OCR을 지원한다. 레거시 Azure Vision API(v1.0~3.1)는 2026년 9월 13일에 사용 중단될 예정이다 — Florence 기반 Image Analysis 4.0 SDK로 마이그레이션하지 않았다면 그 시한이 다가오고 있다.
특화 데이터셋에서 LoRA를 통한 파인튜닝은 도메인별 애플리케이션에서 98% 이상의 정밀도를 입증했다. Hugging Face 커뮤니티는 활발하게 활동 중이며, 네이티브 C#/.NET NuGet 패키지를 통해 ONNX 런타임으로 .NET 통합이 간편하다.
MAI-DS-R1: 오픈 웨이트에 대한 안전성 포스트트레이닝
처음부터 학습된 MAI-Thinking-1과는 별도로, MAI-DS-R1은 DeepSeek-R1(671B)의 마이크로소프트 포스트트레이닝 변형이다. Microsoft AI 팀은 안전성과 응답성을 위해 모델을 수정했다: 이전에 차단되었던 프롬프트의 99.3%에 응답(2.2배 개선), HarmBench에서 유해 콘텐츠 50%+ 감소, 수학, 코딩, 일반 지식 전반에 걸쳐 원본의 추론 능력 유지.
MIT 라이선스로 호스팅 API(Azure Foundry)와 오픈 웨이트(Hugging Face) 모두로 출시되었으며, 낮은 VRAM 요구 사항을 위한 FP8 양자화 변형도 포함된다. 엔터프라이즈급 안전 가드레일을 갖춘 DeepSeek-R1의 추론 능력을 원하는 조직이라면 이 버전을 평가해야 한다.
Copilot 모델 교체 진행 중
멀티 모델 Copilot 아키텍처는 마케팅이 아니다 — 프로덕션 인프라다. 2026년 7월 기준:
- Microsoft 365 Copilot은 Excel 및 Outlook 프롬프트를 MAI 모델로 라우팅(블룸버그 확인)
- GitHub Copilot은 2026년 8월까지 기본값을 MAI-Code-1-Flash로 전환
- PowerPoint 및 OneDrive의 이미지 생성은 MAI-Image-2.5 사용
- Teams 전사(음성-텍스트 변환)에 MAI-Transcribe-1.5 롤아웃 중
- 온디바이스 Windows 추론은 Phi Silica 및 Aion 1.0 사용
- GPT-5.6은 Microsoft 365 Copilot의 지정 “선호 모델"로 유지(7월 9일 기준)되지만, 라우팅 로직은 경제성이 허용되는 경우 점점 더 퍼스트파티 모델을 선호
술레이만의 명시된 목표: “우리는 Anthropic에 많은 비용을 지불하고 있습니다 — 따라서 우리의 목표는 그 비용을 줄이고 궁극적으로 없애는 것입니다.” 그 궤적은 명확하다.
전략적 평가
마이크로소프트는 이제 Google 및 Apple과 함께 완전한 AI 포트폴리오를 보유한 유일한 기업이다: 커스텀 실리콘(Maia 200), 클라우드 프론티어 모델(MAI), 엣지 SLM(Phi-4), 온디바이스 모델(Aion, Phi Silica), 비전 파운데이션 모델(Florence-2), 오케스트레이션 레이어(Copilot).
CTO 및 엔지니어링 리더를 위한 실질적 시사점:
MAI-Code-1-Flash는 즉각적인 결정 사항이다. GitHub Copilot을 사용한다면 모델 교체가 다가오고 있다. 지금 VS Code 모델 선택기로 테스트하고 팀 워크플로우에 미치는 영향을 측정하라.
Phi-4는 온프레미스 또는 엣지 배포를 위한 최고의 SLM 옵션으로 남아 있다. MIT 라이선싱, 입증된 벤치마크, 거의 모든 사용 사례에 맞는 변형을 갖추고 있다. 엣지에는 Phi-4-mini, 비전-추론 작업에는 Phi-4-reasoning-vision-15B로 시작하라.
MAI-Thinking-1은 주시 대상이지만 아직 확정할 대상은 아니다. 비공개 프리뷰, 자체 발표 벤치마크, 공개된 가격 없음. 추적하고, 관계가 있다면 프리뷰 액세스를 요청하되, 2026년 아키텍처 결정을 여기에 기반하지 마라.
Florence-2 마이그레이션은 선택이 아닌 기한이다. 레거시 Azure Vision API는 2026년 9월 13일에 사용 중단된다. 지금 Image Analysis 4.0으로 이전하라.
Aion 1.0 Plan은 Windows 네이티브 애플리케이션을 위해 주목할 대상이다. 도구 호출 및 하위 에이전트 오케스트레이션을 갖춘 140억 파라미터 온디바이스 에이전트 런타임은 로컬 에이전트 AI를 향한 의미 있는 한 걸음이다. Copilot+ PC 배포 일정과 함께 평가하라.
Copilot에서 구성 여부와 관계없이 MAI 모델 사용이 증가할 것으로 예상하라. 마이크로소프트의 비용 인센티브는 자체 모델로의 라우팅에 정렬되어 있다. 점차 OpenAI에서 벗어나 MAI로 향하는 Copilot 경험을 계획하라.
풀스택 AI 전략은 더 이상 열망에 그치지 않는다. 프로덕션에서, 대규모로, 자급자족을 향한 명확한 궤적과 함께 출시되고 있다.
매주 Microsoft AI 분석은 x.com/kkaminski에서 확인하세요.