2026년 중반이 전환점이었다. 2026년 8월, 그것은 운영 현실이 된다. Bloomberg는 Microsoft가 수만 건의 Excel 및 Outlook 프롬프트를 타사 API 대신 자체 MAI 모델로 적극적으로 라우팅하고 있음을 확인했다. GitHub Copilot은 이번 달부터 기본 백엔드로 MAI-Code-1-Flash로 전환 중이다. 엔지니어링 리더들의 질문은 “Microsoft가 프론티어 모델을 만들 수 있는가?“에서 “얼마나 빨리 이를 중심으로 아키텍처를 재설계해야 하는가?“로 바뀌었다.
이번 주 분석은 2026년 8월 현재의 Microsoft 자체 모델 스택 전체를 다룬다 — 7개의 MAI 클라우드 모델, 7개의 Phi-4 엣지 변형, Aion 온디바이스 제품군, Phi Silica의 전환 일정, Florence-2의 폐지 시한, 그리고 이 모든 것을 묶는 Copilot 오케스트레이션 레이어까지.
MAI 제품군: 처음부터 직접 구축
6월 Build 2026에서 공개된 MAI(Microsoft AI) 제품군은 Microsoft의 가장 중요한 사내 AI 투자다. 7개 모델 모두 Mustafa Suleyman의 AI Superintelligence Team이 내부 파이프라인인 “Hill-Climbing Machine"을 사용해 처음부터 학습시켰다. OpenAI, Anthropic 또는 어떤 타사 연구소로부터의 증류(distillation)도 없다. 학습 데이터는 엔터프라이즈급이며 상용 라이선스가 적용되고 추적 가능하다 — 컴플라이언스 요구사항이 있는 조직에게 중요한 차별점이다.
MAI-Thinking-1: 플래그십
리즈닝 플래그십은 총 약 1T 파라미터 중 약 35B의 활성 파라미터를 사용하는 희소 Mixture-of-Experts 아키텍처와 256K 토큰 컨텍스트 윈도우를 갖춘다. Microsoft가 보고한 벤치마크는 놀랍다: AIME 2025에서 97.0%, AIME 2026에서 94.5%, SWE-Bench Pro에서 약 52.8% — Claude Opus 4.6과 일치하는 수준이다. 1,276개 태스크에 걸친 블라인드 인간 평가에서 MAI-Thinking-1은 Claude Sonnet 4.6보다 선호되었다. 현재 Azure Foundry에서 프라이빗 프리뷰로 제공되며, 공개 프리뷰는 수 주 내로 예상된다.
MAI-Code-1-Flash: 이미 프로덕션 가동 중
GitHub Copilot에서 GPT-4 Turbo를 적극적으로 대체하고 있는 모델이 바로 이것이다. 2026년 6월 26일 일반 공개되었으며, 가격은 입력 토큰 1M당 $0.75, 출력 토큰 1M당 $4.50이다. SWE-Bench Pro에서 51.2%를 기록 — Claude Haiku 4.5보다 16포인트 앞서며 — 유사 모델 대비 최대 60% 적은 토큰을 사용한다. VS Code의 기본 모델이며 모든 GitHub Copilot 등급에 걸쳐 출시되고 있다. GPT-4 Turbo는 2026년 11월까지 폴백으로 계속 제공되지만, 상황은 이미 명확하다.
이미지, 음성, 전사 모델
MAI-Image-2.5는 Arena.ai 이미지 편집 리더보드에서 2위를 기록하며 Nano Banana Pro를 능가했고, PowerPoint와 OneDrive에 통합되었다. Flash 변형은 약 3분의 1 비용으로 생성 기능을 제공한다. MAI-Transcribe-1.5는 43개 언어에서 최고 수준의 Word Error Rate를 주장하며 Teams 전사에 출시 중이다. MAI-Voice-2는 Microsoft의 가장 표현력이 뛰어난 TTS 모델이다. 세 모델 모두 Azure Foundry에서 일반 공급 중이다.
프론티어 튜닝: 고객 소유 모델
전략적으로 가장 흥미로운 역량은 아마도 RLE(Reinforcement Learning Environments)일 것이다. 이를 통해 조직은 자체 워크플로 데이터로 MAI 모델을 튜닝할 수 있다. Microsoft는 튜닝된 Excel 모델이 GPT-5.4와 대등하면서 최대 10배 더 효율적이라고 보고한다. 튜닝된 모델은 고객이 계속 소유한다 — 조직의 제도적 지식이 모델 자체의 일부가 되는 것이다. Mayo Clinic은 이미 Microsoft와 함께 비식별화된 임상 데이터와 Microsoft의 기반 AI를 결합한 의료 특화 프론티어 모델을 공동 개발 중이다. 이 모델은 Mayo Clinic이 소유하고 자체 환경에 먼저 배포된 후 Microsoft Foundry를 통해 제공될 예정이다.
Phi-4: 엣지 SLM 포트폴리오
모두 MIT 라이선스인 7개 변형이 리즈닝, 비전, 멀티모달, 엣지 시나리오를 아우른다. 이는 업계에서 가장 설득력 있는 소형 언어 모델 포트폴리오다.
기본 Phi-4(14B)는 MMLU에서 Llama 3.3 70B와 Qwen 2.5 72B에 필적하면서 VRAM을 4~5배 덜 요구한다. 4.8조 토큰의 선별된 웹 및 코드 데이터로 학습되었으며 GPT-4o mini보다 85% 적은 컴퓨팅을 소비한다. 현재 Azure AI Studio에 128K 컨텍스트와 함께 통합되었으며 Azure Machine Learning을 통한 파인튜닝을 지원한다.
Phi-4-mini(3.8B)는 8GB RAM 머신과 Q4 양자화 기준 약 3GB VRAM의 Raspberry Pi 5에서도 실행된다. 7월 19일 Windows 12 Copilot+ PC에 탑재되어 Snapdragon X Elite에서 초당 42토큰으로 실행되며 — 오프라인 코드 완성과 로컬 이미지 편집을 가능하게 한다.
리즈닝 변형은 특별히 주목할 만하다. Phi-4-reasoning은 대부분의 벤치마크에서 OpenAI의 o1-mini와 DeepSeek-R1-Distill-Llama-70B를 능가하며, AIME 2025에서는 전체 DeepSeek-R1(671B 파라미터)과 대등하다. Phi-4-reasoning-plus는 RL 강화를 추가했다. Phi-4-mini-reasoning(3.8B)은 DeepSeek R1이 생성한 약 100만 개의 합성 수학 문제로 학습되었다 — 경량 기기에서의 임베디드 튜터링용으로 설계되었다.
2026년 3월 출시된 Phi-4-reasoning-vision-15B는 SigLIP-2 비전 인코더와 Phi-4-Reasoning 백본을 결합한다. 리즈닝/비리즈닝 모드를 전환할 수 있고 스크린 그라운딩(좌표 기반 UI 요소 식별)을 지원하며, 15B 파라미터에서 온프레미스 비전-리즈닝 워크로드에 가장 적합한 후보다. 자율 UI 에이전트나 RPA 도구를 구축한다면 바로 이 모델이다.
Aion 1.0: 온디바이스 인텔리전스
Build 2026에서 발표된 Aion 1.0은 Microsoft가 “무제한 인텔리전스(unmetered intelligence)“라고 부르는 것을 구현한다 — 클라우드 의존도 제로, 추론당 한계 비용 제로.
Aion 1.0 Instruct는 전용 GPU 없이 CPU, GPU 또는 NPU에서 실행되는 경량 SLM이다. 요약, 재작성, 의도 분류, 접근성 태스크를 처리하며 현재 Edge Canary/Dev 채널을 통해 개발자 프리뷰로 제공된다. 오픈 가중치는 이번 달 Hugging Face에 공개될 예정이다. 핵심적으로, Aion Instruct는 2026년 11월 24일에 프로덕션 온디바이스 모델로서 Phi Silica를 대체한다 — 독립 테스트 패키지는 10월 1일, Windows Insiders 롤아웃은 10월 23일부터 제공된다.
Aion 1.0 Plan(14B, 32K 컨텍스트)은 더 야심적이다. 챗봇이 아니다 — 사용자 의도를 추론하고 서브 에이전트를 로컬에서 오케스트레이션하는 에이전트 런타임이다. Microsoft가 Build 2026에서 오픈소스화한 Windows Agent Framework의 일부로, 지원되는 Windows 기기에 기본 탑재된다. ≥40 TOPS NPU를 갖춘 Copilot+ PC 또는 NVIDIA RTX 30+ / AMD Radeon RX 9060+ GPU가 필요하다. 로컬 퍼스트 에이전트 아키텍처를 구축하는 조직에게 이 플랫폼은 주목할 대상이다.
Florence-2: 안정적인 비전, 엄격한 시한
Florence-3는 발표되지 않았다. Microsoft는 급한 출시 주기보다 안정성과 폭넓은 엔터프라이즈 효용을 선택했다. Florence-2는 Azure AI Vision Image Analysis 4.0의 비전 엔진으로 남아 있으며, 단일 가중치 세트로 12개 이상의 비전 태스크 — 객체 탐지, 세그멘테이션, 캡셔닝, 비주얼 그라운딩, 164개 언어 OCR — 를 지원한다. MIT 라이선스로 base(~0.23B, CPU 배포 가능) 및 large(~0.77B, 프로덕션급) 변형으로 제공된다.
중요한 시한: 레거시 Azure Vision API(v1.0~3.1)는 2026년 9월 13일에 폐지된다. 아직 Florence-2 기반 Image Analysis 4.0 SDK로 마이그레이션하지 않았다면, 이것이 30일 경고다.
Copilot: 모델이 아닌 오케스트레이션
Microsoft 365 Copilot은 단일 모델이 아니다 — 오케스트레이션 레이어다. 태스크 분류 레이어가 각 상호작용을 태스크 유형, 복잡성, 품질 요구사항별로 분류한 다음 그에 따라 라우팅한다.
2026년 7월 현재, 고볼륨 커모디티 태스크 — 이메일 초안 작성, 스레드 요약, 스프레드시트 수식 생성, VS Code 코딩, PowerPoint 이미지 생성, Teams 전사 — 는 자체 MAI 모델로 라우팅된다. 긴 비정형 문서에 대한 새로운 분석, 복잡한 의존성을 가진 다단계 추론, 스타일적 판단이 필요한 창의적 생성은 여전히 GPT-5.6, Claude 같은 프론티어 타사 모델로 라우팅된다. 온디바이스 추론은 Phi Silica를 사용하며, Aion 1.0으로 전환 중이다.
이 라우팅 아키텍처는 실용적인 접근법이다. 자체 모델이 경쟁력 있는 고볼륨 태스크에서 비용 절감을 확보하면서, 프론티어 역량이 가장 중요한 곳에서는 그 접근을 유지한다. 2026년 말까지 대부분의 커모디티 Copilot 태스크는 완전히 MAI 모델에서 실행될 것으로 예상된다.
Turing: 대체됨
2025~2026년 동안 Turing 모델 제품군에는 중요한 업데이트나 신규 릴리스가 없다. MAI 제품군이 프로덕션 워크로드를 인수했다. Turing은 사실상 신규 개발에서 은퇴했다.
전체 스택
Microsoft는 이제 Google과 Apple 외에 모든 레이어를 아우르는 완전한 AI 포트폴리오를 보유한 유일한 기업이다:
- 커스텀 실리콘: Maia 200 가속기(공동 설계를 통한 1.4배 효율 향상)
- 클라우드 프론티어: MAI 제품군(7개 모델)
- 오픈 가중치 엣지: Phi-4 제품군(7개 변형, MIT 라이선스)
- 온디바이스: Aion 1.0 및 Phi Silica
- 비전 기반 모델: Florence-2(MIT 라이선스)
- 오케스트레이션: Copilot 멀티모델 라우팅
- 에이전트 프레임워크: Windows Agent Framework(오픈소스)
엔지니어링 리더에게 주는 의미
실행 가능한 세 가지 핵심 시사점:
Copilot 모델 마이그레이션을 계획하라. MAI-Code-1-Flash가 이번 달 기본 모델이 되며 GPT-4 Turbo 폴백은 11월까지 유지된다. Copilot 통합을 보유하고 있다면 지금 MAI 모델로 테스트하고 11월 창구가 닫히기 전에 폴백 전략을 업데이트하라.
9월 13일 이전에 레거시 Azure Vision API를 마이그레이션하라. Florence-2 기반 Image Analysis 4.0이 대체재다. 30일은 빠듯하다 — 오늘 시작하라.
엣지 및 온프레미스 워크로드에 Phi-4를 평가하라. MIT 라이선스와 다양한 변형 라인업은 완전히 통제 가능한 유능한 AI 모델이 필요한 조직에 Phi-4를 가장 강력한 선택지로 만든다. 15B 파라미터의 reasoning-vision 변형은 온프레미스 비전-리즈닝 에이전트 워크로드에 특히 매력적이다.
MAI 시대는 오는 중이 아니다 — 이미 도래했다. 프로덕션 트래픽이 흐르고 있다. 스택은 완성됐다. 문제는 여러분의 아키텍처가 그에 준비되어 있는가다.
이 분석은 Big Hat Group의 Microsoft AI Weekly 시리즈의 일부다. 지속적인 코멘터리는 x.com/kkaminsk에서 팔로우할 수 있다.