마이크로소프트의 퍼스트파티 AI 모델 전략은 단순히 모델이 출시되는 수준을 넘어, 프로덕션 환경에서 서드파티 모델을 대체하는 단계에 도달했다. 이번 주의 분기점: MAI-Code-1-Flash가 이제 GitHub Copilot 전반의 기본 코딩 모델이 되어 GPT-4 Turbo를 대체했다. 폴백 기간은 3개월로 2026년 11월에 종료된다.
엔지니어링 리더들의 질문은 “마이크로소프트가 자체 모델을 만들 수 있느냐"에서 “워크로드를 얼마나 적극적으로 퍼스트파티 MAI로 옮겨야 하며, GPT-5.6과 Claude를 계속 써야 하느냐"로 바뀌었다. 이번 호에서는 Copilot 라우팅 전환, Aion 1.0 온디바이스 일정, 6일 앞으로 다가온 Azure Vision API 종료, 그리고 오픈웨이트 멀티모달 추론의 새 기준을 조용히 세우고 있는 Phi-4-reasoning-vision을 다룬다.
MAI-Code-1-Flash: Copilot 기본 모델이 퍼스트파티로
MAI-Code-1-Flash는 6월 26일 모든 Copilot 티어(Free부터 Max까지)에서 GA를 달성했고, 2026년 8월 기본 코딩 모델이 되었다. 아키텍처는 스파스 MoE(혼합 전문가) 설계——전체 1,370억 개 파라미터 중 활성 50억 개, 컨텍스트 윈도우 256K——로 VS Code 및 GitHub Copilot CLI 하네스에 최적화되어 있다.
SWE-Bench Pro 51.2%로, 최대 60% 적은 토큰을 사용하면서 Claude Haiku 4.5(35.2%)를 16포인트 차이로 앞선다. 가격: 입력 $0.75/100만 토큰, 출력 $4.50/100만 토큰——서드파티 동급 옵션보다 훨씬 저렴하다. 이 모델은 GitHub Copilot 프로덕션 하네스와 라이선스가 확보된 코드 저장소에서 직접 훈련되었으며, 이것이 에이전틱 코딩 강점의 원천이다.
프로덕션에서 Copilot을 운영하는 팀에게 전환 계획은 중요하다: GPT-4 Turbo는 2026년 11월까지 폴백으로 유지되며, 이후 MAI-Code-1-Flash는 마이크로소프트의 Maia 200 가속기에서만 실행된다. GPT-4 Turbo의 동작에 고정된 프롬프트 엔지니어링이나 평가 파이프라인이 있다면, 지금이 MAI-Code-1-Flash를 대상으로 테스트할 때다.
Copilot 라우팅: MAI로 가는 작업과 서드파티에 남는 작업
블룸버그는 Microsoft 365 Copilot이 이제 Excel 및 Outlook 프롬프트를 MAI 모델로 라우팅한다는 것을 확인했다. 현재 라우팅 구분:
일상 작업——Outlook 이메일 답장 초안 작성, 회의 요약, Excel 수식 생성, VS Code 코딩(MAI-Code-1-Flash), PowerPoint·OneDrive 이미지 생성(MAI-Image-2.5), Teams 전사(MAI-Transcribe-1.5)——은 퍼스트파티 MAI로 라우팅된다. 긴 비정형 문서에 대한 새로운 분석, 복잡한 다단계 추론, 스타일 판단이 필요한 창의적 생성은 여전히 GPT-5.6과 Claude로 라우팅된다. GPT-5.6은 Microsoft 365 Copilot의 선호 모델로 남아 있지만, 경제성이 허용되는 범위에서는 점점 퍼스트파티 쪽으로 기울고 있다.
방향은 명확하다: 2026년 말까지 대부분의 일상적 Copilot 작업이 MAI 모델에서 실행될 것이다. Microsoft 365 Copilot 배포의 API 비용을 예산에 반영한다면, 퍼스트파티 라우팅이 확대될 것이라는 가정으로 모델링하라.
Aion 1.0: 온디바이스 Windows AI의 구체적 일정
Build 2026에서 발표된 Aion 1.0은 마이크로소프트의 “무제한 인텔리전스” 구상이다——클라우드 의존도 제로, 한계 추론 비용 제로. Windows의 온디바이스 모델로 Phi Silica를 대체하며 두 가지 변형으로 제공된다.
Aion 1.0 Instruct는 요약, 재작성, 의도 분류, 접근성을 CPU·GPU·NPU 어디서든 처리한다——전용 하드웨어 불필요. 개발자 미리보기는 지금 Edge Canary 및 Dev 빌드에서 공개 중이다(edge://flags, “Enable prerelease on-device language model”).
Aion 1.0 Plan은 더 무거운 변형이다: 140억 개 파라미터, 32K 컨텍스트, 도구 호출·파일 관리·서브에이전트 오케스트레이션을 포함한 온디바이스 에이전틱 추론용으로 설계되었다. 마이크로소프트가 Build 2026에서 오픈소스화한 Windows Agent Framework를 통해 지원 가능한 Windows 기기에 기본 탑재된다. 하드웨어 요구 사항: 40+ TOPS NPU 탑재 Copilot+ PC(Snapdragon X Elite, Intel Lunar Lake) 또는 NVIDIA RTX 30+ / AMD Radeon RX 9060+ GPU.
일정: 10월 1일 독립 테스트 패키지, 10월 23일 Windows Insiders 롤아웃, 2026년 11월 24일 GA——Phi Silica는 같은 날 소매 기기에서 제거된다. 기존 Phi Silica LoRA 어댑터는 Aion으로 이전할 수 없다——지금 재훈련을 계획하라.
Azure Vision API: 6일 후 하드 종료
이번 주 가장 시급한 사항: 레거시 Azure Vision API(버전 1.0~3.1)는 2026년 9월 13일에 종료된다——소프트 디프리케이션이 아닌 하드 종료다. 이 엔드포인트를 계속 호출하는 모든 애플리케이션은 410 Gone 응답을 받게 된다.
마이그레이션 대상은 Florence-2 기반 Image Analysis 4.0 SDK다. Florence-2는 여전히 마이크로소프트의 비전 파운데이션 모델이다: 단일 가중치 세트로 객체 감지, 세그멘테이션, 캡셔닝, 164개 언어 OCR, 시각적 그라운딩 등 12개 이상의 비전 작업을 처리하는 통합 seq2seq 아키텍처다. large 변형(7.7억 파라미터)은 프로덕션급이며, base 변형(2.3억 파라미터)은 표준 CPU에서 실행된다.
채택 실적이 안정성을 뒷받침한다: 2026년 7월 기준 Hugging Face에서 base 모델 월간 약 266만 건, large 모델 약 81.3만 건의 다운로드. Florence-3 발표는 없다. 9월 13일 이후 Azure에서 새 비전 파이프라인을 구축하는 유일한 지원 경로는 Image Analysis 4.0을 통한 Florence-2다.
Phi-4-Reasoning-Vision-15B: 오픈웨이트 멀티모달의 돌파구
Phi-4-reasoning-vision-15B는 2026년 3월 4일 MIT 라이선스로 출시되어, 올해 가장 중요한 Phi 릴리스가 되었다. Phi-4-reasoning 언어 백본과 SigLIP-2 비전 인코더를 미드퓨전 방식으로 결합하며, 총 약 150억 개 파라미터에 16,384토큰 입력 윈도우를 갖춘다.
가장 눈에 띄는 기능: 동적 추론 활성화. 이 모델은 사고 사슬 추론이 필요한 작업에서만 생각 블록을 출력하고, OCR·캡셔닝·그라운딩 같은 지각 작업에서는 직접 답을 반환한다. 개발자는 think 및 nothink 태그로 동작을 강제할 수 있다. 그 메커니즘: 생각 샘플 20%·비생각 샘플 80%의 혼합 모드 데이터셋.
15B 오픈웨이트 모델로서는 인상적인 벤치마크다: ScreenSpot v2 88.2%(이전 Phi-4-multimodal-instruct는 28.5%), MathVista 75.2, AI2D 84.8, ChartQA 83.3. 훈련은 240대의 NVIDIA B200 GPU와 약 2,000억 개의 엄선된 멀티모달 토큰으로 단 4일 만에 완료됐다.
온프레미스 멀티모달 추론을 평가하는 CTO에게 이 모델은 스위트스팟에 있다: 시각 추론 벤치마크에서 10배 더 큰 모델을 능가하면서도, 단일 팀이 조달할 수 있는 하드웨어에서 실행된다. Florence-2를 대체하는 것이 아니라 보완한다——Florence-2는 고처리량 비전 인프라 레이어이고, Phi-4-reasoning-vision은 그 위의 추론 레이어다.
Phi-Ground-Any-4B: 컴퓨터 사용을 위한 GUI 그라운딩
Phi-Ground-Any-4B는 2026년 5월 마이크로소프트 리서치 아시아가 출시한 40억 파라미터 GUI 그라운딩 모델로, Phi-3.5-vision-instruct에서 파인튜닝되었다. 스크린샷에서 클릭 좌표를 직접 출력하여 컴퓨터 사용 에이전트 파이프라인을 지원하며, 100억 파라미터 미만 클래스에서 패밀리 최고 성적을 기록한다: ScreenSpot-Pro 약 55.0, UI-Vision 36.2.
이 기술은 이미 Windows Copilot의 “Vision Highlighting” 기능에 통합되어 있다. 가중치는 MIT 라이선스로 Hugging Face(microsoft/Phi-Ground-Any)에 공개되어 있으며, 추론에는 약 8GB 이상의 VRAM이 필요하다. 컴퓨터 사용 에이전트를 구축하는 팀이라면, 이것이 벤치마크 대상으로 삼아야 할 오픈웨이트 모델이다.
VibeVoice: 0.5B로 300ms 미만 실시간 TTS
VibeVoice-Realtime-0.5B(MIT 라이선스)는 스트리밍 음성 합성에서 첫 가청 토큰까지의 지연 시간이 300ms 미만이다. 아키텍처는 Qwen2.5-0.5B 백본과 sigma-VAE 음향 토크나이저, 확산 디코딩 헤드를 결합하며, 영어와 9개 추가 언어를 지원한다. 훨씬 작은 규모로 VALL-E 2, Voicebox에 필적한다. 참고: Qwen2.5 백본을 사용하므로 이는 순수한 스크래치 훈련이 아닌 하이브리드 원산지 모델이다——다만 TTS 파이프라인과 훈련은 마이크로소프트의 것이다.
다음 주 주목할 사항
- 9월 13일: 레거시 Azure Vision API 종료——지금 마이그레이션 상태를 확인하라.
- 10월 1일: Aion 1.0 Instruct 독립 테스트 패키지.
- 10월 23일: Aion 1.0 Instruct가 Windows Insiders에 도달.
- 11월 24일: Aion 1.0 GA; Phi Silica는 소매 Windows에서 퇴장.
- 2026년 11월: GPT-4 Turbo 폴백 종료——MAI-Code-1-Flash가 단독 기본 모델로.
패턴은 일관적이다: 마이크로소프트는 클라우드, 엣지, 온디바이스 각 계층에서 서드파티 모델 의존성을 퍼스트파티 대안으로 체계적으로 대체하고 있다. 모델이 항상 프런티어를 선도하는 것은 아니다——독립 테스트에서는 MAI-Thinking-1이 DeepSeek V3.2급으로 평가된다——하지만 경제성과 통합 깊이는 구조적 우위가 되어가고 있다. 엔지니어링 팀의 현실적인 자세는 일상적 워크로드에는 지금 MAI 모델 평가를 시작하고, 측정 가능한 품질 차이가 프리미엄을 정당화하는 작업에는 서드파티 프런티어 모델을 유지하는 것이다.
이 모델들의 출시 동향에 대한 실시간 분석은 https://x.com/kkaminsk에서 팔로우하라.