지난 주에는 Bloomberg가 Microsoft가 프로덕션 Office 워크로드를 자체 MAI 모델로 라우팅하고 있다는 사실을 확인한 것을 다루었습니다. 이번 주, 그 그림은 더 명확해졌습니다: Microsoft의 자체 AI 스택은 더 이상 비전이 아닙니다. 배포되었고, 가격이 책정되었으며, 디바이스부터 클라우드까지 완전한 수직적 아키텍처로 구성되었습니다. CTO와 엔지니어링 리더들에게 질문은 “Microsoft의 모델이 준비되었는가?“에서 “하나의 벤더가 실리콘, 모델, 애플리케이션을 모두 통제하는 스택을 중심으로 어떻게 아키텍처를 설계할 것인가?“로 바뀌었습니다.

완전한 자체 스택

Microsoft는 이제 Google과 Apple 외에 유일하게 풀스택 AI 포트폴리오를 운영하는 기업입니다. 2026년 7월 현재 아키텍처는 다음과 같습니다:

온디바이스 (Aion 1.0): 요약, 재작성, 의도 분류를 위한 경량 추론 — Edge와 Windows 내부의 CPU, GPU 또는 NPU에서 실행됩니다. 14B 매개변수의 Aion 1.0 Plan 변형은 Windows Agent Framework를 통한 도구 호출 및 서브에이전트 오케스트레이션으로 에이전트 워크플로우를 처리합니다. 이번 달에 Hugging Face에서 오픈 웨이트가 공개될 예정입니다.

엣지 (Phi-4 패밀리): 3.8B에서 15B 매개변수에 이르는 10개의 MIT 라이선스 모델. Phi-4-mini는 Raspberry Pi 5에서 실행됩니다. Phi-4-mini-flash-reasoning은 SambaY 하이브리드 아키텍처(Mamba + 슬라이딩 윈도우 어텐션 + Gated Memory Units)를 사용하여 10배의 처리량 향상을 달성합니다. Phi-4-reasoning-vision-15B는 SigLIP-2 비전 인코더로 멀티모달 추론을 처리합니다.

클라우드 프론티어 (MAI 패밀리): Build 2026에서 발표된 7개 모델로, 추론(MAI-Thinking-1), 에이전트 코딩(MAI-Code-1-Flash), 이미지 생성(MAI-Image-2.5 및 Flash), 음성-텍스트 변환(MAI-Transcribe-1.5), 텍스트-음성 변환(MAI-Voice-2 및 Flash)을 포괄합니다. 모두 상용 라이선스 데이터로 처음부터 학습되었으며 서드파티 모델로부터의 증류는 전혀 없습니다.

실리콘 (Maia 200): 3nm 공정, 140B 트랜지스터, 216GB HBM3e. 현재 프로덕션에서 MAI 추론을 실행 중입니다. MAI-Code-1-Flash는 2026년 8월까지 Maia 200으로 완전히 마이그레이션될 예정입니다.

파운데이션 모델 (MAI-1-preview): Microsoft의 최초 엔드투엔드 학습 파운데이션 모델로, 현재 LMArena에서 테스트 중입니다. 공개 정보는 제한적이지만, Microsoft가 작업 특화 모델이 아닌 프론티어 모델 수준에서 경쟁하겠다는 의도를 보여줍니다.

이는 개별 솔루션의 모음이 아닙니다. 각 계층이 다음 계층을 지원하는 의도적인 아키텍처 스택입니다.

Copilot의 라우팅 아키텍처 내부

지난 2주간 전략적으로 가장 중요한 세부 사항은 모델 릴리스가 아니라 — Microsoft 365 Copilot이 트래픽을 라우팅하는 방식의 공개입니다. Copilot은 단일 모델 제품이 아닙니다. 모델 선택 전에 각 상호작용을 작업 유형, 복잡도, 품질 요구사항별로 분류하는 작업 분류 계층을 사용합니다.

MAI로 라우팅되는 항목 (자체, 대용량):

  • 스레드 컨텍스트에서 이메일 답장 초안 작성 (Outlook)
  • 스레드 및 회의 요약
  • 자연어에서 스프레드시트 수식 생성 (Excel)
  • 제목 및 헤더 생성
  • 고정 형식 문서에서 구조화된 데이터 추출
  • 회의 녹취록에서 작업 및 액션 아이템 추출
  • VS Code 및 GitHub Copilot CLI에서 에이전트 코딩 (MAI-Code-1-Flash)
  • PowerPoint 및 OneDrive에서 이미지 생성 및 편집 (MAI-Image-2.5)

프론티어 서드파티 모델로 라우팅되는 항목:

  • 긴 비구조화 문서에 대한 새로운 분석
  • 복잡한 종속성이 있는 다단계 추론
  • 문체적 판단이 필요한 창의적 생성
  • 오류 비용이 높은 민감하거나 모호한 작업

라우팅은 동적입니다. MAI 모델이 개선됨에 따라 라우팅 범위가 확장됩니다. Microsoft에는 자체 모델로 더 많은 트래픽을 이전할 모든 인센티브가 있습니다 — Maia 200에서 MAI로 라우팅되는 각 쿼리는 OpenAI나 Anthropic에 지불하는 토큰당 마진을 제거합니다.

특히, 6월 16일 출시된 Microsoft의 자율 에이전트 제품인 Copilot Cowork은 MAI가 아닌 Anthropic Claude(Opus 4.8 및 Sonnet 4.6)에서 실행됩니다. Microsoft 자체의 Cowork 1 파인튜닝 모델이 발표되었지만 아직 에이전트를 구동하지는 않습니다. 이는 정직한 신호입니다: MAI 모델은 상용 추론용으로 프로덕션 준비가 되었지만, Microsoft는 프론티어 서드파티 모델이 여전히 우위를 점하는 영역을 인정합니다.

MAI 가격: 단위 경제학 스토리

Microsoft는 Foundry에서 MAI 모델의 가격을 공개했으며, 비용 모델링을 수행하는 모든 팀이 이 수치를 검토할 가치가 있습니다:

  • MAI-Transcribe-1: 음성 1시간당 $0.36 (43개 언어, FLEURS 기준 WER 4.86% — 모든 경쟁사 중 최저)
  • MAI-Voice-1: 100만 자당 $22 (15개 이상 언어, 음성 적응 및 감정 제어 지원)
  • MAI-Image-2.5: 100만 텍스트 입력 토큰당 $5, 100만 이미지 입력 토큰당 $8, 100만 이미지 출력 토큰당 $47
  • MAI-Code-1-Flash: Claude Haiku보다 저렴한 위치에서 SWE-Bench Pro 51.2% 점수(Haiku의 35.2% 대비) 및 60% 적은 토큰 사용

가격 패턴은 공격적입니다. Microsoft는 MAI를 서드파티 대안과 동등하게 가격을 책정하는 것이 아니라 — 특정 벤치마크에서 더 나은 성능을 주장하면서 그보다 낮게 가격을 책정하고 있습니다. 대용량 워크로드(전사, 이미지 생성, 코드 완성)의 경우, 비용 차이는 빠르게 누적됩니다.

배포 스토리도 중요합니다. MAI 모델은 Microsoft Foundry, MAI Playground(무료 웹 테스트), 그리고 주목할 점으로 — OpenRouter, Fireworks AI, Baseten에서도 사용 가능합니다. 이는 Microsoft가 비Azure 추론 플랫폼에 자체 모델을 출시한 최초의 사례입니다. 다른 클라우드 제공업체에 종속된 엔터프라이즈 팀은 이제 Azure 약정 없이도 MAI 모델에 액세스할 수 있습니다.

Florence-2: 성능보다 안정성

Phi-4-reasoning-vision-15B가 멀티모달 후속작으로 헤드라인을 장식하는 동안, Florence-2는 순수 컴퓨터 비전을 위한 엔터프라이즈 워크호스로 계속 사용됩니다. 로드맵에 Florence-3은 없습니다. 대신 Microsoft는 생태계 성숙도에 투자하고 있습니다: 로컬 ONNX 실행을 위한 C#/.NET NuGet 패키지, 실시간 엣지 비디오 분석을 위한 NVIDIA DeepStream 통합, 그리고 164개 언어 OCR을 지원하는 Azure AI Vision Image Analysis 4.0 SDK.

Florence-2의 통합 프롬프트 기반 아키텍처 — 하나의 가중치 세트로 텍스트 프롬프트를 통해 12개 이상의 비전 작업을 처리 — 는 아키텍처적으로 우아합니다. 프로덕션 CV 파이프라인을 구축하는 팀에게 선택은 명확합니다: 경량 고처리량 비전 작업에는 Florence-2, 언어 생성 및 사고의 사슬이 필요한 멀티모달 추론에는 Phi-4-reasoning-vision-15B.

Phi-4의 밀도 전략

Phi-4 패밀리는 엣지 AI를 평가하는 엔지니어링 리더의 특별한 주의가 필요합니다. 핵심 논지는 밀도입니다 — 14B 모델이 수학 및 코드 벤치마크에서 70B급 모델과 경쟁합니다.

Phi-4-reasoning-plus는 AIME 2025에서 82.5%를 기록하여 크기의 5분의 1인 DeepSeek-R1-Distill-Llama-70B와 경쟁력을 보입니다. Phi-4-mini(3.8B)는 200K 토큰 어휘와 22개 이상 언어의 네이티브 함수 호출로 MMLU에서 많은 8B급 모델을 능가합니다. SimpleQA의 주의사항이 중요합니다 — Phi-4는 사실 회상에서 3.0점에 불과하여 검색 보강 없이는 일반 지식 어시스턴트로 부적합합니다.

Phi-4-mini-flash-reasoning의 아키텍처 혁신이 돋보입니다. Mamba 상태 공간 모델, 슬라이딩 윈도우 어텐션, Gated Memory Units를 결합한 SambaY 아키텍처는 바닐라 Transformer에서의 진정한 이탈을 나타냅니다. 2-3배 낮은 지연 시간에서 10배의 처리량 향상은 점진적 최적화가 아닙니다. 엣지 AI의 배포 경제학을 바꾸는 종류의 아키텍처 전환입니다.

엔터프라이즈 전략에 대한 시사점

이번 분기에 인프라 결정을 내리는 CTO를 위한 세 가지 시사점:

1. 벤더 종속성 계산이 변했습니다. Microsoft의 수직 통합 — 실리콘부터 모델, 애플리케이션까지 — 는 역사적으로 종속성 우려의 대상이었습니다. 2026년에는 비용 절감 전략입니다. Maia 실리콘의 MAI 모델은 서드파티 마진을 제거합니다. 질문은 비용 절감이 아키텍처 약정을 정당화하는지 여부입니다.

2. 모델 평가는 워크로드별로 이루어져야 합니다. Copilot 내부의 Microsoft 라우팅 아키텍처가 템플릿입니다. 모든 작업에 하나의 모델을 표준화하지 마십시오. 상용 추론(요약, 구조화된 추출, 수식 생성)은 MAI와 같은 비용 효율적인 모델로 라우팅하십시오. 복잡한 추론은 프론티어 모델로 라우팅하십시오. 절감은 모델 선택이 아닌 라우팅에서 발생합니다.

3. 오픈 웨이트 Phi-4 패밀리는 가장 안전한 엣지 베팅입니다. MIT 라이선스, 10개 이상의 변형, Raspberry Pi부터 NVIDIA Jetson까지 모든 것에서 실행. 벤더 종속 없음, 라이선스 위험 없음, 크기의 5배 모델과 경쟁. 로컬 추론을 배포하는 팀에게 — 비용, 지연 시간, 또는 데이터 주권을 위해 — Phi-4가 기본 선택입니다.

2026년 Microsoft의 AI 전략은 OpenAI나 Anthropic을 따라잡는 것이 아닙니다. Microsoft가 모든 계층을 통제하는 완전하고 수직적으로 통합된 스택을 구축하는 것입니다. 모델은 준비되었습니다. 실리콘도 준비되었습니다. 엔터프라이즈 구매자에게 질문은 통합 프리미엄이 유연성 트레이드오프의 가치가 있는지 여부입니다.

X에서 최신 동향을 팔로우하세요: https://x.com/kkaminski