이틀 만에 두 건의 출시다. MAI-Code-1.1-Flash는 8월 11일, 전작 대비 75% 비용 절감과 새로운 이미지 입력 지원을 갖춰 출시됐다. MAI-Image-2.6은 8월 10일 Arena 텍스트-이미지 리더보드에서 Google, Meta, xAI를 제치고 2위에 올랐다. 두 모델 모두 마이크로소프트 자체(first-party) 모델로, 사내에서 학습하고 Copilot을 통해 라우팅되며 Azure Foundry와 GitHub Copilot 등급 전반에서 사용할 수 있다.
신호는 명확하다. MAI 패밀리는 품질을 개선하는 동시에 비용에 민감한 워크로드에서 서드파티 모델을 대체할 수 있을 만큼 빠르게 반복 진화하고 있다.
MAI-Code-1.1-Flash: 더 빠르게, 더 저렴하게, 멀티모달
핵심 수치는 극적이다. (6월 Build 2026에서 출시된) MAI-Code-1-Flash와 비교해 1.1 버전은 다음을 제공한다:
- 75% 비용 절감: $0.20/1M 입력, $0.02/1M 캐시, $1.20/1M 출력 — 기존 $0.75/$0.075/$4.50에서 인하
- 토큰 스트리밍 25% 향상 및 작업당 토큰 25% 감소
- Terminal-Bench 2.1에서 +22% (GitHub Copilot CLI): 51.7% → 62.9%
- .NET 작업에서 +15%, 코드 생존율 +4%, 재방문 +9%
- SWE-Bench Verified 72.6%, 해결 작업당 평균 8.6K 토큰
- 이미지 입력 — MAI-Code 라인 최초로, 스크린샷-투-코드 워크플로우 지원
아키텍처는 희소 MoE로 총 138B / 활성 ~5B, 256K 컨텍스트와 128K 최대 출력, 2M 합성 작업과 150K RL 환경으로 학습됐다. 이제 Free부터 Enterprise까지 모든 GitHub Copilot 등급(Business/Enterprise는 관리자 옵트인 필요)의 프로덕션 모델이다. MAI-Code-1-Flash는 9월 10일 지원이 종료되며, GPT-4 Turbo 폴백은 11월까지 운영된다. Azure Foundry를 통해 MAI-Code를 직접 호출한다면 지금 엔드포인트를 업데이트하라.
MAI-Image-2.6: Arena에서 OpenAI 추격
MAI-Image-2.6은 8월 10일 출시와 동시에 텍스트-이미지 Arena 리더보드에서 2위를 차지했다 — OpenAI 뒤, 그 외 모든 경쟁자보다 앞선다. MAI-Image-2.5 대비 개선 폭은 광범위하다: 전체 +79 Elo, 텍스트 렌더링 부문 +91 Elo, 향상된 인물 사진, 3D 이미지, 포토리얼리스틱 상업용 출력.
현재 Arena에서 사용 가능하며, MAI Playground, Foundry 및 기타 표면은 앞으로 몇 주에 걸쳐 출시된다. 마이크로소프트는 2.x 라인 전반에서 API 호환성을 유지해 MAI-Image-2.5($47/1M) 또는 Flash($19.50/1M)에서의 업그레이드 경로가 단순하다. 실질적 의미: 마이크로소프트 내부 데이터에 따르면 프로덕션에서 GPT-Image-2 대비 GPU 비용이 84% 절감된다. 대규모 이미지 생성에서 이는 무시할 수 없는 비용 항목이다.
MAI-Thinking-1: 공개 미리보기, 독립 벤치마크는 아직
플래그십 추론 모델(총 ~1T / 활성 ~35B 희소 MoE, 256K 컨텍스트)이 8월 12일 Azure Foundry에서 공개 미리보기에 들어갔다. 마이크로소프트 발표 벤치마크는 여전히 인상적이다: AIME 2025 97.0%, AIME 2026 94.5%, SWE-Bench Pro 52.8%, Surge를 통한 1,276개 작업에서 Claude Sonnet 4.6에 대한 블라인드 선호도 승리.
하지만 독립 벤치마크는 아직 드물다. Foundry의 공개 미리보기는 API 접근이 가능하다는 뜻이므로, 도입을 결정하기 전에 직접 벤치마크를 실행하라.
Phi-4: 엣지 스토리의 성숙
Phi-4 패밀리는 이제 3.8B부터 15B까지 10개 이상의 MIT 라이선스 변형을 갖췄다. 이번 주 주요 변화:
Azure AI Studio 통합(7월 25일)으로 Phi-4가 128K 컨텍스트와 Azure ML 파인튜닝을 갖춰 클라우드에 제공된다 — 동일 모델을 온디바이스와 클라우드에서 실행하는 하이브리드 배포에 실용적이다.
Phi-4-mini-flash-reasoning은 SambaY 아키텍처(Mamba 상태 공간 + 슬라이딩 윈도우 어텐션 + Gated Memory Units)를 사용해 Phi-4-mini-reasoning 대비 10배 처리량과 2-3배 지연 시간 개선을 제공한다. 엣지 AI 로드맵에 비-트랜스포머 아키텍처가 반영되지 않았다면 주목할 만하다.
Phi-4-reasoning-vision-15B(2026년 3월)는 이제 신규 멀티모달 추론 워크로드에 권장된다 — GUI 그라운딩 기준 ScreenSpot v2 88.2%, 이중 추론 모드, 추론이 필요한 곳에서 Florence-2의 효과적인 대체재다.
Florence-2: 하드 데드라인까지 28일
레거시 Azure Vision API(v1.0–3.1)는 2026년 9월 13일에 폐지된다 — 오늘로부터 28일 남았다. 조직은 Florence-2 기반 Image Analysis 4.0 SDK로 마이그레이션해야 한다. 이는 유연한 지원 종료가 아닌 하드 컷오프다.
Florence-3는 발표되지 않았다. 전략: 순수 비전은 Florence-2에 유지하고, 추론+비전은 Phi-4-reasoning-vision-15B로 이동한다. 둘 다 MIT 라이선스이며, LoRA 파인튜닝은 특수 데이터셋에서 98% 이상의 정밀도를 보여준다.
Aion 1.0: Phi Silica의 일몰
Aion 1.0 Instruct는 개발자 미리보기(Edge Canary/Dev 150.0.4070+) 상태이며 Windows 온디바이스 모델로 Phi Silica를 대체할 예정이다. 전환 타임라인:
- 10월 1일: 독립형 Aion Instruct 테스트 패키지
- 10월 23일: Windows Insider 배포(Phi Silica 유지, CFR로 모델 선택)
- 11월 24일: GA — Aion Instruct가 프로덕션이 되고 Phi Silica는 소매 디바이스에서 제거
Aion 1.0 Plan(14B, 32K 컨텍스트)은 더 야심 찬 릴리스다 — Windows Agent Framework를 통한 도구 호출과 서브에이전트 오케스트레이션을 갖춘 온디바이스 에이전트 런타임으로, 40 TOPS 이상의 NPU 또는 적격한 개별 GPU가 필요하다. 중요한 점은 Aion Instruct는 Phi Silica와 달리 LAF 토큰을 요구하지 않는다는 것 — 개발자에게 실질적인 마찰 요소를 제거한다. Phi Silica는 PowerToys v0.101(8월 10일)에서 마지막 업데이트를 받았지만, 지금 Phi Silica로 빌드 중이라면 지금 Aion 마이그레이션 계획을 시작하라.
Copilot 라우팅 현실 점검
CNBC는 8월 5일 마이크로소프트가 사내 직원용 GitHub Copilot 기본 모델을 OpenAI GPT-5.6 Sol로 설정하면서 MAI 모델을 옵션으로 제공하고 있다고 보도했다. 이는 모순이 아니라 설계대로 작동하는 전략이다. Copilot의 작업 분류 레이어는 비용 효율성을 위해 일반(commodity) 작업을 MAI 모델로 라우팅하고, 복잡한 추론과 창의적 생성은 프론티어 모델로 보낸다. 핵심: 자체 모델은 대규모 비용 민감 작업에서 승리하고, 프론티어 모델은 복잡한 추론에서 승리한다. 아키텍처는 둘 다 지원해야 한다 — Copilot의 라우팅 레이어는 이미 이를 자동으로 수행한다.
실행 항목
- MAI-Code 배포 업데이트: Azure Foundry로 MAI-Code를 호출한다면 v1.0의 9월 10일 지원 종료 전에 1.1-Flash로 마이그레이션하라.
- MAI-Image-2.6 평가: 대규모 이미지 생성 — 현재 공급업체와 벤치마크를 비교하라. 비용 스토리가 설득력 있다.
- MAI-Thinking-1 자체 벤치마크 실행: 공개 미리보기가 Foundry에서 운영 중이다. 공급업체 발표 수치에 의존하지 말라.
- Florence-2 마이그레이션: 9월 13일 데드라인. 28일 남았다. 지금 옮겨라.
- Aion 마이그레이션 계획: Phi Silica로 빌드 중이라면 10월 1일 테스트 패키지까지 4주 남았다. LoRA 학습 데이터를 준비하라.
- Copilot 라우팅 가정 검토: Copilot 의존성 계획은 모든 것을 OpenAI로 가정하지 말고 MAI/서드파티 분할을 반영해야 한다.
마이크로소프트의 자체 스택은 커스텀 실리콘(Maia 200), 클라우드 모델(MAI), 오픈웨이트 엣지 모델(Phi-4), 온디바이스 모델(Aion), 비전 파운데이션(Florence-2), 오케스트레이션(Copilot)을 아우른다. 일주일 만에 두 건의 주요 모델 출시 — 이제 더 이상 연구 프로젝트가 아니다. 프로덕션 플랫폼이다.
이 글은 Microsoft AI Weekly 시리즈의 일부입니다. 지속적인 분석은 x.com/kkaminsk에서 확인하세요.