마이크로소프트의 제1자 AI 모델 플라이휠이 이제 자가 강화 단계에 들어섰다. 이번 주의 증거: MAI-Transcribe-2가 FLEURS 60개 언어 테스트에서 평균 단어 오류율(WER) 5.2%로 1위, MAI-Image-2.6이 Arena 텍스트-이미지 리더보드에서 데뷔 즉시 2위, MAI-Code-1.1-Flash가 GitHub Copilot의 기본 코딩 모델이 되었으며 — 이전 세대 대비 75% 비용 절감. 동시에, 한 세대의 비전 파이프라인을 지탱했던 구형 Azure Vision API는 9월 13일부터 410 Gone을 반환하고 있다.

엔지니어링 리더에게 전략적 그림은 명확해지고 있다. 마이크로소프트는 더 이상 제1자 모델을 제3자 옵션의 대안으로 출시하는 것이 아니라 — 프로덕션 트래픽을 기본적으로 제1자 모델로 라우팅하고, 공격적인 가격으로 경쟁을 억제하며, 경쟁 경로가 의존하는 인프라를 단계적으로 폐지하고 있다. 이번 호에서는 지난 2주간 출시된 3개의 MAI 모델, Copilot의 제1자 라우팅 전환, Azure Vision API 폐지의 영향, 그리고 Windows 팀이 지금 계획해야 하는 Aion 전환 타임라인을 다룬다.

MAI-Transcribe-2: 가장 빠르고, 가장 저렴하고, 가장 정확한 음성 인식

MAI-Transcribe-2는 2026년 9월 3일 퍼블릭 프리뷰에 진입했으며, 마이크로소프트의 주장은 대담하다: FLEURS 60개 언어에서 1위 · 평균 WER 5.2%, Artificial Analysis AA-WER 2위 · WER 2.0%, 속도는 GPT-Transcribe의 약 10배, Scribe v2의 7배, Gemini 3.5 Transcribe의 5배. 가격은 공격적: 오디오 1시간당 $0.10, 2026년 말까지 한정 가격.

이 모델은 화자 분리와 단어 수준 타임스탬프를 네이티브로 지원 — 후처리 파이프라인이 불필요. 대규모 전사 워크로드(콜센터 분석, 회의 기록, 미디어 인덱싱)를 실행하는 팀에게 경제적 의미가 크다. $0.10/시간으로 계산하면 10,000시간 오디오 전사에 $1,000 — 동급 클라우드 음성 API 비용의 극히 일부. 단일 모델로 60개 언어를 커버하여 기존 파이프라인을 괴롭히는 멀티모델 라우팅 복잡성을 제거한다.

주의사항: 이들은 마이크로소프트 자가 보고 벤치마크 결과. API 접근이 확대됨에 따라 독립 검증이 뒤따를 것이다. 단, 가격은 Microsoft Foundry에서 오늘 직접 확인 가능하며, 성능 주장은 MAI-Transcribe-1 및 1.5의 궤적과 일치한다.

MAI-Image-2.6: Arena 2위, GPU 비용 84% 절감

MAI-Image-2.6은 2026년 8월 10일 출시, 9월 4일 전체 공개. 핵심 수치: Arena 텍스트-이미지 리더보드 2위(버전 2.5 대비 +79 Elo), Artificial Analysis 이미지 편집 1위. Flash 변형은 GPT-Image-2-Medium 대비 2.8배 빠르고 72% 더 효율적.

비용 측면이 프로덕션 배포에서 가장 주목할 점. 마이크로소프트는 프로덕션 워크로드에서 GPT-Image-2 대비 GPU 비용 84% 절감을 보고했다. 이 모델은 다중 이미지 참조 편집, 웹 그라운딩 기반 사실 확인 이미지 생성, 동적 종횡비를 지원 — 이전에는 별도 파이프라인이 필요했던 기능들.

Microsoft Foundry 가격: MAI-Image-2.5 티어는 $19.50(Flash), $47(표준), $106(Pro) 백만 이미지 출력당. 대규모로 이미지를 생성하는 조직 — 마케팅 팀, 이커머스 카탈로그, 콘텐츠 제작 — 에게 GPU 비용 절감은 인프라 지출에 직접 반영된다. 이미지 편집 능력이 Arena에서 5위에서 3위로 상승(+19 Elo)한 것은 이것이 단순한 생성 모델이 아니라 신뢰할 수 있는 편집 도구임을 의미한다.

MAI-Code-1.1-Flash: 비용 75% 절감, Copilot 전 티어 기본 모델

MAI-Code-1.1-Flash는 2026년 8월 11일 일반 출시, 즉시 전 티어(Free~Max)에서 GitHub Copilot의 기본 코딩 모델이 되었다. 가격: 입력 $0.20/백만 토큰, 출력 $1.20/백만 토큰, 원래 MAI-Code-1-Flash 대비 75% 비용 절감. 토큰 스트리밍 25% 향상, 작업당 토큰 소비 25% 감소, 이미지 입력으로 다이어그램-코드 변환 시나리오 지원.

이전 세대 MAI-Code-1-Flash는 2026년 9월 10일 폐지. 해당 모델을 대상으로 한 고정 프롬프트나 평가 하네스는 1.1-Flash로 마이그레이션해야 한다. GPT-4 Turbo는 폴백 옵션으로 2026년 11월까지 사용 가능, 이후 MAI-Code-1.1-Flash는 마이크로소프트의 Maia 200 가속기에서만 실행.

라우팅 현실: Bloomberg가 Microsoft 365 Copilot에서 Excel과 Outlook 프롬프트를 MAI 모델로 라우팅하는 것을 확인. Copilot은 단일 모델이 아니다 — 작업 분류 라우터를 가진 오케스트레이션 레이어. 이메일 작성, 요약, Excel 수식 생성, 구조화 데이터 추출은 MAI로 라우팅. 에이전트 코딩은 MAI-Code-1.1-Flash로. 이미지 생성은 MAI-Image-2.5 및 2.6으로. Teams 전사는 MAI-Transcribe로. 보안 스캔은 MAI-Cyber-1-Flash로. 복잡한 다단계 추론과 스타일 판단이 필요한 크리에이티브 생성만 여전히 제3자 프론티어 모델로 라우팅.

아키텍처 계획에 대한 시사점: 제1자 라우팅이 확대된다는 전제로 예산을 편성. 마이크로소프트는 2026년 말까지 대부분의 일상적 Copilot 작업이 MAI에서 실행될 것으로 예측.

Azure Vision API 폐지: 어제부터 410 Gone

2026년 9월 13일은 구형 Azure Vision API(버전 1.0~3.1)의 하드 폐지일이었다. 이 엔드포인트를 호출하는 애플리케이션은 이제 410 Gone 응답을 받는다. 이는 소프트 폐지가 아니다 — 단계적 감소도, 연장 유예 기간도 없다.

마이그레이션 대상은 Florence-2 기반 Image Analysis 4.0 SDK. Florence-2는 여전히 마이크로소프트의 비전 파운데이션 모델: 통합된 sequence-to-sequence 아키텍처로 단일 가중치 세트로 12개 이상의 비전 작업을 처리 — 감지, 분할, 캡셔닝, 밀집 영역 캡셔닝, 시각적 그라운딩, 164개 언어의 OCR. 대형 변형(7.71억 파라미터)은 프로덕션급, 베이스 변형(2.32억)은 표준 CPU에서 실행. 둘 다 MIT 라이선스로 Hugging Face에 게시, 월간 다운로드는 각각 약 266만과 81.3만.

Florence-3 계획은 없다. 마이크로소프트는 비전 파운데이션 계층에서 릴리스 속도보다 안정성을 우선한다. Image Analysis 4.0 자체는 2028년 9월 25일 폐지 예정 — 팀에 2년의 계획 창을 제공.

아직 마이그레이션하지 않았다면, 이는 프로덕션 영향 중단. 지금 즉시 애플리케이션에서 구형 비전 엔드포인트 호출 잔여를 감사.

Aion 1.0: Phi Silica 전환 타임라인

Aion 1.0은 Phi Silica를 대체하는 온디바이스 모델로, Build 2026에서 발표. 두 가지 변형: Aion 1.0 Instruct(요약, 재작성, 인텐트 분류용 경량 SLM — CPU, GPU 또는 NPU에서 실행, 전용 하드웨어 불필요)와 Aion 1.0 Plan(140억 파라미터, 32K 컨텍스트, Windows Agent Framework를 통한 온디바이스 에이전트 추론용).

전환에 명확한 날짜가 있다:

  • 2026년 10월 1일: 독립 Aion Instruct 테스트 패키지, LoRA 훈련 지원 포함.
  • 2026년 10월 23일: Windows Insiders 롤아웃 — Phi Silica와 Aion 공존, Controlled Feature Rollout로 디바이스별 활성 모델 선택.
  • 2026년 11월 24일: 일반 출시 — Aion Instruct가 프로덕션 모델이 되고 Phi Silica는 리테일 디바이스에서 제거.

중요 계획 사항: 기존 Phi Silica LoRA 어댑터는 Aion으로 전환할 수 없다. 팀이 커스텀 Phi Silica 파인튜닝에 투자한 경우, 지금 재훈련을 시작하라. LanguageModel API와 ImageDescription API의 호환성은 유지되지만 기반 모델 가중치는 다르다. 최종 GPU 호환성 목록과 필요한 NVIDIA 드라이버 버전은 아직 미공개 — 10월 날짜 전까지 주시.

Phi-4: 오픈 웨이트 주력은 계속된다

MAI가 클라우드 프론티어를 주도하는 동안, Phi-4는 여전히 마이크로소프트의 엣지 및 IoT용 오픈 웨이트 소형 언어 모델 패밀리. 최신 릴리스 Phi-4-reasoning-vision-15B(2026년 3월)는 Phi-4-reasoning 백본과 SigLIP-2 비전 인코더를 결합한 멀티모달 추론 모델 — 150억 파라미터, MIT 라이선스, 동적 사고 활성화. Phi-4-mini는 2026년 7월 Windows 12 Copilot+ PC에 탑재, Snapdragon X Elite에서 약 3GB VRAM으로 오프라인 코드 완성과 로컬 이미지 편집을 42 토큰/초로 구현.

Phi 패밀리의 실력 이상의 성능은 계속: Phi-4(140억 파라미터)는 수학과 추론 벤치마크에서 자신의 5배 크기 모델을 능가. 이는 파라미터 수가 아닌 합성 데이터 품질과 정제된 훈련 커리큘럼에서 비롯. 온프레미스 또는 에어갭 환경이 필요한 팀에게 Phi-4는 여전히 벤치마크.

Turing: 폐지된 것으로 취급

Turing 모델 패밀리는 2025~2026년에 의미 있는 업데이트가 없다. MAI가 Turing이 서비스하던 모든 프로덕션 워크로드를 흡수. 아키텍처 다이어그램에 여전히 Turing 모델이 있다면, 그 다이어그램은 역사적 문서 — 교체를 계획하라.

다음 주 주목

  • 10월 1일: Aion 1.0 Instruct 독립 테스트 패키지.
  • 10월 23일: Aion 1.0 Instruct Windows Insiders 도달.
  • 11월 24일: Aion 1.0 일반 출시; Phi Silica 리테일 Windows에서 제거.
  • 2026년 11월: GPT-4 Turbo 폴백 종료 — MAI-Code-1.1-Flash가 유일한 기본.
  • 워치리스트: MAI-Realtime(전이중 음성)이 MAI Playground에서 발견되었으나 공식 발표 없음 — 출시 임박 가능성. MAI-Thinking-1 독립 벤치마크는 더 넓은 API 접근 대기.

마이크로소프트의 제1자 플라이휠은 자체 모멘텀으로 회전: 새 모델, 공격적 가격, Copilot 기본 라우팅, 경쟁 인프라의 하드 폐지일. 엔지니어링 팀의 실용적 입장은 지금 일상적 워크로드에 MAI 모델 평가를 시작하는 것 — 경제성과 통합 깊이는 마이크로소프트 플랫폼에서 제3자 대안이 필적할 수 없는 구조적 우위가 되고 있다.

이 모델들이 출시될 때의 실시간 분석은 https://x.com/kkaminsk에서 팔로우.