2026년 7월 29일 주간을 지배한 단 한 건의 사건은 8월 4일 열린 스페이스X의 첫 공개 실적 발표였습니다. 이 발표는 SpaceXAI 시대의 재무적 메커니즘을 낱낱이 드러냈습니다. 일론 머스크는 이 자리에서 공격적인 Grok 로드맵을 제시했습니다 — 다음 주 Grok 4.6, 3~4주 내 Grok 4.7, 그리고 연말 이전 Grok 5는 스페이스X의 역사적 데이터 전체 코퍼스로 학습됩니다. 실적 발표의 조명 밖에서도 Grok Voice Think Fast 2.0이 프로덕션 마이그레이션을 완료했고, Grok Imagine Video 1.5는 텍스트-비디오 생성과 네이티브 1080p 출력을 추가하는 대규모 기능 업데이트를 출시했습니다.
이번 주 중요했던 개발 사항에 대한 전문가 분석입니다.
스페이스X 첫 실적 발표: 매출 78억 달러, AI 25.6억 달러, 자본 지출 184억 달러
스페이스X는 2026년 8월 4일 첫 분기 실적 발표를 열었습니다 — 6월 12일 SPCX 티커로 IPO한 이후 처음으로 공개된 재무 공시였습니다. 수치는 충격적이었습니다:
- 2026년 2분기 매출: 78억 달러, 전년 동기 대비 92% 증가, 애널리스트 컨센서스(약 68억~69억 달러)를 상회
- AI 부문 매출: 25.6억 달러, 전년 동기 대비 247% 증가, xAI 및 Grok 구독 포함
- 조정 EBITDA: 35억 달러, 전년 동기 대비 191% 증가
- 순손실: 5.41억 달러, 1년 전 약 10억 달러에서 축소
- 자본 지출: 단일 분기에 184억 달러, 1년 전 28억 달러에서 약 7배 증가 — 대부분 AI 인프라가 견인
시장의 반응은 부정적이었습니다. 주가는 시간 외 거래에서 약 7% 하락했으며, 주로 자본 지출 수치 때문이었습니다. 이틀 후인 8월 6일, 락업(lockup) 만료로 약 10억 주의 내부자 보유 주식이 풀리게 됩니다 — 월요일 종가 기준 약 1,064억 달러 규모이며, 이후 2026년 12월까지 100%가 해제될 때까지 2주마다 추가 트랜치가 풀립니다.
AI, 공식 사업 부문으로 자리매김
스페이스X는 이제 Space(발사), Connectivity(Starlink), AI 세 개의 부문을 보고합니다. AI 부문 — xAI, Grok 구독, 컴퓨팅 임대를 포괄 — 은 단일 분기에 25.6억 달러를 창출했습니다. 연율로 환산하면 약 100억 달러 이상의 AI 매출로, SpaceXAI의 AI 사업은 기존 기업용 AI 벤더들과 비슷한 매출 규모에 올라섰습니다.
스페이스X의 사장 겸 COO 귀네 쇼트웰은 이번 발표에서 7월 Grok 4.5 출시 이후 토큰 소비가 3배로 증가했다고 밝혔습니다. 이 지표 — 원시 모델 사용량 — 은 Grok 채택이 실질적으로 가속화되고 있다는 xAI가 지금까지 공유한 가장 강력한 신호입니다. 다만 7월 말에 보고된 월간 활성 사용자 1억 1,700만 명의 성장 정체는 소비자 확보가 멈춰섰음을 시사합니다.
자본 지출 이야기: Nvidia 독점, 연말까지 2 GW
머스크는 발표에서 스페이스X가 AI 데이터센터를 Nvidia의 Vera Rubin 아키텍처로 독점 구축할 것이라고 확인하며, 이를 “현재 시장에서 최고의 AI 컴퓨터"라고 평가했습니다. 컴퓨팅 로드맵은 공격적입니다:
- 현재 온라인 컴퓨팅: 약 1.4 GW
- 2026년 말 목표: 2 GW
- 2027년 말 목표: 10–15 GW
머스크는 병목이 GPU 공급에서 전력 및 냉각 인프라로 이동했으며, 향후 자원 투자는 여기에 집중될 것이라고 밝혔습니다.
Starmind 위성 프로그램은 우주 기반의 새로운 차원을 더합니다: 스페이스X는 Starmind AI 1 위성을 위해 Nvidia와 AI 컴퓨팅 페이로드를 공동 개발했으며, 각 위성은 Nvidia Rubin GPU와 Vera CPU를 탑재합니다. 첫 배치는 내년에 발사가 시작될 예정이며, AI 컴퓨팅을 저궤도로 확장합니다.
Grok 기반 투자자 Q&A 플랫폼
큰 주목을 받은 조치로, 스페이스X는 업계 표준 SAY 플랫폼(테슬라가 실적 발표에 사용)을 건너뛰고 Grok으로 구축한 맞춤형 투자자 Q&A 도구를 선택했습니다. 이 플랫폼은 발표 전에 주주 질문을 접수했고, Grok이 중복 제거, 주제 클러스터링, 순위 산정을 처리했습니다.
이는 지금까지 Grok의 가장 가시적인 엔터프라이즈 배포라고 할 수 있습니다 — 기관 애널리스트, 일반 주주, 금융 미디어를 동시에 마주하게 한 것입니다. 이 도구가 매끄럽게 작동한다면, 다른 모든 상장사가 채택할 수 있는 사례 연구가 됩니다. 현재 SAY에 의존하는 테슬라의 실적 발표가 가장 확실한 다음 후보입니다.
Grok 4.6, 다음 주 출시 목표 — Grok 5는 스페이스X 전체 데이터 통합
실적 발표는 머스크가 지금까지 가장 상세한 Grok 로드맵을 제시하는 플랫폼이 되었습니다:
- Grok 4.6: “아마 다음 주”(8월 7일 주간) 출시 예상
- Grok 4.7: “오늘로부터 약 3~4주”
- Grok 5: “연말 이전”
Grok 4.6은 1.5조 파라미터 모델로 설명되며, Grok 4.5 대비 감독 미세 조정(SFT)과 강화 학습(RL)이 크게 개선되었습니다. 보도에 따라 파라미터 수치는 엇갈립니다 — 일부 소식통은 “2T 모델"을 언급하지만 — 머스크 자신의 발언에서 가장 일관된 설명은 더 큰 아키텍처가 아닌 학습 개선을 동반한 1.5T입니다.
Grok 4.7은 2.1조 파라미터 모델로 보고되며, “서빙 속도가 약간 느린 것 외에는 모든 면에서 더 나을” 것이며 토큰 효율이 더 높습니다. 이는 전주 보도와 일치합니다.
이번 발표의 헤드라인 항목은 Grok 5 학습 데이터에 대한 머스크의 발언이었습니다:
“우리는 스페이스X 데이터의 전체 코퍼스를 통합할 것입니다… 스페이스X가 4분의 1세기 동안 생산한 모든 데이터를 말합니다.”
이는 로켓 발사 로그, 원격 측정(텔레메트리), 제조 데이터, 위성 운용 데이터, 독점 엔지니어링 데이터셋이 Grok 5 학습 파이프라인에 투입된다는 뜻입니다. SpaceXAI 통합이 단순한 기업 구조 재편이 아니라 데이터 시너지에 관한 것임을 보여주는 지금까지 가장 명확한 전략적 신호입니다 — 스페이스X의 독점 엔지니어링 데이터는 Grok의 AI 역량을 위한 지속 가능한 경쟁 해자가 됩니다.
API 현실 점검
8월 5일 기준, Grok 4.5가 여전히 SpaceXAI 공식 문서에서 최신 문서화 모델입니다. 현재 상황은:
docs.x.ai에 Grok 4.6의 공개 모델 ID 없음- API 문서에 가격 행 없음
- 컨텍스트 윈도우 사양 없음
- 벤치마크 점수 없음
Grok 4.6이 출시되었다는 실제 신호는 docs.x.ai/developers/models의 모델 목록에 grok-4.6 항목이 나타나는 것입니다. LMArena는 7월 29일 Grok 4.6이 출시 다음 주에 Arena 리더보드에 등장할 것이라고 발표했으며, 이는 독립적인 벤치마크 검증을 제공할 것입니다.
Grok Voice Think Fast 2.0, 프로덕션 마이그레이션 완료
2026년 8월 5일, grok-voice-latest 별칭이 Grok Voice Think Fast 1.0에서 Grok Voice Think Fast 2.0으로 자동 전환되어, xAI가 7월 29일 발표한 마이그레이션 계획이 완료되었습니다. 명시적으로 grok-voice-think-fast-1.0에 고정(pin)하지 않은 모든 개발자는 이제 2.0을 사용하고 있습니다.
사양
| 지표 | Think Fast 1.0 | Think Fast 2.0 |
|---|---|---|
| AA STS 품질 지수 | 75.7% | 82.9% |
| Agentic τ-voice 벤치 | 52.1% | 56.5% |
| 첫 오디오까지의 시간 | 1.25초 | 0.70초 |
| 추론 토큰(P50) | 기준선 | 1.0의 약 40% |
| 분당 가격 | $0.05 | $0.08 |
이 모델은 엔드투엔드 음성-음성 시스템입니다 — 오디오 입력, 오디오 출력 — 별도의 ASR → LLM → TTS 파이프라인이 없습니다. 24개 이상의 언어를 지원하며, 노이즈가 많은 통화 환경을 처리하고, 추가 지연 없이 말하면서 추론합니다. 첫 문장이 끝나기 전에 도구 호출을 시작할 수 있습니다.
전사 정확도는 1.0 대비 1.4배, xAI의 24개 언어 벤치마크에서 선도적인 전용 STT 모델(Deepgram Nova 3, ElevenLabs Scribe v2) 대비 1.5~2배 개선되었습니다. 노이즈가 많은 통화 환경에서는 개선 폭이 최대 10배에 달합니다.
경쟁 포지셔닝
분당 $0.08(시간당 $4.80)로 Think Fast 2.0은 OpenAI의 GPT-Realtime-2.1 High 가격의 약 45% 수준입니다. Artificial Analysis 음성-음성(Speech-to-Speech) 지수에서 Grok Voice TF 2.0은 **82.9%**를 기록했으며, GPT-Realtime-2.1은 79.1%, Gemini 3.1 Flash는 **69.5%**입니다. Agentic τ-voice 벤치마크에서 Grok은 **56.5%**로 OpenAI의 **45.7%**를 앞섭니다.
음성 에이전트를 구축하는 엔터프라이즈 팀 — 콜센터, IVR 시스템, 대화형 AI — 에게 Think Fast 2.0은 이제 서류상 벤치마크 리더입니다. 분당 $0.05에서 $0.08로의 인상(60% 상승)은 대규모 배포에 의미 있는 변화지만, 추론 토큰 60% 감소가 상호작용당 컴퓨팅 부하를 줄여 분당 비용을 부분적으로 상쇄합니다.
마이그레이션 참고 사항
개발자는 다음을 수행해야 합니다:
- 2.0 준비가 되지 않았다면 프로덕션에서
grok-voice-think-fast-1.0을 고정(pin) - 기존 $0.05 가정 대신 분당 $0.08로 비용 재산정
- 양쪽 엔드포인트를 제어한다면 바이너리 오디오 전송 활성화
- 제품명에 키텀(keyterms) 추가, 발음 수정에 replace 사용
- 오디오 중첩을 피하기 위해 tool → wait-for-playback → response.create 순서 구현
- 서버가 아닌 모든 클라이언트에는 임시 토큰(ephemeral tokens) 사용
WebSocket 엔드포인트는 wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0입니다. 지원 코덱: PCM(8–48 kHz), μ-law, A-law, Opus(24 kHz).
Grok Imagine Video 1.5: 텍스트-비디오, 네이티브 1080p, 음성 레퍼런스
2026년 7월 31일, xAI는 Grok Imagine Video 1.5에 5월 출시 이후 플랫폼에 없던 네 가지 기능을 추가하는 대규모 업데이트를 출시했습니다:
텍스트-비디오 생성
이제 사용자는 레퍼런스 이미지 없이 텍스트 프롬프트만으로 비디오를 생성할 수 있습니다. 이 구현은 xAI의 이미지 생성 파이프라인과 이미지-비디오 엔진을 결합합니다 — 모델이 텍스트 프롬프트에서 시작 프레임을 합성한 후 앞으로 애니메이션합니다. 이는 출시 이후 API 수준에서 텍스트-비디오를 제공해 온 Google Veo 3.1 및 Seedance 2.0과의 기능 격차를 해소합니다.
네이티브 1080p 출력
기존 Grok Imagine Video 출력은 720p로 제한되었습니다(실제로는 720p를 업스케일한 일시적인 “1080p 토글” 제외). 이번 업데이트는 진정한 네이티브 1080p 렌더링을 제공합니다. 가격은 아키텍처 비용을 드러냅니다: Aurora는 각 프레임을 순차적으로 생성하는 자기회귀(autoregressive) 시스템이므로, 720p에서 1080p로의 확장은 픽셀 토큰을 약 2.25배로 늘립니다. API 가격은 이를 반영합니다:
| 해상도 | 초당 가격 |
|---|---|
| 480p | $0.08 |
| 720p | $0.14 |
| 1080p | $0.25 |
1080p에서 API로 60분 분량의 비디오를 생성하는 비용은 $900입니다 — 720p의 $504, Google Veo 3.1 Fast 티어 가격의 약 $540와 비교됩니다. 1080p 기능은 경쟁사와의 포맷 격차를 해소하지만, 해당 해상도에서의 비용 격차는 해소하지 못합니다.
음성 레퍼런스: 얼굴 및 음성 일관성
가장 차별화된 새 기능: 사용자가 캐릭터 사진과 음성 샘플을 제공하면, 모델이 생성된 모든 장면에서 얼굴과 음성을 모두 유지합니다. 기본 메커니즘은 언어적 콘텐츠와 분리하여 음성 정체성 특성(톤, 피치, 운율, 억양)을 추출하는 화자 임베딩(speaker embedding) 시스템입니다.
이는 전통적으로 별도의 도구를 결합해야 했던 후반 제작 단계를 제거합니다. 비교 대상인 HeyGen의 Avatar API는 토킹헤드 클립에 분당 $3를 청구합니다. Grok Imagine의 음성 레퍼런스는 아바타뿐만 아니라 전체 장면 비디오 생성에 내장되어 있어, 다른 기능 카테고리를 대표합니다.
접근성: 음성 레퍼런스는 먼저 미국의 SuperGrok Heavy 및 SuperGrok Plus 구독자에게 출시되며, 며칠 내 더 넓은 출시가 예고되었습니다. API 개발자는 접근을 요청하려면 xAI 영업팀에 문의해야 합니다.
동의 격차: xAI의 발표에는 동의 가드레일(consent guardrails)에 대한 논의가 포함되어 있지 않습니다. 이 기능은 사진과 음성 샘플을 요구하지만, 같은 사람의 것이어야 한다거나 묘사된 사람의 동의를 받아야 한다는 요건은 없는 것으로 보입니다. 비동의 이미지 생성 전력 — 2025년 말/2026년 초 11일간 약 300만 개의 성적 이미지가 생성되었고, 이후 연방 소송과 35개 주 검찰총장의 조사로 이어짐 — 을 고려할 때, 단일 생성 호출에서 얼굴과 음성 레퍼런스를 결합하는 것은 이미지 생성만으로 가능한 것보다 더 완전한 비동의 친밀한 비디오 생성 능력을 만듭니다. xAI의 허용 가능 사용 정책은 그러한 콘텐츠를 금지하지만, 공개된 기술적 통제 수단 없이는 집행 이력이 그 금지 조항에 제한적인 안심만을 제공합니다.
다중 레퍼런스 장면 제어
단일 생성에서 최대 7개의 동시 레퍼런스 이미지를 사용할 수 있습니다. 각 레퍼런스는 얼굴, 제품, 장소, 소품 등 하나의 시각적 요소를 고정하며, 다른 요소는 변형되도록 둡니다. 이는 대부분의 전용 레퍼런스 도구가 제공하는 것보다 많은 앵커 수이며, 음성 레퍼런스와 결합하면 얼굴, 음성, 환경적 맥락을 동시에 고정할 수 있는 캐릭터 파이프라인을 만듭니다.
API 가용성: 텍스트-비디오, 네이티브 1080p, 이미지 레퍼런스는 표준 API 키로 지금 이용할 수 있습니다. grok-imagine-video-1.5 모델 문자열이 이전 -preview 별칭을 대체합니다. 음성 레퍼런스는 영업팀 접근이 필요합니다.
경쟁 구도: OpenAI GPT-5.6 Sol, Terra, Luna
OpenAI는 7월 9일 GPT-5.6을 3개 모델 패밀리로 출시했습니다 — 이 기간 동안 가장 중요한 경쟁사 릴리스입니다:
| 모델 | 포지셔닝 | 가격 (100만 토큰당) |
|---|---|---|
| Sol | 플래그십, 최고 성능 | 입력 $5 / 출력 $30 |
| Terra | 균형형, 더 낮은 비용으로 GPT-5.5 수준 | 입력 $2.50 / 출력 $15 |
| Luna | 가장 빠르고 저렴, 대규모 처리 | 입력 $1 / 출력 $6 |
OpenAI는 또한 Ultra 모드 — 병렬 작업 스트림에서 여러 에이전트를 조율하는 최고 성능 설정 — 와 ChatGPT Work 및 Codex에서 사용 가능한 Max 추론 수준을 도입했습니다.
3단계 전략은 xAI의 접근 방식과 뚜렷하게 대조됩니다. SpaceXAI는 API를 단일 플래그십 모델(Grok 4.3, 그다음 4.5)로 통합해 왔으며, 모델 티어 대신 구독 티어를 배포에 사용했습니다. OpenAI의 Sol/Terra/Luna 분할은 단일 모델 패밀리 내에서 구매자에게 가격-성능 트레이드오프를 제공합니다 — 워크로드별로 다른 성능 티어가 필요한 조직에 조달상 이점입니다.
한편, Moonshot AI의 Kimi K3 — Mixture-of-Experts 아키텍처에 896개 전문가를 갖춘 2.8조 파라미터 오픈웨이트 모델이자 100만 토큰 컨텍스트 윈도우 — 가 7월 말 출시되며 사상 최대 오픈웨이트 모델이라는 타이틀을 차지했습니다. xAI에 대한 경쟁 압력은 독점과 오픈소스 양방향에서 강화되고 있습니다.
주목할 사항
- Grok 4.6 출시 확인: xAI API 문서와 LMArena 리더보드에 모델 ID가 나타나는지 주시하세요. “다음 주"와 실제 API 가용성 사이의 간격은 계획 수립에 얼마나 많은 리드 타임을 확보해야 하는지를 보여줄 것입니다. 머스크의 출시 주기는 가속화되고 있지만 그의 날짜는 목표일 뿐 약속이 아닙니다.
- 스페이스X 락업 해제 연쇄: 8월 6일부터 내부자 주식 해제 첫 트랜치가 시작됩니다 — 약 10억 주, 약 1,060억 달러. 12월까지 2주마다 추가 트랜치가 이어집니다. 매도 압력은 SPCX의 주가 성과를 형성하고, 나아가 이 규모의 AI 인프라 지출에 대한 시장의 식욕을 좌우할 것입니다.
- Grok 5와 스페이스X 데이터 통합: “스페이스X가 생산한 모든 데이터"로 학습하겠다는 약속은 전략적으로 중요합니다. 스페이스X의 엔지니어링 원격 측정, 제조 데이터, 운용 로그가 Grok 5에서 측정 가능한 역량 향상을 만들어낸다면, SpaceXAI 통합 전체 논제를 검증하는 것입니다. 데이터 파이프라인 아키텍처에 관한 기술적 공개를 주시하세요.
- Voice Think Fast 2.0 프로덕션 성능: 벤치마크 수치는 서류상 강력합니다. 엔터프라이즈 배포는 60% 토큰 감소와 0.70초 첫 오디오 도달 시간이 실제 비용 절감과 사용자 경험 개선으로 이어지는지 드러낼 것입니다. 제3자 평가와 사례 연구를 주시하세요.
- Grok Imagine 동의 가드레일: 음성 레퍼런스와 얼굴 레퍼런스의 결합은 비동의 친밀한 비디오 위험을 만듭니다. xAI가 더 넓은 출시 전에 정책 금지뿐만 아니라 기술적 통제 수단을 공개하는지 주시하세요.
- Starmind 위성 발사: AI 탑재 위성의 첫 배치가 내년으로 예정되어 있습니다. 성공한다면 우주 기반 AI 컴퓨팅은 어떤 경쟁사도 복제할 수 없는 차별화 요소가 됩니다.
- OpenAI의 경쟁 대응: GPT-5.6 Sol은 Artificial Analysis 코딩 에이전트 지수에서 80점을 기록했습니다. Grok 4.6의 벤치마크 수치 — 공개되면 — 직접 비교될 것입니다. 3단계 Sol/Terra/Luna 가격 모델은 xAI가 단일 플래그십 API 전략을 재고하도록 압박할 수 있습니다.
AI 생태계 일일 업데이트는 Kevin Kaminski의 X를 팔로우하세요. 다음 주 xAI 위클리로 돌아오세요.