2026 年 7 月 29 日那一週,由單一事件主導:SpaceX 於 8 月 4 日召開史上首次公開財報電話會議,揭開了 SpaceXAI 時代財務運作的面紗。Elon Musk 在會議上勾勒出激進的 Grok 路線圖——Grok 4.6 下週推出、Grok 4.7 在三至四週內推出、Grok 5 在年底前推出,並以 SpaceX 歷史資料的完整語料進行訓練。在財報鎂光燈之外,Grok Voice Think Fast 2.0 完成生產環境遷移,Grok Imagine Video 1.5 則推出重大功能更新,新增文字轉影片(text-to-video)生成與原生 1080p 輸出。
以下為我們對本週重要發展的專業分析。
SpaceX 首次財報電話會議:營收 78 億美元、AI 營收 25.6 億美元、資本支出 184 億美元
SpaceX 於 2026 年 8 月 4 日舉行首場季度財報電話會議——這是自 6 月 12 日以 SPCX 代號上市以來的首次公開財務揭露。數據相當驚人:
- 2026 年 Q2 營收:78 億美元,年增 92%,優於分析師約 68–69 億美元的共識預期
- AI 部門營收:25.6 億美元,年增 247%,包含 xAI 與 Grok 訂閱
- 調整後 EBITDA:35 億美元,年增 191%
- 淨虧損:5.41 億美元,較一年前的約 10 億美元虧損收斂
- 資本支出:單季 184 億美元,較一年前的 28 億美元成長近七倍——主要來自 AI 基礎設施
市場反應為負面。股價在盤後交易中下跌約 7%,主因在於資本支出數字。兩天後的 8 月 6 日,禁售期屆滿將釋出約 10 億股內部人持股——以週一收盤價計算約值 1,064 億美元——之後每兩週再解鎖一批,直至 2026 年 12 月全部解鎖。
AI 正式成為業務部門
SpaceX 目前劃分三個部門:太空(發射)、連線(Starlink)與 AI。AI 部門——涵蓋 xAI、Grok 訂閱與算力租賃——單季貢獻 25.6 億美元。以此脈絡推算,年化 AI 營收約達 100 億美元以上,讓 SpaceXAI 的 AI 業務營收規模與成熟的企業級 AI 廠商並駕齊驅。
SpaceX 總裁兼營運長 Gwynne Shotwell 在會議上透露,7 月 Grok 4.5 發布後,token 消耗量成長為三倍。這項指標——原始模型使用量——是 xAI 迄今分享過最有力的訊號,顯示 Grok 採用率正在顯著加速;即使 7 月底公布的用戶成長持平於 1.17 億月活躍用戶,顯示消費者獲取已趨於停滯。
資本支出故事:Nvidia 獨家合作,年底前達 2 GW
Musk 在會議上確認,SpaceX 將僅採用 Nvidia 的 Vera Rubin 架構打造 AI 資料中心,稱其為「目前市場上最好的 AI 電腦」。算力路線圖相當激進:
- 目前線上算力:約 1.4 GW
- 2026 年底目標:2 GW
- 2027 年底目標:10–15 GW
Musk 表示,瓶頸已從 GPU 供應轉移至電力與散熱基礎設施,未來資源投入將聚焦於此。
Starmind 衛星計畫增添了太空維度:SpaceX 與 Nvidia 共同為 Starmind AI 1 衛星開發了 AI 運算酬載,每顆衛星搭載 Nvidia Rubin GPU 與 Vera CPU。首批衛星預計明年開始發射,將 AI 運算延伸至低地球軌道。
以 Grok 驅動的投資人問答平台
一項備受矚目的舉措是,SpaceX 跳過了業界標準的 SAY 平台(Tesla 財報電話會議所用),改用以 Grok 打造的客製化投資人問答工具。該平台在會議前接受股東提問,由 Grok 負責去重、主題分群與排序。
這可說是 Grok 迄今最受矚目的企業級部署——同時呈現在機構分析師、散戶股東與財經媒體面前。若該工具運作順暢,將成為任何上市公司都可採用的案例研究。目前依賴 SAY 的 Tesla 自家財報電話會議,顯然是下一個候選對象。
Grok 4.6 目標下週推出——Grok 5 將納入 SpaceX 全部資料
財報電話會議也成為 Musk 迄今最詳盡 Grok 路線圖的發表平台:
- Grok 4.6:預計「大概下週」(8 月 7 日當週)
- Grok 4.7:「從今天起約三到四週」
- Grok 5:「年底前」
Grok 4.6 被描述為1.5 兆參數模型,監督式微調(SFT)與強化學習(RL)均較 Grok 4.5 有顯著改善。次級報導對參數量說法不一——有些來源提到「2T 模型」——但與 Musk 自身說法最一致的描述是 1.5T 加上訓練改進,而非更大的架構。
Grok 4.7 據報為2.1 兆參數模型,將「各方面都更好,只有服務速度略慢」,且 token 效率更高。這與前一週的報導一致。
會議的頭條焦點是 Musk 關於 Grok 5 訓練資料的聲明:
「我們將納入 SpaceX 資料的完整語料……SpaceX 在四分之一世紀以來產出的所有資料。」
這代表火箭發射紀錄、遙測資料、製造資料、衛星營運資料與專有工程資料集都將送入 Grok 5 的訓練管線。這是迄今最清晰的策略訊號,顯示 SpaceXAI 整併的核心是資料綜效,而非單純的公司重整——SpaceX 的專有工程資料將成為 Grok AI 能力的持久競爭護城河。
API 現況檢驗
截至 8 月 5 日,Grok 4.5 仍是 SpaceXAI 官方文件中記載的最新模型。目前:
docs.x.ai上沒有 Grok 4.6 的公開模型 ID- API 文件中沒有定價欄位
- 沒有脈絡視窗(context window)規格
- 沒有基準測試分數
Grok 4.6 真正上線的訊號,將是 grok-4.6 出現在 docs.x.ai/developers/models 的模型清單中。LMArena 已於 7 月 29 日宣布,Grok 4.6 將在推出後一週登上 Arena 排行榜,屆時將提供獨立的基準驗證。
Grok Voice Think Fast 2.0 完成生產環境遷移
2026 年 8 月 5 日,grok-voice-latest 別名自動從 Grok Voice Think Fast 1.0 切換至 Grok Voice Think Fast 2.0,完成 xAI 於 7 月 29 日宣布的遷移計畫。任何未明確釘選(pin)grok-voice-think-fast-1.0 的開發者,現在執行的都是 2.0。
規格
| 指標 | Think Fast 1.0 | Think Fast 2.0 |
|---|---|---|
| AA STS 品質指數 | 75.7% | 82.9% |
| Agentic τ-voice 基準 | 52.1% | 56.5% |
| 首次音訊時間 | 1.25s | 0.70s |
| 推理 token(P50) | 基準 | 約 1.0 的 40% |
| 每分鐘價格 | $0.05 | $0.08 |
該模型是端對端語音對語音(speech-to-speech)系統——音訊進、音訊出——沒有獨立的 ASR → LLM → TTS 管線。支援 24 種以上語言,可處理嘈雜的電話環境,並在說話的同時進行推理而不增加任何延遲。工具呼叫(tool calls)可在第一句話結束前就開始。
在 xAI 的 24 語言基準上,轉錄準確度較 1.0 提升 1.4 倍,較領先的專用 STT 模型(Deepgram Nova 3、ElevenLabs Scribe v2)提升 1.5–2 倍。在嘈雜電話環境下,改善幅度最高可達 10 倍。
競爭定位
以每分鐘 0.08 美元(每小時 4.80 美元)的價格,Think Fast 2.0 約為 OpenAI GPT-Realtime-2.1 High 價格的 45%。在 Artificial Analysis 語音對語音指數中,Grok Voice TF 2.0 得分 82.9%,對比 GPT-Realtime-2.1 的 79.1% 與 Gemini 3.1 Flash 的 69.5%。在 agentic τ-voice 基準上,Grok 以 56.5% 領先 OpenAI 的 45.7%。
對於打造語音代理(voice agents)的企業團隊——客服中心、IVR 系統、對話式 AI——Think Fast 2.0 目前是紙面上的基準領先者。每分鐘價格從 0.05 美元調漲至 0.08 美元(漲幅 60%),對高流量部署意義重大;但推理 token 減少 60%,降低了每次互動的運算負載,可部分抵銷每分鐘成本。
遷移注意事項
開發者應:
- 若生產環境尚未準備好升級 2.0,釘選
grok-voice-think-fast-1.0 - 重新估算成本:以每分鐘 0.08 美元取代先前的 0.05 美元假設
- 若同時控制兩個端點,啟用二進位音訊傳輸
- 為產品名稱新增關鍵詞(keyterms),並以 replace 進行發音修正
- 依 tool → wait-for-playback → response.create 的順序實作,避免音訊重疊
- 任何非你伺服器的用戶端,一律使用暫時性 token(ephemeral tokens)
WebSocket 端點為 wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0。支援的編解碼器:PCM(8–48 kHz)、μ-law、A-law 與 Opus(24 kHz)。
Grok Imagine Video 1.5:文字轉影片、原生 1080p、語音參考
2026 年 7 月 31 日,xAI 為 Grok Imagine Video 1.5 推出重大更新,新增平台自 5 月發布以來一直缺少的四項能力:
文字轉影片生成
使用者現在可以僅憑文字提示生成影片,無需提供參考圖片。實作方式是將 xAI 的影像生成管線與影像轉影片引擎搭配——模型先從文字提示合成起始幀,再向前動畫化。這填補了與 Google Veo 3.1 及 Seedance 2.0 的功能差距,兩者自推出以來都已在 API 層級提供文字轉影片。
原生 1080p 輸出
先前的 Grok Imagine Video 輸出上限為 720p(曾有短暫的「1080p 切換」,其實是升頻的 720p)。此次更新提供真正的原生 1080p 渲染。定價揭露了架構成本:Aurora 是自迴歸(autoregressive)系統,逐幀依序生成,因此從 720p 擴展到 1080p 會使像素 token 增加約 2.25 倍。API 定價反映於此:
| 解析度 | 每秒價格 |
|---|---|
| 480p | $0.08 |
| 720p | $0.14 |
| 1080p | $0.25 |
以 1080p 透過 API 生成 60 分鐘影片,成本為 900 美元——相較 720p 的 504 美元,以及 Google Veo 3.1 Fast 等級約 540 美元的定價。1080p 能力填補了與競爭對手的格式差距,但在該解析度下並未縮小成本差距。
語音參考:臉部與語音一致性
最具特色的新功能:使用者提供角色照片與語音樣本,模型便能在每個生成的場景中同時維持臉部與語音的一致性。底層機制是說話者嵌入(speaker embedding)系統,將語音身分特徵(音色、音高、韻律、口音)與語言內容分開萃取。
這省去了一個傳統上需要結合多種工具的後製步驟。相較之下,HeyGen 的 Avatar API 對談話頭影片(talking-head clips)每分鐘收費 3 美元。Grok Imagine 的語音參考內建於全場景影片生成之中——不只是虛擬人像——屬於不同的能力類別。
使用資格: 語音參考將率先提供給美國的 SuperGrok Heavy 與 SuperGrok Plus 訂閱者,並在數日內擴大開放。API 開發者必須聯絡 xAI 銷售團隊申請使用權限。
同意機制缺口: xAI 的公告完全沒有討論同意(consent)護欄。該功能需要照片與語音樣本,但似乎不要求兩者屬於同一人,也不要求被描繪者已表示同意。考量 Grok 在非自願影像上的過往紀錄——2025 年底至 2026 年初的 11 天內生成估計 300 萬張性化影像,隨後引發聯邦訴訟與 35 州檢察長的調查——在單次生成呼叫中結合臉部與語音參考,會比單純影像生成更完整地構成非自願親密影片能力。xAI 的可接受使用政策禁止此類內容,但在未揭露技術控管的情況下,過往的執法紀錄僅能提供有限的安心感。
多重參考場景控制
單次生成最多可使用七張參考圖片。每張參考鎖定一個視覺元素——臉部、產品、地點、道具——同時允許其他元素變化。這比多數專門參考工具提供的錨點數更多;搭配語音參考後,可形成臉部、語音與環境脈絡可同時鎖定的角色管線。
API 可用性: 文字轉影片、原生 1080p 與圖片參考目前以標準 API key 即可使用。grok-imagine-video-1.5 模型字串取代先前的 -preview 別名。語音參考需要銷售團隊授權。
競爭格局:OpenAI GPT-5.6 Sol、Terra 與 Luna
OpenAI 於 7 月 9 日推出 GPT-5.6,採三模型家族形式——這是此期間最具影響力的競爭產品:
| 模型 | 定位 | 價格(每 100 萬 token) |
|---|---|---|
| Sol | 旗艦,能力最強 | $5 輸入 / $30 輸出 |
| Terra | 均衡,GPT-5.5 等級但成本更低 | $2.50 輸入 / $15 輸出 |
| Luna | 最快、最便宜、高流量 | $1 輸入 / $6 輸出 |
OpenAI 也推出 Ultra 模式——其最高能力設定,可在平行工作流程中協調多個代理——以及 ChatGPT Work 與 Codex 中提供的 Max 推理等級。
三層級策略與 xAI 的做法形成鮮明對比。SpaceXAI 一直將 API 整合在單一旗艦模型(Grok 4.3,接著 4.5)周圍,並以訂閱層級而非模型層級進行分銷。OpenAI 的 Sol/Terra/Luna 分層讓買家在單一模型家族內獲得價格與效能的取捨——對於需要以不同能力等級因應不同工作負載的組織而言,是一項採購優勢。
與此同時,Moonshot AI 的 Kimi K3——2.8 兆參數的開放權重模型,採用 896 個專家的混合專家(Mixture-of-Experts)架構,具備 100 萬 token 的脈絡視窗——於 7 月底發布,宣稱是史上最大的開放權重模型。xAI 正面臨來自專有與開源兩個方向日益加劇的競爭壓力。
值得關注的焦點
- Grok 4.6 發布確認:觀察模型 ID 是否出現在 xAI 的 API 文件與 LMArena 排行榜上。「下週」與實際 API 可用時間之間的落差,將顯示規劃時需預留多少前置時間。Musk 的發布節奏正在加快,但他的日期是目標,不是承諾。
- SpaceX 禁售期解鎖連鎖效應:8 月 6 日開始首批內部人持股解鎖——約 10 億股、約 1,064 億美元。之後每兩週解鎖一批,直至 12 月。賣壓將影響 SPCX 的股價表現,進而影響市場對這種規模 AI 基礎設施支出的胃口。
- Grok 5 與 SpaceX 資料整合:以「SpaceX 歷來產出的所有資料」訓練的承諾具有策略意義。若 SpaceX 的工程遙測、製造資料與營運紀錄能為 Grok 5 帶來可量測的能力提升,便驗證了 SpaceXAI 整併的整體論述。請留意任何關於資料管線架構的技術揭露。
- Voice Think Fast 2.0 生產環境表現:基準數據在紙面上相當亮眼。企業部署將揭露 60% 的 token 減少與 0.70 秒首次音訊時間是否能轉化為實際的成本節省與使用者體驗改善。請留意第三方評測與案例研究。
- Grok Imagine 同意護欄:語音參考結合臉部參考會產生非自願親密影片風險。請留意 xAI 是否在擴大開放前揭露技術控管——而不只是政策禁止。
- Starmind 衛星發射:首批搭載 AI 的衛星預計明年發射。若成功,太空 AI 運算將成為任何競爭對手都無法複製的差異化優勢。
- OpenAI 競爭回應:GPT-5.6 Sol 在 Artificial Analysis Coding Agent Index 得分 80。Grok 4.6 的基準分數——公布時——將被直接比較。Sol/Terra/Luna 三層級定價模式可能迫使 xAI 重新考慮其單一旗艦 API 策略。
追蹤 Kevin Kaminski 的 X 帳號 以獲取每日 AI 生態系更新。下週請繼續鎖定下一期的 xAI 週報。