2026 年 7 月 29 日这一周被一件大事主导:8 月 4 日 SpaceX 首次公开财报电话会议,揭开了 SpaceXAI 时代财务运作机制的面纱。埃隆·马斯克在会上勾勒出一条激进的 Grok 路线图——下周发布 Grok 4.6三到四周后发布 Grok 4.7年底前发布 Grok 5,后者将使用 SpaceX 全部历史数据语料进行训练。在财报聚光灯之外,Grok Voice Think Fast 2.0 完成了生产环境迁移,Grok Imagine Video 1.5 也发布了重大功能更新,新增文生视频生成和原生 1080p 输出。

以下是我们对本周重要进展的专业分析。


SpaceX 首次财报电话会议:78 亿美元营收、25.6 亿美元 AI 收入与 184 亿美元资本开支

SpaceX 于 2026 年 8 月 4 日举行了首届季度财报电话会议——这是其 6 月 12 日以 SPCX 为代码 IPO 以来的首次公开财务披露。数字相当惊人:

  • 2026 年第二季度营收:78 亿美元,同比增长 92%,超出分析师约 68–69 亿美元的共识预期
  • AI 业务板块营收:25.6 亿美元,同比增长 247%,包括 xAI 与 Grok 订阅
  • 调整后 EBITDA:35 亿美元,同比增长 191%
  • 净亏损:5.41 亿美元,较一年前约 10 亿美元的亏损收窄
  • 资本开支:单季度 184 亿美元,较一年前的 28 亿美元增长近七倍——主要由 AI 基础设施驱动

市场反应为负面。股价在盘后交易中下跌约 7%,主要源于资本开支数字。两天后的 8 月 6 日,锁定期到期将释放约 10 亿股内部人股份——按周一收盘价计算约合 1064 亿美元——此后每两周解锁一批,直到 2026 年 12 月全部解锁。

AI 成为正式业务板块

SpaceX 现在报告三大板块:Space(发射)、Connectivity(Starlink)和 AI。AI 部门——涵盖 xAI、Grok 订阅和算力租赁——单季度创造了 25.6 亿美元收入。作为参照,这年化约为 100 亿美元以上的 AI 营收,使 SpaceXAI 的 AI 业务与成熟的企业级 AI 厂商处于同一营收量级。

SpaceX 总裁兼首席运营官 Gwynne Shotwell 在电话会议上透露,7 月 Grok 4.5 发布后 token 消耗量增长了两倍。这一指标——原始模型使用量——是 xAI 迄今分享的最强证据,表明 Grok 的采用正在实质性加速,尽管 1.17 亿月活跃用户(7 月底披露)的增长平台期表明消费者端获客已经停滞。

资本开支故事:Nvidia 独家,年底前达到 2 GW

马斯克在电话会议上确认,SpaceX 将仅基于 Nvidia Vera Rubin 架构建造其 AI 数据中心,称其为"目前市场上最好的 AI 计算机"。算力路线图相当激进:

  • 当前在线算力:约 1.4 GW
  • 2026 年底目标:2 GW
  • 2027 年底目标:10–15 GW

马斯克表示,瓶颈已从 GPU 供应转向电力和冷却基础设施,未来资源投入将集中于此。

Starmind 卫星计划增加了太空维度:SpaceX 与 Nvidia 为其 Starmind AI 1 卫星联合开发了 AI 计算载荷,每颗卫星搭载 Nvidia Rubin GPU 和 Vera CPU。首批计划于明年开始发射,将 AI 算力延伸至近地轨道。

基于 Grok 的投资者问答平台

一个备受关注的举措是,SpaceX 弃用了行业标准的 SAY 平台(特斯拉财报电话会议所用),转而采用基于 Grok 构建的定制投资者问答工具。该平台在电话会议前接受股东提问,由 Grok 负责去重、话题聚类和排序。

这可以说是 Grok 迄今最引人注目的企业级部署——同时将模型呈现在机构分析师、散户股东和财经媒体面前。如果该工具运行顺畅,它将成为一个任何上市公司都可借鉴的案例。目前依赖 SAY 的特斯拉财报电话会议,显然是下一个候选对象。


Grok 4.6 目标下周发布——Grok 5 将纳入全部 SpaceX 数据

财报电话会议成为马斯克公布迄今最详细 Grok 路线图的平台:

  • Grok 4.6:预计"可能下周"(8 月 7 日那一周)
  • Grok 4.7:“大约三到四周后”
  • Grok 5:“年底之前”

Grok 4.6 被描述为1.5 万亿参数模型,相比 Grok 4.5 在监督微调(SFT)和强化学习(RL)上有显著改进。二手报道给出的参数数量相互矛盾——一些消息源提到"2T 模型"——但马斯克本人表述中最一致的说法是 1.5T 加上训练改进,而非更大的架构。

Grok 4.7 据报道为2.1 万亿参数模型,“除推理速度略慢外各方面都更好”,token 效率更高。这与前一周的报道一致。

电话会议的头条是马斯克关于 Grok 5 训练数据的声明:

“我们将纳入 SpaceX 的完整数据语料……SpaceX 在四分之一世纪里产生的全部数据。”

这意味着火箭发射日志、遥测数据、制造数据、卫星运营数据和专有工程数据集将进入 Grok 5 的训练流水线。这是迄今最清晰的战略信号:SpaceXAI 整合的核心是数据协同,而不仅仅是公司重组——SpaceX 的专有工程数据将成为 Grok AI 能力的持久竞争护城河。

API 现实核查

截至 8 月 5 日,Grok 4.5 仍是 SpaceXAI 官方文档中记录的最新模型。目前:

  • docs.x.ai 上没有 Grok 4.6 的公开模型 ID
  • API 文档中没有定价条目
  • 没有上下文窗口规格
  • 没有基准测试分数

Grok 4.6 真正上线的信号将是 docs.x.ai/developers/models 模型列表中出现的 grok-4.6 条目。LMArena 于 7 月 29 日宣布,Grok 4.6 将在发布后一周登上 Arena 排行榜,届时将提供独立的基准验证。


Grok Voice Think Fast 2.0 完成生产迁移

2026 年 8 月 5 日grok-voice-latest 别名自动从 Grok Voice Think Fast 1.0 切换到 Grok Voice Think Fast 2.0,完成了 xAI 于 7 月 29 日宣布的迁移计划。任何未明确锁定 grok-voice-think-fast-1.0 的开发者现在都在运行 2.0。

规格

指标Think Fast 1.0Think Fast 2.0
AA STS 质量指数75.7%82.9%
Agentic τ-voice 基准52.1%56.5%
首段音频时间1.25s0.70s
推理 token(P50)基线约为 1.0 的 40%
每分钟价格$0.05$0.08

该模型是端到端语音到语音系统——音频进、音频出——没有独立的 ASR → LLM → TTS 流水线。它支持 24 种以上语言,能应对嘈杂的电话环境,并在说话的同时进行推理而不增加延迟。工具调用可以在第一句话结束前开始。

在 xAI 的 24 语言基准上,转录准确率较 1.0 提升 1.4 倍,较领先的专用 STT 模型(Deepgram Nova 3、ElevenLabs Scribe v2)提升 1.5–2 倍。在嘈杂的电话环境下,提升幅度最高达 10 倍

竞争定位

每分钟 $0.08(每小时 $4.80)计算,Think Fast 2.0 的价格约为 OpenAI GPT-Realtime-2.1 High 的 45%。在 Artificial Analysis 语音到语音指数上,Grok Voice TF 2.0 得分 82.9%,而 GPT-Realtime-2.1 为 79.1%,Gemini 3.1 Flash 为 69.5%。在 agentic τ-voice 基准上,Grok 以 56.5% 领先,OpenAI 为 45.7%

对于构建语音代理的企业团队——呼叫中心、IVR 系统、对话式 AI——Think Fast 2.0 目前纸面上是基准领先者。每分钟价格从 $0.05 涨到 $0.08(上涨 60%)对高流量部署影响显著,但推理 token 减少 60% 降低了每次交互的计算负载,部分抵消了每分钟成本。

迁移注意事项

开发者应:

  1. 若未准备好升级到 2.0,在生产环境中锁定 grok-voice-think-fast-1.0
  2. 按每分钟 $0.08 而非原先假设的 $0.05 重新核算成本
  3. 若同时控制两端,启用二进制音频传输
  4. 为产品名称添加关键词(keyterms),并使用替换(replace)修正发音
  5. 采用 tool → wait-for-playback → response.create 的顺序,避免音频重叠
  6. 对任何非你自己服务器的客户端使用临时 token

WebSocket 端点为 wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0。支持的编解码器:PCM(8–48 kHz)、μ-law、A-law 和 Opus(24 kHz)。


Grok Imagine Video 1.5:文生视频、原生 1080p、声音参考

2026 年 7 月 31 日,xAI 发布了 Grok Imagine Video 1.5 的重大更新,新增了自 5 月上线以来一直缺失的四大能力:

文生视频生成

用户现在可以仅凭文本提示生成视频,无需提供参考图片。实现方式是将 xAI 的图像生成流水线与图生视频引擎配对——模型先从文本提示合成起始帧,再进行动画生成。这填补了与 Google Veo 3.1 和 Seedance 2.0 的功能差距,这两者自发布起就在 API 层面提供文生视频。

原生 1080p 输出

此前 Grok Imagine Video 的输出上限为 720p(所谓"1080p 开关"实际是放大后的 720p)。此次更新带来真正的原生 1080p 渲染。定价揭示了架构成本:Aurora 是自回归系统,逐帧生成,因此从 720p 扩展到 1080p 会使像素 token 增加约 2.25 倍。API 定价反映了这一点:

分辨率每秒价格
480p$0.08
720p$0.14
1080p$0.25

在 1080p 下,通过 API 生成 60 分钟视频的成本为 900 美元——而 720p 为 504 美元,Google Veo 3.1 Fast 档位定价约为 540 美元。1080p 能力填补了与竞争对手的格式差距,但并未在该分辨率上缩小成本差距。

声音参考:面部与声音一致性

最具特色的新功能:用户提供一张角色照片和一段声音样本,模型即可在每个生成场景中保持面部和声音一致。底层机制是一个说话人嵌入系统,将声音身份特征(音色、音高、韵律、口音)与语言内容分开提取。

这消除了传统上需要组合多个工具的后处理步骤。作为对比,HeyGen 的 Avatar API 对口型视频片段收费为每分钟 3 美元。Grok Imagine 的声音参考内置于全场景视频生成——不仅是数字人——属于不同的能力类别。

访问方式: 声音参考首先向美国地区的 SuperGrok Heavy 和 SuperGrok Plus 订阅用户开放,官方称数日内将更大范围推广。API 开发者必须联系 xAI 销售团队申请访问权限。

同意机制缺口: xAI 的公告未包含任何关于同意护栏(consent guardrails)的讨论。该功能需要照片和声音样本,但似乎不要求两者属于同一个人,也不要求被描绘者已经同意。考虑到 Grok 在非自愿影像方面的前科——2025 年底/2026 年初 11 天窗口内生成了约 300 万张色情化图片,随后引发联邦诉讼和 35 个州检察长的调查——在一次生成调用中结合面部和声音参考,比单独图像生成更能实现完整的非自愿亲密影像。xAI 的可接受使用政策禁止此类内容,但过往执行记录使该禁令在未披露技术控制手段的情况下难以让人放心。

多参考场景控制

一次生成最多可使用七张参考图片。每张参考锁定一个视觉元素——面部、产品、地点、道具——同时允许其他元素变化。这一锚定数量高于大多数专用参考工具,与声音参考配合,可构建面部、声音和环境背景同时锁定的角色流水线。

API 可用性: 文生视频、原生 1080p 和图片参考现在可使用标准 API key。grok-imagine-video-1.5 模型字符串取代了此前的 -preview 别名。声音参考需要销售团队授权。


竞争格局:OpenAI GPT-5.6 Sol、Terra 与 Luna

OpenAI 于 7 月 9 日发布了 GPT-5.6,这是一个三模型家族——该期间最重要的竞争性发布:

模型定位价格(每 100 万 token)
Sol旗舰,能力最强输入 $5 / 输出 $30
Terra均衡,GPT-5.5 级能力、更低成本输入 $2.50 / 输出 $15
Luna最快、最便宜、高吞吐输入 $1 / 输出 $6

OpenAI 还推出了 Ultra 模式——其最高能力档位,可协调多个智能体在并行工作流中协作——以及在 ChatGPT Work 和 Codex 中提供的 Max 推理级别

这一三档策略与 xAI 的做法形成鲜明对比。SpaceXAI 一直在围绕单一旗舰模型(Grok 4.3,然后是 4.5)整合其 API,并用订阅档位而非模型档位进行分发。OpenAI 的 Sol/Terra/Luna 分层让买家在同一个模型家族内获得性价比权衡——这对需要为不同工作负载提供不同能力档位的组织来说是一个采购优势。

与此同时,Moonshot AI 的 Kimi K3——一个 2.8 万亿参数的开源权重模型,采用混合专家(Mixture-of-Experts)架构、896 个专家和 100 万 token 上下文窗口——于 7 月底发布,号称史上最大的开源权重模型。xAI 面临来自专有和开源两个方向的竞争压力都在加剧。


值得关注

  • Grok 4.6 发布确认:关注模型 ID 是否出现在 xAI 的 API 文档和 LMArena 排行榜上。“下周"与实际 API 可用性之间的差距将说明规划时需要预留多少提前量。马斯克的交付节奏在加快,但他的日期是目标,不是承诺。
  • SpaceX 锁定期解禁潮:8 月 6 日开始第一批内部人股份解锁——约 10 亿股、约 1060 亿美元。此后每两周解锁一批,直至 12 月。抛售压力将影响 SPCX 的股价表现,进而影响市场对如此规模 AI 基础设施支出的接受度。
  • Grok 5 与 SpaceX 数据整合:用"SpaceX 产生的全部数据"训练的承诺具有战略意义。如果 SpaceX 的工程遥测、制造数据和运营日志能为 Grok 5 带来可量化的能力提升,将验证 SpaceXAI 整合的整体论点。关注任何关于数据流水线架构的技术披露。
  • Voice Think Fast 2.0 生产环境表现:基准数字纸面上很亮眼。企业部署将揭示 60% 的 token 削减和 0.70 秒的首段音频时间能否转化为现实世界的成本节省和用户体验改善。关注第三方评测和案例研究。
  • Grok Imagine 同意护栏:声音参考与面部参考结合带来了非自愿亲密视频风险。关注 xAI 是否在更大范围推广前披露技术控制手段——而不仅仅是政策禁令。
  • Starmind 卫星发射:首批搭载 AI 的卫星计划于明年发射。如果成功,太空 AI 算力将成为任何竞争对手都无法复制的差异化优势。
  • OpenAI 的竞争回应:GPT-5.6 Sol 在 Artificial Analysis 编码智能体指数上得分为 80。Grok 4.6 的基准数据——一旦公布——将被直接对比。Sol/Terra/Luna 三档定价模式可能迫使 xAI 重新考虑其单一旗舰 API 策略。

在 X 上关注 Kevin Kaminski 获取每日 AI 生态动态。下周见,继续关注下一期 xAI Weekly。