2026 年 8 月 8 日至 14 日这一周,是 SpaceXAI 的产品发布马拉松。三大重磅发布接连落地:Grok Imagine Image 2.0 于 8 月 7 日至 8 日推出,Grok Bot 于 8 月 11 日进入 Beta 测试,Grok 4.6 —— 新的旗舰前沿模型 —— 于 8 月 12 日发布。每一款产品都针对技术栈的不同层面:图像生成、智能体工作流和核心模型能力。综合来看,它们勾勒出一家以极少竞争对手能企及的节奏、在全产品面上持续交付的公司图景。
以下是我们对本周重要进展的专业分析。
Grok 4.6:半价的前沿智能
2026 年 8 月 12 日,SpaceXAI 发布了其新的旗舰大语言模型 Grok 4.6。该发布比 DeepSeek 的 V4 Pro 正式可用仅晚数小时——这一时间安排上的细节,凸显了前沿模型层级的激烈竞争态势。
架构与训练
Grok 4.6 是一个 1.5 万亿参数模型,建立在与 Grok 4.5 相同的 V9 基础之上。其能力提升并非来自参数规模的扩展,而是来自一次大幅延长的补充训练:使用经过精选的模型生成数据来训练推理能力、高质量工程数据,以及改进的优化器。随后,SpaceXAI 使用 Grok 4.5 重新生成了跨推理力度、智能体框架以及 STEM、软件工程和知识工作等领域的监督微调(SFT)轨迹——通过基于模型的检查过滤掉有问题的轨迹。强化学习阶段则在广泛的智能体 RL 任务上训练,包括内核优化、Web 开发和计算机辅助设计。
该模型拥有 500,000 token 的上下文窗口,专为长时程智能体任务、多步骤编码和高强度的交互式工作而设计。SpaceXAI 的公告强调,Grok 4.6 能"在众多步骤中持续跟进复杂任务",并在更长的轨迹上展现出更强的自我测试与验证能力。
基准测试表现
Grok 4.6 的基准测试画像显示,它在多个维度上匹配或超越前沿竞争对手,但仍存在明显差距:
| 基准测试 | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| FrontierCode v1.1 | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | — | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
情况颇为微妙。Grok 4.6 在 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平(61 对 61),并在 CursorBench(69.9% 对 67.2%)、GDPVal-AA(1753 对 1728)、AA-Briefcase(1577 对 1502)、APEX-Agents(57.5% 对 56.7%)和 Harvey LAB(15.8% 对 2.5%)上胜过它。对阵 Anthropic 的 Claude Fable 5 Max,Grok 4.6 在 GDPVal-AA、CursorBench、AA-Briefcase 和 Harvey LAB 上胜出,但在 Terminal-Bench(26% 对 34.1%)、DeepSWE(65.9% 对 70%)以及综合 AA Intelligence Index(61 对 62)上落后。
Harvey LAB 的结果尤其引人注目:Grok 4.6 得分 15.8%,而 GPT-5.6 Sol 仅为 2.5%——在法律专业工作评估上具有 6 倍优势。这是否代表真正的能力优势,还是针对特定基准的优化,仍有待独立测试验证。
定价:竞争楔子
Grok 4.6 的定价是其最锋利的竞争武器:
- 标准版: 每百万输入 token $2,每百万输出 token $6
- 快速版: 每百万输入 $4,每百万输出 $12(标准版的 2 倍)
SpaceXAI 明确将其营销为"其他前沿模型价格的一半"。与 Anthropic 的 Fable 5 Max 相比,节省幅度惊人:输入成本约便宜 80%,输出成本约便宜 88%。对于运行高负载工作负载的企业 API 用户而言,这种定价结构从根本上改变了前沿模型部署的单位经济性。
问题在于,这一定价反映的是持久的成本优势——SpaceXAI 独家的 Nvidia Vera Rubin 基础设施和 SpaceX 电力基础设施——还是临时的获客策略。上周的 SpaceX 财报电话会议披露季度资本支出达 $184 亿,表明基础设施投资是真实且持续的。
可用性
Grok 4.6 已可在以下平台立即使用:
- Cursor(代码编辑器,同日上线)
- Grok Build(SpaceXAI 的应用构建工具)
- xAI API 控制台
- 第三方平台: OpenRouter、Vercel、Cloudflare
SpaceXAI 在 Cursor 和 Grok Build 中提供首周 2 倍包含用量,以鼓励采用。
(xAI 公告、SiliconANGLE、NextBigFuture)
Grok Bot:共享一台计算机的 AI 队友
2026 年 8 月 11 日,SpaceXAI 推出了处于 Beta 测试阶段的 Grok Bot——这是其进军"AI 队友"品类的产品。该产品主打常驻型 AI 智能体:登录客户的工具,跨应用和收件箱工作,无需持续监督即可完成多步骤任务。用户像对待同事一样从桌面端或 iOS 应用给 Bots 发消息、布置任务,然后让它们自行运行。
发布了什么
Grok Bot 是一条独立的产品线——不是编码智能体,也不是从提示词生成应用的构建器。它是一个"AI 队友"应用,使用与人类相同的方式跨应用操作,包括没有干净 API 或 MCP 集成的平台。用户离开时任务继续执行;Bot 只在需要审批时才回来。
关键能力包括:
- 示范学习: 让 Bot 看你做一遍工作;它会将步骤保存为 routine,下次自行运行。“Teach a task” 录制上限为十分钟。
- Bot 间协调: 多个 Bots 可以互相发消息、在线程中共享上下文,并在群聊中协调——在彼此之间交接工作、分配归属。
- 持久上下文: Bots 会跨对话保留信息,随时间学习偏好和边界情况。
- Routines: Skills 描述如何执行任务;routines 则将工作流分配给某个 Bot,并附带计划或事件触发器。
xAI 表示,该产品最初是内部原型,在公开推出之前已用于 SpaceXAI 合并后的整个运营体系,包括销售外呼、营销活动、办公室运营和 bug 修复。
安全架构的落差
Grok Bot 发布中最值得关注的细节,是营销文案与安全架构文档之间的落差。
发布页写道:“Bots 拥有自己的计算机。” 这种表述暗示隔离——每个 Bot 都在自己的沙盒环境中运行,拥有独立的凭据和受控的爆炸半径。
xAI 自己的文档却另有说法。根据 Grok Bot 概览页:“你的所有 Bots 使用同一台持久云端计算机。” 这台计算机只对你的账户隔离,而非对单个 Bot 隔离。每个 Bot 在那台机器上有自己的屏幕,但文件、浏览器会话和命令行凭据在整个 Bot 队伍之间共享。
文档在两个独立页面(FAQ 和审批/安全页)上用相同的措辞明确写道:
“不要将单独的 Bots 用作安全边界。”
这意味着一个 Bot 建立的凭据——登录态、API key、会话 token——同一账户上的其他所有 Bot 都可以访问。Bot 删除是软删除: 移除一个 Bot 会删除其个人资料、对话和 routines,但共享计算机上的文件和登录态可能仍然存在,在源头撤销之前,其余 Bots 仍可访问。
对企业评估而言,这种架构是有其合理性的——正是它让 Bots 能以低成本相互交接工作——但它要求将整个 Bot 队伍视为单一身份面。任何安全审查都必须将访问建模为"任何 Bot 可达的一切",而非按 Bot 隔离。而营销文案让这一点更难向利益相关方传达,因为他们有理由从"自己的计算机"推断出隔离的含义。
定价与获取
Grok Bot 没有独立定价。其访问权限捆绑在三个现有订阅层级中:
| 层级 | 价格 | 提供商 |
|---|---|---|
| Cursor Ultra | $200/月 | Cursor |
| Cursor Teams Premium | $120/席位/月 | Cursor |
| SuperGrok Heavy | 已包含 | SpaceXAI |
企业访问权限需要通过候补名单排队。Android 应用被标注为"即将推出"。值得注意的是,xAI 没有披露哪个模型为 Grok Bot 提供动力——无论是在发布帖、产品页,还是所审阅的任何文档页面上。任何关于其能力的假设都应仅视为假设。
分发策略
Cursor 的层级捆绑是这桩商业故事的核心。Grok Bot 搭载在客户已经付费的订阅之中,这比单独销售席位是更便宜的分发路径。它也将 SpaceXAI 的智能体战略与 Cursor 的基础设施捆绑在一起——xAI 页面上的下载构建、入门流程和销售联系方式都经由 Cursor。两家公司的产品栈在发布时明显相互咬合,反映出 SpaceX 于 6 月以 $600 亿收购 Cursor(Anysphere)。
(Unite.AI、Bloomberg via Yahoo Finance、Digital Applied)
Grok Imagine Image 2.0:区域感知编辑,竞技场排名第二
2026 年 8 月 7 日至 8 日,SpaceXAI 开始以 grok.com/imagine 以及 iOS 和 Android 应用上新的 Quality Mode 形式推出 Grok Imagine Image 2.0。Elon Musk 于 8 月 8 日在 X 上发帖宣布"Grok Imagine 图像编辑的重大升级"。
新能力
Image 2.0 围绕"生成可用于实际工作的图像"这一目标构建,带来了多项值得注意的新增功能:
- 区域感知编辑: 魔棒工具只编辑你指向的区域,其余部分保持不变。分割功能可精确选中图像中的区域。背景移除可将任意主体导出为透明背景。
- 多参考编辑: 单次生成最多可使用 5 张输入图像,无需手动合成。
- 智能缩放: 选择纵横比,模型自动填充画面,以任意尺寸生成一张图像。
- 改进的文本渲染: 排版和布局会"像设计师那样"规划,让密集的多元素画面保持整体感,小号文字也能清晰呈现。
- 模板: 为常见工作流提供现成的起点——照片编辑、产品图、头像、图标、游戏资产——工作流已预配置。
- 为视频构建世界: 分别生成角色、场景和道具,同时保持图像之间风格一致——专为下游视频制作而设计。
竞争定位
Image 2.0 在 Arena Text-to-Image 和 Arena Image Edit 两个排行榜上均排名全球第二(截至 2026 年 8 月 7 日)。xAI 的模型在 Arena 上以 SpaceXAI 名义出现。该公司未点名排名第一的竞争对手是谁,但这一排名将 Grok Imagine 置于图像生成与编辑系统的第一梯队。
API 访问
与 Imagine Image 2.0 面向消费者的可用性不同,该模型还可通过 API 以 grok-imagine-image-2.0 的名称访问,完整文档见 xAI 开发者文档。这与前一周 Grok Imagine Video 语音参考功能(需要销售团队授权)的做法不同——Image 2.0 对任何持有标准 API key 的开发者开放。
竞争格局:DeepSeek V4 Pro、OpenAI 与 Anthropic
Grok 4.6 在 DeepSeek V4 Pro 正式可用后数小时内发布——这是一个刻意的信号,表明 SpaceXAI 打算与新兴的中国前沿模型生态正面竞争。DeepSeek 的 V4 Pro 是中国实验室一系列强力发布中的最新一款,而同日发布的时机表明前沿模型竞赛正日益多极化。
三大西方实验室的竞争定位:
| 模型 | AA Intelligence Index | 价格(每百万 token 输入/输出) |
|---|---|---|
| Grok 4.6 | 61 | $2 / $6 |
| GPT-5.6 Sol | 61 | $5 / $30 |
| Claude Fable 5 | 62 | 更高层级贵得多 |
Grok 4.6 在综合指数上与 GPT-5.6 Sol 持平,而输入价格约为其 40%,输出价格约为其 20%。对阵 Claude Fable 5 Max,节省幅度达 80–88%。这是市场上最具攻击性的前沿模型定价——而且只有当 SpaceXAI 的基础设施成本基础(Nvidia Vera Rubin、SpaceX 电力基础设施)确实带来更低的每 token 计算成本时,它才可持续。
与此同时,Anthropic 和 OpenAI 在特定基准上继续保有优势。Claude Fable 5 Max 在 Terminal-Bench(34.1% 对 Grok 的 26%)、DeepSWE(70% 对 65.9%)和 APEX-SWE(58.8% 对 56.4%)上领先——这些全是智能体编码和终端使用类基准。GPT-5.6 Sol 在 DeepSWE(73%)和 Terminal-Bench(34.6%)上大幅领先。Grok 4.6 的优势则集中在知识工作(AA-Briefcase、GDPVal-AA)、法律专业工作(Harvey LAB)以及某些编码任务(CursorBench、FrontierCode)上。
对企业买家的启示:模型选择不再是单一维度的。Grok 4.6 是知识工作和对成本敏感的高负载部署的最强选择。Anthropic 在智能体终端和软件工程任务上保持优势。OpenAI 在深度 SWE 工作负载上领先。正确答案取决于工作负载本身,而性价比权衡的差异已经大到多模型策略越来越理性的程度。
值得关注的事
- Grok Bot 安全披露: “自己的计算机"与"一台共享计算机"之间的落差将在企业安全审查中浮现。关注 xAI 是否会更新营销文案、增加技术隔离控制,或发布安全架构文档。当前的矛盾对任何采购流程而言都是隐患。
- Grok 4.6 独立基准测试: 该模型已列入 LMArena 评测。独立基准验证——尤其是在 xAI 数据最弱的 Terminal-Bench 和 DeepSWE 上——将决定 Grok 4.6 的综合得分在 xAI 自有评测套件之外是否站得住脚。
- Grok 4.6 在 Cursor 中的生产环境表现: Cursor 和 Grok Build 中的 2 倍用量奖励旨在推动采用。关注开发者反馈:该模型的长时程智能体表现——自我测试、验证、持续的多步骤推理——在真实编码工作流中是否经得起考验。
- Grok Bot 模型披露: xAI 对哪个模型为 Grok Bot 提供动力保持沉默,这很不寻常。如果是 Grok 4.6,公开说明将强化该模型的定位。如果不是——如果 Bots 运行在更小或更便宜的模型上——其能力上限和成本经济性与买家的假设将存在差异。
- Imagine Image 2.0 API 采用: Image 2.0 的 API 使用标准 key 即可访问——无需销售团队。关注采用率,以及排名第二的 Arena 排名能否转化为开发者对 OpenAI 和 Google 既有图像 API 的偏好转移。
- DeepSeek V4 Pro 的竞争冲击: DeepSeek 的 V4 Pro 与 Grok 4.6 同日发布。如果它以有竞争力的定价匹配或超越前沿基准,所有西方实验室面临的定价压力都将加剧。关注独立基准对比。
- SpaceX 解禁潮: 第一轮内部人士股票解禁始于 8 月 6 日,此后每两周一批,持续到 12 月。抛售压力将影响 SPCX 的股价表现,进而影响市场对 SpaceX 当前资本支出规模下 AI 基础设施投资的接受度。
在 X 上关注 Kevin Kaminski,获取每日 AI 生态动态。下周再见,敬请期待下一期 xAI 周报。