2026 年 8 月 12 日至 19 日这一周,带来了 SpaceXAI 迄今最具分量的一轮发布序列。Grok 4.6 于 8 月 12 日发布,AA Intelligence Index 达到 61——与 GPT-5.6 Sol 持平,全球排名第三。Grok Bot 于 8 月 11 日进入 Beta 测试,以共享一台云端计算机的常驻 AI 队友形态登场。Grok Imagine Image 2.0 于 8 月 7 日上线,支持区域级编辑,在 Arena 排名第二。然而,在产品发布背后,有两个故事值得严肃审视:Musk 用"所有 SpaceX 信息的集合"训练 Grok 的计划——包括约 14,000 至 15,000 名员工的工作产出,且未披露任何退出机制——以及一份深度伪造威胁报告,将 2026 年上半年 87% 的可追溯深度伪造攻击文件与 Grok 关联起来。

以下是我们对本周重要进展的专业分析。


Grok 4.6:前沿智能、激进定价、真实差距

2026 年 8 月 12 日,SpaceXAI 发布了 Grok 4.6,这是其新的旗舰前沿模型。该发布距 Grok 4.5 约五周,代表了公司迄今最强有力的竞争定位——尽管基准测试的全貌比 xAI 的营销宣传所暗示的要复杂得多。

架构与训练

Grok 4.6 建立在与 Grok 4.5 相同的 1.5 万亿参数 V9 基础之上。能力提升完全来自后训练:一轮更长的补充训练、改进的监督微调(SFT)和强化学习(RL),以及 xAI 所称的在长推理轨迹上增强的自我验证行为。该模型使用 Grok 4.5 重新生成跨推理力度、智能体框架以及 STEM、软件工程和知识工作等领域的 SFT 轨迹。

关键规格:

  • 500,000 token 上下文窗口 —— 专为长时程智能体任务而设计
  • 知识截止日期: 2026 年 2 月 1 日
  • 多模态输入(文本 + 图像),纯文本输出
  • 四个推理力度等级: 低 / 中 / 高(默认)/ xhigh(新增)
  • 原生工具:函数调用、网络搜索、X 搜索、代码执行、结构化输出
  • 兼容 OpenAI 的 Responses 和 Chat Completions API
  • 提示词缓存(缓存输入便宜 75%)和用于长智能体循环的上下文压缩

基准测试表现

Grok 4.6 的数据很亮眼,但不同工作负载的表现差异显著:

BenchmarkGrok 4.6Grok 4.5GPT-5.6 Sol MaxClaude Fable 5 Max
AA Intelligence Index61566162
CursorBench v3.269.9%66.7%67.2%70.5%
DeepSWE v1.165.9%54%73%70%
Terminal-Bench v3.026%15.7%34.6%34.1%
GPQA Diamond94.9%~94%
GDPVal-AA v21753152617281741
AA-Briefcase Elo1577131315021574
Harvey LAB (Vals)15.8%12.9%2.5%11.3%
Databricks OfficeQA Pro63.2%
APEX-Agents57.5%47.1%56.7%59.2%

Grok 4.6 在 AA Intelligence Index 上与 GPT-5.6 Sol 持平(61 对 61)——这是一项综合了智能、速度和成本的复合得分。它在 CursorBench(69.9% 对 67.2%)、GDPVal-AA(1753 对 1728)、AA-Briefcase(1577 对 1502)、APEX-Agents(57.5% 对 56.7%)和 Harvey LAB(15.8% 对 2.5%)上胜过 GPT-5.6 Sol。Harvey LAB 的结果——在法律专业工作评估上取得 6 倍优势——尤为引人注目,尽管这可能反映的是针对特定基准的优化,而非普遍的法学推理优势。

对阵 Claude Fable 5 Max,局面则有所不同。Anthropic 的模型在 AA Intelligence Index(62 对 61)、Terminal-Bench(34.1% 对 26%)、DeepSWE(70% 对 65.9%)、APEX-SWE(58.8% 对 56.4%)和 FrontierCode(63.6% 对 61.3%)上领先。Grok 4.6 则在 GDPVal-AA、CursorBench、AA-Briefcase 和 Harvey LAB 上胜出。格局很清晰:Grok 4.6 擅长知识工作和对成本敏感的任务;Anthropic 在智能体终端和软件工程方面保持优势。

一个值得注意的结果:据某一来源称,xAI 声称在 CursorBench 3.2(真实世界编码)上排名第一,尽管其他报告中 Claude Fable 5 Max 的得分更高(70.5% 对 69.9%)——这一差异很可能反映了不同的基准配置或评测条件。

定价:竞争楔子

Grok 4.6 的定价结构是其最锋利的竞争武器:

层级输入缓存输入输出
标准(<200K token)$2/M$0.50/M$6/M
长上下文(≥200K token)$4/M$1/M$12/M

与每百万 token $5/$30 的 GPT-5.6 Sol 相比,Grok 4.6 的成本约为其输入价格的 40%输出价格的 20%。对阵 Claude Fable 5 Max,节省幅度达 80–88%。这是市场上最具攻击性的前沿模型定价。

一个关键细节:提示词 token 数一旦超过 200K 阈值,整个请求将按更高的长上下文费率重新计价——而不仅仅是超过 200K 的部分。运行在接近该边界的企业应谨慎设计提示词架构,以避免意外的成本攀升。

Artificial Analysis 运行中的成本效率显示,Grok 4.6 完成任务的成本约为每个任务 $0.66–0.84——比 GPT-5.6 Sol 或 Fable 5 的同类模型便宜 32–73%。长程评测平均约 53 轮、约 5 亿输入 token,而 Claude Opus 5 Max 约为 103 轮、20 亿 token,表明在持续的智能体工作负载上效率显著更高。

可用性

Grok 4.6 发布当日即覆盖以下平台:

  • xAI API、Cursor、Grok Build、Grok Bot、OpenRouter、Vercel、Cloudflare(8 月 12 日)
  • GitHub Copilot(8 月 14 日)—— 加入 Pro、Pro+、Max、Business 和 Enterprise 各层级,覆盖 VS Code、Visual Studio、Copilot CLI、JetBrains、Xcode、Eclipse 和云端智能体

GitHub Copilot 的集成意义重大:它让 Grok 4.6 在发布后 48 小时内便触达 GitHub 庞大的开发者群体。SuperGrok 订阅用户($30/月)可在 Grok Build 中获得访问权限,首周促销在 Cursor 和 Grok Build 中提供 2 倍包含用量

注意事项

有几个注意事项需要为头条数字降温:

  • 多张基准测试表为厂商自报;“与 GPT-5.6 Sol 持平"的说法在某些媒体上以 xAI 自身主张的形式出现,而非独立验证
  • 一些评测者指出首 token 延迟较慢——对交互式编码工作流而言是个值得注意的问题
  • 与顶级模型的编码基准差距依然存在,尤其在 Terminal-Bench 和 DeepSWE 上
  • 企业定位的转变是有意为之:SpaceXAI 称 Grok 4.6 是"第一个从头为长时运行智能体打造的 SpaceXAI 模型”——从消费级聊天机器人向企业智能体平台的转型

Grok Bot:常驻 AI 队友——以及一个安全架构落差

2026 年 8 月 11 日,SpaceXAI 推出了处于 Beta 测试阶段的 Grok Bot——进军"AI 队友"品类。该产品主打常驻型 AI 智能体:登录客户的工具,跨应用工作,无需持续监督即可完成多步骤任务。

发布了什么

每个 Bot 都是云端计算机上的具名、持久智能体(一台带有浏览器、文件系统和终端的 Linux 虚拟机),在你合上笔记本电脑后仍会继续工作。Bots 使用你的凭据登录你现有的应用,通过计算机操作来驱动缺乏干净 API 的用户界面——如 Gmail、Slack、CRM 及类似工具。

关键能力:

  • 示范学习: 观看一次任务;Bot 将其保存为 routine,按计划或事件触发器自动执行(每个 Bot 最多约 50 个 routines)
  • Bot 间协调: 多个 Bots 可以互相发消息、在线程中共享上下文,并在群聊中协调——在彼此之间交接工作、分配归属
  • 持久上下文: Bots 跨对话保留信息,随时间学习偏好和边界情况
  • 平台可用性: macOS、Windows、Linux、iOS(Android"即将推出");企业访问需通过候补名单,支持 SSO、SCIM 和 RBAC

底层模型在 Beta 开始时为 Grok 4.5,8 月 12 日后切换为 Grok 4.6

共享计算机的问题

Grok Bot 发布中最具深远影响的细节,是营销文案与安全架构文档之间的落差。

发布页写道:“Bots 拥有自己的计算机。” 这种表述暗示隔离——每个 Bot 都在自己的沙盒环境中运行,拥有独立的凭据和受控的爆炸半径。

xAI 自己的文档却另有说法。根据 Grok Bot 概览页:“你的所有 Bots 使用同一台持久云端计算机。” 这台计算机只对你的账户隔离,而非对单个 Bot 隔离。每个 Bot 在那台机器上有自己的屏幕,但文件、浏览器会话和命令行凭据在整个 Bot 队伍之间共享。

文档明确写道:

“不要将单独的 Bots 用作安全边界。”

这意味着一个 Bot 建立的凭据——登录态、API key、会话 token——同一账户上的其他所有 Bot 都可以访问。Bot 删除是软删除: 移除一个 Bot 会删除其个人资料、对话和 routines,但共享计算机上的文件和登录态可能仍然存在,在源头撤销之前,其余 Bots 仍可访问。

对企业评估而言,这种架构是有其合理性的——它让 Bots 能以低成本相互交接工作——但它要求将整个 Bot 队伍视为单一身份面。任何安全审查都必须将访问建模为"任何 Bot 可达的一切",而非按 Bot 隔离。营销文案让这一点更难向利益相关方传达,因为他们有理由从"自己的计算机"推断出隔离的含义。

定价与获取

Grok Bot 没有独立定价。其访问权限捆绑在三个现有订阅层级中:

层级价格提供商
SuperGrok Heavy$300/月(3 个月 $99 促销价)SpaceXAI
Cursor Ultra$200/月Cursor
Cursor Teams Premium$120/席位/月Cursor

xAI 称之为"早期 Beta",带有用量限制。Musk 表示修复完成后将扩大访问范围。企业访问(SSO、SCIM、RBAC)需通过候补名单排队。

分发策略值得注意:Grok Bot 搭载在客户已经付费的订阅之中,将 SpaceXAI 的智能体战略与 Cursor 的基础设施捆绑在一起——反映出 SpaceX 于 2026 年 6 月以 $600 亿收购 Cursor(Anysphere)。


Grok Imagine Image 2.0:区域感知编辑,竞技场排名第二

2026 年 8 月 7 日至 8 日,SpaceXAI 以 grok.com/imagine 以及 iOS 和 Android 应用上新的 Quality Mode 形式推出 Grok Imagine Image 2.0。该模型以 SpaceXAI 名义出现在 Arena 上。

新能力

  • 区域级编辑: 魔棒工具只编辑你指向的区域,其余部分保持不变;分割功能可精确选中区域;背景移除可将任意主体导出为透明背景
  • 多参考融合: 单次生成最多可使用 5 张输入图像(据某一来源为 3 张),无需手动合成
  • 一个模型同时用于生成和编辑 —— 无需分开的工作流
  • 1K/2K 分辨率层级,13 种纵横比
  • 模板: 为常见工作流提供现成的起点——照片编辑、产品图、头像、图标、游戏资产

竞技场排名与一个营销细节

截至 8 月 7 日,Image 2.0 在 Arena Text-to-Image(Elo 约 1,320)和 Arena Image Edit(Elo 约 1,439)两个排行榜上均排名全球第二——仅次于 OpenAI 的 GPT Image 2(1,380 / 1,463)。据某一来源称,它后来被微软的 MAI-Image-2.6 挤至第三。

一个值得注意的营销细节:Arena 上排名第二的条目是**“低"计算变体**(grok-imagine-image-2 (low));质量变体在排行榜上的排名更低。面向消费者的"Quality Mode"使用更高计算量的模型,因此获得最佳输出的用户未必在使用赢得排名的那个模型。这并非欺骗——Arena 排名反映的是提交上去的内容——但它模糊了竞争主张。


Grok 4.7:SpaceX 数据训练与一场隐私风暴

展望未来,Musk 在一场全员大会(公开发布在 X 上)上宣布,Grok 4.7 正在使用"大量 SpaceX 公司数据"进行补充训练,并将在"3 到 4 周内准备好”——目标定在 2026 年 9 月初至中旬。据报道的规格(未经证实,无模型卡):约 2.1T 参数,而 4.6 为 1.5T。

Musk 声称 Grok 4.7 “将超越当前所有模型”,并说他"如果任何模型在真实世界的工程上更胜一筹,会感到震惊"——得益于独一无二的 SpaceX 语料库:Starlink 遥测数据、Raptor 发动机日志、Starship 再入数据,以及 Slack/Jira/GitHub/ERP 工件。

员工数据问题

争议的焦点不在模型本身,而在训练数据。

Musk 告诉 SpaceX 员工,Grok 将使用**“所有 SpaceX 信息的集合”**进行训练——并补充说,“所以从某种意义上说,它将基于你们来训练。你们实际上将成为这个 AI 的父母。”

这份公告缺失的内容:

  • 未披露包含哪些数据类别(通信、日志、指标、行为数据)
  • 未描述任何退出机制
  • 没有关于数据如何采集、过滤或保护的隐私协议
  • 没有范围限制 ——“集合"意味着一切,包括内部通信和决策模式

大约有 14,000 至 15,000 名 SpaceX 员工可能被纳入范围。法律环境尚不明朗:职务作品原则覆盖工作产出,但持续的行为采集(键盘输入、决策模式、通信元数据)处于灰色地带。据 TechTimes 报道,由于管辖权缺口,SpaceX 员工无法向 NLRB 提出指控。

Meta 的先例

最接近的类比是 Meta 的 Model Capability Initiative(2026 年 4 月),该项目采集员工的键盘输入、鼠标点击和截图来训练内部 AI 模型。结果是:

  • 约 1,600 名员工签署请愿书反对该项目
  • 6 月发生 SEV 2 事件,私人数据在全公司范围内泄露
  • 项目在泄露后被暂停

SpaceXAI 尚未说明是否研究了 Meta 的失败,或是否落实了防止类似结果的保障措施。没有任何已披露的治理框架——再加上 Musk 公开而宽泛的表述——构成了真实的监管和声誉风险。欧盟委员会、加州总检察长、英国和澳大利亚当局已经就其他事项对 X 和 Grok 展开调查。

企业应提出的治理问题

对于任何评估 SpaceXAI 模型的企业而言,SpaceX 的训练计划提出了超越眼前争议的治理问题:

  1. 数据溯源: SpaceXAI 能否证明通过 API 交付的模型没有使用不当获取的员工行为数据进行训练?
  2. 监管敞口: 如果调查发现训练计划在任何司法管辖区违反了隐私法,正在生产环境中使用这些模型的客户有何补救路径?
  3. 员工同意基础设施: SpaceX 是否拥有 AI 训练中知情同意的框架,还是"你们将成为这个 AI 的父母"就是全部披露内容?

这些不是假设性的担忧。它们是任何合规团队在承诺将 Grok 作为生产依赖之前都应提出的采购尽职调查问题。


深度伪造危机:87% 的可追溯攻击与 Grok 相关联

本周最令人震惊的数据点来自 Resemble AI 的 H1 2026 深度伪造威胁报告,于 8 月 12 日发布。

数据

  • 来自 1,760 篇新闻报道的 821 起有记录的深度伪造攻击
  • 生成约 346 万个合成文件
  • 至少 15,736 名确认受害者
  • 六个月媒体覆盖:2,928 亿次曝光——几乎相当于 2025 全年的 2964 亿次
  • 87% 的可追溯文件被归因于 Grok
  • 每 6 起攻击中就有 1 起(137 起)涉及针对成人或未成年人的非自愿亲密影像(NCII)

规模令人震惊。Grok 在可追溯深度伪造领域的主导地位——在能够识别生成模型的文件中占 87%——既反映了 Grok 的市场地位,也反映了其图像生成工具的相对易用性。报告并未指控 xAI 有意促成或便利这些用途;归因基于对生成文件的技术指纹识别。

监管与法律敞口

多个监管机构已展开调查:

  • 欧盟委员会 —— 依据 DSA 条款调查 X 和 Grok
  • 加州总检察长 —— 审查对州深度伪造和 NCII 法律的合规情况
  • 英国澳大利亚 —— 对 Grok 平台实践展开独立调查

依据美国法典第 15 编第 6851 条(15 U.S.C. §6851),对允许或分发非自愿影像的公司,法定民事敞口估计约为 $22.4 亿

方法论注意事项

该报告仅基于公开报道的事件和可追溯文件。实际数字很可能更高。Resemble AI 还发布了 DETECT-World,一个旨在识别来自未见过的生成器的合成内容的检测模型——这是一个有用的防御工具,但治标不治本。

这对企业意味着什么

这份深度伪造报告并不意味着企业应该避开 Grok。它意味着任何使用 Grok 图像生成能力的组织都需要:

  • 可接受使用政策,明确禁止未经同意生成真实人物的合成媒体
  • 输出监控,针对可能违反 NCII 或诽谤法的生成内容
  • 供应商风险评估,将 xAI 的内容审核基础设施(或缺乏)纳入考量
  • 事件响应预案,应对可追溯到本组织 API 使用记录的深度伪造

周边动态:River AI 融资 $11 亿

本周值得一提:由 Igor Babuschkin(xAI 联合创始人;前 DeepMind/OpenAI)创立的 River AI,在种子轮 + A 轮融资中筹集了 $11 亿,投后估值约 $50 亿。本轮由 General Catalyst 和 AMP PBC 联合领投,Nvidia、AMD Ventures、Temasek、Y Combinator 和 a16z 参投。

River AI 成立仅两个月,还没有产品。其主张是:开放权重、用户所有、可本地推理的个人与企业 AI。这笔融资之所以值得关注,是因为 Babuschkin 曾参与构建最初的 Grok——而他离开 xAI 后,一个开放权重竞争对手立即获得巨额融资,表明前沿模型市场远未尘埃落定。投资名单(Nvidia、AMD Ventures)也表明硬件公司正在开放与封闭模型生态之间对冲押注。

竞争对手背景:Qwen 3.8-Max 于 8 月 12 日发布开放权重(定制许可,非 Apache;视觉 + 1M 上下文,仅 API)。DeepSeek V4 Pro 获得了 API 更新。Meta 发布了 Muse Glimmer 30B(Apache 2.0)。开放权重生态继续产出可与封闭前沿模型抗衡的可信替代品。


值得关注的事

  • Grok 4.7 发布时间线: Musk 的"3 到 4 周"目标将发布定在 9 月初至中旬。关注 SpaceX 数据训练争议是否会在发布前迫使任何披露或治理变更。docs.x.ai 上尚无模型卡、定价或上下文窗口信息。
  • SpaceX 员工数据治理: 关注员工反弹、监管行动,或 SpaceXAI 对训练数据治理框架的披露。Meta 的先例(请愿 → 泄露 → 暂停)是一条合理的路径。
  • 深度伪造监管行动: Resemble AI 的报告已引起欧洲、加州、英国和澳大利亚监管机构的关注。关注针对 X 或 SpaceXAI 的具体执法行动,尤其是依据 DSA 或 15 U.S.C. §6851。
  • Grok 4.6 独立基准测试: 该模型已列入 LMArena 评测。独立基准验证——尤其是在 xAI 数据最弱的 Terminal-Bench 和 DeepSWE 上——将决定综合得分在 xAI 自有评测套件之外是否站得住脚。
  • Grok Bot 安全披露: “自己的计算机"与"一台共享计算机"之间的落差将在企业安全审查中浮现。关注 xAI 是否会更新营销文案、增加技术隔离控制,或发布安全架构文档。
  • Grok Bot 模型披露: xAI 对哪个模型为 Grok Bot 提供动力保持沉默,这很不寻常。如果 Bots 运行在更小或更便宜的模型上,其能力上限和成本经济性与买家的假设将存在差异。
  • River AI 轨迹: 手握 $11 亿和一位可信的创始人,关注其首个产品发布。一位前 xAI 架构师推出的开放权重前沿模型将重塑竞争格局。
  • SpaceX 解禁潮: 第一轮内部人士股票解禁始于 8 月 6 日,此后每两周一批,持续到 12 月。抛售压力将影响 SPCX 的股价表现,进而影响市场对 SpaceX 当前资本支出规模下 AI 基础设施投资的接受度(据最近一次财报电话会议,季度资本支出为 $184 亿)。

在 X 上关注 Kevin Kaminski,获取每日 AI 生态动态。下周再见,敬请期待下一期 xAI 周报。