2026 年 8 月 12 日至 19 日這一週,帶來了 SpaceXAI 迄今最具影響力的一波發布序列。Grok 4.6 於 8 月 12 日出貨,AA Intelligence Index 達 61——追平 GPT-5.6 Sol,位居全球第三。Grok Bot 於 8 月 11 日進入測試版,以共享單一雲端電腦的持久 AI 隊友形式登場。Grok Imagine Image 2.0 於 8 月 7 日推出,具備區域級編輯功能與競技場第二名排名。然而,在產品發布背後,有兩則故事值得嚴肅檢視:Musk 計畫以「所有 SpaceX 資訊的總和」訓練 Grok——包括約 14,000 至 15,000 名員工的工作產出,且未揭露任何退出(opt-out)機制——以及一份深偽(deepfake)威脅報告,指出 2026 上半年 87% 可追溯的深偽攻擊檔案與 Grok 有關。
以下是我們針對本週重要發展的專業分析。
Grok 4.6:前沿智慧、激進定價、真實落差
2026 年 8 月 12 日,SpaceXAI 發布 Grok 4.6,其全新旗艦前沿模型。這次發布距離 Grok 4.5 約五週,代表該公司迄今最強的競爭定位——儘管基準測試的全貌比 xAI 的行銷宣傳更為微妙。
架構與訓練
Grok 4.6 建立在與 Grok 4.5 相同的 1.5 兆參數 V9 基礎之上。進步完全來自後訓練(post-training):更長的補充訓練、改良的監督式微調(SFT)與強化學習(RL),以及 xAI 所稱在長推理軌跡上增強的自我驗證行為。該模型使用 Grok 4.5 重新生成涵蓋不同推理努力程度、代理框架(agent harnesses)與 STEM、軟體工程、知識工作等領域的 SFT 軌跡。
關鍵規格:
- 50 萬 tokens 上下文視窗——專為長時程代理任務打造
- 知識截止日期: 2026 年 2 月 1 日
- 多模態輸入(文字 + 影像),僅文字輸出
- 四種推理努力程度: low / medium / high(預設)/ xhigh(新增)
- 原生工具:函式呼叫、網頁搜尋、X 搜尋、程式碼執行、結構化輸出
- 相容 OpenAI 的 Responses 與 Chat Completions API
- Prompt 快取(快取輸入便宜 75%)與適用於長代理迴圈的上下文壓縮(context compaction)
基準測試表現
Grok 4.6 交出亮眼成績,但不同工作負載之間的表現差異顯著:
| Benchmark | Grok 4.6 | Grok 4.5 | GPT-5.6 Sol Max | Claude Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| GPQA Diamond | 94.9% | — | ~94% | — |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| AA-Briefcase Elo | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
| Databricks OfficeQA Pro | 63.2% | — | — | — |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
Grok 4.6 在 AA Intelligence Index 上追平 GPT-5.6 Sol(61 對 61)——這是一個綜合智慧、速度與成本的加權分數。它在 CursorBench(69.9% 對 67.2%)、GDPVal-AA(1753 對 1728)、AA-Briefcase(1577 對 1502)、APEX-Agents(57.5% 對 56.7%)與 Harvey LAB(15.8% 對 2.5%)上擊敗 GPT-5.6 Sol。Harvey LAB 的結果——在法律專業工作評估上取得 6 倍優勢——特別引人注目,儘管它可能反映的是針對特定基準測試的最佳化,而非普遍的法律推理優勢。
對上 Claude Fable 5 Max,局面則有所不同。Anthropic 的模型在 AA Intelligence Index(62 對 61)、Terminal-Bench(34.1% 對 26%)、DeepSWE(70% 對 65.9%)、APEX-SWE(58.8% 對 56.4%)與 FrontierCode(63.6% 對 61.3%)上領先。Grok 4.6 則在 GDPVal-AA、CursorBench、AA-Briefcase 與 Harvey LAB 上獲勝。模式很明確:Grok 4.6 擅長知識工作與成本敏感任務;Anthropic 在代理式終端機與軟體工程上保有優勢。
一項值得注意的結果:根據某個來源,xAI 宣稱在真實世界程式開發的 CursorBench 3.2 上排名第一,儘管在其他報告中 Claude Fable 5 Max 的分數更高(70.5% 對 69.9%)——這個差異可能反映不同的基準配置或評測條件。
定價:競爭的利刃
Grok 4.6 的定價結構是其最鋒利的競爭武器:
| Tier | Input | Cached Input | Output |
|---|---|---|---|
| Standard (<200K tokens) | $2/M | $0.50/M | $6/M |
| Long-context (≥200K tokens) | $4/M | $1/M | $12/M |
相較於 GPT-5.6 Sol 的每百萬 tokens $5/$30,Grok 4.6 的 input 價格約為其 40%、output 價格約為其 20%。對上 Claude Fable 5 Max,節省幅度達到 80–88%。這是市場上最具攻擊性的前沿模型定價。
一個關鍵細節:跨越 200K tokens 的 prompt 門檻,會以較高的長上下文費率重新計價整個請求——而不只是 200K 以上的 tokens。營運接近該邊界的企業應謹慎設計 prompt 架構,以避免意外的成本攀升。
在 Artificial Analysis 上的成本效率評測顯示,Grok 4.6 完成任務的單價約為 $0.66–0.84——比 GPT-5.6 Sol 或 Fable 5 的同等級模型便宜 32–73%。長程評測平均約 53 輪、約 5 億 input tokens,相較之下 Claude Opus 5 Max 約 103 輪、約 20 億 tokens,顯示在持續的代理工作負載上效率顯著更佳。
可用性
Grok 4.6 上市當日即在下列平台開放使用:
- xAI API、Cursor、Grok Build、Grok Bot、OpenRouter、Vercel、Cloudflare(8 月 12 日)
- GitHub Copilot(8 月 14 日)——加入 Pro、Pro+、Max、Business 與 Enterprise 方案,涵蓋 VS Code、Visual Studio、Copilot CLI、JetBrains、Xcode、Eclipse 與雲端代理
GitHub Copilot 整合意義重大:它讓 Grok 4.6 在發布 48 小時內就出現在 GitHub 龐大的開發者基礎面前。SuperGrok 訂閱者(每月 $30)可在 Grok Build 內使用,且第一週促銷提供 Cursor 與 Grok Build 的 2 倍包含用量。
注意事項
有幾項警語為這些頭條數字降溫:
- 部分基準測試表格為供應商自行回報;「追平 GPT-5.6 Sol」的說法在某些媒體上以 xAI 自家宣稱的形式出現,而非獨立驗證
- 部分評論者指出首個 token 延遲較慢——對互動式程式開發工作流程而言是實際問題
- 與頂尖模型的程式開發基準差距仍然存在,尤其是 Terminal-Bench 與 DeepSWE
- 企業定位的轉變是刻意的:SpaceXAI 稱 Grok 4.6 為「第一款從零開始為長時程代理打造的 SpaceXAI 模型」——從消費者聊天機器人轉向企業代理平台的關鍵轉折
Grok Bot:持久 AI 隊友——以及安全架構的落差
2026 年 8 月 11 日,SpaceXAI 推出 Grok Bot 測試版——進軍「AI 隊友」類別。該產品主打隨時在線的 AI 代理:登入客戶的工具、跨應用程式運作,並在無需持續監督的情況下完成多步驟工作。
發布內容
每個 Bot 都是雲端電腦上的具名、持久代理(一台配備瀏覽器、檔案系統與終端機的 Linux VM),在你闔上筆電後仍會繼續工作。Bot 使用你的憑證登入你現有的應用程式,以 computer-use 技術操作缺乏乾淨 API 的介面——例如 Gmail、Slack、CRM 及類似工具。
關鍵能力:
- 示範學習(Learn-by-demonstration): 觀看一次任務;Bot 會將其儲存為例行程序(routine),依排程或事件觸發器執行(每個 Bot 最多約 50 個例行程序)
- Bot 間協調: 多個 Bot 可以互相傳訊、在討論串中共享脈絡,並在群組聊天中協調——在彼此之間交接工作並指派所有權
- 持久脈絡: Bot 會跨對話保留資訊,隨著時間學習偏好與邊界案例
- 平台可用性: macOS、Windows、Linux、iOS(Android「即將推出」);企業存取需透過候補名單,支援 SSO、SCIM 與 RBAC
底層模型在測試版初期為 Grok 4.5,8 月 12 日之後升級為 Grok 4.6。
共享電腦的問題
Grok Bot 發布中最關鍵的細節,是行銷與文件之間在安全架構上的落差。
發布頁面寫著:「Bot 擁有自己的電腦。」 這種措辭暗示隔離——每個 Bot 都在各自獨立的沙盒環境中運作,擁有獨立憑證與受控的災損半徑(blast radius)。
xAI 自己的文件卻不是這麼說的。根據 Grok Bot 總覽頁面:「你所有的 Bot 都使用同一台持久雲端電腦。」 這台電腦是隔離到你的帳戶,而不是隔離到個別的 Bot。每個 Bot 在那台機器上有自己的畫面,但檔案、瀏覽器工作階段與命令列憑證是在整個 Bot 陣容之間共享的。
文件明確寫道:
「請勿將個別 Bot 視為安全邊界。」
這意味著某個 Bot 建立的憑證——一組登入、一把 API 金鑰、一個工作階段 token——同一帳戶上的每個其他 Bot 都能存取。Bot 刪除是軟性刪除: 移除 Bot 會刪除其個人檔案、對話與例行程序,但共享電腦上的檔案與登入資訊可能會持續存在,在來源端撤銷之前,其餘的 Bot 陣容仍可存取。
就企業評估而言,這種架構是可辯護的——它讓 Bot 能以低成本互相交接工作——但它要求將整個 Bot 陣容視為單一身分介面。任何安全審查都必須將存取權建模為「任何 Bot 能觸及的一切」,而非逐 Bot 的隔離。行銷語言讓這件事更難向利害關係人溝通,因為他們會合理地從「自己的電腦」推論出隔離性。
定價與取得方式
Grok Bot 沒有獨立的價格。其存取權綁進三個現有的訂閱方案:
| Tier | Price | Provider |
|---|---|---|
| SuperGrok Heavy | $300/月(促銷價 $99/3 個月) | SpaceXAI |
| Cursor Ultra | $200/月 | Cursor |
| Cursor Teams Premium | $120/座位/月 | Cursor |
xAI 稱之為「早期測試版」,並有使用限制。Musk 表示修正後會擴大開放。企業存取(SSO、SCIM、RBAC)被擋在候補名單之後。
通路策略值得注意:Grok Bot 寄生在使用者已經付費的訂閱方案內,將 SpaceXAI 的代理策略綁在 Cursor 的基礎設施上——反映了 SpaceX 於 2026 年 6 月以 $60B 收購 Cursor(Anysphere)的布局。
Grok Imagine Image 2.0:區域感知編輯,競技場排名第二
2026 年 8 月 7–8 日,SpaceXAI 以 grok.com/imagine 以及 iOS 與 Android 應用程式上的全新 Quality Mode 形式,推出 Grok Imagine Image 2.0。該模型在 Arena 上以 SpaceXAI 名稱出現。
新功能
- 區域級編輯: 魔術棒工具只編輯你指向的區域,其餘部分保持不動;分割功能可精準選取特定區域;背景移除可將任何主體以透明背景匯出
- 多參考影像融合: 單次生成最多可使用 5 張輸入影像(每個來源 3 張),省去手動合成(compositing)的需求
- 單一模型同時負責生成與編輯——無需分開的工作流程
- 1K/2K 解析度等級、13 種長寬比
- 範本: 為常見工作流程——照片編輯、產品攝影、大頭照、圖示、遊戲素材——提供預先配置好的起點
競技場排名與行銷細節
截至 8 月 7 日,Image 2.0 在 Arena Text-to-Image(Elo 約 1,320)與 Arena Image Edit(Elo 約 1,439)兩個排行榜上都排名全球第二——僅次於 OpenAI 的 GPT Image 2(1,380 / 1,463)。某個來源報導它後來被 Microsoft 的 MAI-Image-2.6 擠到第三名。
一個值得注意的行銷細節:Arena 上的第二名條目是 「low」運算變體(grok-imagine-image-2 (low));品質變體在排行榜上的排名較低。消費端面向的「Quality Mode」使用較高運算的模型,因此獲得最佳輸出的使用者,未必使用的是拿下排名的模型。這不算欺騙——Arena 排名反映的是提交的內容——但它模糊了競爭宣稱。
Grok 4.7:SpaceX 資料訓練與隱私風暴
展望未來,Musk 在一場全員會議(公開貼文於 X)上宣布 Grok 4.7 正在以「大量 SpaceX 公司資料」進行補充訓練,並將「在 3 到 4 週內準備就緒」——目標是 2026 年 9 月上旬至中旬。報導中的規格(未經證實,無模型卡):約 2.1T 參數,相較於 4.6 的 1.5T。
Musk 宣稱 Grok 4.7「將超越目前所有模型」,並表示鑑於 SpaceX 獨特的資料庫——Starlink 遙測、Raptor 引擎紀錄、Starship 重返大氣層資料,以及 Slack/Jira/GitHub/ERP 產物——他「會很震驚如果有任何模型在真實世界工程上更強」。
員工資料問題
爭議不在於模型本身,而在於訓練資料。
Musk 告訴 SpaceX 員工,Grok 將以**「所有 SpaceX 資訊的總和」**進行訓練——並補充說:「所以從某種意義上說,它將以你為訓練對象。你們實際上將成為這個 AI 的父母。」
這項宣布缺少的部分:
- 未揭露包含哪些資料類別(通訊、紀錄、指標、行為資料)
- 未說明任何退出(opt-out)機制
- 沒有資料收集、過濾或保護的隱私協議
- 沒有限制範圍——「總和」意味著一切,包括內部通訊與決策模式
約 14,000 至 15,000 名 SpaceX 員工可能在範圍內。法律格局尚未定案:職務創作(work-for-hire)原則涵蓋工作產出,但持續的行為捕捉(鍵盤輸入、決策模式、通訊後設資料)處於灰色地帶。根據 TechTimes 的報導,由於管轄權的落差,SpaceX 員工無法向 NLRB 提出申訴。
Meta 前例
最接近的先例是 Meta 的 Model Capability Initiative(2026 年 4 月),該計畫捕捉員工的鍵盤輸入、滑鼠點擊與螢幕截圖,用於訓練內部 AI 模型。結果:
- 約 1,600 名員工簽署反對該計畫的請願書
- 6 月發生 SEV 2 事件,私人資料外洩至全公司
- 該計畫在資料外洩後暫停
SpaceXAI 尚未說明是否研究過 Meta 的失敗,或是否已實施防止類似結果的防護措施。缺乏任何揭露的治理框架——加上 Musk 公開且擴張性的框架——造成實際的監管與聲譽風險。歐盟執委會、加州檢察長、英國與澳洲當局已就其他事項對 X 與 Grok 展開調查。
企業應提出的治理問題
對於任何評估 SpaceXAI 模型的企業,SpaceX 訓練計畫引發的治理問題超出眼前的爭議:
- 資料溯源: SpaceXAI 能否保證經由 API 出貨的模型,未曾以不當取得的員工行為資料進行訓練?
- 監管曝險: 如果調查發現訓練計畫在任何司法管轄區違反隱私法,在生產環境中使用這些模型的客戶有何補救途徑?
- 員工同意基礎設施: SpaceX 是否有 AI 訓練知情同意的框架,還是「你將成為這個 AI 的父母」就是揭露的全部?
這些不是假設性的顧慮。它們是任何合規團隊在將 Grok 視為生產依賴之前,都應該提出的採購盡職調查問題。
深偽危機:Grok 與 87% 可追溯攻擊有關
本週最令人震驚的數據點來自 Resemble AI 的 2026 上半年 Deepfake 威脅報告,於 8 月 12 日發布。
數據
- 從 1,760 則新聞報導中記錄到 821 起深偽攻擊
- 生成約 346 萬個合成檔案
- 至少 15,736 名確認受害者
- 六個月媒體觸及:2,928 億次曝光——幾乎等於 2025 全年的 296.4B
- 87% 的可追溯檔案歸因於 Grok
- **每 6 起攻擊就有 1 起(137 起)**涉及成人或未成年人的未經同意私密影像(NCII)
規模令人震驚。Grok 在可追溯深偽領域的主導地位——在可辨識生成模型的檔案中占 87%——既反映 Grok 的市場地位,也反映其影像生成工具的相對易用性。該報告並未指控 xAI 有意圖或協助這些用途;歸因是基於生成檔案的技術指紋比對。
監管與法律曝險
多個監管機關已展開調查:
- 歐盟執委會——依據 DSA 條款調查 X 與 Grok
- 加州檢察長——審查對州深偽與 NCII 法律的遵循情況
- 英國與澳洲——對 Grok 平台實務的個別調查
根據 15 U.S.C. §6851,允許或散布未經同意影像的公司的法定民事曝險估計約 $22.4 億。
方法論注意事項
該報告僅基於公開報導的事件與可追溯的檔案。實際數字可能更高。Resemble AI 也發布了 DETECT-World,一個專為辨識來自未見過生成器的合成內容而設計的偵測模型——一個有用的防禦工具,但處理的是症狀而非根本原因。
這對企業意味著什麼
深偽報告並不意味著企業應避免使用 Grok。它的意思是,任何使用 Grok 影像生成能力的組織都需要:
- 可接受使用政策,明確禁止未經同意製作真實人物的合成媒體
- 輸出監控,針對可能違反 NCII 或誹謗法的生成內容
- 供應商風險評估,考量 xAI 的內容審核基礎設施(或其缺乏)
- 事件回應計畫,應對可追溯到組織 API 使用的深偽內容
周邊動態:River AI 募得 $1.1B
本週值得一提:由 Igor Babuschkin(xAI 共同創辦人;前 DeepMind/OpenAI)創立的 River AI,在種子輪與 A 輪共募得 $1.1B,投後估值約 $5B。本輪由 General Catalyst 與 AMP PBC 共同領投,Nvidia、AMD Ventures、Temasek、Y Combinator 與 a16z 參與。
River AI 成立僅兩個月,尚無任何產品。其訴求:開放權重(open-weight)、使用者自有、可本地推論的個人與企業 AI。這筆募資之所以值得注意,是因為 Babuschkin 協助打造了最初的 Grok——而他離開 xAI 後立即為開放權重競爭對手募得巨額資金,顯示前沿模型市場遠未定局。投資人名單(Nvidia、AMD Ventures)也顯示硬體公司正在開放與封閉模型生態系之間分散押注。
競爭者脈絡:Qwen 3.8-Max 於 8 月 12 日出貨開放權重(客製授權,非 Apache;視覺 + 100 萬上下文僅限 API)。DeepSeek V4 Pro 獲得 API 更新。Meta 發布 Muse Glimmer 30B(Apache 2.0)。開放權重生態系持續產出封閉前沿模型的可靠替代品。
值得關注的事
- Grok 4.7 發布時程: Musk 的「3 到 4 週」目標將發布時間落在 9 月上旬至中旬。觀察 SpaceX 資料訓練爭議是否會在發布前迫使任何揭露或治理變更。docs.x.ai 上尚無模型卡、定價或上下文視窗細節。
- SpaceX 員工資料治理: 觀察員工反彈、監管行動,或 SpaceXAI 揭露訓練資料治理框架。Meta 前例(請願 → 外洩 → 暫停)是一條合理的軌跡。
- 深偽監管行動: Resemble AI 報告已引起歐洲、加州、英國與澳洲監管機關的關注。觀察對 X 或 SpaceXAI 的具體執法行動,尤其是依據 DSA 或 15 U.S.C. §6851。
- Grok 4.6 獨立基準測試: 該模型已列入 LMArena 評測。獨立基準驗證——尤其是 xAI 數字最弱的 Terminal-Bench 與 DeepSWE——將決定綜合分數在 xAI 自家評測套件之外是否站得住腳。
- Grok Bot 安全揭露:「自己的電腦」與「一台共享電腦」之間的落差,會在企業安全審查中浮上檯面。觀察 xAI 是否更新行銷語言、加入技術性隔離控制,或發布安全架構文件。
- Grok Bot 模型揭露: xAI 對驅動 Grok Bot 的模型保持沉默,這很不尋常。如果 Bot 運行在較小或較便宜的模型上,能力天花板與成本經濟將不同於買家可能的假設。
- River AI 軌跡: 手握 $1.1B 與可信的創辦人,觀察第一款產品的發布。一位前 xAI 架構師推出的開放權重前沿模型,將重塑競爭格局。
- SpaceX 鎖定期解禁連鎖效應: 第一波內部人持股解禁於 8 月 6 日開始,之後每兩週一波,一路到 12 月。賣壓將形塑 SPCX 的股價表現,進而影響市場對 SpaceX 目前資本支出規模(依上一次財報電話會議,單季資本支出 $18.4B)下 AI 基礎設施投資的胃口。
追蹤 Kevin Kaminski 的 X,獲取每日 AI 生態系更新。下週請繼續鎖定下一期 xAI 每週報。