2026 年 8 月 8 日至 14 日這一週,對 SpaceXAI 而言是一場產品發布馬拉松。三大重要發布接連登場:Grok Imagine Image 2.0 於 8 月 7–8 日、Grok Bot 測試版於 8 月 11 日、以及 Grok 4.6——全新旗艦前沿模型——於 8 月 12 日。每一項發布都針對技術棧的不同層面:影像生成、代理式工作流程(agentic workflow),以及核心模型能力。綜觀來看,這些發布描繪出一家以極少競爭對手能比擬的節奏、橫跨完整產品面向出貨的公司樣貌。
以下是我們針對本週重要發展的專業分析。
Grok 4.6:以半價提供前沿智慧
2026 年 8 月 12 日,SpaceXAI 發布了全新旗艦大型語言模型 Grok 4.6。這次發布緊接在 DeepSeek V4 Pro 正式公開上市(general availability)數小時之後——這個時間安排凸顯了前沿模型層級競爭的激烈程度。
架構與訓練
Grok 4.6 是一個 1.5 兆參數模型,建立在與 Grok 4.5 相同的 V9 基礎之上。其進步並非來自參數規模的擴大,而是來自大幅延長的補充訓練:使用精心策劃的模型生成資料來訓練推理能力、高品質工程資料,以及改良的最佳化器。接著,SpaceXAI 使用 Grok 4.5 重新生成監督式微調(SFT)軌跡,涵蓋推理任務、代理框架(agent harnesses),以及 STEM、軟體工程、知識工作等領域——並透過基於模型的檢查來過濾掉有問題的軌跡。強化學習階段則在各種代理式 RL 任務上進行訓練,包括核心最佳化、網頁開發與電腦輔助設計。
該模型具備 50 萬 tokens 的上下文視窗,專為長時程代理任務、多步驟程式開發與高互動性的複雜工作而設計。SpaceXAI 的公告強調,Grok 4.6「能在多個步驟中持續跟隨複雜任務」,並展現出在更長軌跡上更強的自我測試與驗證能力。
基準測試表現
Grok 4.6 的基準測試成績顯示,它在多個面向追上或超越前沿競爭對手,但仍存在顯著差距:
| Benchmark | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| FrontierCode v1.1 | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | — | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
整體情況相當微妙。Grok 4.6 在 Artificial Analysis Intelligence Index 上與 GPT-5.6 Sol 打平(61 對 61),並在 CursorBench(69.9% 對 67.2%)、GDPVal-AA(1753 對 1728)、AA-Briefcase(1577 對 1502)、APEX-Agents(57.5% 對 56.7%)與 Harvey LAB(15.8% 對 2.5%)上勝出。對上 Anthropic 的 Claude Fable 5 Max,Grok 4.6 在 GDPVal-AA、CursorBench、AA-Briefcase 與 Harvey LAB 上獲勝,但在 Terminal-Bench(26% 對 34.1%)、DeepSWE(65.9% 對 70%)以及整體 AA Intelligence Index(61 對 62)上落後。
Harvey LAB 的結果特別引人注目:Grok 4.6 拿下 15.8%,而 GPT-5.6 Sol 僅有 2.5%——在法律專業工作評估上取得 6 倍優勢。這究竟代表真正的能力優勢,還是針對特定基準測試的最佳化,仍有待獨立測試驗證。
定價:競爭的利刃
Grok 4.6 的定價是其最鋒利的競爭武器:
- 標準版: 每百萬 input tokens $2、每百萬 output tokens $6
- Fast 變體: 每百萬 input $4、每百萬 output $12(標準版的 2 倍)
SpaceXAI 明確以「其他前沿模型的一半價格」作為行銷訴求。與 Anthropic 的 Fable 5 Max 相比,節省幅度驚人:input 約便宜 80%,output 約便宜 88%。對於執行高流量工作負載的企業 API 使用者而言,這種定價結構從根本上改變了前沿模型部署的單位經濟效益。
問題在於,這樣的定價反映的是持久的成本優勢——SpaceXAI 獨家的 Nvidia Vera Rubin 基礎設施與 SpaceX 電力基礎設施——還是暫時性的客戶獲取策略。上週的 SpaceX 財報電話會議揭露了單季 $18.4B 的資本支出,顯示基礎設施投資是真實且持續的。
可用性
Grok 4.6 立即於以下平台開放使用:
- Cursor(程式編輯器,當日上線)
- Grok Build(SpaceXAI 的應用程式建構工具)
- xAI API 主控台
- 第三方平台: OpenRouter、Vercel、Cloudflare
SpaceXAI 在 Cursor 與 Grok Build 中提供第一週 2 倍包含用量,以鼓勵採用。
(xAI 公告、SiliconANGLE、NextBigFuture)
Grok Bot:共享一台電腦的 AI 隊友
2026 年 8 月 11 日,SpaceXAI 推出了 Grok Bot 測試版——進軍「AI 隊友」這個類別。該產品主打全年無休的 AI 代理:登入客戶的工具、跨應用程式與收件匣協作,並在無需持續監督的情況下完成多步驟工作。使用者可以像對待同事一樣,從桌面或 iOS 應用程式傳訊息給 Bot、交辦任務,然後讓它們自行執行。
發布內容
Grok Bot 是一條獨立的產品線——不是程式開發代理,也不是 prompt 轉應用程式建構器。它是一款「AI 隊友」應用程式,透過人類會使用的相同介面跨應用程式運作,包括沒有乾淨 API 或 MCP 整合的平台。使用者離開時工作仍會繼續;只有在需要批准時,Bot 才會回報。
關鍵能力包括:
- 示範學習: 請 Bot 觀看你執行一次工作;它會將步驟儲存為例行程序(routine),下次自行執行。「教導任務」(Teach a task)錄製上限為十分鐘。
- Bot 間協調: 多個 Bot 可以互相傳訊、在討論串中共享脈絡,並在群組聊天中協調——在彼此之間交接工作並指派所有權。
- 持久脈絡: Bot 會跨對話保留資訊,隨著時間學習使用者的偏好與邊界案例。
- 例行程序: Skills 描述如何執行任務;Routines 則以排程或事件觸發器,將工作流程指派給 Bot。
xAI 表示,該產品最初是內部原型,在合併後的 SpaceXAI 營運中廣泛用於銷售外展、行銷活動、辦公室營運與錯誤修正,之後才對外發布。
安全架構的落差
Grok Bot 發布中最關鍵的細節,是行銷語言與文件之間在安全架構上的落差。
發布頁面寫著:「Bot 擁有自己的電腦。」 這種措辭暗示隔離——每個 Bot 都在各自獨立的沙盒環境中運作,擁有獨立憑證與受控的災損半徑(blast radius)。
xAI 自己的文件卻不是這麼說的。根據 Grok Bot 總覽頁面:「你所有的 Bot 都使用同一台持久雲端電腦。」 這台電腦是隔離到你的帳戶,而不是隔離到個別的 Bot。每個 Bot 在那台機器上有自己的畫面,但檔案、瀏覽器工作階段與命令列憑證是在整個 Bot 陣容之間共享的。
文件在兩個不同的頁面(FAQ 與批准/安全頁面)以相同文字明確陳述:
「請勿將個別 Bot 視為安全邊界。」
這意味著某個 Bot 建立的憑證——一組登入、一把 API 金鑰、一個工作階段 token——同一帳戶上的每個其他 Bot 都能存取。Bot 刪除是軟性刪除: 移除 Bot 會刪除其個人檔案、對話與例行程序,但共享電腦上的檔案與登入資訊可能會持續存在,在來源端撤銷之前,其餘的 Bot 陣容仍可存取。
就企業評估而言,這種架構是可辯護的——正是它讓 Bot 能以低成本互相交接工作——但它要求將整個 Bot 陣容視為單一身分介面。任何安全審查都必須將存取權建模為「任何 Bot 能觸及的一切」,而非逐 Bot 的隔離。行銷語言讓這件事更難向利害關係人溝通,因為他們會合理地從「自己的電腦」推論出隔離性。
定價與取得方式
Grok Bot 沒有獨立的價格。其存取權綁進三個現有的訂閱方案:
| Tier | Price | Provider |
|---|---|---|
| Cursor Ultra | $200/月 | Cursor |
| Cursor Teams Premium | $120/座位/月 | Cursor |
| SuperGrok Heavy | 隨方案包含 | SpaceXAI |
企業存取權被擋在候補名單之後。Android 應用程式則標示為「即將推出」。值得注意的是,xAI 並未揭露哪個模型驅動 Grok Bot——在發布貼文、產品頁面或所檢視的任何文件頁面上都沒有。能力假設應被視為假設。
通路策略
Cursor 的方案分級是商業面上最重要的故事。Grok Bot 寄生在使用者已經付費的訂閱方案內,這比單獨銷售座位是更便宜的通路。它同時也把 SpaceXAI 的代理策略綁在 Cursor 的基礎設施上——下載建置、入門流程與 xAI 頁面上的銷售聯絡窗口,全都透過 Cursor 運作。兩家公司的產品技術棧在發布時明顯相互交織,反映了 SpaceX 在 6 月以 $60B 收購 Cursor(Anysphere)的布局。
(Unite.AI、Bloomberg via Yahoo Finance、Digital Applied)
Grok Imagine Image 2.0:區域感知編輯,競技場排名第二
2026 年 8 月 7–8 日,SpaceXAI 開始以 grok.com/imagine 以及 iOS 與 Android 應用程式上的全新 Quality Mode 形式,推出 Grok Imagine Image 2.0。Elon Musk 於 8 月 8 日在 X 上發文宣布「Grok Imagine 影像編輯的重大升級」。
新功能
Image 2.0 圍繞著產出可應用於實際工作的影像這個目標打造,並加入多項值得注意的新功能:
- 區域感知編輯: 魔術棒工具只編輯你指向的區域,其餘部分保持不動。分割功能可精準選取影像中的特定區域。背景移除功能可將任何主體以透明背景匯出。
- 多參考影像編輯: 單次生成最多可使用 5 張輸入影像,省去手動合成(compositing)的需求。
- 智慧尺寸調整: 選擇一個長寬比,模型便會填滿畫面,在任何尺寸下產生一張影像。
- 改善的文字渲染: 字體排版與版面「以設計師的方式」規劃,因此資訊密集、多區塊的視覺內容能保持一致,小字也能清晰銳利。
- 範本: 為常見工作流程——照片編輯、產品攝影、大頭照、圖示、遊戲素材——提供預先配置好的起點。
- 為影片打造世界: 分別生成角色、場景與道具,同時在影像之間維持一致的風格——專為下游影片製作而設計。
競爭定位
截至 2026 年 8 月 7 日,Image 2.0 在 Arena Text-to-Image 與 Arena Image Edit 兩個排行榜上都排名全球第二。xAI 的模型在 Arena 上以 SpaceXAI 名稱出現。該公司沒有點名第一名是哪個競爭對手,但這個排名已將 Grok Imagine 置於影像生成與編輯系統的第一梯隊。
API 存取
與 Imagine Image 2.0 的消費端可用性不同,該模型也可透過 API 以 grok-imagine-image-2.0 存取,完整文件可在 xAI 的開發者文件中取得。這與前一週的 Grok Imagine Video 語音參考功能採取不同做法——後者需要銷售團隊的存取權限——Image 2.0 對任何持有標準 API 金鑰的開發者開放。
競爭格局:DeepSeek V4 Pro、OpenAI 與 Anthropic
Grok 4.6 在 DeepSeek V4 Pro 正式公開上市後數小時內出貨——這是一個刻意的訊號,表明 SpaceXAI 打算與正在崛起的中國前沿模型生態系正面交鋒。DeepSeek 的 V4 Pro 是中國實驗室一系列強勢發布中的最新一作,而同日出貨的時機安排,將前沿模型競賽描繪成日益多極化的局面。
西方三大實驗室的競爭定位:
| Model | AA Intelligence Index | Price (Input/Output per 1M tokens) |
|---|---|---|
| Grok 4.6 | 61 | $2 / $6 |
| GPT-5.6 Sol | 61 | $5 / $30 |
| Claude Fable 5 | 62 | 更高階方案顯著更貴 |
Grok 4.6 在綜合指數上與 GPT-5.6 Sol 打平,而 input 價格約為其 40%、output 價格約為其 20%。對上 Claude Fable 5 Max,節省幅度達到 80–88%。這種定價結構是市場上最具攻擊性的前沿模型定價——而且唯有當 SpaceXAI 的基礎設施成本基礎(Nvidia Vera Rubin、SpaceX 電力基礎設施)確實帶來更低的每 token 運算成本時,它才可持續。
與此同時,Anthropic 與 OpenAI 在特定基準測試上仍保有優勢。Claude Fable 5 Max 在 Terminal-Bench(34.1% 對 Grok 的 26%)、DeepSWE(70% 對 65.9%)與 APEX-SWE(58.8% 對 56.4%)上領先——這些全是代理式程式開發與終端機使用基準。GPT-5.6 Sol 則在 DeepSWE(73%)與 Terminal-Bench(34.6%)上大幅領先。Grok 4.6 的優勢集中在知識工作(AA-Briefcase、GDPVal-AA)、法律專業工作(Harvey LAB)與特定程式開發任務(CursorBench、FrontierCode)。
對企業買家而言,這意味著:模型選擇不再是單一面向的決定。Grok 4.6 是知識工作與成本敏感的高流量部署最強的選擇。Anthropic 在代理式終端機與軟體工程任務上保有優勢。OpenAI 在深度 SWE 工作負載上領先。正確答案取決於工作負載,而價格與效能的取捨現在差異大到多模型策略越來越合理。
值得關注的事
- Grok Bot 安全揭露:「自己的電腦」與「一台共享電腦」之間的落差,會在企業安全審查中浮上檯面。密切觀察 xAI 是否更新行銷語言、加入技術性隔離控制,或發布安全架構文件。目前的矛盾對任何採購流程都是一項負債。
- Grok 4.6 獨立基準測試: 該模型已列入 LMArena 評測。獨立基準驗證——尤其是 xAI 數據最弱的 Terminal-Bench 與 DeepSWE——將決定 Grok 4.6 的綜合分數在 xAI 自家評測套件之外是否站得住腳。
- Grok 4.6 在 Cursor 中的實際生產表現: Cursor 與 Grok Build 的 2 倍用量獎勵是為了推動採用。觀察開發者的回報:模型的長時程代理表現——自我測試、驗證、持續的多步驟推理——在真實世界的程式開發工作流程中是否維持得住。
- Grok Bot 模型揭露: xAI 對驅動 Grok Bot 的模型保持沉默,這很不尋常。如果是 Grok 4.6,說出來會強化該模型的定位。如果不是——如果 Bot 運行在較小或較便宜的模型上——能力天花板與成本經濟將不同於買家可能的假設。
- Imagine Image 2.0 API 採用: Image 2.0 的 API 以標準金鑰即可使用——不需要銷售團隊。觀察採用率,以及第二名競技場排名是否轉化為開發者對 OpenAI 與 Google 既有影像 API 的偏好轉移。
- DeepSeek V4 Pro 的競爭衝擊: DeepSeek 的 V4 Pro 與 Grok 4.6 同日出貨。如果它以具競爭力的價格追上或超越前沿基準,所有西方實驗室承受的定價壓力都會加劇。密切觀察獨立的基準比較。
- SpaceX 鎖定期解禁連鎖效應: 第一波內部人持股解禁於 8 月 6 日開始,之後每兩週一波,一路到 12 月。賣壓將形塑 SPCX 的股價表現,進而影響市場對 SpaceX 目前資本支出規模下 AI 基礎設施投資的胃口。
追蹤 Kevin Kaminski 的 X,獲取每日 AI 生態系更新。下週請繼續鎖定下一期 xAI 每週報。