2026年7月29日からの1週間は、単一のイベントが支配しました:8月4日に行われたSpaceX初の公的決算説明会です。これはSpaceXAI時代の財務メカニズムの幕を引き上げるものでした。イーロン・マスク氏はこの説明会で攻撃的なGrokロードマップを提示しました — Grok 4.6は来週Grok 4.7は3〜4週間後、そしてGrok 5は年末までに、SpaceXの歴史的データの全コーパスでトレーニングされます。決算のスポットライトの外では、Grok Voice Think Fast 2.0が本番移行を完了し、Grok Imagine Video 1.5がテキストからの動画生成とネイティブ1080p出力を追加する大規模な機能アップデートをリリースしました。

以下が、今週注目すべき展開に関する弊社の専門的分析です。


SpaceX初の決算説明会:売上78億ドル、AI売上25.6億ドル、資本的支出184億ドル

SpaceXは2026年8月4日に初の四半期決算説明会を開催しました — 6月12日にティッカーSPCXでIPOして以来、初の公的財務情報開示です。その数字は衝撃的でした:

  • 2026年第2四半期の売上:78億ドル、前年同期比92%増、アナリストコンセンサスの約68〜69億ドルを上回る
  • AIセグメントの売上:25.6億ドル、前年同期比247%増、xAIおよびGrokサブスクリプションを含む
  • 調整後EBITDA:35億ドル、前年同期比191%増
  • 純損失:5億4100万ドル、前年の約10億ドルから縮小
  • 資本的支出:184億ドルを単一四半期で計上、前年の28億ドルから約7倍増 — その大部分はAIインフラによるもの

市場の反応はネガティブでした。株価は時間外取引で約7%下落し、主に資本的支出の数字が原因でした。2日後の8月6日には、ロックアップ期間の満了により約10億株のインサイダー株が解放されます — 月曜日の終値で約1064億ドル相当 — その後も2週間ごとに追加トランシェがロック解除され、2026年12月までに100%が解放されます。

正式な事業セグメントとしてのAI

SpaceXは現在、3つのセグメントを報告しています:Space(打ち上げ)、Connectivity(Starlink)、およびAIです。AI部門 — xAI、Grokサブスクリプション、コンピュートリースを含む — は単一四半期で25.6億ドルを生み出しました。参考までに、これは年間約100億ドル以上のAI売上に相当し、SpaceXAIのAI事業は既存のエンタープライズAIベンダーと同じ売上規模に位置します。

SpaceXの社長兼COOであるグウィン・ショットウェル氏は、説明会で7月のGrok 4.5リリース後にトークン消費が3倍になったことを明らかにしました。この指標 — 生のモデル利用量 — は、xAIがこれまでに共有した中で、Grokの採用が実質的に加速していることを示す最も強力な指標です。一方で、月間アクティブユーザー数1億1700万人(7月下旬に報告)でのユーザー成長の横ばいは、消費者向けの獲得が停滞していることを示唆しています。

資本的支出のストーリー:Nvidia独占、年末までに2 GW

マスク氏は説明会で、SpaceXがAIデータセンターをNvidiaのVera Rubinアーキテクチャのみで構築すると確認し、それを「現在市場で最高のAIコンピュータ」と呼びました。コンピュートロードマップは攻撃的です:

  • 現在オンラインのコンピュート:約1.4 GW
  • 2026年末までの目標:2 GW
  • 2027年末までの目標:10〜15 GW

マスク氏は、ボトルネックがGPU供給から電力および冷却インフラに移行したと述べ、今後のリソース投資はそこに集中すると述べました。

Starmind衛星プログラムは宇宙ベースの次元を追加します:SpaceXはStarmind AI 1衛星向けにNvidiaとAIコンピューティングペイロードを共同開発しており、各衛星はNvidia Rubin GPUとVera CPUを搭載します。第1バッチは来年の打ち上げ開始が予定されており、AIコンピュートを低軌道に拡張します。

Grok搭載の投資家Q&Aプラットフォーム

大きな注目を集めた動きとして、SpaceXは業界標準のSAYプラットフォーム(Teslaが決算説明会で使用)を迂回し、Grokで構築された特注の投資家Q&Aツールを採用しました。このプラットフォームは説明会前に株主からの質問を受け付け、Grokが重複排除、トピッククラスタリング、ランキングを処理しました。

これは間違いなく、これまでのGrokのエンタープライズ展開の中で最も可視性の高いものと言えます — 機関アナリスト、個人株主、金融メディアの前に同時にモデルを公開するものです。このツールが問題なく機能すれば、他のどの上場企業も採用できるケーススタディとなります。現在SAYに依存しているTesla自身の決算説明会が、明らかな次の候補です。


Grok 4.6は来週を目標に — Grok 5はSpaceXの全データを組み込む

決算説明会は、マスク氏がこれまでで最も詳細なGrokロードマップを提示する場となりました:

  • Grok 4.6:「おそらく来週」(8月7日の週)に登場見込み
  • Grok 4.7:「今日から3、4週間後」
  • Grok 5:「年末までに」

Grok 4.6は、Grok 4.5から教師ありファインチューニング(SFT)と強化学習(RL)が大幅に改善された1.5兆パラメータのモデルと説明されています。二次的な報道では矛盾するパラメータ数が生じています — 一部の情報源は「2Tモデル」に言及 — しかし、マスク氏自身の発言から最も一貫している特徴づけは、より大きなアーキテクチャではなく、トレーニングが改善された1.5Tです。

Grok 4.7は2.1兆パラメータのモデルと報告されており、「提供速度がわずかに遅いことを除けばあらゆる点で優れている」とされ、トークン効率も向上します。これは先週の報道と一致します。

説明会の見出しとなったのは、Grok 5のトレーニングデータに関するマスク氏の発言でした:

「我々はSpaceXのデータの全コーパスを組み込むつもりです…四半世紀にわたってSpaceXが生み出してきたすべてのデータを。」

これは、ロケット打ち上げログ、テレメトリ、製造データ、衛星運用データ、および独自のエンジニアリングデータセットがGrok 5のトレーニングパイプラインに投入されることを意味します。これは、SpaceXAI統合が単なる企業再編ではなくデータシナジーに関するものであることを示す、これまでで最も明確な戦略的シグナルです — SpaceXの独自エンジニアリングデータは、GrokのAI能力にとって永続的な競争優位の堀となります。

APIの現実確認

8月5日現在、Grok 4.5はSpaceXAI公式ドキュメントに記載された最新モデルのままです。現状は以下の通りです:

  • 公開モデルIDなしdocs.x.aiにGrok 4.6の記載なし
  • APIドキュメントに価格の記載なし
  • コンテキストウィンドウの仕様なし
  • ベンチマークスコアなし

Grok 4.6が出荷されたという真のシグナルは、docs.x.ai/developers/modelsのモデル一覧にgrok-4.6エントリが出現することです。LMArenaは7月29日、Grok 4.6がローンチ翌週にArenaリーダーボードに登場すると発表しており、独立したベンチマーク検証が提供されることになります。


Grok Voice Think Fast 2.0が本番移行を完了

2026年8月5日grok-voice-latestエイリアスが自動的にGrok Voice Think Fast 1.0からGrok Voice Think Fast 2.0に切り替わり、xAIが7月29日に発表した移行計画が完了しました。明示的にgrok-voice-think-fast-1.0に固定していない開発者は、すべて2.0を実行しています。

仕様

指標Think Fast 1.0Think Fast 2.0
AA STS Quality Index75.7%82.9%
Agentic τ-voice Bench52.1%56.5%
Time to first audio1.25s0.70s
Reasoning tokens (P50)ベースライン1.0の約40%
Price per minute$0.05$0.08

このモデルはエンドツーエンドの音声間(speech-to-speech)システムです — 音声入力、音声出力 — 個別のASR → LLM → TTSパイプラインはありません。24以上の言語をサポートし、ノイズの多い電話環境を処理し、追加の遅延なしに話しながら推論します。ツールコールは最初の文が終わる前に開始できます。

文字起こし精度は、xAIの24言語ベンチマークで1.0比1.4倍、主要な専用STTモデル(Deepgram Nova 3、ElevenLabs Scribe v2)比1.5〜2倍向上しました。ノイズの多い電話環境では、その改善は最大10倍に達します。

競争上のポジショニング

1分あたり0.08ドル(1時間あたり4.80ドル)で、Think Fast 2.0はOpenAIのGPT-Realtime-2.1 Highの価格の約45%です。Artificial Analysis Speech-to-Speech Indexでは、Grok Voice TF 2.0は82.9%をスコアし、GPT-Realtime-2.1の79.1%、Gemini 3.1 Flashの**69.5%を上回ります。エージェント型τ-voiceベンチマークでは、Grokが56.5%でリードし、OpenAIの45.7%**を上回ります。

音声エージェントを構築するエンタープライズチーム — コールセンター、IVRシステム、会話型AI — にとって、Think Fast 2.0は現在、紙面上でベンチマークリーダーです。1分あたり0.05ドルから0.08ドルへの値上げ(60%増)は、大量導入にとって重要ですが、推論トークンの60%削減が、インタラクションあたりのコンピュート負荷を減らすことで、分あたりのコストを部分的に相殺します。

移行に関する注意事項

開発者は以下の対応を行う必要があります:

  1. 2.0への準備ができていない場合は、本番環境でgrok-voice-think-fast-1.0に**固定(ピン留め)**する
  2. 従来の0.05ドル/分の前提から、0.08ドル/分でコストを再計算する
  3. 両方のエンドポイントを管理する場合は、バイナリ音声トランスポートを有効化する
  4. 製品名にはkeytermsを追加し、発音修正にはreplaceを使用する
  5. 音声の重複を避けるため、tool → wait-for-playback → response.createの順序を実装する
  6. 自社サーバー以外のクライアントには**一時トークン(ephemeral tokens)**を使用する

WebSocketエンドポイントはwss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0です。サポートされるコーデック:PCM(8〜48 kHz)、μ-law、A-law、Opus(24 kHz)。


Grok Imagine Video 1.5:テキストからの動画生成、ネイティブ1080p、音声リファレンス

2026年7月31日、xAIはGrok Imagine Video 1.5に大幅なアップデートをリリースし、5月のローンチ以来プラットフォームに欠けていた4つの機能を追加しました:

テキストからの動画生成(Text-to-Video)

ユーザーはリファレンス画像を提供せずに、テキストプロンプトだけで動画を生成できるようになりました。実装はxAIの画像生成パイプラインと画像から動画へのエンジンを組み合わせたものです — モデルがテキストプロンプトから開始フレームを合成し、そこから前方にアニメーションを生成します。これにより、ローンチ以来APIレベルでテキストからの動画生成を提供してきたGoogle Veo 3.1やSeedance 2.0との機能差が埋まります。

ネイティブ1080p出力

従来のGrok Imagine Video出力は720pが上限でした(実際には720pのアップスケールである短命な「1080pトグル」を除く)。今回のアップデートは真のネイティブ1080pレンダリングを提供します。価格設定はアーキテクチャ上のコストを明らかにします:Auroraは各フレームを順次生成する自己回帰(オートリグレッシブ)システムであり、720pから1080pへのスケーリングはピクセルトークンを約2.25倍に増やします。API価格はこれを反映しています:

解像度1秒あたりの価格
480p$0.08
720p$0.14
1080p$0.25

1080pでは、API経由で60分の動画を生成するのに900ドルかかります — 720pの504ドル、Google Veo 3.1 Fastティア価格の約540ドルと比較して。1080p対応は競合他社とのフォーマット格差を埋めますが、その解像度でのコスト格差は埋めません。

音声リファレンス:顔と音声の一貫性

最も特徴的な新機能:ユーザーがキャラクターの写真と音声サンプルを提供すると、モデルは生成されたすべてのシーンにわたって顔と音声の両方を維持します。基盤となるメカニズムは、音声のアイデンティティ特性(トーン、ピッチ、プロソディ、アクセント)を言語内容とは別に抽出する話者埋め込み(speaker embedding)システムです。

これにより、従来は別々のツールを組み合わせる必要があったポストプロダクションのステップが不要になります。比較として、HeyGenのAvatar APIはトーキングヘッドクリップに1分あたり3ドルを請求します。Grok Imagineの音声リファレンスは、アバターだけでなくフルシーンの動画生成に埋め込まれており、異なる能力カテゴリを表します。

アクセス: 音声リファレンスはまず米国のSuperGrok HeavyおよびSuperGrok Plusサブスクライバーに展開され、数日以内にさらなる展開が示されています。API開発者はアクセスをリクエストするためにxAIのセールスチームに連絡する必要があります。

同意に関するギャップ: xAIの発表には、同意に関するガードレールの議論は一切含まれていません。この機能は写真と音声サンプルを必要としますが、それらが同一人物のものであることや、描写された人物が同意していることを要求しているようには見えません。Grokの非同意画像に関する歴史 — 2025年末から2026年初めの11日間で推定300万枚の性的画像が生成され、その後、連邦訴訟と35州の司法長官による調査が行われた — を考慮すると、単一の生成コールで顔と音声のリファレンスを組み合わせることは、画像生成単独よりも完全な非同意の親密な動画の能力を生み出します。xAIの許容利用ポリシー(AUP)はそのようなコンテンツを禁止していますが、開示された技術的制御なしでは、その禁止は執行履歴から見て限定的な安心感しか提供しません。

マルチリファレンスシーン制御

単一の生成で最大7枚の同時リファレンス画像を使用できます。各リファレンスは1つの視覚要素 — 顔、製品、場所、小道具 — を固定し、他の要素は変化させることができます。これはほとんどの専用リファレンスツールが提供するよりも多いアンカー数であり、音声リファレンスと組み合わせることで、顔、音声、環境コンテキストをすべて同時に固定できるキャラクターパイプラインを生み出します。

API利用可能性: テキストからの動画生成、ネイティブ1080p、画像リファレンスは標準のAPIキーで現在利用可能です。grok-imagine-video-1.5モデル文字列が以前の-previewエイリアスに取って代わります。音声リファレンスにはセールスチームのアクセスが必要です。


競争環境:OpenAI GPT-5.6 Sol、Terra、Luna

OpenAIは7月9日にGPT-5.6を3モデル構成のファミリーとしてリリースしました — この期間で最も重要な競合リリースです:

モデルポジショニング価格(100万トークンあたり)
Solフラッグシップ、最高能力入力$5 / 出力$30
Terraバランス型、低コストでGPT-5.5レベル入力$2.50 / 出力$15
Luna最速、最安、大量処理向け入力$1 / 出力$6

OpenAIはまた、並行ワークストリームにわたって複数のエージェントを調整する最高能力設定のUltraモードと、ChatGPT WorkおよびCodexで利用可能なMax推論レベルを導入しました。

この3層戦略はxAIのアプローチと明確に対照的です。SpaceXAIはAPIを単一のフラッグシップモデル(Grok 4.3、その後4.5)の周りに集約し、モデル層ではなくサブスクリプション層を流通に使用してきました。OpenAIのSol/Terra/Luna分割は、購入者に単一のモデルファミリー内での価格性能トレードオフを提供します — ワークロードごとに異なる能力層を必要とする組織にとって調達上の利点です。

一方、Moonshot AIのKimi K3 — 2.8兆パラメータのオープンウェイトモデルで、Mixture-of-Expertsアーキテクチャに896のエキスパート、100万トークンのコンテキストウィンドウを備える — は7月下旬にリリースされ、史上最大のオープンウェイトモデルの座を主張しています。xAIへの競争圧力は、プロプライエタリとオープンソースの両方向から強まっています。


注目すべきポイント

  • Grok 4.6のローンチ確認:xAIのAPIドキュメントとLMArenaリーダーボードにモデルIDが登場するかに注目。「来週」と実際のAPI利用可能性の差が、計画にどれだけのリードタイムを組み込むべきかを示します。マスク氏の提供ペースは加速していますが、彼の日付は目標であり、コミットメントではありません。
  • SpaceXのロックアップカスケード:8月6日からインサイダー株ロック解除の最初のトランシェが始まります — 約10億株、約1060億ドル。その後12月まで2週間ごとに追加トランシェが続きます。売却圧力はSPCXの株価パフォーマンスを形成し、ひいてはこの規模でのAIインフラ投資に対する市場の意欲を形成します。
  • Grok 5とSpaceXデータ統合:「SpaceXがこれまでに生み出したすべてのデータ」でトレーニングするという約束は戦略的に重要です。SpaceXのエンジニアリングテレメトリ、製造データ、運用ログがGrok 5で測定可能な能力向上を生み出せば、SpaceXAI統合の全体的な論理が検証されます。データパイプラインアーキテクチャに関する技術的な開示に注目。
  • Voice Think Fast 2.0の本番パフォーマンス:ベンチマーク数値は紙面上では強力です。エンタープライズ導入により、60%のトークン削減と0.70秒のファーストオーディオ時間が現実のコスト削減とユーザー体験向上につながるかが明らかになります。第三者評価とケーススタディに注目。
  • Grok Imagineの同意ガードレール:音声リファレンスと顔リファレンスの組み合わせは、非同意の親密な動画のリスクを生み出します。より広範な展開の前に、xAIがポリシー上の禁止だけでなく技術的制御を開示するかに注目。
  • Starmind衛星打ち上げ:AI搭載衛星の第1バッチは来年打ち上げ予定です。成功すれば、宇宙ベースのAIコンピュートは競合他社が再現できない差別化要因になります。
  • OpenAIの競争対応:GPT-5.6 SolはArtificial Analysis Coding Agent Indexで80をスコアしています。Grok 4.6のベンチマーク数値 — 発表され次第 — が直接比較されます。3層のSol/Terra/Luna価格モデルにより、xAIは単一フラッグシップのAPI戦略を再考せざるを得なくなるかもしれません。

XでKevin Kaminskiをフォローして、日々のAIエコシステム最新情報をご覧ください。来週も次回のxAIウィークリーをお楽しみに。