2026年8月12日から19日までの1週間は、SpaceXAIにとってこれまでで最も影響力のあるリリースシーケンスが展開された。Grok 4.6が8月12日にAA Intelligence Index 61でリリースされ、GPT-5.6 Solと同点、グローバル3位となった。Grok Botは8月11日にベータ版として開始され、1台のクラウドコンピュータを共有する永続的なAIチームメイトとして登場した。Grok Imagine Image 2.0は8月7日にリージョンレベルの編集機能とArenaランキング2位で展開された。しかし製品ローンチの背後で、2つのストーリーが厳しい精査を必要としている。MuskがGrokを「SpaceXのすべての情報の総量」で訓練する計画( opt-outの開示なしに約14,000〜15,000人の従業員の作業成果を含む)、そして2026年前半のディープフェイク攻撃の追跡可能なファイルの87%がGrokに関連しているとするディープフェイク脅威レポートである。
今週の重要な動向に関するプロフェッショナルな分析は以下のとおりである。
Grok 4.6:最前線の知能、攻撃的な価格、現実のギャップ
2026年8月12日、SpaceXAIは新しいフラッグシップ最前線モデルGrok 4.6をリリースした。このリリースはGrok 4.5から約5週間後のことであり、同社のこれまでで最も強力な競争ポジショニングを表すものだが、ベンチマークの状況はxAIのマーケティングが示唆するよりも微妙である。
アーキテクチャとトレーニング
Grok 4.6はGrok 4.5と同じ1.5兆パラメータのV9基盤上に構築されている。性能向上は entirely post-trainingからもたらされた。より長い補助トレーニングラン、改良された教師ありファインチューニング(SFT)と強化学習(RL)、そしてxAIが長い推論軌道における自己検証行動の増加と表現するものがそれである。このモデルはGrok 4.5を使用して、推論タスク、エージェントハーネス、STEM・ソフトウェアエンジニアリング・ナレッジワークなどの領域にわたるSFT軌道を再生成している。
主な仕様:
- 50万トークンのコンテキストウィンドウ — 長時間のエージェントタスク専用に構築
- 知識カットオフ: 2026年2月1日
- マルチモーダル入力(テキスト + 画像)、テキストのみの出力
- 4つの推論努力レベル: low / medium / high(デフォルト) / xhigh(新規)
- ネイティブツール:関数呼び出し、ウェブ検索、X検索、コード実行、構造化出力
- OpenAI互換のResponsesおよびChat Completions API
- プロンプトキャッシュ(キャッシュされた入力で75%安価)および長いエージェントループ向けのコンテキスト圧縮
ベンチマーク性能
Grok 4.6は強力な数値を記録しているが、状況はワークロードによって大きく異なる。
| Benchmark | Grok 4.6 | Grok 4.5 | GPT-5.6 Sol Max | Claude Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| GPQA Diamond | 94.9% | — | ~94% | — |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| AA-Briefcase Elo | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
| Databricks OfficeQA Pro | 63.2% | — | — | — |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
Grok 4.6はAA Intelligence IndexでGPT-5.6 Solと同点(61対61)であり、これは知能、速度、コストを総合的に評価する複合スコアである。CursorBench(69.9%対67.2%)、GDPVal-AA(1753対1728)、AA-Briefcase(1577対1502)、APEX-Agents(57.5%対56.7%)、Harvey LAB(15.8%対2.5%)でGPT-5.6 Solを上回る。Harvey LABの結果(法務専門業務評価で6倍の優位性)は特に顕著だが、一般的な法的推論能力の優位性というより、ベンチマーク特化の最適化を反映している可能性がある。
Claude Fable 5 Maxに対しては、状況は変化する。AnthropicのモデルはAA Intelligence Index(62対61)、Terminal-Bench(34.1%対26%)、DeepSWE(70%対65.9%)、APEX-SWE(58.8%対56.4%)、FrontierCode(63.6%対61.3%)でリードする。Grok 4.6はGDPVal-AA、CursorBench、AA-Briefcase、Harvey LABで勝利する。パターンは明確である。Grok 4.6はナレッジワークとコスト感応型タスクに優れ、Anthropicはエージェント型ターミナルおよびソフトウェアエンジニアリングで優位を維持している。
注目すべき結果の1つ:xAIはある情報源でCursorBench 3.2で1位を主張しているが、Claude Fable 5 Maxは他のレポートでより高いスコア(70.5%対69.9%)を記録している。この不一致はおそらく、異なるベンチマーク設定または評価条件を反映している。
価格設定:競争の楔
Grok 4.6の価格構造は、その最も鋭い競争武器である。
| Tier | Input | Cached Input | Output |
|---|---|---|---|
| Standard(<200Kトークン) | $2/M | $0.50/M | $6/M |
| Long-context(≥200Kトークン) | $4/M | $1/M | $12/M |
GPT-5.6 Solの$5/$30(100万トークンあたり)と比較すると、Grok 4.6は入力価格の約40%、**出力価格の約20%**のコストである。Claude Fable 5 Maxと比較すると、節約額は80〜88%に達する。これは市場で最も攻撃的な最前線モデル価格である。
重要な詳細:200Kトークンのプロンプト閾値を超えると、リクエスト全体がより高いロングコンテキストレートで再計算される。200Kを超えた分だけではなく、リクエスト全体である。この境界付近で稼働するエンタープライズは、意図せぬコスト増加を避けるため、プロンプトを慎重に設計すべきである。
Artificial Analysisでのコスト効率は、Grok 4.6がタスクあたり約**$0.66〜0.84で完了することを示しており、GPT-5.6 SolまたはFable 5の同等タスクより32〜73%安価**である。長時間実行評価では平均約53ターン、約500M入力トークンであったのに対し、Claude Opus 5 Maxでは約103ターン、約2Bトークンであり、持続的なエージェントワークロードで実質的に優れた効率を示している。
提供状況
Grok 4.6は以下で同日提供開始された。
- xAI API、Cursor、Grok Build、Grok Bot、OpenRouter、Vercel、Cloudflare(8月12日)
- GitHub Copilot(8月14日) — Pro、Pro+、Max、Business、Enterprise層でVS Code、Visual Studio、Copilot CLI、JetBrains、Xcode、Eclipse、クラウドエージェントで利用可能
GitHub Copilotへの統合は重要である。リリースから48時間以内にGitHubの巨大な開発者ベースの前にGrok 4.6を配置する。SuperGrokサブスクライバー($30/月)はGrok Build内でアクセスでき、初週のプロモでCursorとGrok Buildで2倍の利用枠込みが提供された。
注意点
いくつかの注意点が見出しの数値を緩和する。
- いくつかのベンチマークテーブルはベンダー報告である。「GPT-5.6 Solと同点」という主張は一部のメディアでxAI自身の主張として掲載されており、独立した検証ではない
- 一部のレビューアーは最初のトークンレイテンシの遅さを指摘している。インタラクティブなコーディングワークフローにとって意味のある問題である
- トップモデルに対するコーディングベンチマークのギャップは残っており、特にTerminal-BenchとDeepSWEで顕著である
- エンタープライズポジショニングの転換は意図的である。SpaceXAIはGrok 4.6を「長時間実行エージェントのためにゼロから構築された初のSpaceXAIモデル」と呼んでおり、コンシューマーチャットボットからエンタープライズエージェントプラットフォームへの転換である
Grok Bot:永続的AIチームメイト — そしてセキュリティアーキテクチャのギャップ
2026年8月11日、SpaceXAIはGrok Botをベータ版としてローンチした。これは「AIチームメイト」カテゴリへの同社の参入である。この製品は、顧客のツールにログインし、アプリケーションを横断して作業し、継続的な監視なしに多段階のジョブを完了する常時稼働のAIエージェントを提案する。
リリースされた内容
各Botは、クラウドコンピュータ上の名前付きの永続的なエージェントである(ブラウザ、ファイルシステム、ターミナルを備えたLinux VM)。ラップトップを閉じても作業を継続する。Botはユーザーの既存のアプリにユーザーの認証情報でログインし、クリーンなAPIを持たないUIを操作するためにコンピュータ使用機能を用いる。Gmail、Slack、CRMなどがその対象である。
主な機能:
- デモによる学習: タスクを一度実行する様子を見せると、Botはそれをルーチンとして保存し、スケジュールまたはイベントトリガーで発火する(Botあたり最大約50ルーチン)
- Bot間連携: 複数のBotが互いにメッセージを送り合い、スレッド内でコンテキストを共有し、グループチャットで調整できる。作業の受け渡しや所有権の割り当てをBot同士で行う
- 永続的なコンテキスト: Botは会話をまたいで情報を保持し、時間とともに好みやエッジケースを学習する
- プラットフォーム対応: macOS、Windows、Linux、iOS(Androidは「近日対応」)。エンタープライズアクセスはSSO、SCIM、RBACを備えたウェイトリスト経由
ベータ版開始時の基盤モデルはGrok 4.5から、8月12日以降はGrok 4.6に移行した。
共有コンピュータの問題
Grok Botのローンチで最も重大な詳細は、セキュリティアーキテクチャに関するマーケティングとドキュメンテーションの乖離である。
ローンチページにはこう書かれている。**「Botにはそれぞれ独自のコンピュータがある」**と。この表現は分離を示唆している。つまり、各Botが独自のサンドボックス環境で動作し、個別の認証情報と封じ込められたブラスト半径を持つことを意味する。
しかしxAI自身のドキュメンテーションは別のことを述べている。Grok Botの概要ページによれば、**「すべてのBotが同じ永続的なクラウドコンピュータを使用します」**という。コンピュータはアカウント単位で分離されており、個々のBot単位ではない。各Botはそのマシン上で独自の画面を持つが、ファイル、ブラウザセッション、コマンドラインの認証情報はBot全体で共有される。
ドキュメンテーションはこれを明確に記載している。
「セキュリティ境界として個別のBotを使用しないでください。」
つまり、あるBotが確立した認証情報(ログイン、APIキー、セッショントークン)は、同じアカウント上の他のすべてのBotがアクセスできる。Botの削除はソフト削除である。 Botを削除すると、そのプロフィール、会話、ルーチンは削除されるが、共有コンピュータ上のファイルやログイン情報は残存し、ソースで失効されるまで残りのBotからアクセスできる可能性がある。
エンタープライズ評価の観点では、このアーキテクチャは理にかなっている。Botが互いに作業を低コストで受け渡すことを可能にするからだ。ただし、Botの一覧全体を単一のアイデンティティ面として扱うことが求められる。いかなるセキュリティレビューも、Bot単位の封じ込めではなく、「任意のBotが到達できるすべてのもの」としてアクセスをモデル化しなければならない。「独自のコンピュータ」という表現から分離を合理的に推測するステークホルダーにこの点を伝えることは、マーケティング言語によって難しくなっている。
価格とアクセス
Grok Botに単独の価格はない。アクセスは既存の3つのサブスクリプション層にバンドルされている。
| Tier | Price | Provider |
|---|---|---|
| SuperGrok Heavy | $300/月(3ヶ月間$99プロモ) | SpaceXAI |
| Cursor Ultra | $200/月 | Cursor |
| Cursor Teams Premium | $120/シート/月 | Cursor |
xAIはこれを「早期ベータ」と呼び、利用制限がある。Muskは修正後にアクセスが拡大すると述べた。エンタープライズアクセス(SSO、SCIM、RBAC)はウェイトリストの後ろにゲートされている。
流通戦略は注目に値する。Grok Botは顧客がすでに支払っているサブスクリプションの中に組み込まれており、SpaceXAIのエージェント戦略をCursorのインフラに結びつけるものである。これは2026年6月のSpaceXによるCursor(Anysphere)の$60B買収を反映している。
Grok Imagine Image 2.0:リージョン認識編集、Arenaランキング2位
2026年8月7〜8日、SpaceXAIはgrok.com/imagineおよびiOS・Androidアプリの新しいQuality ModeとしてGrok Imagine Image 2.0の展開を開始した。このモデルはArenaでSpaceXAI名義で登場する。
新機能
- リージョンレベルの編集: マジックワンドツールが指し示した領域だけを編集し、残りはそのままにする。セグメンテーションは正確な領域を選択する。背景除去は任意の被写体を透明背景付きで書き出す
- マルチリファレンスブレンド: 1回の生成で最大5枚の入力画像を使用(1ソースあたり3枚)。手動コンポジットが不要
- 生成と編集を1つのモデルで — 別々のワークフローは不要
- 1K/2K解像度層、13種類のアスペクト比
- テンプレート: 写真編集、プロダクトショット、ヘッドショット、アイコン、ゲームアセットなど、一般的なワークフローのための既製の開始点
Arenaランキングとマーケティングの微妙な差
Image 2.0は2026年8月7日時点で、Arena Text-to-Image(Elo約1,320)およびArena Image Edit(Elo約1,439)の両リーダーボードで世界2位にランクインしている。OpenAIのGPT Image 2(1,380 / 1,463)に次ぐ位置である。ある情報源では、後にMicrosoftのMAI-Image-2.6によって3位に押し下げられたと報告されている。
注記すべきマーケティングの微妙な差:Arenaで2位のエントリーは**「low」コンピュートバリアント**(grok-imagine-image-2 (low))であり、品質バリアントはボード上ではより低いランクにある。コンシューマー向けの「Quality Mode」はより高いコンピュートのモデルを使用するため、最高品質の出力を得ているユーザーは必ずしもランキングを獲得したモデルを使用しているわけではない。これは欺瞞ではない — Arenaランキングは提出されたものを反映している — が、競争上の主張を曖昧にする。
Grok 4.7:SpaceXデータ訓練とプライバシーの炎上
先行きを見据えると、Muskは全社ミーティング(Xに公開投稿された)で、Grok 4.7が「SpaceXの企業データの大量」を用いた補助トレーニング中であり、「3〜4週間で準備完了」する — 2026年9月上旬〜中旬をターゲットにしている — と発表した。報告されたスペック(未確認、モデルカードなし):4.6の1.5Tに対して約2.1Tパラメータ。
MuskはGrok 4.7が「現在のすべてのモデルを超える」と主張し、SpaceX特有のコーパス(Starlinkテレメトリ、Raptorエンジンログ、Starship再突入データ、Slack/Jira/GitHub/ERPアーティファクト)を考えると、「実世界のエンジニアリングでより優れたモデルがあるとしたら驚きだ」と述べた。
従業員データの問題
論争の中心はモデルではなく、トレーニングデータである。
MuskはSpaceXの従業員に、Grokが**「SpaceXのすべての情報の総量」**で訓練されると告げた。そして「ある意味で、それはあなたたちの上で訓練される。あなたたちは事実上このAIの親になる」と付け加えた。
この発表に欠けているもの:
- どのデータカテゴリが含まれるかの開示なし(コミュニケーション、ログ、メトリクス、行動データ)
- opt-outメカニズムの説明なし
- データの収集、フィルタリング、保護方法に関するプライバシープロトコルなし
- スコープの制限なし — 「総量」は一切を意味し、内部コミュニケーションや意思決定パターンを含む
約14,000〜15,000人のSpaceX従業員が潜在的に対象となる。法的な状況は未確定である。職務著作の原則は作業成果をカバーするが、継続的な行動キャプチャ(キーストローク、意思決定パターン、コミュニケーションメタデータ)はグレーゾーンにある。TechTimesの報道によれば、SpaceXの従業員は管轄権のギャップによりNLRBへの申し立てができない。
Metaの先例
最も近い類似例はMetaのModel Capability Initiative(2026年4月)である。これは従業員のキーストローク、マウスクリック、スクリーンショットをキャプチャして社内AIモデルを訓練するものだった。その結果:
- 約1,600人の従業員がプログラムに反対する請願書に署名
- 6月にプライベートデータが社内全体に漏洩するSEV 2インシデントが発生
- リークを受けてプログラムは一時停止
SpaceXAIはMetaの失敗を研究したか、同様の結果に対する安全策を実装したかについて言及していない。開示されたガバナンスフレームワークの不存在 — Muskの公開的で拡大的な枠組みと組み合わせると — 現実的な規制上およびレピュテーション上のリスクを生み出している。欧州委員会、カリフォルニア州司法長官、英国、オーストラリア当局はすでに別の案件でXとGrokの調査を開始している。
エンタープライズが尋ねるべきガバナンスの問い
SpaceXAIのモデルを評価するいかなるエンタープライズにとっても、SpaceXのトレーニングプログラムは直接的な論争を超えたガバナンスの問いを提起する。
- データの出所: SpaceXAIはAPI経由で出荷されたモデルが不適切に取得された従業員の行動データで訓練されていないことを証明できるか?
- 規制上の曝露: 調査がいずれかの管轄区域でトレーニングプログラムがプライバシー法に違反したと判断した場合、本番環境でそれらのモデルを使用している顧客の是正措置の道筋は何か?
- 従業員同意のインフラ: SpaceXにはAI訓練におけるインフォームド・コンセントのフレームワークがあるか、それとも「あなたたちはこのAIの親になる」というのが開示のすべてか?
これらは仮説的な懸念ではない。Grokを本番環境の依存先としてコミットする前に、いかなるコンプライアンスチームも尋ねるべき調達デューデリジェンスの問いである。
ディープフェイク危機:Grokが追跡可能な攻撃の87%に関連
今週最も警鐘を鳴らすべきデータポイントは、Resemble AIの2026年上半期ディープフェイク脅威レポート(8月12日公開)からのものである。
数値
- 1,760件のニュース報道から821件のドキュメント化されたディープフェイク攻撃
- 約346万件の合成ファイルが生成
- 15,736人以上の確認された被害者
- 6ヶ月間のメディアリーチ:2,928億インプレッション — 2025年通年(2,964億)にほぼ匹敵
- 追跡可能なファイルの87%がGrokに帰属
- **6回に1回の攻撃(137件)**が成人または未成年の非合意親密画像(NCII)を含む
規模は驚異的である。追跡可能なディープフェイクの風景におけるGrokの支配率(生成モデルを特定できたファイルの87%)は、Grokの市場ポジションと画像生成ツールの相対的なアクセスのしやすさの両方を反映している。レポートはxAIがこれらの用途を意図または助長していると主張するものではない。帰属は生成ファイルの技術的なフィンガープリンティングに基づいている。
規制上・法的な曝露
複数の規制当局が調査を開始している。
- 欧州委員会 — DSA規定に基づきXとGrokを調査中
- カリフォルニア州司法長官 — 州のディープフェイクおよびNCII法とのコンプライアンスを調査中
- 英国およびオーストラリア — Grokプラットフォームの慣行に関する個別調査
非合意画像の許可または配信を行う企業に対する15 U.S.C. §6851に基づく法定民事責任は約**$22.4億**と推定されている。
方法論の注意点
このレポートは公的に報告されたインシデントと追跡可能なファイルのみに基づいている。実際の数値はおそらくより高い。Resemble AIはまた、未見のジェネレーターからの合成コンテンツを特定するために設計された検出モデルDETECT-Worldをリリースした。これは有用な防御ツールであるが、根本原因ではなく症状に対処するものである。
エンタープライズにとっての意味
ディープフェイクレポートは、エンタープライズがGrokを避けるべきという意味ではない。ただし、Grokの画像生成機能を使用する組織は以下が必要である。
- 実在の人物の同意なしの合成メディアを明示的に禁止する利用規定
- NCIIまたは名誉毀損法に違反する可能性のある生成コンテンツの出力モニタリング
- xAIのコンテンツモデレーションインフラ(またはその欠如)を考慮したベンダーリスクアセスメント
- 組織のAPI使用に追跡されたディープフェイクに対するインシデント対応計画
隣接動向:River AIの$11億調達
今週注目に値する:River AI(Igor Babuschkin設立、xAI共同創業者、元DeepMind/OpenAI)が、約$50Bのポストマネー評価額で**$11億**のシード+シリーズA資金調達を実施した。このラウンドはGeneral CatalystとAMP PBCが共同リードし、Nvidia、AMD Ventures、Temasek、Y Combinator、a16zが参加した。
River AIは設立わずか2ヶ月で、製品はまだない。そのピッチはオープンウェイト、ユーザー所有、ローカル推論可能なパーソナルおよびエンタープライズAIである。この資金調達が注目されるのは、BabuschkinがオリジナルのGrokのアーキテクチャを構築するのに貢献した人物であり、xAIからの離脱後、即座にオープンウェイト競合としてのメガファンディングを行ったことが、最前線モデル市場がまだ決着していないことを示唆しているからである。投資家名簿(Nvidia、AMD Ventures)は、ハードウェア企業がオープンとクローズドのモデルエコシステムの両方にヘッジしていることも示唆している。
競合コンテキスト:Qwen 3.8-Maxが8月12日にオープンウェイトでリリース(カスタムライセンス、Apacheではない。ビジョン + 100万コンテキストはAPIのみ)。DeepSeek V4 ProがAPIアップデートを受信。MetaがMuse Glimmer 30Bをリリース(Apache 2.0)。オープンウェイトエコシステムはクローズドな最前線モデルに対する信頼できる代替品を生み続けている。
注目ポイント
- Grok 4.7ローンチタイムライン: Muskの「3〜4週間」ターゲットはリリースを9月上旬〜中旬に位置づける。SpaceXデータ訓練の論争がローンチ前に何らかの開示またはガバナンスの変更を強制するかに注目。docs.x.aiにはまだモデルカード、価格、コンテキストウィンドウの詳細は存在しない。
- SpaceX従業員データガバナンス: 従業員の反発、規制措置、またはSpaceXAIのトレーニングデータガバナンスフレームワークの開示に注目。Metaの先例(請願 → リーク → 一時停止)は起こりうる軌跡である。
- ディープフェイク規制措置: Resemble AIのレポートは欧州、カリフォルニア、英国、オーストラリアの規制当局の注目を集めた。特にDSAまたは15 U.S.C. §6851に基づくXまたはSpaceXAIに対する具体的な執行措置に注目。
- Grok 4.6の独立ベンチマーク: 本モデルはLMArena評価にリストされている。独立したベンチマーク検証(特にxAIの数値が最も弱いTerminal-BenchとDeepSWE)が、複合スコアがxAI独自の評価スイートの外でも維持されるかを決定づける。
- Grok Botのセキュリティ開示: 「独自のコンピュータ」と「1台の共有コンピュータ」の乖離は、エンタープライズのセキュリティレビューで表面化する。xAIがマーケティング言語を更新するか、技術的な分離制御を追加するか、セキュリティアーキテクチャのドキュメントを公開するかに注目。
- Grok Botのモデル開示: Grok Botを動かしているモデルについてのxAIの沈黙は異例である。Botがより小型または安価なモデルで動作している場合、能力の上限とコスト経済はバイヤーが想定するものとは異なる。
- River AIの軌跡: $11億と信頼できる創業者を擁し、最初の製品リリースに注目。xAIの元アーキテクトによるオープンウェイトの最前線モデルは競争環境を再構築するだろう。
- SpaceXのロックアップカスケード: インサイダー株式ロックアップ解除の最初のトランシェが8月6日に開始され、以降12月まで2週間ごとに追加トランシェが続く。売り圧力はSPCXの株価パフォーマンスを形成し、ひいてはSpaceXの現在の設備投資規模(直近の決算発表で四半期$18.4Bの設備投資)でのAIインフラ支出に対する市場の意欲を形成する。
毎日のAIエコシステムアップデートは、XでKevin Kaminskiをフォロー。来週のxAIウィークリーもお楽しみに。