Grok 4.5 レビュー 2026:
xAIのコーディングモデルに乗り換える価値はあるか

Cursor ヘビーユーザー、エンジニアリングリード、API 調達担当者が 2026年7月8日の Grok 4.5 ローンチを見守る際、論点は「Opus 級かどうか」ではありません。論点は実際のワークロードでタスク単価 $2.49 が $11.80 を下回るかです。本稿では結論ファーストの判断材料、コアスペック、API とタスク単価の比較表、コーディングおよび Agent ベンチマーク、CursorBench 汚染問題、TryAI 実測結果、8ステップの Cursor/API 導入手順、混合モデルルーティング、FAQ 6問、一次ソースをまとめます。ノード構成は 料金ページをご参照ください。

短い結論:Grok 4.5 は 2026年中期時点で最も精度の高いコーディングモデルではありません。大量の Agent パイプラインでは、当社が計測した範囲で知能あたりコスト最強の選択肢であり、その差は日々拡大しています。

Grok 4.5 は xAI のフロンティアモデルであり、同社が上場した後の初の大型リリースです。対象領域はコーディングとソフトウェアエンジニアリング多段階 Agent 自動化知識集約型業務(法務、医療、教育、データ分析)です。

本モデルは Cursor と共同学習されています。SpaceX は 2026年6月に Cursor 親会社 Anysphere を買収し、Grok 4.5 の学習には実際の IDE セッションから数兆 Token——コードレビュー、デバッグ、Agent とコードベースの対話——が含まれています。

Grok 4.5 コアスペック(2026年7月時点)
項目
アーキテクチャ Mixture of Experts(MoE)
コンテキストウィンドウ 500,000 Token
推論モード Low / Medium / High(デフォルト:High)
推論速度 公式 80 TPS、実測約 90 TPS
学習ハードウェア NVIDIA GB300 GPU 数万基(テネシー州メンフィス)
パラメータ数 非公開(MoE)

クリーンな乗り換えを阻む課題:

  • ベンチマークと請求の乖離:リーダーボードの点数は Token 消費を無視します。スコアが5点低くても、マージ済み PR あたりのコストは4分の1になることがあります。
  • CursorBench の信頼ギャップ:学習データ汚染が判明後、ローンチ資料から CursorBench が撤回されました。ベンダー単独の Cursor 数値にはまだ頼れません。
  • 幻覚率の上昇:独立評価機関は AA-Omniscience Index で幻覚率 54%を報告しており、前世代 Grok を上回ります。本番では検証ゲートが必須です。
  • EU 提供の遅れ:ローンチ時点の API リージョンは us-east-1us-west-2 のみ。EU アクセスは 2026年7月中旬が見込まれます。
  • 単一モデル固定:すべてのタスクに1つのフロンティアモデルを当てると、定型コード生成では過払い、設計判断では品質不足になります。
  • ホストの不安定さ:Token が安くても、ローカル Mac がスリープして Agent ループが途切れれば意味がありません。長時間の Cursor ジョブには常時稼働の Apple Silicon ホストが必要です。

表示価格は半分の話に過ぎません。Grok 4.5 の強みは単価と出力 Token 効率の両方です。SWE-Bench Pro タスクでは平均出力 15,954 Token/タスクでしたが、Claude Opus 4.8 は同作業で67,020 Token——4.2倍の効率差です。

API Token 料金(100万 Token あたり、2026年7月)
モデル 入力 出力
Grok 4.5 $2.00 $6.00
Grok 4.5(キャッシュ入力) $0.50
Grok 4.5 Fast $4.00 $18.00
Claude Opus 4.7 $5.00 $25.00
Claude Fable 5 上位ティア 上位ティア
GPT-5.6 Sol $5.00 $30.00
GPT-5.6 Luna $1.00 $6.00
Agent 型コーディングタスクの推定コスト
モデル / プラットフォーム タスクあたり平均 Token 推定コスト/タスク
Grok 4.5 / Grok Build 約 1.9M $2.49
GPT-5.5 / Codex 約 6.2M $5.07
Claude Fable 5 / Claude Code 約 7.2M $11.80

1日500タスクなら、Claude Code 級スタックとの差はおおよそ$1,245/日 対 $5,900/日です。キャッシュヒットが効きます。Responses API では prompt_cache_key、Chat Completions では x-grok-conv-id を設定し、キャッシュ済み入力を $2.00 から$0.50/100万 Tokenへ下げてください。

ベンチマーク上の精度とドルあたりの価値は同じではありません。Grok 4.5 の訴求は広告コピーではなく、算術です。

xAI はローンチ時に4つのコーディングベンチマークを公開しました。第三者数値が空白を埋めます。まず中立ハーネスの行を読んでください。ベンダーハーネスはスコアを膨らませます。

コーディングベンチマーク解決率(2026年7月)
ベンチマーク Grok 4.5 Claude Fable 5 Claude Opus 4.8 GPT-5.5
DeepSWE 1.0(提供者ハーネス) 62.0% 66.1% 55.75% 64.31%
DeepSWE 1.1(中立ハーネス) 53% 70% 59% 67%
Terminal Bench 2.1 83.3% 84.3% 78.9% 83.4%
SWE-Bench Pro 64.7% 80.4% 69.2% 58.6%

コーディングの読み取り:DeepSWE 1.1 が最も正直な比較です。Grok 4.5 は3競合すべてに後れを取り、Fable 5 が17ポイント先行します。Terminal Bench 2.1 は5.4ポイント以内に集中しており、わずかなスコア差よりコストと適合性が勝ちます。SWE-Bench Pro は難易度最高のテストで、Grok 4.5 は3位、複数ファイル作業では Fable 5 に15.7ポイント遅れです。

CursorBench の注意点:Cursor 自身のコードベースのスナップショットが Grok 4.5 の学習データに誤って含まれたため、xAI はローンチ資料から CursorBench を削除しました。これは明確な汚染リスクです。Cursor 固有のベンダー主張は、独立再検証が出るまで暫定扱いにしてください。

Agent 型・専門業務ベンチマーク
ベンチマーク Grok 4.5 Claude Fable 5 Claude Opus 4.8
AutomationBench-AA(657件の企業ワークフロー) 51.4% 48.6% 48.5%
Snorkel GDPVal+(専門知識業務) 29% 21%

AutomationBench-AA は Gmail、Slack、Salesforce、HubSpot など40の企業アプリを模擬します。Grok 4.5 はビジネス制約を破らずにワークフロー目標の半数超を達成した初のモデルです。Snorkel GDPVal+ では法務(40% 対 27–28%)、教育(58% 対 35–42%)、医療(35% 対 23–25%)で大差を示しました。

総合知能:Artificial Analysis Intelligence Index は Grok 4.5 を54/100と評価します。Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)に次ぐ4位ですが、前世代 Grok から16ポイントの跳躍です。

独立テスター TryAI は、Grok 4.5、GPT-5.5、Opus 4.8、Fable 5 に同一のワンショットプロンプトを与え、ブラウザ上のインタラクティブアプリをゼロから構築させました。

3D キューブ描画(最難関):Opus 4.8 と Fable 5 は初回で成功しました。Grok 4.5 は1回目でタイトルとボタンは出たもののキューブは未描画、再試行で合格しました。GPT-5.5 は完全に失敗しました。

速度とコスト:Grok 4.5 は初 Token を500ms未満で返し、約110 Token/秒でストリーミングしました。競合の約2倍のスループットです。Token 数が多い試行でも毎回最安でした。Fable 5 は最遅かつ最高コストでした。

実務上の結論:ワンショット精度と複雑なステートフル UI は依然 Claude 優位です。大量の反復コード生成は Grok 4.5 の速度とコストが有利です。

Grok 4.5 が利用可能なプラットフォーム(EU は 2026年7月中旬見込み):

  • Grok Build:xAI 純正コーディング Agent。Grok 4.5 がデフォルトモデル
  • Cursor:全プラン対応——デスクトップ、Web、iOS、CLI、SDK。ローンチ週は利用枠2倍
  • xAI Console API:Chat Completions と Responses API。us-east-1us-west-2
  • Microsoft Office アドイン:Word、PowerPoint、Excel のデフォルト
  • サードパーティゲートウェイ:OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic

ローンチ時の API 上限:150 リクエスト/秒5,000万 Token/分

grok-api-smoke-test.sh
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "Find and fix the bug: function median(a){a.sort();return a[a.length/2]}"
  }'

本番トラフィックを Grok 4.5 に流す前に、次の手順を実行してください。

  1. xAI API キーを作成:xAI Console でキーを発行し、シークレットマネージャーに保存します。リポジトリ内ファイルには置かないでください。
  2. 認証情報をローカルへ設定:シェルプロファイルまたは CI シークレットに export XAI_API_KEY=... を設定します。
  3. Responses API をスモークテスト:上記 curl 例を実行し、median バグに対するパッチ差分が返ることを確認します。
  4. キャッシュルーティングを有効化:Responses API では prompt_cache_key、Chat Completions では x-grok-conv-id を付与し、繰り返し Agent ターンでキャッシュ入力 $0.50/M を使います。
  5. Context Compaction を有効化:長い Agent ループではツールラウンド間でコンテキストを圧縮し、Token 蓄積を抑えます。
  6. Cursor で Grok 4.5 を選択:任意プランのモデルピッカーから Grok 4.5 を選び、定型サブタスクの Agent モードにピン留めします。
  7. 混合モデルルーティングを導入:大量のコード生成、テスト修正、ドキュメント更新は Grok 4.5 へ。アーキテクチャ、セキュリティ、複数ファイルリファクタは Claude Fable 5 へエスカレーションします。
  8. 出力検証を追加:テストとリンターでマージをゲートします。独立評価のAA-Omniscience 幻覚率 54%を踏まえ、特に本番では厳格に運用してください。
Grok 4.5 が向く場面と Claude を維持する場面
シナリオ 推奨 理由
1日数百〜数千の Agent タスク Grok 4.5 を使う タスク単価 $2.49 対 $11.80 の差が急速に積み上がる
ターミナル・ツール利用が多いワークフロー Grok 4.5 を使う AutomationBench-AA で 51.4% と首位
Cursor ネイティブチーム Grok 4.5 を使う 共同学習モデルで統合コストがほぼゼロ
SWE-Bench Pro 級の精密リファクタ Claude Fable 5 を優先 最難コーディングベンチで 80.4% 対 64.7%
金融・安全クリティカル・コンプライアンスコード Claude + 人間レビューを優先 幻覚率 54% は厳格なゲートを要求
現時点で EU データレジデンシーのみ 待機またはハイブリッド API は 2026年7月中旬まで US リージョン限定

引用可能な技術データポイント——ベンダー更新後は再確認してください。

  • コンテキストウィンドウ:500,000 Token——圧縮を有効にすれば大規模リポジトリの Agent セッションに十分です。
  • Token 効率:SWE-Bench Pro タスクあたり平均出力15,954 対 67,020 Token(Opus 4.8 比)——4.2倍差
  • Agent ワークフロー完了率:AutomationBench-AA で51.4%——ビジネス制約を破らず50%超を達成した初のフロンティアモデル。
  • 推論スループット:公式80 TPS、実測約90 TPS、TryAI ストリーミングで約110 TPS
  • 知能指数:Artificial Analysis スコア54/100、世代間で16ポイント上昇。

FAQ:

  • Grok 4.5 は Claude Opus 4.8 より優れていますか? Opus 4.8 は生のコーディング精度で優位です(SWE-Bench Pro:69.2% 対 64.7%)。Grok 4.5 は速度、Token 効率、タスク単価で勝ち、しばしば4倍の差が出ます。エージェント型ワークフロー完了率では AutomationBench-AA で Grok 4.5 が Opus を上回ります。
  • Grok 4.5 は無料で使えますか? リリース直後は Grok Build と Cursor で期間限定の無料枠がありました。継続的な API 料金は入力 $2/100万 Token、出力 $6/100万 Token です。Cursor プランのモデルプールにも含まれます。
  • Cursor で Grok 4.5 を使うには? 全プランで自動利用可能です。モデル選択から Grok 4.5 を選びます。ローンチ後1週間は利用枠が2倍でした。
  • コンテキストウィンドウは? 500,000 Token です。長いループでは Context Compaction と組み合わせれば大規模コードベースの大半に対応できます。
  • CursorBench が外された理由は? Cursor コードベースのスナップショットが学習データに入り、ベンチマークが汚染されました。xAI は結果を撤回し、独立再検証が予定されています。
  • Grok 4.5 は OpenRouter で使えますか? はい。Vercel AI Gateway、Cloudflare、Snowflake、Databricks Mosaic でも利用できます。

一次参考ソースです。料金または機能更新後はリンクを再確認してください。

xAI 公式発表:Grok 4.5

Cursor ローンチ記事:Grok 4.5

xAI API ドキュメント:Grok 4.5

TechCrunch:xAI が Grok 4.5 をリリース

Awesome Agents:独立 Grok 4.5 レビュー

APIdog:Grok 4.5 ベンチマーク詳解

Snorkel AI:専門業務評価

Valletta Software:Grok 4.5 vs Claude vs GPT

Grok 4.5 はタスク単価を大幅に下げますが、スリープするノート PC で Agent ループが死ぬ、EU ルーティングが塞がれる、未検証の出力が本番に出ると節約は一瞬で消えます。個人 MacBook は Cursor Agent の長時間実行、Grok Build パイプライン、大規模な Xcode 検証の24時間稼働面としては不向きです。

Grok 4.5、混合モデル Cursor ワークフロー、iOS CI/CD を専用 Apple Silicon ホストで24時間稼働させる必要がある場合、ベアメタル Mac 容量は不安定なローカル端末の火消しより通常コスパが良いです。NOVAKVM は複数リージョンの Mac Mini M4 / M4 Pro 柔軟レンタル、固定帯域、デフォルト SSH を提供し、AI Agent 自動化とモバイルビルド検証の同機運用に適しています。料金ページ注文ページヘルプセンターをご参照ください。