Cursor ヘビーユーザー、エンジニアリングリード、API 調達担当者が 2026年7月8日の Grok 4.5 ローンチを見守る際、論点は「Opus 級かどうか」ではありません。論点は実際のワークロードでタスク単価 $2.49 が $11.80 を下回るかです。本稿では結論ファーストの判断材料、コアスペック、API とタスク単価の比較表、コーディングおよび Agent ベンチマーク、CursorBench 汚染問題、TryAI 実測結果、8ステップの Cursor/API 導入手順、混合モデルルーティング、FAQ 6問、一次ソースをまとめます。ノード構成は 料金ページをご参照ください。
短い結論:Grok 4.5 は 2026年中期時点で最も精度の高いコーディングモデルではありません。大量の Agent パイプラインでは、当社が計測した範囲で知能あたりコスト最強の選択肢であり、その差は日々拡大しています。
[ SECTION_01 ] // OVERVIEW Grok 4.5 とは何か、コアスペック、乗り換えを躊躇させる要因
Grok 4.5 は xAI のフロンティアモデルであり、同社が上場した後の初の大型リリースです。対象領域はコーディングとソフトウェアエンジニアリング、多段階 Agent 自動化、知識集約型業務(法務、医療、教育、データ分析)です。
本モデルは Cursor と共同学習されています。SpaceX は 2026年6月に Cursor 親会社 Anysphere を買収し、Grok 4.5 の学習には実際の IDE セッションから数兆 Token——コードレビュー、デバッグ、Agent とコードベースの対話——が含まれています。
| 項目 | 値 |
|---|---|
| アーキテクチャ | Mixture of Experts(MoE) |
| コンテキストウィンドウ | 500,000 Token |
| 推論モード | Low / Medium / High(デフォルト:High) |
| 推論速度 | 公式 80 TPS、実測約 90 TPS |
| 学習ハードウェア | NVIDIA GB300 GPU 数万基(テネシー州メンフィス) |
| パラメータ数 | 非公開(MoE) |
クリーンな乗り換えを阻む課題:
- ベンチマークと請求の乖離:リーダーボードの点数は Token 消費を無視します。スコアが5点低くても、マージ済み PR あたりのコストは4分の1になることがあります。
- CursorBench の信頼ギャップ:学習データ汚染が判明後、ローンチ資料から CursorBench が撤回されました。ベンダー単独の Cursor 数値にはまだ頼れません。
- 幻覚率の上昇:独立評価機関は AA-Omniscience Index で幻覚率 54%を報告しており、前世代 Grok を上回ります。本番では検証ゲートが必須です。
- EU 提供の遅れ:ローンチ時点の API リージョンは
us-east-1とus-west-2のみ。EU アクセスは 2026年7月中旬が見込まれます。 - 単一モデル固定:すべてのタスクに1つのフロンティアモデルを当てると、定型コード生成では過払い、設計判断では品質不足になります。
- ホストの不安定さ:Token が安くても、ローカル Mac がスリープして Agent ループが途切れれば意味がありません。長時間の Cursor ジョブには常時稼働の Apple Silicon ホストが必要です。
[ SECTION_02 ] // PRICING API 料金、タスク単価、4.2倍の Token 効率差
表示価格は半分の話に過ぎません。Grok 4.5 の強みは単価と出力 Token 効率の両方です。SWE-Bench Pro タスクでは平均出力 15,954 Token/タスクでしたが、Claude Opus 4.8 は同作業で67,020 Token——4.2倍の効率差です。
| モデル | 入力 | 出力 |
|---|---|---|
| Grok 4.5 | $2.00 | $6.00 |
| Grok 4.5(キャッシュ入力) | $0.50 | — |
| Grok 4.5 Fast | $4.00 | $18.00 |
| Claude Opus 4.7 | $5.00 | $25.00 |
| Claude Fable 5 | 上位ティア | 上位ティア |
| GPT-5.6 Sol | $5.00 | $30.00 |
| GPT-5.6 Luna | $1.00 | $6.00 |
| モデル / プラットフォーム | タスクあたり平均 Token | 推定コスト/タスク |
|---|---|---|
| Grok 4.5 / Grok Build | 約 1.9M | $2.49 |
| GPT-5.5 / Codex | 約 6.2M | $5.07 |
| Claude Fable 5 / Claude Code | 約 7.2M | $11.80 |
1日500タスクなら、Claude Code 級スタックとの差はおおよそ$1,245/日 対 $5,900/日です。キャッシュヒットが効きます。Responses API では prompt_cache_key、Chat Completions では x-grok-conv-id を設定し、キャッシュ済み入力を $2.00 から$0.50/100万 Tokenへ下げてください。
ベンチマーク上の精度とドルあたりの価値は同じではありません。Grok 4.5 の訴求は広告コピーではなく、算術です。
[ SECTION_03 ] // BENCHMARKS コーディングスコア、Agent 優位、知能指数、CursorBench 問題
xAI はローンチ時に4つのコーディングベンチマークを公開しました。第三者数値が空白を埋めます。まず中立ハーネスの行を読んでください。ベンダーハーネスはスコアを膨らませます。
| ベンチマーク | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| DeepSWE 1.0(提供者ハーネス) | 62.0% | 66.1% | 55.75% | 64.31% |
| DeepSWE 1.1(中立ハーネス) | 53% | 70% | 59% | 67% |
| Terminal Bench 2.1 | 83.3% | 84.3% | 78.9% | 83.4% |
| SWE-Bench Pro | 64.7% | 80.4% | 69.2% | 58.6% |
コーディングの読み取り:DeepSWE 1.1 が最も正直な比較です。Grok 4.5 は3競合すべてに後れを取り、Fable 5 が17ポイント先行します。Terminal Bench 2.1 は5.4ポイント以内に集中しており、わずかなスコア差よりコストと適合性が勝ちます。SWE-Bench Pro は難易度最高のテストで、Grok 4.5 は3位、複数ファイル作業では Fable 5 に15.7ポイント遅れです。
CursorBench の注意点:Cursor 自身のコードベースのスナップショットが Grok 4.5 の学習データに誤って含まれたため、xAI はローンチ資料から CursorBench を削除しました。これは明確な汚染リスクです。Cursor 固有のベンダー主張は、独立再検証が出るまで暫定扱いにしてください。
| ベンチマーク | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| AutomationBench-AA(657件の企業ワークフロー) | 51.4% | 48.6% | 48.5% |
| Snorkel GDPVal+(専門知識業務) | 29% | — | 21% |
AutomationBench-AA は Gmail、Slack、Salesforce、HubSpot など40の企業アプリを模擬します。Grok 4.5 はビジネス制約を破らずにワークフロー目標の半数超を達成した初のモデルです。Snorkel GDPVal+ では法務(40% 対 27–28%)、教育(58% 対 35–42%)、医療(35% 対 23–25%)で大差を示しました。
総合知能:Artificial Analysis Intelligence Index は Grok 4.5 を54/100と評価します。Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)に次ぐ4位ですが、前世代 Grok から16ポイントの跳躍です。
[ SECTION_04 ] // REAL_TESTS TryAI 実測、利用プラットフォーム、API クイックスタート
独立テスター TryAI は、Grok 4.5、GPT-5.5、Opus 4.8、Fable 5 に同一のワンショットプロンプトを与え、ブラウザ上のインタラクティブアプリをゼロから構築させました。
3D キューブ描画(最難関):Opus 4.8 と Fable 5 は初回で成功しました。Grok 4.5 は1回目でタイトルとボタンは出たもののキューブは未描画、再試行で合格しました。GPT-5.5 は完全に失敗しました。
速度とコスト:Grok 4.5 は初 Token を500ms未満で返し、約110 Token/秒でストリーミングしました。競合の約2倍のスループットです。Token 数が多い試行でも毎回最安でした。Fable 5 は最遅かつ最高コストでした。
実務上の結論:ワンショット精度と複雑なステートフル UI は依然 Claude 優位です。大量の反復コード生成は Grok 4.5 の速度とコストが有利です。
Grok 4.5 が利用可能なプラットフォーム(EU は 2026年7月中旬見込み):
- Grok Build:xAI 純正コーディング Agent。Grok 4.5 がデフォルトモデル
- Cursor:全プラン対応——デスクトップ、Web、iOS、CLI、SDK。ローンチ週は利用枠2倍
- xAI Console API:Chat Completions と Responses API。
us-east-1、us-west-2 - Microsoft Office アドイン:Word、PowerPoint、Excel のデフォルト
- サードパーティゲートウェイ:OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic
ローンチ時の API 上限:150 リクエスト/秒、5,000万 Token/分。
curl -s https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "Find and fix the bug: function median(a){a.sort();return a[a.length/2]}"
}'
[ SECTION_05 ] // SETUP 8ステップの Cursor/API 導入、混合モデルルーティング、切り替え判断
本番トラフィックを Grok 4.5 に流す前に、次の手順を実行してください。
- xAI API キーを作成:xAI Console でキーを発行し、シークレットマネージャーに保存します。リポジトリ内ファイルには置かないでください。
- 認証情報をローカルへ設定:シェルプロファイルまたは CI シークレットに
export XAI_API_KEY=...を設定します。 - Responses API をスモークテスト:上記 curl 例を実行し、median バグに対するパッチ差分が返ることを確認します。
- キャッシュルーティングを有効化:Responses API では
prompt_cache_key、Chat Completions ではx-grok-conv-idを付与し、繰り返し Agent ターンでキャッシュ入力 $0.50/M を使います。 - Context Compaction を有効化:長い Agent ループではツールラウンド間でコンテキストを圧縮し、Token 蓄積を抑えます。
- Cursor で Grok 4.5 を選択:任意プランのモデルピッカーから Grok 4.5 を選び、定型サブタスクの Agent モードにピン留めします。
- 混合モデルルーティングを導入:大量のコード生成、テスト修正、ドキュメント更新は Grok 4.5 へ。アーキテクチャ、セキュリティ、複数ファイルリファクタは Claude Fable 5 へエスカレーションします。
- 出力検証を追加:テストとリンターでマージをゲートします。独立評価のAA-Omniscience 幻覚率 54%を踏まえ、特に本番では厳格に運用してください。
| シナリオ | 推奨 | 理由 |
|---|---|---|
| 1日数百〜数千の Agent タスク | Grok 4.5 を使う | タスク単価 $2.49 対 $11.80 の差が急速に積み上がる |
| ターミナル・ツール利用が多いワークフロー | Grok 4.5 を使う | AutomationBench-AA で 51.4% と首位 |
| Cursor ネイティブチーム | Grok 4.5 を使う | 共同学習モデルで統合コストがほぼゼロ |
| SWE-Bench Pro 級の精密リファクタ | Claude Fable 5 を優先 | 最難コーディングベンチで 80.4% 対 64.7% |
| 金融・安全クリティカル・コンプライアンスコード | Claude + 人間レビューを優先 | 幻覚率 54% は厳格なゲートを要求 |
| 現時点で EU データレジデンシーのみ | 待機またはハイブリッド | API は 2026年7月中旬まで US リージョン限定 |
引用可能な技術データポイント——ベンダー更新後は再確認してください。
- コンテキストウィンドウ:500,000 Token——圧縮を有効にすれば大規模リポジトリの Agent セッションに十分です。
- Token 効率:SWE-Bench Pro タスクあたり平均出力15,954 対 67,020 Token(Opus 4.8 比)——4.2倍差。
- Agent ワークフロー完了率:AutomationBench-AA で51.4%——ビジネス制約を破らず50%超を達成した初のフロンティアモデル。
- 推論スループット:公式80 TPS、実測約90 TPS、TryAI ストリーミングで約110 TPS。
- 知能指数:Artificial Analysis スコア54/100、世代間で16ポイント上昇。
[ SECTION_06 ] // FAQ FAQ、参考ソース、Agent ワークロードの安定実行
FAQ:
- Grok 4.5 は Claude Opus 4.8 より優れていますか? Opus 4.8 は生のコーディング精度で優位です(SWE-Bench Pro:69.2% 対 64.7%)。Grok 4.5 は速度、Token 効率、タスク単価で勝ち、しばしば4倍の差が出ます。エージェント型ワークフロー完了率では AutomationBench-AA で Grok 4.5 が Opus を上回ります。
- Grok 4.5 は無料で使えますか? リリース直後は Grok Build と Cursor で期間限定の無料枠がありました。継続的な API 料金は入力 $2/100万 Token、出力 $6/100万 Token です。Cursor プランのモデルプールにも含まれます。
- Cursor で Grok 4.5 を使うには? 全プランで自動利用可能です。モデル選択から Grok 4.5 を選びます。ローンチ後1週間は利用枠が2倍でした。
- コンテキストウィンドウは? 500,000 Token です。長いループでは Context Compaction と組み合わせれば大規模コードベースの大半に対応できます。
- CursorBench が外された理由は? Cursor コードベースのスナップショットが学習データに入り、ベンチマークが汚染されました。xAI は結果を撤回し、独立再検証が予定されています。
- Grok 4.5 は OpenRouter で使えますか? はい。Vercel AI Gateway、Cloudflare、Snowflake、Databricks Mosaic でも利用できます。
一次参考ソースです。料金または機能更新後はリンクを再確認してください。
TechCrunch:xAI が Grok 4.5 をリリース
Awesome Agents:独立 Grok 4.5 レビュー
Valletta Software:Grok 4.5 vs Claude vs GPT
Grok 4.5 はタスク単価を大幅に下げますが、スリープするノート PC で Agent ループが死ぬ、EU ルーティングが塞がれる、未検証の出力が本番に出ると節約は一瞬で消えます。個人 MacBook は Cursor Agent の長時間実行、Grok Build パイプライン、大規模な Xcode 検証の24時間稼働面としては不向きです。
Grok 4.5、混合モデル Cursor ワークフロー、iOS CI/CD を専用 Apple Silicon ホストで24時間稼働させる必要がある場合、ベアメタル Mac 容量は不安定なローカル端末の火消しより通常コスパが良いです。NOVAKVM は複数リージョンの Mac Mini M4 / M4 Pro 柔軟レンタル、固定帯域、デフォルト SSH を提供し、AI Agent 自動化とモバイルビルド検証の同機運用に適しています。料金ページ、注文ページ、ヘルプセンターをご参照ください。