Cursor 파워 유저, 엔지니어링 리드, API 구매 담당자가 2026년 7월 8일 Grok 4.5 출시를 지켜본다면 핵심 질문은 머스크가 Opus급이라고 부른 것이 아닙니다. 실제 워크로드에서 Agent 작업당 2.49달러가 11.80달러를 이기는지입니다. 본문은 결론 우선 답변, 핵심 스펙, API·작업당 가격표, 코딩·Agent 벤치마크, CursorBench 오염 문제, TryAI 실측 결과, 8단계 Cursor/API 설정 가이드, 혼합 모델 라우팅, FAQ 6개, 1차 출처를 제공합니다. 노드 구성은 NOVAKVM 가격 페이지를 참고하세요.
짧은 답변: Grok 4.5는 2026년 중반 기준 가장 정확한 코딩 모델은 아닙니다. 대량 Agent 파이프라인에서는 측정한 범위에서 달러당 지능 최강 옵션이며, 이 격차는 매일 누적됩니다.
[ SECTION_01 ] // OVERVIEW Grok 4.5 정의, 핵심 스펙, 전환을 망설이는 이유
Grok 4.5는 xAI의 프론티어 모델로, 회사 상장 이후 첫 주요 릴리스입니다. 코딩·소프트웨어 엔지니어링, 다단계 Agent 자동화, 지식 집약 업무(법률, 의료, 교육, 데이터 분석)를 겨냥합니다.
이 모델은 Cursor와 공동 학습되었습니다. SpaceX가 2026년 6월 Cursor 모회사 Anysphere를 인수했으며, Grok 4.5 학습에는 실제 IDE 세션에서 수조 Token이 포함되었습니다. 코드 리뷰, 디버깅, Agent-코드베이스 상호작용 데이터가 반영되었습니다.
| 항목 | 값 |
|---|---|
| 아키텍처 | Mixture of Experts (MoE) |
| 컨텍스트 윈도 | 500,000 Token |
| 추론 모드 | Low / Medium / High (기본: High) |
| 추론 속도 | 공식 80 TPS, 실측 약 90 TPS |
| 학습 하드웨어 | 수만 대 NVIDIA GB300 GPU (미국 테네시주 멤피스) |
| 파라미터 수 | 미공개 (MoE) |
깔끔한 전환을 막는 페인 포인트:
- 벤치마크와 청구서 불일치: 리더보드 점수는 Token 소모를 무시합니다. 5점 낮은 모델이 병합 PR당 4배 저렴할 수 있습니다.
- CursorBench 신뢰 공백: 학습 데이터 오염이 드러나 출시 자료에서 CursorBench가 철회되었습니다. 벤더 단독 Cursor 수치에 의존하기 어렵습니다.
- 환각률 상승: 독립 평가기관이 AA-Omniscience Index에서 환각률 54%를 보고했습니다. 이전 Grok 세대보다 높으며 프로덕션에는 검증 게이트가 필요합니다.
- EU 가용성 지연: 출시 시 API 리전은
us-east-1,us-west-2만 지원합니다. EU 접근은 2026년 7월 중순 예상입니다. - 단일 모델 고집: 모든 작업에 하나의 프론티어 모델을 강제하면 일상 코드 생성은 과금되고 아키텍처 결정은 부족해집니다.
- 호스트 불안정: 저렴한 Token도 로컬 Mac이 Agent 루프 중 절전하면 무의미합니다. 장시간 Cursor 작업에는 상시 가동 Apple Silicon 호스트가 필요합니다.
[ SECTION_02 ] // PRICING API 가격, 작업당 비용, 4.2배 Token 효율 격차
표면 가격은 절반의 이야기입니다. Grok 4.5는 단가와 출력 Token 효율 모두에서 우위입니다. SWE-Bench Pro 작업당 평균 출력 Token은 15,954인 반면 Claude Opus 4.8은 동일 작업에 67,020을 사용했습니다. 4.2배 효율 격차입니다.
| 모델 | 입력 | 출력 |
|---|---|---|
| Grok 4.5 | $2.00 | $6.00 |
| Grok 4.5 (캐시 입력) | $0.50 | — |
| Grok 4.5 Fast | $4.00 | $18.00 |
| Claude Opus 4.7 | $5.00 | $25.00 |
| Claude Fable 5 | 상위 티어 | 상위 티어 |
| GPT-5.6 Sol | $5.00 | $30.00 |
| GPT-5.6 Luna | $1.00 | $6.00 |
| 모델 / 플랫폼 | 작업당 평균 Token | 예상 작업당 비용 |
|---|---|---|
| Grok 4.5 / Grok Build | 약 1.9M | $2.49 |
| GPT-5.5 / Codex | 약 6.2M | $5.07 |
| Claude Fable 5 / Claude Code | 약 7.2M | $11.80 |
하루 500건 작업 기준 Claude Code급 스택 대비 대략 일 1,245달러 vs 5,900달러입니다. 캐시 히트가 중요합니다. Responses API에서 prompt_cache_key, Chat Completions에서 x-grok-conv-id를 설정하면 캐시 입력을 100만 Token당 2.00달러에서 0.50달러로 낮출 수 있습니다.
벤치마크 정확도와 달러당 가치는 동일하지 않습니다. Grok 4.5의 핵심 논거는 산술이지 광고 문구가 아닙니다.
[ SECTION_03 ] // BENCHMARKS 코딩 점수, Agent 우위, 지능 지수, CursorBench 문제
xAI는 출시 시 네 가지 코딩 벤치마크를 공개했습니다. 제3자 수치가 공백을 채웁니다. 중립 하네스 행을 먼저 읽어야 합니다. 벤더 하네스는 점수를 부풀립니다.
| 벤치마크 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| DeepSWE 1.0 (제공자 하네스) | 62.0% | 66.1% | 55.75% | 64.31% |
| DeepSWE 1.1 (중립 하네스) | 53% | 70% | 59% | 67% |
| Terminal Bench 2.1 | 83.3% | 84.3% | 78.9% | 83.4% |
| SWE-Bench Pro | 64.7% | 80.4% | 69.2% | 58.6% |
코딩 해석: DeepSWE 1.1이 가장 정직한 코딩 비교입니다. Grok 4.5는 세 경쟁 모델 모두에 뒤지며 Fable 5가 17점 앞섭니다. Terminal Bench 2.1은 5.4점 이내로 밀집해 비용과 적합성이 미세 점수 차이를 이깁니다. SWE-Bench Pro는 가장 어려운 시험으로 Grok 4.5는 3위이며 복잡 다파일 작업에서 Fable 5 대비 15.7점 뒤집니다.
CursorBench 주의: Cursor 코드베이스 스냅샷이 Grok 4.5 학습 데이터에 실수로 포함되어 xAI는 출시 자료에서 CursorBench를 제거했습니다. 명백한 오염 위험이므로 Cursor 특화 벤더 주장은 독립 재검증 전까지 잠정으로 봐야 합니다.
| 벤치마크 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| AutomationBench-AA (657개 엔터프라이즈 워크플로) | 51.4% | 48.6% | 48.5% |
| Snorkel GDPVal+ (전문 지식 업무) | 29% | — | 21% |
AutomationBench-AA는 Gmail, Slack, Salesforce, HubSpot 등 40개 엔터프라이즈 앱을 시뮬레이션합니다. Grok 4.5는 비즈니스 제약을 위반하지 않고 워크플로 목표의 절반 이상을 완료한 최초 프론티어 모델입니다. Snorkel GDPVal+에서는 법률(40% vs 27–28%), 교육(58% vs 35–42%), 의료(35% vs 23–25%)에서 큰 격차를 보입니다.
종합 지능: Artificial Analysis Intelligence Index는 Grok 4.5를 54/100으로 평가합니다. Fable 5(60), Opus 4.8(56), GPT-5.5(55)에 이어 4위이나 이전 Grok 세대 대비 16점 상승입니다.
[ SECTION_04 ] // REAL_TESTS TryAI 실측, 플랫폼, API 빠른 시작
독립 테스터 TryAI는 Grok 4.5, GPT-5.5, Opus 4.8, Fable 5에 동일한 원샷 프롬프트로 인터랙티브 브라우저 앱을 처음부터 구축하게 했습니다.
3D 큐브 렌더링(최난도): Opus 4.8과 Fable 5는 1차 시도에 성공했습니다. Grok 4.5는 제목과 버튼만 렌더링하고 큐브는 없었으며 재시도에서 통과했습니다. GPT-5.5는 완전 실패했습니다.
속도와 비용: Grok 4.5는 첫 Token을 500ms 이내에 반환하고 초당 약 110 Token으로 스트리밍했습니다. 경쟁 대비 대략 2배 처리량입니다. Token 수가 더 많아도 모든 테스트에서 가장 저렴했습니다. Fable 5가 가장 느리고 비쌌습니다.
실무 결론: 원샷 정밀도와 복잡 상태 UI는 여전히 Claude 우위입니다. 대량 반복 코드 생성은 Grok 4.5가 속도·비용에서 유리합니다.
Grok 4.5 현재 이용 가능 플랫폼 (EU는 2026년 7월 중순 예상):
- Grok Build: xAI 네이티브 코딩 Agent, Grok 4.5가 기본 모델
- Cursor: 모든 플랜, 데스크톱·웹·iOS·CLI·SDK, 출시 주 사용량 2배
- xAI Console API: Chat Completions 및 Responses API,
us-east-1,us-west-2 - Microsoft Office 애드인: Word, PowerPoint, Excel 기본 모델
- 서드파티 게이트웨이: OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic
출시 시 API 한도: 초당 150요청, 분당 5,000만 Token입니다.
curl -s https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "Find and fix the bug: function median(a){a.sort();return a[a.length/2]}"
}'
[ SECTION_05 ] // SETUP 8단계 Cursor/API 설정, 혼합 모델 라우팅, 전환 시점
프로덕션 트래픽을 Grok 4.5로 라우팅하기 전에 다음 순서를 실행하세요.
- xAI API 키 생성: xAI Console에서 키를 발급하고 시크릿 매니저에 저장합니다. 저장소 파일에 넣지 마세요.
- 로컬 자격 증명 설정: 셸 프로필 또는 CI 시크릿에
export XAI_API_KEY=...를 설정합니다. - Responses API 스모크 테스트: 위 curl 예제를 실행하고 median 버그에 대한 패치 diff가 반환되는지 확인합니다.
- 캐시 라우팅 활성화: Responses API에
prompt_cache_key, Chat Completions에x-grok-conv-id를 추가해 반복 Agent 턴이 100만 Token당 0.50달러 캐시 입력을 맞추게 합니다. - Context Compaction 켜기: 장시간 Agent 루프에서는 도구 라운드 사이에 컨텍스트를 압축해 Token 누적을 제한합니다.
- Cursor에서 Grok 4.5 선택: 모든 플랜의 모델 선택기에서 Grok 4.5를 고르고 일상 서브태스크 Agent 모드에 고정합니다.
- 혼합 모델 라우팅 배포: 대량 코드 생성, 테스트 수정, 문서 업데이트는 Grok 4.5로, 아키텍처·보안·다파일 리팩터는 Claude Fable 5로 에스컬레이션합니다.
- 출력 검증 추가: 테스트와 린터로 병합을 게이트합니다. 독립 평가 AA-Omniscience 환각률 54%를 고려하면 특히 중요합니다.
| 시나리오 | 권장 | 이유 |
|---|---|---|
| 하루 수백~수천 건 Agent 작업 | Grok 4.5 사용 | 작업당 2.49달러 vs 11.80달러가 빠르게 누적 |
| 터미널·도구 사용 집약 워크플로 | Grok 4.5 사용 | AutomationBench-AA 51.4% 1위 |
| Cursor 네이티브 팀 | Grok 4.5 사용 | 공동 학습 모델, 통합 마찰 제로 |
| SWE-Bench Pro급 정밀 리팩터 | Claude Fable 5 우선 | 최난도 코딩 벤치 80.4% vs 64.7% |
| 금융·안전·컴플라이언스 코드 | Claude + 인간 검토 우선 | 환각률 54%로 엄격한 게이트 필요 |
| 현재 EU 전용 데이터 레지던시 | 대기 또는 하이브리드 | 2026년 7월 중순까지 API는 미국 리전만 |
인용 가능 기술 데이터 포인트 — 벤더 업데이트 후 재확인하세요:
- 컨텍스트 윈도: 500,000 Token — 압축 활성화 시 대규모 저장소 Agent 세션에 충분합니다.
- Token 효율: SWE-Bench Pro 작업당 평균 출력 Token 15,954 vs 67,020(Opus 4.8 대비) — 4.2배 격차입니다.
- Agent 워크플로 완료: AutomationBench-AA 51.4% — 비즈니스 제약 위반 없이 50%를 넘긴 최초 프론티어 모델입니다.
- 추론 처리량: 공식 80 TPS, 실측 약 90 TPS, TryAI 스트리밍 약 110 TPS입니다.
- 지능 지수: Artificial Analysis 54/100, 세대 대비 16점 상승입니다.
[ SECTION_06 ] // FAQ FAQ, 출처, Agent 워크로드 안정 실행
FAQ:
- Grok 4.5가 Claude Opus 4.8보다 우수한가요? Opus 4.8이 원시 코딩 정확도에서 우위입니다(SWE-Bench Pro 69.2% vs 64.7%). Grok 4.5는 속도, Token 효율, 작업당 비용에서 이기며 종종 4배 차이가 납니다. Agentic 워크플로 완료에서는 AutomationBench-AA에서 Grok 4.5가 Opus를 앞섭니다.
- Grok 4.5를 무료로 쓸 수 있나요? 출시 직후 Grok Build와 Cursor에서 제한적 무료 사용이 있었습니다. 지속 API 가격은 입력 100만 Token당 2달러, 출력 100만 Token당 6달러입니다. Cursor 플랜에는 Grok 4.5가 포함됩니다.
- Cursor에서 Grok 4.5를 어떻게 쓰나요? 모든 플랜에서 자동 제공됩니다. 모델 선택에서 Grok 4.5를 고르면 됩니다. 출시 첫 주 사용량이 2배였습니다.
- 컨텍스트 윈도는? 500,000 Token입니다. 장시간 루프에 Context Compaction을 함께 쓰면 대부분의 대규모 코드베이스 작업에 충분합니다.
- CursorBench가 제거된 이유는? Cursor 코드베이스 스냅샷이 학습 데이터에 들어가 벤치마크가 오염되었습니다. xAI가 결과를 철회했으며 독립 재검증이 예상됩니다.
- OpenRouter에서 Grok 4.5를 쓸 수 있나요? 가능합니다. Vercel AI Gateway, Cloudflare, Snowflake, Databricks Mosaic에서도 접근할 수 있습니다.
주요 1차 참고 출처입니다. 가격·기능 업데이트 후 링크를 다시 확인하세요.
Awesome Agents: 독립 Grok 4.5 리뷰
Valletta Software: Grok 4.5 vs Claude vs GPT
Grok 4.5는 작업당 비용을 크게 낮추지만, 절전 노트북에서 Agent 루프가 끊기거나 EU 라우팅이 막히거나 검증 없는 출력이 프로덕션에 나가면 절감 효과는 사라집니다. 개인 MacBook은 Cursor Agent 마라톤, Grok Build 파이프라인, 대규모 온디바이스 Xcode 검증에 부적합한 24/7 실행면입니다.
Grok 4.5, 혼합 모델 Cursor 워크플로, iOS CI/CD를 전용 Apple Silicon 호스트 하나에서 24시간 가동해야 한다면 베어메탈 Mac 용량이 불안정한 로컬 기기 소방보다 낫습니다. NOVAKVM은 다중 리전 Mac Mini M4 / M4 Pro 유연 임대, 고정 대역폭, 기본 SSH를 제공하며 AI Agent 자동화와 모바일 빌드 검증을 동일 호스트에서 수행하기에 적합합니다. 구성은 가격 페이지, 주문은 주문 페이지, 배포 문제는 고객 센터를 참고하세요.