DeepSeek V4 풀버전 정식 출시:
요금·아키텍처와 GPT-5.6 성능 격차 해설

3개월의 대기 끝에 DeepSeek V4 풀버전(GA 정식판)이 2026년 7월 20일 정식 출시되었습니다. 4월 프리뷰 대비 Agent·수학 추론·코드 생성이 강화되었고, 처음으로 피크·오프피크 차등 요금이 도입되었습니다. 본문은 여전히 deepseek-chat을 쓰며 7월 24일까지 마이그레이션이 필요한 개발자와 GPT-5.6·Claude Fable 5·V4 사이에서 선택 중인 팀을 대상으로 합니다. 7대 고민부터 타임라인, 1.6T MoE(CSA+HCA, mHC, Muon), 벤치마크, 3자 비교, 요금표, 6단계 마이그레이션인용 가능 기술 파라미터를 정리하고, Mac 셀프호스팅과 NOVAKVM 고메모리 노드로 데이터 주권 경로를 제시합니다. 수치는 DeepSeek 공식 문서와 arXiv:2606.19348을 기준으로 하며, 출시 후 링크를 다시 확인하십시오. 요금은 요금 페이지, 주문은 주문 페이지입니다. ds4 로컬 추론편GPT-5.6 출시편도 함께 읽기를 권합니다.

  • 구 API 종료: deepseek-chatdeepseek-reasoner2026년 7월 24일 23:59(베이징 시간)에 영구 중단됩니다. 모델명을 갱신하지 않은 프로덕션 코드는 하드 다운타임을 맞습니다.
  • 피크 요금 스케줄링: 평일 09:00–12:00, 14:00–18:00(베이징 시간)에는 요금이 2배입니다. 24시간 Agent 파이프라인을 시간대별로 나누지 않으면 청구가 예상을 초과할 수 있습니다.
  • Pro vs Flash 선택: V4-Pro(1.6T / 49B 활성)와 V4-Flash(284B / 13B 활성)는 가격·능력 경계가 다릅니다. 잘못된 라우팅은 Token 낭비 또는 품질 저하로 이어집니다.
  • 폐쇄형 플래그십과의 점수 격차: Claude Fable 5는 SWE-bench Pro 80.3%, V4-Pro는 55.4%입니다. 「오픈소스 최강」이 「업계 전체 최강」은 아닙니다.
  • 1M 컨텍스트 비용: KV Cache가 V3.2의 10%까지 압축되어도 장컨텍스트 Agent는 연산·메모리를 소모합니다. 셀프호스팅에는 96GB 이상 통합 메모리가 사실상 필수입니다(ds4 경로 참조).
  • 데이터 역외·컴플라이언스: 금융·의료·공공 부문은 MIT 오픈소스+프라이빗 배포를 선호하지만, 풀버전 V4-Pro를 로컬에서 돌리는 하드웨어 비용은 매우 높습니다.
  • 추론 모드 설정: Non-think / Think High / Think Max 3단과 공식 권장 temperature=1.0, top_p=1.0을 시나리오별로 조정해야 합니다. Think Max를 무조건 켜면 지연·비용이 증가합니다.

DeepSeek V4 주요 타임라인(2026)
일자 이벤트
4월 24일 V4 프리뷰 공개·MIT 오픈소스(V4-Pro 1.6T, V4-Flash 284B)
5월 프로덕션 튜닝판 출시, API 정식 제공
6월 V4-Pro 출력 단가 영구 75% 인하, $0.87/M tokens
6월 29일 GA 7월 중순 예정 메일 통지, 피크 요금 최초 공개
7월 19일 다수 개발자 GA 그레이 내부 테스트 자격 확보, 언론 「풀버전 내일 출시」 보도
7월 20일 GA 정식판 출시(본문 게시일)
7월 24일 deepseek-chat / deepseek-reasoner 영구 중단

핵심: 풀버전은 Agent·수학 추론·코드 생성을 강화하고 정식 상용 과금 체계를 갖췄습니다. MoE 기반 아키텍처 자체는 변경되지 않았습니다.

V4-Pro vs V4-Flash 사양 대조
항목 V4-Pro V4-Flash
총 파라미터 1.6조(1.6T) 2840억(284B)
Token당 활성 파라미터 490억(49B) 130억(13B)
Transformer 층수 61층 43층
컨텍스트 윈도 1,000,000 tokens 1,000,000 tokens
최대 출력 384K tokens 384K tokens
정밀도 FP4(전문가 가중치) + FP8(기타) FP4 + FP8 혼합
사전학습 데이터량 33T+ tokens 32T+ tokens
라이선스 MIT MIT

1M 컨텍스트를 뒷받침하는 핵심 아키텍처:

  • 하이브리드 어텐션(CSA + HCA): V2/V3 MLA를 버리고 압축 희소 어텐션(CSA: KV를 Softmax 게이트 풀링으로 4배 압축 + FP4 Lightning Indexer로 top-k 희소, Pro는 top-1024, Flash는 top-512, 최근 128 token 슬라이딩 윈도 유지)과 고압축 어텐션(HCA: 128배 압축 후 글로벌 밀집 어텐션)을 교대 사용합니다. 1M 시나리오에서 추론 FLOPs는 V3.2의 27%, KV Cache 메모리는 V3.2의 10%(Flash 7%)입니다.
  • 다양체 제약 하이퍼커넥션(mHC): 4채널 잔차 스트림 + 이중확률 행렬 제약(Birkhoff 다면체)으로 61층 깊은 네트워크의 그래디언트 전파를 안정화합니다.
  • Muon 옵티마이저: 학습 시 Newton–Schulz 직교화로 그래디언트를 처리해 AdamW보다 수렴이 빠르고 안정적입니다.
3가지 추론 모드와 적용 시나리오
모드 특징 적용 시나리오
Non-think 사고 연쇄 없음, 최고속 응답 단순 Q&A, 라우팅
Think High 명시적 추론(사고 연쇄 태그) 중간 복잡도 작업, 코드 디버깅
Think Max 최대 추론 강도, 384K+ 컨텍스트 필수 고난도 수학, 장체인 Agent

공식 권장 샘플링(전 모드 공통): temperature=1.0, top_p=1.0.

V4-Pro 핵심 벤치마크(2026년 7월)
벤치마크 DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80.6%(오픈소스 최고) 96.0% 별도 미공개 ~69%
SWE-bench Pro 55.4% 80.3% 78.1% 69.2%
LiveCodeBench (Pass@1) 93.5% 88.1% 87.4% 83.2%
Codeforces Elo 3,206
Terminal-Bench 2.1 83.9% 88.0% 85.1% 82.7%

Artificial Analysis 가성비: Claude Fable 5는 Strategy & Ops 지수 작업당 $3.48·점수 50, DeepSeek V4-Pro는 작업당 $0.03·점수 38입니다. 비용은 약 116배 차이, 점수 차는 약 31%입니다. V4-Flash는 6개 지수 작업 모두 1회 $0.04 미만입니다.

DeepSeek V4-Pro vs GPT-5.6 Sol vs Claude Fable 5 전체 포지셔닝
차원 DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
오픈소스 / 셀프호스팅 MIT, 가능 폐쇄형, 불가 폐쇄형, 불가
컨텍스트 윈도 1M tokens 미공개 1M tokens
API 출력 단가(평시) $0.87/M tokens ~$15/M $50/M
피크 출력 단가 $1.74/M tokens
Agent 능력 강함, 멀티 Agent 오케스트레이션 강함 최강
데이터 프라이버시 프라이빗 배포 가능 제3자 클라우드 제3자 클라우드

시나리오별 빠른 선택: 예산 제약 / 고빈도 호출 / 프라이빗 배포 → V4-Pro 또는 V4-Flash; 최고 코드 능력·비용 무관 → Claude Fable 5; 복잡 알고리즘+수학 추론 → GPT-5.6 Sol / Ultra; 초대규모 로그·문서 처리 → V4-Flash(캐시 히트 입력 $0.0028/M).

GA에서 가장 주목받은 변화는 전력 시간대 요금과 유사한 피크·오프피크 차등 가격입니다. 피크(베이징 시간)는 평일 09:00–12:0014:00–18:00에 요금이 2배입니다. DeepSeek은 변경 24시간 전 메일 통지를 약속합니다.

V4-Pro / V4-Flash 전체 가격표(Off-Peak / Peak)
모델 과금 항목 평시(Off-Peak) 피크(Peak)
V4-Pro 입력(캐시 히트) ¥0.025 / $0.0035 / 1M 2배
V4-Pro 입력(캐시 미스) ¥3.00 / $0.435 / 1M ¥6.00 / $0.87
V4-Pro 출력 ¥6.00 / $0.87 / 1M ¥12.00 / $1.74
V4-Flash 입력(캐시 히트) ¥0.02 / $0.0028 / 1M 2배
V4-Flash 입력(캐시 미스) ¥1.00 / $0.14 / 1M ¥2.00 / $0.28
V4-Flash 출력 ¥2.00 / $0.28 / 1M ¥4.00 / $0.56
  • 비실시간 작업을 오프피크로: 배치 문서 처리, 데이터 라벨링, 코드 리뷰는 18:00 이후 또는 9:00 이전에 배치합니다.
  • Prompt Cache 활용: 반복 System Prompt로 캐시를 구축하면 V4-Flash 캐시 히트는 $0.0028/M까지 내려갑니다.
  • Flash로 분기: 단순 의도 판별·라우팅은 V4-Flash, 복잡 추론은 V4-Pro로 전환해 비용을 60–80% 절감할 수 있습니다.
  • 청구 메일 구독: 계정 메일로 요금 변경 통지를 확실히 수신하도록 설정합니다.

피크 시간에도 V4-Pro 출력($1.74/M)은 Claude Opus 4.8($15/M)과 GPT-5.6 Sol(약 $15/M)보다 8.6배 저렴합니다.

중요: 구 모델명 deepseek-chatdeepseek-reasoner2026년 7월 24일 15:59 UTC(베이징 시간 7월 24일 23:59)에 영구 중단됩니다.

마이그레이션 매핑
구 모델명 신 모델명 비고
deepseek-chat deepseek-v4-flash(비사고 모드) 고속, 경량 작업용
deepseek-reasoner deepseek-v4-flash(사고 모드) 또는 deepseek-v4-pro로 더 강한 추론
  1. 구 모델명 전체 검색: 코드 저장소, CI 설정, 환경 변수, Secret 관리에서 deepseek-chat, deepseek-reasoner 문자열을 검색합니다.
  2. 시나리오별 신 모델 선택: 경량 대화 → deepseek-v4-flash 비사고; 기존 reasoner 동작 → Flash 사고 모드 또는 deepseek-v4-pro.
  3. OpenAI SDK 호출 갱신: model 파라미터만 변경; 사고 모드는 extra_bodythinking 설정을 전달합니다.
  4. Anthropic SDK 호환 경로 검증: base_urlhttps://api.deepseek.com 유지, modeldeepseek-v4-pro 또는 deepseek-v4-flash로 갱신합니다.
  5. Staging 회귀 테스트: Tool Calling, 스트리밍, 장컨텍스트를 커버; Think Max는 컨텍스트 ≥ 384K를 확인합니다.
  6. 프로덕션 전환·모니터링: 7월 24일 전 카나리 배포를 완료하고 피크 시간대 Token 사용량·에러율을 모니터링, 필요 시 시간대 스케줄링을 활성화합니다.
migrate_deepseek_v4.py
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

공식 문서와 논문(출시 후 링크를 다시 확인하십시오):

https://api.deepseek.com

https://arxiv.org/abs/2606.19348

  • SWE-bench Verified 80.6%: 현재 오픈소스 최고, Gemini 3.1 Pro와 동급. 실제 GitHub 저장소 Bug 수정 시나리오(출처: 공개 벤치마크 집계, 출시 후 재확인).
  • KV Cache 메모리 10%: 1M token 시나리오에서 V4-Pro는 V3.2의 10%, V4-Flash는 7%(출처: arXiv:2606.19348).
  • 116배 비용 격차: Artificial Analysis Strategy & Ops에서 Fable 5 1회 $3.48 vs V4-Pro $0.03(출처: Artificial Analysis, 출시 후 재확인).
  • 6월 인하 고정: V4-Pro 출력 $0.87/M tokens는 역대 최고 수준의 가성비 구간(출처: DeepSeek 공식 요금 페이지).
  • MIT 오픈소스: V4-Pro·V4-Flash 가중치 셀프호스팅 가능, 데이터 비역외 시나리오(출처: HuggingFace 모델 페이지).
  • 마이그레이션 하드 마감: 2026-07-24 23:59 베이징 시간 이후 deepseek-chat / deepseek-reasoner 영구 사용 불가(출처: DeepSeek API 공지 메일).

DeepSeek V4 GA는 2026년 오픈소스 LLM 분야에서 가장 중요한 이정표 중 하나입니다. 가치는 Claude Fable 5나 GPT-5.6을 지금 당장 이기는 데 있지 않고, 폐쇄형 플래그십의 1/10에서 1/100 수준 비용으로 오픈소스 최상위 성능을 제공하는 데 있습니다.

대안의 현실적 단점: ① Claude / GPT 클라우드 API만 쓰면 장컨텍스트 Agent 월 비용이 커지고 코드 경로가 제3자를 거쳐 감사 부담이 증가합니다; ② 16GB 노트북에서 범용 추론 프레임워크를 억지로 돌려도 풀버전 V4 가중치는 올리지 못해 트러블슈팅에 시간을 낭비합니다; ③ 몇 주 실험을 위해 Mac Studio Ultra를 사면 유휴 감가상각이 고메모리 인스턴스 주간 대여보다 큽니다. 프라이빗 환경에서 V4 Flash 로컬 추론을 검증하려면 ds4 + 128GB Mac 배포편을 참고하십시오.

데이터 비역외·제한 예산·1M 컨텍스트 Agent·API 가성비를 원하는 팀에게 DeepSeek V4 Pro는 현재 단점이 적은 오픈소스 선택입니다. 셀프호스팅 실험을 재현 가능한 인프라로 만들려면 NOVAKVM Mac Mini 클라우드 베어메탈 대여가 실무상 최적해에 가깝습니다. 6개 지역 노드, Apple Silicon 고메모리 전용, 일/주/월 탄력 계약으로 128GB 인스턴스를 검증 기간만 빌려 로컬 추론을 통과한 뒤 자체 구매를 결정할 수 있습니다. 7월 24일 전 API 마이그레이션을 완료하십시오. M4 Pro와 스토리지 확장은 NOVAKVM 요금 페이지, 시험 머신 기동은 주문 페이지, 원격 세션은 고객 센터를 확인하십시오.