DeepSeek V4-Flash-0731 정식판:
Agent 벤치 V4-Pro 초과, Opus 4.8 대비 1/100 비용

Agent API 비용 최적화, deepseek-chat 마이그레이션, 중국산 open weight 대규모 모델 선정을 검토하는 AI 개발자와 기술 책임자에게 7월 31일 DeepSeek이 API 공개한 V4-Flash-0731 정식판은 「파라미터를 늘리지 않고 Agent 능력을 끌어올린다」는 노선의 실증입니다. 284B 총량·13B 활성 아키텍처는 4월 프리뷰와 동일하며 성능 향상은 사후 학습 재실행만에서 비롯됩니다. Agent 벤치에서는 1.6T V4-Pro 프리뷰를 초과하고 Claude Opus 4.8 대비 입력 캐시 미스 약 36배·캐시 히트 약 179배·출력 약 89배 저렴하다는 보도가 있습니다. 본문에서는 3개월 타임라인, 핵심 스펙 표, Harness 프레임워크, Kimi K3 / GLM-5.2 / Qwen3.8-Max 횡단 비교, Artificial Analysis 지수 50·작업당 $0.03, 벤치마크 논란, 6단계 API 마이그레이션, V4-Pro 미출시 현황을 정리합니다. V4 GA 편, Kimi K3 편, Qwen3.8-Max 편과 함께 읽으세요. 요금은 요금 페이지를 참고하세요.

  • 4월 24일: V4 프리뷰 공개·MIT 오픈소스. V4-Pro(1.6T / 49B 활성)와 V4-Flash(284B / 13B 활성), 모두 100만 Token 컨텍스트.
  • 7월 24일: deepseek-chat / deepseek-reasoner 영구 중단. 전 트래픽 V4 계열 명명으로 전환.
  • 7월 27일: Moonshot AI Kimi K3(2.8T) 가중치 Hugging Face 공개. DeepSeek에 경쟁 압력.
  • 7월 31일: V4-Flash-0731 정식판 API 공개 베타. 동일 아키·동일 파라미터로 사후 학습만 갱신. Hugging Face MIT 가중치 동기화. changelog에서 자체 Agent 프레임워크 Harness 최초 공개(「곧 출시」). API만 갱신, App·웹 미동기화.
  • 8월 3일: Alibaba Qwen3.8-Max GA. 국산 flagship 3강(DeepSeek / Kimi / Qwen) 동주 업데이트.
  • 8월 5일(집필 시점): V4-Pro 정식판은 「가능한 한 빨리」만. 8월 10–20일 GA는 미기명 매체 유언비어로 공식 미확인.

결론: V4-Flash-0731은 「신규 모델」이 아니라 동일 284B/13B의 사후 학습 업데이트입니다. Agent 벤치에서 V4-Pro 프리뷰를 초과하지만 측정은 미공개 Harness에 의존하며 V4-Pro 정식판과 Harness 본체는 미출시입니다.

개발자가 직면하는 쟁점:

  • Pro 기대치 어긋남: 7월 중순 V4-Pro 전량 GA 기대가 밀리며 중국 AI 커뮤니티에서 창업자 梁文鋒에 대한 평가가 「공약 불이행」에서 「기대 이상」으로 반전했으나 Pro 정식판은 여전히 미출시입니다.
  • Harness 의존 벤치: Terminal Bench 2.0(82.7점 vs V4-Pro 프리뷰 67.9점) 등은 Harness 미니멀 모드·max 설정·top_p=0.95·temperature=1.0으로 측정. 공식도 「harness 선택에 극도로 민감」이라 경고합니다.
  • 실사용 보고: 해외 개발자 커뮤니티에서 입력 캐시 히트율 저하, 안전 분류기 타임아웃 등이 보고되어 벤치와 실운용 간극이 지적됩니다.
  • 킬 라인 압력: 「충분한 성능+극단적 저가」 조합이 동종 가격 전략을 압박. GPT-5.6 Luna 80% 인하 등의 배경 요인 중 하나입니다.

DeepSeek V4-Flash-0731 핵심 파라미터(출처: DeepSeek 공식 changelog·API 문서, 2026-07-31)
항목
출시일2026년 7월 31일(API 정식판 공개 베타)
빌드 태그V4-Flash-0731
총 파라미터 / 활성 파라미터284B / 13B(4월 프리뷰와 동일)
성능 향상 원천아키 변경 없음, 사후 학습 재실행만
컨텍스트 윈도100만 Token
API 입력(캐시 미스 / 히트)$0.14 / $0.0028(백만 Token당)
API 출력$0.28(백만 Token당)
라이선스MIT(Hugging Face 가중치 공개)
Terminal Bench 2.0(DeepSeek 자체 측정·Harness)82.7(V4-Pro 프리뷰 67.9 초과)
Artificial Analysis Intelligence Index50(제3자 독립 평가)
Artificial Analysis 작업당 평균 비용$0.03
V4-Pro 정식판미출시(프리뷰만)

아키텍처(4월 이후 변경 없음): 하이브리드 어텐션 CSA+HCA(DSA 스파스 어텐션), 매니폴드 제약 하이퍼커넥션 mHC, Muon 옵티마이저. 100만 Token 추론 시 V4-Pro는 V3.2 대비 FLOPs 27%, KV Cache 10%(DeepSeek 기술 보고 arXiv:2606.19348, 벤더 자체 발표). 사후 학습만으로 284B/13B가 1.6T/49B V4-Pro 프리뷰를 Agent 벤치에서 초과한 점은 2026년 하반기 「규모 경쟁에서 효율·데이터 품질 경쟁으로」의 상징입니다.

DeepSeek Harness란: 7월 31일 changelog에서 최초 공개된 자체 Agent 실행 프레임워크입니다. 파일 읽기/쓰기, 도구 호출, 명령 실행, 엔드투엔드 엔지니어링 작업을 담당하며 Claude Code에 상응합니다. 지금까지 DeepSeek 모델은 Claude Code·OpenCode 등 제3자 Agent에 의존해 왔습니다. V4-Flash-0731 Agent 벤치는 모두 Harness 미니멀 모드로 측정되었으며 Harness 본체는 집필 시점 미공개입니다.

flagship 대규모 모델 횡단 비교(2026년 8월 초 공개 정보)
모델 총/활성 파라미터 Artificial Analysis 지수 작업당 평균 비용 출력 API(백만 Token)
V4-Flash-0731 284B / 13B 50 $0.03 $0.28
Kimi K3 2.8T / 약 5000억 57 $0.86 $15
GLM-5.2 약 744B / 약 40B V4-Flash 대비 약 +1 본문 미확인 본문 미확인
Qwen3.8-Max 2.4T / 9500억 본문 미확인 본문 미확인 $6
GPT-5.6 Sol 비공개 V4-Flash 대비 약 +9 $1.86 약 $15
Claude Opus 4.8 비공개 상위 높음 $15

Artificial Analysis 지수와 DeepSeek 자체 Agent 벤치는 평가 방법이 달라 직접 합산 비교할 수 없습니다. 제3자 지수에서는 V4-Flash가 Kimi K3·GLM-5.2에 약간 열세이나 작업당 비용은 Kimi K3의 약 1/29, GPT-5.6 Sol의 약 1/62, Claude Fable 5의 약 1/105입니다. DeepSeek의 목표는 「벤치 1위」가 아니라 「충분한 지능+따라올 수 없는 가격」—— OpenRouter에서 프리뷰가 7주 연속 호출량 1위였던 배경과 일치합니다.

벤치를 맹신하지 말아야 할 네 가지 이유:

  1. Harness 미공개: Agent 벤치는 미출시 Harness 미니멀 모드 의존. Claude Code·Cursor 독립 재현 대기.
  2. 공식 자체 경고: changelog에 「벤치는 harness 선택에 극도로 민감」 명시.
  3. 실운용 보고: 캐시 히트율 저하, 안전 분류기 타임아웃 등 벤치와 괴리하는 피드백.
  4. V4-Pro GA 일정 유언: 8월 10–20일 등은 미기명 매체 유래. 공식은 「가능한 한 빨리」만.

  1. 레거시 model 이름 전 저장소 검색: deepseek-chat / deepseek-reasoner는 7월 24일 중단됨. CI·환경 변수·Secret 스캔.
  2. 워크로드별 V4 명명 선택: 경량 채팅·대량 배치 → deepseek-v4-flash 비 think. 구 reasoner → Flash think 모드 또는 deepseek-v4-pro 프리뷰.
  3. SDK 설정 갱신: base_urlhttps://api.deepseek.com 유지. OpenAI·Anthropic 호환 SDK는 model만 변경. think 모드는 extra_body로 설정.
  4. 피크·오프피크 요금 스케줄링: 평일 09:00–12:00, 14:00–18:00(베이징) 2배 예고. 24시간 Agent는 오프피크 이동 검토. OpenRouter 7월 계층 선정 참고.
  5. 계층 라우팅 구축: 일상 Agentic Coding은 V4-Flash-0731, 난점은 Claude Opus 4.8·GPT-5.6 Sol로 에스컬레이션. GPT-5.6 인하 편 병독.
  6. 7×24 Agent 실행 환경 고정: Harness 대기 Agent 오케스트레이션은 슬립하는 노트북이 아닌 상시 가동 macOS 노드 필요. 고객 센터주문 페이지 참고.
deepseek-v4-flash-api.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Review this Python module for security issues."}]
)
print(response.choices[0].message.content)

  • 파라미터 불변·사후 학습만: 284B / 13B. 성능 향상은 post-training 재실행(출처: DeepSeek 7/31 changelog).
  • Terminal Bench 2.0: 82.7점, V4-Pro 프리뷰 67.9점 초과(Harness 미니멀 모드·DeepSeek 자체 측정).
  • Artificial Analysis: Intelligence Index 50, 작업당 $0.03(제3자 독립 평가).
  • Opus 4.8 가격 차: 입력 캐시 미스 약 36배, 캐시 히트 약 179배, 출력 약 89배 저렴(출처: 21세기 경제보도 등, 벤더 공시가 기준).
  • 1M 컨텍스트 효율: V4-Pro V3.2 대비 FLOPs 27%, KV Cache 10%(출처: arXiv:2606.19348).
  • API만 갱신: 7/31 시점 App·웹 채팅은 구버전(출처: DeepSeek changelog).
  • V4-Pro / Harness: 「가능한 한 빨리」 출시 예정, 구체일 미공표.

업계 배경: 7월 31일 V4-Flash-0731 공개 당일 Nvidia·Broadcom·AMD 등 연산 칩 주가에 큰 변동은 없었습니다. 2025년 초 DeepSeek-R1 때 AI 칩 주가 급락과 대조적이며 시장은 「더 적은 연산으로 동등 효과」를 일반적 공학 혁신으로 받아들이기 시작했습니다. 동주 Kimi K3 가중치 공개, 8월 Qwen3.8-Max GA와 겹쳐 국산 open weight 3강의 가격·Agent 능력 경쟁이 가속합니다.

FAQ 요약:

  • Q: V4-Flash-0731이 V4-Pro보다 강한가요? A: Agent 벤치에서는 Harness 측정 기준 초과하나 harness 의존. 복잡 추론은 Pro 프리뷰 유리한 경우도.
  • Q: V4-Pro 정식판은? A: 미확인. 8월 10–20일은 유언 수준.
  • Q: 벤치를 믿을 수 있나요? A: SWE-bench Verified 등은 참고. Terminal Bench 2.0 등 Harness 의존·독립 재현 대기.
  • Q: deepseek-chat 마이그레이션? A: 7/24 중단. deepseek-v4-flash로 갱신.
  • Q: Harness란? A: DeepSeek 최초 자체 Agent 프레임워크. 7/31 최초 공개, 본체 미출시.

아래는 집필 시점 공개 소스입니다. 상류 갱신 시 원문을 기준으로 하세요.

https://api-docs.deepseek.com

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash

https://arxiv.org/abs/2606.19348

대안 구성의 실무적 한계: ① 16GB 노트북에서 284B 가중치 로컬 추론 시 ds4도 96GB 이상 통합 메모리가 사실상 요건이며 API fallback으로는 하드 상한을 넘을 수 없습니다. ② 덮으면 슬립·OAuth 끊김으로 7주 연속 OpenRouter 1위급 Agent 배치가 중단됩니다. ③ V4-Flash Agent 검증용 고사양 Mac Studio 구매 후 3개월 방치 시 주간 임대의 수 배 감가상각. 284B급 추론은 API가 정답이며 로컬에 필요한 것은 안정적 macOS Agent 오케스트레이션면입니다. ds4 로컬 추론 편 참고.

전용 Apple Silicon, 7×24 상시 가동, 일/주/월 탄력 스케일로 macOS 호스트에 V4-Flash API 구동 Agent(Claude Code, OpenClaw, OpenCode 등)와 iOS CI를 공존시키려는 개발자·AI 자동화 팀에게 NOVAKVM Mac Mini 클라우드 베어메탈 임대가 보통 더 적합한 선택입니다. 6개 지역 노드, 고메모리 구성, SSH 직결로 DeepSeek API 추론과 베어메탈 macOS 실행면을 분리해 다노드 클러스터 자체 구축·노트북 슬립 이중 함정을 피할 수 있습니다. NOVAKVM 요금 페이지에서 M4 Pro·스토리지 확장을 비교하고 주문 페이지에서 시험기를 기동하세요. 원격 접속은 고객 센터를 참고하세요.