Kimi K3 도입·자체 호스팅·상업 컴플라이언스를 검토하는 AI 개발자와 기술 책임자에게 2026년 7월 27일 Moonshot AI(월지암면)의 전체 가중치·기술 보고서 공개는 3T급 모델 평가 기준을 바꿉니다. Kimi K3는 총 2.8조 파라미터, 100만 토큰 컨텍스트를 갖추고 MoonEP·FlashKDA·AgentEnv 세 인프라를 동시에 공개했습니다. API 최초 공개 후 불과 11일 만의 움직임입니다. 본문은 타임라인, KDA/AttnRes/Per-Head Muon 아키텍처, 인프라 공개, SWE-bench·Artificial Analysis 벤치마크, open weight 라이선스의 두 상업 임계값, API 요금, 6단계 도입 체크리스트를 정리합니다. 7월 16일 K3 최초 리뷰, 증류 논란 편, OpenRouter 7월 랭킹과 함께 읽으십시오. 노드 요금은 가격 페이지를 참고하세요.
[ SECTION_01 ] // PAIN_POINTS Kimi K3 open weight 공개 후 모델 스택을 즉시 재평가해야 하는 이유
2026년 7월 27일 23시경 Moonshot AI는 Kimi K3 전체 가중치와 기술 보고서를 공개했습니다. Hugging Face 다운로드 용량은 약 1.56TB이며, 공개 30분 이내 트렌드 1위를 기록했습니다. 3조 파라미터급 모델이 전체 가중치로 공개된 최초 사례입니다. 다만 공식은 일관되게 「open source」가 아닌 「open weight(가중치 공개)」라고 표현합니다.
- 용어 함정: 언론은 「오픈소스」로 번역하는 경우가 많지만, OSI 준수 오픈소스에는 학습 데이터와 재현 가능한 학습 파이프라인 공개가 필요합니다. K3가 공개하는 것은 가중치·기술 보고서·추론 인프라에 한정됩니다.
- 라이선스 맹점: K2 시리즈에 없던 두 상업 임계값이 추가되었습니다. Model-as-a-Service 사업 최근 12개월 누적 매출 2천만 달러 초과, 월간 활성 사용자 1억 초과 또는 월 매출 2천만 달러 초과 시 표기 의무입니다.
- 자체 배포 환상: 2.8T 파라미터와 896 전문가 MoE로 소비자 하드웨어 운용은 비현실적입니다. 공식은 64장 이상 슈퍼노드를 권장하며, 개인 개발자에게는 API나 OpenRouter가 실무 해법입니다.
- 벤치마크 오독: 독립 기관 Vals AI의 SWE-bench Verified에서 K3는 93.4%입니다. Claude Opus 5(97%)·GPT-5.6 Sol(96.2%)에는 미치지 않으나 open weight 진영 최상위입니다.
- 비용 불일치: Intelligence Index 환산 작업당 비용 약 0.95달러. Claude Fable 5(약 2.4달러)보다 저렴하나 GLM-5.2(약 0.47달러)보다 높아 역량 상한형 선택지입니다.
- 지정학적 노이즈: 가중치 공개 며칠 전 미국 측은 Moonshot이 Anthropic Fable 모델을 「산업 규모로 증류」했다고 비난했고, 7월 28일 중국 상무부는 「AI 패권주의」라며 반박했습니다.
핵심 결론: Kimi K3는 open weight 진영의 역량 상한이지 교과서적 오픈소스 프로젝트가 아닙니다. 대다수 중소 팀은 그대로 상업 이용이 가능하나, Moonshot과 경쟁하는 대규모 MaaS를 운영한다면 매출 임계값은 법무상 레드라인입니다.
API 최초 공개부터 가중치 공개까지 11일:
- 7월 16일(WAIC 2026 전야):kimi.com, Kimi Work, Kimi Code, Kimi API에 K3 등장. 온라인 호출만 가능하고 가중치는 비공개.
- 7월 17일:업계가 아키텍처를 분석. 국영 매체는 「현재 세계 최대 오픈 모델」로 보도.
- 7월 22일–23일:미중 「모델 증류」 논쟁 격화. 백악관 기술 고문 Michael Kratsios가 Moonshot의 은밀한 산업 증류를 지적.
- 7월 27일 23시경:전체 가중치·기술 보고서 공개. MoonEP·AgentEnv 오픈(FlashKDA는 선행 공개).
- 7월 28일:중국 상무부 공식 대응. 국내 매체가 공개 세부를 추적 보도.
[ SECTION_02 ] // ARCHITECTURE Kimi K3 핵심 사양과 세 가지 아키텍처 혁신
Kimi K3는 단순 파라미터 적층이 아니라 주의 메커니즘·잔차 연결·옵티마이저라는 딥러닝의 세 가지 관례를 재구성합니다.
| 항목 | 값 |
|---|---|
| 총 파라미터 | 2.8조(2.8T) |
| 활성화 파라미터 | 약 1,040억 |
| 아키텍처 | 혼합 전문가(MoE) |
| 전문가 구성 | 896 라우팅 전문가, 토큰당 16 활성화(공유 전문가 포함) |
| 주의 메커니즘 | Kimi Delta Attention(KDA) + 게이트 MLA |
| 컨텍스트 | 100만 토큰 |
| 멀티모달 | 네이티브 시각 이해(ViT-V2, 27층) |
| 가중치 형식 | MXFP4 가중치 + MXFP8 활성화(SFT 단계부터 양자화 인지 학습) |
| 가중치 크기 | 약 1.56TB(Hugging Face) |
| 라이선스 | 커스텀(공식 표현은 open weight, open source 아님) |
Kimi Delta Attention(KDA):기존 Gated DeltaNet은 스칼라 망각 게이트를 쓰지만, KDA는 채널 단위 게이트로 대체해 각 특징 차원이 고유 감쇠율을 갖습니다. chunkwise DPLR 공식으로 선형 시간 재귀를 구현하고, 소수의 Gated MLA 글로벌 주의층과 교차 배치해 100만 토큰을 지원하면서 KV Cache 비용을 낮춥니다.
Attention Residuals(AttnRes):표준 잔차는 층마다 균등 누적해 심층에서 초기 정보가 희석됩니다. AttnRes는 입력에 따라 선행층 출력을 선택적으로 집계하며, RMSNorm과 pseudo-query 벡터 한 쌍 추가로 약 25% 학습 효율 향상, 비용은 2% 미만입니다.
Per-Head Muon:Muon 옵티마이저를 주의 헤드 단위로 적용해 각 헤드가 더 적응적 수렴 경로를 얻습니다. API 호출 측에는 보이지 않으나, 적은 활성화 파라미터로 최상위 폐쇄 모델에 근접하는 성능의 요인 중 하나입니다.
Stable LatentMoE:896 중 16 스파스 라우팅(스파스도 약 1.8%)에 공유 전문가를 결합하고, Quantile Balancing과 MoonEP로 각 랭크의 중복 전문가 수 이론 상한을 증명합니다.
[ SECTION_03 ] // INFRA_BENCH 세 인프라 공개와 SWE-bench 순위
Moonshot은 가중치 파일뿐 아니라 K3 학습 효율과 안정성을 떠받치는 세 인프라 기술도 함께 공개했습니다.
| 기술 | 역할 | 핵심 수치 |
|---|---|---|
| MoonEP | 초대규모 세밀 MoE 통신 라이브러리 | 과부하 전문가를 일시 복제해 랭크별 토큰 수 균등화. 중복 전문가 수 이론 상한 증명 |
| FlashKDA | NVIDIA CUTLASS 기반 KDA 커널(선행 공개) | H20에서 prefill이 flash-linear-attention 기준 1.72–2.22배. chunk_kda로 직접 교체 가능 |
| AgentEnv | KVCache.ai 공동 개발 Agent 샌드박스(Firecracker microVM) | 대규모 병렬 Agent RL. 공식값 체크포인트 133ms·복구 49ms·메모리 오버커밋 최대 6.5배(제3자 미검증) |
SWE-bench Verified(독립 재측정, Vals AI, 2026년 7월 기준):
| 모델 | 점수 | 공개일 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Artificial Analysis 지능 지수(max 추론档):Claude Fable 5가 60, GPT-5.6 Sol이 59, Kimi K3는 약 57(세계 3위, open weight 1위), GLM-5.2가 51, DeepSeek V4 Pro가 44입니다. Arena.ai Frontend Code Arena에서도 1위를 기록합니다. 작업당 비용은 약 0.95달러로 Claude Fable 5(약 2.4달러)보다 약 60% 저렴하나 GLM-5.2(약 0.47달러)보다 높습니다.
[ SECTION_04 ] // LICENSE_DEPLOY open weight 라이선스 두 임계값과 6단계 도입
Moonshot 공식 자료는 일관되게 「open weight」라 표현하며 「open source」는 쓰지 않습니다. 커스텀 라이선스에는 두 상업 임계값이 있습니다.
- Model-as-a-Service 매출 임계값:피허가자가 K3 기반 MaaS 사업을 운영하고 최근 12개월 누적 매출이 2천만 달러를 넘으면 Moonshot과 별도 상업 계약이 필요합니다.
- 규모 표기 임계값:제품 월간 활성 사용자가 1억을 넘거나 월 매출이 2천만 달러를 넘으면 UI에 「Kimi K3」를 눈에 띄게 표시해야 합니다.
API 요금(OpenAI SDK 호환, 모델 ID kimi-k3):
| 토큰 유형 | 가격 |
|---|---|
| 입력(캐시 히트) | $0.30 |
| 입력(캐시 미스) | $3.00 |
| 출력(추론 과정 포함) | $15.00 |
Mooncake 분리형 추론 아키텍처에서는 전형적 코딩 부하에서 캐시 히트율 90% 이상이 보고되며, 실효 입력 비용은 표의 $3.00보다 $0.30 쪽에 가깝습니다.
6단계 Kimi K3 도입 체크리스트(개발자·소규모 팀·기업 공통):
- 경로 결정:자체 배포(64장 이상 슈퍼노드) vs 공식 API vs OpenRouter를 평가합니다. 대다수 팀은 API가 정답입니다. OpenRouter 도입 가이드로 멀티 프로바이더 추상화를 검토하세요.
- 라이선스 정독:Hugging Face LICENSE 전문을 받아 MaaS 매출·표기 임계값에 해당하지 않는지 확인합니다. Moonshot과 경쟁하는 추론 서비스는 법무 검토 핵심입니다.
- API 클라이언트 설정:base URL을 Moonshot 공식 엔드포인트로, 모델 ID를
kimi-k3로 설정합니다. 기존 OpenAI SDK 프로젝트는 URL·API Key 변경으로 충분한 경우가 많습니다. - 캐시 인지 과금 설계:코딩 Agent용 prompt 캐시 전략을 짜 Mooncake 고히트율로 실효 입력을 $0.30/M 근처로 누릅니다.
- 계층 라우팅 구축:일상 Agentic Coding은 K3나 DeepSeek V4 Flash로 처리하고 난관은 Claude Opus 5·GPT-5.6 Sol로 에스컬레이션합니다. 7월 OpenRouter 계층 선정을 참고하세요.
- 7×24 Agent 실행 환경 고정:장시간 Agent 오케스트레이션과 멀티모델 게이트웨이는 덮개를 닫으면 슬립하는 노트북이 아닌 상시 가동 macOS 노드가 필요합니다. 고객 센터와 주문 페이지를 참고하세요.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain Kimi Delta Attention in one paragraph."}]
)
print(response.choices[0].message.content)
[ SECTION_05 ] // FACTS_FAQ 인용 가능 데이터, FAQ, 7×24 Agent 호스트 마무리
- 총 파라미터:2.8조, 활성화 약 1,040억. 전체 가중치 공개된 최초 3T급 모델(출처: Moonshot 기술 보고서).
- 가중치 크기:약 1.56TB. Hugging Face 공개 30분 만에 트렌드 1위(출처: Hugging Face).
- SWE-bench Verified:독립 재측 93.4%. open weight 최강, Claude Opus 5 97%에는 미달(출처: Vals AI, 2026년 7월).
- 지능 지수:max档 약 57, 세계 3위·open weight 1위(출처: Artificial Analysis).
- FlashKDA 가속:NVIDIA H20에서 prefill이 기준 대비 1.72–2.22배(출처: Moonshot GitHub).
- 캐시 히트 요금:입력 $0.30/M(히트) 대 $3.00/M(미스). 코딩 부하 히트율 90% 이상(출처: Moonshot 공식).
- 자체 배포 문턱:64장 이상 슈퍼노드 권장. OpenRouter에서 7개 업체가 K3 호스팅(출처: Moonshot / OpenRouter).
FAQ 요약:
- Q: Kimi K3는 오픈소스입니까?A: 엄밀히는 아닙니다. open weight이며 가중치·기술 보고서·일부 인프라는 공개되나 학습 데이터와 전체 학습 코드는 비공개입니다.
- Q: 상업 이용이 무료입니까?A: 대부분 상업 시나리오에서 제한 없습니다. MaaS 연매출 2천만 달러 초과·월간 활성 1억 초과 시 추가 조항이 적용됩니다.
- Q: 자체 배포에 몇 장이 필요합니까?A: 공식은 64장 이상 슈퍼노드를 권장합니다. 개인과 대부분 기업은 API나 OpenRouter가 현실적입니다.
- Q: 성능은 어느 정도입니까?A: open weight 진영 종합 1위, Artificial Analysis 세계 3위. 다만 GLM-5.2보다 고비용이라 가성비 최우선은 아닙니다.
- Q: K2와 차이는?A: K3는 K2.5 대비 약 3배 규모에 AttnRes·Per-Head Muon 추가. 컨텍스트·멀티모달 확장, MaaS 매출 임계값 신설.
아래는 집필 시점 공개 출처입니다. 상류가 갱신되면 원문을 기준으로 하십시오.
https://huggingface.co/moonshotai
https://github.com/moonshotai/FlashKDA
K3 공개 3일 후 Moonshot 투자사 Alibaba가 2.4조 파라미터 Qwen3.8-Max-Preview를 발표해 K3에 대한 직접 대응으로 해석됩니다. 국산 대규모 모델 경쟁은 「3T 클럽」 단계에 진입했습니다. 「오픈소스」 라벨보다 라이선스 경계 이해와 계층 라우팅 설계에 집중할 가치가 큽니다.
대안 구성의 실무적 단점:① 16GB 노트북에서 1.56TB 가중치 다운로드와 로컬 추론을 시도하면 디스크·메모리가 즉시 포화되며 라우팅으로 하드웨어 상한을 넘을 수 없습니다. ② 덮개를 닫으면 슬립해 OAuth가 끊기고 장시간 Agent 배치가 중단됩니다. 주간 랭킹의 「최강 open weight」는 7×24 파이프라인을 노트북에서 돌릴 수 없습니다. ③ K3 Agent 워크플로 검증용 고사양 Mac Studio를 구매해 3개월 방치하면 주간 임대의 수 배 감가상각이 발생합니다. 3T급 추론은 API가 맞고, 로컬에 필요한 것은 안정적 macOS Agent 오케스트레이션 면뿐입니다.
전용 Apple Silicon, 7×24 상시 가동, 일/주/월 탄력 스케일로 macOS 호스트에 Kimi K3 API 기반 Agent(Hermes, OpenClaw, Kilo Code 등)와 iOS CI를 공존시키려는 개발자·AI 자동화 팀에게 NOVAKVM Mac Mini 클라우드 베어메탈 임대가 통상 더 나은 선택입니다. 6개 지역 노드, 고메모리 구성, SSH 직결로 Moonshot API 추론과 베어메탈 macOS 실행면을 분리해 64 GPU 클러스터와 노트북 슬립의 이중 함정을 피합니다. NOVAKVM 가격 페이지에서 M4 Pro·스토리지 확장을 비교하고 주문 페이지에서 시험 노드를 기동하세요. 원격 연결은 고객 센터를 참고하십시오.