화웨이 openPangu 2.0 정식 오픈소스:
505B MoE, 512K 컨텍스트와 어센드 풀링크 개방

국산화 환경에 대규모 모델을 배포하거나, 초장문 계약서와 코드베이스를 처리하거나, 어센드 NPU로 NVIDIA를 대체하는 방안을 평가하는 개발자 및 기업 IT 책임자라면 「openPangu 2.0과 DeepSeek·Qwen의 차이는 무엇인가」「오픈소스 판고 2.0을 어떻게 다운로드·배포하는가」에 대해 궁금하실 수 있습니다. 본 글은 HDC 2026 공식 발표와 GitCode Ascend Tribe 저장소를 바탕으로 이벤트 타임라인, Pro/Flash 파라미터, 7대 오픈소스 컴포넌트, mHC/MoE 아키텍처, 경쟁 비교 매트릭스, ModelArts API와 GitCode 자체 배포, 하드웨어 요구사항, 전략적 의미, 오픈소스 로드맵을 포괄적으로 다룹니다. 엔지니어링 환경은 NOVAKVM 가격 페이지를 참조하십시오.

2026년 6월 12일, 화웨이 개발자 대회 HDC 2026이 동관 송산호에서 개최되었고, 위청동의 기조 연설을 통해 openPangu 2.0이 정식 발표되었습니다. 6월 30일, openPangu-2.0-Flash 모델 가중치, 기본 추론 코드, 훈련·추론 연산자가 GitCode에 공개되어 HDC 약속이 이행되었습니다.

  • 「가중치만 오픈소스」의 한계: 대부분의 오픈소스 대규모 모델은 가중치와 추론 코드만 공개하여 훈련 흐름을 재현할 수 없으며, 학술 연구와 기업의 2차 사전 훈련이 제약됩니다.
  • NVIDIA 의존 불안: 미국의 A100/H100 대중 수출 제한으로 업계는 「NVIDIA 없이는 최첨단 모델을 만들 수 없다」고 여겨 왔습니다. openPangu 2.0은 세계 최초의 비 NVIDIA 하드웨어에서 최첨단 규모 훈련을 완료한 오픈소스 대규모 모델입니다.
  • 컨텍스트 윈도우 병목: DeepSeek V4 Pro, Qwen 3.7 Max는 대부분 128K로, 초장문 계약서와 대규모 코드베이스는 분할 처리가 필요하여 정보 손실이 큽니다.
  • 국산화 컴플라이언스 공백: 정부·기업 프로젝트는 훈련과 추론의 풀스택 자주 통제를 요구하지만, 기존 최첨단 모델의 훈련 하드웨어는 모두 NVIDIA입니다.
  • 엣지와 Agent 분리: HarmonyOS 7이 Agent 시대에 진입하며, 시스템과 깊이 통합된 네이티브 대규모 모델 기반이 필요합니다.
  • 로컬 Mac 연동 병목: 개발자가 Mac에서 Agent를 편성하고 API 라우팅을 조정할 때, 로컬 머신의 절전과 디스크 제한이 7×24 파이프라인을 중단시킵니다.
openPangu 2.0 오픈소스 타임라인
시기 이벤트
2026-06-12 HDC 2026 위청동 기조 연설로 openPangu 2.0 정식 발표
2026-06-30 Flash 가중치, 추론 코드, 훈련·추론 연산자 GitCode 공개
2026-07(예정) Pro 버전 가중치와 추론 코드 공개
2026 하반기(예정) 사전 훈련 코드, 사후 훈련 코드, 훈련 연산자 순차 공개

핵심 요약: 두 버전(Pro + Flash), 통일 512K 초장 컨텍스트, 어센드 NPU 전 과정 훈련, 7대 컴포넌트 풀링크 오픈소스——화웨이가 2021년 1세대 판고를 발표한 이후 가장 중요한 오픈소스 업그레이드입니다.

openPangu 2.0 두 버전 핵심 파라미터
차원 Pro Flash
총 파라미터 수 505B 92B
활성화 파라미터 수 18B 6B
스파스 비율 약 28:1 약 15:1
컨텍스트 윈도우 512K 512K
이용 가능 상태 7월 공개 예정 6월 30일 공개 완료
주요 최첨단 오픈소스 모델 횡단 비교
모델 총 파라미터 활성화 파라미터 컨텍스트 훈련 하드웨어 오픈소스 수준
openPangu 2.0 Pro 505B 18B 512K 어센드 NPU 풀링크(7 컴포넌트)
openPangu 2.0 Flash 92B 6B 512K 어센드 NPU 풀링크(7 컴포넌트)
DeepSeek V4 Pro 1.6T 약 200B 128K NVIDIA 가중치+추론
Qwen 3.7 Max 약 400B+ 가변 128K NVIDIA 가중치+추론+일부 훈련
Kimi K2.7 1T 32B 256K NVIDIA 가중치+추론
Llama 4 405B 405B 128K NVIDIA 가중치+추론

능력 매트릭스 개요: 코드 생성과 복잡 추론에서는 DeepSeek V4 Pro가 앞서며(약 200B 활성화 파라미터), Agent/멀티툴 협업에서는 Kimi K2.7의 MCP 생태계가 가장 완비되어 있습니다. 초장 컨텍스트, 추론 효율, 자주 통제, 풀링크 오픈소스 네 차원에서 openPangu 2.0은 거의 대체 불가능합니다. 독립 제3자 벤치마크는 아직 평가 중이며, 아래는 아키텍처 기반 추론입니다.

openPangu 2.0은 MoE(혼합 전문가) 아키텍처를 채택하며, 화웨이 어센드 910B NPU에서 전 과정 훈련되었고 A100이나 H100은 전혀 사용하지 않았습니다.

  • mHC(Multi-Head Combinatorial) 라우팅: 전문가 라우팅 효율을 개선하고 부하 불균형을 낮춥니다.
  • Muon 옵티마이저: Microsoft가 제안한 2차 모멘텀 최적화 방안으로 훈련 안정성을 향상시킵니다.
  • ModAttn(Modular Attention): 모듈형 어텐션으로 512K 초장 컨텍스트(약 8권 분량의 장편 소설)에 대응합니다.
  • DSA+SWA 초희소 어텐션(Flash 전용): 극한의 스파스 비율을 실현하여 추론 연산 요구를 대폭 낮춥니다.
  • 훈련·추론 일치성 >99%: MoE 모델의 훈련/추론 분포 불일치라는 오래된 난제를 해결합니다.
  • 단카드 처리량 2배: 어센드 친화 아키텍처로 업계 주류 오픈소스 모델 대비 어센드 단카드 처리량 2배, 512K 장시퀀스 훈련 처리량 +50%, 슈퍼노드 훈련 효율 +30%입니다.
  • 엣지 30B 내장 모델: 추론 속도 50% 향상, 메모리 사용량 20% 감소, 기린 칩 스마트폰 오프라인 실행을 지원합니다.
  • Flash-Int8 양자화 버전: W4A8 양자화로 메모리 사용량 40% 감소, 정밀도 손실 <10%입니다.

공개 예정인 7대 컴포넌트는 다음과 같습니다. 모델 구조, 모델 가중치(Flash 6/30 공개 완료, Pro 7월), 기술 보고서, 추론 코드+훈련·추론 연산자(공개 완료), 사전 훈련 코드(하반기), 사후 훈련 코드 SFT/RLHF(하반기), 어센드 고성능 훈련 연산자(하반기). 앞 4항목은 업계 관행이지만, 뒤 3항목은 초대규모 MoE에서 극히 드물며 진정한 풀링크 오픈소스를 실현합니다.

개발자 생태계는 CANN(CUDA 유사)+torch_npu(PyTorch 적응 계층)를 기반으로 하며, 표준 PyTorch 코드는 import torch_npu로 어센드 백엔드에 전환할 수 있습니다. 배포 플랫폼은 화웨이 클라우드 ModelArts API, GitCode Ascend Tribe 자체 배포, 홍몽 네이티브 통합을 포괄합니다.

  1. 화웨이 클라우드 계정 등록: 화웨이 클라우드 공식 사이트에서 실명 인증을 완료하고 ModelArts 구독을 준비합니다.
  2. ModelArts AI Gallery 구독: ModelArts → AI Gallery → 「openPangu 2.0」을 검색하여 Flash 또는 Pro 버전을 구독하고 API Endpoint와 Token을 획득합니다.
  3. API 호출 검증: 표준 Chat Completions 형식으로 첫 추론 요청을 보내 지연 시간과 출력 품질이 업무 요구를 충족하는지 확인합니다.
  4. GitCode 저장소 클론: Ascend Tribe 조직에서 openPangu-2.0-Flash 가중치, openPangu-2.0-Infer 추론 소스, openPangu-2.0-Op 연산자를 다운로드합니다.
  5. 어센드 환경 구성: CANN과 torch_npu를 설치하고 모델을 npu:0에 로드합니다. Flash는 단카드 910B 또는 대용량 메모리 시스템(약 96GB 통합 메모리)에서 실행을 시도할 수 있습니다.
  6. 도메인 미세 조정 및 상용화: LoRA 등으로 전용 데이터에서 미세 조정하거나 API 모드로 기존 Agent 파이프라인에 연결합니다. 릴리스 후 공식 저장소에서 명령과 버전을 다시 확인하십시오.
modelarts-api.sh
ModelArts API 호출 예시(공식 문서 기준)
curl -X POST "https://modelarts.${REGION}.myhuaweicloud.com/v1/infers/openpangu-2-flash/chat/completions" \
  -H "Content-Type: application/json" \
  -H "X-Auth-Token: ${TOKEN}" \
  -d '{
    "model": "openpangu-2.0-flash",
    "messages": [{"role": "user", "content": "안녕하세요, 자기소개를 부탁드립니다"}],
    "max_tokens": 1024,
    "temperature": 0.7
  }'
inference.py
Flash 버전 단카드 추론(어센드 910B)
python inference.py \
  --model_path ./openPangu-Flash \
  --device npu:0 \
  --context_length 512000 \
  --precision bf16

공식 저장소와 문서 진입점은 아래와 같습니다. 상류가 업데이트되면 링크 내 최신 README를 기준으로 하십시오.

https://gitcode.com/org/ascend-tribe/repos

https://www.huaweicloud.com/product/modelarts.html

https://developer.huawei.com/consumer/cn/hdc/

하드웨어 요구사항 참고
버전 권장 하드웨어 최소 구성 비고
Flash(6B 활성화) 단카드 어센드 910B 약 96GB 통합 메모리 커뮤니티 테스트로 대용량 메모리 시스템에서 실행 가능
Flash-Int8 단카드 어센드 Atlas A2 약 48GB VRAM W4A8 양자화, 정밀도 손실 <10%
Pro(18B 활성화) 4카드 이상 어센드 910B 멀티카드 클러스터 7월 가중치 공개 후 검증 가능
시나리오별 선정 빠른 참조
시나리오 권장 이유
초장문 문서(>256K Token) Pro 512K 컨텍스트는 업계 최상위
국산화/컴플라이언스 Pro/Flash 유일한 순수 국산 하드웨어 훈련 최첨단 모델
코드 생성/복잡 추론 DeepSeek V4 Pro 200B 활성화 파라미터로 성능 선도
Agent/멀티툴 협업 Kimi K2.7 MCP 생태계가 가장 완비
저비용 고동시 API Flash 6B 활성화로 추론이 매우 빠름
어센드/화웨이 클라우드 환경 임의 버전 네이티브 적응, 2배 처리량
홍몽 엣지 AI Embedded 30B 기린 칩 로컬 실행

오픈소스 라이선스: 화웨이 openPangu License——상업적 이용 가능, 로열티 무료, 비독점적. 구체 조항은 GitCode 저장소를 참조하십시오.

  • 지정학적 의미: 미국의 대중 선진 AI 칩 제한 배경에서 openPangu 2.0은 어센드 910B에서 풀스택 최첨단 훈련이 가능함을 증명하며 「NVIDIA 없이는 대규모 모델을 만들 수 없다」는 주장에 대한 유력한 반박입니다.
  • HarmonyOS Agent 기반: HarmonyOS 7이 Agent 지능 시대에 전면 진입했고, 홍몽 지능체 프레임워크 2.0의 복잡 작업 실행 성공률은 >90%입니다. 엣지 30B 모델로 스마트폰 로컬 대규모 모델이 네트워크 없이 동작합니다.
  • 풀링크 오픈소스 가치: 학술 연구에서 훈련 흐름을 완전 재현 가능하고, 기업은 사전 훈련 코드로 수직 도메인 2차 사전 훈련이 가능하며, 개발자의 어센드 연산 이용 장벽을 낮춥니다.
  • 512K 컨텍스트: 장편 소설 8권 분량, 완전한 대규모 코드베이스, 부록이 포함된 완전한 법률 계약서를 한 번에 처리할 수 있습니다.
  • 훈련·추론 일치율 >99%: MoE 아키텍처의 핵심 지표로 매우 높은 엔지니어링 가치를 지닙니다.
  • 추론 지연: 업계 동급 모델 대비 1.2배 우수(화웨이 공식 데이터).

면책 조항: 본 글의 일부 벤치마크와 능력 평가는 아키텍처 기반 추론 분석입니다. 독립 제3자 테스트 결과가 공개되면 지속적으로 업데이트하겠습니다. 게시일: 2026년 7월 1일.

openPangu 2.0은 코드와 복잡 추론에서 DeepSeek V4 Pro에 아직 열세이지만, 512K 초장 컨텍스트, 국산화 자주 통제, 어센드 네이티브 2배 처리량, 풀링크 오픈소스, 엣지 홍몽 통합 다섯 차원에서는 거의 대체 불가능합니다. Mac에서 Agent를 편성하고 ModelArts API에 연결하거나 멀티모델 라우팅을 수행할 때, 개인 Mac의 절전 단절, 디스크와 네트워크 변동이 7×24 파이프라인을 저해합니다. 퍼블릭 클라우드 GPU 가상머신은 Metal 부재와 Apple Silicon 툴체인 비호환 문제가 있습니다. 더 안정적이고 iOS CI/CD와 AI Agent 자동화에 적합한 프로덕션 환경에서는 NOVAKVM Mac Mini 클라우드 대여가 일반적으로 더 나은 선택입니다. 전용 Apple Silicon, 7×24 온라인, 일/주/월 유연 주문으로 클라우드 대규모 모델 API와 「로컬 편성 + 원격 추론」의 안정적 조합을 형성합니다. 자세한 내용은 고객 센터주문 페이지를 참조하십시오.