Huawei openPangu 2.0 в open source:
505B MoE, 512K контекст и полный стек Ascend

Если вы разворачиваете LLM в суверенном стеке, работаете с контрактами и code base на сотни тысяч токенов или оцениваете Ascend NPU как замену NVIDIA и не понимаете, чем openPangu 2.0 отличается от DeepSeek и Qwen и как скачать open-source Pangu 2.0, этот разбор на основе релиза HDC 2026 и репозиториев GitCode Ascend Tribe покрывает таймлайн, параметры Pro/Flash, 7 open-source компонентов, архитектуру mHC/MoE, матрицу конкурентов, ModelArts API и self-hosted деплой на GitCode, требования к железу, стратегию и roadmap. Инфра: тарифы аренды NOVAKVM.

12 июня 2026 на Huawei Developer Conference (HDC 2026) в Дунгуане Юй Чэндун (余承东) официально представил openPangu 2.0. 30 июня веса openPangu-2.0-Flash, базовый inference-код и training/inference ops вышли на GitCode — обещание HDC выполнено.

  • Лимит «только веса»: у большинства open-source LLM открыты веса и inference, но не training pipeline — академия и корпорации не могут воспроизвести pretrain.
  • Зависимость от NVIDIA: экспортные ограничения США на A100/H100 закрепили миф «без Nvidia нет frontier» — openPangu 2.0 стал первой open-source frontier-моделью, обученной целиком на не-NVIDIA железе.
  • Узкое окно контекста: DeepSeek V4 Pro и Qwen 3.7 Max — чаще 128K; длинные контракты и крупные репозитории приходится резать на чанки с потерей контекста.
  • Разрыв compliance: госсектор и крупный enterprise требуют суверенный training+inference stack; frontier-модели до сих пор тренировались на NVIDIA.
  • Разрыв edge и Agent: HarmonyOS 7 переходит в эру Agent — нужна нативная LLM-основа, встроенная в ОС.
  • Локальный Mac как bottleneck: при оркестрации Agent и API-routing на Mac сон, диск и сеть рвут 7×24 pipeline.
Таймлайн open source openPangu 2.0
Дата Событие
2026-06-12 HDC 2026: keynote Юй Чэндуна, анонс openPangu 2.0
2026-06-30 Flash weights, inference code, training ops на GitCode
2026-07 (план) Веса и inference code для Pro
H2 2026 (план) Pretrain code, post-train code, training kernels

В одном предложении: две версии (Pro + Flash), единый 512K контекст, training целиком на Ascend NPU, 7 компонентов full-stack open source — крупнейший open-source апгрейд Pangu с 2021 года.

Ключевые параметры Pro и Flash
Параметр Pro Flash
Всего параметров 505B 92B
Активных параметров 18B 6B
Sparse ratio ~28:1 ~15:1
Контекст 512K 512K
Статус план — июль доступен с 30 июня
Сравнение frontier open-source моделей
Модель Всего Активных Контекст Training HW Open source
openPangu 2.0 Pro 505B 18B 512K Ascend NPU full stack (7 компонентов)
openPangu 2.0 Flash 92B 6B 512K Ascend NPU full stack (7 компонентов)
DeepSeek V4 Pro 1.6T ~200B 128K NVIDIA веса + inference
Qwen 3.7 Max ~400B+ varies 128K NVIDIA веса + inference + часть training
Kimi K2.7 1T 32B 256K NVIDIA веса + inference
Llama 4 405B 405B 128K NVIDIA веса + inference

Матрица способностей: code gen и сложный reasoning — лидер DeepSeek V4 Pro (~200B active); Agent/multi-tool — Kimi K2.7 с сильным MCP-экосистемой; по длинному контексту, эффективности inference, суверенности и full-stack open source openPangu 2.0 почти без альтернатив. Независимые benchmark ещё в работе; ниже — выводы по архитектуре.

openPangu 2.0 — MoE (Mixture of Experts), обучение целиком на Huawei Ascend 910B NPU без A100/H100.

  • mHC (Multi-Head Combinatorial) routing: эффективнее маршрутизация экспертов, меньше load imbalance.
  • Muon optimizer: second-order momentum от Microsoft, стабильнее training.
  • ModAttn (Modular Attention): модульное внимание под 512K контекст (~8 томов «Задачи трёх тел» в тексте).
  • DSA+SWA ultra-sparse attention (только Flash): экстремальный sparse ratio, ниже compute на inference.
  • Train/inference consistency >99%: решает классическую проблему drift MoE между train и serve.
  • 2× throughput на одной карте: Ascend-native дизайн даёт ~2× throughput vs типичные open models на Ascend; +50% throughput на 512K sequences; +30% efficiency на super-node training.
  • Edge 30B embedded: inference +50% быстрее, −20% памяти, офлайн на Kirin-смартфонах.
  • Flash-Int8: W4A8 квантизация, −40% памяти, <10% потери точности.

Планируемые 7 компонентов open source: model architecture, weights (Flash — 30 июня, Pro — июль), technical report, inference code + training/inference ops (уже), pretrain code (H2), post-train SFT/RLHF (H2), high-performance Ascend training kernels (H2). Первые четыре — industry standard; последние три для MoE такого масштаба крайне редки — это настоящий full-stack open source.

Экосистема: CANN (аналог CUDA) + torch_npu (адаптер PyTorch). Стандартный PyTorch-код переключается на Ascend через import torch_npu. Платформы: Huawei Cloud ModelArts API, self-hosted на GitCode Ascend Tribe, нативная интеграция HarmonyOS.

  1. Аккаунт Huawei Cloud: регистрация и верификация для подписки ModelArts.
  2. ModelArts AI Gallery: ModelArts → AI Gallery → «openPangu 2.0», подписка Flash или Pro, получение API endpoint и token.
  3. Проверка API: первый запрос в формате Chat Completions — latency и качество под ваш use case.
  4. Клонирование репозитория GitCode: из org Ascend Tribe — веса openPangu-2.0-Flash, исходники openPangu-2.0-Infer и ops openPangu-2.0-Op.
  5. Среда Ascend: установка CANN и torch_npu, загрузка модели на npu:0; Flash на одной 910B или системе с ~96GB unified memory.
  6. Domain fine-tune и prod: LoRA на своих данных или API-mode в существующий Agent pipeline; после релизов сверяйте команды с официальным репозиторием.
modelarts-api.sh
Пример вызова ModelArts API (см. официальную документацию)
curl -X POST "https://modelarts.${REGION}.myhuaweicloud.com/v1/infers/openpangu-2-flash/chat/completions" \
  -H "Content-Type: application/json" \
  -H "X-Auth-Token: ${TOKEN}" \
  -d '{
    "model": "openpangu-2.0-flash",
    "messages": [{"role": "user", "content": "Привет, расскажи о себе"}],
    "max_tokens": 1024,
    "temperature": 0.7
  }'
inference.py
Single-card inference Flash (Ascend 910B)
python inference.py \
  --model_path ./openPangu-Flash \
  --device npu:0 \
  --context_length 512000 \
  --precision bf16

Официальные репозитории и документация; при обновлениях ориентируйтесь на актуальный README по ссылкам.

https://gitcode.com/org/ascend-tribe/repos

https://www.huaweicloud.com/product/modelarts.html

https://developer.huawei.com/consumer/cn/hdc/

Требования к железу
Версия Рекомендация Минимум Примечание
Flash (6B active) 1× Ascend 910B ~96GB unified memory community-тесты на больших RAM-системах
Flash-Int8 1× Ascend Atlas A2 ~48GB VRAM W4A8, <10% потери точности
Pro (18B active) 4+× Ascend 910B multi-card cluster проверка после релиза весов в июле
Выбор по сценарию
Сценарий Выбор Почему
Документы >256K токенов Pro 512K — топ среди open models
Суверенный / domestic compliance Pro/Flash единственная frontier, обученная на domestic HW
Code gen / сложный reasoning DeepSeek V4 Pro 200B active parameters
Agent / multi-tool Kimi K2.7 сильнейший MCP-экосистема
Дешёвый high-concurrency API Flash 6B active, быстрый inference
Стек Ascend / Huawei Cloud любая версия native fit, 2× throughput
HarmonyOS on-device AI Embedded 30B локально на Kirin

Лицензия: Huawei openPangu License — коммерческое использование, без роялти, non-exclusive; детали в репозитории GitCode.

  • Геополитика: на фоне экспортного контроля США на AI-чипы openPangu 2.0 доказывает, что frontier training возможен на Ascend 910B — ответ на тезис «без Nvidia нет больших моделей».
  • Основа HarmonyOS Agent: HarmonyOS 7 в эру Agent; HarmonyOS Agent Framework 2.0 — >90% success на сложных задачах; edge 30B — локальная LLM на телефоне без сети.
  • Ценность full-stack open source: академия воспроизводит training; enterprise делает vertical pretrain; ниже порог входа на Ascend compute.
  • 512K контекст: ~8 романов, полный крупный репозиторий или юридический контракт с приложениями за один проход.
  • Train/serve consistency >99%: критичная метрика для MoE в production.
  • Latency inference: на 1.2× лучше аналогов по данным Huawei.

Дисклеймер: часть benchmark и оценок — архитектурные выводы; обновим после публикации независимых тестов. Дата публикации: 1 июля 2026.

В code gen и сложном reasoning DeepSeek V4 Pro пока сильнее, но по 512K контексту, суверенности, Ascend-native 2× throughput, full-stack open source и интеграции с HarmonyOS edge openPangu 2.0 почти без конкурентов. Если вы оркестрируете Agent на Mac, стыкуете ModelArts API или строите multi-model routing, сон Mac, диск и сетевой jitter ломают 7×24 pipeline; облачные GPU-VM не дают Metal и ломают Apple Silicon toolchain. Для стабильного prod под iOS CI/CD и AI Agent automation аренда Mac Mini в NOVAKVM — типично лучший вариант: dedicated Apple Silicon, 7×24 online, гибкие сроки day/week/month, связка «локальная оркестрация + remote inference». См. центр помощи и оформить заказ.