華為 openPangu 2.0 正式開源:
505B MoE、512K 上下文與昇騰全鏈路開放

若你是需要在信創環境部署大模型、處理超長合約與程式碼庫、或評估昇騰 NPU 替代 NVIDIA 的開發者與企業 IT 負責人,正困惑「openPangu 2.0 與 DeepSeek、Qwen 有何差異、開源盤古 2.0 如何下載部署」,本文基於 HDC 2026 官方發布與 GitCode Ascend Tribe 儲存庫,完整涵蓋事件時間線、Pro/Flash 參數、7 大開源組件、mHC/MoE 架構、競品對比矩陣、ModelArts API 與 GitCode 自部署、硬體需求、戰略意義與開源路線圖。工程環境見 NOVAKVM 定價頁

2026 年 6 月 12 日,華為開發者大會 HDC 2026 在東莞松山湖舉辦,余承東主題演講正式發布 openPangu 2.0。6 月 30 日,openPangu-2.0-Flash 模型權重、基礎推理程式碼與訓推算子上線 GitCode,兌現 HDC 承諾。

  • 「只開源權重」的侷限:多數開源大模型僅釋出權重與推理程式碼,無法復現訓練流程,學術與企業二次預訓練受阻。
  • NVIDIA 依賴焦慮:美國對華限制 A100/H100 出口,業界預設「無輝達做不出前沿模型」——openPangu 2.0 是全球首個在非 NVIDIA 硬體上完成前沿規模訓練的開源大模型
  • 上下文視窗瓶頸:DeepSeek V4 Pro、Qwen 3.7 Max 多為 128K,超長合約與大型程式碼庫需分塊處理,資訊損失大。
  • 信創合規缺口:政企專案要求訓練與推理全棧自主可控,現有前沿模型訓練硬體均為 NVIDIA。
  • 端側與 Agent 割裂:HarmonyOS 7 進入 Agent 時代,需要與系統深度整合的原生大模型底座。
  • 本地 Mac 聯調瓶頸:開發者用 Mac 編排 Agent、調 API 路由時,本機休眠與磁碟限制會打斷 7×24 流水線。
openPangu 2.0 開源時間線
時間 事件
2026-06-12 HDC 2026 余承東主題演講正式發布 openPangu 2.0
2026-06-30 Flash 權重、推理程式碼、訓推算子上線 GitCode
2026-07(規劃) Pro 版權重與推理程式碼上線
2026 下半年(規劃) 預訓練程式碼、後訓練程式碼、訓練算子等陸續上線

一句話讀懂:兩個版本(Pro + Flash),統一 512K 超長上下文,全程昇騰 NPU 訓練,7 大組件全鏈路開源——這是華為 2021 年發布第一代盤古以來最重要的一次開源升級。

openPangu 2.0 兩版本核心參數
維度 Pro Flash
總參數量 505B 92B
啟用參數量 18B 6B
稀疏比 ~28:1 ~15:1
上下文視窗 512K 512K
可用狀態 7 月規劃上線 6 月 30 日已上線
主流前沿開源模型橫向對比
模型 總參數 啟用參數 上下文 訓練硬體 開源程度
openPangu 2.0 Pro 505B 18B 512K 昇騰 NPU 全鏈路(7 組件)
openPangu 2.0 Flash 92B 6B 512K 昇騰 NPU 全鏈路(7 組件)
DeepSeek V4 Pro 1.6T ~200B 128K NVIDIA 權重+推理
Qwen 3.7 Max ~400B+ varies 128K NVIDIA 權重+推理+部分訓練
Kimi K2.7 1T 32B 256K NVIDIA 權重+推理
Llama 4 405B 405B 128K NVIDIA 權重+推理

能力矩陣速覽:程式碼生成與複雜推理 DeepSeek V4 Pro 領先(~200B 啟用參數);Agent/多工具協作 Kimi K2.7 MCP 生態完善;超長上下文、推理效率、自主可控、全鏈路開源四維度 openPangu 2.0 幾乎無可替代。獨立第三方 benchmark 尚在評測中,以下基於架構推斷。

openPangu 2.0 採用 MoE(混合專家)架構,全程在華為昇騰 910B NPU上訓練,未使用任何 A100 或 H100。

  • mHC(Multi-Head Combinatorial)路由:改進專家路由效率,降低負載不均衡。
  • Muon 優化器:微軟提出的二階動量優化方案,提升訓練穩定性。
  • ModAttn(Modular Attention):模組化注意力,適配 512K 超長上下文(約 8 本《三體》第一部文字量)。
  • DSA+SWA 超稀疏注意力(Flash 獨有):實現極致稀疏比,大幅降低推理算力需求。
  • 訓推一致性 >99%:解決 MoE 模型訓練/推理分佈不一致的老大難問題。
  • 單卡吞吐率 2 倍:昇騰親和架構,較業界主流開源模型在昇騰上單卡吞吐率達 2 倍;512K 長序列訓練吞吐率 +50%;超節點訓練效率 +30%。
  • 端側 30B 入端模型:推理提速 50%,記憶體佔用減少 20%,支援麒麟晶片手機離線執行。
  • Flash-Int8 量化版:W4A8 量化,記憶體佔用減少 40%,精度損失 <10%。

計劃開源的 7 大組件:模型結構、模型權重(Flash 6/30 已上線,Pro 7 月)、技術報告、推理程式碼+訓推算子(已上線)、預訓練程式碼(下半年)、後訓練程式碼 SFT/RLHF(下半年)、昇騰高效能訓練算子(下半年)。前四項為業界常規操作,後三項在超大規模 MoE 中極為罕見,實現真正意義上的全鏈路開源。

開發者生態基於 CANN(類 CUDA)+ torch_npu(PyTorch 適配層),標準 PyTorch 程式碼透過 import torch_npu 即可切換昇騰後端。部署平台涵蓋華為雲 ModelArts API、GitCode Ascend Tribe 自部署、鴻蒙原生整合。

  1. 註冊華為雲帳號:造訪華為雲官網完成實名認證,為 ModelArts 訂閱做準備。
  2. 訂閱 ModelArts AI Gallery:進入 ModelArts → AI Gallery → 搜尋「openPangu 2.0」,訂閱 Flash 或 Pro 版本並取得 API Endpoint 與 Token。
  3. API 呼叫驗證:使用標準 Chat Completions 格式發起首次推理請求,確認延遲與輸出品質滿足業務需求。
  4. GitCode 複製儲存庫:從 Ascend Tribe 組織下載 openPangu-2.0-Flash 權重、openPangu-2.0-Infer 推理原始碼及 openPangu-2.0-Op 算子。
  5. 昇騰環境設定:安裝 CANN 與 torch_npu,將模型載入至 npu:0;Flash 單卡 910B 或大記憶體系統(~96GB 統一記憶體)可嘗試執行。
  6. 領域微調與上線:使用 LoRA 等方法在專有資料上微調,或保持 API 模式接入現有 Agent 流水線;發版後請再次開啟官方儲存庫核對命令與版本。
modelarts-api.sh
ModelArts API 呼叫範例(以官方文件為準)
curl -X POST "https://modelarts.${REGION}.myhuaweicloud.com/v1/infers/openpangu-2-flash/chat/completions" \
  -H "Content-Type: application/json" \
  -H "X-Auth-Token: ${TOKEN}" \
  -d '{
    "model": "openpangu-2.0-flash",
    "messages": [{"role": "user", "content": "你好,請介紹一下你自己"}],
    "max_tokens": 1024,
    "temperature": 0.7
  }'
inference.py
Flash 版單卡推理(昇騰 910B)
python inference.py \
  --model_path ./openPangu-Flash \
  --device npu:0 \
  --context_length 512000 \
  --precision bf16

官方儲存庫與文件入口如下;若上游更新,請以連結內最新 README 為準。

https://gitcode.com/org/ascend-tribe/repos

https://www.huaweicloud.com/product/modelarts.html

https://developer.huawei.com/consumer/cn/hdc/

硬體需求參考
版本 推薦硬體 最低配置 備註
Flash(6B 啟用) 單卡昇騰 910B ~96GB 統一記憶體 社群測試可在大記憶體系統執行
Flash-Int8 單卡昇騰 Atlas A2 ~48GB 顯存 W4A8 量化,精度損失 <10%
Pro(18B 啟用) 4+ 卡昇騰 910B 多卡叢集 7 月權重上線後可驗證
場景選型速查
場景 推薦 原因
超長文件(>256K Token) Pro 512K 上下文業內頂級
信創/國產化合規 Pro/Flash 唯一純國產硬體訓練的前沿模型
程式碼生成/複雜推理 DeepSeek V4 Pro 200B 啟用參數效能領先
Agent/多工具協作 Kimi K2.7 MCP 生態最完善
低成本高併發 API Flash 6B 啟用,推理極快
昇騰/華為雲環境 任意版本 原生適配,2x 吞吐率
鴻蒙端側 AI Embedded 30B 麒麟晶片本地執行

開源協議:華為 openPangu License——可商業使用、免版權費、非排他性,具體條款以 GitCode 儲存庫為準。

  • 地緣政治意義:在美國對華限制先進 AI 晶片背景下,openPangu 2.0 證明全棧前沿訓練可在昇騰 910B 上完成,是對「沒有 NVIDIA 就無法做大模型」的有力回擊。
  • HarmonyOS Agent 底座:HarmonyOS 7 全面進入 Agent 智慧時代,鴻蒙智慧體框架 2.0 複雜任務執行成功率 >90%,端側 30B 模型實現手機本地大模型無需連網。
  • 全鏈路開源價值:學術研究可完整復現訓練流程;企業可基於預訓練程式碼做垂直域二次預訓練;降低開發者使用昇騰算力門檻。
  • 512K 上下文:相當於 8 部長篇小說、完整大型程式碼庫或帶附錄的完整法律合約一次處理。
  • 訓推一致率 >99%:MoE 架構關鍵指標,極具工程價值。
  • 推理延遲:時延優於業界同類模型 1.2 倍(華為官方資料)。

免責聲明:本文部分 benchmark 與能力評估為基於架構的推斷性分析,獨立第三方測試結果公布後將持續更新。發布日期:2026 年 7 月 1 日。

openPangu 2.0 在程式碼與複雜推理上 DeepSeek V4 Pro 仍有優勢,但在512K 超長上下文、國產化自主可控、昇騰原生 2x 吞吐、全鏈路開源、端側鴻蒙整合五維度幾乎無可替代。若你用 Mac 編排 Agent、對接 ModelArts API 或做多模型路由,個人 Mac 的休眠斷連、磁碟與網路抖動會拖累 7×24 流水線;公有雲 GPU 虛擬機則存在 Metal 缺失與 Apple Silicon 工具鏈不相容。對於更穩定、更適合 iOS CI/CD 與 AI Agent 自動化的生產環境,NOVAKVM 的 Mac Mini 雲端租用通常是更優解:獨占 Apple Silicon、7×24 在線、按天/週/月彈性下單,與雲端大模型 API 形成「本地編排 + 遠端推理」的穩定組合。詳見 雲端幫助中心雲端訂購頁