編按:本文綜合整理自 openPangu-2.0-Pro 官方模型頁、官方技術報告 與 IT之家報導,並加入 Siami 編輯部觀點與數據解讀。官方公布的效能數字仍有待第三方獨立重現。
華為已公開 openPangu-2.0-Pro 的模型權重、基礎推理程式碼與技術報告。這次釋出的不只是一張規格表,而是一套以昇騰 NPU 為核心、從訓練到推理共同設計的大型混合專家模型方案。
官方資料顯示,openPangu-2.0-Pro 共有約 505B(5,050 億)參數,但每處理一個 token 只啟用約 18B,並支援最高 512K 上下文。模型訓練資料量約 34T tokens;後訓練則結合監督微調、多專項強化學習與線上蒸餾。
這次到底開放了什麼
此次可取得的核心內容包括模型權重、基礎推理程式碼、部署說明與技術報告。對研究者而言,權重使模型能在自有環境中測試;對工程團隊而言,推理程式碼與昇騰適配資訊,則決定模型是否能真正進入產品驗證階段。
官方模型頁將 openPangu-2.0-Pro 定位為面向複雜推理、代理任務與程式開發的大型版本。openPangu 2.0 家族另有 92B 總參數、每 token 啟用約 6B 的 Flash 版,以及技術報告所述、面向資源受限環境的 30B 裝置端版本。
本次釋出的主要規格可整理為:
- 總參數量約 505B,每個 token 啟用約 18B。
- 最長支援 512K token 上下文。
- 預訓練資料量約 34T tokens。
- 提供思考與非思考兩種工作模式的評測結果。
- 主要訓練與推理環境建立在華為昇騰 NPU 生態。
- 模型頁同時提供部署、推理框架與授權文件入口。
這裡需要區分「開放權重」與「完整開源」。使用者已能下載權重並查看部分程式與報告,但是否符合每個組織對開源的嚴格定義,仍要逐項檢查授權條款、訓練資料透明度、可重現性,以及完整訓練流程是否都能取得,不能只看宣傳用語下結論。
架構重點:用稀疏啟用換取規模
openPangu-2.0-Pro 採混合專家(MoE)架構。505B 是模型可用的總參數池,18B 則是單次 token 計算時實際被路由啟用的規模。兩者相除約為 28,代表模型以高度稀疏的方式,在不必每次動用全部參數的前提下擴大知識與能力容量。
注意力層延續 MLA,並以 1:2 的比例交錯配置 DSA 與 SWA。SWA 專注局部視窗,DSA 負責稀疏的全域資訊聚合;設計目標是降低超長序列推理的計算量、顯存與資料存取壓力。這項取捨對 512K 上下文尤其重要,因為長上下文的瓶頸不只有算力,還包括 KV cache 容量與記憶體頻寬。
模型也將傳統殘差連接改為四支流 mHC 架構,並使用 Muon 優化器。官方表示,這些設計用於提升表徵多樣性與訓練收斂穩定性。推理端另加入三頭 MTP,一次額外預測三個 token,希望透過自投機方式提高生成速度。
技術報告特別強調軟硬體共同設計:客製算子、拓撲感知最佳化、快取管理與非同步排程都針對昇騰硬體打造。這也是 openPangu 與許多以 CUDA 為預設環境的開放權重模型最明顯的差異。
數據解讀:官方成績亮眼,但不能直接橫比
官方模型卡列出多組思考版與非思考版成績。思考版在 AIME 2026 為 95.4,搭配 Python 時為 97.9;GPQA-Diamond 為 87.9,HLE 為 27.1。代理任務方面,TAU2-Bench 為 81.1、MCP-Atlas 為 61.3;程式能力則包括 LiveCodeBench V6 的 85.7,以及 SWE-bench Verified 的 68.5。
這些數字可用來理解官方設定下的能力分布,卻不宜直接當成「全面勝過其他模型」的結論,原因至少有四項:
- 不同模型可能使用不同推理 token 預算、採樣次數與工具權限。
- 部分測試使用 OpenCode、OpenHands 或官方指定的代理腳手架,腳手架本身會影響成績。
- GDPVal 採官方內部評測流程;BrowseComp 使用特定上下文管理策略與最高 300 次迭代。
- 目前公開數字主要來自模型團隊,尚缺少大規模第三方重現與跨硬體成本比較。
還有一個容易被忽略的地方:18B 啟用參數不等於只需載入 18B 權重。部署大型 MoE 時,總權重儲存、專家分布、路由通訊與多卡互連仍會形成很高的硬體門檻。稀疏啟用降低每 token 計算量,但不會讓 505B 模型瞬間變成一般單卡可跑的小模型。
因此,更公平的比較應同時公開首 token 延遲、每秒 token 數、併發量、能耗、硬體數量、量化方式與總持有成本。只有單一 benchmark 分數,無法回答企業最在意的部署效率問題。
為什麼這件事重要
這次釋出的價值,不只在於「又一個五千億參數模型」。更關鍵的是,華為正在把模型、訓練框架、推理引擎與昇騰硬體綁成一套可供外部開發者驗證的技術路線。全球大型模型生態長期以 NVIDIA CUDA 為中心,openPangu 提供另一條從晶片、算子到模型共同最佳化的路徑,可能擴大非 CUDA AI 基礎設施的實驗規模。
對中國市場來說,模型權重與推理程式公開,有助於企業在本地硬體上評估私有部署、資料治理與代理應用,不必完全依賴封閉 API。對其他地區的研究者來說,最值得觀察的是這套架構能否被獨立重現,以及在相同品質下,昇騰平台能否提出具競爭力的延遲、吞吐與能耗數據。
不過,「能下載」只是生態起點。真正影響採用速度的,還包括文件品質、社群回覆、主流框架支援、量化工具、微調方案、硬體可得性與授權限制。官方模型頁目前已有模型卡、部署入口和技術報告,接下來幾週開發者提出的 issue、相容性修補與第三方測試,會比發布當天的口號更能反映實際成熟度。
openPangu-2.0-Pro 的核心命題,是以 505B 總容量與 18B 稀疏啟用追求大型模型能力,再透過昇騰原生的軟硬體共同設計控制長上下文與代理推理成本;這項命題仍需公開、可重現的實測驗證。
開發者接下來該看什麼
有意測試的團隊可先從官方模型頁、技術報告與部署說明著手,不必急著下載全部權重。第一階段應確認授權是否符合商用情境、推理框架支援哪些昇騰型號,以及現有叢集是否具備足夠儲存與互連能力。
後續值得追蹤的訊號包括:
- Hugging Face 或主流推理框架是否提供穩定、可重現的整合。
- 第三方能否重現 SWE-bench Verified、AIME 與代理任務成績。
- 512K 上下文在真實文件檢索中是否維持準確率,而非只做到「可輸入」。
- 量化後的品質損失、記憶體需求與每 token 成本。
- 官方是否持續公開預訓練、後訓練與算子等承諾中的其餘組件。
背景資料可參考 華為雲官方頻道的盤古模型介紹。該影片早於 Pro 此次開放權重,適合作為產業生態背景,不應被視為這次版本的獨立評測。
最終,openPangu-2.0-Pro 是否能成為廣泛採用的開放權重模型,答案不會由 505B 這個數字決定,而會取決於模型能否被下載、部署、重現、改造,並在真實工作負載中證明成本與效能。
網友熱門留言 (2)