华为今日宣布开源其最新研发的盘古MoE模型openPangu-2.0-Pro,该模型基于昇腾NPU训练,总参数规模达5050亿,激活参数规模180亿,支持512K上下文长度,训练数据总量约34T tokens。这是继6月12日轻量化模型openPangu-2.0-Flash开源后,华为在大模型领域的又一重要进展。
openPangu-2.0-Pro在模型架构上实现了全面升级。其Attention架构采用DSA+SWA独立分层混合架构,层配比为1:2,其中SWA层负责局部窗口建模,DSA层负责稀疏全局聚合,在保持精度的同时显著降低了长序列推理的计算、显存与访存开销。拓扑架构方面,将传统残差连接升级为4支流mHC架构,提升了表征多样性与泛化能力。自投机模块采用3头MTP架构,一次额外预测3个token,有效提升了模型的推理速度。训练中采用的Muon优化器使模型获得了更快的收敛速度。
研究人员发现,底层性能强劲的基础推理能力能够直接支撑复杂智能体行为运行,而智能体的持续运行又会反向迭代优化模型的多阶任务规划能力与长轨迹上下文处理水平。这一正向协同反馈机制为模型性能的提升提供了新的思路。
openPangu-2.0系列模型是专为长上下文智能体任务打造的。智能体应用要求模型能够执行长程任务、精准调用外部工具,并在长时间运行时保持认知一致性。然而,现有通用框架在部署时会带来不必要的推理资源损耗,拉长上下文长度会拖累模型表现;传统对齐手段稳定性不足,运行长周期任务时常出现时间逻辑、层级结构方面的推理问题。为此,华为融合自研硬件内核、整机系统架构、训推一体化智能体强化学习算法,搭配专属推理加速方案,搭建了一套完备的软硬件协同设计体系。
在性能评估方面,研究人员基于多个公开基准测试对openPangu-2.0模型进行了评估。技术报告显示,在通用能力测试、推理任务、智能体等测试中,openPangu-2.0表现出色,但在处理复杂现实世界软件工程任务时,仍与顶尖模型存在明显差距。具体来看,openPangu-2.0-Flash和openPangu-2.0-Pro在多种通用测试中都表现优异,包括上下文学习、指令遵循以及多轮理解能力等方面。在世界知识及事实可靠性测试中,openPangu-2.0-Pro的表现远远超过openPangu-2.0-Flash。
华为内部实验表明,为模型建立扎实的基础知识及推理能力有助于学习更复杂的智能体行为和编程技能。反过来,在复杂的智能体环境中进行训练能够明显提升模型基本能力,包括指令遵循、长轨迹上下文处理、多步推理以及程序规划等。在训练过程中及训练结束后,持续提供高质量、多样化的长轨迹智能体数据以及互动环境是非常有优势的,这成为未来模型升级的核心策略之一。
openPangu-2.0系列模型的核心架构采用分层混合注意力机制完成上下文计算解耦。滑动窗口注意力机制(SWA)用于稠密局部上下文的处理,深度稀疏注意力机制用于全局稀疏信息检索。同时,为实现推理加速,模型额外搭载了一个三头多Token预测(MTP)模块,还将流形约束超连接(mHC)与Muon优化器相结合,能够在固定数据投入量的前提下提升模型收敛速度。
训练基础设施方面,当模型拓展至512K上下文窗口,同时叠加mHC、Muon、MTP等多重复杂基础架构单元,会带来更高通信开销与显存占用瓶颈。为此,研发人员搭建了一套系统化协同优化框架,融合无冗余混合上下文并行(CP)、面向MTP的轻量化点对点数据传输、适配Muon优化器的分布式计算通信重叠机制以及混合重计算策略。依托Ascend C专用编程语言定制融合内核,对mHC、参数化注意力汇点(PAS)、模块化注意力(ModAttn)模块进行深度加速。
预训练阶段,openPangu-2.0预训练语料库包含约34T tokens。预训练过程被划分为三个阶段:第一阶段是通用领域(25T tokens),重点在于建立扎实的通用知识和广泛的语言能力基础;第二阶段是推理能力培养(8T tokens),提升深度推理能力、逻辑思维能力以及高级编程技能;第三阶段是退火处理(1.4T tokens),优化模型行为和智能体的能力,保留了较长的文档和复杂的轨迹数据,以便在这一阶段最大限度提升模型的自主任务处理能力。预训练语料库汇集了网页、书籍、PDF文件、多语言文本、代码库等数据。
后训练阶段分为三级流水线:监督微调(SFT)、并行强化学习专家训练、多专家在线策略蒸馏(OPD)。完成统一监督微调后,系统并行训练多组强化学习专家模型;各组专家依托独立数据集与专属奖励函数,分别针对逻辑推理、通用问答、智能体交互、代码生成四大领域优化策略,消除强化学习过程中的跨领域任务干扰。最后借助在线策略蒸馏完成各路专家能力的融合聚合。
推理加速方面,华为自研了昇腾原生推理框架,实现硬件执行逻辑与模型运行时动态行为耦合。该架构自研多款融合算子,包含面向推理场景优化的mHC算子、专用集合通信原语,同时配套Felix上下文并行、单核多流执行等并行策略。为提升推理吞吐,该框架搭配了定制量化方案与算子感知式保精度量化机制;并且集成混合KV缓存管理、无损并行分词(LoPT),基于模块化注意力(ModAttn)原生适配自动前缀缓存(APC)与MTP技术。在128K上下文长度下,这套框架在昇腾NPU硬件的长上下文推理性能为:openPangu-2.0-Flash版本最低TPOT时延可达5.63ms,在TPOT为15ms的工况下单卡NPU生成吞吐1846 token/s;openPangu-2.0-Pro版本最低TPOT时延9.55ms,TPOT 20ms条件下单卡吞吐1326 token/s。















