在人工智能技术迅猛发展的当下,算力需求呈现爆发式增长,超节点方案正成为各大企业的“必争之地”。从互联网巨头到服务器厂商,纷纷加大在这一领域的投入,一场围绕超节点的竞争已悄然打响。
超节点究竟是什么?简单来说,它是通过高速互联技术,将大量GPU或加速卡深度整合,在逻辑上形成一台“超级计算机”。这种设计打破了传统集群跨机器通信的带宽和延迟瓶颈,显著提升了GPU或加速卡的利用率,进而降低了单位Token成本。如今,超节点已成为AI基础设施建设的核心趋势。
回顾超节点的发展历程,2024年英伟达发布的GB200 NVL72将其推向业界视野,但当时市场需求并不旺盛。直到2025年,随着大模型参数量的急剧膨胀,超节点才真正成为热点。国内厂商早在2024年前后便开始技术预研,2025年首批产品上市,华为、百度智能云、浪潮信息、新华三、中兴等企业纷纷入局,赛道迅速升温。
在这场竞争中,企业们选择了不同的技术路线。华为、中科曙光和百度等企业倾向于扩大单个超节点的规模。华为已展示由20个机柜组成的1024卡超节点,并计划在今年第四季度交付8192卡超节点,理论上达到满配技术上限。中科曙光则采用浸没式液冷技术,单机柜可部署640张加速卡,其构建的十万卡算力集群已落地国家超算互联网郑州核心节点。百度智能云的天池超节点正从256卡向512卡演进,强调全栈自研,并已交付多个万卡集群。
另一批厂商则认为“越大未必越好”。阿里云推出的灵骏真武M890以64卡为一个Scale-up单元,再通过Scale-out网络扩展至更大集群,并将这种算力形态引入公共云,客户可按需调用。浪潮信息和沐曦也选择了类似方向,浪潮信息去年推出64卡超节点,今年再推32卡产品,沐曦则以单柜64卡为基础,强调CUDA生态兼容和横向扩展能力。
还有一些厂商试图跳出传统路径。清微智能采用可重构数据流架构,每颗芯片同时承担计算和数据转发,芯片之间可直连,无需交换机,已推出4096卡、峰值算力为500PFLOPS的超节点。东方算芯也于7月推出类似产品。摩尔线程计划年底伴随新一代GPU推出超节点产品,寒武纪虽未推出超节点,但业界预计其下一代芯片将涉足这一领域。
超节点为何在今年爆发?业内人士认为,模型训练和推理需求的激增是首要原因。训练端,模型参数量持续飙升,7月Kimi发布的K3模型参数达2.8万亿,业界预计未来将突破10万亿。推理端,AI Coding等场景中,任务触发的操作调用次数激增,复杂长程任务甚至达到百万次,这对超节点的大内存池提出了更高要求。从需求比例来看,线上推理与训练的比例已接近5:1至10:1,超节点在推理场景中的价值日益凸显。
经济性也是超节点受青睐的关键因素。虽然超节点的价格高于同等卡数的服务器,但其集约化设计降低了风火水电等基础设施成本。浪潮信息副总裁赵帅举例称,通过超节点,推理性能可提升10倍,而耗电仅提升2倍,整体收益显著。昆仑芯人士也表示,传统模式下10台机器的算力相加只能等于6,而超节点通过高速互联将损耗降至最低,让更多算力得以发挥。
超节点的批量交付能力也是推动其普及的重要因素。超节点是工程化产物,涉及GPU芯片、存储、通信、散热等多个环节,需要产业链上下游协同。目前,国内主要算力芯片和服务器企业已具备整机交付能力,超节点进入可批量落地阶段。
在超节点的应用场景上,企业们存在不同看法。华为人士认为,超节点在训练和推理中均有价值,尤其是万亿参数大模型训练和Agent推理场景。摩尔线程认为,超节点应面向1万亿至5万亿参数大模型训练及高速推理场景。沐曦人士则认为,超节点在推理的Decode阶段价值更为突出。清微智能陈逸伦分析称,目前超节点在训练侧多用于微调,推理性能更优。
尽管超节点前景广阔,但技术路线分歧仍存。首先是规模之争,企业分为“小节点派”和“大节点派”。“小节点派”认为64卡足够,再大则因通信延迟导致效率下降;“大节点派”则认为,进入Agent时代后,万亿参数和海量并发推理需要更大规模的超节点。其次是CUDA兼容之争,阿里平头哥、沐曦等走CUDA兼容路线,华为昇腾、昆仑芯等走自研生态路线。自研生态虽迁移成本高,但可控性和长期演进空间更大。
连接技术中铜缆与光纤的选择、液冷技术中风冷与浸没式液冷的争议,也反映了业界在不同技术商业选择中的矛盾与挑战。尽管存在分歧,但软硬架构协同已成为共识。超节点的演进与模型技术路线密切相关,国内模型架构的分化将影响超节点的硬件适配方向。
随着更多厂商具备整机交付能力,超节点市场的竞争愈发激烈。一位大厂人士表示,现在比拼的是能否批量交付、稳定运行并真正降低每Token成本。供应链成为更大挑战,无论是国产还是海外供应均存在不足,锁定供应链成为企业未来发展的关键。















