国产算力新突破!美团LongCat-2.0秘密训练三年,获开发者青睐

   发布时间:2026-07-14 22:00 作者:吴婷

在AI大模型领域,国产算力训练万亿参数规模模型一直面临诸多挑战。过去三年,虽有多个国产算力训练的基础模型问世,但真正被开发者大规模使用和检验的万亿规模模型却寥寥无几。不过,美团发布的LongCat-2.0(龙猫2.0)打破了这一局面,成为少数实现该目标的模型。

6月30日,美团正式推出新一代基础模型LongCat-2.0。技术博客显示,其完整训练与大规模部署均依赖国产算力集群。预训练在5万多张国产算力芯片上完成,使用超35万亿Tokens。LongCat-2.0是总参数量达1.6万亿的MoE(混合专家)语言模型,每个Token平均激活约480亿参数。在AI Coding(AI代码生成)和Agent(智能体)任务常用的几个基准测试中,其性能接近或超过Anthropic的Opus 4.6。Opus 4.6于2026年2月发布,是AI Coding和Agent领域的标杆,长程任务能力取得重大突破,可连续自动写两三个小时代码且几乎不出错,改变了过去基础模型执行复杂任务需随时人工干预的状态。在Coding和Agent能力方面,智谱GLM - 5.2等国产模型也达到甚至超过了Opus 4.6的水平,但LongCat-2.0的独特之处在于,它完全依赖国产算力,从第一个Token到最后一个Token都在国产算力上完成训练,验证了在国产算力平台上进行前沿级大规模模型训练的可行性。

LongCat-2.0是用2023下半年量产的某款主流国产AI芯片训练出来的,还未用到该公司2025 - 2026年量产的最新型号芯片。此前,用国产芯片训练基础模型被认为“可以干,但不经济”。2025年末,某模型创业公司技术负责人表示,用国产芯片训练模型,考虑适配和验证周期,训练周期至少是GPU的150%以上,算力成本高出一倍以上,后续适配成本更高,只能训练千亿、百亿参数的中小尺寸模型。国内科技公司普遍用国产芯片做推理,用英伟达GPU做训练,常用万亿参数模型多由英伟达芯片训练,预训练先用H100/H800,再用国产算力复现。LongCat-2.0的进展提供了另一种可能。

LongCat团队并非聚光灯下的明星团队,工作高度保密。其探索可追溯到2023年,当时美团决定训练基础模型,内部讨论是用英伟达芯片还是国产芯片,最终在2023年7月决定用国产算力训练模型,此后三年秘密进行训练。这条路艰难且高风险,2023 - 2025年主流观点认为国产芯片难以做训练。不过,LongCat-2.0经历了三个里程碑:2024年春节前后,第一次端到端跑通国产芯片训练,Loss数值和主流芯片接近,验证了可行性;2024下半年,用1.6万卡训练出4500亿参数的MoE模型,达到同等参数规模模型的SOTA水平,但未开源;2025年9月,LongCat - Flash训练完成并开源,参数规模5600亿,虽技术报告未披露使用国产芯片训练,但让团队有信心继续坚持。经过三个阶段技术积累,LongCat - 2.0训练目标更明确,在算力资源、研发时间分配中,预训练和后训练比例约为1:1,人力层面预训练和后训练比例大概为1:2,后训练中约80%围绕Agent能力建设开展。预训练阶段加入代码仓库级数据,逐步提高代码和推理数据比例,扩展上下文长度;后训练阶段投入真实Agent环境反复训练,参考多个教师模型经验改进行为。

训练大模型本质是做海量矩阵乘法,万亿参数基础模型训练要执行超10²⁶次浮点运算,需将模型参数、训练数据和计算过程拆分到几万张芯片并行计算,国产芯片面临诸多技术问题。一是国产芯片单卡显存更小,通信带宽更紧张,训练时芯片间数据交换速度慢,效率下降;二是算子要重新适配优化或重写,英伟达CUDA生态算子高度优化,国产芯片需保证训练出的Loss曲线和英伟达CUDA平台一致,避免精度偏差。LongCat团队认为硬件计算精度没问题就不存在理论障碍,后续靠人、时间解决工程细节问题。他们过去三年打磨了国产算力用于模型训练的机制、流程和方法论,包括精度验证方法、算子开发优化方案等,说明大模型训练工程是科学,硬件短板可通过工程优化代偿,但要付出更多时间和人力成本。

美团披露,LongCat - 2.0训练中遇到国产芯片显存不足、33条通信Bug、57条算子问题等挑战。为解决显存问题,LongCat团队在主流五种并行计算策略外新增EMBP策略,还采取减少重复存储、计算等方式降低显存占用;为解决通信问题,利用超节点架构优势,让预训练吞吐提升约30%;算子方面,重新开发关键算子,采用二叉树分段累加方法减少浮点误差累积,以严格高精度基线为对照验证计算精度,加入比特翻转检测及时发现数值异常。训练问题无法靠一家公司解决,美团与国产算力厂商采取模芯协同方式,双方联合技术攻关,国产算力厂商还和美团等公司优化训练框架和开发工具,自研架构兼容主流框架,推动国产算子等生态完善。

训练出模型后,LongCat - 2.0部署在国产算力上。Agent任务中大量输入是重复历史上下文,LongCat团队优化思路是让这些代码和上下文复用,优先保留Agent任务缓存,淘汰复用价值低的缓存。其线上缓存命中率长期在95%以上,高于业内平均水平,说明部署在国产算力中能达到较高缓存命中率。

模型发布是起点,被开发者真实使用才决定未来竞争力。LongCat - 2.0发布后,第一批开发者出现在GitHub。截至7月8日,在GitHub至少新增132个Issue、92个PR,表明开发者开始反馈问题、讨论功能并提交代码参与完善。开发者关注API兼容细节、部署与推理框架适配、计费和缓存价格等问题。LongCat - 2.0吸引开发者接入的重要原因是100万上下文长度、128K输出长度、可开关思考模式、主流Harness下稳定任务表现等。社区早期反馈显示,其企业级大规模部署曾出现不能“开箱即用”的问题,但随着开发者反馈会慢慢解决。LongCat相关人士表示,LongCat - 2.0以开源为核心策略,有专门开源生态团队,未来会在技术分享等层面持续投入。LongCat - 2.0预览版曾以“Owl Alpha”代号匿名登录全球模型聚合平台OpenRouter,截至6月末Token总调用量一度跻身全球前三,在一些Agent工具中受开发者欢迎。

为观察LongCat - 2.0真实表现,通过OpenCode开源Agent工具,对LongCat - 2.0与几款全球流行基础模型进行体验测试。测试使用日常研究真实任务,统计14家模型公司7月1 - 7日在GitHub的开发者生态热度并生成HTML网页报告,每款模型使用相同提示词连续执行三次,统计结果与使用Codex反复统计校验并剔除误差的数据对比衡量准确率。体验测试中,LongCat - 2.0能应对日常办公任务,数据统计准确率、网页设计能力表现稳定,对Token消耗量控制出色,三个任务缓存命中率总体在92%以上,连续工作55分钟缓存命中率提升至95.8%。目前知识工作者、软件工程师日均Token消耗量大,用户关注Token用量和成本问题。LongCat - 2.0的Token Plan采用新计费方式,套餐只对缓存未命中Token计费,缓存命中Token不计入套餐消耗,长期使用Token成本相对更低。

用国产算力训练模型,从0 - 1的万亿规模突破是里程碑,但长期挑战在于能否被稳定、低成本且长期使用。过去三年,用国产算力训练的万亿规模模型未被开发者大规模使用和检验,LongCat - 2.0首次实现该目标,不仅证明国产算力集群可支撑万亿参数模型训练,还证明国产芯片训练的模型能得到全球开发者日常使用。三年训推过程中,LongCat团队加深了对模型、芯片技术细节的理解。他们下一步规划是将推理优化和规模化部署经验反哺开源社区,增强开源社区对国产算力推理的信心,吸引更多开发者参与生态建设。中国AI产业呈现“涌现式”创新能力,随着LongCat - 2.0后续开源模型权重和训练过程,未来更多基于国产芯片训练的万亿级基础模型将不断涌现。LongCat - 2.0对美团也很重要,在新一轮AI浪潮竞争中,训练自己的模型是进入竞争的入场券,LongCat - 2.0让美团上了牌桌。

 
 
更多>同类内容
全站最新
热门内容
本栏最新