7月6日,腾讯低调推出混元Hy3正式版大模型。没有铺天盖地的宣传,也没有高调的发布会,这款旗舰模型以一种不同寻常的方式进入市场。然而,在开发者群体中,Hy3却引发了不小的关注。
上线仅三天,处于限时免费阶段的Hy3便跻身全球大模型API调用平台OpenRouter最受欢迎模型榜单第八位。接入腾讯办公智能体WorkBuddy后,其调用量迅速攀升,排队率一度超过50%,项目组不得不紧急增加算力资源。资本市场也迅速做出反应,腾讯股价在发布当天上涨4.82%。
过去两年,国内大模型领域竞争激烈。阿里、字节跳动不断加码模型研发、应用推广和算力基础设施建设,智谱、DeepSeek等AI公司也凭借爆款模型在市场上占据一席之地。相比之下,腾讯虽拥有微信、QQ等庞大用户群体和丰富的产业生态,却始终未能推出一款具有行业影响力的基础模型,甚至一度被外界质疑在AI技术竞赛中落后。
如今,腾讯用实际行动打破了质疑。引入前OpenAI研究员姚顺雨并重组混元研发体系后,腾讯近期又被曝吸纳其前同事田永龙。在模型研发之外,腾讯还参与了可灵最高30亿美元的融资,并传出洽谈成为AI智能体公司Manus最大股东的消息。从人才引进到模型研发,再到基础设施投资,腾讯正全面加大对AI领域的投入。
Hy3的推出,是腾讯在AI领域重新发力的一个重要信号。它虽然不足以证明腾讯已经追上所有对手,但至少表明腾讯已经重新获得了进入开发者主流候选清单的机会,并建立了一套能够将模型、产品和工程体系有效连接起来的研发方法。
从参数和公开榜单来看,Hy3并非一款“全能冠军”模型。在这一轮国产模型更新中,DeepSeek V4 Pro、智谱的GLM-5.2、MiniMax M3等模型都在争夺能力上限,有的将总参数推至万亿级,有的把上下文长度拉到100万Token。相比之下,Hy3总参数为2950亿,支持256K上下文,并未在每一项指标上追求极致。
然而,判断一个模型的真实水平,不能仅看参数和榜单排名。在具体任务中的能力边界和工程化落地能力,才是更关键的指标。在衡量软件工程能力的SWE-bench Verified测试中,Hy3获得78分,虽然落后于Claude Fable 5等闭源模型,也排在GLM-5.2和DeepSeek V4 Pro之后,但在难度更高的SWE-bench Pro测试中,Hy3以57.9分反超DeepSeek V4 Pro。在更接近真实执行环境的WildClawBench测试中,Hy3又超过GLM-5.1和DeepSeek V4 Pro,位居开放模型前列。
腾讯组织的270名专业人员盲测结果显示,Hy3整体表现优于GLM-5.1,尤其在前端开发、数据存储和持续集成等场景中表现突出。资深Agent从业者赵江杰认为,Hy3目前处于“整体能力第二梯队上沿、开放与低成本模型第一梯队”,在前端开发、常规代码、搜索浏览和工具调用等方面具备较强竞争力,但在高难度任务上尚未全面领先。
除了任务能力,Hy3在工程化落地和成本控制方面也表现出色。它采用MoE架构,总参数2950亿,但单次推理仅激活约210亿参数,在模型容量、运行速度和算力成本之间找到了平衡。对于企业而言,模型成本不仅取决于单次Token价格,还与推理开销、部署门槛等因素密切相关。Hy3的架构设计为其降低推理成本和部署难度奠定了基础。
稳定性同样是成本的重要组成部分。企业需要的不是模型偶尔表现惊艳,而是在多次连续调用中保持稳定。腾讯公布的数据显示,Hy3在不同Agent框架下运行SWE-bench Verified时,准确率波动被控制在4%以内;在内部场景中,幻觉率和多轮对话问题率也明显下降。
Hy3 Preview发布后,日均Token消耗增长20倍,WorkBuddy中主动选择该模型的用户增长6倍。正式版上线后,WorkBuddy算力消耗迅速达到上限,排队率一度超过50%,腾讯不得不紧急调度算力进行扩容。与此同时,腾讯还将Hy3接入元宝、CodeBuddy、ima和Marvis等产品,用于生成文档、制作表格、编辑文件、管理电脑和编排工作流。
Hy3的热度不仅限于腾讯体系内部。在OpenRouter 7月的编程模型使用量排名中,Hy3进入前四,与GLM-5.2、MiniMax M3和DeepSeek V4系列处于相近的调用梯队。不过,目前Hy3在OpenRouter处于限时免费阶段,WorkBuddy的调用增长也可能受到积分、限免和内部导流等因素的影响。真正的考验,将在免费期结束后到来。
对于腾讯而言,Hy3的推出只是第一步。过去两年,腾讯在AI领域的短板并非缺乏产品、场景或数据,而是缺乏将这些资源持续转化为模型进化能力的方法。最初的混元模型走的是“大而全”路线,先训练一款通用底模,再接入腾讯云和内部业务。这种方式虽然帮助腾讯迅速补课,但也让混元陷入同质化竞争,难以在开发者心中占据独特位置。
姚顺雨的加入和混元研发体系的重组,为腾讯带来了新的变化。腾讯不再急于训练参数更大的模型,而是先重做造模型的基础工程:重建预训练和强化学习系统,扩充和清洗数据,重新调整后训练流程。公开榜单不再作为唯一标准,真实产品反馈、人工盲测和内部任务开始进入评测体系。Hy3正是这套新方法下的首批成果。
腾讯总裁刘炽平曾表示,AI不会是一场只产生一个冠军的竞赛。未来,大量现有应用将推出自身智能体与智能体能力,不同模型也将竞争赢得智能体的采用。腾讯首席战略官詹姆斯·米切尔则将其描述为一条“性价比曲线”:未来成功的智能体,会根据不同任务的能力要求和成本约束,自主选择合适的模型;不同模型,则分布在这条曲线的不同位置。
按照这一判断,未来的AI市场将形成一个由模型、智能体、应用和基础设施共同组成的多层竞争格局。混元模型的角色,并非与对手拼胜负,而是成为腾讯AI生态的底盘。未来,混元不必包揽腾讯体系内的所有任务,也不必成为每一款产品的默认模型。高难度、低频任务可以调用能力更强的外部模型;高频、敏感、需要私有化部署或对成本要求更高的任务,则更多交给自研模型。
然而,拥有自研模型只是第一步。腾讯手里握有14亿微信月活入口、身份权限体系、小程序工具生态、支付与交易能力、企业微信里的组织流程,以及云基础设施等优势资源。但理论上的优势尚未直接转化为商业价值。真正的商业价值,取决于腾讯能够成功完成多少任务,这些任务本身有多大价值,调用成本有多高,以及执行失败可能带来多大风险。
赵江杰认为,腾讯AI战略真正需要补上的两块能力,一是连续多个版本保持前沿水平的模型能力,二是一个被用户高频采用、可信可控的微信原生Agent。只有当模型能够调动腾讯生态中的工具、服务和交易能力,微信的入口优势才会真正转化成AI时代的执行优势。















