腾讯近日宣布,其新一代AI大模型混元Hy3已正式上线。这款模型在智能水平上表现突出,不仅超越了同尺寸的竞品,甚至可与更大尺寸的旗舰开源模型相媲美。这一突破性进展,使得Hy3在各类产品和生产力任务中的应用价值大幅提升。
自preview版本发布以来,Hy3已经在腾讯多个业务场景中落地应用,包括WorkBuddy、CodeBuddy、元宝、Marvis和ima等。同时,其API也已在腾讯云TokenHub上线,并计划陆续接入多个海外平台。数据显示,自preview版本上线以来,Hy3的日均Token消耗量增长了20倍,这得益于全球开发者的广泛使用以及腾讯海量真实业务的验证。
Hy3在推理、智能体和长上下文处理等任务上取得了显著进步。这得益于其基于preview版本进一步优化了后训练数据的质量和多样性,并扩大了强化学习(RL)的算力规模。与国内外更大尺寸的旗舰模型相比,Hy3在参数规模仅为其20%至50%的情况下,实现了同等甚至更优的效果。
在生产力任务中,Hy3的表现尤为亮眼。无论是软件开发、办公生产、金融建模,还是前端设计和游戏制作,Hy3都能提供高性价比的解决方案。例如,在内部组织的盲测中,270位专家基于真实工作场景对Hy3和GLM5.1进行了评估。结果显示,Hy3的平均得分为2.67分(满分4分),优于GLM5.1的2.51分,尤其在前端、数据与存储、CI/CD等类别中优势明显。
具体应用案例包括:Hy3可以设计核聚变能源引擎的概念宣传网页,实现基于摄像头的手势交互控制图片粒子融解重组,通过多轮交互制作落日飞车游戏,以及在办公场景中从101个SKU销售数据中生成Excel建模分析和30页汇报PPT。Hy3还能将公司三个地区的数据用联动公式汇总成一张包含5000多个单元格的表格。
腾讯强调,模型的实用体验并不完全取决于榜单成绩。基于广泛的用户反馈和分析,Hy3在输出格式稳定性、工具调用效率和跨脚手架泛化性等方面进行了优化。例如,不同脚手架(如Codebuddy、Cline、KiloCode)在SWE Bench Verified上的分数标准差控制在4个百分点以内,确保了模型在各种工具设置和输出要求下达到生产级标准。
在知识常识和抗幻觉能力方面,Hy3通过细粒度的数据清洗和训练约束,显著降低了内生知识和外部幻觉问题。内部评测显示,Hy3的幻觉率从12.5%降至5.4%,常识错误率从25.4%降至12.7%,有效改善了“张冠李戴”、无中生有和逻辑矛盾等问题。
Hy3还优化了复杂上下文承接和多轮意图保持能力。通过在SFT与RL阶段联合优化指代消解、省略还原及多轮约束继承等业务痛点问题,内部评测的多轮问题率从17.4%降至7.9%。同时,Hy3在长对话理解基准中的表现显著提升,例如MRCR从42.9%升至75.1%,确保复杂意图在长程交互中不衰减、不跑偏。
为了推动AI技术的普惠应用,腾讯以Apache 2.0协议将Hy3在GitHub、HuggingFace、ModelScope和GitCode等平台开源。同时,通过软硬协同优化,腾讯降低了Hy3在腾讯云的API价格及在WorkBuddy等产品上的使用成本。目前,Hy3的API价格为:输入每百万Tokens 1元,输出4元,输入(命中缓存)0.25元。
资本市场对腾讯的这一进展给予了积极回应。今日,港股腾讯控股股价大涨4.82%,收盘报452港元/股,总市值超过4.1万亿港元。















