当前,中国大模型领域呈现出一种独特现象:几乎每家头部企业都宣称自家模型为“中国第一”,甚至“全球前三”。阿里称其Qwen3.8-Max在第三方盲测中仅次于Claude;月之暗面宣称Kimi K3是全球最强开源模型;智谱表示GLM-5.2在Code Arena全球排名第一;DeepSeek宣称其模型在SWE-bench Verified测试中得分80.6%;字节跳动称豆包2.1在IMO金牌和HLE测试中全球领先;百度则强调文心5.0拥有10M上下文和中文写作第一的能力。
这些表述并非完全错误,但都存在片面性。它们共同的特点是,每个“第一”都附加了特定条件:参数规模最大、单项基准测试第一、特定盲测榜单第一、特定价格区间第一等。这种宣传方式与智能手机时代厂商宣称“跑分第一、拍照第一、续航第一”,以及新能源汽车领域宣称“续航第一、智驾第一、安全第一”的情况颇为相似。
相比之下,美国大模型行业已形成相对公认的竞争格局。不同阶段,OpenAI、Anthropic的Claude和Google的Gemini轮流领先。2026年年中,行业共识是Anthropic重新领跑,其Claude Fable 5在Artificial Analysis智能指数上以约60分排名第一,GPT-5.6 Sol以约59分紧随其后。这一共识由第三方评测机构、开发者社区和实际使用数据共同形成,无需依赖企业发布会。
中国尚未形成类似共识,并非缺乏答案,而是被企业宣传所掩盖。为探究真实情况,我们采用Artificial Analysis智能指数、Arena全球盲测和SuperCLUE中文测评三类权威第三方数据,进行交叉验证。
Artificial Analysis是国际开发者社区广泛引用的独立评测机构,其智能指数综合数学、推理、代码、知识等多维度测试,对全球189款模型进行统一排名。截至2026年8月初,中国主要模型成绩如下:月之暗面Kimi K3(Max)以57分排名第四,创开源权重模型历史最高纪录,超越Claude Opus 4.8(约56分),仅次于Claude Fable 5(约60分)、GPT-5.6 Sol(约59分)和谷歌一款旗舰模型;智谱GLM-5.2(Max)得51分,排名十名开外;DeepSeek V4 Flash 0731得50分,与谷歌Gemini 3.6 Flash持平;阿里Qwen3.8-Max尚未完成评测,其上一代Qwen3.7-Max得分为56.6分。
这表明,中国最强模型已接近全球第一梯队,Kimi K3与榜首差距仅3分,而一年前这一差距为两位数。同时,“官方宣称最强”与“第三方验证最强”存在差异,声称“仅次于Claude Fable 5”的Qwen3.8-Max,恰是头部模型中唯一缺乏第三方成绩的。
Arena盲测机制为人类匿名投票,两个模型回答同一问题,用户选择更优者,数百万投票转换为ELO积分,衡量“真人认为谁更好用”。2026年8月第33周榜单显示,在综合榜中,Anthropic的Claude系列包揽前五,国产模型中Qwen3.8-Max排名第八(ELO 1491),Kimi K3 Max排名第十二(1489),为仅有的两家进入前十五的中国模型,两者分差仅2分,基本并列,但Qwen3.8-Max位置更靠前。
在代码榜中,Kimi K3 Max排名第六(1544分),为排名最高的国产代码模型,Qwen3.8-Max排名第十三,小米Mimo排名第二十五。前端开发榜中,国产模型表现突出,Kimi K3 Max以1674分排名第二,仅落后榜首Claude Opus 5 Max(1692分)18分;Qwen3.8-Max排名第三(1667分);智谱GLM-5.2-Max排名第九;DeepSeek V4 Pro新入榜即排名第十。一个月前,Kimi K3曾以1679分短暂登顶该榜单,为国产模型首次在该实战榜单上获得全球第一。
智能体榜中,Kimi K3 Max以10.60%的净提升度排名第五,与Claude Opus系列同处全球第一梯队;Qwen3.8 Max新入榜排名第十一;GLM 5.2 Max排名第十四;DeepSeek V4 Flash排名第十九。综合来看,Kimi K3 Max为中国模型中覆盖面最广、排名最高的,代码第六、前端第二、智能体第五、综合第十二,无一项掉出前十五;Qwen3.8-Max为综合榜排名最高的国产模型,但在代码、智能体两个实战榜单上落后于Kimi。
SuperCLUE是中文场景下最具公信力的第三方基准之一。2026年7月榜单显示,12款国产主流模型综合总分排名为:Qwen3.8-Max、Kimi-K3、豆包Doubao-Seed-2.1-Pro与DeepSeek-V4-Flash。第一和第二分差很小,但顺序明确,Qwen3.8-Max在中文综合能力上排名第一,与Arena综合榜表现相互印证。值得注意的是,字节豆包2.1-Pro在中文综合测评中排名第三,是“五强”中唯一未参加Arena国际盲测的模型,其能力在国内榜单可见,但在国际坐标系中缺失。DeepSeek排名第四,其曾经的领跑者位置已被后来者取代。
编程专项上,SuperCLUE给出不同答案。GLM-5.2以64.13分断层领先,Kimi K2.7-Code得55.43分。智谱为典型“偏科生”,单项编程全球第一(在国际Code Arena和Design Arena上获得过第一),但综合能力未进入国内前四。
2026年夏天,五家企业密集发布前沿模型:6月中旬智谱GLM-5.2,7月16日Kimi K3,7月19日Qwen3.8-Max预览,7月27日Kimi K3开源,7月31日DeepSeek V4 Flash 0731,8月3日Qwen3.8-Max正式版。三个事实值得关注:百万token上下文已成为旗舰标配;2万亿参数级模型全部选择开源(MIT协议),为中国公司对全球开源社区的贡献,也是对美国闭源路线的差异化竞争;同为旗舰,输出价格相差50倍,Kimi K3输出定价100元/百万token,为DeepSeek V4 Flash的50倍。
综合三条证据链,2026年8月中国大模型五强真实位置如下:月之暗面Kimi K3为验证维度上的中国第一。7月16日发布,7月27日开源,2.8万亿参数、104B激活,为人类历史上参数规模最大的开源模型,也是全球首个原生支持文本、图像、音频、视频四模态的万亿级开源模型。其第三方成绩单最完整,AA智能指数57分(开源史上最高、全球第四、超过Claude Opus 4.8),Arena前端第二、代码第六、智能体第五,SuperCLUE中文第二。FireworksAI在1030个真实Agent任务上的实测显示,Kimi K3表现接近Claude Fable 5,成本约为其1/50。短板为价格昂贵。
阿里Qwen3.8-Max为中文综合与生态上的第一。2.4万亿参数、95B激活,8月3日正式版发布。为SuperCLUE中文综合第一、Arena综合榜国产最高(第八)。但其国际验证成绩单目前空白,AA智能指数未评测,官方基准全部来自阿里自己。其真正优势在于Qwen开源家族数年积累的全球下载量第一、衍生模型生态最厚。
深度求索DeepSeek V4为推理与性价比之王,但已被反超。2025年初,DeepSeek R1以极低训练成本逼近当时OpenAI顶级模型,在硅谷引发震动。此后一年半,DeepSeek节奏放缓,V4今年4月24日发布,中间四个月无重磅更新,7月31日的V4 Flash 0731和8月中旬的V4 Pro更新才重新回到竞争行列。其底子仍在,8月中旬一项对8款主流模型的独立横评(API实测)中,DeepSeek V4 Pro以9.1分排在所有国产模型之首,全场仅次于Claude Opus 4.8(9.20),推理单项9.5分超过GPT-5.6,“识别条件不足、知道何时不该下结论”的能力被评为全场最强;SWE-bench Verified约80.6%为国产模型中可查证的最高标准化跑分。V4 Flash(284B/13B激活)把输出价格压到2元/百万token,约为Claude Opus的1%,为Agent高频调用场景默认选项。但其AA智能指数为50分,综合排名已被Kimi K3(57)和Qwen3.8-Max甩开,从2025年全球领跑者变为2026年追赶者。
智谱GLM-5.2为编程特长生。约744B参数,MIT开源,基于华为昇腾训练。在Code Arena、Design Arena两个国际编程盲测榜上拿过全球第一,SuperCLUE编程专项断层领先。但综合能力(AA 51分、Arena智能体第十四)与第一梯队有明显差距,独立横评中其推理任务表现甚至出现过失误。
字节豆包2.1-Pro为用户规模第一,国际验证缺位。SuperCLUE中文综合第三,响应速度全场最快(首字延迟约380毫秒),背靠豆包App国内最大AI用户盘子。字节内部正在推进五万亿参数超大模型前期论证。但其缺席Arena国际盲测,AA指数也查无此模型,无法参与“全球坐标”排名。
中国大模型领域“人人第一”现象背后,是企业选择对自己最有利的坐标系进行宣传。阿里称“盲测仅次于Claude”,用的是Arena综合榜(第八,前面7个中有5个是Anthropic和谷歌模型,国产中确实最高);月之暗面称“全球最强开源”,用的是参数规模和AA指数(在开源类目中确实第一);智谱称“全球第一”,用的是Code Arena(编程单项确实第一过);DeepSeek称“SWE-bench 80.6%”,用的是单一标准化基准(确实可查证);字节称“金牌、全球领先”,用的是竞赛成绩和自建基准(HLE-Text 54.2分确实是该基准最高分,但样本极少)。
美国行业也存在营销,但受两股力量压制:一是Artificial Analysis、Arena等成熟第三方评测机构存在,其榜单被投资人和企业采购方当作决策依据,厂商无法回避;二是开发者社区舆论场,模型发布后几小时内就会在开源社区和社交媒体上被真实任务检验,名不副实的宣称难以存活48小时。中国评测基础设施(SuperCLUE、OpenCompass等)正在完善,但公关宣传音量仍大于榜单音量。
中国第一与世界第一差距目前为3分(AA指数57对60),但实际差距更大。Kimi K3超过的是Claude Opus 4.8,面对的Claude Fable 5、GPT-5.6 Sol以及Anthropic8月密集发布的多款opus-4系列新模型仍在快速迭代。Arena第33周榜单上,综合榜前五名全部是Anthropic模型,集中度体现差距。
但中国模型进步显著,从“落后一个身位”到“3分之差”仅用一年半。2025年初DeepSeek R1让全球首次正视中国模型,2026年年中Kimi K3成为全球前五中唯一非美国模型且开源。在开源领域,格局已反转,全球最强开源权重模型(Kimi K3)、下载量最大开源家族(Qwen)、生态最活跃开源社区均在中国。
这场追赶背后,算力是重要变量。GLM-5.2基于华为昇腾训练,为首个在国际榜单登顶的国产芯片训练模型;DeepSeek架构设计从V3开始以“单位算力产出最大化”为第一原则,用稀疏激活和算法优化压低成本;Kimi K3和Qwen3.8-Max的万亿级训练完成于国产算力占比持续提升的集群。在美国对高端GPU出口持续收紧背景下,中国大模型进步是在算力约束下取得,为效率创新产物,具有可持续、可复制性。
商业模式与生态差距也常被忽略。Anthropic与OpenAI领先不仅是模型分数,还有Claude Code、ChatGPT等被全球开发者高强度使用的终端产品形成的真实数据飞轮。中国模型在API与开源生态上进展快,但全球级别终端产品尚未出现,豆包用户盘子主要在国内,Kimi和Qwen海外用户以开发者为主。分数可三个月追平,产品与生态差距需更长时间弥补。















