← 返回博主原创
BiFish original · 2026-08-16

国产大模型 8月榜单深度解读:普通人该怎么选

综合总分——千问Qwen3.8-Max 71.48分排第一,Kimi-K3 70.68分第二,豆包Doubao-Seed-2.1-pro 65.95分第三,DeepSeek-V4-Flash 65.6

8月6日,SuperCLUE放出2026年7月中文大模型完整测评榜,12款国产主流模型同台。结果和半年前完全不一样:

综合总分——千问Qwen3.8-Max 71.48分排第一,Kimi-K3 70.68分第二,豆包Doubao-Seed-2.1-pro 65.95分第三,DeepSeek-V4-Flash 65.60分第四,DeepSeek-V4-Pro 64.40分第五。

这是DeepSeek第一次掉出国产前三。而前两名咬得极紧——千问71.48、Kimi70.68,只差0.8分,豆包和DeepSeek也都卡在65分出头,五强之间最大差距也就7分。换句话说,这已经不是"谁碾压谁"的榜,而是"各擅胜场"的榜。

分数看着只差零点几,但在这组数字背后,是评测规则的改写、各家长短板的彻底分化,还有价格上的一道巨大鸿沟。这篇文章把榜一层层拆开,最后给你一张"普通人到底该用哪一个"的速查表。

01

一、评测规则改了,所以排名才大变

往年看的是"代码生成、写文章"这类单点能力。这次SuperCLUE把传统代码生成升级成了"智能体编程",权重直接给到25%,是六大维度里最高的一项;剩下五项分别是数学推理18%、科学推理16%、精确指令遵循16%、幻觉控制16%、智能体任务规划9%。

翻译成大白话:评测从"你会不会做题",变成了"你能不能当一个能自己干活的小员工"。会写一段代码不算本事,能多轮对接、自己拆解任务、调工具把事干完才算数。

这一改,擅长"长程工程代码"的模型吃了分,纯刷分型的掉了队。举个例子:旧版评测让你写一段排序算法,给分;新版是给你一个需求文档,要求模型自己读文档、拆任务、调接口、跑测试、修报错,全程多轮自己兜。能跑通的,才是高分。所以DeepSeek综合掉到第四,不是它变弱了,是新规则不站在它最舒服的位置上。千问和Kimi能冲到前二,恰恰是因为它们在这套"当员工"的权重里更顺手。

这条变化对普通人的意义是:现在的主流模型,比的是"能不能帮你把活干完",不是"能不能聊两句"。你挑模型,也得按这个思路来。

02

二、综合分背后,各家长短板差得离谱

光看总分最容易被骗。把六个细分维度拉出来看:

1

数学推理:DeepSeek-V4-Flash 78.95分,全场第一

2

科学推理:豆包 77.19分,第一

3

智能体编程:Kimi-K3 75.79分,第一;千问68.42分第二

4

幻觉控制 + 任务规划:千问断层领先,任务规划单项拿到90.94分

翻译成人话就是:

5

你要算账、做数、推逻辑,DeepSeek最稳;

6

你问科学类、查资料,豆包更准;

7

你是真要写工程代码、搞多轮开发,Kimi体验最好;

8

你怕AI编瞎话、要它把复杂任务拆明白,千问最让人放心。

所谓"第一",只是在这套权重下综合最高,不等于它样样都强。没有任何一个模型是全能。

03

三、速度这道坎,榜上没写但你必须知道

SuperCLUE还有一套标准是推理速度和性价比。结果很扎心:

DeepSeek-V4全系列、GLM、Hy3属于高效能区,算得快、等得短;而总分前两名的千问和Kimi,单次运算等待时间很长,Kimi的耗时甚至是最快模型的3倍。

这意味着什么?你用千问或Kimi写个短文案,可能要多等几秒才出;如果你做的是批量任务、要跑几百上千次,时间成本直接翻几倍。DeepSeek、GLM这类"快且便宜"的模型,更适合高频调用和规模化使用。

04

四、最狠的差距在价格:同一件事,成本能差50倍

榜上看不出钱,但钱才是普通人最该关心的。下面是2026年8月几家主流API的官方公示价(单位:元/百万tokens,输入/输出):

1

DeepSeek V4-Flash:输入1 / 输出2(高峰时段2倍)

2

豆包 1.5 Pro:输入0.8 / 输出2

3

通义 Qwen3.5 Flash:输入0.2 / 输出2

4

Kimi K3:输入20(缓存命中2)/ 输出100

5

通义 Qwen3.7-Max:输入12 / 输出36

6

GLM-5.2:输入约10 / 输出约31.7

7

豆包 Seed:输入6 / 输出30

看最刺眼的一组:Kimi K3的输出价100元/百万tokens,是DeepSeek V4-Flash(2元)的50倍。

你让AI写同样一万字的内容,用DeepSeek花几毛钱,用Kimi可能要一块多——量一大,差距就是几十上百块。预算有限、又要批量产出的人,这一栏直接决定你每月多掏多少。

算笔具体的账:假设一个做自媒体的小团队,每天让AI生成约3万字文案,一个月就是90万字,约等于90万tokens的输出量。同样这90万tokens,DeepSeek V4-Flash按2元/百万算,花费约1.8元;Kimi K3按100元/百万算,花费约90元。一个月差出88块,一年就是一千多。这还没算输入和缓存命中的优惠。对个人可能无所谓,对靠AI干活的团队,这就是实打实的利润。

05

五、开源还是闭源,普通人也得看一眼

这次上榜的头部里,千问、Kimi、DeepSeek都是开源模型,豆包是闭源。这跟你有啥关系?

开源意味着你可以把它部署到自己电脑或公司内网,数据不出门,还能免费用社区优化版;闭源则数据和算力都在厂商手里,省心但受限于它的定价和规则。如果你处理的是敏感资料、或者想长期免费用某个模型的"免费版",开源模型腾挪空间更大。普通个人用户感受不明显,但一旦你往"拿AI干活赚钱"那条路上走,这点早晚要算。

一个有意思的信号:在这一轮国产开源浪潮里,中国开源模型的全球下载量已经占到41%,排世界第一。换句话说,你今天能免费用上的千问、DeepSeek、Kimi,背后是一整条正在变便宜、变开放的基础设施——这对普通人长期是好事,因为"免费且能自托管"的选项只会越来越多,厂商想靠封闭收费卡你脖子的空间在缩小。

06

六、普通人到底怎么选?一张速查表

别追"第一名",追你的场景:

你的主要用途首选模型为什么
日常办公、写文案、怕AI乱编千问Qwen3.8-Max幻觉控制+任务规划断层第一,综合最高
算数、推逻辑、做数据分析DeepSeek-V4-Flash数学推理78.95第一,价格最低档
真写工程代码、多轮开发Kimi-K3智能体编程75.79第一
查科学资料、知识问答豆包科学推理77.19第一
批量调用、怕贵怕慢DeepSeek / 豆包1.5 Pro高效能区+白菜价
完全免费入门豆包、DeepSeek网页版基础功能轻量用户仍免费

一句话框架:先想清楚你每天拿AI干什么,再对着上表选,别被综合分带着走。

07

七、为什么DeepSeek掉到第四,我仍把它放批量首选

这里有个反直觉的点,必须单独说。

综合分上DeepSeek排第四,但看"性价比"它还是最香的那个。原因就藏在上面的价格和速度两栏里:V4-Flash输出2元/百万tokens,是榜单里最便宜的档位之一;同时它处在高效能区,算得快。数学推理还拿了78.95的全场第一。

翻译成你的账本:同样让AI干一万字的批量活,DeepSeek花几毛、等得短、算得准;Kimi花一块多、还得等三倍时间。对"拿AI干活"的人来说,综合分差那零点几,远没有"每百万tokens便宜98%、速度快三倍"来得实在。

所以选模型不能只看一张总分榜,得把它拆成"能力分"和"成本分"两张表,再对号入座你的用法。这也是为什么速查表里,DeepSeek同时出现在"算数"和"批量调用"两行——它不是全能冠军,但在它擅长的那几格,性价比没有对手。

08

八、普通人最常问的三个问题

Q1:免费版够用吗? 轻量用户(偶尔问问、写写短文)够。豆包和DeepSeek的网页基础功能对个人仍免费。但凡你要高清出图、批量生成、长文、去水印,就得出付费档。免费是"能打开",不是"能干正经活"。

Q2:是不是综合分第一就闭眼选? 不是。千问总分第一,但它在速度和部分价格档上不占优;Kimi编程强但贵且慢。先定场景,再看那一项的细分分,比看总分靠谱。

Q3:模型更新这么快,要不要每次追新? 没必要。榜单每月一变,但对你日常有用的那两三个能力(比如"不乱编""算得准""写得快")是稳定的。锁定适合你场景的那一个,用到它明显不够用再说,别被版本号带着跑。

09

九、三个坑,普通人最容易踩

1

只看综合分。 综合分是权重算出来的,权重一变排名就变。看你的场景维度,比看总分有用十倍。

2

把"免费"当真免费。 豆包、DeepSeek网页基础功能对个人仍免费,但高清、批量、长文、去水印全在付费档。真要量产内容,迟早付费。

3

忽略峰谷计费。 DeepSeek官方工作日9-12点、14-18点价格按2倍执行,半夜调反而便宜。批量任务排到凌晨,成本能砍一半。

10

防骗带过(一句实话)

榜单是各家送测版本跑出来的,不等于你手机里那个APP的真实表现;厂商排名有营销成分,别信"某某第一所以闭眼冲"。本篇只讲已公开的评测分数和官方标价,不荐具体付费课、不保证收益。

11

看完想想

你平时主要拿AI干啥?现在用的那个,是上表里对应场景的首选吗?留言说说你的用法,我下篇可以按场景拆更细的对比。觉得有用,转发给也在纠结"到底该用哪个"的朋友。


*数据口径:综合分与细分维度来自SuperCLUE 2026年8月6日发布的7月中文大模型榜(12款国产模型);API价格为各平台2026年8月官方公示价,不含限时促销。分数是送测版本结果,实际体验以你自用的版本为准。*