← 返回每日热点
BiFish original · 2026-10-05

中美AI差距只剩3%?我扒了扒DeepSeek V4.1 Flash的底裤

你上周是不是也被各种「中美AI差距只剩3%」的标题刷屏了? 说实话,作为一个被各种AI工具坑过无数次的人,我第一反应是:又来了,又是跑分神话。但这次彭博行业研究甩出来的数据,还真让我没法直接划走。

你上周是不是也被各种「中美AI差距只剩3%」的标题刷屏了?

说实话,作为一个被各种AI工具坑过无数次的人,我第一反应是:又来了,又是跑分神话。但这次彭博行业研究甩出来的数据,还真让我没法直接划走。

一、3%到底是个啥概念

先把这个数字拆开看。彭博行业研究的高级分析师罗伯特·利亚在报告里写得清楚:DeepSeek 9月发布V4.1 Flash之后,中国顶尖模型在LiveBench基准测试上的得分,只落后美国最强模型3%。

3%是什么水平?我给你换算一下。

今年5月的时候,这个差距还是9%左右。再往前推到今年早些时候,是15%。也就是说,短短几个月,差距从15%一路砍到3%,差不多是每个月抹掉2到3个百分点。

具体到分数:DeepSeek V4.1 Flash在LiveBench上拿了81.1分,Anthropic最高的模型是83.4分。2.3分的差距,落在百分比上就是3%左右。

有个细节很有意思,LiveBench这个榜单的评分机制,是让AI去回答问题、解谜题、做任务,然后根据回答质量打分,号称「像测人类智商一样测AI」。V4.1 Flash这次排到了全球第六,是自打2025年DeepSeek靠R1推理模型出圈以来,中国模型拿到的最高名次。

跑分接近不等于体验接近,但跑分差距快速收窄,说明技术底子的差距在实质性缩小。

二、跟同类比,到底谁更强

那问题来了:81.1分对83.4分,是不是意味着DeepSeek已经跟Anthropic、OpenAI平起平坐了?

利亚的说法是,DeepSeek的表现已经「可以与Anthropic、OpenAI的领先AI系统相媲美」。注意他用的是「相媲美」,不是「超越」。

咱们得看另一个数据。虽然分差只有3%,但LiveBench排出来的前15个模型里,只有3个来自中国。这个比例才是真正扎心的地方。

简单讲就是:尖子生追上来了,但整体厚度还差得远。美国那边是前十名里塞满了自家模型,中国这边是偶尔冒出一个能打的,后面梯队还没完全跟上。

技术上来说,这跟中国实验室的打法有关系。彭博的报道点了一件事:中国模型的进步,很大程度得益于研究人员针对国产硬件做优化的能力。这句话翻译一下就是——你英伟达高端卡不是不卖给我吗?那我就在能拿到的硬件上把模型效率榨到极致。

这条路走得通,而且走得挺快。但它的天花板也明显:单点突破容易,全面铺开难。

三、这事跟你有什么关系

你可能会说:我又不搞AI研究,这3%跟我有啥关系?

关系大了。

如果你是个开发者,或者哪怕只是个重度AI工具用户,接下来几个月你大概率会看到两个变化。

第一,API价格还得降。中国模型追得越紧,OpenAI和Anthropic的定价压力就越大。过去一年Claude和GPT系列已经降过好几轮了,这个趋势不会停。

第二,中文场景的体验会明显变好。美国模型再强,中文语料和本地化场景一直是短板。DeepSeek这类中国模型把分数追上来的同时,中文理解、本土知识这些维度本来就是主场优势。

举个实际场景:你拿AI写一份中文商业合同,或者让它分析一份A股上市公司的财报。以前你可能得在GPT和国产模型之间来回切换,以后可能一个国产模型就搞定了。

对普通用户来说,模型排行榜上那3%的差距,远不如「哪个工具更懂我的需求」来得实在。

四、美国那边慌不慌

慌。

彭博这篇报道的措辞已经很直白了,说中国AI的崛起「让美国的科技主导地位面临威胁」,还专门提了一句:这些进展让人们开始质疑美国限制技术出口的做法是否有效。

这句话才是整篇报告里最狠的。

美国过去几年的逻辑是:卡住高端芯片,就能卡住中国AI的脖子。结果DeepSeek们在国产硬件上做优化,把模型效率提上来了,分数差距反而越缩越小。这就好比你把人家的跑车轮胎扎了,结果人家骑自行车抄近道,先到终点了。

当然,利亚也留了余地。他提醒说,这类排名会不断变化,而且无论模型在排行榜上排第几,变现都可能很困难。这话说得挺实在。跑分高不等于赚钱多,中国AI实验室在商业化这块,跟OpenAI比还有不小的距离。

但趋势已经摆在这儿了。3%的差距,放在一年前没人敢想。

如果你正好在选AI编程工具或者写作助手,这周可以先把DeepSeek的免费版装上试试。别光看跑分,自己上手用两个真实任务测一测,比什么榜单都靠谱。

毕竟,作为一个被各种AI工具坑过无数次的人,我现在的原则是:谁好用用谁,管它来自哪儿。

本文基于 media 公开报道编译解读

本文基于 media 公开报道编译解读,查看原文

公开来源
  1. DeepSeek V4.1 Flash 发力,中美顶尖模型 LiveBench 跑分差距缩至 3%