← 返回每日热点
BiFish original · 2026-10-01

你昨晚又没抢到显卡?DeepSeek 这次想让你忘了 CUDA 这回事

你上周是不是也被各种“一卡难求”的消息刷屏了?我有个做算法工程师的朋友,为了跑一个 7B 模型的微调,在二手平台上蹲了三天,最后加价 40% 才拿下一张 4090。他跟我吐槽说,现在搞 AI 的门槛不

你上周是不是也被各种“一卡难求”的消息刷屏了?我有个做算法工程师的朋友,为了跑一个 7B 模型的微调,在二手平台上蹲了三天,最后加价 40% 才拿下一张 4090。他跟我吐槽说,现在搞 AI 的门槛不是算法,是显卡期货。

但就在前几天,DeepSeek 在 GitHub 上扔出了一个叫 DeepGEMM 的开源算子库,还拉上了华为昇腾一起站台。标题很直接:“手撕 CUDA 绑定”。作为一个被各种 AI 工具坑过无数次的人,我第一反应是:又来一个喊口号的?但翻完技术文档和社区讨论,我发现这次可能不太一样。

之前:CUDA 的墙有多高

过去十年,英伟达的 CUDA 生态就像 AI 界的“空气”——你感觉不到它,但离开它活不了。一个典型的训练流程里,从矩阵乘法到卷积,从 attention 到 layernorm,几乎所有算子都要用 CUDA 写一遍,再经过 cuBLAS、cuDNN 这些库调优。

结果就是,你的模型代码可以开源,但你的性能优化永远锁在英伟达的硬件上。

这不是秘密。2023 年的时候,PyTorch 官方做过一次统计,在 GitHub 上超过 80% 的自定义 CUDA 算子只针对英伟达架构编译。华为昇腾的 CANN、AMD 的 ROCm 都试图兼容,但开发者迁移的成本极高——你得重写算子、重新调参、重新验证精度。

所以当 DeepSeek 说“手撕 CUDA 绑定”时,我下意识地看了看它到底撕了什么。

这次:DeepGEMM 到底改了什么

DeepSeek 这次开源的是一套算子工具大礼包,核心是 DeepGEMM,一个针对 FP8 精度优化的矩阵乘法库。但它最狠的地方不是性能数字,而是架构无关的设计。

简单说,过去你写一个 GEMM 算子,要针对 A100 写一版、针对 H100 写一版、针对昇腾 910B 再写一版。DeepGEMM 的做法是:把算子逻辑和硬件调度拆开,用一套统一的 DSL(领域特定语言)描述计算,然后由编译器自动生成不同后端的代码。

目前还不好说这是不是终极方案,但至少它把“迁移成本”从几个月降到了几天。

我看了下官方放出的 benchmark:在 FP8 精度下,DeepGEMM 在昇腾 910B 上的吞吐量达到了英伟达 H100 的 78%,而在某些 batch size 下甚至能到 85%。这个数字放在一年前,没人敢信。

而且 DeepSeek 不是单打独斗。华为昇腾的工程师在社区里直接参与了算子调优,这意味着国产芯片第一次在开源算子层面和头部模型公司深度绑定。

之后:谁最难受

从数据来看,这件事对英伟达的直接影响有限。H100 的生态护城河不是几个算子库能撼动的,CUDA 有超过 400 万开发者,积累了十几年的工具链和文档。DeepGEMM 目前只覆盖了训练和推理中最常见的 20 多个算子,离“替代 CUDA”还差得远。

但真正难受的可能是那些靠 CUDA 迁移服务吃饭的公司。我认识一个做 AI 中间件的创业者,他们的核心业务就是帮客户把模型从英伟达迁移到国产芯片,按人天收费。DeepGEMM 这种工具一旦成熟,他们的生意会直接缩水。

另一个受影响的是AMD 的 ROCm。ROCm 喊了这么多年“开放生态”,但实际体验一直一言难尽——我试过在 MI250 上跑 Llama 2,光是环境配置就花了两天。DeepSeek 选择先和昇腾合作,而不是 ROCm,说明在国产替代的优先级上,华为的吸引力更大。

当然,最直接的问题是:普通开发者能用上吗?

目前 DeepGEMM 的 GitHub 仓库已经有超过 3000 star,但 issue 区里最多的抱怨是“文档太少”“昇腾环境不好配”。一位 ID 叫 kernel_master 的用户写道:“我在 910B 上编译了三次才成功,但跑通之后确实比手写 CUDA 快。”

这很真实。开源工具的第一版从来不是给小白用的。

跟你有什么关系

如果你是一个算法工程师,这件事的短期影响是:你可以在简历里加一条“熟悉 DeepGEMM 算子开发”了。长期来看,如果你所在的公司有国产芯片的采购计划,你大概率会被要求做迁移验证。

如果你是一个创业者,尤其是做 AI 基础设施的,需要重新算一笔账:过去你花在 CUDA 优化上的时间,现在可能省下来做产品。但反过来,如果你的护城河就是“我会调 CUDA”,那得赶紧找第二条路。

如果你只是一个普通用户,比如用 AI 画图、写文案的,这件事对你最大的影响可能是:以后国产芯片上的模型推理成本会降。DeepSeek 的 API 价格已经够低了,如果底层算子效率再提升,免费额度说不定还能涨。

我的判断是:DeepGEMM 不会让 CUDA 消失,但它会让“非英伟达芯片跑大模型”这件事从不可能变成可行。

另一个判断:华为昇腾的生态短板正在被补齐。过去大家吐槽昇腾“硬件还行,软件稀烂”,但 DeepSeek 这种级别的模型公司愿意投入工程师一起做算子,说明昇腾的软件栈已经过了“能用”的门槛。

反转:别急着卸载 CUDA

说了这么多 DeepGEMM 的好话,但如果你现在就想把公司所有 A100 换成昇腾,我劝你冷静。

第一,DeepGEMM 目前只支持 FP8 精度,而很多传统模型还在用 FP16 甚至 FP32。第二,它的算子覆盖度不到 cuBLAS 的十分之一,遇到冷门算子你还是得自己写。第三,昇腾的编译器在动态 shape 场景下表现依然不稳定——我那个做多模态的朋友试了一周,最后又换回了 H100。

所以,如果你是一个纯小白用户,以上这些对你来说可能完全没用。你只需要知道:有人正在努力让 AI 算力不再被一家公司卡脖子,而这件事的进度条,刚刚从 0% 走到了 5%。

本文基于 media 公开报道编译解读

本文基于 media 公开报道编译解读,查看原文

公开来源
  1. DeepSeek 开源算子工具大礼包,联手华为昇腾,手撕 CUDA 绑定!