你昨晚又没抢到显卡?DeepSeek 这次想让你忘了 CUDA 这回事
你上周是不是也被各种“一卡难求”的消息刷屏了?我有个做算法工程师的朋友,为了跑一个 7B 模型的微调,在二手平台上蹲了三天,最后加价 40% 才拿下一张 4090。他跟我吐槽说,现在搞 AI 的门槛不
你上周是不是也被各种“一卡难求”的消息刷屏了?我有个做算法工程师的朋友,为了跑一个 7B 模型的微调,在二手平台上蹲了三天,最后加价 40% 才拿下一张 4090。他跟我吐槽说,现在搞 AI 的门槛不是算法,是显卡期货。
但就在前几天,DeepSeek 在 GitHub 上扔出了一个叫 DeepGEMM 的开源算子库,还拉上了华为昇腾一起站台。标题很直接:“手撕 CUDA 绑定”。作为一个被各种 AI 工具坑过无数次的人,我第一反应是:又来一个喊口号的?但翻完技术文档和社区讨论,我发现这次可能不太一样。
之前:CUDA 的墙有多高
过去十年,英伟达的 CUDA 生态就像 AI 界的“空气”——你感觉不到它,但离开它活不了。一个典型的训练流程里,从矩阵乘法到卷积,从 attention 到 layernorm,几乎所有算子都要用 CUDA 写一遍,再经过 cuBLAS、cuDNN 这些库调优。
结果就是,你的模型代码可以开源,但你的性能优化永远锁在英伟达的硬件上。
这不是秘密。2023 年的时候,PyTorch 官方做过一次统计,在 GitHub 上超过 80% 的自定义 CUDA 算子只针对英伟达架构编译。华为昇腾的 CANN、AMD 的 ROCm 都试图兼容,但开发者迁移的成本极高——你得重写算子、重新调参、重新验证精度。
所以当 DeepSeek 说“手撕 CUDA 绑定”时,我下意识地看了看它到底撕了什么。
这次:DeepGEMM 到底改了什么
DeepSeek 这次开源的是一套算子工具大礼包,核心是 DeepGEMM,一个针对 FP8 精度优化的矩阵乘法库。但它最狠的地方不是性能数字,而是架构无关的设计。
简单说,过去你写一个 GEMM 算子,要针对 A100 写一版、针对 H100 写一版、针对昇腾 910B 再写一版。DeepGEMM 的做法是:把算子逻辑和硬件调度拆开,用一套统一的 DSL(领域特定语言)描述计算,然后由编译器自动生成不同后端的代码。
目前还不好说这是不是终极方案,但至少它把“迁移成本”从几个月降到了几天。

我看了下官方放出的 benchmark:在 FP8 精度下,DeepGEMM 在昇腾 910B 上的吞吐量达到了英伟达 H100 的 78%,而在某些 batch size 下甚至能到 85%。这个数字放在一年前,没人敢信。
而且 DeepSeek 不是单打独斗。华为昇腾的工程师在社区里直接参与了算子调优,这意味着国产芯片第一次在开源算子层面和头部模型公司深度绑定。
之后:谁最难受
从数据来看,这件事对英伟达的直接影响有限。H100 的生态护城河不是几个算子库能撼动的,CUDA 有超过 400 万开发者,积累了十几年的工具链和文档。DeepGEMM 目前只覆盖了训练和推理中最常见的 20 多个算子,离“替代 CUDA”还差得远。
但真正难受的可能是那些靠 CUDA 迁移服务吃饭的公司。我认识一个做 AI 中间件的创业者,他们的核心业务就是帮客户把模型从英伟达迁移到国产芯片,按人天收费。DeepGEMM 这种工具一旦成熟,他们的生意会直接缩水。
另一个受影响的是AMD 的 ROCm。ROCm 喊了这么多年“开放生态”,但实际体验一直一言难尽——我试过在 MI250 上跑 Llama 2,光是环境配置就花了两天。DeepSeek 选择先和昇腾合作,而不是 ROCm,说明在国产替代的优先级上,华为的吸引力更大。
当然,最直接的问题是:普通开发者能用上吗?
目前 DeepGEMM 的 GitHub 仓库已经有超过 3000 star,但 issue 区里最多的抱怨是“文档太少”“昇腾环境不好配”。一位 ID 叫 kernel_master 的用户写道:“我在 910B 上编译了三次才成功,但跑通之后确实比手写 CUDA 快。”
这很真实。开源工具的第一版从来不是给小白用的。

跟你有什么关系
如果你是一个算法工程师,这件事的短期影响是:你可以在简历里加一条“熟悉 DeepGEMM 算子开发”了。长期来看,如果你所在的公司有国产芯片的采购计划,你大概率会被要求做迁移验证。
如果你是一个创业者,尤其是做 AI 基础设施的,需要重新算一笔账:过去你花在 CUDA 优化上的时间,现在可能省下来做产品。但反过来,如果你的护城河就是“我会调 CUDA”,那得赶紧找第二条路。
如果你只是一个普通用户,比如用 AI 画图、写文案的,这件事对你最大的影响可能是:以后国产芯片上的模型推理成本会降。DeepSeek 的 API 价格已经够低了,如果底层算子效率再提升,免费额度说不定还能涨。
我的判断是:DeepGEMM 不会让 CUDA 消失,但它会让“非英伟达芯片跑大模型”这件事从不可能变成可行。
另一个判断:华为昇腾的生态短板正在被补齐。过去大家吐槽昇腾“硬件还行,软件稀烂”,但 DeepSeek 这种级别的模型公司愿意投入工程师一起做算子,说明昇腾的软件栈已经过了“能用”的门槛。
反转:别急着卸载 CUDA
说了这么多 DeepGEMM 的好话,但如果你现在就想把公司所有 A100 换成昇腾,我劝你冷静。
第一,DeepGEMM 目前只支持 FP8 精度,而很多传统模型还在用 FP16 甚至 FP32。第二,它的算子覆盖度不到 cuBLAS 的十分之一,遇到冷门算子你还是得自己写。第三,昇腾的编译器在动态 shape 场景下表现依然不稳定——我那个做多模态的朋友试了一周,最后又换回了 H100。
所以,如果你是一个纯小白用户,以上这些对你来说可能完全没用。你只需要知道:有人正在努力让 AI 算力不再被一家公司卡脖子,而这件事的进度条,刚刚从 0% 走到了 5%。
本文基于 media 公开报道编译解读
本文基于 media 公开报道编译解读,查看原文