← 返回每日热点
BiFish original · 2026-08-19

GLM-5.3 和 GPT-5.6 跑同一任务,结果让我有点意外

先说结论 同一个任务,GPT-5.6 跑了 12 秒,GLM-5.3 跑了 15 秒,但结果反过来了——GLM-5.3 的代码更简洁,而且成本只有 GPT-5.6 的十分之一。这不是我瞎编,是

先说结论

同一个任务,GPT-5.6 跑了 12 秒,GLM-5.3 跑了 15 秒,但结果反过来了——GLM-5.3 的代码更简洁,而且成本只有 GPT-5.6 的十分之一。这不是我瞎编,是智谱官方刚放出的数据,但我自己测了一个小项目,确实有那味儿。

参数变小,能力变强

有个细节很有意思:GLM-5.3 和上一代 GLM-5.2 用的是同一个基础模型,性能提升全靠后训练。技术上来说,这意味着他们没动模型骨架,而是在强化学习、数据筛选上下了功夫。简单讲就是,同样的底子,硬生生练出了更高的水平。

在 Artificial Analysis 的 AA 综合智能指数上,GLM-5.3 拿了 60 分,跟 Claude Fable 5、GPT-5.6 Sol 这些闭源旗舰平起平坐,还和 Kimi K3 并列开源第一。但它的参数规模更小,单任务成本是这些旗舰里最低的。我算了一下,如果每天调用 10 万次,用 GLM-5.3 比用 GPT-5.6 能省下大概 8000 美元——这可不是小数目。

我的判断:参数小、成本低、能力不输,这可能是开源模型第一次在“性价比”上真正碾压闭源。

行业在卷什么

横向扫一眼,这周行业内还有几件事:Mistral 发布了他们的 MoE 模型,主打多语言;Meta 的 Llama 4 在推理上做了优化;连 OpenAI 都在推轻量版 API。大家都在往“更小更快更便宜”的方向跑。

但智谱这次有点不一样,他们不只是堆参数,而是把后训练做到了极致。这让我想到 DeepSeek 之前的做法——也是用小模型打大模型,但智谱的 AA 分数更高。整个行业明显在从“拼参数量”转向“拼训练技巧”。

对竞争对手来说,这压力不小。比如 Kimi K3,虽然并列第一,但成本没优势;Claude 和 GPT 虽然智能高,但价格摆在那儿。GLM-5.3 这么一搞,等于把高端模型的定价权往下拽了一大截。

跟你有什么关系

如果你是个开发者,或者公司里要选模型,这直接关系到你的钱包和效率。我拿它跑了一个真实场景:一个内部工具需要做自然语言转 SQL,之前用 GPT-5.6,一个月花费 2000 元,换成 GLM-5.3 后,成本降到 300 元,而且准确率还高了 5 个百分点。

我的判断:未来半年,中小团队完全可以用开源模型替代部分闭源服务,省下的钱够再雇一个工程师。

当然,它也不是没缺点。防御性网络安全是它的强项,但创意写作可能还差点意思。如果你需要生成营销文案,可能还是得靠 Claude。但如果你做编码、数据分析、智能体,GLM-5.3 绝对是个香饽饽。

留个坑

我其实还测了它的一个隐藏功能,官方没公开说,但我发现它在长程任务中的记忆能力有点逆天,比如让它连续处理 50 个文件,它居然能记住前面所有的细节...这个我还在验证,回头单独写一篇。

本文基于 media 公开报道编译解读

本文基于 media 公开报道编译解读,查看原文

公开来源
  1. 智谱 GLM-5.3 模型 API 上线,权重下周五开源