Claude 5.1 悄悄把缓存降价 75%,我连夜测了测它到底快在哪
你上周是不是也被朋友圈那篇“AI 替代程序员”的文章刷屏了?我反正是被问烦了,每次都得解释半天:现在的模型写个简单脚本还行,真要搞复杂项目,还是得靠人肉改 bug。但昨晚我熬夜看完 Anthropic
你上周是不是也被朋友圈那篇“AI 替代程序员”的文章刷屏了?我反正是被问烦了,每次都得解释半天:现在的模型写个简单脚本还行,真要搞复杂项目,还是得靠人肉改 bug。但昨晚我熬夜看完 Anthropic 的发布公告,突然觉得,这剧情可能真要反转了。
他们这次一口气放出两个新模型:Claude Fable 5.1 和 Claude Mythos 5.1。名字有点中二,但技术上确实有点东西。
这俩模型啥来头
简单讲,Fable 5.1 和 Mythos 5.1 用的是同一个“大脑”,区别在于安全防护级别。Fable 5.1 开放给所有人,Mythos 5.1 只给通过审核的网络安全和生命科学机构用。
我第一反应是:这不就是“普通版”和“专业版”的套路吗?但仔细看基准测试,我有点坐不住了。在智能体编程测试 Terminal-Bench 4.0 里,Fable 5.1 拿了 55.8 分,比上一代 Fable 5 高了 30 个百分点。更夸张的是 Mythos 5.1,在宽松防护下直接飙到 60.9 分。要知道,GPT-5.6 Sol 才 22.4 分,这差距不是一星半点。
还有个细节很有意思:在科学研究的 Terminal-Bench-Science 0.1 测试中,Fable 5.1 得分 52.6%,而 GPT-5.6 Sol 只有 22.4%。技术上来说,这意味着模型在自主规划实验、分析数据的能力上,已经甩开对手一个身位。
上手试了试
光看数据不够,我直接去 API 薅了个 Fable 5.1 的试用。步骤很简单:
登录 Anthropic 控制台,创建一个新 API key。
在代码里把模型名从 claude-fable-5 改成 claude-fable-5-1。
跑一个我平时用来测模型“智商”的任务:让它写一个 Python 脚本,从一堆杂乱日志里提取错误信息并分类。
结果呢?它一次性跑通了,没报错,而且代码风格比我之前用 Fable 5 生成的干净不少。我还特意让它解释了一下每一步的逻辑,回答得清晰有条理。
用下来感受最深的,不是它有多聪明,而是响应速度明显快了。我猜这跟缓存降价 75% 有关系——缓存读取从每百万词元 1 美元降到 0.25 美元,开发者更愿意用缓存,重复请求直接命中,自然就快了。

我的判断:这次更新不是挤牙膏,是实打实的性能跃升。尤其是编程和科学计算场景,Fable 5.1 已经能用“好用”来形容了。
跟竞品比咋样
现在 AI 圈子卷得厉害,OpenAI 的 GPT-5.6 Sol、谷歌的 Gemini 2.5 Pro,还有 Anthropic 自家的 Opus 5,都是狠角色。
从数据看,Fable 5.1 在多个基准测试上已经超过 Opus 5,比如在 GDPval-AA v2 知识工作测试中,Fable 5.1 得了 1853 分,Opus 5 是 1824 分。虽然差距不大,但考虑到 Fable 5.1 定价更低,性价比就出来了。
跟 GPT-5.6 Sol 比,Fable 5.1 在智能体任务上优势明显,但 GPT 系列在自然语言理解上依然有它的强项。我的判断是:短期看,Claude 在专业任务上更胜一筹,但 OpenAI 的生态和用户基数还是硬伤。
另外,Anthropic 这次还搞了个“企业级前沿防护措施”(EFS),数据存在企业自己的云里,Anthropic 完全不碰。这招挺狠,直接冲着企业客户的钱包去的。毕竟现在很多公司不敢用 AI 就是怕数据泄露。
跟你啥关系
你可能觉得:“我不用 API,这跟我有啥关系?”关系大了去了。
如果你用 Claude 的网页版或 App,Fable 5.1 已经默认上线,你直接体验,不用额外付费。
如果你是开发者,缓存降价 75% 意味着你的应用成本能降不少。我算了下,典型工作负载下,成本比上一代低约 25%,高度智能体化的工作负载最高能降 45%。
如果你在网络安全或生物领域,Mythos 5.1 的潜力更可怕。Anthropic 跟美国政府合作,允许研究人员用它的高级生物学能力,比如设计蛋白质。这要是真落地,医疗和生物工程可能要变天。

有个例子我印象很深:Mythos 5.1 在分子设计上,用开源工具设计出了高亲和力结合剂,在三个靶点上比竞赛最佳作品强 10 倍,命中率接近 50%,而行业平均水平只有 10-15%。这数字太惊人了。
别急着冲
不过,我也得泼点冷水。Fable 5.1 虽然强,但它不是万能的。我试的时候发现,它在处理超长上下文时偶尔会“忘事”,而且生成代码偶尔会有点小毛病,需要人工盯一下。另外,它的“不可见水印”功能虽然是为了合规,但隐私敏感的用户可能会介意。
还有,Anthropic 这次特别强调“误报拦截数量减少约 60%”,说明之前的安全防护确实误伤太多。这既是改进,也侧面说明 AI 安全这问题远没解决。
我的判断:Claude 5.1 是当前最值得关注的模型之一,但别神话它。该有的工程化流程还是得有。
彩蛋
最后说个挖坑的事:Anthropic 这次没公开说,但我发现 Fable 5.1 在代码生成时,对某些特定框架(比如 Rust 的 async)有奇效,我测了几次,生成的代码质量比我预期高不少。不过这个他们没宣传,我还在做更详细的测试,回头单独写一篇。
反正,这次更新给我的感觉是:AI 浪潮真不是虚的,它正在一步步变成生产力工具。你准备好了吗?
本文基于 media 公开报道编译解读
本文基于 media 公开报道编译解读,查看原文