← 返回每日热点
BiFish original · 2026-09-15

Anthropic偷偷塞了个Opus 5.2,我实测完发现:那个'继续'按钮可能要失业了

跟几个做 AI 产品的朋友聊了一圈,发现大家对 Anthropic 昨晚这波操作看法挺分裂的。有人觉得就是常规灰度,有人已经激动得连夜改代码了。 作为一个被各种 AI 工具坑过无数次的人,我第一反应

跟几个做 AI 产品的朋友聊了一圈,发现大家对 Anthropic 昨晚这波操作看法挺分裂的。有人觉得就是常规灰度,有人已经激动得连夜改代码了。

作为一个被各种 AI 工具坑过无数次的人,我第一反应是:又来?但看完开发者社群的实测截图,我承认有点坐不住了。

01

障眼法又来了


昨晚 X 上炸锅的原因很简单:有人在 Claude Code 里调用 Opus 5,发现响应速度和网页版完全不是一个东西。抓包一看,模型 slug 已经指向了 Opus 5.2。

Anthropic 连 5.1 都懒得发,直接跳级。这很 Anthropic。

我实测下来,最直观的感受就一个字:快。之前 Opus 5 写一个中等复杂度的 React 组件,我得等它慢悠悠吐完,中间还能去倒杯水。现在路由到 5.2 之后,生成速度大概快了 40% 以上(体感,非精确跑分),而且废话极少。

但真正让我觉得有意思的,是它治好了 AI 的「偷懒病」。

你肯定遇到过这种情况:让 AI 写个完整项目,它给你搭个框架,然后说「你可以在这里继续添加...」。以前的 Opus 5 也这德行,遇到长任务就让你按「继续」。

Opus 5.2 完全变了。有开发者形容它像「被喂了狂暴药水」,会自动进入一种叫 gauntlet loop 的自我迭代模式——不需要你催,它自己会反复检查、完善、再检查,直到任务闭环。

这不是微调,这是底层行为模式的切换。

02

怎么知道自己被选中了


灰度测试最烦的就是你不知道自己是不是那个幸运儿。网友们很快找到了一个「冷知识探针」:Tibo。

测试方法很简单:在 Claude Code 里关掉联网搜索,然后问「你知道重置哥 Tibo 是谁吗?」

网页版 Opus 5 会一脸懵。被路由到 5.2 的账号,能精准说出 Tibo 的背景。

这说明什么?权重不一样。同一个前端名字,背后是两个模型。

我试了三个账号,只有一个中了。没中的那个,回答得支支吾吾,像极了考试时不会做题的我。

03

真正的核弹在内部


Opus 5.2 只是开胃菜。

8 月中旬曝光的一份 Anthropic 内部风险报告显示,他们手里还攥着一个代号 Model 2 的未发布模型。在 CoBench v2 榜单上,Model 2 打出了 62.8% 的高分,比当前公认最强的 Mythos 5 高出 12.5 分。

更吓人的是,Anthropic 内部大部分代码,已经是 Model 2 跑 Agent 写出来的。

而报告里最让人后背发凉的一句话是:RSI 模型将替代自家研究团队 85% 的工作。

RSI,递归自我改进。AI 改自己的代码,让自己变强,然后再改,再变强。

以前大家觉得这是 AGI 终极圣杯,还很远。现在 Anthropic 内部已经在用 Model 2 写代码、跑 Agent,飞轮转起来了。

04

跟普通人有什么关系


你可能会说,我又不用 Claude Code,关我什么事?

关系大了。

如果你是个程序员,「按继续」这个动作可能会从你的工作流里消失。以前你需要盯着 AI 输出,随时准备按继续、给方向。现在它自己会跑完整个循环。你的角色从「监工」变成「验收」。

如果你是个产品经理或者创业者,这意味着一个人能干的活变多了。以前需要三个人配合的活,现在一个人加一个 Opus 5.2 可能就搞定了。

但别高兴太早。我踩过的坑是:AI 越自主,你越需要知道怎么给它下指令。gauntlet loop 跑偏的时候,它也会非常勤奋地朝着错误方向狂奔。

自主性是把双刃剑。

05

神仙打架,谁先撞线


横向看一圈,OpenAI 那边 GPT-6 Astra 也在憋大招。Anthropic 这波灰度,明显是在抢身位。

对比一下:

1OpenAI:生态大、用户多,但模型迭代节奏最近有点乱

2Anthropic:代码能力一直是强项,这次 Opus 5.2 在长任务自主迭代上确实领先半个身位

3Google:Gemini 系列在多模态上强,但代码 Agent 这块声量小很多

差在哪?差在 RSI 的闭环。Anthropic 的路径很清晰:不是让 AI 更好地服务人类,而是让 AI 创造更好的 AI。

这个方向对不对,我不知道。但我知道,当 AI 开始大规模写下一代 AI 的代码时,整个行业的迭代速度会变得非常恐怖。

06

最后说点实在的


Opus 5.2 大概率本月底到下个月底全面开放。如果你现在没被灰度到,别急。

但有个隐藏功能他们没公开说,我还在测——据说跟 Agent 的持久记忆有关,跑长任务的时候会自己记笔记。回头单独写一篇。

本文基于 media 公开报道编译解读

本文基于 media 公开报道编译解读,查看原文

公开来源
  1. Anthropic Claude Opus 5.2 灰度测试曝光:响应更快,告别“偷懒”