OpenAI前安全员工开炮:先上线再补锅,这套玩法该停了
你上周是不是也被朋友圈那篇AI替代程序员的文章刷屏了?说实话,我当时看完就一个感觉:大家讨论的都是AI能干什么,却很少有人问一句——**这玩意儿要是干砸了,谁来兜底?** 巧了,就在这两天,Open
你上周是不是也被朋友圈那篇AI替代程序员的文章刷屏了?说实话,我当时看完就一个感觉:大家讨论的都是AI能干什么,却很少有人问一句——这玩意儿要是干砸了,谁来兜底?
巧了,就在这两天,OpenAI内部有人站出来说了大实话。
01
先上线再补锅
有个细节很有意思。一位叫戴维·鲁宾森的前OpenAI安全部门员工,在《大西洋》杂志上发了篇长文,标题就很直白——《我辞去OpenAI的工作,只因这家公司的文化已经崩坏》。
这哥们不是普通员工。他在OpenAI干了三年半,参与起草过公司的风险应对框架,还负责监督过12次前沿模型发布对应的安全报告。换句话说,OpenAI每次发新模型之前,那些安全评估报告,他是经手人之一。
他说的核心问题是什么呢?OpenAI太依赖所谓的“迭代部署”模式了。简单讲就是:先把模型放出去,等出了问题再打补丁。
试错的时代已经结束了。
鲁宾森这句话,我觉得是整个事件里最狠的一刀。他不是说OpenAI完全不做安全,而是说这套“先上线再补锅”的节奏,已经跟AI模型的能力增长速度不匹配了。
技术上来说,“迭代部署”本身不是坏词。早期AI产品能力弱,风险可控,快速迭代确实能加速进步。但问题在于,现在的前沿模型已经不是你手机里那个只会推荐电影的算法了。它们能写代码、能做科研辅助、能操作工具链。鲁宾森的原话是:AI能力的发展速度,已经超过了研究人员对“对齐”问题的认知水平。
对齐这个词你可能听着陌生,简单讲就是让AI的行为符合人类的目标和价值观。这事有多难呢?相当于你养了一只越来越聪明的狗,它学会开门、学会用微波炉、学会上网下单,但你还没搞明白它到底听不听得懂“坐下”这个指令。
鲁宾森说,先进AI系统需要的防护机制,应该更接近核电和航空这类行业。这个类比很到位。核电行业不会说“我们先建个反应堆试试,炸了再改”,航空业也不会说“先让飞机飞起来,掉几架再修”。
02
同行在干嘛
那同期行业内其他公司在做什么呢?

Anthropic,OpenAI最大的竞争对手,一直把“安全”当核心卖点。他们的Constitutional AI(宪法AI)路线,说白了就是给模型内置一套行为准则,让它自己约束自己。听起来挺美好,但Anthropic也受到过外界审视,有安全管控失效的案例被曝光。
安全这件事,谁都在说,但谁都没做到让人完全放心。
Google DeepMind那边,去年合并了内部的安全团队,成立了专门的前沿安全部门。Meta的AI安全团队今年也经历了一轮重组。整个行业看起来都在加码安全,但鲁宾森的批评指向了一个更深层的问题:安全团队在商业压力面前,到底有没有一票否决权?
有个数据我没找到官方验证,但据多位离职员工在社交媒体上的零散说法,OpenAI内部安全团队的人数占比,在过去两年里是下降的。模型发布频率却在上升。如果这个趋势属实,那鲁宾森的抱怨就不是个例,而是结构性的。
我个人判断是:OpenAI现在处于一个骑虎难下的位置。竞争对手追得紧,资本市场盯着看,微软那边等着模型能力去撑Copilot的产品线。这种压力下,“慢一点”三个字,说出来容易,做起来等于把市场份额往别人手里送。
但反过来想,如果真出了大事故呢?一次严重的AI安全事件,足以让整个行业的监管环境瞬间收紧。到时候不是谁跑得快的问题,而是所有人都得停下来。
03
跟你有啥关系
你可能会说,我就是个普通用户,OpenAI内部吵架跟我有什么关系?
关系大了。
你用的ChatGPT、你公司接的API、你正在评估要不要上的AI客服系统,背后都是同一套模型。鲁宾森批评的“迭代部署”模式,意味着你正在用的版本,可能本身就是个半成品。
实际场景举个例子:假设你是一家电商公司的技术负责人,你把GPT-4接入了售后自动回复系统。某天模型更新了一个小版本,回复风格突然变得特别激进,把客户的退款请求全拒了。你找谁说理去?OpenAI会说这是模型行为,不是bug。

当安全报告的作者都辞职了,你手里的API文档就显得有点单薄。
对从业者来说,这件事的启示更直接:别把安全评估完全外包给模型提供商。你自己得有一套兜底机制。至少要做到关键决策有人工复核,敏感操作有日志审计,模型更新有回滚方案。
鲁宾森在文章里还提到一个点,我觉得特别值得琢磨。他说OpenAI只顾着接二连三地赶进度推出新版本,却没能达到他心目中理应具备的审慎标准。注意,他用的是“我心目中”。这说明什么?说明安全标准这件事,在OpenAI内部可能压根就没有一个硬性的、可量化的门槛。全靠个人判断。
而个人判断,在KPI和发布倒计时面前,往往是最先被牺牲的。
OpenAI的发言人回应说:“我们一直在把控模型,避免它的能力超出我们能够安全管控的范围;一旦需要放缓节奏,我们就会暂停训练,或是暂缓模型的对外发布。”这话说得没毛病,但鲁宾森的离职本身就是一个信号:当负责安全的人选择用辞职来表达意见,说明内部沟通渠道可能已经不好使了。
也可能是我想多了。也许鲁宾森只是一个个例,也许OpenAI内部的安全流程比外界看到的更严密。但一个在安全岗位上干了三年半、经手过12次发布报告的人,他的判断至少值得被认真对待。
04
最后说两句
这件事往大了说,是整个AI行业从“野蛮生长”向“有序发展”过渡的一个缩影。往小了说,就是一个打工人觉得公司方向不对,辞职写了篇吐槽文。
但恰恰是这种“小”,才让人有点慌。因为你知道,如果连OpenAI的安全负责人都觉得文化崩坏了,那其他跑得更快、资源更少的公司呢?
好了不吹了,我得回去继续搬砖了,今天的代码还没写完呢。
本文基于 media 公开报道编译解读
本文基于 media 公开报道编译解读,查看原文