OpenAI把电话客服的饭碗端了?GPT-Live-1这玩意儿每分钟只收5美分
跟几个做语音 AI 产品的朋友聊了一圈,发现大家对 OpenAI 昨天发的 GPT-Live-1 看法特别分裂。做客服系统的在骂娘,做语音陪聊的在偷笑,还有几个搞出海业务的直接连夜改方案。 说白了,
跟几个做语音 AI 产品的朋友聊了一圈,发现大家对 OpenAI 昨天发的 GPT-Live-1 看法特别分裂。做客服系统的在骂娘,做语音陪聊的在偷笑,还有几个搞出海业务的直接连夜改方案。
说白了,OpenAI 这次不是发了个新模型,是直接把一条产业链给折叠了。
先看它干了啥
GPT-Live-1 上线 API,核心就一件事:把语音理解、语音生成、打断处理、工具调用全塞进一个模型里。以前你要搭一个能打电话的 AI 客服,得串三四个模块——语音转文字、大模型推理、文字转语音,中间还得加个轮次检测模块来判断用户说没说完。现在 OpenAI 告诉你,不用了,一个模型全包。
价格是每分钟 0.05 美元,一小时 3 美元,约合人民币 20 块。后端模型和工具调用另算。
别被这个价格忽悠了。3 美元一小时听起来便宜,但你得想清楚:一个真人客服时薪多少?美国最低时薪 7.25 美元,中国二线城市客服月薪 4000 块,折算下来时薪也就 20 多块人民币。AI 的成本已经压到跟真人差不多了,但 AI 不用休息、不会离职、不会跟客户吵架。
这不是技术升级,这是成本结构的暴力重构。
谁最疼?
首当其冲的是做语音中间件的公司。过去两年,国内有一批创业公司专门做“实时语音交互解决方案”,核心卖点就是低延迟打断、回声消除、轮次检测。GPT-Live-1 直接把这些能力原生内置了,而且评测数据很吓人:Full Duplex Bench 比 GPT-Realtime-2.1 高出 30 个百分点。
30 个百分点是什么概念?在语音交互里,打断处理的准确率从 70% 提到 95% 是质变,从 90% 提到 99% 也是质变。30 个点的差距,意味着你辛辛苦苦调的工程优化,人家一个模型升级就抹平了。

更狠的是那个医疗平台的案例:代码量减少 80%,删了约 2.3 万行代码。2.3 万行是什么规模?一个中等规模的语音交互系统,核心逻辑大概也就这个量级。OpenAI 等于告诉开发者:你过去两年写的那些胶水代码,现在可以扔了。
但有人哭就有人笑。做电话语音智能体的团队反而爽了。以前要接电话、订餐厅、查订单,得自己搭 ASR、TTS、对话管理、工具调用四层架构,现在一个 API 全搞定。语言学习平台 Speak 的数据也很说明问题:学习者思考停顿期间的误打断次数减少近 80%。这个场景太典型了——人说话会卡壳、会“嗯...那个...”,传统轮次检测系统根本分不清你是说完了还是在想词。
语音交互的竞争,从“谁调得更准”变成了“谁更会用 OpenAI 的提示词”。
跟竞品比,差在哪
国内做实时语音的,绕不开字节的豆包实时语音和阿里通义千问的语音模块。我作为一个被各种 AI 工具坑过无数次的人,说句公道话:在中文场景下,国产模型未必输。
GPT-Live-1 的强项是全双工架构和工具调用生态。它能直接连 Codex、连企业系统、连 OpenAI Presence 做人工转接,这套企业级工作流是 OpenAI 的护城河。但它的弱项也很明显:中文语音的韵律、方言、口语化表达,OpenAI 的语料积累肯定不如字节和阿里。你让 GPT-Live-1 去接一个四川话的订餐电话,大概率翻车。
而且价格上,国产 API 的语音模块普遍更便宜。豆包实时语音的定价策略一直是贴着成本打,通义千问也有免费额度。OpenAI 这 0.05 美元一分钟,在国内市场没有价格优势。
但真正的威胁不在价格,在生态锁定。一旦开发者用了 GPT-Live-1 的 API,接了 Presence 的人工转接,用了 Codex 的工具调用,迁移成本就上去了。OpenAI 玩的是“前端语音层便宜甚至亏本,后端模型和工具赚钱”的路子。3 美元一小时的前端费用,可能只是钩子。

跟你有什么关系
如果你是个普通用户,接下来半年你会明显感觉到:打客服电话时,接电话的越来越不像人。
这不是坏事。真人客服被解放出来处理复杂投诉,简单查询、预约、改签全交给 AI。但问题也来了:当 AI 能模仿任何声音、任何语气,你怎么确认电话那头是不是真人?OpenAI 新增了 12 种声音——Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta、Cinder——还计划继续加。声音多了是好事,但声音克隆和诈骗的门槛也在同步降低。
如果你是从业者,不管是做客服系统、语音助手还是出海业务,我的判断很直接:
别自己造轮子了。除非你的场景极度垂直(比如医疗问诊、法律咨询),否则直接用 GPT-Live-1 的 API 做原型,把精力放在业务逻辑上。
关注后端成本。前端语音 3 美元一小时是明牌,后端模型和工具调用的费用才是大头。做一个中等复杂度的电话智能体,后端成本可能是前端的 3-5 倍。
中文场景先测再上。拿你的真实录音去跑一遍,特别是带口音、带背景噪声、带多人对话的场景。评测分数好看不代表你的场景好用。
工具越强,判断力越值钱。
OpenAI 这次还埋了个东西没明说:GPT-Live-1 支持“字母数字理解”和“关键词偏置”。翻译一下就是,你可以告诉模型“听到订单号就重点识别”“听到人名就提高注意力”。这玩意儿在电话客服场景里是杀手锏——用户报一串数字,传统 ASR 经常错一位,现在模型能根据上下文纠错。
不过有个隐藏的能力他们没公开说,我还在测,回头单独写一篇。
本文基于 media 公开报道编译解读
本文基于 media 公开报道编译解读,查看原文