← 返回每日热点
BiFish original · 2026-09-25

谷歌虚拟人上线,97种语言无缝切换,但先别急着叫好

数字人又来了 同一个虚拟人对话任务,谷歌 Gemini 3.8 Live 的 Live Avatar 跑完一轮实时唇形同步加表情生成,官方演示里几乎感觉不到延迟;而市面上大部分数字人方案,从你

01

数字人又来了


同一个虚拟人对话任务,谷歌 Gemini 3.8 Live 的 Live Avatar 跑完一轮实时唇形同步加表情生成,官方演示里几乎感觉不到延迟;而市面上大部分数字人方案,从你说话结束到它张嘴回应,平均要等 1.5 到 3 秒。

但别被忽悠了,快不代表好用。

谷歌上周才推出 Gemini 3.8 Live,这周就塞进了 Live Avatar。节奏快得像赶 KPI。IT之家 9 月 25 日消息说得很清楚:这个功能把接近实时的视频生成和语音结合,能倾听、观察,还能用动态视觉形象跟你交流。精准唇形同步、自然表情、流畅对话轮次切换,官方话术一套接一套。

我作为一个被各种 AI 工具坑过无数次的人,看到“无缝切换 97 种语言”这种宣传,第一反应不是兴奋,是警惕。

因为数字人这玩意儿,过去三年我见过太多“ demo 惊艳、落地翻车”的案例。

02

谁最需要这玩意儿


先说清楚,Live Avatar 不是给普通用户玩的。它已经在 Gemini Enterprise 上线,自定义虚拟形象只对企业白名单用户开放。说白了,这是 to B 的产品。

那谁最需要?

1跨国客服团队。97 种语言无缝切换,唇形和表情动态适配,不降低视频保真度。如果你的客服中心要覆盖东南亚、中东、欧洲,以前得养多少语种坐席?现在一个虚拟人全包。

2在线教育平台。老师形象可以定制,品牌风格保留,参考图像生成完整动画。一个数学老师形象,同时给 20 个国家的学生上课,表情还不崩。

3企业培训部门。异步工具调用这个能力被很多人忽略了。它能在后台触发工具调用、获取数据,同时保持对话不中断。什么意思?虚拟人一边跟你聊,一边查你的培训记录、调你的考核数据,嘴还不停。

4直播电商和虚拟导购。实时唇形同步加自然表情,比现在那些嘴型对不上、表情像面瘫的虚拟主播强太多。

03

谁不需要


但下面这些人,我劝你先别凑热闹。

1个人开发者和小团队。自定义虚拟形象只对企业白名单开放,API 文档虽然能看,但你想拿它做个个人助理、搞个副业项目,门槛和成本都不友好。

2只需要文字对话的场景。如果你就是拿 AI 写代码、改文案、查资料,Live Avatar 对你来说是纯浪费。视觉呈现再流畅,也不如直接看文本快。

3对延迟极度敏感的实时交互。官方说“接近实时”,不是“实时”。这个数据我没找到官方验证,但根据视频生成的算力消耗,端到端延迟大概率还在几百毫秒级别。做实时游戏 NPC、远程手术指导这类场景,别赌。

4预算敏感的中小企业。Gemini Enterprise 的定价从来不是给创业公司准备的。你算算一个虚拟人客服的并发成本,可能比雇三个真人还贵。

数字人最大的坑,不是技术不行,是你根本算不过来账。

04

谷歌在急什么


这件事对行业的影响,比功能本身更值得看。

谷歌把 Live Avatar 塞进 Gemini 3.8 Live,本质上是在打一场 多模态实时交互 的卡位战。OpenAI 的 GPT-5 系列在文本和推理上压着谷歌打,谷歌必须在“实时视频+语音+表情”这个维度上抢回话语权。

你看它的技术选择就明白了:异步工具调用、原生多语言语音同步、SynthID 隐形水印。这三件事分别对应三个竞争对手的软肋。

1异步工具调用,打的是那些“一调用工具就卡住对话”的方案。

297 种语言无缝切换,打的是只支持十几种语言的区域性数字人厂商。

3SynthID 水印,打的是监管和合规焦虑。所有 AI 生成内容直接嵌入音频和视频输出,减少错误信息和错误归属。

但谷歌的软肋也很明显。自定义虚拟形象只对企业白名单开放,这意味着生态开放度远不如它宣传的那么美好。对比之下,一些开源数字人方案虽然效果糙,但胜在谁都能用。

我的判断是:谷歌这一刀,砍的是企业级虚拟服务市场,不是创作者市场。它想抢的是客服、培训、导购这些标准化场景,而不是让你拿它做抖音虚拟网红。

谁控制了企业实时交互的入口,谁就控制了下一波 AI 落地的现金流。

05

跟你有什么关系


如果你是个普通打工人,这件事跟你最直接的关系是:你公司明年可能给你配一个虚拟人同事。

不是科幻。企业客服、HR 答疑、IT 支持这些岗位,已经在被这类方案渗透。Live Avatar 的 97 种语言能力和异步工具调用,恰好覆盖了跨国企业最头疼的两件事:语言成本和系统集成。

如果你是从业者,尤其是做数字人、虚拟主播、在线教育的,我的建议很直接:

1别跟谷歌拼通用能力,拼不过。

2拼垂直场景的深度集成。谷歌不会为了一家医院的导诊需求去定制虚拟人,但你会。

3盯紧 SynthID 水印的合规影响。如果监管要求所有 AI 生成内容必须带水印,你的方案能不能快速跟上?

如果你正好在选企业级虚拟人方案,这周可以先去看看 Gemini Enterprise 的官方文档,把 API 探索权限申请下来。免费额度大概率不够跑生产,但至少能让你摸清楚它的真实延迟和成本。

别急着签合同。先跑一个最小场景,比如让虚拟人用三种语言回答同一个退换货问题,看看唇形同步在第三种语言上崩不崩。

这个测试方法我自己也没完全验证过,也可能是我想多了。但数字人这东西,demo 和生产的差距,从来都是数量级的。

本文基于 media 公开报道编译解读

本文基于 media 公开报道编译解读,查看原文

公开来源
  1. 谷歌 Gemini 3.8 Live 虚拟人上线:实时唇形同步 + 自然表情,无缝切换 97 种语言