VoxCPM2:清华团队出品,用文字描述就能「凭空造」出一个新声音
20 亿参数、支持 30 种语言的下一代语音合成模型
它是什么
VoxCPM2 是清华大学 OpenBMB 团队(一个专门研究多模态 AI 的实验室)推出的语音合成模型。所谓「语音合成」,就是让 AI 把文字变成真人一样的声音。
它有 20 亿参数(参数可以理解为 AI 大脑里的「神经连接」数量,越多通常越聪明),支持多达 30 种语言。但最让它出圈的,是一个超酷的功能:你可以用文字描述一个声音,它就能凭空创造出这个声音。比如你输入「一个温暖、略带沙哑的中年女声,语速偏慢」,它就真能给你造出这样一个独一无二的嗓音——不需要任何录音样本。
解决什么问题
传统的语音克隆需要你提供一段录音,但很多时候你根本没有合适的录音,或者你想要一个「现实中不存在」的声音。VoxCPM2 解决的就是这类问题:
- 想要一个完全原创、不会和别人撞款的虚拟主播声音
- 做多语言内容,需要 30 种语言都能hold住的配音
- 不想露脸、不想录音,但又想要自然的人声
- 给小说、游戏设计有性格的角色声音
它特别适合内容创作者、虚拟主播、独立游戏开发者,以及任何想要「下一代」语音体验的人。
长什么样
VoxCPM2 提供了一个网页操作界面(在浏览器里运行,地址通常是 http://localhost:7860)。打开后你会看到:
- 文本输入框:填写要让 AI 朗读的文字
- 声音选择区:可以选预设声音,也可以上传参考音频做克隆
- 「文字造声音」输入框:这是它的招牌功能,用一句话描述你想要的声音
- 语言/参数设置:选择语言、调整语速和音质
- 合成按钮和音频播放器:点击生成,然后试听、下载
整体界面简洁,重点功能一目了然。
怎么安装
VoxCPM2 需要一台配置不错的电脑(建议有 NVIDIA 显卡,显存 8GB 以上体验最佳)。安装步骤如下:
- 安装 Python:去
python.org下载并安装 Python 3.10 版本(一种运行 AI 程序必备的工具),安装时记得勾选「Add Python to PATH」 - 下载代码:打开命令行(Windows 按
Win+R输入cmd),输入git clone https://github.com/OpenBMB/VoxCPM.git把项目下载到本地 - 进入文件夹:输入
cd VoxCPM回车 - 安装依赖:输入
pip install -r requirements.txt,等待自动下载安装所需的库(这一步可能要几分钟) - 启动程序:输入项目提供的启动命令(如
python webui.py,具体以项目说明为准),看到「Running on local URL」就成功了 - 打开浏览器:访问命令行里提示的地址,就能看到操作界面
第一次运行会自动下载模型文件(几个 GB),需要耐心等待,确保网络通畅。
怎么用
咱们来玩两个最典型的场景。
场景一:用文字「造」一个声音
- 在「声音描述」框里输入:
一个温暖、略带沙哑的女声,语速适中,像在讲睡前故事 - 在文本框输入要朗读的内容,比如「从前有座山,山里有座庙」
- 选择语言为「中文」
- 点击「合成」,等几秒,就能听到一个根据你的描述生成的全新声音
场景二:克隆一段已有声音
- 上传一段 5-10 秒的清晰录音作为参考
- 输入想让这个声音朗读的新文字
- 点击合成,AI 就会用参考音频的音色读出新内容
多语言也很简单:把文本框内容换成英文、日文等,再选对应语言,同一个声音就能「说」外语了。
需要 AI 模型吗?
VoxCPM2 本身就是一个完整的 AI 模型,下载项目时会自动获取所需的模型权重(可以理解为 AI 的「记忆和知识」),不需要你额外申请 API Key(调用云端 AI 服务的密码)。它在你自己电脑上本地运行,数据不出门,隐私更安全。
不过,如果你想把它和其他 AI 工具组合使用,或者想了解市面上还有哪些好用的 AI 模型,可以去模型导航挑一个适合你的 AI 助手 →
费用
免费开源。VoxCPM2 由清华团队开源发布,个人使用完全免费。商用前建议查看项目的具体许可协议(License,规定你能怎么用这份代码的法律文件),通常对商业用途会有些额外说明。你的成本主要是电脑硬件和电费。
适合谁
- 虚拟主播/数字人创作者:打造独一无二的原创声音形象
- 多语言内容创作者:30 种语言一站式搞定
- 独立游戏/动画开发者:低成本设计有性格的角色配音
- 有声内容制作人:广播剧、有声书、播客
- AI 技术爱好者:想体验最前沿的语音合成技术
项目地址
GitHub 地址:https://github.com/OpenBMB/VoxCPM
项目页面有官方文档、模型下载链接和示例。3 万星的关注度说明社区很活跃,遇到安装问题可以去 Issues(提问区)找找答案。