GPT-SoVITS:录 1 分钟声音,AI 就能用你的嗓音读任何文字
短视频配音神器,零基础也能克隆自己的声音
它是什么
简单说,GPT-SoVITS 就是一个「声音复印机」。你只需要录一段自己说话的声音(最少 1 分钟就够了),它就能学会你的音色、语气、说话习惯,然后用「你的声音」去朗读任何你给它的文字。
这个项目在 GitHub(一个全球程序员分享代码的网站)上有 5.9 万颗星,是目前最火的开源(免费、代码公开)语音克隆工具之一。它把两个厉害的 AI 技术——GPT(擅长理解文字)和 SoVITS(擅长模仿声音)——结合在了一起,所以叫 GPT-SoVITS。
解决什么问题
你有没有遇到过这些烦恼?
- 做短视频要配音,但自己普通话不标准、声音不好听
- 想给小说做有声书,但请配音演员太贵(一分钟好几十块)
- 想做多语言内容,但不会日语、韩语
- 想给游戏角色配各种声音,但自己变不出那么多嗓子
GPT-SoVITS 就是来解决这些问题的。它支持中文、英文、日语、韩语、粤语五种语言,你可以克隆自己的声音,也可以克隆别人的声音(注意要拿到授权哦),甚至能创造出全新的角色声音。
长什么样
打开 GPT-SoVITS 后,你会看到一个网页界面(它会在你电脑的浏览器里运行,地址通常是 http://localhost:9874)。界面主要分几个区域:
- 顶部标签页:切换不同功能,比如「0-前置数据集获取工具」(处理你的录音)、「1-GPT-SOVITS-TTS」(合成声音)
- 左侧:上传参考音频(你录的那 1 分钟)和填写参考文字
- 中间:输入要让 AI 朗读的文字
- 右侧/底部:选择语言、调整语速,点击「合成」按钮
界面是中文的,按钮也都标得很清楚,不用怕看不懂。
怎么安装
安装稍微有点技术含量,但跟着步骤走就行。你需要一台 Windows 电脑(建议有 NVIDIA 显卡,没有也能跑,只是慢一点)。
- 下载整合包:去项目页面找到「Windows 整合包」下载链接(作者贴心地打包好了一切),下载后解压到一个没有中文、没有空格的文件夹,比如
D:\GPT-SoVITS - 双击启动:进入解压后的文件夹,找到
go-webui.bat这个文件,双击它 - 等待启动:会弹出一个黑色命令行窗口(别关它),等它显示「Running on local URL」就成功了
- 打开界面:浏览器会自动打开,或者你手动访问
http://localhost:9874
如果你会用命令行(就是那个黑窗口),也可以用 Python(一种编程语言)方式安装:先 git clone https://github.com/RVC-Boss/GPT-SoVITS.git 下载代码,再 pip install -r requirements.txt 安装依赖,最后 python webui.py 启动。但对新手来说,强烈建议直接用整合包,省事 10 倍。
怎么用
来,咱们走一遍完整流程,目标是「用我的声音读一段话」。
- 准备录音:用手机或电脑录一段你朗读的文字,1-5 分钟最佳,环境要安静。比如你录一段读新闻的声音,保存为
my_voice.wav - 上传参考音频:在「1-GPT-SOVITS-TTS」标签页,把
my_voice.wav拖进「参考音频」框 - 填写参考文本:在「参考文本」框里,一字不差地输入你录音里说的话(这一步是告诉 AI 这段声音对应什么文字)
- 选择语言:参考音频选「中文」,要合成的文字也选「中文」
- 输入目标文本:在「需要合成的文本」框里,输入你想让 AI 读的内容,比如「大家好,欢迎观看本期视频」
- 点击合成:点「合成」按钮,等几秒到几十秒,下方会出现音频播放器,点播放就能听到「你的声音」在说这段话了
- 下载音频:满意的话,右键播放器选「另存为」就能保存成音频文件
小技巧:参考音频的情绪会延续到合成结果。如果你录音时很开心,合成出来的声音也会很欢快。
需要 AI 模型吗?
需要的。GPT-SoVITS 本身就是一个 AI 模型,整合包里已经自带了预训练模型(可以理解为「已经学会说话的 AI 大脑」),下载好就能直接用,不需要你额外去申请什么 API Key(一串用来调用 AI 服务的密码)。
但如果你想克隆一个全新的声音(不是用现成的),就需要先用你的录音「训练」一下模型,这个过程会调用本地的 AI 算力。如果你想了解更多 AI 模型的选择,或者想搭配其他 AI 工具一起用,可以去模型导航挑一个适合你的 AI 助手 →
费用
完全免费。GPT-SoVITS 是开源项目,所有功能都不收钱,也没有使用次数限制。你唯一的「成本」就是一台性能还行的电脑(建议 8GB 以上内存,有独立显卡更好)。商用也是允许的,但要遵守项目协议,并且克隆别人声音必须获得本人授权。
适合谁
- 短视频创作者:批量生成配音,不用每次都自己录音
- 有声书/广播剧爱好者:一个人就能配出多个角色
- 多语言内容创作者:用同一个声音说五种语言
- 游戏/动画开发者:低成本制作角色语音
- 想保存亲人声音的普通人:把家人的声音「留」下来读故事
项目地址
GitHub 地址:https://github.com/RVC-Boss/GPT-SoVITS
项目页面有详细的安装文档、整合包下载链接和常见问题解答,遇到问题可以先去那里翻翻。5.9 万星的社区非常活跃,更新也很勤快。