← 返回博主原创
BiFish original · 2026-07-25

GPT-SoVITS:录 1 分钟声音,AI 就能用你的嗓音读任何文字

短视频配音神器,零基础也能克隆自己的声音

它是什么

简单说,GPT-SoVITS 就是一个「声音复印机」。你只需要录一段自己说话的声音(最少 1 分钟就够了),它就能学会你的音色、语气、说话习惯,然后用「你的声音」去朗读任何你给它的文字。

这个项目在 GitHub(一个全球程序员分享代码的网站)上有 5.9 万颗星,是目前最火的开源(免费、代码公开)语音克隆工具之一。它把两个厉害的 AI 技术——GPT(擅长理解文字)和 SoVITS(擅长模仿声音)——结合在了一起,所以叫 GPT-SoVITS。

解决什么问题

你有没有遇到过这些烦恼?

  • 做短视频要配音,但自己普通话不标准、声音不好听
  • 想给小说做有声书,但请配音演员太贵(一分钟好几十块)
  • 想做多语言内容,但不会日语、韩语
  • 想给游戏角色配各种声音,但自己变不出那么多嗓子

GPT-SoVITS 就是来解决这些问题的。它支持中文、英文、日语、韩语、粤语五种语言,你可以克隆自己的声音,也可以克隆别人的声音(注意要拿到授权哦),甚至能创造出全新的角色声音。

长什么样

打开 GPT-SoVITS 后,你会看到一个网页界面(它会在你电脑的浏览器里运行,地址通常是 http://localhost:9874)。界面主要分几个区域:

  • 顶部标签页:切换不同功能,比如「0-前置数据集获取工具」(处理你的录音)、「1-GPT-SOVITS-TTS」(合成声音)
  • 左侧:上传参考音频(你录的那 1 分钟)和填写参考文字
  • 中间:输入要让 AI 朗读的文字
  • 右侧/底部:选择语言、调整语速,点击「合成」按钮

界面是中文的,按钮也都标得很清楚,不用怕看不懂。

怎么安装

安装稍微有点技术含量,但跟着步骤走就行。你需要一台 Windows 电脑(建议有 NVIDIA 显卡,没有也能跑,只是慢一点)。

  1. 下载整合包:去项目页面找到「Windows 整合包」下载链接(作者贴心地打包好了一切),下载后解压到一个没有中文、没有空格的文件夹,比如 D:\GPT-SoVITS
  2. 双击启动:进入解压后的文件夹,找到 go-webui.bat 这个文件,双击它
  3. 等待启动:会弹出一个黑色命令行窗口(别关它),等它显示「Running on local URL」就成功了
  4. 打开界面:浏览器会自动打开,或者你手动访问 http://localhost:9874

如果你会用命令行(就是那个黑窗口),也可以用 Python(一种编程语言)方式安装:先 git clone https://github.com/RVC-Boss/GPT-SoVITS.git 下载代码,再 pip install -r requirements.txt 安装依赖,最后 python webui.py 启动。但对新手来说,强烈建议直接用整合包,省事 10 倍。

怎么用

来,咱们走一遍完整流程,目标是「用我的声音读一段话」。

  1. 准备录音:用手机或电脑录一段你朗读的文字,1-5 分钟最佳,环境要安静。比如你录一段读新闻的声音,保存为 my_voice.wav
  2. 上传参考音频:在「1-GPT-SOVITS-TTS」标签页,把 my_voice.wav 拖进「参考音频」框
  3. 填写参考文本:在「参考文本」框里,一字不差地输入你录音里说的话(这一步是告诉 AI 这段声音对应什么文字)
  4. 选择语言:参考音频选「中文」,要合成的文字也选「中文」
  5. 输入目标文本:在「需要合成的文本」框里,输入你想让 AI 读的内容,比如「大家好,欢迎观看本期视频」
  6. 点击合成:点「合成」按钮,等几秒到几十秒,下方会出现音频播放器,点播放就能听到「你的声音」在说这段话了
  7. 下载音频:满意的话,右键播放器选「另存为」就能保存成音频文件

小技巧:参考音频的情绪会延续到合成结果。如果你录音时很开心,合成出来的声音也会很欢快。

需要 AI 模型吗?

需要的。GPT-SoVITS 本身就是一个 AI 模型,整合包里已经自带了预训练模型(可以理解为「已经学会说话的 AI 大脑」),下载好就能直接用,不需要你额外去申请什么 API Key(一串用来调用 AI 服务的密码)。

但如果你想克隆一个全新的声音(不是用现成的),就需要先用你的录音「训练」一下模型,这个过程会调用本地的 AI 算力。如果你想了解更多 AI 模型的选择,或者想搭配其他 AI 工具一起用,可以去模型导航挑一个适合你的 AI 助手 →

费用

完全免费。GPT-SoVITS 是开源项目,所有功能都不收钱,也没有使用次数限制。你唯一的「成本」就是一台性能还行的电脑(建议 8GB 以上内存,有独立显卡更好)。商用也是允许的,但要遵守项目协议,并且克隆别人声音必须获得本人授权。

适合谁

  • 短视频创作者:批量生成配音,不用每次都自己录音
  • 有声书/广播剧爱好者:一个人就能配出多个角色
  • 多语言内容创作者:用同一个声音说五种语言
  • 游戏/动画开发者:低成本制作角色语音
  • 想保存亲人声音的普通人:把家人的声音「留」下来读故事

项目地址

GitHub 地址:https://github.com/RVC-Boss/GPT-SoVITS

项目页面有详细的安装文档、整合包下载链接和常见问题解答,遇到问题可以先去那里翻翻。5.9 万星的社区非常活跃,更新也很勤快。

本文基于公开来源进行分析,AI 参与资料整理与初稿生成,最终由人工确认选题和发布。涉及产品能力、价格或政策时,请以原始来源的最新信息为准。