GPT-SoVITS 保姆级实战:1分钟录音克隆专属音色

发布时间:2026/8/30 20:56:45
GPT-SoVITS 保姆级实战:1分钟录音克隆专属音色 GPT-SoVITS 保姆级实战1分钟录音克隆专属音色【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一个少样本语音合成与语音克隆项目给一段 5 秒参考音频即可零样本合成语音用 1 分钟录音微调后音色相似度和自然度会再上一个台阶。本文面向没有训练经验的新手带你从零跑通安装、数据处理、模型微调到推理合成的完整链路全部命令都来自仓库内实际脚本。先选路线5秒零样本还是1分钟微调在动手装环境之前先搞清楚自己走哪条路线这决定了后面每个步骤要做什么。GPT-SoVITS 提供两档能力。零样本只传一段约 5 秒的参考音频和它的文本不训练直接在推理界面出声音适合现在就要的场景。少样本微调准备约 1 分钟的干净录音走一遍切片、识别、训练流程得到属于这个音色的 GPT 权重和 SoVITS 权重效果更稳README 中描述为1 min voice data can also be used to train a good TTS model。两档路线都覆盖中文、英语、日语、韩语、粤语语言代码zh/en/ja/ko/yue并且支持跨语言推理即训练数据是中文、推理时合成英文。模型内部是一条两段式流水线GPT 部分把文本预测成语义 tokenSoVITS 部分再把 token 还原成声学特征并合成波形v3/v4 的声码器基于 BigVGAN。你不需要理解每个模块只需要记住文本进、波形出中间调参就两个旋钮参考音频和采样参数。官方给出的推理速度RTF越低越快4090 上 0.0141400 字约 4 分钟的语音只花 3.36 秒、4060Ti 上 0.028、M4 CPU 上 0.526。版本怎么选先记住这张表版本关键特性来自 README Release Notes适合谁v12k 小时预训练基础架构老项目迁移v2预训练扩到 5k 小时新增韩语/粤语低质量参考音频更稳新手首选v3/v4音色相似度更高、GPT 更稳v4 原生输出 48k 并修复 v3 金属感高质量录音、追求音质v2Pro/Plus性能接近 v4硬件开销和速度接近 v2显存有限的显卡README 里有一句很实用的提示训练集平均音质一般时v1/v2/v2Pro 能出可用结果而 v3/v4 未必。所以录音环境不好先别上 v4。十分钟装好环境conda 一条 install.sh 命令这一节解决从下载代码到浏览器打开 WebUI的全部动作。装完你会得到端口 9874 上的主界面后面所有操作都在这个页面里完成。先克隆仓库并建好 Python 3.10 环境然后一条install.sh装完 PyTorch、依赖和预训练模型git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS conda create -n GPTSoVits python3.10 conda activate GPTSoVits bash install.sh --device CU128 --source HF说明--device按你的环境填CU126|CU128|ROCM|MPS|CPU--source选模型下载源HF|HF-Mirror|ModelScope。脚本的完整参数可以直接跑bash install.sh查看帮助出错时会打印失败行号和调用栈方便定位。Windows 用户可以不敲命令README 提供了一键集成包下载后双击go-webui.bat即可启动。Mac 官方提醒一句GPU 训练的音质明显低于其他设备因此 macOS 上暂时推荐用 CPU--device MPS或CPU。install.sh成功后模型已就位如果手动安装需要把三组文件放对地方主预训练模型 →GPT_SoVITS/pretrained_models中文 TTS 用的 G2PW 文本处理模型 →GPT_SoVITS/text解压后改名为G2PWModelUVR5 人声分离模型 →tools/uvr5/uvr5_weights官方验证过的环境组合摘自 README照这个对齐基本不出错PythonPyTorch设备3.10 / 3.112.5.1CUDA 12.43.112.7.0CUDA 12.83.9 / 3.112.5.1 / 2.7.0Apple silicon3.92.2.2CPU环境就绪后启动主界面python webui.py浏览器会打开 9874 端口的主 WebUI。如果要用 Docker仓库根目录的docker-compose.yaml定义了四个服务选一个跑即可docker compose run --service-ports GPT-SoVITS-CU128其中带-Lite的镜像不含 ASR 和 UVR5 模型体积更小README 提醒 Windows Docker Desktop 用户把shm_size调大如16g否则容易出怪问题。端到端交付从一段录音到可合成的音色这一节是全文主线假设你手里有一段 1 分钟的干净录音走完这六步推理界面就能用这个音色说话了。主 WebUI 里这些功能都有对应按钮顺序就是界面上从左到右的排列。第 1 步填录音路径。在主界面输入音频目录路径支持单个文件或整个文件夹。第 2 步切片。长录音先自动切成适合训练的小片段按音量曲线在静音处下刀阈值、最短时长、最短间隔都有默认值新手直接点开始切片即可。命令行等价物是tools/slice_audio.py。第 3 步降噪可选。录音有底噪或混响时先跑降噪底层是tools/cmd-denoise.pyWebUI 上有按钮。第 4 步语音识别ASR。识别结果直接生成标注文件。WebUI 里默认走 FunASR 系模型首次使用自动下载命令行版本是python tools/asr/funasr_asr.py -i 输入目录 -o 输出目录 -l zh第 5 步校对文本。这是最容易被跳过但最影响效果的一步。ASR 会错尤其是人名、专有名词和口语语气词错一句文本模型就会学到一句错音。主界面有专门的标注校对页SubFix WebUI9871 端口逐条听、逐条改。第 6 步训练。点完开始训练后后台实际做了三件事文本分词与 BERT 特征提取1-get-text.py、HuBERT 自监督特征提取2-get-hubert-wav32k.py、语义 token 提取3-get-semantic.py然后分别训练 GPTs1和 SoVITSs2产物保存在logs目录和GPT_weights_*、SoVITS_weights_*目录下。最终交付物是一个.list标注文件加一对权重。标注格式仓库里写得很直白每行四段用竖线分隔D:/GPT-SoVITS/mydata/xxx.wav|xxx|zh|今天天气真不错。格式是音频路径|说话人|语言|文本。训练完成后切到推理页签路径是1-GPT-SoVITS-TTS/1C-inference选中刚训出的权重输入参考音频和目标文本点合成就拿到第一段克隆音色的语音了。微调参数怎么调batch size、epoch 与版本选择训到一半爆显存、或者训完音色不像九成是这几个参数没对上。这一节只讲主 WebUI 上暴露的旋钮每个都有代码里的默认值可查。batch_size不用手填。webui.py会读你的显存自动计算v2 系列按显存GB//2取v3/v4 按显存GB//8取因为 v3/v4 声码器更大。如果关闭了半精度fp16实际 batch 还会再除以 2。所以显存不够时先想是不是 fp16 被关了而不是直接硬降。epochv2 系列默认 8 轮、每 4 轮存一次v3/v4 默认 2 轮、每轮存一次webui.py里 v3/v4 的上限被压到 16 并配了句注释训太多作死。小数据集过拟合的迹象是声音越训越怪遇到就少训几轮、挑靠前的权重。text_low_lr_rate默认 0.4见GPT_SoVITS/configs/s2.json控制文本嵌入层的学习率缩放保持默认即可。v3/v4 专属lora_rank 与 grad_ckptv3/v4 的 SoVITS 训练入口是GPT_SoVITS/s2_train_v3_lora.py走 LoRA 微调界面提供lora_rank和梯度检查点grad_ckpt开关显存紧张时开grad_ckpt是最省事的省显存手段。参数代码里的默认值什么时候动它batch_size按显存自动v2: GB/2v3/v4: GB/8OOM 时减半epochsv2 系 / v3-v48 / 2音色不像就换早期权重不是加轮数fp16is_half支持 fp16 的卡自动开启关了它 batch 自动减半text_low_lr_rate0.4一般不动lora_rankv3/v4界面可调显存富余可加大完整超参数以GPT_SoVITS/configs/下的s1longer-v2.yaml和s2.json为准WebUI 会自动把它们打包成训练配置。推理界面top_k、top_p、temperature 怎么拨训好权重只是拿到原料合成页面上那几个滑块决定最终听感。默认值就藏在界面里top_k15、top_p1、temperature1见GPT_SoVITS/inference_webui.py的滑块初始值。调参口诀一句话声音复读、漏字就把 top_k 调大、temperature 调低声音呆板、机械感重就把 temperature 调高。top_p 平时保持 1 不动只留一个变量方便你听差异。参考音频的选择比滑块更影响结果。v3/v4 的合成音色明显偏向参考音频本身README 原话是 v3/v4 lean more toward the reference audio所以给 5 秒干净、情绪平稳的参考比调十轮参数更有效。日常使用直接开主 WebUI 的推理页签即可需要命令行启动或者想要批量加速推理用下面这个入口inference_webui_fast.py是批量加速版主界面有开关python GPT_SoVITS/inference_webui.py推理界面默认跑在 9872 端口。踩坑速查表常见症状与适用边界排错最快的方式是先对号入座。下面这些症状在仓库代码和 README 里都有出处按顺序查一遍症状原因解法启动时打印以下模型不存在install.sh没跑完或模型源没下全重跑install.sh核对--source与网络Mac 上 GPU 训完音质差官方说明 Mac GPU 训练质量低于其他设备按 README 建议改用 CPU 训练Docker 行为诡异Windows 默认共享内存太小compose 里把shm_size调到16g训练 OOMbatch 太大或 fp16 被关降 batch、开grad_ckpt、确认半精度开启v3/v4 合成有金属感或音质翻车录音平均质量一般换 v2Pro 系列底模重训再明确一下什么时候不该用 GPT-SoVITS语言不在五选一目前推理支持中、英、日、韩、粤其他语种不在支持范围内。录音又短又脏只有几秒还带 BGM 和回声先过 UVR5 人声分离和降噪再谈训练直接硬训大概率翻车。要大规模多语言商业级配音跨语言推理是可用而非母语级效果以官方演示为准。纯 CPU 且要低延迟M4 CPU 上 RTF 0.526 说明 CPU 也能快于实时但弱核 x86 体验会明显下降建议用 8GB 以上显存的卡。下一步接 API、看源码与继续深入到这里你手上已经有了一个能用的音色。按需求往下走想集成到自己的程序用 api_v2.py 起服务默认端口 9880把 WebUI 里的合成能力变成 HTTP 接口。没有本地显卡仓库自带Colab-WebUI.ipynb在 Colab 上跑同样的流程。想看中文完整使用文档docs/cn/README.md 有比 README 更细的操作说明更新日志见docs/en/Changelog_EN.md。想搞懂原理GPT 部分在 GPT_SoVITS/AR/models/t2s_model.py是主干声码器在GPT_SoVITS/BigVGAN/bigvgan.py文本前端在GPT_SoVITS/text/。现在打开终端敲下conda create -n GPTSoVits python3.10然后按第二节的五连命令把环境装完。十分钟后浏览器会停在 9874 端口的主界面上从填录音路径那个按钮开始一路点到底。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻