
3 分钟救回被噪音毁掉的录音ClearerVoice-Studio AI 语音处理上手指南【免费下载链接】ClearerVoice-StudioAn AI-Powered Speech Processing Toolkit and Open Source SOTA Pretrained Models, Supporting Speech Enhancement, Separation, and Target Speaker Extraction, etc.项目地址: https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio如果你正被录音里的空调声、键盘声、背景人声折磨这篇文章是写给你的。ClearerVoice-Studio 是一款开源的 AI 语音处理工具包几行代码就能完成语音增强、人声分离、音质提升等操作免费开源新手也能快速上手。先讲个真实场景凌晨一点录音废了上周我熬夜剪一期播客剪到凌晨一点导出回放才发现整段人声背后全是空调的嗡嗡声和敲键盘的哒哒声。重新录嘉宾档期约不上了。花钱找人修报价高得离谱。后来同事丢给我一个开源项目说你跑两行命令试试。试完我愣住了——那段以为要报废的录音人声变得干净透亮背景噪音像被橡皮擦擦掉了一样。这个项目就是 ClearerVoice-Studio。一句话看懂它是声音界的AI 修图师美图软件给照片磨皮祛痘ClearerVoice-Studio 则给声音做同样的事自动识别并抹掉噪音、把混在一起的说话人分开、把模糊的音质变清晰。它由三部分组成ClearVoice开箱即用的推理入口加载预训练模型几行代码出结果Train面向开发者的训练与微调框架想定制自己的模型就看这里SpeechScore客观评测工具量化处理完到底变好了多少。内容创作者、想给产品加语音能力的开发者、只想抢救老录音的普通用户它都适用。处理前 vs 处理后一张表看懂它能做什么你的痛点对应任务现成预训练模型效果对比背景噪音太重语音增强FRCRN_SE_16K、MossFormerGAN_SE_16K、MossFormer2_SE_48KDNS 测试集 PESQ 从 1.58 提到 3.57多人说话分不清语音分离MossFormer2_SS_16K一次输出两条音轨LRS2-2Mix 上 SI-SNRi 达 15.5老录音音质发闷语音超分辨率MossFormer2_SR_48K16kHz/24kHz/32kHz 补全到 48kHz视频里只想要特定人声目标说话人提取AV_MossFormer2_TSE_16K结合画面人脸与口型提取目标声音换句话说从听不清到听清从混在一起到各归各位它全包了。四个真实场景手把手带你跑通开工前两条命令装好环境pip install clearvoice装好后在代码里写from clearvoice import ClearVoice即可开工。只处理 WAV 的话这步就够要处理 MP3、AAC、FLAC 等格式再补装一个 FFmpeg。想从源码安装或参与开发可以git clone https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio后进入clearvoice/目录执行pip install --editable .。仓库自带的demo.py、demo_with_more_comments.py可直接运行python demo.py就能看到完整效果。场景一会议录音去噪让领导听清你的汇报from clearvoice import ClearVoice myClearVoice ClearVoice(taskspeech_enhancement, model_names[MossFormer2_SE_48K]) output_wav myClearVoice(input_pathsamples/input.wav, online_writeFalse) myClearVoice.write(output_wav, output_pathsamples/output_enhanced.wav)大白话解释第一行创建了一个去噪器指定使用全频带模型 MossFormer2_SE_48K第二行把input.wav丢进去模型返回处理后的音频数据第三行把结果存成新文件。跑完直接播放对比噪音基本消失、人声完整保留模型文件会在首次运行时自动下载。这个语音降噪工具还提供 FRCRN_SE_16K、MossFormerGAN_SE_16K 两个 16kHz 版本前者更轻快、后者效果更佳按需挑选即可。场景二多人访谈人声分离把两把声音拆开myClearVoice ClearVoice(taskspeech_separation, model_names[MossFormer2_SS_16K]) output_wav myClearVoice(input_pathsamples/input_ss.wav, online_writeFalse) myClearVoice.write(output_wav, output_pathsamples/output_separated.wav)代码几乎没变只是把任务换成了speech_separation。它会将混在一起的两路人声分别输出为..._s1.wav和..._s2.wav相当于自动帮你分轨。在 LRS2-2Mix、WSJ0-2Mix 等公开基准上MossFormer2_SS_16K 的分离指标超过了 Conv-TasNet 等经典模型处于开源方案的第一梯队。场景三老旧录音的音频质量提升方法从糊到清采样率可以理解为声音的清晰度档位16kHz 相当于低清视频48kHz 才接近高清。MossFormer2_SR_48K 能把低采样率音频脑补到 48kHz让老录音丢失的高频细节回来。myClearVoice ClearVoice(taskspeech_super_resolution, model_names[MossFormer2_SR_48K]) output_wav myClearVoice(input_pathsamples/input_sr.wav, online_writeFalse) myClearVoice.write(output_wav, output_pathsamples/output_sr_48k.wav)如果音频又旧又吵可以先用增强模型去噪、再做超分辨率两步串起来就是一条完整的翻新流水线。场景四视频里只留下想听的那个人的声音多人同框说话时怎么只提取其中一人的声音AV_MossFormer2_TSE_16K 结合画面中的人脸与口型信息把目标说话人的声音从混合音轨里抠出来。传入视频目录即可批量处理支持 .avi/.mp4/.mov/.webmmyClearVoice ClearVoice(tasktarget_speaker_extraction, model_names[AV_MossFormer2_TSE_16K]) myClearVoice(input_pathsamples/path_to_input_videos_tse, online_writeTrue, output_pathsamples/path_to_output_videos_tse)此外项目还提供 Numpy 进 Numpy 出的接口见 demo_Numpy2Numpy.py方便把模型直接嵌进你自己的训练或推理管线。效果好不好让数字说话光靠耳朵不够客观。SpeechScore 模块提供 18 种评测指标最常用的四个PESQ感知语音质量约 0.5~4.5越大越好——MossFormerGAN_SE_16K 在 DNS-Challenge-2020 上把 PESQ 从 1.58 拉到 3.57STOI可懂度0~1越接近 1 越清楚DNSMOS神经网络打的 MOS 分1~5 分制SI-SDR信号失真比dB越高代表分离与增强越干净。评测代码同样一行启动SpeechScore([PESQ,STOI,DNSMOS,SISDR])传入测试音频与参考音频即可。其中 DNSMOS、NISQA 这类非侵入式指标甚至不需要干净参考直接给处理结果打分相当方便。进阶玩法与新手避坑指南想让模型适配自己的数据train/ 目录下有四类任务的完整训练脚本配置集中在train/speech_enhancement/config/train/等目录还附带自动合成带噪、带混响训练音频的数据生成脚本train/data_generation/。更硬核的是目标说话人提取支持用参考语音、人脸口型、身体姿态乃至脑电信号EEG作为提取条件。新手最常踩的坑有三个非 WAV 格式报错处理 MP3/AAC/FLAC 前先装 FFmpeg纯 WAV 不需要长音频卡顿或爆内存建议先切成 30~60 秒片段或用目录/列表批量处理online_writeTrue模型下载失败首次运行需联网自动拉取预训练模型网络不稳时可手动从 ModelScope 下载放到checkpoints目录。你可能担心的 3 件事① 不会写代码能用吗能。复制上面的代码、改一下文件路径就行demo_with_more_comments.py每步都有详细注释照着读就能懂。② 支持哪些系统和格式Windows、macOS、Linux 都能跑音频支持 wav、mp3、aac、flac、ogg、aiff 等十几种常见格式视频支持 avi、mp4、mov、webm。③ 效果真的靠谱吗预训练模型出自阿里巴巴语音实验室团队全部经过公开基准严格评测上文指标就是证据其中 FRCRN 去噪模型在 ModelScope 上已被调用超过 300 万次口碑经得起检验。现在就去试试3 分钟体验 AI 语音处理回到开头那个深夜剪播客的场景如果你硬盘里也躺着舍不得删又没法用的录音现在花 3 分钟就能给它第二次生命。装好clearvoice后跑一遍demo.py用samples/里的示例音频对比处理前 vs 处理后的差别你会回来收藏这篇文章的。想第一时间获取新模型和使用教程扫描下方二维码加入官方交流群和开发者、同好一起聊语音增强与处理心得如果你有更好的模型思路也欢迎通过 train/ 框架贡献代码让更多人用上更干净的声音。【免费下载链接】ClearerVoice-StudioAn AI-Powered Speech Processing Toolkit and Open Source SOTA Pretrained Models, Supporting Speech Enhancement, Separation, and Target Speaker Extraction, etc.项目地址: https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考