Voice Clone Studio 将所有热门语音神经网络汇聚于一窗
如果你曾经尝试过搭建本地语音合成或语音克隆环境,你一定记得那种依赖地狱般的体验。一个模型需要 PyTorch 2.1 搭配旧版 torchaudio 库,另一个要求全新的 CUDA 构建,第三个又需要单独的 ONNX Runtime 版本。结果就是磁盘上堆了五个虚拟环境,每个都带着随机端口的 Gradio 界面。
昵称为 FranckyB 的开发者决定终结这种混乱,发布了 Voice Clone Studio 项目。它本质上是一个模块化的一站式工具,将 Qwen3-TTS、Microsoft VibeVoice、Fish Speech、LuxTTS、Resemble AI Chatterbox 和 MMAudio 音效生成器整合到了一起。
这个工具能做什么
无需再开着五个标签页运行不同的脚本,这里所有功能都按标签页划分,数据管道统一。
语音克隆与情感控制
基本使用场景很简单:上传一段 3–10 秒的音频样本,输入原始转写文本,然后获取结果。但妙处在于可以通过下拉菜单随时切换引擎:
- Qwen3-TTS(0.6B 和 1.7B 两种规格)
- VibeVoice(1.5B,完整模型和 4 位量化版本)
- Fish Speech S2 Pro,40 亿参数
- LuxTTS 和 Chatterbox
如果选择 Fish Speech 引擎,可以直接在文本中插入语调标签,如 [whisper]、[laughing] 或 [excited]。系统支持超过 15000 个这样的标记。开发者还做了一个贴心的设计:切换回 Qwen 或 VibeVoice 时,标签会自动从文本中移除后再发送给模型,这样脚本就不会出问题了。
播客对话场景
最有趣的标签页之一是 Conversation(对话)。它专为多人长对话设计。
脚本采用统一的文本格式编写:
[1]: Привет, как продвигается проект?
[2]: Отлично, только что собрал окружение без конфликтов.
[3]: Можно к вам присоединиться?
Qwen 模式下有 9 个内置旁白可选,旁白之间的停顿可调节。切换到 VibeVoice 模式则可生成最长 90 分钟的连续音频,支持四个说话者使用你自己的语音样本。模型会自动处理重音,有时甚至会加入细微的环境房间噪音以增强真实感。
文本描述生成语音
当没有现成的音频文件用于克隆时,基于 Qwen3-TTS 的 Voice Design 标签页就派上用场了。你只需用文字描述想要的角色特征:年龄、性别、情感基调、轻微的英式口音,或者安静而阴险的说话方式。神经网络会从零开始生成一个独特的音色。
变声与音效
Voice Changer 模块基于 Chatterbox 工作,采用语音到语音转换方式。你可以对着麦克风说话,从已保存的样本中选择目标音色,模型会用不同的声音重新录制你的语音,同时保留原始的节奏和语调。
为了视频配音,项目加入了 MMAudio。你要么输入声音的文本描述,要么直接丢入一段没有音频的视频片段。神经网络会分析视频内容,在 44.1 kHz 质量下生成同步的音效。
数据准备与微调
Voice Clone Studio 内置了音频预处理工作区(Prep Audio)。你可以放入一个长视频,提取音轨,通过 DeepFilterNet 降噪,标准化音量,并使用 Qwen3-ASR 或 Whisper 自动将文件切割成句子。
这里还有 Train Custom Voices 模块。如果短样本的基础克隆不够用,项目会启动本地 LoRA 微调,支持 VibeVoice 或 Qwen。界面会显示 loss 曲线和 epoch 进度,训练好的权重会直接落入预设文件夹。在支持 CUDA 的 GPU 上,小数据集的训练需要 10 到 30 分钟。
底层架构
项目架构是模块化的。主脚本 voice_clone_studio.py 只有约 230 行,会从 modules/core_components/tools/ 目录动态加载标签页。不需要的模型或重型标签页可以在设置中禁用,避免界面和内存被拖累。
一些值得关注的技术方案:
- CUDA Graphs 加速支持(Faster-Qwen3-TS 项目),为 Qwen 带来 5–10 倍的推理加速。
- 模型跨 GPU 分配。如果你的系统有两块 GPU,可以把语音生成放在一张卡上,ASR 识别和本地 LLM 放在第二张卡上。
- 内置 Prompt Manager。它连接到本地 llama.cpp 或 Ollama 服务器,下载 GGUF 模型,帮助你在界面内直接生成对话或系统提示词。
启动与注意事项
最低舒适门槛是 NVIDIA 显卡 8GB 显存。在 macOS 上项目也可以通过 MPS(Apple Silicon)运行,但训练标签页会自动隐藏,因为训练功能专注于 CUDA。
Linux 快速启动如下:
git clone https://github.com/FranckyB/Voice-Clone-Studio.git
cd Voice-Clone-Studio
chmod +x setup-linux.sh
./setup-linux.sh
./launch.sh
Windows 有现成的 setup-windows.bat,如果你不想在系统上直接安装 SOX 和 FFMPEG,也可以使用 Docker Compose 配置。
几个实用的细节需要注意:
- 推荐使用 Python 3.11。3.12 版本可能在构建 DeepFilterNet 降噪库的 wheel 时出现问题。
- Linux 和 macOS 用户应避免安装
openai-whisper包,因为会导致环境冲突。VibeVoice ASR 和 Qwen3 ASR 作为默认选项运行良好。 - 任何样本的首次生成都会有延迟,因为语音提示需要缓存,但后续行会明显更快地组装完成。
谁会需要这个项目
Voice Clone Studio 解决了三个明确的需求。首先,对于想在同一音频素材上比较 VibeVoice、Qwen3 和 Fish Speech 质量、但不想跟控制台打交道的人来说,这是一个绝佳的测试平台。其次,播客和有声书创作者会欣赏 Conversation 模块的 90 分钟生成能力。第三,它是一个现成的工作站,可以用来准备数据集和训练自定义语音模型,无需编写训练脚本。
相关项目