>_ DevTrendszh

语言

首页

语言

板块

前端 后端 移动端 DevOps AI / ML 游戏开发 区块链 嵌入式 安全
Python

在自有硬件上使用 VoiceStudio 实现本地化 ElevenLabs 级语音合成

最近我需要为几十个教程视频配音并剪辑字幕。最初的想法是使用 ElevenLabs 等云服务。但当你算了一下团队订阅费用,并且意识到草稿音频和机密材料将被发送到外部服务器时,热情就消退了。

VoiceStudio(原名 OmniVoice-Studio)在 GitHub 上越来越受欢迎。这是一个用于语音合成、声音克隆、转录和配音的桌面应用程序,可在本地运行。

VoiceStudio logo

无需令牌、无需生成积分、无需绑定信用卡。下载应用程序后,它会拉取必要的模型权重,所有处理都在您的 GPU 或 CPU 上运行。

该应用能做什么

该仓库汇集了近年来几乎所有值得关注的开源音频开发成果。无需启动十几个独立的 Jupyter notebook 或处理不兼容的 PyTorch 版本,您就能获得一个现成的 GUI 和本地服务器。

Switching engines in VoiceStudio

以下是程序涵盖的主要场景:

  1. 声音克隆。支持零样本模式工作:您只需提供一段 5-15 秒的无噪音、无音乐的参考音频片段,输入文本,即可获得具有相同音色的现成音轨。
  2. 语音设计。如果没有现成的样本,可以通过文本设置参数:年龄、口音、音调、情感色彩或言语习惯。
  3. 自动视频配音。该工具可以识别视频中的语音、翻译内容、通过说话人分离技术区分不同说话者、将合成语音叠加在原始音轨上,并立即导出成品文件。
  4. 有声书和长篇故事。您可以上传 EPUB 或 PDF 格式的文件,在不同的虚拟叙述者之间分配台词,渲染章节,并将最终书籍组装成 MP3 格式。
  5. 系统听写小部件。按下全局热键即可将麦克风语音实时转录为文本,本地语言模型可以立即清理填充词并添加标点符号。

内置模型目录让您可以通过组合键在 16 种合成引擎和 11 种识别引擎之间即时切换。

Model catalog and voice gallery

底层架构与终端使用

项目架构设计精良。开发者没有用笨重的 Electron 包装一切。

  • 桌面外壳:Tauri v2(使用 Rust 编写),负责系统托盘、热键调用和后台进程管理。
  • 界面:React 配合 Vite 打包器和 Zustand 状态管理器。
  • 后端:Python 中的 FastAPI,在 8,000 端口上启动。内部运行模型适配器、任务队列,以及通过 Alembic 进行迁移的 SQLite 数据库。

在语音合成引擎中,通过 k2-fsa/OmniVoice、CosyVoice 3、GPT-SoVITS、VoxCPM2、PocketTTS 和 MOSS-TTS 声称支持 646 种语言。转录方面则提供 WhisperX、Faster-Whisper、Parakeet TDT 和 FunASR。在需要时使用 Demucs 分离音轨,通过 Pyannote 进行说话人识别。

如果您不需要界面,想从脚本生成音频,后端会暴露一个 OpenAI 兼容的 API。只需在您的客户端中重定向基础 URL:

base_url="http://localhost:8000/v1"

除了标准 REST API 外,还支持 WebSocket、Server-Sent Events 和 MCP(Model Context Protocol)。这意味着语音合成和识别可以作为工具直接供 Claude Code 或 Cursor 中的 AI 代理调用。

硬件要求与安装

为了快速上手,作者准备了现成的构建版本:

  • macOS:适用于 Apple Silicon 的 DMG 安装包(支持 MPS 和 MLX 后端)。在旧的 Intel 处理器上,本地后端无法运行。
  • Windows:适用于 64 位系统的 MSI 安装程序,支持 CUDA 加速。
  • Linux:AppImage 包和现成的 Docker 容器,支持 CUDA 和 ROCm。

首次启动时,程序会自动设置隔离的 Python 环境并下载基础模型。

舒适使用的最低要求是 8 GB 内存和在 GPU 上运行时的 4 GB 显存。如果没有 GPU,基础模型也可以在 CPU 上运行,但生成长片段会明显花费更多时间。对于 CosyVoice 3 等重型模型,最好配备 8-16 GB 显存的显卡。

如果您想从源码运行项目,需要准备 git 和 Python:

git clone https://github.com/...

要仅在浏览器中运行 Web 界面,请使用命令 python -m app。

适用人群

该项目显然会受到任何定期处理音频内容但又不想将数据泄露到外部云端的人的青睐。对于播客本地化、自动文档配音、独立游戏配音,或无时长限制的本地会议转录来说,这是一个绝佳的选择。

代码采用 AGPL-3.0 许可证分发,基础模型采用 Apache-2.0。如果您一直在寻找桌面独立音频组合工具,VoiceStudio 绝对值得安装和尝试。

相关项目