>_ DevTrendspt

Idioma

Início

Linguagens

Seções

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embarcados Segurança
Python

ElevenLabs local no seu próprio hardware com o VoiceStudio

Recentemente precisei narrar alguns dezenas de vídeos tutoriais e cortar legendas. Minha primeira ideia foi usar serviços de nuvem como ElevenLabs. Mas quando você calcula o custo da assinatura de equipe e percebe que áudios de rascunho e materiais confidenciais serão enviados para servidores externos, o entusiasmo desaparece.

VoiceStudio (anteriormente OmniVoice-Studio) tem ganhado popularidade no GitHub. É um aplicativo desktop para síntese de fala, clonagem de voz, transcrição e dublagem que roda localmente.

Logo do VoiceStudio

Sem tokens, créditos de geração ou vinculação obrigatória de cartão. Você baixa o app, ele baixa os pesos do modelo necessários, e todo o processamento roda na sua GPU ou CPU.

O que o aplicativo pode fazer

O repositório reúne quase todos os desenvolvimentos notáveis de áudio open-source dos últimos tempos. Em vez de subir várias dezenas de notebooks Jupyter separados ou lidar com versões incompatíveis do PyTorch, você obtém uma GUI pronta e um servidor local.

Alternando motores no VoiceStudio

Aqui estão os principais cenários que o programa cobre:

  1. Clonagem de voz. Funciona em modo zero-shot: você pega um clipe de áudio de referência curto de 5–15 segundos sem ruído ou música, digita o texto e obtém uma faixa pronta com o mesmo timbre.
  2. Design de voz. Se você não tem uma amostra pronta, os parâmetros são definidos via texto: idade, sotaque, tom, coloração emocional ou peculiaridades de fala.
  3. Dublagem automática de vídeo. A ferramenta pode reconhecer a fala no vídeo, traduzir, separar os falantes via diarização, sobrepor a voz sintetizada na faixa original e exportar imediatamente o arquivo finalizado.
  4. Audiolivros e histórias longas. Você pode fazer upload de um arquivo em formato EPUB ou PDF, distribuir falas entre diferentes narradores virtuais, renderizar capítulos e montar o livro final em formato MP3.
  5. Widget de diktação do sistema. Pressionar uma tecla de atalho global transcreve a voz do microfone em texto em tempo real, e um modelo de linguagem local pode limpar imediatamente palavras de preenchimento e adicionar pontuação.

O catálogo de modelos integrado permite alternar entre 16 mecanismos de síntese e 11 mecanismos de reconhecimento em tempo real com uma combinação de teclas.

Catálogo de modelos e galeria de vozes

Por baixo do capô e no terminal

A arquitetura do projeto é bem pensada. Os desenvolvedores não envolveram tudo em um Electron pesado.

  • Shell desktop: Tauri v2 em Rust, que gerencia a bandeja do sistema, chamadas de teclas de atalho e gerenciamento de processos em segundo plano.
  • Interface: React com bundler Vite e gerenciador de estado Zustand.
  • Backend: FastAPI em Python, subindo na porta 8000. Dentro dele rodam adaptadores de modelo, filas de tarefas e um banco de dados SQLite com migrações via Alembic.

Entre os mecanismos de síntese de fala, é reivindicado suporte para 646 idiomas via k2-fsa/OmniVoice, CosyVoice 3, GPT-SoVITS, VoxCPM2, PocketTTS e MOSS-TTS. Para transcrição, WhisperX, Faster-Whisper, Parakeet TDT e FunASR estão disponíveis. Faixas de áudio são separadas com Demucs quando necessário, e falantes são identificados via Pyannote.

Se você não precisa da interface e quer gerar áudio a partir de scripts, o backend expõe uma API compatível com OpenAI. Basta redirecionar a URL base no seu cliente:

base_url="http://localhost:8000/v1"

Além da API REST padrão, WebSocket, Server-Sent Events e MCP (Model Context Protocol) são suportados. Isso significa que síntese e reconhecimento de fala podem ser chamados diretamente como uma ferramenta para agentes de IA em Claude Code ou Cursor.

Requisitos de hardware e instalação

Para um início rápido, os autores prepararam builds prontos:

  • macOS: Pacote DMG para Apple Silicon (backends MPS e MLX são suportados). Em processadores Intel antigos, o backend local não funcionará.
  • Windows: Instalador MSI para sistemas 64-bit com aceleração CUDA.
  • Linux: Pacote AppImage e containers Docker prontos com suporte a CUDA e ROCm.

Na primeira execução, o programa configura automaticamente um ambiente Python isolado e baixa o modelo base.

O mínimo para trabalho confortável é 8 GB de RAM e 4 GB de memória de vídeo ao rodar na GPU. Se não houver GPU, os modelos base também funcionam na CPU, mas gerar segmentos longos levará perceptivelmente mais tempo. Para modelos pesados como CosyVoice 3, é melhor ter uma placa com 8–16 GB de VRAM.

Se você quiser rodar o projeto a partir do código-fonte, você precisará de git e Python:

git clone https://github.com/...

Para rodar apenas a interface web no navegador, use o comando python -m app.

Para quem será útil

O projeto certamente atrairá qualquer pessoa que trabalha regularmente com conteúdo de áudio mas não quer vazar dados para nuvens externas. É uma ótima descoberta para localização de podcasts, narração automatizada de documentação, dublagem de jogos indie ou transcrição rápida de reuniões locais sem limites de duração.

O código é distribuído sob a licença AGPL-3.0, e os modelos base são distribuídos sob Apache-2.0. Se você tem procurado um combi de áudio independente para seu desktop, o VoiceStudio definitivamente vale a pena instalar e experimentar.

Projetos relacionados