>_ DevTrendspl

Język

Strona główna

Języki

Sekcje

Frontend Backend Mobilne DevOps AI / ML GameDev Blockchain Systemy wbudowane Bezpieczeństwo
Python

Lokalny ElevenLabs na własnym sprzęcie z VoiceStudio

Ostatnio musiałem nagrać lektor do kilkudziesięciu filmów instruktażowych i przyciąć napisy. Moim pierwszym pomysłem było skorzystanie z usług chmurowych takich jak ElevenLabs. Ale gdy policzysz koszt subskrypcji zespołowej i uświadomisz sobie, że robocze nagrania i poufne materiały będą wysyłane na zewnętrzne serwery, entuzjazm szybko gaśnie.

VoiceStudio (dawniej OmniVoice-Studio) zyskuje popularność na GitHubie. To desktopowa aplikacja do syntezy mowy, klonowania głosu, transkrypcji i dubbingu, która działa lokalnie.

Logo VoiceStudio

Żadnych tokenów, kredytów generacyjnych ani obowiązkowego podpinania karty. Pobierasz aplikację, pobiera ona niezbędne wagi modelu, a całe przetwarzanie odbywa się na Twoim GPU lub CPU.

Co potrafi aplikacja

Repozytorium łączy niemal wszystkie godne uwagi open-source'owe rozwiązania audio z ostatnich lat. Zamiast uruchamiać dziesiątki osobnych notebooków Jupyter lub zmagać się z niekompatybilnymi wersjami PyTorch, otrzymujesz gotowy interfejs GUI i lokalny serwer.

Przełączanie silników w VoiceStudio

Oto główne scenariusze, które program obejmuje:

  1. Klonowanie głosu. Działa w trybie zero-shot: bierzesz krótki, 5–15-sekundowy klip audio referencyjny bez szumów ani muzyki, wpisujesz tekst i otrzymujesz gotowy utwór z tym samym tembrem.
  2. Projektowanie głosu. Jeśli nie masz gotowego sampla, parametry ustawiasz za pomocą tekstu: wiek, akcent, ton, zabarwienie emocjonalne lub cechy mowy.
  3. Automatyczny dubbing wideo. Narzędzie rozpoznaje mowę w filmie, tłumaczy ją, rozdziela mówców poprzez diarizację, nakłada syntetyzowany głos na oryginalną ścieżkę i od razu eksportuje gotowy plik.
  4. Audiobooki i długie historie. Możesz wgrać plik w formacie EPUB lub PDF, rozdzielić linie między różnych wirtualnych narratorów, wyrenderować rozdziały i złożyć finalną książkę w formacie MP3.
  5. Widget dyktowania systemowego. Naciśnięcie globalnego skrótu klawiszowego transkrybuje głos z mikrofonu na bieżąco na tekst, a lokalny model językowy może od razu oczyścić wypełniacze i dodać interpunkcję.

Wbudowany katalog modeli pozwala przełączać się między 16 silnikami syntezy i 11 silnikami rozpoznawania mowy na bieżąco za pomocą kombinacji klawiszy.

Katalog modeli i galeria głosów

Pod maską i w terminalu

Architektura projektu jest przemyślana. Deweloperzy nie owinęli wszystkiego w ciężki Electron.

  • Desktop shell: Tauri v2 w Rust, który obsługuje tackę systemową, wywołania skrótów klawiszowych i zarządzanie procesami w tle.
  • Interfejs: React z bundlerem Vite i menedżerem stanu Zustand.
  • Backend: FastAPI w Pythonie, uruchamiający się na porcie 8000. Wewnątrz działają adaptery modeli, kolejki zadań i baza danych SQLite z migracjami przez Alembic.

Wśród silników syntezy mowy deklarowane jest wsparcie dla 646 języków poprzez k2-fsa/OmniVoice, CosyVoice 3, GPT-SoVITS, VoxCPM2, PocketTTS i MOSS-TS. Do transkrypcji dostępne są WhisperX, Faster-Whisper, Parakeet TDT i FunASR. Ścieżki audio rozdzielane są przez Demucs w razie potrzeby, a mówcy identyfikowani przez Pyannote.

Jeśli nie potrzebujesz interfejsu i chcesz generować audio ze skryptów, backend udostępnia API kompatybilne z OpenAI. Wystarczy przekierować base URL w swoim kliencie:

base_url="http://localhost:8000/v1"

Oprócz standardowego REST API obsługiwane są również WebSocket, Server-Sent Events i MCP (Model Context Protocol). Oznacza to, że synteza i rozpoznawanie mowy mogą być wywoływane bezpośrednio jako narzędzie dla agentów AI w Claude Code lub Cursor.

Wymagania sprzętowe i instalacja

Do szybkiego startu autorzy przygotowali gotowe buildy:

  • macOS: Pakiet DMG dla Apple Silicon (obsługiwane backendy MPS i MLX). Na starych procesorach Intel lokalny backend nie zadziała.
  • Windows: Instalator MSI dla systemów 64-bitowych z przyspieszeniem CUDA.
  • Linux: Pakiet AppImage oraz gotowe kontenery Docker z obsługą CUDA i ROCm.

Przy pierwszym uruchomieniu program automatycznie konfiguruje izolowane środowisko Python i pobiera model bazowy.

Minimum do komfortowej pracy to 8 GB RAM i 4 GB pamięci wideo przy pracy na GPU. Jeśli nie ma GPU, modele bazowe też działają na CPU, ale generowanie długich segmentów zajmie zauważalnie więcej czasu. Dla ciężkich modeli jak CosyVoice 3 lepiej mieć kartę z 8–16 GB VRAM.

Jeśli chcesz uruchomić projekt ze źródeł, potrzebujesz git i Python:

git clone https://github.com/...

Aby uruchomić tylko interfejs webowy w przeglądarce, użyj polecenia python -m app.

Dla kogo to będzie przydatne

Projekt z pewnością przypadnie do gustu każdemu, kto regularnie pracuje z treściami audio, ale nie chce wyciekać danych do zewnętrznych chmur. To świetne rozwiązanie do lokalizacji podcastów, automatycznego lektora dokumentacji, nagłaśniania gier indie czy szybkiej lokalnej transkrypcji spotkań bez limitów czasowych.

Kod rozpowszechniany jest na licencji AGPL-3.0, a modele bazowe na Apache-2.0. Jeśli szukałeś samodzielnego combi audio na desktop, VoiceStudio zdecydowanie warto zainstalować i wypróbować.

Powiązane projekty