>_ DevTrendspl

Język

Strona główna

Języki

Sekcje

Frontend Backend Mobilne DevOps AI / ML GameDev Blockchain Systemy wbudowane Bezpieczeństwo
Python

Voice Clone Studio łączy wszystkie popularne sieci neuronowe głosu w jednym oknie

Jeśli kiedykolwiek próbowałeś skonfigurować lokalną syntezę mowy lub klonowanie głosu, prawdopodobnie pamiętasz piekło zależności. Jeden model wymaga PyTorch 2.1 ze starymi bibliotekami torchaudio, inny potrzebuje świeżej kompilacji CUDA, a trzeci wymaga osobnej wersji ONNX Runtime. Efektem jest pięć środowisk wirtualnych nagromadzonych na dysku, każde z własnym interfejsem Gradio na losowym porcie.

Developer o pseudonimie FranckyB postanowił położyć kres temu chaosowi i wydał projekt Voice Clone Studio. To w zasadzie modułowe narzędzie typu all-in-one, które łączy Qwen3-TTS, Microsoft VibeVoice, Fish Speech, LuxTTS, Resemble AI Chatterbox oraz generator efektów dźwiękowych MMAudio pod jedną maską.

Voice Clone Studio Preview

Co to potrafi

Zamiast trzymać otwartych pięć zakładek z różnymi skryptami, wszystko tutaj jest podzielone na zakładki ze ujednoliconym potokiem danych.

Klonowanie głosu i emocji

Podstawowy scenariusz jest prosty: uploadujesz krótki, 3–10 sekundowy przykład audio, wprowadzasz tekst z oryginalną transkrypcją i otrzymujesz wynik. Ale piękno tkwi w tym, że możesz przełączać silniki w locie za pomocą dropdowna:

  • Qwen3-TTS w wariantach 0.6B i 1.7B
  • VibeVoice (1.5B, pełny model i skwantowany 4-bitowo)
  • Fish Speech S2 Pro z 4B parametrami
  • LuxTTS i Chatterbox

Jeśli wybierzesz silnik Fish Speech, możesz wstawić tagi intonacyjne bezpośrednio w tekście, jak [whisper], [laughing] lub [excited]. System zna ponad 15 000 takich markerów. Developer zrobił też miły szczegół: jeśli przełączysz się z powrotem na Qwen lub VibeVoice, tagi są automatycznie usuwane z tekstu przed wysłaniem do modelu, więc Twoje skrypty się nie psują.

Scenariusze dialogowe dla podcastów

Jedna z najbardziej interesujących zakładek to Conversation. Jest zaprojektowana dla długich dialogów między wieloma mówcami.

Skrypt jest pisany w ujednoliconym formacie tekstowym:

[1]: Привет, как продвигается проект?
[2]: Отлично, только что собрал окружение без конфликтов.
[3]: Можно к вам присоединиться?

W trybie Qwen dostępnych jest 9 wbudowanych narratorów z regulowanymi pauzami między liniami. A jeśli przełączysz tryb na VibeVoice, otrzymujesz ciągłą generację ścieżki do 90 minut z czterema mówcami używającymi Twoich własnych próbek głosu. Model automatycznie umieszcza akcenty i czasami dodaje subtelny szum pomieszczenia dla realizmu.

Projektowanie głosu z opisu tekstowego

Gdy nie ma gotowego pliku audio do klonowania, przydaje się zakładka Voice Design oparta na Qwen3-TTS. Po prostu opisujesz pożądaną postać słowami: wiek, płeć, ton emocjonalny, lekki brytyjski akcent lub cichy i podstępny sposób mówienia. Sieć neuronowa generuje unikalny głos od zera.

Zmiana głosu i efekty dźwiękowe

Moduł Voice Changer działa na Chatterbox poprzez konwersję speech-to-speech. Możesz mówić tekst do mikrofonu, wybrać docelowy tembr z zapisanych próbek, a model przemówi Twoją mową innym głosem, zachowując oryginalne timingi i intonację.

Do dubbingu wideo do projektu dodano MMAudio. Wprowadzasz opis tekstowy dźwięku lub wrzucasz gotowy klip wideo bez audio. Sieć neuronowa analizuje wideo i generuje zsynchronizowane efekty dźwiękowe w jakości 44.1 kHz.

Przygotowanie danych i fine-tuning

Voice Clone Studio ma wbudowane środowisko do przygotowywania audio (Prep Audio). Możesz wrzucić długie wideo, wyodrębnić ścieżkę audio, usunąć szum przez DeepFilterNet, znormalizować głośność i automatycznie pociąć plik na frazy używając Qwen3-ASR lub Whisper.

Jest tu również moduł Train Custom Voices. Jeśli podstawowe klonowanie z krótkiej próbki nie jest dla Ciebie wystarczające, projekt uruchamia lokalny fine-tuning LoRA dla VibeVoice lub Qwen. Interfejs wyświetla wykresy loss i postęp epoch, a wytrenowane wagi natychmiast trafiają do folderu presetów. Na karcie GPU z obsługą CUDA trening na małym zbiorze danych trwa od 10 do 30 minut.

Co pod maską

Architektura projektu jest modułowa. Główny skrypt voice_clone_studio.py ma tylko około 230 linii i dynamicznie ładuje zakładki z katalogu modules/core_components/tools/. Niepotrzebne modele lub ciężkie zakładki można wyłączyć w ustawieniach, aby nie zaśmiecać interfejsu i pamięci.

Wśród interesujących rozwiązań inżynieryjnych:

  1. Obsługa przyspieszenia CUDA Graphs (projekt Faster-Qwen3-TTS), co daje 5–10x przyspieszenie inferencji dla Qwen.
  2. Rozmieszczanie modeli na różnych GPU. Jeśli masz w systemie dwie karty GPU, możesz umieścić generowanie mowy na jednej karcie, a rozpoznawanie ASR i lokalny LLM na drugiej.
  3. Wbudowany Prompt Manager. Łączy się z lokalnym serwerem llama.cpp lub Ollama, pobiera model GGUF i pomaga generować dialogi lub prompty systemowe bezpośrednio w interfejsie.

Uruchomienie i zastrzeżenia

Minimalny komfortowy próg to 8 GB VRAM na kartach NVIDIA. Na macOS projekt również uruchomi się przez MPS (Apple Silicon), ale zakładka treningu będzie automatycznie ukryta, ponieważ trening jest skoncentrowany na CUDA.

Szybkie uruchomienie na Linuksie wygląda tak:

git clone https://github.com/FranckyB/Voice-Clone-Studio.git
cd Voice-Clone-Studio
chmod +x setup-linux.sh
./setup-linux.sh
./launch.sh

Dla Windows dostępny jest gotowy setup-windows.bat, a także konfiguracja Docker Compose, jeśli nie chcesz instalować SOX i FFMPEG bezpośrednio w systemie.

Kilka praktycznych niuansów, o których warto wiedzieć:

  • Zalecany jest Python 3.11. Wersja 3.12 może mieć problemy z budowaniem wheeli dla redukcji szumu DeepFilterNet.
  • Użytkownicy Linuksa i macOS powinni unikać instalacji pakietu openai-whisper ze względu na konflikty środowiskowe. VibeVoice ASR i Qwen3 ASR świetnie sprawdzają się jako domyślne zamienniki.
  • Pierwsza generacja na dowolnej próbce ma opóźnienie podczas cache'owania promtpów głosowych, ale kolejne linie są składane znacznie szybciej.

Kto znajdzie ten projekt użyteczny

Voice Clone Studio odpowiada na trzy wyraźne potrzeby. Po pierwsze, to doskonałe środowisko testowe dla każdego, kto chce porównać jakość VibeVoice, Qwen3 i Fish Speech na tym samym materiale audio bez grzebania w konsoli. Po drugie, twórcy podcastów i audiobooków docenią moduł Conversation z generowaniem do 90 minut. Po trzecie, to gotowa stacja robocza do przygotowywania zbiorów danych i treningu niestandardowych modeli głosu bez pisania skryptów treningowych.

Powiązane projekty