>_ DevTrendsnl

Taal

Home

Talen

Secties

Frontend Backend Mobiel DevOps AI / ML GameDev Blockchain Embedded Beveiliging
Python

Voice Clone Studio brengt alle populaire stemneurale netwerken samen in één venster

Als je ooit hebt geprobeerd lokale spraaksynthese of stemklonering in te stellen, herinner je je waarschijnlijk de dependency hell. Het ene model heeft PyTorch 2.1 met oude torchaudio-bibliotheken nodig, een ander vereist een nieuwe CUDA-build, en een derde heeft een aparte ONNX Runtime-versie nodig. Het resultaat is vijf virtuele omgevingen die zich ophopen op de schijf, elk met zijn eigen Gradio-interface op een willekeurige poort.

Ontwikkelaar onder de nickname FranckyB besloot een einde te maken aan deze chaos en bracht het Voice Clone Studio-project uit. In wezen is het een modulaire all-in-one tool die Qwen3-TTS, Microsoft VibeVoice, Fish Speech, LuxTTS, Resemble AI Chatterbox en de MMAudio-effectengenerator samenbrengt onder één dak.

Voice Clone Studio Preview

Wat dit ding kan doen

In plaats van vijf tabbladen open te houden met verschillende scripts, is hier alles verdeeld in tabbladen met een uniforme datapipeline.

Stemklonering en emoties

Het basisscenario is eenvoudig: je uploadt een kort audiovoorbeeld van 3-10 seconden, voert de tekst in met de originele transcriptie en krijgt het resultaat. Maar het mooie is dat je on the fly tussen engines kunt schakelen met behulp van het dropdown-menu:

  • Qwen3-TTS in 0.6B en 1.7B varianten
  • VibeVoice (1.5B, volledig model en 4-bit gekwantiseerd)
  • Fish Speech S2 Pro met 4B parameters
  • LuxTTS en Chatterbox

Als je de Fish Speech-engine selecteert, kun je intonatietags rechtstreeks in de tekst invoegen, zoals [whisper], [laughing] of [excited]. Het systeem kent meer dan 15.000 van dergelijke markers. De ontwikkelaar heeft ook een leuke toevoeging gemaakt: als je terugschakelt naar Qwen of VibeVoice, worden de tags automatisch verwijderd uit de tekst voordat deze naar het model wordt verzonden, zodat je scripts niet breken.

Dialoogscenario's voor podcasts

Een van de meest interessante tabbladen is Conversatie. Het is ontworpen voor lange dialogen tussen meerdere sprekers.

Het script wordt geschreven in een uniforme tekstformaat:

[1]: Привет, как продвигается проект?
[2]: Отлично, только что собрал окружение без конфликтов.
[3]: Можно к вам присоединиться?

In Qwen-modus zijn er 9 ingebouwde vertellers met aanpasbare pauzes tussen regels. En als je overschakelt naar VibeVoice, krijg je continue trackgeneratie tot 90 minuten lang met vier sprekers met behulp van je eigen stemmonsters. Het model plaatst automatisch klemtonen en voegt soms zelfs subtiele omgevingsgeluiden toe voor realisme.

Stemontwerp op basis van tekstbeschrijving

Wanneer er geen kant-en-klaar audiobestand is voor klonen, komt het tabblad Stemontwerp op basis van Qwen3-TTS goed van pas. Je beschrijft eenvoudig het gewenste personage in woorden: leeftijd, gender, emotionele toon, een licht Brits accent of een rustige en verraderlijke spreekstijl. Het neurale netwerk genereert een unieke stem helemaal opnieuw.

Stemverandering en geluidseffecten

De Stemwisselaar-module werkt op Chatterbox via spraak-naar-spraak-conversie. Je kunt tekst in de microfoon spreken, een doeltimbre selecteren uit opgeslagen monsters, en het model zal je spraak opnemen in een andere stem terwijl de oorspronkelijke timing en intonatie behouden blijven.

Voor videodubbing is MMAudio aan het project toegevoegd. Je voert ofwel een tekstbeschrijving van het geluid in, of je plaatst een kant-en-klaar videobestand zonder audio. Het neurale netwerk analyseert de video en genereert gesynchroniseerde geluidseffecten in 44,1 kHz-kwaliteit.

Datavoorbereiding en fijnafstemming

Voice Clone Studio heeft een ingebouwde audio-voorbereidingswerkruimte (Prep Audio). Je kunt een lang videobestand neerzetten, de audiotrack extraheren, ruis verwijderen via DeepFilterNet, het volume normaliseren en het bestand automatisch in zinnen knippen met behulp van Qwen3-ASR of Whisper.

Er is hier ook de module Aangepaste Stemmen Trainen. Als basisklonering van een kort monster niet genoeg voor je is, start het project lokale LoRA-fijnafstemming voor VibeVoice of Qwen. De interface toont loss-grafieken en epoch-voortgang, en de getrainde gewichten gaan direct naar de voorinstellingenmap. Op een CUDA-ingeschakelde GPU duurt training op een kleine dataset 10 tot 30 minuten.

Wat er onder de motorkap zit

De projectarchitectuur is modulair. Het hoofd script voice_clone_studio.py is slechts ongeveer 230 regels en laadt dynamisch tabbladen uit de modules/core_components/tools/-directory. Onnodige modellen of zware tabbladen kunnen in de instellingen worden uitgeschakeld om de interface en het geheugen niet te belasten.

Onder de interessante technische oplossingen:

  1. CUDA Graphs-versnellingsondersteuning (Faster-Qwen3-TTS-project), wat een 5-10x inferentieversnelling geeft voor Qwen.
  2. Modellen verdelen over verschillende GPU's. Als je twee GPU's in je systeem hebt, kun je spraakgeneratie op de ene kaart plaatsen, en ASR-herkenning en lokale LLM op de tweede.
  3. Ingebouwde Prompt Manager. Het maakt verbinding met een lokale llama.cpp- of Ollama-server, downloadt een GGUF-model en helpt dialoog- of systeemprompts genereren direct in de interface.

Opstarten en valkuilen

De minimale comfortabele drempel is 8 GB VRAM op NVIDIA GPU's. Op macOS draait het project ook via MPS (Apple Silicon), maar het trainings tabblad wordt automatisch verborgen omdat training CUDA-gericht is.

Een snelle opstart op Linux ziet er zo uit:

git clone https://github.com/FranckyB/Voice-Clone-Studio.git
cd Voice-Clone-Studio
chmod +x setup-linux.sh
./setup-linux.sh
./launch.sh

Voor Windows is er een kant-en-klare setup-windows.bat, evenals een Docker Compose-configuratie als je SOX en FFMPEG niet rechtstreeks op het systeem wilt installeren.

Enkele praktische nuances om rekening mee te houden:

  • Python 3.11 wordt aanbevolen. Versie 3.12 kan problemen hebben met het bouwen van wheels voor DeepFilterNet-ruisreductie.
  • Linux- en macOS-gebruikers moeten het openai-whisper-pakket vermijden vanwege omgevingsconflicten. VibeVoice ASR en Qwen3 ASR werken prima als standaardopties.
  • De eerste generatie op een monster heeft een vertraging terwijl stemprompts worden gecachet, maar volgende regels worden aanzienlijk sneller samengesteld.

Voor wie is dit project nuttig

Voice Clone Studio pakt drie duidelijke behoeften aan. Ten eerste is het een uitstekend testplatform voor iedereen die de kwaliteit van VibeVoice, Qwen3 en Fish Speech op hetzelfde audiomateriaal wil vergelijken zonder met consoles te werken. Ten tweede zullen podcast- en audioboekmakers de Conversatie-module met 90-minuten generatie waarderen. Ten derde is het een kant-en-klare werkstation voor het voorbereiden van datasets en het trainen van aangepaste stemmodellen zonder trainingsscripts te schrijven.

Gerelateerde projecten