>_ DevTrendsnl

Taal

Home

Talen

Secties

Frontend Backend Mobiel DevOps AI / ML GameDev Blockchain Embedded Beveiliging
Python

Hoe je elk boek omzet in een meerstemmige audio-productie met Alexandria

Een bekende situatie: je vindt een cool boek of fanfic dat je in één avond wilt "verslinden", maar er is simpelweg geen tijd om te gaan zitten lezen. Gewone "lezers" met synthetische stemmen klinken als robots uit de jaren tachtig, en professionele audioboeken kosten geld of bestaan simpelweg niet voor zeldzame werken. Onlangs stuitte ik op het Alexandria-project, dat dit probleem oplost op bijna studiokwaliteit.

Alexandria Logo

Wat het is

Alexandria is niet zomaar een tekst-naar-spraak script. Het is een volwaardige pipeline die je tekstbestand neemt en omzet in een geformatteerd script. Het systeem begrijpt zelf waar de verteller spreekt en waar de personages dat doen, en wijst elk een unieke stem toe. Het draait op de Qwen3-TTS engine, die emoties kan overbrengen, pauzes kan maken en zelfs zuchten of lachen kan imiteren.

Het hoogtepunt is dat het project de mogelijkheden van grote taalmodellen (LLM) voor tekstanalyse combineert met moderne neurale netwerken voor spraaksynthese. Je krijgt geen monotone gebrabbel, maar een volwaardige audio-uitvoering.

Hoe het proces werkt

Werken met de tool is opgedeeld in logische fasen. Ik vond het prettig dat de ontwikkelaar je niet dwingt om met de console te rommelen — er is een perfect bruikbare webinterface.

Script-annotatie via LLM

Ten eerste feed je het boek aan het programma. Alexandria maakt verbinding met je lokale LLM (via Ollama of LM Studio) of met de OpenAI API. Het neurale netwerk analyseert de tekst en zet deze om in een JSON-structuur. Het extraheert dialogen, identificeert de spreker en, het coolste van alles, schrijft steminstructies. Bijvoorbeeld: "Marcus zegt dit met dreigende zekerheid, in een lage, insinuerende stem."

Werken met stemmen

Na annotatie kom je terecht in het stemmanagementgedeelte. Voor elk gevonden personage kun je kiezen uit negen presets of verder gaan:

  • Klonen: upload een 10-seconden audiofragment, en het personage zal met die stem spreken.
  • Stemontwerp: je kunt de stem simpelweg in tekst beschrijven, bijvoorbeeld: "Een warme stem van een oudere vrouw met een lichte schorheid," en het neurale netwerk creëert deze van scratch.
  • LoRA-training: voor degenen die het perfecte resultaat willen, is er een optie om het model finetunen op een specifieke dataset direct in de interface.

Editor en export

Voor de definitieve assemblage kun je elk segment afzonderlijk beluisteren. Als het neurale netwerk ergens een fout heeft gemaakt met de intonatie, bewerk je simpelweg de tekstinstructie en genereer je dat specifieke stuk opnieuw. De output is ofwel een enkel MP3/M4B-bestand met hoofdstukken, ofwel een project voor Audacity waar elke stem op een apart spoor staat. Dit is handig als je handmatig achtergrondmuziek of effecten wilt toevoegen.

De technische kant

Het project is geschreven in Python en vereist vrij krachtige hardware als je audio snel wilt genereren.

  • Minimum: 8 GB videogeheugen (VRAM). Dit is genoeg om regel voor regel te werken.
  • Aanbevolen: 16 GB en hoger. Dan kun je batchverwerking inschakelen, wat het proces 3-6 keer versnelt.
  • Optimalisatie: torch.compile wordt ondersteund, wat een merkbare snelheidsboost geeft op NVIDIA en AMD-kaarten (op Linux).

Interessant is dat de auteur Pinokio-ondersteuning heeft toegevoegd — dit is een browser voor AI-applicaties die automatisch alle afhankelijkheden, omgevingen en bibliotheken installeert. Voor degenen die geen zin hebben om met pip install en versieconflicten om te gaan, is dit een redder in nood.

Praktische voordelen

Waarom zou een ontwikkelaar dit nodig hebben? Afgezien van de voor de hand liggende "maak een audioboek van documentatie," zijn er een paar interessante gebruiksmogelijkheden:

  1. Stem-prototyping voor games: je kunt snel dialogen schetsen en beluisteren hoe ze klinken uitgevoerd door verschillende personages zonder op vroege stadia acteurs in te huren.
  2. Contentcreatie: als je een podcast of YouTube-kanaal runt, helpt Alexandria je bij het creëren van kwaliteitssegmenten met verschillende stemmen.
  3. Automatisering: het project heeft een REST API. Je kunt stemgeneratie integreren in je pipelines.

Is het de moeite waard om te proberen

Als je een grafische kaart hebt op het niveau van een RTX 3060 of hoger, dan zeker ja. Alexandria is een van de meest doordachte tools in zijn niche. Het "leest" niet alleen tekst — het probeert de context en emoties van het werk te begrijpen.

Aan de negatieve kant: het project is vrij zwaar. Bij de eerste installatie downloadt het ongeveer 20 GB aan data (bibliotheken + modelgewichten). Houd er ook rekening mee dat een goed LLM nodig is voor kwaliteitsvolle tekstannotatie — kleine modellen met 3-7 miljard parameters kunnen in de war raken over personages.

Al met al is het een geweldig voorbeeld van hoe neurale netwerken evolueren van leuke speeltjes naar echt nuttige tools voor alledaagse taken. Je kunt het lokaal proberen of via Google Colab als je niet genoeg eigen hardware hebt.

Gerelateerde projecten