Come Generare Musica con Voci a Partire da Testo e Riferimenti sulla Tua GPU

I generatori di musica basati su cloud come Suno o Udio producono risultati eccellenti, ma richiedono un abbonamento costante, limitano i tuoi crediti e ti legano a server esterni. Se vuoi eseguire uno strumento simile in locale, per molto tempo non c'erano praticamente alternative adeguate. La maggior parte delle reti neurali open source poteva generare solo brevi campioni di sottofondo senza voci o richiedeva complicate manipolazioni da console.
Recentemente, lo sviluppatore BazedFrog ha rilasciato il progetto SongGeneration Studio. Si tratta di un'interfaccia web comoda per il modello LeVo, creato dai ricercatori di Tencent AI Lab. L'applicazione è confezionata per il lancio con un clic tramite l'installer Pinokio, quindi puoi implementarla senza una profonda conoscenza di Python e PyTorch.
Cosa può fare l'applicazione
Il progetto è costruito su un modello generativo capace di sintetizzare una traccia audio completa da una descrizione testuale e testi. L'interfaccia web di SongGeneration Studio trasforma questo motore in uno studio mini completo.
All'interno, ci sono diverse funzionalità principali:
- Costruttore di struttura della composizione. I testi della canzone possono essere divisi in blocchi logici: intro, strofe, ritornello, sezione ponte e outro finale. Questo aiuta la rete neurale a costruire la forma musicale corretta.
- Personalizzazione dettagliata dello stile. Selezioni il genere (dal pop all'hip-hop fino al metal e jazz), il tono emotivo, il tempo in BPM, oltre al tipo di voce e all'insieme di strumenti principali.
- Clonazione dello stile da un file audio. Se carichi una traccia di riferimento, il modello cercherà di copiarne il carattere, il ritmo e il suono complessivo durante la creazione di una nuova canzone.
- Separazione multitraccia. L'output ti fornisce non solo una traccia mista ma anche steli separati: voci pulite e arrangiamento strumentale.
- Gestione progetti ed esportazione. Tutte le tracce generate vengono salvate nella libreria integrata. Il risultato finito può essere esportato in formato FLAC senza perdita o come file video MP4 con copertina.
Separare voci isolate e strumentali rende la vita più facile per chi è abituato a rifinire il materiale in DAW come Ableton, FL Studio o Logic. I campioni possono essere facilmente elaborati con effetti, ritagliati o sovrapposti al tuo beat.
Requisiti hardware e installazione
La limitazione principale del progetto è legata alle risorse. Il modello LeVo è esigente in termini di memoria video.
Avrai bisogno di una GPU NVIDIA con almeno 10 GB di VRAM. Tuttavia, per una generazione stabile di tracce lunghe in alta qualità, gli sviluppatori consigliano di avere 24 GB di memoria video. Avrai bisogno di circa 50 GB di spazio libero sul disco rigido, poiché i pesi del modello da soli occupano circa 15 GB.
Il deploy del sistema è estremamente semplice grazie alla piattaforma Pinokio:
- Avvia Pinokio.
- Cerca SongGeneration Studio.
- Clicca sul pulsante di installazione.
L'installer installerà automaticamente la versione richiesta di Python, scaricherà le dipendenze e caricherà i pesi del modello. Una volta completato, clicca semplicemente su Avvia, e l'interfaccia si aprirà nel tuo browser.
Come funziona il processo di generazione
Dopo aver avviato l'interfaccia web, creare una canzone consiste in quattro passaggi:
- Input del testo e marcatura. Incolli i testi e li distribuisci tra i blocchi della canzone.
- Selezione dei parametri stilistici. Vengono impostati genere, mood, voce del vocalist e strumenti.
- Aggiunta di un riferimento se necessario. Caricare un breve estratto musicale aiuta a fissare il sound design desiderato.
- Avvio della generazione. Il calcolo di una traccia richiede solitamente dai 3 ai 6 minuti.
Dalle osservazioni personali: la qualità vocale dipende direttamente dalla struttura ritmica del testo. Se inserisci testo continuo senza rima e metro chiaro, la rete neurale inizia a inciampare, allungare le vocali o "inghiottire" le finali. Se dividi il testo in strofe regolari di quattro versi, il risultato risulta significativamente più pulito.
La funzione di coda dei task funziona anche in modo interessante. Puoi preparare diverse varianti di testo contemporaneamente e inviarle per la generazione in background, per poi scegliere il miglior risultato dalla libreria.
Limitazioni e impressione complessiva
Lo strumento non può ancora sostituire completamente una registrazione in studio o un arrangiatore professionista. A volte le voci possono suonare leggermente sintetiche, e la generazione su schede con 10 GB di VRAM potrebbe raggiungere il limite di memoria con testi troppo lunghi. Inoltre, il progetto è ancora giovane—il repository ha circa 550 stelle e una ventina di issue aperte.
Nevertheless, SongGeneration Studio is becoming an excellent tool for quick experiments. It will be useful for indie game developers creating soundtracks, content creators getting background music without copyright issues, and musicians generating quick demo ideas.
Progetti correlati