Musik mit Gesang aus Text und Referenzen auf Ihrer GPU generieren

Cloud-basierte Musikgeneratoren wie Suno oder Udio liefern ausgezeichnete Ergebnisse, erfordern jedoch ein ständiges Abonnement, begrenzen Ihre Credits und binden Sie an externe Server. Wenn Sie ein ähnliches Tool lokal betreiben möchten, gab es lange Zeit praktisch keine adäquaten Alternativen. Die meisten Open-Source-Neuronalen Netze konnten nur kurze Hintergrundsamples ohne Gesang generieren oder erforderten komplexe Konsolenmanipulationen.
Kürzlich hat der Entwickler BazedFrog das Projekt SongGeneration Studio veröffentlicht. Dies ist eine benutzerfreundliche Web-Oberfläche für das LeVo-Modell, das von Forschern des Tencent AI Lab erstellt wurde. Die Anwendung ist für den Ein-Klick-Start über den Pinokio-Installer verpackt, sodass Sie sie ohne tiefgehende Kenntnisse von Python und PyTorch bereitstellen können.
Was die Anwendung leisten kann
Das Projekt basiert auf einem generativen Modell, das in der Lage ist, einen vollständigen Audiotrack aus einer Textbeschreibung und Lyrics zu synthetisieren. Die SongGeneration Studio Web-Oberfläche macht diese Engine zu einem vollwertigen Mini-Studio.
Im Inneren gibt es mehrere Hauptfunktionen:
- Kompositionsstruktur-Builder. Die Songtexte können in logische Blöcke unterteilt werden: Intro, Strophen, Refrain, Bridge und finales Outro. Dies hilft dem neuronalen Netz, die richtige musikalische Form aufzubauen.
- Detaillierte Stil-Anpassung. Sie wählen das Genre (von Pop und Hip-Hop bis Metal und Jazz), die emotionale Stimmung, das Tempo in BPM sowie die Gesangsstimme und die Lead-Instrumente.
- Stil-Klonen aus einer Audiodatei. Wenn Sie einen Referenztrack hochladen, versucht das Modell, dessen Charakter, Rhythmus und Gesamtklang beim Erstellen eines neuen Songs zu kopieren.
- Multitrack-Trennung. Die Ausgabe liefert Ihnen nicht nur einen gemischten Track, sondern auch separate Stems: saubere Vocals und instrumentale Anordnung.
- Projektmanager und Export. Alle generierten Tracks werden in der integrierten Bibliothek gespeichert. Das fertige Ergebnis kann im verlustfreien FLAC-Format oder als MP4-Videodatei mit Cover-Art exportiert werden.
Die Trennung isolierter Vocals und Instrumente erleichtert denen das Leben, die gewohnt sind, Material in DAWs wie Ableton, FL Studio oder Logic zu verfeinern. Samples können einfach mit Effekten bearbeitet, zugeschnitten oder über Ihren eigenen Beat gelegt werden.
Hardware-Anforderungen und Installation
Die Hauptbeschränkung des Projekts bezieht sich auf Ressourcen. Das LeVo-Modell ist anspruchsvoll in Bezug auf den Videospeicher.
Sie benötigen eine NVIDIA-GPU mit mindestens 10 GB VRAM. Für die stabile Generierung langer Tracks in hoher Qualität empfehlen die Entwickler jedoch 24 GB Videospeicher. Sie benötigen etwa 50 GB freien Speicherplatz auf Ihrer Festplatte, da die Modellgewichte selbst etwa 15 GB beanspruchen.
Die Bereitstellung des Systems ist dank der Pinokio-Plattform extrem einfach:
- Starten Sie Pinokio.
- Suchen Sie nach SongGeneration Studio.
- Klicken Sie auf die Install-Schaltfläche.
Der Installer installiert automatisch die erforderliche Python-Version, lädt Abhängigkeiten herunter und lädt die Modellgewichte. Nach Abschluss klicken Sie einfach auf Start, und die Oberfläche öffnet sich in Ihrem Browser.
Wie der Generierungsprozess funktioniert
Nach dem Start der Web-Oberfläche besteht das Erstellen eines Songs aus vier Schritten:
- Texteingabe und Markup. Sie fügen Lyrics ein und verteilen sie auf Song-Blöcke.
- Auswahl der stilistischen Parameter. Genre, Stimmung, Gesangsstimme und Instrumente werden festgelegt.
- Hinzufügen einer Referenz bei Bedarf. Das Hochladen eines kurzen Musikausschnitts hilft, den gewünschten Sound-Design zu fixieren.
- Start der Generierung. Die Berechnung eines Tracks dauert normalerweise 3 bis 6 Minuten.
Aus persönlichen Beobachtungen: Die Gesangsqualität hängt direkt von der rhythmischen Struktur des Textes ab. Wenn Sie zusammenhängenden Text ohne Reim und klares Metrum eingeben, beginnt das neuronale Netz zu stolpern, Vokale zu dehnen oder Endungen zu „verschlucken". Wenn Sie den Text in sogar vierzeilige Strophen aufteilen, wird das Ergebnis deutlich sauberer.
Die Task-Queue-Funktion funktioniert auch interessant. Sie können mehrere Textvarianten gleichzeitig vorbereiten und sie zur Hintergrundgenerierung senden, und dann das beste Ergebnis aus der Bibliothek auswählen.
Einschränkungen und Gesamteindruck
Das Tool kann Studioaufnahmen oder einen professionellen Arrangeur noch nicht vollständig ersetzen. Manchmal können die Vocals leicht synthetisch klingen, und die Generierung auf Karten mit 10 GB VRAM kann bei zu langen Texten an die Speichergrenze stoßen. Außerdem ist das Projekt noch jung – das Repository hat etwa 550 Stars und etwa zwanzig offene Issues.
Dennoch wird SongGeneration Studio zu einem ausgezeichneten Tool für schnelle Experimente. Es wird nützlich sein für Indie-Spielentwickler, die Soundtracks erstellen, Content Creator, die Hintergrundmusik ohne Urheberrechtsprobleme benötigen, und Musiker, die schnelle Demo-Ideen generieren möchten.
Ähnliche Projekte