>_ DevTrendspt

Idioma

Início

Linguagens

Seções

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embarcados Segurança
JavaScript

Como Gerar Música com Vocais a Partir de Texto e Referências na Sua GPU

SongGeneration Studio

Geradores de música baseados em nuvem como Suno ou Udio produzem resultados excelentes, mas exigem uma assinatura constante, limitam os seus créditos e prendem-no a servidores externos. Se quiser executar uma ferramenta semelhante localmente, durante muito tempo não havia praticamente alternativas adequadas. A maioria das redes neurais de código aberto só conseguia gerar amostras curtas de fundo sem vocais ou exigia manipulações complexas na consola.

Recentemente, o desenvolvedor BazedFrog lançou o projeto SongGeneration Studio. Esta é uma interface web conveniente para o modelo LeVo, criado por pesquisadores do Tencent AI Lab. A aplicação está empacotada para lançamento com um clique através do instalador Pinokio, para que possa implementá-la sem conhecimento profundo de Python e PyTorch.

O que a aplicação pode fazer

O projeto é construído sobre um modelo generativo capaz de sintetizar uma faixa de áudio completa a partir de uma descrição de texto e letras. A interface web do SongGeneration Studio transforma este motor num mini estúdio completo.

Internamente, existem várias funcionalidades principais:

  • Construtor de estrutura de composição. As letras da música podem ser divididas em blocos lógicos: intro, versos, coro, secção de ponte e outro final. Isto ajuda a rede neural a construir a forma musical correta.
  • Personalização detalhada de estilo. Você seleciona o género (de pop e hip-hop a metal e jazz), tom emocional, tempo em BPM, bem como o tipo vocal e conjunto de instrumentos principais.
  • Clonagem de estilo a partir de um ficheiro de áudio. Se carregar uma faixa de referência, o modelo tentará copiar o seu caráter, ritmo e som geral ao criar uma nova música.
  • Separação multitrack. A saída dá-lhe não apenas uma faixa mixada, mas também stems separados: vocais limpos e arranjo instrumental.
  • Gestor de projetos e exportação. Todas as faixas geradas são guardadas na biblioteca integrada. O resultado final pode ser exportado em formato FLAC sem perdas ou como ficheiro de vídeo MP4 com capa.

Separar vocais e instrumentais isolados facilita a vida de quem está习惯 de refinar material em DAWs como Ableton, FL Studio ou Logic. As amostras podem ser facilmente processadas com efeitos, cortadas ou sobrepostas ao seu próprio beat.

Requisitos de hardware e instalação

A principal limitação do projeto está relacionada com os recursos. O modelo LeVo é exigente em memória de vídeo.

Você vai precisar de uma GPU NVIDIA com pelo menos 10 GB de VRAM. No entanto, para geração estável de faixas longas em alta qualidade, os desenvolvedores recomendam ter 24 GB de memória de vídeo. Vai precisar de cerca de 50 GB de espaço livre no disco rígido, pois os pesos do modelo por si só ocupam cerca de 15 GB.

Implementar o sistema é extremamente simples graças à plataforma Pinokio:

  1. Inicie o Pinokio.
  2. Pesquise por SongGeneration Studio.
  3. Clique no botão de instalação.

O instalador irá automaticamente instalar a versão necessária do Python, descarregar as dependências e carregar os pesos do modelo. Uma vez concluído, basta clicar em Iniciar, e a interface abrirá no seu navegador.

Como funciona o processo de geração

Após iniciar a interface web, criar uma música consiste em quatro passos:

  1. Entrada de texto e marcação. Você cola as letras e distribui-as pelos blocos da música.
  2. Seleção de parâmetros estilísticos. Género, humor, voz do vocalista e instrumentos são definidos.
  3. Adicionar uma referência se necessário. Carregar um pequeno trecho de música ajuda a fixar o design de som desejado.
  4. Iniciar a geração. Calcular uma faixa geralmente leva de 3 a 6 minutos.

De observações pessoais: a qualidade vocal depende diretamente da estrutura rítmica do texto. Se despejar texto contínuo sem rima e metro claro, a rede neural começa a tropeçar, alongar vogais ou "engolir" terminações. Se dividir o texto em estrofes uniformes de apenas quatro linhas, o resultado fica significativamente mais limpo.

A função de fila de tarefas também funciona de forma interessante. Você pode preparar várias variações de texto de uma só vez e enviá-las para geração em segundo plano, e depois escolher o melhor resultado da biblioteca.

Limitações e impressão geral

A ferramenta ainda não consegue substituir totalmente uma gravação em estúdio ou um arranjador profissional. Às vezes, os vocais podem soar ligeiramente sintéticos, e a geração em placas com 10 GB de VRAM pode atingir o limite de memória com textos demasiado longos. Além disso, o projeto ainda é jovem—o repositório tem cerca de 550 estrelas e cerca de vinte issues abertas.

No entanto, o SongGeneration Studio está a tornar-se uma excelente ferramenta para experiências rápidas. Será útil para desenvolvedores de jogos indie criando soundtracks, criadores de conteúdo obtendo música de fundo sem problemas de direitos autorais, e músicos gerando ideias rápidas de demos.

Projetos relacionados