ElevenLabs local en tu propio hardware con VoiceStudio
VoiceStudio ofrece síntesis de voz, clonación y transcripción con calidad de ElevenLabs en local—no hay nube, no hay suscripciones, solo poder open source.
Idioma
InicioLenguajes
Secciones
VoiceStudio ofrece síntesis de voz, clonación y transcripción con calidad de ElevenLabs en local—no hay nube, no hay suscripciones, solo poder open source.
SGLang-Omni es un runtime especializado para inferencia de modelos de voz y multimodales, gestionando el pipeline desde codificación de audio hasta síntesis.
Un vistazo a Uncensored Local Studio, un cliente de escritorio unificado que combina Stable Diffusion, modelos de lenguaje, reconocimiento de voz y texto a voz en una sola aplicación.
Alexandria transforma cualquier texto en una producción de audio multivoz utilizando análisis con LLM y síntesis de voz neuronal. Aquí te explicamos cómo funciona y si vale la pena probarlo.
MLX-Audio ofrece capacidades ultrarrápidas de TTS, STT y STS para Macs con Apple Silicon. Construido sobre el framework MLX de Apple, ofrece Whisper, Kokoro, clonación de voz y más, todo ejecutándose localmente sin costos en la nube.
IndexTTS2 es un modelo de síntesis de voz de código abierto de nueva generación con control preciso de duración y separación de emociones para generación de voces realistas.
GPT-SoVITS es una solución de código abierto para clonar voces que puede sintetizar habla con solo 5 segundos de audio. Conoce sus características y aplicaciones prácticas.