Voz a texto de forma local justo en el cursor con Voicetypr
A menudo me descubro pensando que escribir prompts largos para redes neuronales o comentarios detallados en pull requests es simplemente demasiado tedioso. Mis dedos se cansan, los pensamientos se enredan y no tengo ganas de releer el borrador. La entrada de voz parece resolver este problema, pero las herramientas del sistema estándar en macOS y Windows no funcionan tan bien. Los servicios en la nube de terceros como Wispr Flow requieren una suscripción y enrutan toda tu voz a través de servidores externos, lo cual queda inmediatamente descartado para código confidencial o chats relacionados con el trabajo.
Hace poco me encontré con un proyecto interesante llamado Voicetypr. Es una aplicación de escritorio de código abierto bajo la licencia AGPL-3.0 que inserta el habla reconocida directamente donde parpadea el cursor. Y lo hace completamente de forma local en tu máquina.
¿Qué puede hacer la aplicación?
La idea principal es simple: presiona un atajo global, dicta texto al micrófono, suelta la tecla y las oraciones terminadas aparecen inmediatamente en el campo de entrada activo. Ya sea en el editor de VS Code, terminal, mensajería o navegador.
Estas son algunas de las funcionalidades que el autor incluyó en esta utilidad:
- Reconocimiento en el dispositivo. En macOS y Windows funciona el modelo Whisper, y para Macs con chips Apple Silicon puedes conectar el modelo Parakeet optimizado.
- Formateo mediante LLM. El texto dictaminado en bruto suele estar lleno de muletillas y pausas extrañas. La aplicación puede pasar el texto preliminar a través de OpenAI, Anthropic, Gemini o cualquier endpoint local personalizado para producir un párrafo limpio y editado en la salida.
- Transcripción de archivos multimedia existentes. Puedes soltar un archivo de audio o video y obtener una transcripción de texto.
- Historial de grabaciones. Todas las transcripciones se guardan en la interfaz con metadatos, para que puedas comparar el texto original con la versión editada o reproducir la grabación.
- Modo servidor a través de red local. Si tienes una tarjeta gráfica potente en una computadora, puedes configurar Voicetypr como un servidor de transcripción local y enviar audio desde una laptop menos potente.
Por cierto, si la potencia local no es suficiente, puedes cambiar a servicios de reconocimiento en la nube en la configuración: Groq, Deepgram, OpenAI, Soniox o Cohere. Pero el punto central de Voicetypr es que por defecto el flujo de audio nunca sale de tu computadora.
CLI para automatización y agentes locales
Un detalle interesante que los desarrolladores rara vez consideran en utilidades GUI similares: Voicetypr viene con una interfaz de consola integrada.
El comando se puede instalar directamente desde la configuración del programa. Esto hace posible llamar al motor de reconocimiento desde scripts bash o conectar con agentes de IA locales:
# Проверить статус приложения
voicetypr status --json
# Посмотреть доступные модели
voicetypr models --json
# Расшифровать аудиофайл и получить структурированный JSON
voicetypr transcribe --file note.wav --json
# Записать голос с микрофона до наступления тишины
voicetypr record --until-silence --json
El indicador --json devuelve una respuesta estructurada, por lo que el resultado es fácil de analizar con jq estándar o alimentar más abajo en la tubería.
Cómo funciona internamente
La pila de la aplicación está construida de manera bastante pragmática. El autor eligió Tauri v2 y Rust para el trabajo pesado del sistema, y escribió la interfaz en React 19, TypeScript, Tailwind CSS y shadcn/ui.
Todo el trabajo de interceptar atajos de teclado, capturar el micrófono, remuestrear audio y emular la entrada a la ventana activa recae enteramente en el backend de Rust. Esto dio una respuesta rápida y un consumo modesto de RAM en comparación con las aplicaciones Electron típicas.
En Windows, Whisper local puede usar Vulkan para aceleración de GPU. Y este proceso está aislado en un sidecar separado. Si algo sale mal con el controlador de video, la aplicación simplemente cambia silenciosamente a cálculos por CPU sin bloquear el programa principal.
Cómo compilar y ejecutar
Si quieres compilar el proyecto desde el código fuente tú mismo, necesitarás Node.js con el administrador de paquetes pnpm, la cadena de herramientas de Rust y las herramientas de compilación básicas para tu sistema operativo (Xcode CLI en macOS o Visual Studio Build Tools en Windows).
La compilación se inicia con comandos estándar:
git clone https://github.com/moinulmoin/voicetypr.git
cd voicetypr
pnpm install
pnpm tauri:dev
También hay pruebas y linters listos para usar en el repositorio:
pnpm lint
pnpm test
pnpm test:backend
pnpm quality-gate
Para quienes no quieren compilar manualmente, hay paquetes DMG firmados para macOS e instaladores para Windows 10/11 disponibles en los lanzamientos de GitHub y en el sitio web oficial.
Por qué un desarrollador necesita esto
Ante todo, Voicetypr será útil para quienes escriben mucho texto: mantener documentación, redactar tareas en rastreadores de problemas o comunicarse con redes neuronales en Cursor y Claude Dev. Dictar contexto complejo por voz en veinte segundos es mucho más fácil que escribir cinco párrafos a mano.
El segundo escenario obvio es la privacidad. Si trabajas con NDA o simplemente no quieres entregar grabaciones de tu voz a empresas de terceros, la combinación de Whisper local e inferencia local a través de Ollama resuelve completamente este problema.
El proyecto actualmente tiene relativamente pocas estrellas en GitHub, pero el código base se ve limpio y la combinación de Tauri con Rust funciona rápido. Definitivamente vale la pena probarlo, especialmente si has estado buscando un reemplazo gratuito para aplicaciones de dictado propietarias.
Proyectos relacionados