>_ DevTrendses

Idioma

Inicio

Lenguajes

Secciones

Frontend Backend Móvil DevOps AI / ML GameDev Blockchain Embebidos Seguridad
Rust

Voz a texto de forma local justo en el cursor con Voicetypr

Voicetypr app icon

A menudo me descubro pensando que escribir prompts largos para redes neuronales o comentarios detallados en pull requests es simplemente demasiado tedioso. Mis dedos se cansan, los pensamientos se enredan y no tengo ganas de releer el borrador. La entrada de voz parece resolver este problema, pero las herramientas del sistema estándar en macOS y Windows no funcionan tan bien. Los servicios en la nube de terceros como Wispr Flow requieren una suscripción y enrutan toda tu voz a través de servidores externos, lo cual queda inmediatamente descartado para código confidencial o chats relacionados con el trabajo.

Hace poco me encontré con un proyecto interesante llamado Voicetypr. Es una aplicación de escritorio de código abierto bajo la licencia AGPL-3.0 que inserta el habla reconocida directamente donde parpadea el cursor. Y lo hace completamente de forma local en tu máquina.

¿Qué puede hacer la aplicación?

La idea principal es simple: presiona un atajo global, dicta texto al micrófono, suelta la tecla y las oraciones terminadas aparecen inmediatamente en el campo de entrada activo. Ya sea en el editor de VS Code, terminal, mensajería o navegador.

Estas son algunas de las funcionalidades que el autor incluyó en esta utilidad:

  • Reconocimiento en el dispositivo. En macOS y Windows funciona el modelo Whisper, y para Macs con chips Apple Silicon puedes conectar el modelo Parakeet optimizado.
  • Formateo mediante LLM. El texto dictaminado en bruto suele estar lleno de muletillas y pausas extrañas. La aplicación puede pasar el texto preliminar a través de OpenAI, Anthropic, Gemini o cualquier endpoint local personalizado para producir un párrafo limpio y editado en la salida.
  • Transcripción de archivos multimedia existentes. Puedes soltar un archivo de audio o video y obtener una transcripción de texto.
  • Historial de grabaciones. Todas las transcripciones se guardan en la interfaz con metadatos, para que puedas comparar el texto original con la versión editada o reproducir la grabación.
  • Modo servidor a través de red local. Si tienes una tarjeta gráfica potente en una computadora, puedes configurar Voicetypr como un servidor de transcripción local y enviar audio desde una laptop menos potente.

Por cierto, si la potencia local no es suficiente, puedes cambiar a servicios de reconocimiento en la nube en la configuración: Groq, Deepgram, OpenAI, Soniox o Cohere. Pero el punto central de Voicetypr es que por defecto el flujo de audio nunca sale de tu computadora.

CLI para automatización y agentes locales

Un detalle interesante que los desarrolladores rara vez consideran en utilidades GUI similares: Voicetypr viene con una interfaz de consola integrada.

El comando se puede instalar directamente desde la configuración del programa. Esto hace posible llamar al motor de reconocimiento desde scripts bash o conectar con agentes de IA locales:

# Проверить статус приложения
voicetypr status --json

# Посмотреть доступные модели
voicetypr models --json

# Расшифровать аудиофайл и получить структурированный JSON
voicetypr transcribe --file note.wav --json

# Записать голос с микрофона до наступления тишины
voicetypr record --until-silence --json

El indicador --json devuelve una respuesta estructurada, por lo que el resultado es fácil de analizar con jq estándar o alimentar más abajo en la tubería.

Cómo funciona internamente

La pila de la aplicación está construida de manera bastante pragmática. El autor eligió Tauri v2 y Rust para el trabajo pesado del sistema, y escribió la interfaz en React 19, TypeScript, Tailwind CSS y shadcn/ui.

Todo el trabajo de interceptar atajos de teclado, capturar el micrófono, remuestrear audio y emular la entrada a la ventana activa recae enteramente en el backend de Rust. Esto dio una respuesta rápida y un consumo modesto de RAM en comparación con las aplicaciones Electron típicas.

En Windows, Whisper local puede usar Vulkan para aceleración de GPU. Y este proceso está aislado en un sidecar separado. Si algo sale mal con el controlador de video, la aplicación simplemente cambia silenciosamente a cálculos por CPU sin bloquear el programa principal.

Cómo compilar y ejecutar

Si quieres compilar el proyecto desde el código fuente tú mismo, necesitarás Node.js con el administrador de paquetes pnpm, la cadena de herramientas de Rust y las herramientas de compilación básicas para tu sistema operativo (Xcode CLI en macOS o Visual Studio Build Tools en Windows).

La compilación se inicia con comandos estándar:

git clone https://github.com/moinulmoin/voicetypr.git
cd voicetypr
pnpm install
pnpm tauri:dev

También hay pruebas y linters listos para usar en el repositorio:

pnpm lint
pnpm test
pnpm test:backend
pnpm quality-gate

Para quienes no quieren compilar manualmente, hay paquetes DMG firmados para macOS e instaladores para Windows 10/11 disponibles en los lanzamientos de GitHub y en el sitio web oficial.

Por qué un desarrollador necesita esto

Ante todo, Voicetypr será útil para quienes escriben mucho texto: mantener documentación, redactar tareas en rastreadores de problemas o comunicarse con redes neuronales en Cursor y Claude Dev. Dictar contexto complejo por voz en veinte segundos es mucho más fácil que escribir cinco párrafos a mano.

El segundo escenario obvio es la privacidad. Si trabajas con NDA o simplemente no quieres entregar grabaciones de tu voz a empresas de terceros, la combinación de Whisper local e inferencia local a través de Ollama resuelve completamente este problema.

El proyecto actualmente tiene relativamente pocas estrellas en GitHub, pero el código base se ve limpio y la combinación de Tauri con Rust funciona rápido. Definitivamente vale la pena probarlo, especialmente si has estado buscando un reemplazo gratuito para aplicaciones de dictado propietarias.

Proyectos relacionados