>_ DevTrendspt

Idioma

Início

Linguagens

Seções

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embarcados Segurança
Rust

Transcrição de voz para texto local bem no cursor com Voicetypr

Voicetypr app icon

Frequentemente me pego pensando que digitar longos prompts para redes neurais ou comentários detalhados em pull requests é simplesmente muito tedioso. Meus dedos ficam cansados, os pensamentos se embaralham e não tenho vontade de reler o rascunho. A entrada de voz parece resolver esse problema, mas as ferramentas padrão do sistema em macOS e Windows não funcionam tão bem. Utilitários de nuvem de terceiros como Wispr Flow exigem uma assinatura e roteiam toda a sua voz através de servidores externos, o que é imediatamente descartado para código confidencial ou chats relacionados ao trabalho.

Recentemente encontrei um projeto interessante chamado Voicetypr. É um aplicativo desktop de código aberto sob a licença AGPL-3.0 que insere o discurso reconhecido diretamente onde o cursor está piscando. E faz isso completamente localmente na sua máquina.

O que o aplicativo pode fazer

A ideia principal é simples: pressione um atalho global, dite o texto no microfone, solte a tecla e as frases prontas aparecem imediatamente no campo de entrada ativo. Seja no editor VS Code, terminal, mensageiro ou navegador.

Aqui estão algumas coisas que o autor empacotou neste utilitário:

  • Reconhecimento no dispositivo. No macOS e Windows, o modelo Whisper funciona, e para Macs com chips Apple Silicon você pode conectar o modelo Parakeet otimizado.
  • Formatação via LLM. A diktação bruta geralmente está cheia de palavras de preenchimento e pausas estranhas. O aplicativo pode passar o texto rascunho pelo OpenAI, Anthropic, Gemini ou qualquer endpoint local personalizado para produzir um parágrafo limpo e editado na saída.
  • Transcrição de arquivos de mídia existentes. Você pode soltar um arquivo de áudio ou vídeo e obter uma transcrição de texto.
  • Histórico de gravações. Todas as transcrições são salvas na interface com metadados, para que você possa comparar o texto original com a versão editada ou reproduzir a gravação.
  • Modo servidor na rede local. Se você tiver uma placa de vídeo potente em um computador, pode configurar o Voicetypr como um servidor de transcrição local e enviar áudio de um laptop menos potente.

A propósito, se a potência local não for suficiente, você pode alternar para serviços de reconhecimento em nuvem nas configurações: Groq, Deepgram, OpenAI, Soniox ou Cohere. Mas todo o sentido do Voicetypr é que, por padrão, o fluxo de áudio nunca sai do seu computador.

CLI para automação e agentes locais

Um detalhe interessante que desenvolvedores raramente pensam em utilitários GUI semelhantes: o Voicetypr vem com uma interface de console integrada.

O comando pode ser instalado diretamente das configurações do programa. Isso torna possível chamar o mecanismo de reconhecimento de scripts bash ou conectar a agentes de IA locais:

# Проверить статус приложения
voicetypr status --json

# Посмотреть доступные модели
voicetypr models --json

# Расшифровать аудиофайл и получить структурированный JSON
voicetypr transcribe --file note.wav --json

# Записать голос с микрофона до наступления тишины
voicetypr record --until-silence --json

O flag --json retorna uma resposta estruturada, então o resultado é fácil de analisar com jq padrão ou alimentar mais adiante no pipeline.

Como funciona nos bastidores

A pilha do aplicativo é construída de forma bastante pragmática. O autor escolheu Tauri v2 e Rust para trabalho pesado do sistema e escreveu a interface em React 19, TypeScript, Tailwind CSS e shadcn/ui.

Todo o trabalho de interceptar hotkeys, capturar microfone, reamostrar áudio e emular entrada para a janela ativa fica inteiramente no backend Rust. Isso proporcionou resposta rápida e consumo modesto de RAM em comparação com aplicativos Electron típicos.

No Windows, o Whisper local pode usar Vulkan para aceleração de GPU. E esse processo é isolado em um sidecar separado. Se algo der errado com o driver de vídeo, o aplicativo simplesmente alterna silenciosamente para cálculos na CPU sem travar o programa principal.

Como compilar e executar

Se você quiser compilar o projeto do zero, precisará do Node.js com o gerenciador de pacotes pnpm, o toolchain Rust e ferramentas de compilação básicas para seu sistema operacional (Xcode CLI no macOS ou Visual Studio Build Tools no Windows).

A compilação é iniciada com comandos padrão:

git clone https://github.com/moinulmoin/voicetypr.git
cd voicetypr
pnpm install
pnpm tauri:dev

Também existem testes e linters prontos no repositório:

pnpm lint
pnpm test
pnpm test:backend
pnpm quality-gate

Para quem não quer compilar manualmente, pacotes DMG assinados para macOS e instaladores para Windows 10/11 estão disponíveis nos lançamentos do GitHub e no site oficial.

Por que um desenvolvedor precisa disso

Antes de mais nada, o Voicetypr será útil para quem escreve muito texto: manter documentação, rascunhar tarefas em rastreadores de issues ou se comunicar com redes neurais no Cursor e Claude Dev. Ditar contexto complexo por voz em vinte segundos é muito mais fácil do que digitar cinco parágrafos manualmente.

O segundo cenário óbvio é a privacidade. Se você trabalha com NDAs ou simplesmente não quer entregar gravações da sua voz para empresas terceiras, a combinação de Whisper local e inferência local via Ollama resolve completamente esse problema.

O projeto atualmente tem relativamente poucas estrelas no GitHub, mas a base de código parece limpa e a combinação Tauri com Rust funciona rápido. Definitivamente vale a pena experimentar, especialmente se você tem procurado uma替代 gratuita para aplicativos de diktação proprietários.

Projetos relacionados