Como Transformar Voz em Código e Notas Sem Nuvens e Olhos Indiscretos
Imagine: você está em uma ligação, as ideias estão voando rápido, e anotá-las manualmente significa perder o ritmo. Ou outra situação: você precisa rascunhar rapidamente uma documentação, mas seus dedos já estão cansados de digitar. Soa familiar? Geralmente em momentos assim, recorremos a serviços pagos que enviam seus dados de áudio para seus servidores, analisam e possivelmente treinam seus modelos com eles.
Recentemente encontrei o OpenWhispr. É um projeto de código aberto que tenta resolver o problema de ditado e transcrição para usuários comuns. O recurso principal aqui é a privacidade: tudo pode funcionar localmente no seu hardware, seja um MacBook com chip M ou uma máquina Linux com GPU NVIDIA.
O que essa ferramenta pode fazer
OpenWhispr não é apenas um wrapper em torno de um modelo de reconhecimento de fala. É uma aplicação desktop completa em Electron que se integra ao seu fluxo de trabalho.
Ditado bem no cursor
O cenário mais simples: você pressiona um atalho de teclado, dita o texto e ele aparece imediatamente na janela ativa. Seja VS Code, Slack ou navegador. Há até um recurso separado para tradução em tempo real — fale em um idioma e o texto em outro é inserido.
Reuniões inteligentes e reconhecimento de locutor
O projeto pode detectar automaticamente chamadas no Zoom, Teams ou FaceTime. Mas o recurso mais interessante aqui é a diarização local. O programa lembra "impressões digitais" de vozes e rotula quem disse o quê, sem enviar a gravação para a nuvem. Se você costuma ouvir novamente gravações de reuniões para lembrar quem prometeu corrigir aquele bug até quarta-feira, isso vai economizar muito tempo.
Agentes de IA ao seu alcance
Dentro existem agentes que você pode controlar com comandos de voz. Você pode conectar pesos pesados como GPT-4 ou Claude via API, ou usar modelos locais através do llama.cpp. Pressione um botão, pergunte "escreva um breve resumo deste texto", e o agente entrega o resultado.
Detalhes técnicos
Os desenvolvedores montaram uma stack bastante sólida. A base é React 19 e Tailwind CSS v4 para a interface, com Electron 41 por baixo.
Para a mágica de voz, eles usam:
- whisper.cpp para reconhecimento C++ de alto desempenho.
- NVIDIA Parakeet e sherpa-onnx para quem prefere velocidade de GPU.
- better-sqlite3 para armazenar notas e transcrições.
Curiosamente, o projeto suporta aceleração Metal no macOS, CUDA na NVIDIA e até Vulkan para GPUs AMD e Intel. Isso significa que a transcrição local não vai demorar uma eternidade.
Como executar
Se você não quer lidar com compilação a partir do código-fonte, eles têm builds prontos para todas as plataformas. Mas somos desenvolvedores aqui, queremos colocar as mãos no código. Para executar a partir do código-fonte, você vai precisar de Node.js 24+.
git clone https://github.com/OpenWhispr/openwhispr.git
cd openwhispr
npm install
npm run dev
A propósito, o projeto tem seu próprio servidor MCP (Model Context Protocol). Isso permite conectar suas notas e transcrições diretamente ao seu assistente de IA favorito como contexto externo.
Para quem isso será útil
Vejo várias categorias de pessoas que vão apreciar o OpenWhispr:
- Desenvolvedores que mantêm muitos logs ou notas e querem fazer isso mais rápido.
- Líderes de equipe que precisam capturar os resultados de reuniões sem envolver serviços espiões de terceiros.
- Paranóicos (no bom sentido) que valorizam soluções auto-hospedadas e privacidade de dados.
O projeto parece bastante ativo: quase 5.000 estrelas no GitHub e commits ativos. Claro, o Electron vai consumir uma boa quantidade de RAM, e modelos locais vão colocar carga na CPU, mas esse é um preço justo por manter suas conversas apenas no seu disco.
Se você tem procurado uma alternativa gratuita e aberta aos serviços de ditado proprietários, o OpenWhispr definitivamente vale a pena passar uma noite testando em condições reais.
Projetos relacionados