Lokale Spracherkennung direkt am Cursor mit Voicetypr
Ich erwische mich oft dabei, wie ich denke, dass das Eintippen langer Prompts für neuronale Netze oder detaillierter Kommentare zu Pull Requests einfach zu mühselig ist. Meine Finger werden müde, Gedanken geraten durcheinander, und ich habe keine Lust, den Entwurf erneut zu lesen. Spracherkennung scheint dieses Problem zu lösen, aber die Standard-Systemtools in macOS und Windows funktionieren nicht besonders gut. Cloud-Dienste von Drittanbietern wie Wispr Flow erfordern ein Abonnement und leiten alle Ihre Sprachdaten über externe Server weiter, was für vertraulichen Code oder arbeitsbezogene Chats sofort wegfällt.
Kürzlich bin ich auf ein interessantes Projekt namens Voicetypr gestoßen. Es handelt sich um eine Open-Source-Desktop-Anwendung unter der AGPL-3.0-Lizenz, die erkannte Sprache direkt dort einfügt, wo der Cursor blinkt. Und das komplett lokal auf Ihrem Rechner.
Was die App kann
Die Grundidee ist einfach: Drücken Sie eine globale Tastenkombination, diktieren Sie Text in das Mikrofon, lassen Sie die Taste los, und die fertigen Sätze erscheinen sofort im aktiven Eingabefeld. Egal ob VS Code-Editor, Terminal, Messenger oder Browser.
Hier sind einige Funktionen, die der Autor in dieses Tool gepackt hat:
- On-Device-Erkennung. Auf macOS und Windows funktioniert das Whisper-Modell, und für Macs mit Apple-Silicon-Chips können Sie das optimierte Parakeet-Modell anschließen.
- Formatierung per LLM. Rohe Diktate enthalten oft Füllwörter und merkwürdige Pausen. Die App kann Entwurfstext über OpenAI, Anthropic, Gemini oder einen beliebigen benutzerdefinierten lokalen Endpunkt leiten, um einen sauberen und bearbeiteten Absatz auszugeben.
- Transkription bestehender Mediendateien. Sie können eine Audio- oder Videodatei ablegen und erhalten eine Texttranskription.
- Aufnahmeverlauf. Alle Transkriptionen werden in der Oberfläche mit Metadaten gespeichert, sodass Sie den Originaltext mit der bearbeiteten Version vergleichen oder die Aufnahme erneut abspielen können.
- Server-Modus über lokales Netzwerk. Wenn Sie eine leistungsstarke Grafikkarte auf einem Computer haben, können Sie Voicetypr als lokalen Transkriptionsserver einrichten und Audio von einem weniger leistungsstarken Laptop senden.
Übrigens, wenn die lokale Leistung nicht ausreicht, können Sie in den Einstellungen auf Cloud-Erkennungsdienste umschalten: Groq, Deepgram, OpenAI, Soniox oder Cohere. Aber der ganze Sinn von Voicetypr ist, dass der Audiostream standardmäßig nie Ihren Computer verlässt.
CLI für Automatisierung und lokale Agents
Ein interessantes Detail, das Entwickler bei ähnlichen GUI-Tools selten bedenken: Voicetypr wird mit einer integrierten Konsolenschnittstelle ausgeliefert.
Der Befehl kann direkt aus den Programmeinstellungen installiert werden. Dadurch wird es möglich, die Erkennungs-Engine aus Bash-Skripten aufzurufen oder eine Verbindung zu lokalen KI-Agents herzustellen:
# Проверить статус приложения
voicetypr status --json
# Посмотреть доступные модели
voicetypr models --json
# Расшифровать аудиофайл и получить структурированный JSON
voicetypr transcribe --file note.wav --json
# Записать голос с микрофона до наступления тишины
voicetypr record --until-silence --json
Das Flag --json gibt eine strukturierte Antwort zurück, sodass das Ergebnis leicht mit Standard-jq geparst oder weiter in der Pipeline verarbeitet werden kann.
Wie es unter der Haube funktioniert
Der App-Stack ist ziemlich pragmatisch aufgebaut. Der Autor wählte Tauri v2 und Rust für schwere Systemarbeit und schrieb die Oberfläche in React 19, TypeScript, Tailwind CSS und shadcn/ui.
Die gesamte Arbeit des Abfangens von Hotkeys, der Mikrofonaufnahme, des Resamplings von Audio und der Emulation der Eingabe ins aktive Fenster liegt vollständig auf dem Rust-Backend. Das ergab schnelle Reaktionszeiten und modesten RAM-Verbrauch im Vergleich zu typischen Electron-Apps.
Auf Windows kann lokales Whisper Vulkan für GPU-Beschleunigung nutzen. Und dieser Prozess ist in einem separaten Sidecar isoliert. Wenn etwas mit dem Videotreiber schiefgeht, wechselt die App einfach stillschweigend zu CPU-Berechnungen, ohne das Hauptprogramm zum Absturz zu bringen.
Wie man baut und ausführt
Wenn Sie das Projekt selbst aus dem Quellcode bauen möchten, benötigen Sie Node.js mit dem pnpm-Paketmanager, die Rust-Toolchain und grundlegende Build-Tools für Ihr Betriebssystem (Xcode CLI auf macOS oder Visual Studio Build Tools auf Windows).
Der Build wird mit Standardbefehlen gestartet:
git clone https://github.com/moinulmoin/voicetypr.git
cd voicetypr
pnpm install
pnpm tauri:dev
Im Repository gibt es auch fertige Tests und Linter:
pnpm lint
pnpm test
pnpm test:backend
pnpm quality-gate
Für diejenigen, die nicht manuell kompilieren möchten, sind signierte DMG-Pakete für macOS und Installer für Windows 10/11 in den GitHub-Releases und auf der offiziellen Website verfügbar.
Warum ein Entwickler dies braucht
Voicetypr ist vor allem für diejenigen nützlich, die viel Text schreiben: Dokumentation pflegen, Aufgaben in Issue-Trackern entwerfen oder mit neuronalen Netzen in Cursor und Claude Dev kommunizieren. Komplexen Kontext in zwanzig Sekunden per Sprache zu diktieren ist viel einfacher, als fünf Absätze von Hand zu tippen.
Das zweite offensichtliche Szenario ist Datenschutz. Wenn Sie mit NDAs arbeiten oder einfach keine Sprachaufnahmen an Drittunternehmen weitergeben möchten, löst die Kombination aus lokalem Whisper und lokaler Inferenz über Ollama dieses Problem vollständig.
Das Projekt hat derzeit relativ wenige Sterne auf GitHub, aber der Codebase sieht sauber aus und die Kombination aus Tauri mit Rust funktioniert schnell. Es lohnt sich auf jeden Fall, es auszuprobieren, besonders wenn Sie nach einem kostenlosen Ersatz für proprietäre Diktier-Apps gesucht haben.
Ähnliche Projekte