Spracherkennung auf beliebiger Hardware ohne Python-Abhängigkeiten und Kopfschmerzen ausführen
Stellen Sie sich vor, Sie müssen eine Sprach-zu-Text-Funktion zu Ihrer Anwendung hinzufügen. Sie öffnen die Dokumentation beliebter Bibliotheken und sehen eine endlose Liste von Abhängigkeiten: PyTorch mit mehreren Gigabyte, spezifische CUDA-Versionen, eine Reihe von Python-Skripten und komplizierte Umgebungen. Und was, wenn Sie dies auf einem normalen Laptop ohne leistungsstarke GPU oder auf Apple Silicon ausführen müssen?
Kürzlich bin ich auf das Projekt transcribe.cpp gestoßen, das dieses Problem radikal löst. Es ist eine leichtgewichtige C/C++-Bibliothek, die auf der ggml-Engine aufbaut. Was sie für die Spracherkennung leistet, hat llama.cpp für Sprachmodelle getan: Sie verwandelt ressourcenintensive neuronale Netze in kompakte, sofort funktionierende Programme.
Unter der Haube
Das Projekt beschränkt sich nicht auf eine einzige Architektur. Die Entwickler von handy-computer haben enorme Arbeit geleistet und 16 Modellfamilien portiert. Die Liste umfasst sowohl die bewährte Whisper von OpenAI als auch neuere Optionen: Parakeet, NVIDIA's Canary, GigaAM und sogar das multimodale Voxtral, das nicht nur transkribieren, sondern auch Audio direkt übersetzen kann.
Das Haupt-Highlight ist die Verwendung des GGUF-Formats. Das bedeutet, dass Modelle quantisiert (komprimiert) werden können, wodurch ihre Größe um ein Vielfaches reduziert wird, ohne dass die Genauigkeit darunter leidet. Wenn Sie begrenzten RAM haben, können Sie die Q4_K_M-Version verwenden und ein ziemlich ernstzunehmendes Modell sogar auf einem Büro-PC ausführen.
Warum es für Entwickler praktisch ist
Als ich das Repository durchsuchte, fielen mir mehrere Dinge auf, die man in ähnlichen Open-Source-Projekten selten sieht.
Erstens die Backend-Unterstützung. Die Bibliothek wählt automatisch Metal auf dem Mac, funktioniert über Vulkan auf Linux und Windows, und für NVIDIA-Besitzer gibt es CUDA. Wenn Sie überhaupt keine GPU haben, wird tinyBLAS verwendet – optimierte CPU-Anweisungen, die Berechnungen im Vergleich zu normalem Code um das 10-15-fache beschleunigen.
Zweitens haben die Autoren Aufwand in die Genauigkeitsüberprüfung gesteckt. Jedes Modell, das sie auf Hugging Face veröffentlichen, besteht einen numerischen Test und eine WER-Prüfung (Word Error Rate). Es ist nicht nur „Gewichte kopiert und hofft, dass es funktioniert
Ähnliche Projekte