>_ DevTrendsja

言語

ホーム

言語

セクション

フロントエンド バックエンド モバイル DevOps AI / ML ゲーム開発 ブロックチェーン 組み込み セキュリティ
C-plus-plus

Python依存なしで任意のハードウェアで音声認識を実行する方法

Speech-to-Text機能をアプリケーションに追加する必要があるとします。人気ライブラリのドキュメントを開くと、果てしなく続く依存関係のリストが表示されます:数ギガバイトのPyTorch、特定のCUDAバージョン、複数のPythonスクリプト、そして面倒な環境設定です。そして、強力なGPUのない普通のノートパソコンや、Apple Silicon上で動作させる必要がある場合はどうでしょうか?

最近、transcribe.cppプロジェクトを見つけました。このプロジェクトは、この問題を根本から解決します。ggmlエンジンをベースにした軽量なC/C++ライブラリです。llama.cppが言語モデルに対して行ったことを、音声認識に対して行いました:重量級のニューラルネットワークを、「そのまま動く」コンパクトな実行ファイルに変換します。

内部構造

このプロジェクトは単一のアーキテクチャに限定されていません。handy-computerの開発者は、16のモデルファミリーを移植するという巨大な仕事を完了しました。リストには、OpenAIの実績あるWhisperだけでなく、Parakeet、NVIDIAのCanary、GigaAM、さらにはオーディオを文字起こしだけでなく直接翻訳できるマルチモーダルなVoxtralなど、新しいオプションも含まれています。

ここでの主な特徴は、GGUFフォーマットの使用です。つまり、モデルは量子化(圧縮)でき、精度のほぼ无损でサイズを数分の1に縮小できます。RAMが限られている場合は、Q4_K_Mバージョンを選択して、事務用PCでもかなり本格的なモデルを実行できます。

開発者にとってなぜ便利なのか

リポジトリを閲覧していたとき、同様のオープンソースプロジェクトではめったに見られないいくつかの特徴に気づきました。

まず、バックエンドのサポートです。このライブラリはMacでMetalを自動選択し、LinuxとWindowsではVulkan経由で動作し、NVIDIAユーザーはCUDAを利用できます。GPUがまったくない場合は、tinyBLASが使用されます—通常のコードと比較して計算を10〜15倍高速化する最適化されたCPU命令です。

次に、作者たちは精度検証に力を入れています。Hugging Faceで公開されているすべてのモデルは、数値テストとWER(Word Error Rate)チェック通过了しています。「重みをコピーしてうまくいくといいね」というものではなく、元のPyTorch実装の結果に可能な限り近い結果を出す検証済みの移植です。

試してみる方法

プロジェクトのビルドは、C++の世界では標準的です。CMakeがインストールされていれば、ビルドは数分で完了します。

Vulkanサポート付きのLinuxの場合:

ビルド後、CLIユーティリティを通じてライブラリをすぐに試すことができます。唯一の制限は、入力ファイルが16kHzモノラルのWAV形式である必要があることです。mp3をお持ちの場合は、ffmpegで変換する必要があります:

プロジェクトへの統合

誰もが純粋なC++での記述を好むわけではありません。作者们也そう理解しています。リポジトリにはすでに готовые バインディングが含まれています:

  • Python(使い慣れた言語を維持したいが、重い依存関係はなくしたい場合)
  • TypeScript / JavaScript(Electronでのデスクトップアプリケーション用)
  • Rust
  • Swift / Objective-C(iOSおよびmacOSのネイティブサポート)

興味深いことに、このプロジェクトはバッチファイル処理だけでなく、ストリーミングもサポートしています。これは、音声アシスタントやリアルタイムシステムを構築している場合、話している間にテキストが表示される必要がある場合に重要です。

transcribe.cpp誰が恩恵を受けるか

このプロジェクトが標準的なソリューションより優れているシナリオがいくつか考えられます。

デスクトップソフトウェアを開発していて、ユーザーにPythonのダウンロードと環境設定を強制したくない場合、transcribe.cppは理想的なオプションです。ライブラリはコンパクトで、依存関係は最小限です。

エッジ(エッジコンピューティング)やGPUのない弱いサーバーでの作業には、量子化サポートとCPU最適化により、既存のハードウェアから最大限の性能を引き出せます。

このプロジェクトはMozilla AIとHugging Faceによって積極的にメンテナンスされており、長期的な開発への信頼が高まります。追加の依存関係の肥大化なしに、高速でクロスプラットフォームかつ信頼性の高い音声認識が必要な場合は、ぜひこのリポジトリをチェックしてください。 готов-madeでテスト済みのGGUFモデルが入手できるHugging Faceページから始めることができます。

関連プロジェクト