>_ DevTrendsja

言語

ホーム

言語

セクション

フロントエンド バックエンド モバイル DevOps AI / ML ゲーム開発 ブロックチェーン 組み込み セキュリティ
Python

VoiceStudioで自有ハードウェアにローカルElevenLabs環境を構築

最近、チュートリアル動画を数十本作って字幕を切る必要がありました。最初はElevenLabsのようなクラウドサービスを使おうと思いましたが、チーム向けサブスクリプションのコストを計算し、ドラフト音声や機密性の高い素材を外部サーバーに送信することを考えると、情熱が冷めてしまいます。

VoiceStudio(旧称OmniVoice-Studio)はGitHubで人気を集めているデスクトップアプリケーションです。ローカルで動作する音声合成、声音クローン、文字起こし、吹き替えのためのアプリケーションです。

VoiceStudio logo

トークンも生成クレジットもクレジットカードの紐付けも不要です。アプリをダウンロードすれば、必要なモデル重みが自動的に取得され、すべての処理はGPUまたはCPU上で実行されます。

このアプリでできること

このリポジトリには、近年の注目すべきオープンソースのオーディオ開発がほぼすべて集約されています。 десятокの個別のJupyterノートブックを起動したり、互換性のないPyTorchバージョンに頭を悩ませたりする必要はなく、すぐに使えるGUIとローカルサーバーが手に入ります。

Switching engines in VoiceStudio

このプログラムが対応している主なシナリオは次のとおりです:

  1. 声音クローン。ゼロショットモードで動作します:ノイズや音楽のない5〜15秒の参照用オーディオクリップを用意し、テキストを入力すれば、同じ音色の готов trackが生成されます。
  2. 声音デザイン。 готов sampleがない場合でも、パラメータはテキストで設定できます:年齢、アクセント、トーン、感情的な色づけ、話し方の癖など。
  3. 自動動画吹き替え。このツールは動画内の speech を認識し、翻訳し、話者分離(ダイアリゼーション)で話者を分け、合成音声を元のトラックにオーバーレイして、すぐに完成ファイルをエクスポートできます。
  4. オーディオブックと長編ストーリー。EPUBまたはPDF形式のファイルをアップロードし、異なる仮想ナレーターに行を分配し、チャプターをレンダリングして、最終的な本をMP3形式でアセンブルできます。
  5. システムディクテーションウィジェット。グローバルホットキーを押すと、マイクからの音声がリアルタイムでテキストに変換され、ローカル言語モデルがすぐにフィラーワードを削除して句読点を追加できます。

組み込みのモデルカタログでは、キーコンビネーションで16の合成エンジンと11の認識引擎をいつでも切り替えられます。

Model catalog and voice gallery

内部構造とターミナル

プロジェクトのアーキテクチャはよく考えられています。開発者はすべてを重量級のElectronでラップしていません。

  • デスクトップシェル:Rustで書かれたTauri v2。システムトレイ、ホットキー呼び出し、バックグラウンドプロセス管理を担当します。
  • インターフェース:ViteバンドラーとZustand状態管理자를使用したReact。
  • バックエンド:PythonのFastAPIで、ポート8000でスピンアップ。内部にはモデルアダプター、タスクキュー、Alembicによるマイグレーション付きのSQLiteデータベースが動作しています。

音声合成エンジンの中では、k2-fsa/OmniVoice、CosyVoice 3、GPT-SoVITS、VoxCPM2、PocketTTS、MOSS-TTS経由で646言語のサポートがうたわれています。文字起こしには、WhisperX、Faster-Whisper、Parakeet TDT、FunASRが利用可能です。オーディオトラックの分離は必要な場合にDemucsで行われ、話者の特定はPyannote経由で行われます。

インターフェースが不要でスクリプトからオーディオを生成したい場合は、バックエンドがOpenAI互換APIを公開しています。クライアントでベースURLをリダイレクトするだけです:

base_url="http://localhost:8000/v1"

標準のREST APIに加えて、WebSocket、Server-Sent Events、MCP(Model Context Protocol)もサポートされています。这意味着语音合成和识别可以直接作为Claude Code或Cursor中AI代理的工具调用。

ハードウェア要件とインストール

クイックスタートのために、作者らは готов-madeビルドを用意しています:

  • macOS:Apple Silicon用のDMGパッケージ(MPSとMLXバックエンドがサポートされています)。古いIntelプロセッサでは、ローカルバックエンドは動作しません。
  • Windows:CUDAアクセラレーション対応の64ビットシステム用MSIインストーラー。
  • Linux:CUDAとROCmサポート付きのAppImageパッケージと готов Dockerコンテナ。

初回起動時に、プログラムは自動的に分離されたPython環境をセットアップし、ベースモデルをダウンロードします。

快適な作業に必要な最小要件は、GPUで実行する場合8GBのRAMと4GBのビデオメモリです。GPUがない場合でも、ベースモデルはCPUでも動作しますが、長いセグメントの生成にはかなり時間がかかります。CosyVoice 3のような重いモデルの場合は、8〜16GBのVRAM搭載のカードを用意することをお勧めします。

ソースからプロジェクトを実行したい場合は、gitとPythonが必要です:

git clone https://github.com/...

ブラウザでWebインターフェースのみを実行する場合は、python -m appコマンドを使用します。

誰が便利に使えるか

このプロジェクトは、オーディオコンテンツを定期的に扱っていて、外部クラウドにデータを漏らしたくない人なら誰でもきっと気に入るでしょう。ポッドキャストのローカライゼーション、文書の音声化自動ナレーション、イン디게임의 음성 지원、ローカルでの会議文字起こし(時間制限なし)などにも最適です。

コードはAGPL-3.0ライセンスで配布されており、ベースモデルはApache-2.0で出荷されています。デスクトップ用のオールインワンオーディオツールを探していたなら、VoiceStudioは確かにインストールして試す価値があります。

関連プロジェクト