Voice Clone Studio、主要な音声ニューラルネットワークを一つのウィンドウに統合
ローカルの音声合成や音声クローンの設定を試みたことがある方なら、依存関係地獄を覚えているでしょう。あるモデルはPyTorch 2.1と古いtorchaudioライブラリを必要とし、別のモデルは新鮮なCUDAビルドを要求し、3番目のモデルは別のONNX Runtimeバージョンを必要とします。结果は5つの仮想環境がディスクに蓄積し、それぞれがランダムなポートで独自のGradioインターフェースを実行しています。
FranckyBというニックネームの開発者がこの混乱に終止符を打ち、Voice Clone Studioプロジェクトをリリースしました。本質的には、Qwen3-TTS、Microsoft VibeVoice、Fish Speech、LuxTTS、Resemble AI Chatterbox、MMAudioエフェクトジェネレーターを1つのツールに統合したモジュラーオールインワンソリューションです。
このツールでできること
5つの異なるタブを開いてスクリプトを管理するのではなく、ここではすべてが統一されたデータパイプラインでタブ分割されています。
音声クローンと感情
基本的なシナリオはシンプルです:3〜10秒の短いオーディオサンプルをアップロードし、元の文字起こしを含むテキストを入力し、結果を取得します。しかし、美しいのは、ドロップダウンを使用して引擎をその場で切り替えられることです:
- Qwen3-TTS(0.6Bと1.7Bのバリアント)
- VibeVoice(1.5B、フルモデルと4ビット量子化)
- パラメータ数4BのFish Speech S2 Pro
- LuxTTSとChatterbox
Fish Speech引擎を選択すると、テキストに直接イントネーションマーカーを挿入できます(例:[whisper]、[laughing]、[excited])。システムには15,000以上のそのようなマーカーがあります。開発者の素晴らしい工夫として、QwenやVibeVoiceに戻すと、タグはモデルに送信される前に自動的にテキストから削除されるため、スクリプトが壊れることはありません。
ポッドキャスト用のダイアログシナリオ
最も興味深いタブの1つはConversationです。複数の話者間の長いダイアログ用に設計されています。
スクリプトは統一されたテキスト形式で記述されます:
[1]: Привет, как продвигается проект?
[2]: Отлично, только что собрал окружение без конфликтов.
[3]: Можно к вам присоединиться?
Qwenモードでは、行間の調整可能な一時停止を備えた9つの組み込みナレーターがあります。VibeVoiceモードに切り替えると、自分の音声サンプルを使用して4人の話者で最大90分間の連続トラック生成が得られます。モデルは自動的にアクセントを配置し、時にはリアルな効果のために微妙な部屋の環境音を добавлятьこともあります。
テキスト説明からの音声デザイン
クローン用の готовый オーディオファイルがない場合、Qwen3-TTSベースのVoice Designタブが便利です。希望のキャラクターを言葉で説明するだけです:年齢、性別、感情的なトーン、軽い英国アクセント、または quietで陰湿な話し方。ニューラルネットワークはゼロからユニークな声を生成します。
声の変更とサウンドエフェクト
Voice ChangerモジュールはChatterboxで動作し、 speech-to-speech変換を行います。マイクにテキストを入力し、保存されたサンプルからターゲット音色を選択し、モデルは元のタイミングとイントネーションを保持しながら、異なる声であなたの speechを再録音します。
ビデオダビングには、MMAudioがプロジェクトに追加されました。音のテキスト説明を入力するか、音声のない готовый ビデオクリップをドロップします。ニューラルネットワークはビデオを分析し、44.1 kHz品質で同期したサウンドエフェクトを生成します。
データ準備と微調整
Voice Clone Studioには組み込みのオーディオ準備ワークスペース(Prep Audio)があります。長いビデオをドロップし、オーディオトラックを抽出し、DeepFilterNetでノイズを削除し、音量を正規化し、Qwen3-ASRまたはWhisperを使用してファイルを自動的にフレーズにカットできます。
ここにはTrain Custom Voicesモジュールもあります。短いサンプルからの基本的なクローンでは不十分な場合、プロジェクトはVibeVoiceまたはQwenのローカルLoRA微調整を開始します。インターフェースには損失グラフとエポック進行が表示され、トレーニングされた重みはすぐにプリセットフォルダーに 配置されます。CUDA対応GPUでは、小さなデータセットでのトレーニングに10〜30分かかります。
内部構造
プロジェクトのアーキテクチャはモジュラー形式です。メインストリームスクリプト voice_clone_studio.pyは約230行で、modules/core_components/tools/ディレクトリからタブを動的にロードします。不要なモデルや重いタブは設定で無効化して、インターフェースとメモリを整理できます。
興味深いエンジニアリングソリューションの中で:
- CUDA Graphs加速サポート(Faster-Qwen3-TTSプロジェクト)により、Qwenの推論速度が5〜10倍向上します。
- 異なるGPU間でのモデルの分散配置。システムに2つのGPUがある場合、音声生成を1つのカードに配置し、ASR認識とローカルLLMを2番目に 配置できます。
- 組み込みのPrompt Manager。ローカルllama.cppまたはOllamaサーバーに接続し、GGUFモデルをダウンロードし、インターフェース内でダイアログまたはシステムプロンプトの生成を支援します。
起動と注意点
最小の快適な阈値はNVIDIA GPUで8GB VRAMです。macOSでは、MPS(Apple Silicon)経由でもプロジェクトは動作しますが、トレーニングタブは自動的に非表示になります(トレーニングはCUDAに焦点を当てているため)。
Linuxでのクイック起動は次のようになります:
git clone https://github.com/FranckyB/Voice-Clone-Studio.git
cd Voice-Clone-Studio
chmod +x setup-linux.sh
./setup-linux.sh
./launch.sh
Windowsでは、 готовый setup-windows.batがあり、システムに直接SOXとFFMPEGをインストールしたくない場合は、Docker Compose設定もあります。
注意すべきいくつかの実用的なニュアンス:
- Python 3.11を推奨します。バージョン3.12はDeepFilterNetノイズリダクションのwheelビルドに問題を起こす可能性があります。
- LinuxとmacOSユーザーは、環境の競合を避けるために
openai-whisperパッケージのインストールを避けるべきです。代わりにVibeVoice ASRとQwen3 ASRがデフォルトで正常に動作します。 - 任意のサンプルでの最初の生成は、音声プロンプトがキャッシュされる間に遅延がありますが、後続の行は大幅に高速に_assembleされます。
誰がこのプロジェクトを見つけるか
Voice Clone Studioは3つの明確なニーズに対応しています。第一に、コンソールを扱わずに同じオーディオ素材でVibeVoice、Qwen3、Fish Speechの品質を比較したい人にとって優れたテスト環境です。第二に、90分間の生成機能を備えたConversationモジュールを評価するポッドキャストとオーディオブックの作成者。第三に、トレーニングスクリプトを書かずにデータセットの準備とカスタム音声モデルのトレーニングのための готовなワークステーションです。
関連プロジェクト