>_ DevTrendsja

言語

ホーム

言語

セクション

フロントエンド バックエンド モバイル DevOps AI / ML ゲーム開発 ブロックチェーン 組み込み セキュリティ
JavaScript

クラウドや覗き見なしで、声をコードやメモに変換する方法

想像してみてください:電話会議中で、アイデアが次々と湧いてくるのに、手でメモしていたら流れが止まってしまう。或者は、別の場面として:ドキュメントの下書きを急いで作成する必要があるのに、指先はすでにタイピングで疲れている。こんな経験、ありませんか?このような瞬間には обычно、音声データをサーバーに送信して分析し、おそらくはそのデータでモデルを訓練している有料サービスに頼ることになります。

最近、OpenWhisprを見つけました。これは、一般ユーザー向けの音声入力と文字起こしの問題を解決しようとするオープンソースプロジェクトです。主な特徴はプライバシーです:すべてお使いのハードウェア上でローカルに実行できます。M-chip搭載のMacBookでも、NVIDIA GPU搭載のLinuxマシンでも。

OpenWhispr

このツールでできること

OpenWhisprは、単に音声認識モデルをラップしただけのものではありません。ワークフローに統合されたフル機能のデスクトップアプリケーションです。

カーソル位置での直接音声入力

最もシンプルなシナリオ:ホットキーを押してテキストを音声入力すると、アクティブウィンドウにすぐに表示されます。VS Codeでも、Slackでも、ブラウザでも。もう一つの отдельная機能として、その場で翻訳することもできます—one languageで話すと、別の言語のテキストが挿入されます。

スマートな会議と話者認識

このプロジェクトは、Zoom、Teams、FaceTimeでの通話を自動的に検出できます。しかし、ここで 가장素晴らしいのはローカル diarization(話者分離)です。プログラムは声の「指紋」を記憶して、誰が何と言ったかにラベル付けします。クラウドに録音を送信する必要はありません。会議の録音を何度も聞き返して、水曜までにあのバグを修正すると約束したのは誰だったか思い出そうとしているなら、これは大量の時間を節約してくれます。

手の届くところにあるAIエージェント

内部には、音声コマンドで制御できるエージェントが含まれています。GPT-4やClaudeのような有力モデルをAPI経由で接続したり、llama.cppを通じてローカルモデルを使用したりできます。ボタンを押し、「このテキストの簡単な要約を書いて」と依頼すると、エージェントが結果を返します。

技術的な内部構造

開発者たちはかなり堅実なスタックを構築しました。基盤はReact 19とTailwind CSS v4で、Electron 41がその裏側で動作しています。

音声の魔法のため、以下を使用しています:

  • whisper.cpp — 高性能C++認識
  • NVIDIA Parakeetとsherpa-onnx — GPU速度を優先する方向け
  • better-sqlite3 — メモと文字起こしの保存用

興味深いことに、このプロジェクトはmacOSでのMetalアクセラレーション、NVIDIAでのCUDA、そしてAMDやIntel GPU向けのVulkanさえサポートしています。つまり、ローカルでの文字起こしが永遠に続くことはありません。

実行方法

ソースからのビルドしたくない場合、すべてのプラットフォーム向けの готовыеビルドがあります。でも私たちは開発者です。コードに触りたいですよね。ソースから実行するには、Node.js 24+が必要です。

git clone https://github.com/OpenWhispr/openwhispr.git
cd openwhispr
npm install
npm run dev

ちなみに、このプロジェクトには独自のMCPサーバー(Model Context Protocol)があります。これにより、メモや文字起こしをお気に入りのAIアシスタントに外部コンテキストとして直接接続できます。

誰が役立つのか

OpenWhisprを高く評価するであろういくつかの人々のカテゴリーがあります:

  1. 多くのログやメモを取っていて、もっと速くやりたい開発者
  2. 会議の結果を記録する必要があるが、サードパーティのスパイサービスには頼したくないチームリーダー
  3. (良い意味での)paranoidで、自己ホスト型のソリューションとデータのプライバシーを重視する人々

このプロジェクトは очень живой(非常にアクティブ)です:GitHubでほぼ5,000個のスターがあり、コミットも活発です。当然ながら、Electronは一定のRAMを消費しますし、ローカルモデルはCPUに負荷をかけますが、会話をディスク上にだけ保持するための対価としては妥当です。

有料の音声入力サービスの代替として、自由でオープンなものを探していたなら、OpenWhisprは実際の条件で一晩かけてテストする価値があります。

関連プロジェクト