SGLang-Omniで音声・マルチモーダルモデルの高速推論を設定する方法
SGLang-Omniは、音声エンコーディングから音声合成までの複雑なパイプラインを処理する、音声・マルチモーダルモデルのマルチステージ推論に特化したランタイムを提供します。
言語
ホーム言語
セクション
SGLang-Omniは、音声エンコーディングから音声合成までの複雑なパイプラインを処理する、音声・マルチモーダルモデルのマルチステージ推論に特化したランタイムを提供します。
Sentinelで古いAndroidスマホをAI監視システムに変身。LAN越しに動画を取得、PCに記録し、マルチモーダルニューラルネットでリアルタイムイベント認識。
マルチモーダルモデルの訓練スクリプトを散らかった形で管理するのに疲れていませんか?lmms-engineは、分散訓練、シーケンスパッキング、GPU最適化を処理するモジュラーエンジンで、設定とデータに集中できます。
動画をフレームとタイムスタンプ付き文字起こしに変換するClaude Code用プラグイン。スクリーンキャストやYouTube動画をターミナルで直接AIに分析させることができる。
FirebaseチームがAI機能構築用のフレームワーク「Genkit」をオープンソース化。Gemini、OpenAI、Ollamaをスパゲティコードなしに組み合わせられるのか?
実際に動作するAIエージェントを構築するための実践ガイド。Bojie Liのai-agent-bookリポジトリでは、コンテキストエンジニアリングからファインチューニングなしの自己進化までカバーしている。
MLX-AudioがApple Silicon Macに超高速のTTS、STT、STS機能をもたらします。AppleのMLXフレームワーク 기반으로、Whisper、Kokoro、声のクローンなどに対応し、クラウドコストなしでローカル実行。
AnythingLLMは、ドキュメントをチャット可能なスマートナレッジベースに変換します。20以上のLLM、ノーコードエージェント、マルチモーダル処理に対応。