>_ DevTrendsja

言語

ホーム

言語

セクション

フロントエンド バックエンド モバイル DevOps AI / ML ゲーム開発 ブロックチェーン 組み込み セキュリティ
Unknown

ニューラルネットワークのための無限キャンバス — AI CanvasProがAI作業をビジュアルな創造体験に変える方法

複雑なプロジェクトに取り組んでいる状況を想像してみてください:キャラクターを生成し、台本を書かせ、声を当てさせ、すべてを短い動画に変換する必要があります。通常、これはブラウザタブの悪夢へと発展します:ChatGPTはここで、Midjourneyはあそこで、ElevenLabsは別のウィンドウ、そして編集はまったく別のアプリで行います。中国の開発者、ashuoAIというニックネームを持つ人物は、もう十分だと思い、AI CanvasProを構築しました。

これはElectronデスクトップアプリケーションで、生成プロセスを無限キャンバス上のノード操作に変えます。Blender(Geometry Nodes)やDaVinci Resolve(Fusion)を開いたことがある人なら、すぐにそのロジックを理解できるでしょう。

https://raw.githubusercontent.come/ashuoAI/AI-CanvasPro/master/images/favicon.svg

そもそも这是什么

AI CanvasProは、レイヤーやチャットではなくノードを使用するビジュアルエディタです。テキスト用のノードを配置し、画像生成ノードに接続し、結果を動画またはアップスケーラーノードに送信します。このプロジェクトは本身でニューラルネットワークを置き換えることは目指していません—異なるAPIやローカルツールの「接着剤」として機能します。

最も素晴らしい点は、クラウドAPI(OpenAIやGeminiなど)だけでなく、ComfyUIとの深い統合もサポートしていることです。つまり、ローカルのワークフローをキャンバスに直接引っ張ってきて、クラウドモデルと組み合わせることができるのです。

How it works in practice

ここでの主な特徴はデータ接続性です。通常のチャットボットでは、コンテキストは1つのダイアログに限定されます。AI CanvasProでは、プロンプト入力フィールド内で記号@を使用することで、キャンバス上の他の任意のノードの出力を参照できます。例えば、テキストブロックからキャラクターの説明を取得して、画像ジェネレーターに渡すことができます。

Main node types

キャンバスには десятки種類の異なるノードタイプ配置できます。以下は、私が最も有用だと思ったものです:

  • Material source. ここからディスクからファイルをドラッグできます—画像、音源、または動画です。
  • Generators. テキスト(GPT-4、Gemini)、画像(RunningHubまたはAPImart経由)、そして動画用の別々のブロックです。
  • Browser node. Webから直接コンテンツを引っ張ってきて、そのまま処理に送ることができます。
  • Editing tools. 動画トリミング、写真からの背景削除、さらには360度パノラマ操作のための組み込みミニエディターです。

オーディオ作業の実装も面白いです。別々の「オーディオスタジオ」があり、声をクローンしたり、ボーカルとBGMを分離したりできます。すべてが1つのプロジェクト内で完結し、果てしないエクスポートとインポートがありません。

Technical side and installation

このアプリはElectronで構築されているため、クロスプラットフォームです。WindowsとmacOS(Apple Silicon含む)のビルドがあります。

「オープン性」について重要な注意:著者はGitHubにプロジェクトを投稿しましたが、古典的な意味でのオープンソースではありません。ライセンスは許可なく商業利用すること、およびアプリをSaaSとして転売することを禁止しています。個人利用や実験に制限はありません。

始めるには、以下の手順が必要です:

  1. Releasesセクションから.exeまたは.dmgをダウンロードします。
  2. 設定に移動します(左下のプロフィールアイコン)。
  3. APIキーを入力します。特定の中国プロバイダー(RunningHub、Volcano Engine)と標準のOpenAI API形式の両方がサポートされています。

Who is this for

2つの主なユースケースがあります。1つはソーシャルメディアやYouTube向けのコンテンツ制作です。「テキスト→画像→ナレーション→動画」というチェーンでアイデアを素早く試す必要がある場合、ビジュアルキャンバスは多くの時間を節約できます。

2番目のユースケースは、複雑なパイプラインのプロトタイピングです。開発者で、複数のモデルの組み合わせがどのように機能するかを素早くテストしたい場合は、ノードをキャンバスに投げ込む方がPythonスクリプトを書くよりもずっと速いです。

AI CanvasProは、チャットボットインターフェースに厌倦した人にとって堅実なツールです。このプロジェクトにはまだ粗削りな部分があります—例えば、インターフェースとドキュメントの一部は中国語です(ただし、主要な機能は直感的に理解できます)、そしてライセンスは 꽤 엄격합니다。しかし、キャンバス上の「AIオペレーティングシステム」というコンセプトは非常にうまく実装されています。

ComfyUIを積極的に使用している場合や、複数のニューラルネットワークを同時に扱うことが多いなら、ぜひ試してみる価値があります。少なくとも、生成物の整理整頓に最適な方法です。

プロジェクトの詳細や最新バージョンのダウンロードは、ashuoAI/AI-CanvasProリポジトリで確認できます。

関連プロジェクト