>_ DevTrendspt

Idioma

Início

Linguagens

Seções

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embarcados Segurança
Unknown

Tela infinita para redes neurais — como o AI CanvasPro transforma o trabalho com IA em criatividade visual

Imagine que você está trabalhando em um projeto complexo: precisa gerar um personagem, escrever um roteiro para ele, dar voz às falas e transformar tudo em um vídeo curto. Geralmente isso vira um pesadelo de abas do navegador: ChatGPT aqui, Midjourney ali, ElevenLabs em uma terceira janela, e edição em um quarto aplicativo. Um desenvolvedor chinês com o apelido ashuoAI decidiu que já era hora de criar algo melhor e construiu o AI CanvasPro.

Esta é uma aplicação desktop Electron que transforma o processo generativo em trabalho com nós em uma tela infinita. Se você já abriu o Blender (Geometry Nodes) ou o DaVinci Resolve (Fusion), entenderá a lógica imediatamente.

https://raw.githubusercontent.com/ashuoAI/AI-CanvasPro/master/images/favicon.svg

O que é isso afinal

AI CanvasPro é um editor visual onde nós são usados em vez de camadas ou chats. Você coloca um nó para texto, conecta a um nó de geração de imagem e envia o resultado para um nó de vídeo ou upscaler. O projeto não tenta substituir redes neurais por conta própria—funciona como uma "cola" para diferentes APIs e ferramentas locais.

O melhor é que o projeto suporta não apenas APIs na nuvem como OpenAI ou Gemini, mas também se integra profundamente com o ComfyUI. Isso significa que você pode puxar seus fluxos de trabalho locais direto para a tela e combiná-los com modelos na nuvem.

Como funciona na prática

O recurso principal aqui é a conectividade de dados. Em um chatbot comum, o contexto é limitado a uma única conversa. No AI CanvasPro você pode usar o símbolo @ diretamente no campo de entrada do prompt para referenciar a saída de qualquer outro nó na tela. Por exemplo, pegue uma descrição de personagem de um bloco de texto e passe para um gerador de imagem.

Principais tipos de nós

Você pode colocar dezenas de tipos diferentes de nós na tela. Aqui estão os que me pareceram mais úteis:

  • Fonte de material. Você pode simplesmente arrastar um arquivo do disco aqui—uma imagem, som ou vídeo.
  • Geradores. Blocos separados para texto (GPT-4, Gemini), imagens (via RunningHub ou APImart) e vídeo.
  • Nó de navegador. Permite puxar conteúdo diretamente da web e enviar direto para processamento.
  • Ferramentas de edição. Mini-editores integrados para corte de vídeo, remoção de fundo de fotos, e até trabalho com panoramas de 360 graus.

O trabalho com áudio é implementado de forma interessante. Há um "estúdio de áudio" separado onde você pode clonar uma voz ou separar vocais e música de fundo. Tudo isso acontece dentro de um projeto, sem exports e imports intermináveis.

Lado técnico e instalação

O app é construído em Electron, então é multiplataforma. Há builds para Windows e macOS (incluindo Apple Silicon).

Uma nota importante sobre "abertura": o autor postou o projeto no GitHub, mas não é Open Source no sentido clássico. A licença proíbe uso comercial sem permissão e revenda do app como SaaS. Não há restrições para uso pessoal e experimentos.

Para começar, você precisa:

  1. Baixar .exe ou .dmg da seção Releases.
  2. Ir para configurações (ícone de perfil no canto inferior esquerdo).
  3. Inserir suas chaves de API. Tanto provedores chineses específicos (RunningHub, Volcano Engine) quanto o formato padrão da API OpenAI são suportados.

Para quem é isso

Vejo dois casos de uso principais. O primeiro é criação de conteúdo para redes sociais ou YouTube. Quando você precisa rapidamente passar uma ideia pela cadeia "texto -> imagem -> narração -> vídeo," uma tela visual economiza muito tempo.

O segundo caso de uso é prototipagem de pipelines complexos. Se você é desenvolvedor e quer testar rapidamente como uma combinação de vários modelos vai funcionar, jogar nós em uma tela é muito mais rápido do que escrever um script Python.

AI CanvasPro é uma ferramenta sólida para quem está cansado de interfaces de chatbot. O projeto tem suas arestas—as partes da interface e documentação em chinês (apesar das funções principais serem intuitivamente compreensíveis) e a licença bastante restritiva. Mas o conceito de "sistema operacional de IA" em uma tela está muito bem implementado.

Se você usa ativamente o ComfyUI ou trabalha frequentemente com múltiplas redes neurais simultaneamente, definitivamente vale a pena experimentar. No mínimo, é uma ótima forma de organizar suas gerações.

Você pode conferir o projeto e baixar a versão mais recente no repositório ashuoAI/AI-CanvasPro.

Projetos relacionados