Comment créer un cinéma IA multimodal sur un canevas infini unique
Si vous avez déjà essayé de créer quelque chose de plus complexe qu'une simple génération d'image — comme un clip animé court ou un storyboard pour un clip musical — vous connaissez cet enfer. Le premier onglet du navigateur a ChatGPT ouvert pour le script. Le deuxième exécute Midjourney ou Stable Diffusion. Le troisième a ElevenLabs pour le voiceover. Le quatrième a Runway ou Luma ouvert pour l'animation image par image. Et quelque part en arrière-plan, un ComfyUI local avec un graphe de trois cents nœuds ronronne sans cesse.
En résultat, votre bureau se transforme en décharge de fichiers PNG avec des noms étranges comme final_v2_really_final.png, et le transfert de contexte entre les réseaux neuronaux prend plus de temps que le travail créatif proprement dit.
Un développeur chinois sous le pseudonyme ashuoAI a tenté de résoudre ce problème avec le projet SHUO Canvas (anciennement connu sous le nom de AI-CanvasPro). C'est une application de bureau qui combine la génération de texte, graphiques, audio et vidéo sur un tableau interactif unique.

Comment fonctionne le canevas
Au cœur de SHUO Canvas se trouve l'idée d'un espace de travail infini, similaire à Figma, Miro ou ComfyUI, mais adapté pour la production complète de contenu multimédia. Au lieu de basculer entre les services, vous disposez les éléments directement sur le tableau et les connectez avec des lignes logiques.
Chaque élément sur le tableau est un nœud. Un nœud peut être une invite de texte, une image téléchargée, un clip vidéo généré, une piste audio ou un bloc de contrôle complet. Vous connectez les sorties de certains nœuds aux entrées d'autres, construisant ainsi une chaîne : script -> génération d'images -> animation -> voiceover et montage.
L'application peut sauvegarder automatiquement l'état du canevas au redémarrage, et pour transférer un projet vers un autre PC, elle génère une archive unique .aicpkg contenant toutes les ressources utilisées.

Ce qu'il y a d'intéressant à l'intérieur
Les développeurs ne se sont pas limités à une grille basique de générateurs d'images. À l'intérieur de l'application, on trouve plusieurs nœuds spécialisés qu'on trouve rarement dans de tels outils tout-en-un.
Storyboarding et réalisation 3D
Pour ceux qui créent des histoires vidéo, un nœud de script de réalisateur a été ajouté. Il aide à décomposer le texte en scènes individuelles, à décrire les mouvements de caméra, les dialogues et les effets sonores.
Travaillant de concert avec celui-ci, un nœud de réalisation 3D. Ici, vous pouvez placer schématiquement des personnages dans l'espace, définir l'angle de la caméra virtuelle et positionner les objets. Le schéma 3D obtenu est transmis plus loin dans la chaîne comme image de référence (ControlNet/IP-Adapter) pour générer l'image finale. Cela aide à maintenir la perspective et la composition d'une image à l'autre.

Outils de traitement sur le canevas
Directement sur le canevas, vous pouvez recadrer des vidéos, couper des pistes audio, supprimer des arrière-plans, retirer des objets unwanted des images ou assembler des collages. Pour travailler avec les pipelines de génération vidéo, des nœuds pour décomposer la vidéo en images individuelles et une synchronisation labiale précise ont été ajoutés.
Si vous avez besoin de créer une grille de variantes ou un panorama, des nœuds séparés sont utilisés :
- Grid décompose le storyboard en blocs pour la génération par lots.
- 360 Panorama transforme une image plate en environnement sphérique interactif.

Assistant IA intégré
Pour éviter de passer du temps à créer manuellement des dizaines de nœuds, un agent est intégré au système. Via le symbole @ dans le champ de texte, vous référencez n'importe quel objet sur le canevas (image, texte ou vidéo). Le symbole / appelle des modèles d'invites rapides.
De plus, l'assistant de dialogue dans le coin de l'écran peut exécuter des commandes directement sur le tableau : créer des nœuds, les connecter et lancer une génération par lots depuis une requête textuelle.
Intégrations et connexion des réseaux neuronaux
SHUO Canvas n'inclut pas ses propres modèles génératifs prêts à l'emploi. C'est un client graphique qui envoie des requêtes à des fournisseurs externes ou des serveurs locaux.

Les options de connexion suivantes sont prises en charge :
- ComfyUI local ou cloud. Vous pouvez importer directement sur le tableau SHUO Canvas des workflows JSON ComfyUI prêts à l'emploi.
- La plateforme RunningHub pour exécuter des pipelines ComfyUI dans le cloud.
- Les API directes des services cloud chinois (Jimeng, Volcengine, APImart, GRSAI).
- Tous les fournisseurs avec une API compatible OpenAI pour les modèles de texte.
Ce schéma offre de la liberté : si vous le souhaitez, vous pouvez tout exécuter localement sur votre propre puissance GPU via ComfyUI, ou connecter des API tierces et ne pas fatiguer votre matériel.
Plusieurs nuances importantes
Avant de télécharger la distribution, vous devriez considérer quelques caractéristiques du projet.
Premièrement, le projet n'est pas open source au sens traditionnel (Non-Open-Source / NC). Le dépôt GitHub sert de plateforme pour les publications de versions, la documentation et un gestionnaire de tâches. L'application elle-même est distribuée sous forme de builds prêts à l'emploi pour Windows et macOS (les puces Apple Silicon sont prises en charge).
Deuxièmement, la monétisation est basée sur l'activation du logiciel. Le développeur facture des frais pour la licence du programme elle-même, et vous payez les générations directement aux services dont vous saisissez les clés API dans les paramètres.
Troisièmement, l'interface et les vidéos tutoriels sont principalement destinés aux publics sinophone et anglophone, bien que le contrôle de base via les raccourcis clavier ne pose pas de difficultés. Des raccourcis familiers sont utilisés pour la navigation sur le canevas : Space + ЛКМ pour déplacer, Alt + перетаскивание pour dupliquer un nœud avec ses connexions, Ctrl+Z pour annuler des actions.
À qui cela devrait-il plaire
SHUO Canvas intéressera ceux qui sont fatigués du chaos lors de la création de contenu génératif complexe. Si votre flux de travail implique une combinaison de ComfyUI, d'éditeurs vidéo et de générateurs de voix, le concept de canevas unique fera gagner beaucoup de temps.
Le projet évolue rapidement : la version 0.7.1 a apporté des algorithmes de contrôle de personnage mis à jour et une personnalisation flexible des raccourcis clavier. Vous pouvez télécharger les builds pour Windows et macOS dans la section releases sur GitHub.
Projets similaires