>_ DevTrendsnl

Taal

Home

Talen

Secties

Frontend Backend Mobiel DevOps AI / ML GameDev Blockchain Embedded Beveiliging
Unknown

Hoe Multimodale AI-cinema te bouwen op één oneindig canvas

Als je ooit hebt geprobeerd iets complexers te maken dan het genereren van een enkele afbeelding — zoals een korte geanimeerde clip of een storyboard voor een muziekvideo — ken je deze hel. Het eerste browsertabblad heeft ChatGPT open voor het script. Het tweede draait Midjourney of Stable Diffusion. Het derde heeft ElevenLabs voor voice-over. Het vierde heeft Runway of Luma open voor frame-animatie. En ergens op de achtergrond bromt een lokale ComfyUI met een graaf van driehonderd nodes weg.

Als gevolg hiervan verandert je bureaublad in een dump van PNG-bestanden met vreemde namen zoals final_v2_really_final.png, en het overdragen van context tussen neurale netwerken kost meer tijd dan het eigenlijke creatieve werk.

Een Chinese ontwikkelaar onder de nickname ashuoAI probeerde dit probleem op te lossen met het SHUO Canvas-project (voorheen bekend als AI-CanvasPro). Het is een desktop-applicatie die tekst, graphics, audio en videogeneratie combineert op één interactief bord.

Script en storyboard in de werkomgeving

Hoe het Canvas werkt

In de kern van SHUO Canvas is het idee van een oneindige werkruimte, vergelijkbaar met Figma, Miro of ComfyUI, maar afgestemd op uitgebreide media-inhoudproductie. In plaats van te schakelen tussen diensten, leg je elementen direct op het bord en verbind je ze met logische lijnen.

Elk element op het bord is een node. Een node kan een tekstprompt zijn, een geüploade afbeelding, een gegenereerde videoclip, een audiotrack of een volledig controleblok. Je verbindt de uitvoeren van sommige nodes met de invoeren van andere, waardoor je een keten bouwt: script -> frame-generatie -> animatie -> voice-over en editing.

De applicatie kan automatisch de canvas-status opslaan bij herstart, en om een project over te dragen naar een andere PC genereert het een enkel archief .aicpkg met alle gebruikte bronnen.

Tekens vervangen in frames

Wat interessant is aan de binnenkant

De ontwikkelaars hebben zichzelf niet beperkt tot een basisraster van afbeeldingsgeneratoren. Binnen de applicatie zijn er verschillende gespecialiseerde nodes die je zelden vindt in dergelijke all-in-one tools.

Storyboarding en 3D-regie

Voor degenen die videoverhalen bouwen, is er een director's script-node toegevoegd. Het helpt bij het opsplitsen van tekst in individuele scenes, het beschrijven van camerabewegingen, dialogen en geluidseffecten.

Samen ermee werkt een 3D-regie-node. Hier kun je personages schematisch in de ruimte plaatsen, de virtuele camerahoek instellen en objecten positioneren. Het resulterende 3D-schema wordt verder in de keten doorgegeven als referentieafbeelding (ControlNet/IP-Adapter) voor het genereren van het uiteindelijke frame. Dit helpt om perspectief en compositie van frame tot frame te behouden.

3D-regie

Bewerkingshulpmiddelen op het canvas

Rechtstreeks op het canvas kun je video bijsnijden, audiotracks knippen, achtergronden verwijderen, ongewenste objecten uit afbeeldingen verwijderen of collages samenstellen. Voor het werken met videogeneratie-pipelines zijn nodes toegevoegd voor het opsplitsen van video in individuele frames en nauwkeurige lip-sync.

Als je een raster van varianten of een panorama moet maken, worden afzonderlijke nodes gebruikt:

  • Grid breekt het storyboard op in blokken voor batch-generatie.
  • 360 Panorama transformeert een platte afbeelding naar een interactieve bolvormige omgeving.

Bewerkingsnode op het canvas

Ingebouwde AI-assistent

Om tijd te besparen op het handmatig aanmaken van tientallen nodes, is er een agent ingebouwd in het systeem. Via het @ symbool in het tekstveld verwijs je naar elk object op het canvas (afbeelding, tekst of video). Het / symbool roept snelle prompt-sjablonen op.

Bovendien kan de dialoogassistent in de hoek van het scherm opdrachten uitvoeren op het bord zelf: nodes aanmaken, ze verbinden en batch-generatie starten vanuit een tekstquery.

Integraties en het verbinden van neurale netwerken

SHUO Canvas bevat standaard geen eigen generatieve modellen. Het is een grafische client die verzoeken verzendt naar externe providers of lokale servers.

ComfyUI- en RunningHub-workflows importeren

De volgende verbindingsopties worden ondersteund:

  • Lokale of cloud ComfyUI. Je kunt kant-en-klare ComfyUI JSON-workflows rechtstreeks importeren op het SHUO Canvas-bord.
  • Het RunningHub-platform voor het uitvoeren van ComfyUI-pipelines in de cloud.
  • Directe API's van Chinese clouddiensten (Jimeng, Volcengine, APImart, GRSAI).
  • Elke provider met OpenAI-compatibele API voor tekstmodellen.

Dit schema biedt vrijheid: als je wilt, kun je alles lokaal draaien op je eigen GPU-kracht via ComfyUI, of verbind externe API's en belast je hardware niet.

Verschillende belangrijke nuances

Voordat je de distributie downloadt, moet je rekening houden met een paar kenmerken van het project.

Ten eerste is het project niet open source in de traditionele zin (Non-Open-Source / NC). De GitHub-repository dient als platform voor release-publicaties, documentatie en een taaktracker. De applicatie zelf wordt gedistribueerd als kant-en-klare builds voor Windows en macOS (Apple Silicon-chips worden ondersteund).

Ten tweede is de monetisatie gebaseerd op software-activatie. De ontwikkelaar rekent een vergoeding voor de programm licentie zelf, en je betaalt voor generaties rechtstreeks aan de diensten waarvan je API-sleutels in de instellingen invoert.

Ten derde zijn de interface en tutorialvideo's primair gericht op Chinese- en Engelstalige doelgroepen, hoewel basisbediening via hotkeys geen problemen oplevert. Vertrouwde sneltoetsen worden gebruikt voor canvas-navigatie: Space + ЛКМ voor verplaatsen, Alt + перетаскивание voor het dupliceren van een node met verbindingen, Ctrl+Z voor ongedaan maken van acties.

Voor wie is het de moeite waard om te proberen

SHUO Canvas zal interessant zijn voor degenen die genoeg hebben van de chaos bij het maken van complexe generatieve inhoud. Als je workflow een combinatie omvat van ComfyUI, video-editors en spraakgeneratoren, zal het single-canvas-concept veel tijd besparen.

Het project ontwikkelt zich snel: versie 0.7.1 bracht bijgewerkte tekencontrole-algoritmen en flexibele hotkey-aanpassing. Je kunt builds voor Windows en macOS downloaden in de releases-sectie op GitHub.

Gerelateerde projecten