>_ DevTrendspl

Język

Strona główna

Języki

Sekcje

Frontend Backend Mobilne DevOps AI / ML GameDev Blockchain Systemy wbudowane Bezpieczeństwo
JavaScript

Jak przekształcić ComfyUI w pełnoprawne studio edycyjne dzięki potokowi LTX 2.3

Każdy, kto próbował złożyć spójny klip wideo lub muzyczny w ComfyUI, zna ten ból. Wykres szybko zamienia się w niekończący się „spaghetti" połączeń. Musisz generować fragmenty jeden po drugim, przeciągać je do edytora wideo, synchronizować z beatem, a potem wracać, gdy zorientujesz się, że twarz postaci zmieniła się w trzeciej sekundzie.

Deweloper o nazwie użytkownika VRGameDevGirl udostępnił pakiet węzłów comfyui-vrgamedevgirl. To próba przekształcenia interfejsu opartego na węzłach z prostego generatora krótkich GIF-ów w pełnoprawne studio edycyjne.

Co zawiera pakiet

Projekt łączy narzędzie do składania wideo, możliwości przetwarzania audio, moduły przywracania klatek oraz potoki treningowe LoRA.

Głównym elementem jest tutaj węzeł VRGDG Music Video Builder UI. Po dodaniu do obszaru roboczego otwiera on oddzielny interfejs roboczy bezpośrednio na ComfyUI. Możesz załadować plik audio lub gotowe napisy w formacie SRT, umieścić znaczniki scen i powiązać generowanie każdej klatki z osią czasu.

Narzędzia do pracy ze scenami i wideo

Zamiast ręcznie przełączać prompty dla każdego segmentu, Video Builder pozwala zarządzać projektem scenę po scenie.

  • Interaktywna oś czasu. Możesz zobaczyć strukturę ścieżki i oznaczyć zwrotki, refreny i sekcje instrumentalne.
  • Generowanie między klatkami. Narzędzie może powiązać pierwszą i ostatnią klatkę sąsiadujących scen. Utrzymuje to spójność wizualną, gdy postać przechodzi z jednego ujęcia do drugiego.
  • Automatyzacja promptów przez LLM. Builder łączy się z lokalną siecią neuronową przez LM Studio lub zewnętrzne API. Odczytuje tekst piosenki i sugeruje opcje opisów scen.

Naprawa twarzy i poprawa jakości

Modele wideo często tracą szczegóły, gdy postać jest daleko od kamery. Zestaw zawiera gotowe rozwiązania do przywracania.

Węzły zestawu Face Fix lokalizują twarz w materiale, wycinają odpowiedni fragment, przepuszczają go przez model dyfuzyjny, aby przywrócić szczegóły, i ostrożnie mieszają wynik z powrotem z oryginalnym klipem.

Do ostatecznych poprawek autor dodał Fast Film Grain, Color Match i algorytmy wyostrzania. Sprowadzają one disparate wygenerowane segmenty do ujednoliconej palety kolorów i dodają kinowy szum bez zauważalnej utraty prędkości renderowania.

Audio, klonowanie głosu i zbiory danych

Obok materiału wideo repozytorium zawiera narzędzia do przygotowania audio i treningu modeli.

Pakiet zawiera moduł VoxCPM2, który może sklonować głos z krótkiego nagrania i wygenerować mowę z tekstu. Jest to przydatne, gdy potrzebujesz narracji lektorskiej dla klipu. Węzły pomocnicze mogą ciąć audio na segmenty, usuwać ciszę i wyodrębniać transkrypcje.

Dla osób trenujących własne modele przydaje się interfejs VRGDG LoRA Dataset Creator UI. Upraszcza on etykietowanie par obrazów i przygotowywanie opisów tekstowych. Repozytorium zawiera gotowe workflow do treningu LoRA na LTX 2.3 i Z-Image przy użyciu Musubi-Tuner.

Instalacja i szczegóły licencji

Możesz zainstalować zestaw w standardowy sposób przez ComfyUI Manager, wyszukując vrgamedev, lub klonując repozytorium bezpośrednio:

cd ComfyUI/custom_nodes
git clone https://github.com/vrgamegirl19/comfyui-vrgamedevgirl.git

Po instalacji nie zapomnij załadować zależności z requirements.txt do środowiska ComfyUI i odświeżyć stronę w przeglądarce za pomocą Ctrl+F5.

Zwróć uwagę na licencję. Projekt jest rozpowszechniany na licencji AGPL-3.0. Oznacza to, że jeśli użyjesz kodu w usługach komercyjnych lub produktach SaaS, będziesz musiał udostępnić swoją aplikację na tej samej licencji.

Dla kogo jest ten zestaw

Pakiet z pewnością przyda się każdemu, kto tworzy klipy, krótkie filmy lub animowane historie i jest zmęczony przełączaniem się między tuzinem różnych programów.

Nie musisz od razu zagłębiać się w całą funkcjonalność Video Builder. Możesz wybrać poszczególne węzły: użyć Color Match do korekcji kolorów, naprawić twarz postaci na gotowym wideo lub wygenerować lektora przez VoxCPM2.

Powiązane projekty