Jak przekształcić ComfyUI w pełnoprawny edytor wideo dla LTX Video
Generowanie wideo za pomocą modeli dyfuzyjnych w ComfyUI zazwyczaj przypomina składanie skomplikowanego zestawu Lego z setkami przewodów. Jeśli musisz połączyć kilka klatek, dodać dźwięk, zsynchronizować dialog postaci lub po prostu przyciąć nieudane ujęcie, wykres natychmiast rozrasta się do nieczytelnych rozmiarów. Kończysz ciągłym przeskakiwaniem między Premiere Pro a przeglądarką, eksportując pośrednie wyniki tam i z powrotem.
Niedawno natknąłem się na repozytorium WhatDreamsCost-ComfyUI. Autor zmęczył się ciągłym żonglowaniem dziesiątkami rozłączonych węzłów i zbudował pełny panel edycyjny w jednym węźle dla generatora LTX Video. Projekt zdobył już prawie 20 000 gwiazdek i zawiera kilka naprawdę sprytnych rozwiązań interfejsu, które oszczędzają mnóstwo czasu.
Dlaczego warto przenieść oś czasu do węzłów
Centrum tego zestawu jest węzeł LTX Director. Zamiast majstrować przy czasach w polach tekstowych lub obliczać klatki na kalkulatorze, otrzymujesz znajomą oś czasu z ścieżkami.
Możesz tutaj przeciągać i upuszczać pliki wideo, ustawiać kluczowe klatki (pierwszą, pośrednie, końcową), ciąć ścieżki i łączyć prompty tekstowe. Ma wbudowany mechanizm Prompt Relay, który płynnie przenosi kontrolę z jednego opisu tekstowego na drugi w miarę postępu osi czasu.
Innym częstym problemem przy generowaniu mówiących głów jest obliczanie długości sceny, aby dopasować ją do lektora. Autor stworzył osobny węzeł Speech Length Calculator. Analizuje cytowany dialog w czasie rzeczywistym i wyprowadza zalecany czas trwania klipu w sekundach na podstawie tempa mowy. Zapobiega to sytuacjom, gdy generowanie przerywa się w połowie słowa lub wideo przez kilka dodatkowych sekund utrzymuje się w ciszy.
Co potrafi zestaw węzłów
Poza podstawową edycją, wersja druga wprowadza kilka praktycznych dodatków do potoku:
- Wsparcie IC-LoRA. Możesz upuścić wideo referencyjne lub obraz na osobną ścieżkę (LTX Ingredients jest obsługiwane), aby przenieść ruch lub styl bez ręcznej pracy z łańcuchem preprocessingu.
- Wbudowana obsługa audio. Możesz zaimportować własny plik audio, przyciąć go bezpośrednio w interfejsie i zastosować audio inpainting, miksując oryginalną ścieżkę z wygenerowanymi dźwiękami.
- Tryb Retake (nadal w wersji beta). Zaznaczasz segment na osi czasu i regenerujesz tylko nieudany fragment bezpośrednio w projekcie.
- Optymalizacja pamięci i cache. Spatchowane modele są cache'owane między uruchomieniami, więc ComfyUI nie ładuje za każdym razem wag do VRAM przy drobnych zmianach promptu. Dodatkowo autor dodał proper SageAttention i wsparcie dla Tritona.
- Utrwalanie stanu. Oś czasu wraz ze wszystkimi ustawieniami, zaimportowanymi plikami mediów i punktami cięcia może być wyeksportowana do standardowego pliku JSON.
|
Proste sterowanie
|
Nowy tryb przycinania!
|
Paczka zawiera ulepszone węzły ładowania wideo i audio (Load Video UI / Load Audio UI). W przeciwieństwie do standardowych komponentów ComfyUI, obsługują one przeciąganie i upuszczanie, mogą przycinać do różnych proporcji obrazu i nie psują się na plikach powyżej 100 MB.
Do wsadowej pracy z klatkami jest węzeł Multi Image Loader. Łączy preprocessing, dostosowanie rozdzielczości i wbudowaną mini galerię.
Instalacja i uwagi
Pakiet można zainstalować przez standardowego ComfyUI Managera (wyszukaj WhatDreamsCost-ComfyUI) lub ręcznie przez terminal:
cd ComfyUI/custom_nodes/
git clone https://github.com/WhatDreamsCost/WhatDreamsCost-ComfyUI.git
Przed uruchomieniem upewnij się, że zaktualizowałeś zależności ComfyUI-LTXVideo i ComfyUI-KJNodes do najnowszych wersji, w przeciwnym razie węzły osi czasu wyrzucą błąd podczas inicjalizacji grafu. Autor zamieścił gotowe do użycia przykładowe workflow bezpośrednio w folderze example_workflows w repozytorium.
Na minus: autor uczciwie ostrzega w README, że tryb Retake jest nadal niedopracowany i niestabilny. Dodatkowo przetwarzanie bardzo długich wideo nadal natrafia na ścianę z powodu ograniczeń silnika ComfyUI jeśli chodzi o RAM systemowy, więc nie będziesz w stanie złożyć godzinnych filmów w jednym węźle.
Dla kogo to jest
Jeśli eksperymentujesz z modelem LTX Video 2.3 i masz dość chaosu połączeń między dziesiątkami malutkich węzłów, ten projekt zdecydowanie warto dodać do swojej kolekcji. Zastępuje niewygodne łańcuchy narzędzi pomocniczych czystą wizualną osią czasu i zauważalnie przyspiesza iteracje podczas generowania złożonych scen.
Powiązane projekty