Cały teledysk AI z jednego obrazu — lokalnie, na MiniMax H3

2026-09-28 • Manolo Remiddi • AI zagraniczne •tutorial •waga 3/5 •12 min czytania

Muzyk pokazuje krok po kroku, jak w jeden dzień zrobić teledysk AI z jednego obrazu: MiniMax H3 lokalnie na GPU, agent i MCP, montaż w DaVinci. Praktyczny punkt startu dla twórców wideo i muzyków.

Robocza publikacja redakcyjna na podstawie publicznego transkryptu YouTube. Źródło: YouTube.

Oryginalny tytuł filmu

I Made a Whole AI Music Video From 1 Image — Locally on MiniMax H3

O czym jest ten film

  1. MiniMax H3 to — według panującej opinii — najlepszy obecnie model do generowania wideo lokalnie, czyli na własnym komputerze i własnej karcie graficznej.
  2. Manolo Remiddi, muzyk, postanowił sprawdzić to w praktyce: skomponował około półtoraminutowy kawałek eksperymentalnego techno i w jeden dzień zbudował do niego teledysk.
  3. Cały materiał wideo powstał z jednego obrazu wygenerowanego rok wcześniej w Midjourney.
  4. Autor świadomie wybrał estetykę lo-fi i oczywistą „sztuczność” obrazu — widz od pierwszej sekundy ma wiedzieć, że patrzy na generację AI.
  5. ComfyUI, skomplikowane środowisko do generowania obrazów i wideo, obsługiwał za pomocą własnego agenta połączonego przez protokół MCP — bez dogłębnego poznawania narzędzia.
  6. Montaż odbył się w darmowym DaVinci Resolve (Linux, Mac, PC), a muzykę autor nagrał na żywo, na sprzęcie analogowym, bez poprawek.
  7. Model „zepsuł” plan: zamiast jednej postaci wygenerował dwie — autor przepisał fabułę tak, żeby dopasować ją do materiału, i tym przyspieszył pracę.
  8. Sekret montażu teledysku: cięcia wypadające dokładnie w rytm muzyki oraz częsta zmiana ujęć.
  9. Realizm byłby niewdzięcznym celem — wideo AI nigdy nie wygląda w pełni wiarygodnie i tylko rozprasza widza; lepiej z sztuczności zrobić atut.
  10. Na końcu autor zaprasza do społeczności Resonant DAO na Discordzie: cotygodniowe spotkania o AI w wideo (Creative AI Video Lab) i o muzyce (Creative Labs).

10 najważniejszych takeaways — z kontekstem zastosowania

1.Jeden dobry obraz może wystarczyć na cały teledysk

Na czym polega: Autor wygenerował wszystkie ujęcia na podstawie jednego obrazu z Midjourney sprzed roku. Obraz pełnił rolę wizualnej „biblii” produkcji — wspólnej referencji dla stylu, kolorystyki i klimatu.

Jak stosować: Zanim zaczniesz tworzyć ujęcia, wybierz albo wygeneruj jeden obraz definiujący świat materiału i wracaj do niego przy każdym kolejnym ujęciu.

Na co uważać: Rozdzielczość i jakość obrazu wejściowego przenoszą się na wynik. Jeśli zależy ci na ostrym, wysokiej jakości materiale, nie zaczynaj od małego, zmniejszonego obrazka.

2.Nie udawaj realizmu — pokaż, że to AI

Na czym polega: Autor celowo sięgnął po obraz, który jednoznacznie wygląda na wygenerowany, żeby widz nie marnował uwagi na pytanie „czy to prawda?”. Materiał dążący do fotograficznej realności i tak nigdy nie wygląda jak rzeczywistość i rozprasza.

Jak stosować: Zamiast walczyć o iluzję, zbuduj estetykę, w której sztuczność jest zaletą: lo-fi, artefakty, oniryczny klimat, mocna kolorystyka.

Na co uważać: To rada na materiały eksperymentalne i muzyczne, nie uniwersalna reguła — w reklamie czy filmie fabularnym widz ma zupełnie inne oczekiwania.

3.Skomplikowane narzędzie może za ciebie obsłużyć agent

Na czym polega: ComfyUI jest potężne, ale skomplikowane — autor sam przyznaje, że nie zna go w pełni. Połączył je przez MCP ze swoim agentem i teraz wydaje polecenia zwykłym językiem, a agent obsługuje interfejs.

Jak stosować: Jeśli narzędzie cię przerasta, nie rezygnuj z niego — sprawdź, czy ma integrację z agentami (np. przez MCP) i przenieś na AI samą obsługę, sobie zostawiając reżyserię.

Na co uważać: Agent zwalnia z nauki interfejsu, ale nie z myślenia. To ty musisz wiedzieć, jakie ujęcia są potrzebne i w jakiej kolejności — oraz weryfikować, co dostajesz.

4.Potraktuj „błędy” modelu jako surowiec

Na czym polega: Autor chciał jednej postaci, a dostał dwie. Zamiast walczyć z materiałem, przepisał fabułę: dwie podobne sylwetki, jaśniejsza i ciemniejsza, pościg, próba ucieczki. Zaskoczenie okazało się szczęśliwym trafem.

Jak stosować: Zbieraj nietrafione generacje i przeglądaj je osobno — często znajdziesz w nich kadr albo motyw, który nada się jako oś narracji.

Na co uważać: Metoda działa przy luźnej narracji (teledysk, klip eksperymentalny). Przy sztywnym scenariuszu, jak w reklamie, dopasowywanie wszystkiego w locie się nie obroni.

5.Fabułę buduj na materiale, nie na odwrót

Na czym polega: Historia w teledysku jest prosta i celowo zagmatwana — autor przyznaje, że nie chodziło o precyzyjną opowieść, tylko o punkt zaczepienia, który nada sens ujęciom już po ich wygenerowaniu.

Jak stosować: Przy eksperymentalnych formach najpierw wygeneruj zbiór ujęć, dopiero potem szukaj w nich historii. To szybsze niż wymuszanie na modelu gotowej fabuły ujęcie po ujęciu.

Na co uważać: Całkowity brak klamry też nie działa — widz potrzebuje chociaż sugestii narracji, żeby wytrwać do końca.

6.Cięcia w rytm muzyki to fundament montażu

Na czym polega: Sekret według autora: zmiany ujęć wypadają dokładnie na mocnych momentach utworu. Nie w każdym takcie — ale we właściwych chwilach. To daje montażowi muzyczność.

Jak stosować: Przesłuchaj utwór i zaznacz na osi czasu punkty zmian, zanim zaczniesz ciąć; potem dowiązuj ujęcia do tych znaczników.

Na co uważać: Cięcie co ułamek sekundy nuży i robi się z tego „przeinżynierowanie” — zmiana ma wynikać z muzyki, nie z potrzeby ciągłego ruchu.

7.Nie trzymaj widza na jednym kadrze

Na czym polega: Ujęcia w materiale zmieniają się często: bieg, zbliżenie, kolejny plan, jeszcze inny — dzięki temu krótki klip trzyma uwagę od początku do końca.

Jak stosować: Już na etapie generowania zaplanuj kilka wariantów każdego motywu (różne plany, kąty, światło), żeby przy montażu mieć z czego wybierać.

Na co uważać: Zmiana dla samej zmiany rozprasza. Ujęcia muszą do siebie pasować stylistycznie — i tu znów ratuje cię wspólny obraz-referencja z pierwszego punktu.

8.Kontrast „żywe versus generowane” wzmacnia materiał

Na czym polega: Muzyka nagrana na żywo, na sprzęcie analogowym, bez poprawek, zestawiona z lo-fi obrazem z AI — napięcie między organicznym a sztucznym tworzy estetykę całego projektu.

Jak stosować: Jeśli jesteś muzykiem, masz przewagę: naturalne brzmienie i wygenerowany obraz mogą się wzajemnie podkreślać zamiast konkurować o realizm.

Na co uważać: To propozycja autorska, nie przepis na wszystko — sprawdź, czy taki kontrast pasuje do twojej muzyki i odbiorców.

9.Praca z AI to nie „prompt i gotowe”

Na czym polega: Sensowny materiał wymaga pracy ręcznej: doboru ujęć, decyzji o kolejności, montażu. Bez tego wychodzi „slop” — bezkształtna masa wygenerowanych obrazów.

Jak stosować: Powierz AI rolę działu produkcji (tworzenie ujęć), a sobie zostaw role reżysera i montażysty — to od ciebie zależy, czy materiał będzie miał sens.

Na co uważać: Eksperyment na półtorej minuty da się skleić w dzień. Dłuższy, lepiej zbudowany teledysk wymaga znacznie więcej ujęć — liczonych w dniach pracy.

10.Zaczynaj od krótkiej formy i sprawdź oba warianty uruchomienia

Na czym polega: Autor przetestował cały łańcuch — obraz, generowanie, montaż, publikacja — na jednym dniu i półtoraminutowym utworze. MiniMax H3 można uruchamiać lokalnie, ale istnieje też wersja chmurowa.

Jak stosować: Wypróbuj najpierw miniaturę projektu: 60–90 sekund wystarczy, żeby oszacować czas, jakość i własny komfort pracy. Przy własnym GPU zacznij od wersji lokalnej, by nie płacić za każdą próbę.

Na co uważać: Sam autor przyznaje, że nie wycisnął z modelu wszystkiego — nie wyciągaj wniosków o granicach narzędzia na podstawie jednego projektu.

Redakcyjne tłumaczenie

Lokalnie, na własnym komputerze

Wszyscy ostatnio mówią o MiniMax H3, bo to podobno najlepszy model do tworzenia wideo lokalnie — czyli tak, żeby liczył na to twój własny komputer i twoja karta graficzna. Jako muzyk pomyślałem: „Ciekawe. Może pora na teledysk?”. I zrobiłem go.

To, co zaraz pokażę, jest eksperymentem. Skomponowałem kawałek — około półtorej minuty eksperymentalnego techno — bo chciałem sprawdzić, czy w ogóle da się zrobić teledysk z pomocą AI. I chciałem wam go pokazać. Nie zamierzałem nagrywać dziesięciu minut; półtorej minuty to rozmiar, który da się udostępnić. Na początek kilka sekund tego, jak gram — żebyście zobaczyli narzędzie, na którym pracuję. A potem obejrzymy całość.

Wszystko zaczęło się od jednego obrazu

[muzyka]

Mnie osobiście bardzo się to podoba. A oto jak to zrobiłem. Wziąłem obraz, który wygenerowałem rok temu w Midjourney — dokładnie ten — i na jego podstawie stworzyłem każde pozostałe ujęcie.

Od razu poszedłem na łatwiznę. Po prostu pomyślałem: wezmę obraz, który mi się podoba, i to taki, który od razu widać, że jest z AI. Nie chcę iluzji, nie chcę, żeby ktoś zastanawiał się: „prawda czy nieprawda?”. Chcę, żeby widz wiedział: to generacja, to nie dzieje się naprawdę. Ten film w całości powstał w sztucznej inteligencji — i moim zdaniem właśnie w tym tkwi klucz.

Potem potrzebowałem środowiska trochę dziwnego, mrocznego. Ten obraz idealnie się sprawdził. Stworzyłem go 52 tygodnie temu, więc ma dokładnie rok.

Agent sterujący ComfyUI

Jak wyglądał mój proces? Użyłem własnego agenta — Augmenter Agent — i połączyłem go przez MCP z ComfyUI.

(Informacja dodatkowa: MCP to protokół, który pozwala agentom AI sterować zewnętrznymi programami; tutaj agent „obsługuje” ComfyUI zamiast człowieka.)

ComfyUI to coś w rodzaju warsztatu dla modeli generujących wideo i obrazy — potężne, ale dość zakręcone narzędzie. Sam nie znam go w pełni. I właśnie dlatego chciałem, żeby sterował nim mój agent. Przez MCP mam nad ComfyUI pełną kontrolę, a cała obsługa staje się dużo prostsza: piszę agentowi, jakie obrazy i ujęcia są mi potrzebne, a on ogarnia resztę.

Dopiśmy jeszcze jedno: mój film od początku powstawał w założeniu niskiej rozdzielczości, w estetyce lo-fi. Ale MiniMax potrafi liczyć naprawdę wysokiej jakości materiał — spójrzcie na to. Zasada jest prosta: dajesz bardzo dobry obraz, dostajesz bardzo dobry wynik. W moim wypadku obraz wejściowy nie był w wysokiej rozdzielczości — i było mi z tym dobrze. Lubię tę lo-fi estetykę, zwłaszcza gdy pochodzi z AI. Nie przeszkadzają mi artefakty, które przy tym wyskakują.

Montaż w DaVinci Resolve

Pokażę teraz chwilę z sesji montażowej. Montowałem w DaVinci Resolve — programie, który można zainstalować za darmo. To profesjonalne narzędzie do montażu, dostępne na Maca, Linuksa i pecety; ja siedzę na Linuksie.

Najpierw wstawiłem muzykę: nagrałem swoje wykonanie, a potem zacząłem importować kolejne ujęcia i układać je we własnej kolejności.

Mała historia o dwóch uciekinierach

Jest w tym wszystkim miniatura fabularna. Ktoś mieszka w tym dziwnym świecie i biegnie. Nie wiadomo, przed czym — dopóki nie łapiemy się, że ucieka przed drugą postacią. Teraz biegną już dwie: ta i ta. Trochę to zagmatwane — i nie szkodzi. Nie chodzi o precyzyjną opowieść; to jest całkiem nieistotne. Chodzi o to, że dałem sobie jakąś historię za punkt zaczepienia.

Wyglądają podobnie, tylko jedna jest jaśniejsza, druga ciemniejsza. A na końcu jedna próbuje się wymknąć w ten sposób, a druga próbuje ją dopaść. I to cała fabuła. Mnie natomiast bardzo podoba się warstwa wizualna. Uwielbiam ten szafirowy statek kosmiczny — albo coś, co wygląda jak on — i ten dotyk trawy tutaj.

Brak pełnej kontroli bywa prezentem

Robiąc ten film, przekonałem się, że tworzenie wideo z AI jest możliwe — trzeba tylko obejść kilka przeszkód. Po pierwsze: trzeba zaakceptować, że nie panuje się nad wszystkim. AI zrozumie twoją intencję i coś stworzy, ale nigdy dokładnie to, co chciałeś. Zawsze wyskoczy coś zaskakującego. To zaskoczenie można jednak nazwać szczęśliwym trafem: coś, czego się nie spodziewałeś, a po chwili myślisz — „o, ale z tego skorzystam”.

Przykład? Chciałem jednej postaci. Wyszły dwie. Więc z dwóch postaci zrobiłem historię — dopasowałem fabułę do materiału, który faktycznie udało mi się wygenerować. Dzięki temu wszystko poszło znacznie szybciej.

Kalendarz prac: od generowania do gotowego klipu

Te ujęcia zajęły mi kilka godzin. Wpisywałem AI serię poleceń i pozwalałem mu działać — więc te kilka godzin to nie ja siedzący przy komputerze, tylko komputer pracujący za mnie.

Wczoraj nagrałem utwór kilka razy, bo chciałem zrozumieć jego strukturę i skrócić go, upychając w nim mnóstwo zmian — czego w normalnej piosence się nie robi. Te półtorej minuty to materiał, który dla porządku powinien zostać rozciągnięty do co najmniej pięciu minut, żeby powstał porządny kawałek techno z budowaniem napięcia i całą resztą. Ja jednak chciałem czegoś mocno urozmaiconego w krótkim czasie — żebym mógł poeksperymentować i mieć coś ładnego, co wam puszczę.

Potem wgrałem utwór do DaVinci i zacząłem budować. Od razu wiedziałem, że otwierającą fazę wykorzystam na początku, bo tworzy niepokojący klimat, a przy tym ma bardzo mocne zarysowanie i światło. I wtedy przyszedł mi do głowy pomysł zbudowania historii.

Sekret tkwi w rytmie

W teledysku muzycznym najważniejsze jest jedno: cięcia wypadają w rytm muzyki. To jest sekret. Zmiany następują we właściwych momentach — nie ciągle, nie przesadzajcie z tym — ale właśnie dzięki temu montaż nabiera muzyczności.

Druga sprawa: nie zatrzymujcie się zbyt długo na jednym obrazie. Kadry muszą się nieustannie zmieniać: bieg, potem zbliżenie, potem kolejne ujęcie i jeszcze jedno. Zawsze coś się dzieje — i to trzyma widza przy ekranie. Tniesz w rytm, budujesz jakąś historię — i gotowe.

Dlaczego świadoma sztuczność wygrywa z realizmem

Gdybym celował w coś, co wygląda na prawdziwe, efekt nie byłby tak dobry. Zajęłoby to znacznie więcej czasu, nigdy nie wyglądałoby tak realnie jak rzeczywistość, a widz i tak by się zastanawiał: „czy to na pewno prawda?”. Sam obraz by go rozpraszał. Świadome pokazanie, że to generacja AI, rozwiązuje problem.

Prawdziwa muzyka tworzy natomiast kontrast. Analogowy sprzęt, fakt, że gram na żywo i bez poprawek — to daje coś organicznego, na tle którego pracują te lo-fi obrazy z AI. Taka jest moja estetyka. Nie twierdzę, że każdy musi tak budować. Chciałem wam po prostu pokazać, że przy dzisiejszej technologii — jeśli poświęcicie czas na naukę i trochę eksperymentów — teledysk jest do zrobienia.

To nie jest „prompt i gotowe”

Muszę was jednak ostrzec: to nie działa tak, że wpisujesz polecenie, AI wypluwa „slop” i koniec.

(Informacja dodatkowa: „slop” — potoczne określenie masowo generowanych, bezrefleksyjnych treści AI, które niczego nie wnoszą.)

Tak to nie działa. Jeśli chcesz, żeby materiał miał sens, musisz włożyć w to ręce. A to oznacza czas — dużo czasu. Udało mi się wszystko zrobić w jeden dzień, bo utwór trwał półtorej minuty. To był eksperyment, a technika, której użyłem, pozwoliła ogarnąć wszystko za jednym zamachem: szybki montaż i sprawa zamknięta. Jeśli chcesz zrobić coś porządnie — dłuższy materiał, lepszą strukturę, większą złożoność — potrzebujesz znacznie więcej ujęć. To już dni pracy.

Dobra wiadomość jest taka, że jeśli jesteś muzykiem albo twórcą wideo, masz teraz taką możliwość. Model można uruchomić lokalnie, ale jest też jego wersja chmurowa. Jestem pewien, że nie wykorzystałem nawet wszystkich możliwości MiniMax H3 — do odkrycia zostało mnóstwo.

Społeczność i cotygodniowe spotkania

W każdy poniedziałek w mojej społeczności na Discordzie odbywa się godzinna rozmowa o wideo generowanym przez AI. Spotyka się tam kilku twórców: dyskutujemy, budujemy, wymieniamy się doświadczeniami. Więcej informacji znajdziecie na resonantdao.com — wejdźcie w zakładkę z wydarzeniami i zobaczycie listę rozmów. Ta nosi nazwę Creative AI Video Lab. Godziny podane są w mojej strefie czasowej, ale po otwarciu strony zobaczycie czas właściwy dla siebie. Po spotkaniu robimy piętnastominutową rozmowę dla nowych członków, a potem Resonant DAO — o społeczności i projektach.

Mamy sporo różnych wydarzeń, w tym Resonant Academy, AI Stack Call i Creative Labs. Na najbliższych Creative Labs, które odbywają się w każdą środę, będziemy rozmawiać o muzyce. Pokażę więcej o syntezatorze modularnym i o tym, jak z niego korzystam. To spotkanie dla twórców — oczywiście możecie sięgać po AI we własnej twórczości, ale drzwi są otwarte dla każdego artysty, niezależnie od dziedziny. Jeśli chcecie dołączyć, zacznijcie właśnie tutaj, wejdźcie na Discorda i do zobaczenia.

Dzięki, że dotrwaliście do końca. Zostawcie łapkę w górę, zasubskrybujcie kanał i obejrzyjcie kolejny film. Ciao!