Jak z pomocą AI oglądam dowolne wideo w kilka sekund

2026-10-02 • Brad Bonanno • AI zagraniczne •tutorial •waga 4/5 •14 min czytania

Darmowy dodatek Watch pozwala Claude'owi i ChatGPT analizować wideo przez Gemini — ze znacznikami czasu, bez pobierania plików i bez opłat (8 h dziennie). Kompletny tutorial: instalacja i trzy zastosowania.

Robocza publikacja redakcyjna na podstawie publicznego transkryptu YouTube. Źródło: YouTube.

Oryginalny tytuł filmu

How I Watch ANY Video with AI in Seconds

O czym jest ten film

  1. Google udostępniło nowe API rozumienia wideo dla Gemini z bezpłatnym poziomem: do ośmiu godzin materiałów z YouTube dziennie, bez ryzyka automatycznych opłat.
  2. We własnym teście Google wersja „agentowa” rozumienia wideo, licząc na 50 pytań, daje więcej poprawnych odpowiedzi i zużywa o 87% mniej tokenów niż dotychczasowe podejścia.
  3. Watch to darmowa umiejętność agentowa, która daje Claude’owi i ChatGPT zdolność rozumienia nagrań — wystarczy podać link i zadać pytanie.
  4. Architektura rozwiązania: link i pytanie trafiają do Gemini, który łączy obraz, dźwięk i transkrypcję, sam wybiera fragmenty do bliższego przyjrzenia i zwraca analizę ze znacznikami czasu; niczego nie pobieramy, więc blokady nie grożą.
  5. Zastosowanie 1: odnajdywanie drobnych detali w wielogodzinnych nagraniach — test na 3,5-godzinnym wykładzie Karpathy’ego, w którym trzeba znaleźć narzędzie do tokenizacji pokazane przez kilka sekund.
  6. Zastosowanie 2: analiza spadków retencji — zestawienie danych analitycznych własnego filmu (100 tys. wyświetleń) z tym, co działo się na ekranie, i szukanie wzorców do poprawy scenariuszy.
  7. Zastosowanie 3: automatyczne notatki z filmów zapisywane do „LLM Wiki” — bazy powiązanych notatek, które AI czyta przy późniejszej pracy.
  8. Umiejętność obsługuje ponad 1300 serwisów, w tym TikToka i Instagrama, i działa też na cudzych materiałach.
  9. Instalacja zajmuje około 5 minut: wtyczka w aplikacjach Claude i ChatGPT, klucz API z Google AI Studio na darmowym poziomie (bez włączania rozliczeń), konfiguracja jednorazowa.
  10. Dla niechętnych Gemini pozostaje wariant lokalny: klatki i transkrypcja przygotowywane na własnym komputerze, z WhisperX do transkrypcji dźwięku i trzema trybami doboru klatek.

10 najważniejszych takeaways — z kontekstem zastosowania

Na czym polega: Dotychczas jedyną metodą „pokazania” wideo modelowi było generowanie setek zrzutów ekranu. Agentowe rozumienie wideo w Gemini analizuje nagranie samo — łączy obraz, dźwięk i transkrypcję, decyduje, gdzie przyjrzeć się dokładniej, i zwraca odpowiedzi ze znacznikami czasu. W teście Google daje lepsze wyniki przy 87% mniejszym zużyciu tokenów.

Jak stosować: Zamiast przygotowywać klatki, wręcz AI link do filmu i pytanie przez umiejętność Watch; wyniki trafiają prosto do rozmowy z Claude’em lub ChatGPT i można je od razu wykorzystać (np. przy pisaniu scenariusza).

Na co uważać: Każda analiza zużywa dzienny limit darmowego poziomu Google (do 8 godzin wideo z YouTube). Przy masowej pracy z długimi nagraniami limit można wyczerpać — czeka się wtedy na reset.

2.Drobny detal w godzinach nagrania? Opisz go z pamięci

Na czym polega: Autor odnalazł w 3,5-godzinnym wykładzie narzędzie pokazane przez kilka sekund, opisując je od ręki: „wpisuje tekst, wyświetla go jako kolorowe fragmenty z liczbami obok”. AI zwróciło nazwę, stronę internetową i znacznik czasu.

Jak stosować: Sformułuj prompt w stylu: „Obejrzyj to wideo, znajdź moment, w którym…, podaj nazwę i znacznik czasu”. Działa też na własnych nagraniach ekranu — znaleziony fragment można przekazać wprost do narzędzi montażowych.

Na co uważać: Trafność zależy od precyzji opisu. Zawsze otwórz wskazany znacznik czasu i zweryfikuj, czy AI trafiło we właściwą scenę.

3.Zestaw retencję z treścią, zamiast zgadywać

Na czym polega: Autor przekazał Claude’owi dane o retencji swojego filmu, a Watch przeanalizował nagranie wokół trzech największych spadków widowni — i pomógł wypatrywać wzorca w tym, co wtedy mówiono i pokazywano.

Jak stosować: Podaj modelowi liczby z analityki oraz link do filmu, poproś o wyznaczenie największych spadków i analizę ich otoczenia. Powtórzone na wielu filmach, wnioski wplata się w scenariusze kolejnych produkcji.

Na co uważać: AI nie pozna prawdziwego powodu, dla którego ktoś wyłączył film — wskazuje korelacje między spadkiem a treścią, nie pewniki. Traktuj wyniki jako hipotezy do przetestowania.

4.Analizuj też filmy innych twórców

Na czym polega: Umiejętność obsługuje ponad 1300 serwisów, w tym TikToka i Instagrama, i równie dobrze przetwarza cudze materiały jak własne — można sprawdzić, co napędza skuteczne filmy w Twojej niszy.

Jak stosować: Wybierz kilka udanych filmów konkurencji lub liderów niszy i każ AI rozłożyć je na czynniki: strukturę, haczyki, momenty utrzymujące uwagę.

Na co uważać: To, co działa u innych, nie przenosi się automatycznie na Twoją widownię — zweryfikuj wnioski na własnych materiałach.

5.Notatki z filmów pisz raz — do bazy, którą czyta AI

Na czym polega: Trzeci scenariusz użytkowy: Watch wyciąga z filmu wyjaśnienia i przykłady wizualne, a Claude zapisuje je do „LLM Wiki” — zbioru powiązanych notatek dostępnych dla modelu. Koniec z odszukiwaniem tego samego wyjaśniającego fragmentu tydzień później.

Jak stosować: Po każdym wartościowym filmie każ zapisać kluczowe fragmenty do bazy; przy następnej pracy nad podobnym tematem AI ma od razu potrzebny kontekst.

Na co uważać: Notatki powinny pozwalać wrócić do oryginału (warto zachować znaczkiki czasu i linki), bo sama skrócona treść bywa za uboga. Zamiast LLM Wiki model może budować zwykłe dokumenty w Twoim systemie notatek — wybierz jedno i trzymaj się tego.

6.Darmowy limit: 8 godzin YouTube dziennie i zero niespodzianek

Na czym polega: Analiza wideo odbywa się w ramach bezpłatnego poziomu Google — do 8 godzin materiałów z YouTube na dobę. Po wyczerpaniu limitu czeka się na odnowienie; opłaty nie uruchamiają się same, bo nie trzeba włączać rozliczeń.

Jak stosować: W Google AI Studio utwórz klucz API w projekcie na darmowym planie i korzystaj bez podpinania karty.

Na co uważać: Gemini analizuje wideo „za darmo”, ale Claude zużywa własny przydział na opracowanie wyników i dalszą pracę. Najbardziej limit zjada lokalny tryb „Token burner” — o tym niżej.

7.Instalacja jednorazowa, korzyść codzienna

Na czym polega: Cały setup to około 5 minut i jest darmowy. Po konfiguracji nie wraca się do ustawień — wystarczy podrzucić nagranie w ramach bieżącego zadania, a umiejętność zadziała sama.

Jak stosować: W aplikacji Claude na komputerze: menu personalizacji → wtyczki → dodaj repozytorium Watch jako marketplace → instaluj. W ChatGPT: menu wtyczek → dodaj marketplace → instaluj wtyczkę. Następnie nowa rozmowa, polecenie /watch, klucz API z Google AI Studio.

Na co uważać: Jeśli nie chcesz podawać klucza API w rozmowie, poproś agenta o otwarcie pliku środowiskowego i zapisz go tam ręcznie. Upewnij się, że projekt jest na darmowym planie.

8.Po aktualizacji sam przełącz silnik na Gemini

Na czym polega: Aktualizacja ze starszej wersji zachowuje dotychczasowe ustawienia — nowy silnik Gemini nie włączy się sam z siebie.

Jak stosować: Po aktualizacji z marketplace każ agentowi jawnie zmienić silnik na Gemini i dodać klucz. Przy instalacji samodzielnej (standalone) zaktualizuj z tego samego repozytorium i zacznij nową sesję.

Na co uważać: Pominięcie tego kroku oznacza, że umiejętność nadal będzie działać starym sposobem — przez klatki — i mocniej obciążać limit Claude’a.

9.Wariant lokalny: zacznij od „Balanced” i WhisperX

Na czym polega: Bez Gemini umiejętność przygotowuje klatki i transkrypcję do przeczytania przez model, a WhisperX — gdy brak napisów — przepisuje dźwięk na tekst lokalnie, za darmo. Tryby doboru klatek: „Efficient” (mniejsza próbka, szybkie rozeznanie), „Balanced” (klatki wokół zmian scen), „Token burner” (bez limitu klatek, ale bardzo kosztowny).

Jak stosować: Ruszaj od „Balanced” i wybierz WhisperX do lokalnej transkrypcji; pozwól modelowi dokończyć jednorazową instalację.

Na co uważać: „Token burner” szybko wyczerpie przydział Claude’a — sięgaj po niego tylko wtedy, gdy naprawdę potrzebujesz pełnego pokrycia.

10.Silnik dopasuj do zadania, nie na stałe

Na czym polega: Gemini sprawdza się do pytań o filmy i szukania momentów — bierze na siebie całe oglądanie, a Claude dostaje gotowe ustalenia. Silnik lokalny jest lepszy, gdy model musi sam oglądać obraz: np. przy odtwarzaniu animacji, kiedy pobiera konkretną klatkę i porównuje ją z własnym renderem.

Jak stosować: Przełączaj między silnikami zależnie od zadania; wybór nigdy nie jest ostateczny.

Na co uważać: Bezpośredni wgląd w klatki (tryb lokalny) kosztuje znacznie więcej tokenów Claude’a. Z Gemini pracujesz natomiast na czyimś opisie nagrania, nie na samym obrazie — przy pracach wizualnych ta różnica ma znaczenie.

Redakcyjne tłumaczenie

AI nauczyło się oglądać wideo — i to za darmo

Sztuczna inteligencja potrafi już obejrzeć wideo za Ciebie — bezpłatnie i bez zjadania Twojego limitu tokenów. Do tej pory jedyna droga prowadziła przez wysyłanie modelowi setek zrzutów ekranu. Google udostępniło właśnie mechanizm, dzięki któremu AI rozumie nagrania naprawdę dobrze, i korzysta się z niego bez płacenia. Rzućcie okiem na test samego Google: w teście na 50 pytań z zakresu rozumienia wideo wersja agentowa daje więcej poprawnych odpowiedzi, zużywając o 87% mniej tokenów. Zintegrowałem to od razu z umiejętnością Watch, dzięki czemu użyjesz jej z dowolnym narzędziem AI. Pokażę, jak to działa, i przedstawię trzy najlepsze zastosowania.

Watch: co to jest i jak działa

Nawet najlepsze modele — autor wymienia tu projekty w rodzaju Astry czy Fable — nie potrafią rozumieć wideo od razu, bez dodatkowych zabiegów. Watch to darmowa umiejętność agentowa, którą instalujesz obok swojego AI, a to zyskuje zdolność analizowania nagrań. (Informacja dodatkowa: „umiejętności”, ang. skills, to w ekosystemie Claude pakiety instrukcji i narzędzi podłączane do modelu, by rozszerzyć jego możliwości.) Po konfiguracji wystarczy przekazać link i powiedzieć, czego chcesz się dowiedzieć.

Autor robi szybki test: podaje swojemu Claude’owi film Alexa z kanału Mozie, „Jak wygrywać z AI w 2026”, i prosi o analizę haczyka (hook) otwierającego oraz o wyjaśnienie, dlaczego ten materiał działa.

Za kulisami umiejętność wysyła link i pytanie do Gemini. Model przegląda nagranie, odnajduje potrzebne fragmenty i odsyła analizę wraz ze znacznikami czasu. Właśnie o to chodzi w „agentowym” rozumieniu wideo: Gemini sam decyduje, którym miejscom przyjrzeć się bliżej. Na pytania odpowiada, łącząc obraz, dźwięk i transkrypcję. Link z YouTube trafia bezpośrednio do oficjalnego API Google — niczego nie pobierasz, więc blokada Ci nie grozi. Twoje AI zamiast setek zrzutów dostaje gotowe ustalenia, a cała analiza wideo odbywa się za darmo na bezpłatnym poziomie Google.

Dokładnie tak samo sprawa ma się w ChatGPT — konfigurację obu narzędzi pokażę na końcu. A gdy odpowiedź wróci do rozmowy z Claude’em, można go od razu poprosić, żeby przeniósł świeżo zdobyte informacje do pracy — choćby do pisania scenariusza kolejnego filmu.

Zastosowanie 1: drobny detal ukryty w godzinach nagrania

Pierwszy sposób: zleć AI znalezienie drobnego szczegółu zatopionego w godzinach materiału. Test przeprowadzamy na dogłębnym wykładzie Andreja Karpathy’ego o dużych modelach językowych takich jak ChatGPT. (Informacja dodatkowa: Andrej Karpathy, współzałożyciel OpenAI i były szef AI w Tesli, publikuje cenione wykłady o modelach językowych.) Nagranie trwa trzy i pół godziny, a gdzieś w środku pojawia się narzędzie dzielące tekst na tokeny. Załóżmy, że pamiętasz je z widzenia, ale nazwa Ci umknęła. Wystarczy opisać to, co pamiętasz, i poprosić Watch o odnalezienie:

„Obejrzyj to wideo. Znajdź moment, w którym Karpathy wpisuje tekst do narzędzie pokazującego go w postaci kolorowych fragmentów z liczbami obok. Podaj nazwę narzędzia, jego stronę internetową i znacznik czasu.”

Autor otwiera wskazaną chwilę, żeby sprawdzić, czy rzeczywiście o tę scenę chodziło — i tak, dokładnie ten fragment. Można pytać o coś, co mignęło na ekranie przez kilka sekund, a AI to wyłuska. Metoda działa też na własnych nagraniach: jeśli masz folder nagrań ekranu i gdzieś tam otwierasz konkretne menu, Claude z pomocą Watch znajdzie ten moment, a wycinek przekażesz od razu do narzędzi montażowych.

Zastosowanie 2: co działo się na ekranie, gdy widzowie odpadali

Drugi sposób: AI ustala, co działo się w Twoim filmie w momentach, w których widzowie przestawali oglądać — a potem pomaga to poprawić. Za przykład służy materiał autora „Z książki do umiejętności” (Book to Skill), w którym wręczył Claude’owi pięć najlepszych książek biznesowych wszech czasów i zamienił je w umiejętności. Film ma około 100 tys. wyświetleń i — co kluczowe — autor jako jego właściciel widzi prawdziwe dane o retencji. Widać na nich, w których punktach ludzie odpadają, więc można przyjrzeć się, co właśnie wtedy mówiono i pokazywano.

Claude dostaje liczby, a Watch analizuje nagranie wokół spadków: „Obejrzyj to wideo i na podstawie danych o retencji wyznacz trzy największe spadki widowni. Powiedz, co je wywołało.”

Claude nie odpowie, dlaczego konkretna osoba wyłączyła film, ale potrafi zestawić spadek z faktyczną treścią i pomóc wypatrywać wzorca. Gdy powtórzy się to na wielu filmach z katalogu, wnioski da się wpleść w scenariusze kolejnych produkcji. Sprawa nie ogranicza się do YouTube: umiejętność obsługuje ponad 1300 serwisów, między innymi TikToka i Instagrama. Nie trzeba też kierować jej wyłącznie na własne treści — można analizować filmy innych twórców i sprawdzać, co sprawiło, że zadziałały.

Na koniec tego wątku krótka zapowiedź własna: jeśli chcesz zbudować oparty na AI system operacyjny całego biznesu, tym zajmie się najbliższa edycja Founder OS Bootcamp. Autor przekaże swój dokładny setup i wszystkie playbooki AI oraz nauczy dopasować je do własnej firmy. Zapis na listę oczekujących — pod filmem.

Zastosowanie 3: notatki, do których AI wróci za tydzień

Trzeci sposób: niech AI robi notatki z filmów, które oglądasz, i od razu zapisuje je w LLM Wiki. Scenariusz na pewno znany: oglądasz coś wartościowego, jesteś przekonany, że zapamiętasz, a po tygodniu musisz od nowa odszukiwać całe wyjaśnienie. Lepiej kazać AI trzymać użyteczne fragmenty w miejscu, do którego zajrzy przy następnej pracy nad podobnym tematem.

Autor bierze ponownie wykład Karpathy’ego z pierwszego demo i prosi Watch o wyłuskanie wyjaśnień oraz przykładów wizualnych, a Claude zapisuje je w LLM Wiki — to po prostu zbiór powiązanych notatek, które Twoje AI potrafi czytać. Równie dobrze można kazać modelowi budować z nich zwykłe dokumenty w Twoim systemie notatek.

Instalacja w pięć minut

Skoro wiesz już, co daje Watch, czas na instalację. Sama umiejętność jest darmowa, a pracujący pod spodem Gemini ma bezpłatny poziom API, więc całość powinna kosztować zero. Darmowy plan Google obejmuje do ośmiu godzin wideo z YouTube dziennie. Po wyczerpaniu limitu czeka się po prostu na odnowienie — opłaty nie uruchamiają się automatycznie. Claude zużywa wprawdzie własny przydział na opracowanie odpowiedzi i włączenie jej do działania, ale całe oglądanie wideo spada na Gemini w ramach limitu Google, więc w praktyce wychodzi bezpłatnie. Najlepsze jest to, że konfigurację wykonuje się tylko raz — w środowisku, w którym chcesz korzystać z Watch. Później wystarczy podrzucić nagranie przy okazji tego, nad czym akurat pracujesz, i wszystko pójdzie samo.

Szczegółowe instrukcje dla ChatGPT i Claude’a autor przygotował pod linkiem — tam znajdziesz pełny przewodnik krok po kroku. W skrócie: w aplikacji Claude na komputerze otwórz menu personalizacji, wejdź we wtyczki, dodaj repozytorium Watch jako marketplace i zainstaluj Watch. W ChatGPT na komputerze otwórz również menu wtyczek, dodaj marketplace i kliknij instalację wtyczki — gotowe. Następnie uruchom nową rozmowę, wpisz /watch i przejdź przez proces konfiguracji.

Żeby silnik Gemini działał, potrzebny jest klucz API — pozwala on Twojemu AI połączyć się z modelem. Wejdź do Google AI Studio, otwórz sekcję kluczy API, kliknij „utwórz klucz” i wybierz projekt. Upewnij się, że projekt jest na darmowym poziomie — nie trzeba włączać rozliczeń. Przekaż klucz agentowi, a ten zapisze go dla Ciebie. Jeśli nie chcesz podawać go w rozmowie, poproś o otwarcie pliku środowiskowego i zapisz go tam ręcznie. Na koniec podaj link do filmu i poproś, żeby AI obejrzało go z użyciem Watch.

Aktualizacja ze starszej wersji

Masz już wcześniejszą wersję umiejętności? Wejdź w marketplace wtyczek i kliknij aktualizację, a potem każ agentowi wybrać silnik Gemini — albo nową, lokalną opcję transkrypcji, o której zaraz mowa. Jeśli umiejętność instalowała się samodzielnie (standalone), poproś o aktualizację z tego samego repozytorium i zacznij nową sesję. Jedna pułapka: aktualizacja zachowuje dotychczasowe ustawienia. Kiedy chcesz przejść na Gemini, każ agentowi jawnie zmienić silnik i dodać klucz.

Wariant lokalny: klatki, transkrypcja i WhisperX

A jeśli nie chcesz korzystać z Gemini wcale, pierwotny mechanizm wciąż działa. Wybierz tryb lokalny, a umiejętność przygotuje klatki i transkrypcję, które Twoje AI przeczyta. Nowa wersja dodaje WhisperX: gdy napisy nie są dostępne, przepisuje on dźwięk na tekst — całkowicie za darmo, na Twoim komputerze.

W trybie lokalnym ustawienia decydują, ile klatek widzi Claude i ile tokenów pochłania. „Efficient” przygotowuje mniejszą próbkę klatek do szybkiego rozeznania. „Balanced” dobiera klatki wokół zmian scen — na przykład nowego slajdu czy pokazu na ekranie. „Token burner” zdejmuje limit klatek całkowicie: daje większe pokrycie, ale znacznie mocniej obciąża przydział Claude’a. Autor radzi zacząć od „Balanced”, a idąc w lokalną stronę — wybrać WhisperX do transkrypcji. Pozwól modelowi dokończyć jednorazową instalację i możesz działać.

Gemini czy lokalnie? Dobierz silnik do zadania

Do większości rzeczy autor używa Gemini: pyta o film z YouTube albo każe odnaleźć konkretny moment. Gemini zajmuje się całym oglądaniem, więc filmu nigdy nie pobieramy — przekazujemy tylko adres. Claude dostaje gotowe ustalenia i nie musi czytać klatek.

Są jednak prace, w których lepszy okazuje się pierwotny, lokalny silnik. Przykład: odtwarzanie animacji graficznej. Wtedy chcesz, żeby Claude widział klatki bezpośrednio, w trakcie pracy — mógł obejrzeć układ, pobrać inną klatkę z dokładnego momentu i porównać tę referencję z własnym renderem. Z Gemini model bazuje na cudzym opisie nagrania; lokalnie sam ogląda obraz. Kosztuje to więcej z przydziału Claude’a, ale bezpośredni wzrok na materiał bywa niezastąpiony, gdy dopracowujesz animację albo potrzebujesz właśnie takiego poziomu detalu. Dobra wiadomość: silnik wybierasz wtedy, kiedy chcesz, i możesz go zmieniać w dowolnej chwili — żadnej decyzji raz na zawsze.

Na koniec

Przewodnik konfiguracji Watch jest darmowy pod linkiem — tam znajdziesz i bezpośrednie pobranie, i zapisy na najbliższą edycję Founder OS Bootcamp. Jeśli ten materiał był użyteczny, kliknij subskrypcję. Dzięki za obejrzenie.