O czym jest ten film
- Jack Roberts pokazuje zbudowany przez siebie system „JARVIS”, oparty na GPT-6 Astra i obsługiwany także głosem.
- Podstawą systemu jest pamięć zbierająca informacje z rozmów, plików, notatek i innych podłączonych źródeł.
- Profil osobisty i profil firmy mają dostarczać asystentowi kontekstu potrzebnego do udzielania trafniejszych odpowiedzi.
- Roberts pokazuje, jak system korzysta z istniejących połączeń z narzędziami takimi jak Codex, Claude i Hermes.
- Cele, kalendarz i dane z innych usług służą do przygotowywania codziennych podsumowań oraz ustalania priorytetów.
- Asystent może wykonywać działania: w demonstracji uruchamia sesję Codexa i dodaje wydarzenie do kalendarza.
- Integracja z API Higgsfield pozwala generować obrazy i filmy z poziomu tego samego interfejsu.
- Biblioteka zdjęć wyszukuje obrazy według ich zawartości, nawet gdy odpowiednie słowo nie występuje w nazwie pliku.
- System obejmuje również podgląd stron internetowych, narzędzia do pracy nad treścią oraz widoki poczty i komunikatorów.
- Autor proponuje użycie Zapiera jako sposobu na połączenie kolejnych aplikacji i udostępnia własny pakiet startowy.
10 najważniejszych takeaways — z kontekstem zastosowania
1.Zacznij od zadania, które system ma wykonać
Na czym polega: Roberts ocenia swojego asystenta przez pryzmat konkretnych działań: wyszukania informacji, zaplanowania spotkania czy uruchomienia pracy w Codexie.
Jak stosować: Wybierz kilka powtarzalnych czynności i sprawdź, jakie informacje oraz połączenia są potrzebne, by asystent mógł je wykonać.
Na co uważać: Efektowny interfejs sam w sobie nie świadczy o użyteczności. W demonstracji widać wybrane przykłady, a nie niezawodność całego systemu w codziennej pracy.
2.Opisz siebie i firmę, zanim zaczniesz automatyzować pracę
Na czym polega: Profil osobisty i firmowy mają wyjaśniać asystentowi, czym zajmuje się użytkownik, kim są jego klienci i jakie sprawy są dla niego ważne.
Jak stosować: Przygotuj zwięzły opis swojej roli, bieżących projektów, odbiorców i sposobu pracy. Możesz poprosić model, by przeprowadził z tobą rozmowę i pomógł uzupełnić luki.
Na co uważać: Taki profil szybko się starzeje. Jeśli zmienią się cele lub oferta firmy, popraw go, zanim zaczniesz polegać na przygotowywanych przez system wskazówkach.
3.Zbieraj pamięć z narzędzi, których już używasz
Na czym polega: System Robertsa sięga do rozmów z asystentami, notatek, poczty, zdjęć i innych źródeł, aby odpowiadać na pytania dotyczące wcześniejszej pracy.
Jak stosować: Podłącz najpierw źródła, w których rzeczywiście znajdują się potrzebne informacje. Przetestuj pamięć prostym pytaniem o zapisane spotkanie lub dodaną notatkę.
Na co uważać: Samo podłączenie źródła nie gwarantuje poprawnej odpowiedzi. Sprawdzaj, czy asystent odnalazł właściwy zapis i dobrze go zrozumiał.
4.Dodawaj ważne informacje ręcznie, gdy pojawiają się w pracy
Na czym polega: Roberts pokazuje możliwość zapisania krótkiej informacji w pamięci, a potem odzyskania jej w nowej rozmowie.
Jak stosować: Po spotkaniu albo lekturze przydatnego materiału zapisz ustalenie, link lub obserwację, do której chcesz wrócić.
Na co uważać: Zapisuj informacje precyzyjnie. Błędna lub niejasna notatka może później stać się podstawą kolejnych odpowiedzi.
5.Powiąż codzienne podsumowania z celami
Na czym polega: Asystent ma znać plany na tydzień, miesiąc i kwartał, a następnie pomagać ustalać, czym zająć się danego dnia.
Jak stosować: Wprowadź aktualne cele i regularnie porównuj proponowane priorytety z kalendarzem oraz rzeczywistym stanem projektów.
Na co uważać: Podsumowanie będzie przydatne tylko wtedy, gdy cele i dane źródłowe pozostaną aktualne. Traktuj je jako pomoc w podjęciu decyzji.
6.Testuj działania głosowe na prostych poleceniach
Na czym polega: W filmie Roberts głosowo przechodzi do sekcji pamięci, uruchamia sesję Codexa i dodaje wydarzenie do kalendarza.
Jak stosować: Zacznij od łatwych do sprawdzenia zadań, takich jak utworzenie własnego bloku czasu w kalendarzu.
Na co uważać: Sprawdź wynik po wykonaniu polecenia. W demonstracji nazwa wydarzenia wypowiedziana przez asystenta różni się nieco od nazwy podanej przez autora.
7.Korzystaj z dotychczasowych połączeń między narzędziami
Na czym polega: Roberts przedstawia rozwiązanie, które wykorzystuje połączenia dostępne już w używanych przez niego narzędziach, między innymi w Codexie i Claude.
Jak stosować: Zanim dodasz nowe integracje, sprawdź, do jakich usług mają już dostęp twoje narzędzia i czy da się użyć ich w jednym przepływie pracy.
Na co uważać: Zakres dostępnych działań zależy od faktycznie skonfigurowanych połączeń. Po demonstracji autora nie należy zakładać, że każda usługa zadziała od razu w innej konfiguracji.
8.Zestawiaj generowanie obrazów z kontrolą kosztów
Na czym polega: Autor podłącza API Higgsfield, wybiera model, proporcje obrazu i liczbę wyników, a interfejs pokazuje koszt generowania.
Jak stosować: Przygotuj małą próbę, porównaj modele i sprawdź cenę przed uruchomieniem większej serii obrazów lub filmów.
Na co uważać: Koszt zależy od wybranego modelu i ustawień. Roberts wspomina o korzystnych cenach na początku korzystania z usługi, ale nie podaje warunków pozwalających potraktować tę informację jako stałą ofertę.
9.Wyszukuj zdjęcia po zawartości, nie tylko po nazwie pliku
Na czym polega: System opisuje obrazy słowami kluczowymi. Dzięki temu Roberts znajduje zdjęcie burgera, choć nazwa pliku nie zawiera tego słowa.
Jak stosować: Jeśli pracujesz z dużą biblioteką zdjęć, zindeksuj ją i sprawdź wyszukiwanie na plikach o nieoczywistych nazwach.
Na co uważać: Opisy tworzone przez AI mogą być niedokładne. Przed wykorzystaniem znalezionego zdjęcia obejrzyj je i upewnij się, że rzeczywiście pasuje do zadania.
10.Rozszerzaj system dopiero wtedy, gdy znasz potrzebny przepływ pracy
Na czym polega: Roberts pokazuje wiele możliwych połączeń — od poczty i komunikatorów po Zapiera, finanse i podgląd stron.
Jak stosować: Dodawaj kolejne usługi pod konkretne zadania, na przykład przygotowanie podsumowania spotkań albo obsługę materiałów do publikacji.
Na co uważać: Każde nowe źródło zwiększa liczbę danych, na których system musi polegać. Po podłączeniu aplikacji sprawdź, co asystent potrafi z niej odczytać i jakie działania może wykonać.
Redakcyjne tłumaczenie
JARVIS, który potrafi działać
Właśnie uruchomiłem mojego JARVIS-a z GPT-6 Astra. Rezultaty zrobiły na mnie ogromne wrażenie.
— Dobry wieczór. Jestem gotowy do pomocy — mówi asystent.
— Cześć, JARVIS. Przejdź proszę do sekcji pamięci.
— Jesteśmy w sekcji pamięci.
— Utwórz nową sesję Codexa i poproś go o pomysły na ulepszenie całego systemu JARVIS.
— Sesja Codexa została uruchomiona i pracuje nad ulepszeniami.
Ten system nie tylko dobrze wygląda. Łączy się z narzędziami, których używam, i może wykonywać za mnie konkretne czynności. Przygotowałem też pakiet startowy dla osób, które chcą zbudować własne środowisko tego rodzaju. Link znajduje się w opisie filmu. Pokażę, co potrafi moja wersja i jak można zacząć pracę nad podobnym rozwiązaniem.
Moim zdaniem taki asystent potrzebuje czterech rzeczy. Najpierw musi mieć dostęp do informacji o użytkowniku i jego pracy: rozmów w ChatGPT, Claude czy Codexie, wiadomości, spotkań, zdjęć i innych materiałów. Potem powinien uporządkować te dane tak, aby dało się z nich korzystać. Musi także umieć na ich podstawie wyciągać wnioski. Wreszcie powinien wykonywać działania, których oczekujemy od asystenta, zamiast poprzestawać na rozmowie.
Pamięć i profil użytkownika
Zacznijmy od głównej pamięci mojego systemu. Trafiają tu między innymi informacje z ChatGPT i Claude. Całość zbudowałem z pomocą Astry, a w tle dodawane są kolejne zapisy. Interfejs można przełączyć między jasnym a ciemnym wyglądem, zależnie od upodobań.
Przy tworzeniu własnego systemu nadajemy mu nazwę i opisujemy, kim jesteśmy oraz czym zajmuje się nasza firma. Kontekst jest tutaj najważniejszy. Dlatego przygotowałem osobny profil dotyczący życia i pracy użytkownika oraz profil firmy. Można w nich zapisać bieżące sprawy, klientów i to, jak działa przedsiębiorstwo. Astra może przeprowadzić z nami rozmowę, by pomóc zebrać te informacje. Dzięki temu asystent ma z czego korzystać, kiedy odpowiada na pytania lub proponuje działania.
Nie chciałem jednak ręcznie przenosić do niego wszystkiego, co przez lata powstało w innych aplikacjach. Pomysł polega na tym, by wykorzystać istniejące połączenia. System rozpoznał narzędzia, których używam: Codex, Claude, Hermes i Open Claude. Mogę też dodać następne.
Wśród źródeł pamięci mogę wybrać Granolę, Notion, Obsidian i zdjęcia. Dalej są Gmail, Outlook, Slack, Skool, YouTube oraz profile w mediach społecznościowych. Da się też dołączyć informacje finansowe. Chodzi o to, by dane potrzebne do pracy były dostępne z jednego miejsca.
Cele, codzienne podsumowania i rozmowa z pamięcią
Po podłączeniu źródeł można określić cele. Dla mnie cały ten system miałby niewielką wartość, gdyby nie pomagał osiągać wyników w życiu i firmie. W sekcji postępów zapisuję więc cele i sposoby ich realizacji.
Na tej podstawie asystent przygotowuje codzienne podsumowanie. Wie, co planuję na dany tydzień, jakie mam zadania na miesiąc i do czego dążę w ciągu kwartału. Może podpowiedzieć, na czym warto się skupić danego dnia.
Pamięć ma się przy tym zmieniać wraz z moją pracą. Gdy prowadzę rozmowę w Claude lub Codexie albo dostaję wiadomość, odpowiednie informacje mogą być dostępne w moim systemie działającym lokalnie na komputerze. Mogę potem zapytać na przykład, kto uczestniczył w ostatnim spotkaniu albo jaki był jego temat. Pokazuję to w oknie rozmowy: asystent odnajduje informację o moim najnowszym spotkaniu i przedstawia odpowiedź.
Mogę również sam dodawać zapisy do pamięci. Wpisuję przykładowo, że ulubionym kolorem Jacka Robertsa jest zielony, a ulubioną rasą psa — angielski springer spaniel. W praktyce równie dobrze mogłaby to być uwaga ze spotkania albo artykuł, do którego chcę wrócić. Wystarczy zapisać tę informację.
Otwieram teraz nową rozmowę i pytam o ulubiony kolor oraz psa Jacka. Wybieram model, z którym chcę rozmawiać. W tym interfejsie mam między innymi GPT-6 Astra, narzędzia Claude i Hermes, OpenRouter oraz model lokalny. Asystent przeszukuje dostępne źródła i odpowiada: zielony oraz angielski springer spaniel.
W podobny sposób mogę dodawać filmy z YouTube, przesyłać pliki i zdjęcia, a później wracać do ich zawartości w rozmowie. Dlatego przestałem nazywać ten projekt systemem opartym na Claude Code. To szersze środowisko, które łączy informacje z różnych części mojej pracy.
Jeden pulpit do śledzenia pracy
Na głównym pulpicie widzę podłączone usługi i najważniejsze wskaźniki. Liczby, które pokazuję w tej demonstracji, są przykładowe. Pojawia się tu także codzienne podsumowanie oparte na moich celach. Mogę dopytać asystenta o priorytety; ma on również dostęp do kalendarza.
Przygotowałem widok finansów firmy. Mogę sprawdzić przychody w kolejnych miesiącach, ich podział oraz inne dane finansowe zebrane w systemie. Osobno śledzę postępy względem celów i rozwój mojej społeczności.
Pokażę prosty przykład działania. Jestem w kalendarzu i chcę zarezerwować czas na jutro. Uruchamiam sterowanie głosem.
— Dobry wieczór. Jestem gotowy do pomocy.
— Dodaj proszę jutro wydarzenie dla mnie. Nazwij je „Jack Brunch Lock-in” i ustaw od 11.00 do 12.00 według czasu w Budapeszcie.
— Dodałem wydarzenie na jutro, od 11.00 do 12.00 czasu budapeszteńskiego, pod nazwą „Jack Brunch Lock”.
Wydarzenie pojawia się w kalendarzu. Zwróćcie uwagę, że asystent podał nieco inną nazwę, niż wypowiedziałem. Sam przykład pokazuje jednak, o co mi chodzi: mogę wydać polecenie w tym interfejsie, a system wykona czynność w podłączonej usłudze. Korzysta przy tym z połączeń, które mam już w swoich narzędziach.
Generowanie obrazów i filmów przez API
Kolejna część dotyczy projektowania. Dodałem połączenie z API Higgsfield, aby z poziomu własnego systemu generować obrazy i filmy. Zamiast pracować wyłącznie w osobnej aplikacji, mogę korzystać z jej modeli we własnym interfejsie.
W ustawieniach wybieram Higgsfield i dodaję klucz API pobrany z serwisu. Następnie mogę przygotować obraz. Wpisuję polecenie: angielski springer spaniel pije koktajl proteinowy na siłowni. Wybieram model, proporcje 16:9 oraz cztery obrazy. Interfejs pokazuje cenę za każdy wynik, zanim uruchomię generowanie. Podobny proces można zastosować do wideo.
Ceny zależą od wybranego modelu. Wspominam też o korzystnych stawkach w pierwszym tygodniu korzystania z usługi, choć nie omawiam szczegółowych warunków tej oferty. Dla mnie ważne jest to, że koszt widzę podczas przygotowywania zadania.
Biblioteka zdjęć, którą można przeszukiwać po treści
W moim systemie jest również biblioteka obrazów z komputera. Zdjęcia nie zawsze mają opisowe nazwy, więc zwykłe wyszukiwanie po nazwie pliku często nie wystarcza. Tutaj AI analizuje obrazy i zapisuje słowa opisujące ich zawartość.
Wpisuję „burger” i znajduję pasujące zdjęcie, chociaż nazwa pliku nie zawiera tego wyrazu. Mogę użyć obrazu jako punktu odniesienia przy tworzeniu kolejnego — na przykład poprosić o burger dwa razy większy. Przy generowaniu da się wybrać ustawienia, w tym rozdzielczość, oraz sprawdzić cenę. Otrzymuję też wyniki wcześniejszego polecenia z psem na siłowni. Jeden z obrazów nie przedstawia rasy szczególnie trafnie, ale na innym pies wygląda już bardziej jak springer spaniel.
Z biblioteki mogę przejść do dalszego tworzenia obrazów lub filmów. Mam też podgląd wydatków na używane usługi. Osobne studio służy do budowania narzędzi, przygotowywania karuzel i pracy nad materiałami wideo.
Poczta, wiadomości i praca nad stroną
W tym samym środowisku mogę przejść do skrzynki odbiorczej, wiadomości w Skool, Slacka, Gmaila i Outlooka. Nie będę pokazywać prywatnych wiadomości innych osób, ale chciałem zaznaczyć, że te obszary również można tu obsługiwać.
Dodałem także narzędzia do pracy nad stronami internetowymi. Mogę wpisać adres lokalnie uruchomionej strony i otworzyć jej podgląd w systemie. Oglądam projekt na ekranie komputera, tabletu i telefonu. Pokazywana strona powstała w toku mojej pracy z Astrą: wydawałem jej kolejne polecenia dotyczące tego, co ma zbudować lub zmienić.
Mogę przyjrzeć się tekstom, grafikom i wyglądowi poszczególnych części strony, a następnie wprowadzać poprawki. Do pracy nad tekstem dodałem też narzędzie, które nazywam Slop Monster. W tym miejscu mogę również przygotowywać lub zmieniać grafiki. Połączenie z API do generowania obrazów przydaje się więc nie tylko przy pojedynczych ilustracjach, lecz także podczas tworzenia strony.
Zapier i kolejne połączenia
W sekcji pamięci widać, jak wiele źródeł jest już podłączonych. Jeśli używane aplikacje są rozproszone, kolejną możliwością jest Zapier. Sam z niego korzystam; za jego pomocą zbudowałem nawet swój pierwszy startup technologiczny.
Zapier może pośredniczyć między moim systemem a następnymi usługami, na przykład YouTube czy narzędziami Microsoftu. Wybieram potrzebne połączenia i umiejętności, a potem udostępniam je asystentowi. Mogę też wydawać polecenia Claude i Codexowi bezpośrednio z mojego środowiska.
W opisie filmu umieszczę przewodnik konfiguracji oraz link do przygotowanego przeze mnie pakietu. Można go pobrać, przejść przez początkowe ustawienia i dalej rozwijać własną wersję. Zamierzam aktualizować ten projekt. Pokazałem już pamięć, działania w podłączonych aplikacjach, obrazy, stronę internetową i codzienne podsumowania; można do niego dołączyć także wiadomości o AI. To, co zbudujecie dalej, zależy od waszych potrzeb.