O czym jest ten film
- Autor sprawdza GPT-6 Astra w kilku zadaniach wykraczających poza rozmowę z modelem i pisanie kodu.
- Wyjaśnia trzy sposoby, w jakie agent może obsługiwać program: przez interfejs graficzny, API i połączenie oparte na MCP.
- Pokazuje, jak Astra przygotowała model 3D w Blenderze na podstawie wygenerowanego wcześniej obrazu.
- Omawia podział pracy między droższą Astrę a tańszych subagentów.
- Demonstruje pracę agentów w przeglądarce oraz tworzenie strony fikcyjnego hotelu dla psów na podstawie zebranych inspiracji.
- Pokazuje konfigurację scen, grafik i elementów transmisji w OBS-ie za pomocą WebSocketu oraz obsługi interfejsu.
- Opisuje przygotowanie krótkiego filmu promocyjnego: od scenopisu po poprawki napisów i dźwięku.
- Zwraca uwagę na koszty generowania obrazów i wideo oraz na szybkie zużywanie limitu Astry.
- Radzi, by przed kosztowną produkcją zatwierdzać kierunek prac na podstawie moodboardu lub scenopisu.
- Ocenia Astrę jako bardzo mocny, lecz nierówny model, którego nie nazwałby jeszcze AGI.
10 najważniejszych takeaways — z kontekstem zastosowania
1.Dobierz sposób obsługi programu do zadania
Na czym polega: Agent może klikać w interfejsie, wydawać polecenia przez API albo korzystać z narzędzi udostępnionych przez MCP. Autor używał tych sposobów zależnie od możliwości programu.
Jak stosować: Sprawdź najpierw, czy aplikacja udostępnia agentowi gotowe polecenia. Obsługę ekranu wykorzystaj wtedy, gdy potrzebnej czynności nie da się wykonać w ten sposób.
Na co uważać: Klikanie wymaga śledzenia obrazu i bywa mniej pewne. Autor zwraca też uwagę, że zużywa więcej tokenów.
2.Powierz prostsze etapy tańszemu subagentowi
Na czym polega: W przykładzie z Blenderem Astra zleciła wstępne rozpoznanie projektu modelowi GPT-5.6 Luna. Autor proponuje, by mocniejszy model planował pracę i oceniał wynik, a tańszy wykonywał rutynowe zadania.
Jak stosować: Zleć subagentowi przegląd plików, zebranie kontekstu lub przygotowanie pierwszej wersji. Astrze powierz decyzje, kontrolę jakości i trudniejsze poprawki.
Na co uważać: Oszczędność nie jest gwarancją takiego samego wyniku w każdym zadaniu. Sprawdzaj efekt pracy subagenta, zanim oprzesz na nim kolejne kroki.
3.Daj agentowi wzór i poleć mu porównać z nim wynik
Na czym polega: Przy pracy w Blenderze Astra dostała obraz koncepcyjny, a następnie miała budować scenę, renderować podgląd i poprawiać model na podstawie porównania.
Jak stosować: Dołącz przykład oczekiwanego efektu i poproś o kolejne wersje z oceną różnic. Przygotuj się na uwagi dotyczące szczegółów, których agent sam nie odgadnie.
Na co uważać: Model 3D autora nie był kopią obrazu. Jakość wyniku zależała także od opisu zadania, dostępnych narzędzi i wiedzy osoby oceniającej.
4.Ustal momenty, w których agent ma wrócić po decyzję
Na czym polega: Przy stronie hotelu dla psów autor podzielił pracę na zbieranie inspiracji, przygotowanie moodboardu i budowę strony. Przejście do ostatniego etapu wymagało jego zgody.
Jak stosować: W poleceniu wskaż konkretne wyniki do zatwierdzenia, na przykład paletę kolorów i układ strony. Pozwól agentowi samodzielnie wykonać czynności między tymi etapami.
Na co uważać: Zbyt częste pytania spowalniają pracę, ale rezygnacja z oceny kierunku może oznaczać kosztowne poprawki gotowego projektu.
5.Zbieraj inspiracje wraz z uzasadnieniem
Na czym polega: Astra miała obejrzeć kilka stron, zachować wybrane fragmenty i przy każdym zapisać, co warto z niego wykorzystać. Na tej podstawie powstał moodboard.
Jak stosować: Poproś o niewielki zestaw przykładów, zrzuty ekranu, paletę kolorów, propozycje krojów pisma i krótkie zasady projektu. Oceń ten materiał przed zleceniem strony.
Na co uważać: Sama kolekcja obrazów nie wyjaśnia decyzji projektowych. Trzeba też sprawdzić, czy gotowa strona rzeczywiście odpowiada zatwierdzonemu kierunkowi.
6.Wykorzystaj dostęp programu do poleceń, a interfejs do brakujących czynności
Na czym polega: W OBS-ie autor użył połączenia WebSocket do tworzenia i ustawiania scen. Gdy nie wystarczało, Astra wykonywała czynności w oknie programu.
Jak stosować: Przy konfiguracji powtarzalnych elementów, takich jak sceny i źródła obrazu, udostępnij agentowi polecenia programu. Potem obejrzyj wynik w aplikacji i popraw szczegóły wizualne.
Na co uważać: Samo wykonanie polecenia nie oznacza, że grafika jest dobrze umieszczona. Autor sprawdzał dopasowanie ramki do obrazu z kamery i właściwych scen.
7.Wygeneruj grafikę pod konkretny wymiar i miejsce użycia
Na czym polega: Przy ramce do transmisji Astra najpierw ustaliła wymiary obrazu z kamery, potem przygotowała grafikę z przezroczystym tłem i umieściła ją w scenach OBS-a.
Jak stosować: Przed generowaniem podaj docelowy rozmiar, kolorystykę i informację, czy tło ma być przezroczyste. Oceń kilka wariantów, zanim agent zastąpi dotychczasowy element.
Na co uważać: Pierwsza propozycja może mieć niewłaściwą grubość lub charakter. Zachowaj możliwość powrotu do poprzedniej wersji, tak jak zrobił to autor.
8.Zatwierdź scenopis, zanim wydasz środki na wideo
Na czym polega: Przy filmie promocyjnym Astra najpierw przygotowała scenopis. Autor wprowadził poprawki, a dopiero później uruchomił płatne generowanie.
Jak stosować: Ustal kolejność ujęć, wygląd scen i budżet kredytów przed produkcją. Poproś o pokazanie planu, aby wychwycić nietrafiony kierunek.
Na co uważać: Wygenerowany klip miał błędy w polskich napisach. Zaplanuj czas na montaż i poprawki, nawet jeśli obraz wygląda dobrze.
9.Sprawdzaj niższy poziom rozumowania przed droższym
Na czym polega: Autor przytacza porównanie, w którym Astra na ustawieniu „high” osiągnęła podobną skuteczność do „max” przy niższym średnim koszcie. Część własnych zadań wykonywał na ustawieniu „low”.
Jak stosować: Zacznij od tańszego ustawienia przy zadaniu, którego wynik można łatwo ocenić. Zwiększ poziom dopiero wtedy, gdy pojawi się wyraźny powód.
Na co uważać: Przytoczone liczby pochodzą z omawianego przez autora zestawienia; nie są obietnicą kosztu ani skuteczności w twoim projekcie. Generowanie obrazów i wideo może dodatkowo zwiększyć wydatki.
10.Oceniaj model po powtarzalności wyników
Na czym polega: Autor bardzo wysoko ocenia Astrę w obsłudze komputera, ale opisuje też nierówną jakość przy złożonym rozumowaniu i kodowaniu. Dlatego nie uznaje jej za AGI.
Jak stosować: Przetestuj model na kilku własnych zadaniach, także podobnych do siebie. Porównuj jakość, liczbę poprawek i zużyty limit.
Na co uważać: Udany pokaz jednej umiejętności nie wystarcza, by ocenić ogólne możliwości modelu. Wnioski autora wynikają przede wszystkim z jego praktyki i przytoczonych przykładów.
Redakcyjne tłumaczenie
Co chcę sprawdzić
Kilka tygodni temu OpenAI zaprezentowało GPT-6 Astra, przedstawiając go jako swój najpotężniejszy model. Szybko pojawiły się głosy, że oto dostaliśmy AGI, czyli ogólną sztuczną inteligencję. W sieci można zobaczyć efektowne pokazy, choćby taki, w którym Astra uczy się rysować za pomocą mechanicznego ramienia.
Chcę sprawdzić model w zadaniach, z którymi można spotkać się podczas pracy z agentami AI. Pokażę, co udało mi się zrobić po kilku tygodniach prób i kilkukrotnym wyczerpaniu limitu w planie Pro. Na końcu wrócę do pytania, czy możliwości Astry rzeczywiście uzasadniają mówienie o AGI.
Najmocniej zainteresowała mnie jej zdolność obsługi komputera. Moim zdaniem Astra radzi sobie z tym lepiej niż inne modele, które obecnie mam do dyspozycji, w tym Fable 5.1 od Anthropic. Zanim pokażę przykłady, wyjaśnię jednak, w jaki sposób agent może dostać się do programu i wykonać w nim pracę.
Trzy sposoby obsługi programu
Większość aplikacji ma graficzny interfejs użytkownika: okna, przyciski i pola, które widzimy na ekranie. Agent AI może korzystać z niego podobnie jak człowiek. Uruchamia program, robi zrzut ekranu, ustala położenie potrzebnego elementu i klika. Taki sposób pracy nazywa się computer use, czyli obsługą komputera przez agenta.
Ma on oczywiste zalety: agent może w ten sposób pracować z programami, które mają zwykły interfejs. Są też ograniczenia. Musi stale obserwować ekran, czasem kliknie obok celu, a cała operacja zużywa więcej tokenów niż wydawanie programowi gotowych poleceń.
Niektóre aplikacje udostępniają API. Wtedy agent nie szuka przycisku na ekranie, lecz wysyła polecenie, które program potrafi wykonać. Jest też MCP, czyli standard pozwalający udostępniać agentom narzędzia i opisywać, do czego służą. Z punktu widzenia tego materiału najważniejsza różnica jest prosta: agent może działać przez ekran albo korzystać z poleceń udostępnionych przez aplikację. W kolejnych przykładach użyję obu możliwości.
Blender: od obrazka do modelu 3D
Pierwszy sprawdzian dotyczył Blendera, bezpłatnego programu do tworzenia grafiki 3D. Sam nie umiem się nim sprawnie posługiwać. Chciałem zobaczyć, ile uda się zrobić, kiedy oddam tę pracę Astrze.
Na potrzeby eksperymentu przygotowałem projekt gry o owcach. Ustawiłem w Astrze wysoki poziom rozumowania, a na początek poprosiłem ją o wysłanie subagenta z modelem GPT-5.6 Luna, żeby zapoznał się z plikami projektu i zrozumiał kontekst gry. To przy okazji pierwsza praktyczna rada dotycząca kosztów: nie każde zadanie musi wykonywać najmocniejszy model.
W Codexie można ustawić domyślnych subagentów w pliku config.toml. W konfiguracji, którą pokazuję, Astra zajmuje się planowaniem, oceną i zlecaniem poprawek, a Luna wykonuje część pracy przygotowawczej. Takie rozdzielenie ról ma ograniczać zużycie droższego modelu. Link do repozytorium opisującego tę konfigurację zostawiłem pod filmem.
Do projektu podłączyłem znaleziony na GitHubie, nieoficjalny serwer MCP dla Blendera. Następnie poprosiłem Astrę o przygotowanie dwóch lub trzech propozycji logo w stylistyce wokselowej, z realistycznym oświetleniem. Obrazy powstały przy użyciu narzędzia do generowania grafiki dostępnego w aplikacji. Wybrałem kierunek, który miał posłużyć za wzór dla modelu 3D.
Generowanie takich obrazów kosztuje więcej niż zwykła rozmowa z modelem, więc warto świadomie decydować o liczbie wariantów. Kiedy miałem już obraz koncepcyjny, poleciłem Astrze zbudować scenę w Blenderze, wyrenderować podgląd, porównać go ze wzorem i wprowadzać poprawki. Mogła korzystać zarówno z MCP, jak i z interfejsu programu.
Nie odbyło się to zupełnie bez mojego udziału. Poprosiłem o dodanie tekstur, które również zostały wygenerowane, oraz o zmianę wyglądu trójwymiarowego barana, by sprawiał groźniejsze wrażenie. Od pierwszego polecenia do wersji, która mnie zadowoliła, minęło około 15 minut. Według mojego pomiaru praca zużyła około 4% tygodniowego limitu w planie Codex Pro 5X przy ustawieniu Astry na wysoki poziom rozumowania.
Model nie odtworzył logo dokładnie. Część odpowiedzialności przypisuję sobie: nie znam Blendera ani projektowania 3D, więc mogłem niedokładnie określić, czego oczekuję. Być może lepszy opis, dodatkowe narzędzia lub płatne usługi do generowania modeli poprawiłyby rezultat. Mimo tego eksperyment pokazał mi, że z pomocą agenta mogę przygotować projekt w programie, którego sam nie potrafię obsługiwać.
Przeglądarka, w której agent pracuje za mnie
Zanim przejdę do następnego zadania Astry, pokażę przykład pracy agenta w przeglądarce. Ta część materiału powstała we współpracy z partnerem odcinka, twórcami Ego Lite.
Przeglądarka działa na silniku Chromium i obsługuje rozszerzenia, z których korzystam na co dzień. Zainteresowała mnie przede wszystkim możliwość oddania agentowi osobnej przestrzeni roboczej. Może tam wykonywać czynności w stronach, do których jestem już zalogowany, a ja w tym czasie pracuję w innym oknie.
Potrzebowałem animowanego paska zachęcającego widzów do polubienia filmu i subskrypcji oraz nowej planszy końcowej. Uruchomiłem projekt zawierający informacje o mojej marce i poprosiłem Claude Code o przygotowanie kilku wariantów w narzędziu do projektowania. Agent obejrzał materiały odniesienia, przygotował propozycje i zapytał, które kierunki mi odpowiadają. Wybrałem dwa.
Później poleciłem mu poprawić nazwę profilu na pasku. Agent otworzył własną przestrzeń w przeglądarce, wpisał polecenie i wykonał zmianę. Mogłem obserwować pracę, zatrzymać ją albo przejąć sterowanie. Gdy potrzebował mojej czynności, dostałem powiadomienie. Po jej wykonaniu mogłem ponownie oddać mu kontrolę.
W mojej pracy przydaje się to również do sprawdzania stron i aplikacji tworzonych z pomocą agentów. Agent przechodzi przez interfejs i może korzystać z danych widocznych w panelach, do których jestem zalogowany. Według testów przytaczanych przez twórców Ego Lite praca w tej przeglądarce trwa ponad dwa razy krócej niż w porównywanych rozwiązaniach. Z mojego doświadczenia wynika przede wszystkim, że przy pokazanych zadaniach agent działał szybciej, niż zrobiłbym to ręcznie. W chwili nagrywania Ego Lite było bezpłatne i dostępne na macOS; według informacji przekazanej mi przez twórców wersja na Windows miała pojawić się w okolicach października.
Strona hotelu dla psów: najpierw kierunek, potem wykonanie
Kolejne zadanie zleciłem już Astrze. Chciałem, żeby przygotowała stronę fikcyjnego hotelu dla psów. Zależało mi jednak na tym, by przed pisaniem strony poszukała inspiracji i pokazała, jaki kierunek proponuje.
Podzieliłem pracę na trzy etapy. Najpierw Astra miała obejrzeć pięć lub sześć projektów stron usługowych na Dribbble i Pintereście. Mogła też skorzystać z płatnego połączenia z Mobbin, które udostępnia przykłady rozwiązań projektowych. Przy każdym przykładzie miała zachować zrzut interesującego fragmentu i w jednym zdaniu wyjaśnić, co warto z niego zaczerpnąć.
Drugi etap stanowił moodboard, czyli plansza pokazująca zamierzony wygląd projektu. Poprosiłem o sześć miniatur, paletę czterech lub pięciu kolorów z kodami, dwa kroje pisma i trzy krótkie zasady określające, co pasuje do strony, a czego unikać. Astra miała zapisać planszę w folderze projektu i pokazać mi ją do zatwierdzenia. Dopiero po mojej decyzji mogła przejść do budowy strony.
Takie wyznaczenie etapów ogranicza liczbę pytań podczas pracy. Agent nie zatrzymuje się po każdej drobnej czynności, ale wraca w chwili, gdy moja decyzja wpływa na dalszy projekt. Gdy pierwszy moodboard był gotowy, wprowadziłem poprawki i zatwierdziłem kierunek.
W międzyczasie zmieniłem poziom rozumowania Astry z wysokiego na niski. Pokazałem w filmie zestawienie, według którego średni koszt zadania wynosił około 12 dolarów przy ustawieniu „max”, 5,72 dolara przy „high” i 2,19 dolara przy „low”. Skuteczność w tym zestawieniu wynosiła odpowiednio około 73%, 73% i 67%. To skłoniło mnie do sprawdzenia tańszego ustawienia w zadaniu, którego wynik mogłem sam ocenić. Przytoczyłem też opinię członka zespołu Codexa, że Astra na niskim poziomie rozumowania potrafi dorównać GPT-5.6 Sol na wysokim poziomie.
Astra przygotowała poprawiony moodboard, wygenerowała obrazy do strony, a następnie zbudowała ją przy użyciu funkcji Sites dostępnej w Codexie. Powstała witryna „Cztery łapy” z nagłówkiem, opisem pobytu, modułami korzyści, cennikiem i formularzem. Część tekstów można było jeszcze poprawić, lecz całość uznałem za udaną pierwszą wersję. Poza połączeniem z Mobbin nie dodawałem do tego projektu osobnych umiejętności dotyczących projektowania stron.
OBS: sceny, ramka kamery i elementy transmisji
Następny przykład dotyczy OBS-a, programu, którego używam do transmisji i nagrywania. Astra, a wcześniej także GPT-5.6 Sol, pomagały mi ustawiać sceny, animacje i inne elementy widoczne podczas moich transmisji.
OBS udostępnia połączenie WebSocket. Po włączeniu serwera w ustawieniach i skonfigurowaniu hasła można pozwolić agentowi wydawać programowi polecenia. Dzięki temu tworzył i zmieniał sceny, ustawiał elementy obrazu, animacje oraz poziomy dźwięku. Większość tych czynności nie wymagała klikania w oknie OBS-a.
Nie wszystko dało się jednak zrobić przez WebSocket. W takich sytuacjach Astra korzystała z obsługi interfejsu. Poprosiłem ją między innymi o alternatywną ramkę wokół obrazu z kamery, utrzymaną w kolorystyce mojej transmisji. Agent zapytał, czy ramka ma obejmować kamerę, czy cały ekran. Kiedy doprecyzowałem zadanie, przygotował warianty grafiki z przezroczystym tłem.
Wybrałem jedną propozycję. Astra ustaliła wymiary obrazu z kamery w pikselach, dopasowała ramkę i umieściła ją w odpowiednich scenach. Sprawdziła jej położenie w OBS-ie. Poprzednią ramkę wyłączyła, ale zachowała, żebym mógł do niej wrócić.
Poprosiłem również o baner promujący moją społeczność „Operatorzy AI” oraz kwadratową grafikę dla osób, które chciałyby wesprzeć transmisję. Agent przygotował te elementy i umieścił je w scenie. Przy okazji pokazuję system wpłat zbudowany przeze mnie z pomocą Codexa i Claude Code. Widz może przejść do płatności przez kod QR lub link, a po wpłacie na ekranie pojawiają się jego nazwa, kwota i opcjonalna wiadomość. Lektor odczytuje komunikat. Dodałem także niewielki model, który sprawdza wiadomości i ukrywa wulgaryzmy.
Film promocyjny: scenopis, generowanie i poprawki
Ostatni eksperyment dotyczy ruchomej grafiki. Znalazłem udostępnioną bezpłatnie umiejętność do tworzenia animacji autorstwa twórcy o imieniu Chase i postanowiłem użyć jej przy krótkim filmie promującym moją aplikację Tumforge. Aplikacja służy do tworzenia miniatur na podstawie rozmowy z agentem.
Uruchomiłem Astrę w projekcie zawierającym materiały dotyczące strony aplikacji i jej stylu wizualnego. Poprosiłem subagenta o zapoznanie się z udostępnionym repozytorium, a Astrę o zaplanowanie filmu z użyciem tej umiejętności oraz połączenia z Higgsfield, platformą dającą dostęp do modeli generujących obrazy i wideo.
Zaczęliśmy od pytań i scenopisu opisującego przebieg animacji. Dzięki temu mogłem ocenić pomysł przed wydaniem kredytów na generowanie. Wprowadziłem kilka uwag, ustaliliśmy limit do 300 kredytów i dopiero wtedy powstały materiały. Jeden z pierwszych elementów tła wyglądał słabo, więc poprosiłem Astrę o ponowne poszukanie inspiracji w przeglądarce i poprawienie kierunku.
Ostateczny klip został wygenerowany przez Higgsfield za pomocą modelu Seedance 2.5. Obraz mi odpowiadał, ale polskie napisy zawierały błędy. Powiedziałem Astrze, że nie mam już kredytów na kolejne generowanie. Zamiast zaczynać od początku, wykorzystała dostępne na moim komputerze narzędzia do obróbki gotowego materiału. Po kilku rundach poprawek dostałem szóstą wersję filmu z poprawionymi napisami. Astra dopasowała też efekty dźwiękowe do wydarzeń na ekranie.
Całość kosztowała mnie 300 kredytów oraz czas poświęcony na ocenę i poprawki. Osoba zajmująca się zawodowo animacją zapewne uzyskałaby lepszy rezultat. Dla kogoś, kto chce przygotować materiał do własnego projektu i nie ma budżetu na profesjonalną produkcję, taki wynik może jednak wystarczyć. Sam prawdopodobnie poprawiłbym go jeszcze, gdybym poświęcił więcej czasu na materiały odniesienia.
Czy Astra jest już AGI?
Po tych czterech eksperymentach wracam do pytania z początku. Przez AGI rozumiem sztuczną inteligencję, która dorównuje człowiekowi lub przewyższa go w praktycznie wszystkich zadaniach wymagających zdolności poznawczych. Czy Astra spełnia to kryterium? Moim zdaniem jeszcze nie.
To bardzo mocny model. Szczególnie dobrze oceniam jego pracę z komputerem. Zdarzało się również, że przy złożonym problemie lub pisaniu kodu osiągał lepszy wynik niż Fable 5.1 i wyraźnie posuwał projekt naprzód. Przy podobnych zadaniach bywało jednak odwrotnie. Właśnie ta nierówność utrudnia mi uznanie Astry za wyraźnie najlepszy wybór do każdej pracy.
Dochodzi koszt. Testując model przez kilka dni po premierze na planie Pro 5X, czterokrotnie wyczerpałem dostępny limit tygodniowy i korzystałem z bezpłatnych resetów przypisanych do konta. Miewałem też wrażenie, że ustawienie wyższego poziomu rozumowania nie zawsze poprawia wynik; niekiedy odpowiedzi na poziomie średnim lub niskim bardziej mi odpowiadały.
Dlatego moja odpowiedź brzmi: Astra potrafi imponująco dużo, ale nie nazwałbym jej AGI. Chciałbym przede wszystkim bardziej wyrównanej jakości. Pokazane zadania przekonały mnie, że warto ją sprawdzać w praktyce — z jasno określonym celem, kontrolą kosztów i możliwością oceny kolejnych wersji.