O czym jest ten film
- OpenAI wydało GPT-6.1 Soul jako odpowiedź na Opusa 5.5 i obiecuje niemal inteligencję Astry za ułamek ceny — autor postanowił to zweryfikować w praktyce.
- Test polegał na zbudowaniu klona WhisperFlow: aplikacji do głosowego dyktowania, która potrafi wywoływać narzędzia — Gmaila i Firecrawl do pogłębionego researchu.
- Powstały trzy wersje programu: hybryda (Astra planuje, Soul wykonuje) oraz dwie solowe — Astra i Soul z identycznym promptem i identycznym stosem technologicznym.
- Różnica cen jest ogromna: Soul jest pięciokrotnie tańszy na wejściu i wyjściu, a za powtórne użycie kontekstu (cache) płaci się dziesięciokrotnie mniej.
- Czas budowy okazał się niemal identyczny (42 minuty Astry, 40 minut Soula), ale koszt — 203 dolary kontra 43 dolary przy zbliżonym zużyciu tokenów (69 mln kontra 66 mln).
- Najlepiej zadziałała wersja hybrydowa: stworzyła osiem faz pracy sama z siebie i wymagała najmniej poprawek.
- Astra od razu ogarnęła fundamenty (np. przechwytywanie głosu), ale jej cytowania z researchu były w dużej części uszkodzone; u Soula było odwrotnie — źródła działały, głos ruszył dopiero po pięciu–sześciu dodatkowych promptach.
- Według OpenAI najsłabsze strony 6.1 to sterowanie komputerem i tworzenie profesjonalnych dokumentów — autor potwierdza to w testach.
- Autor udostępnia cały prompt oraz kod aplikacji do jednoklikowego sklonowania.
- W ocenie autora 6.1 to wyraźny skok względem poprzedniej generacji, która „nie nadawała się do użycia” — ale porównania z Opusem wciąż trwają.
10 najważniejszych takeaways — z kontekstem zastosowania
1.Pięciokrotna różnica w cenie przy porównywalnym efekcie
Na czym polega: Soul zbudował działającą aplikację za 43 dolary, Astra za 203 — przy niemal identycznym zużyciu tokenów (66 mln kontra 69 mln) i czasie (40 kontra 42 minuty).
Jak stosować: Samo budowanie i iterowanie zlecaj tańszemu modelowi; droższego trzymaj w rezerwie na momenty wymagające wyższej inteligencji.
Na co uważać: „Działająca” nie znaczy „wykończona” — wygląd wersji Soula był wyraźnie skromniejszy. Zaplanuj osobny prompt na dopracowanie wizualne.
2.Czas wykonania to złe kryterium wyboru modelu
Na czym polega: Oba modele ukończyły zadanie w praktycznie tym samym czasie, więc różnica w szybkości niczego nie przesądza.
Jak stosować: Przy wyborze modelu do własnych projektów porównuj koszt i liczbę wymaganych poprawek, a nie same minuty.
Na co uważać: Krótszy przebieg bywa złudzeniem — model może oddać pracę szybciej, ale w gorszym stanie, i debug zje różnicę.
3.Hybryda „drogi planuje, tani wykonuje” wypadła najlepiej
Na czym polega: Wersja, w której Astra przygotowała spójny plan, a Soul zrealizował poszczególne fazy, działała najlepiej od razu i wymagała najmniej poprawek.
Jak stosować: Pozwól mocniejszemu modelowi zaprojektować architekturę i podzielić pracę na fazy, a budżet tokenowy wydawaj na tańsze wykonanie. Autor rekomenduje ten układ zwłaszcza na planach za 20 lub 100 dolarów.
Na co uważać: Planowanie u drogiego modelu też kosztuje — ogranicz jego rolę do strategii, nie do każdej drobnej decyzji.
4.Tani cache to ukryta dźwignia oszczędności
Na czym polega: Za ponowne użycie wcześniej przetworzonego kontekstu (tzw. cached input) Soul kosztuje 10 centów wobec dolara u Astry — dziesięciokrotność.
Jak stosować: Długie sesje z powtarzającym się kontekstem — konwencje projektu, dokumentacja, wielokrotne iteracje — kieruj na model z tańszym cache’em.
Na co uważać: Zysk rośnie tylko tam, gdzie kontekst faktycznie się powtarza; przy krótkich, jednorazowych zadaniach różnica jest mniej odczuwalna.
5.Fundamentalne funkcje testuj od pierwszej minuty
Na czym polega: Soul zrealizował większość funkcji, ale podstawowa rzecz — przechwytywanie głosu — ruszyła dopiero po pięciu–sześciu promptach diagnostycznych; u Astry zadziałała za pierwszym razem.
Jak stosować: Krytyczną ścieżkę produktu (np. wejście audio, logowanie, zapis danych) weryfikuj natychmiast po pierwszym builde, zanim ruszysz z resztą.
Na co uważać: Oszczędność na tańszym modelu potrafi zostać w całości zjedzona przez pętlę napraw — licz koszt razem z promptami ratunkowymi.
6.Research i cytowania każdy model załatwia po swojemu
Na czym polega: W wersji Soula odnośniki do źródeł działały od razu; Astra przynosiła z researchu dużo uszkodzonych linków.
Jak stosować: Zanim osadzisz workflow badawczy w produkcie, przetestuj go osobno u każdego modelu i sprawdzaj, czy źródła żyją.
Na co uważać: Martwe cytowania podważają wiarygodność całego raportu — w automatycznych zestawieniach weryfikuj linki programistycznie.
7.Sterowanie komputerem to słaby punkt tańszych modeli
Na czym polega: Według OpenAI 6.1 najbardziej ustępuje Aastrze właśnie w obsłudze komputera i tworzeniu profesjonalnych dokumentów — autor musiał tu ręcznie doglądać obu modeli.
Jak stosować: Etapy wymagające „klikania” po interfejsie systemu i dopracowanych dokumentów zostawiaj mocniejszemu modelowi albo od razu zakładaj ręczne korekty.
Na co uważać: Długie łańcuchy sterowania komputerem potrafią wyrwać się w połowie — a to najdroższy moment na porażkę.
8.Daj modelowi autonomię w organizacji własnej pracy
Na czym polega: Prompt wprost upoważniał modele do tworzenia osobnych wątków roboczych; same decydowały o liczbie faz i ustanawiały wątki-lidery pilnujące podzadań. Hybryda wymyśliła sobie osiem faz — i to ona działała najlepiej.
Jak stosować: W prompcie autoryzuj tworzenie wątków, określ kryteria ukończenia i zasady korzystania ze sterowania komputerem, ale pozwól modelowi samemu zaprojektować podział pracy.
Na co uważać: Im więcej swobody, tym trudniej pilnować kosztów — określ warunki zakończenia i limity.
9.Miej własny, powtarzalny test porównawczy modeli
Na czym polega: Całe badanie opiera się na jednym stałym benchmarku: ten sam prompt, ten sam stos technologiczny, to samo zadanie „od zera do działającego demo” — i pomiar tokenów, czasu oraz wydatków.
Jak stosować: Zbuduj sobie analogiczny sprawdzian (aplikacja + prompt + stack) i każdy nowy model przepuszczaj przez niego, porównując koszty i liczbę poprawek.
Na co uważać: Pojedynczy przebieg to anegdota, nie statystyka — sam autor zapowiada dalsze testy na bieżącej pracy z klientami.
10.Po poprzedniej generacji warto dać modelom OpenAI drugą szansę
Na czym polega: W ocenie autora szósta generacja z wariantem Soul „nie nadawała się do użycia” i nie miała argumentów wobec Opusa czy Sonneta; 6.1 jest wyraźnie zdolniejszy i znacznie tańszy.
Jak stosować: Jeśli odpuściłeś modelom OpenAI po tamtej generacji, przetestuj 6.1 na własnym, stałym benchmarku zanim wyrokujesz.
Na co uważać: To subiektywna ocena z jednego projektu — zweryfikuj ją na swoich realnych zadaniach, zwłaszcza w starciu z Opusem.
Redakcyjne tłumaczenie
Odpowiedź OpenAI na Opusa 5.5
OpenAI właśnie pokazało swoją odpowiedź na Opusa 5.5 — model GPT-6.1 Soul. (Informacja dodatkowa: Opus to flagowa rodzina modeli Anthropic, głównego konkurenta OpenAI.) Sam OpenAI zapewnia, że Soul jest prawie tak sprawny jak Astra, a kosztuje ułamek jej ceny. Postanowiłem przepuścić tę deklarację przez praktyczny sprawdzian: kazałem obu modelom zbudować bardzo złożony produkt w krótkim czasie.
Trzy aplikacje, jedno zadanie
Zleceniem był klon WhisperFlow — aplikacji do głosowego dyktowania — z możliwością wywoływania narzędzi: od Gmaila po Firecrawl, służącego do pogłębionych poszukiwań na rozmaite tematy. (Informacja dodatkowa: Firecrawl to narzędzie do przeszukiwania i zbierania treści ze stron internetowych.) Jeśli zajrzycie do moich aplikacji, znajdziecie tam trzy oddzielne programy, które robią dokładnie to samo, ale powstały na trzy sposoby. Relay Voice zbudowała hybryda: Astra prowadziła projekt, Soul wykonywał robotę. Dwie pozostałe powstały solo — Astra i Soul dostały co do słowa ten sam prompt i szły z nim od zera do finalnej wersji, żeby różnice widać było gołym okiem.
Ekonomia: pięć razy taniej, a za cache aż dziesięć
Postawmy oba modele obok siebie i spójrzmy na liczby. Za tekst wejściowy Astra kosztuje 10 dolarów, Soul jest pięciokrotnie tańszy — 2 dolary. Za generowanie odpowiedzi proporcje są identyczne: 50 dolarów u Astry, 10 u Soula. (Informacja dodatkowa: ceny modeli w API podaje się standardowo za milion tokenów — token to fragment tekstu, którym rozlicza się pracę modelu.) Warto też przyjrzeć się wejściu z cache, czyli ponownemu wykorzystaniu wcześniej przetworzonego kontekstu. Tu Astra kosztuje dolara, Soul jedynie 10 centów — dziesięć razy mniej. Oszczędność jest więc ogromna, ale sedno w tym, czy przekłada się na realną produktywność. Zespół OpenAI przyznaje, że wyniki w testach są niemal równe, a najwyraźniej Soul ustępuje w dwóch obszarach: sterowaniu komputerem i tworzeniu profesjonalnych dokumentów. W praktyce oznacza to, że do codziennych zadań, które korzystają z dodatkowej porcji inteligencji, lepiej przystosowany jest 6.1, natomiast Astra najlepiej sprawdza się jako planista — a gotowy plan wykonujemy już Soulem.
Wersja hybrydowa: dyktowanie, poczta i research w jednym
Pokażę teraz wszystkie trzy buildy, potem prompt, którym je uruchomiono, stos technologiczny — i dopiero na końcu bezpośrednie porównanie pod względem tokenów, czasu i wydanych pieniędzy.
To efekt pracy duetu: Astra planowała, Soul wykonywał. Gdy wciskam klawisz Option, dostaję nie tylko transkrypcję na żywo, ale też całą sekwencję wywołań narzędzi — do pakietu Gmail albo do Firecrawla na głębsze dociekania. Sprawdźmy najpierw Gmaila. Pytam:
„Powiedz mi, ile e-maili dostałem w ciągu ostatniej godziny i jak na imię każdej osobie, która do mnie napisała.”
Wysyłam. Model błyskawicznie orientuje się, że trzeba sięgnąć po narzędzie — i już: znajduje Gmaila, odpala Google CLI, wyłapuje wiadomości, zawęża listę, przekłada wszystko na czytelną formę i pokazuje w rogu ekranu. Widzę imię każdej osoby, która odezwała się do mnie w ciągu godziny. Każde wywołanie narzędzia mogę rozwinąć i podejrzeć, a cały panel zwinąć i przeciągnąć, gdzie chcę.
Teraz strona badawcza. Mówię:
„Zbadaj aktualne na dziś, najnowsze wersje planów OpenAI ChatGPT i przedstaw rachunek kosztów każdego z nich.”
Model rozpoznaje, że to zapytanie badawcze. Odpala Firecrawl, w mgnieniu oka przeszukuje sieć, wraca ze źródłami i składa krótką listę. Przesuwamy okno, rozwijamy — i proszę: zupełnie nowy plan za 500 dolarów, razem ze źródłem. Klikamy w nie i dostajemy pełną rozpiskę ekonomii. Całość ruszyła w jakieś pięć do siedmiu promptów. Do tego historia i ustawienia — aplikacja niczym nie odbiega od istniejących na rynku programów do dyktowania.
Wersja zbudowana przez Astrę
To aplikacja Astry. Chętnie przesunąłbym ją dla was w bok, ale nie da się jej przeciągać — choć wyraźnie prosiłem o to w planie. Działa jednak poprawnie. Wciskam Option+Shift: „Halo, halo, halo. Chcę sprawdzić, czy to działa i jak szybko reaguje. A przy okazji — zajrzysz mi do Gmaila?” Model rozpoznaje, że trzeba do Gmaila. Trochę mu to trwa, ale otwiera skrzynkę, rozpisuje wiadomości i pokazuje pocztę. Działa.
Wersja zbudowana przez Soula
Na koniec GPT-6.1 Soul. Wizualnie najbardziej ascetyczny z całej trójki, ma wprawdzie tryb minimalizacji, ale pracuje wolniej i z odczuwalnym opóźnieniem. Zobaczmy, czy działa. Skrót to Option+Command: „Halo, mówię do ciebie. Sprawdzam, czy to działa i czy wyłapiesz, gdy zmienię język, tak jak tamci. Bonjour, monsieur. Bonjour.” Sprawdźmy, czy da radę. I dał — całkiem szybko, choć nie najpiękniej. Przeciągać się też nie da. Gdy zajrzę w ustawienia, na pierwszy rzut oka wszystko wygląda znajomo: historia, przełączanie modeli. Problem w tym, że przyciski nie reagują tak jak w wersji Astry, a już na pewno nie tak pewnie jak w aplikacji zbudowanej przez oba modele.
Przypominam: wersje solo powstawały z identycznego promptu i na identycznym stosie technologicznym — Gemini transkrybował mowę, Firecrawl prowadził research, a Google CLI otwierał dostęp do Gmaila, Google Suite, Dokumentów i reszty ekosystemu Google.
Sedno zadania: rozstrzygnąć, kiedy sięgnąć po narzędzie
Cała finezja tego zadania polega na czym innym niż samo dyktowanie. Program musi zdecydować, czy wypowiedź ma zostać zwykłą transkrypcją, czy najpierw wymaga wywołania narzędzi — a jeśli tak, to jakich i w jakiej kolejności — i dopiero potem pokazać wynik w interfejsie. Do tego wszystko musiało zostać zrobione metodą sterowania komputerem: nie tylko zbudować aplikację w Electronie (Informacja dodatkowa: Electron to technologia, która opakowuje aplikację webową w program desktopowy — tutaj na Maca), ale też — jako dodatkowe utrudnienie — fizycznie wejść w gotowy program, otworzyć ustawienia i włączyć prywatność, bezpieczeństwo oraz dostępność, żeby transkrybowany tekst dało się realnie wstawiać do innych aplikacji.
Prompt-kolos i wątki z liderami
Ten potwór był promptem, który dostały oba modele. Zachęcano je w nim do zakładania osobnych wątków roboczych na kolejne fazy projektu. Na ekranie widać fazy od 1 do 6 — ale to modele same rozstrzygały, czy do dowiezienia całości wystarczą dwie, cztery czy pięć. Same organizowały sobie wątki, a każdemu przydzielały wątek-lidera. Cała idea polegała na tym, żeby lider pilnował swoich podfaz: czy wszystkie „żyją”, czy pracują i czy zmierzają we właściwym kierunku — do wspólnego celu. Ciekawostka: wersja, której dałem więcej czasu na spójne zaplanowanie w Aastrze i która potem uruchamiała wątki Soulem, wymyśliła sobie osiem faz. I to właśnie ona działała najlepiej od razu, bez dopieszczania.
Prompt i cały kod udostępniam — jednym kliknięciem sklonujecie je do własnych projektów. A oto cel, jaki dostały wszystkie modele:
„Zbuduj szybki lokalny prototyp o nazwie Relay Voice. Chcę doświadczenia w stylu WhisperFlow. Zbadaj w sieci, czym jest WhisperFlow, dodaj asystencję Gmaila; zoptymalizuj pod jedną niezawodną demonstrację osobistą, przejrzysty wygląd i wyniki możliwe do podejrzenia. Jesteś czatem prowadzącym — i to jest kluczowe: wprost upoważniam cię do tworzenia nowych wątków Codex dla poniższych faz.”
(Informacja dodatkowa: Codex to agentowe środowisko programistyczne OpenAI; wątek to osobna, równoległa sesja robocza.) Każdemu modelowi mówiłem w ten sposób: masz pełną swobodę co do liczby uruchamianych czatów, ich zadań, kryteriów oceny i tego, jak korzystasz ze sterowania komputerem.
Wyniki: remis na czas, przepaść w kosztach
Przejdźmy do rezultatów, a potem do rozliczenia wad, które musiałem ręcznie wygładzać. Czas: praktycznie bez różnicy. Astra potrzebowała 42 minut, Soul 40. Samo tempo wykonania nie jest więc czynnikiem rozstrzygającym. Koszty to zupełnie inna historia. Przy niemal identycznym zużyciu tokenów — 69 i 66 milionów — Astra kosztowała 203 dolary, Soul pięciokrotnie mniej: 43 dolary za działającą wersję aplikacji. Czy była tak ładna jak tamta? Nie. Ale wystarczyłby zapewne jeden prompt Astry, żeby ją wizualnie dopracować, podczas gdy zdecydowaną większość budowy wykonałby Soul.
Gdzie który model kulał
Oba modele potykały się o co innego — i dlatego mówię wam, że podejście hybrydowe, w którym jeden model planuje, a ty ten plan realizujesz tokenami drugiego, to prawdopodobnie najlepsza droga, zwłaszcza jeśli korzystacie z planów za 20 albo 100 dolarów.
Astra wyszła słabiej na etapie researchu — na tym fragmencie, w którym model po otrzymaniu promptu orientuje się, że potrzebne są dociekania, sięga po Firecrawl, a następnie rozstrzyga, czy wystarczy jedna runda wyszukiwania, czy potrzeba kilku: na przykład zeskrobać stronę albo pogrzebać głębiej w konkretnym źródle, po czym szybko wrócić z odpowiedzią. I właśnie przy tym researchu, gdy model przynosił cytowania, spora część odnośników była uszkodzona. W wersji Soula źródła działały od razu, prosto z pudełka. Z kolei Soul ogarnął większość głównych funkcji, ale przy najbardziej fundamentalnej — pobieraniu głosu jako wejścia — musiałem się natrudzić. Poza pojedynczym promptem startowym dałem mu jeszcze pięć, sześć kolejnych, w których nieustannie sprawdzał, dlaczego to nie działa; u Astry ta funkcja ruszyła za pierwszym podejściem. Poza samym planowaniem warto więc mieć Astrę w zanadrzu jako serwisanta — kogoś, kto na koniec posprząta bałagan, jaki Soul potrafi zostawić po drodze.
Na koniec porównanie 6.1 z szóstą generacją: tamten model w moich oczach nie nadawał się do użytku i w ogóle nie brał udziału w rozmowie o rywalizacji z Opusem czy Sonnetem. Obecny jest zdecydowanie zdolniejszy i dużo wydajniejszy.
Co dalej
Mam nadzieję, że dostaliście szybki obraz tego, jak oba modele pracują i kiedy który ma sens. Zamierzam dalej testować je na bieżącej pracy z klientami, żeby sprawdzić, czy mają przewagę nad Opusem — dam znać, jeśli wyjdzie coś istotnego. Klon WhisperFlow udostępniam wraz z całym promptem i stroną, na której rozpisane są wyniki — drugi link w opisie filmu. A jeśli materiał był dla was pomocny, zostawcie łapkę i komentarz — to realnie pomaga zasięgowi. Wkrótce wracam z kolejnym filmem. Do zobaczenia!