O czym jest ten film
- Anthropic wydało Sonnet 5.5 zaledwie sześć dni po premierze Opusa 5.5; nowy model jest dwukrotnie tańszy (2/10 dolarów za milion tokenów) i według twórców ma wyprzedzać Opusa w kodowaniu agentowym.
- Autor przez tydzień używał Opusa 5.5 po 3–6 godzin dziennie i na planie za 200 dolarów miesięcznie ani razu nie zbliżył się do limitów.
- Mało kto zauważył nową funkcję Projects w Claude: główny agent deleguje zadania do osobnych wątków — chmurowych i lokalnych (Claude Code, GitHub, Vercel).
- Na DevDay OpenAI zapowiedziano około dwudziestu aktualizacji aplikacji ChatGPT, w tym platformę agentów Dots — osobistego asystenta głosowego opartego na modelach czołówki.
- W demie agent „Bluey” wysyła maile i wiadomości Slack, a na życzenie odpala lokalne sesje Codexa, które przygotowują trzy warianty strony głównej.
- Nowa przestrzeń GPT Space to dokumenty w stylu Notion z podstronami, do których agent sam dopisuje treści; mieszczą się tam też witryny Sites, obrazy i Google Drive.
- Model GPT 6.1 Soul ma być pięć razy tańszy od Astry i według testów autora bardzo dobry; doszły też rozszerzenia wtyczek pozwalające ChatGPT sterować aplikacjami firm trzecich (np. Magic Path).
- Google zapowiedziało Gemini 4 Argon w cenie Sonnet 5.5, ale dostęp ma tylko wąska grupa „cyber obrońców”; autor — po zmianie bio na Twitterze — dostał obietnicę wstępu do testów.
- Autor jest „sceptycznie podekscytowany”: od stycznia Gemini nie miało naprawdę dobrego modelu (odmawiał używania narzędzi), a nadmiar platform Google utrudnia wybór miejsca pracy.
- Grokbot: proaktywne podpowiedzi inspirowane Muse, szkice maili i wiadomości Slack osadzone w rozmowie, boty zespołowe podpinane do Slacka oraz kierowanie ruchu agenta przez komputer użytkownika.
10 najważniejszych takeaways — z kontekstem zastosowania
1.Opus 5.5 do ciężkiej pracy — limity są szczodrzejsze, niż się wydaje
Na czym polega: Mimo premiery Sonnet 5.5 to Opus 5.5 pozostaje najlepszym modelem do zaawansowanej pracy; autor przy 3–6 godzinach dziennie nie wyczerpał limitów na planie za 200 dolarów.
Jak stosować: Na planach za 100–200 dolarów ustaw Opusa jako domyślny model do budowania aplikacji i pracy z wiedzą; prowadź dwie, trzy sesje naraz i nie bój się intensywnego użytkowania.
Na co uważać: Granice osiągają osoby kodujące wielkie projekty przez cały dzień z wieloma równoległymi sesjami — jeśli tak pracujesz, miej w zanadrzu plan awaryjny lub przełączanie modelu.
2.Sonnet 5.5 — połowa ceny, wciąż bardzo wysoka klasa
Na czym polega: Sonnet kosztuje 2 dolary za milion tokenów wejściowych i 10 wyjściowych (Opus: 4 i 20), a według Anthropic wyprzedza Opusa w kodowaniu agentowym.
Jak stosować: Przełączaj się na Sonnet przy prostszych, powtarzalnych zadaniach albo wtedy, gdy puli użycia zaczyna brakować — zwłaszcza na tańszych planach.
Na co uważać: Wykresy z kart modeli bywają dalekie od codziennej praktyki; porównaj oba modele na własnym projekcie (autor: około 30 godzin z Opusem wobec 4 z Sonnetem).
3.Deleguj z krótkiego wątku nadrzędnego (funkcja Projects)
Na czym polega: Główny agent w Claude rozdaje zadania osobnym wątkom, główna rozmowa pozostaje zwięzła, a wszystkie wytwory lądują w bibliotece projektu.
Jak stosować: Formułuj polecenia typu „zbuduj prezentację wyjaśniającą X” — nowy wątek (domyślnie Opus 5.5 Medium) wykonuje robotę, a ty wracasz do czystego wątku głównego.
Na co uważać: Zadania wymagające twojego sprzętu (lokalny kod, GitHub, Vercel) muszą iść przez wątek lokalny; resztę rób w chmurze, by dało się nią sterować choćby z telefonu.
4.Dots: asystent głosowy, który nie zjada kredytów
Na czym polega: Osobisty agent w aplikacji ChatGPT działa na szybkim modelu, który nie zużywa kredytów z planu — dopóki sam nie deleguje pracy do Codexa.
Jak stosować: Wprowadź poranny rytuał: 45 minut rozmowy głosowej o planie dnia; w jego trakcie zlecaj wysyłkę maili, wiadomości Slack i uruchamianie sesji Codexa — także na spacerze, przez telefon.
Na co uważać: Agent modyfikuje wiadomości wychodzące i może prosić o potwierdzenie zmian (np. korekty treści maila) — czytaj uważnie, co zatwierdzasz; aplikacja ChatGPT robi się przy tym funkcjonalnie przeładowana.
5.GPT Space — dokumenty, do których dopisuje agent
Na czym polega: Przestrzeń dokumentów z podstronami (jak w Google Docs czy Notion), dostępna jednocześnie dla człowieka i agenta; mieszczą się w niej witryny Sites, obrazy i Google Drive.
Jak stosować: Prowadź w Space listę zadań, którą agent uzupełnia w trakcie rozmowy głosowej; twórz podstrony tematyczne i proś agenta o wypełnianie ich diagramami oraz treścią.
Na co uważać: Agent nie zawsze wie o stronach utworzonych ręcznie i może dublować pracę lub „gubić” zapis podstrony — wskazuj mu istniejące dokumenty i pilnuj potwierdzeń zapisu.
6.GPT 6.1 Soul — model na co dzień
Na czym polega: Nowy model OpenAI ma być pięć razy tańszy od Astry, a w odczuciu autora jest bardzo dobry i znacznie wolniej zjada limity.
Jak stosować: Ustaw 6.1 Soul jako domyślny do rutynowych zadań, a Astrę zostaw na trudne, jednorazowe problemy.
Na co uważać: To ocena „na czuja” po wielu godzinach pracy, nie wynik benchmarków — przetestuj model na własnych przypadkach, zanim przestawisz cały workflow.
7.Rozszerzenia wtyczek: agent steruje aplikacjami innych firm
Na czym polega: Aplikacje takie jak Magic Path (projektowanie z AI) działają teraz wewnątrz ChatGPT, także w wersji przeglądarkowej, a ChatGPT steruje nimi bezpośrednio na tokeny twojego konta.
Jak stosować: Zaloguj się w narzędziu przez ChatGPT, wydaj polecenie w stylu „zrób wersję jasną” i zatwierdzaj zmiany w projekcie bez przeskakiwania między aplikacjami.
Na co uważać: Zużycie tokenów rozlicza się na twoim koncie ChatGPT — przy cięższych projektach licz się z szybszym wyczerpywaniem limitów.
8.Zapowiedziom Gemini nie wierz na słowo
Na czym polega: Argon (Gemini 4) ma być modelem czołówki w cenie Sonnet 5.5, ale publiczność nie ma jeszcze dostępu; Gemini 3 zachwycało w demach, a w praktyce odmawiało korzystania z narzędzi — kluczowej umiejętności agentów.
Jak stosować: Czekaj na publiczny dostęp i niezależne testy, zanim rozważysz przesiadkę; sprawdzaj w pierwszej kolejności, czy model faktycznie używa narzędzi, a nie tylko wyniki benchmarków.
Na co uważać: „Cyber obrońcy” to wąska, wybrana grupa testowa — brak sygnałów z realnego użytkowania to sam sygnał.
9.Cena stała się parametrem modelu — licz koszt sesji, nie tylko jakość
Na czym polega: Czołówka wyceniana jest coraz podobnie: Argon 2/10, Sonnet 5.5 2/10, Opus 5.5 4/20, a 6.1 Soul pięć razy taniej od Astry — różnice kosztów potrafią zdominować wybór.
Jak stosować: Przy wyborze modelu licz koszt tokenów wejściowych i wyjściowych na typowej sesji; przy prostych zadaniach tańszy model często wystarczy w pełni.
Na co uważać: Niska cena bez publicznego dostępu (Argon) to na razie obietnica, nie oferta — porównuj to, czego faktycznie możesz użyć.
10.Proaktywność i „przebranie” agenta za człowieka — dwie strony medalu
Na czym polega: Grokbot zaczyna sam proponować pomoc (wzorzec zaczerpnięty z Muse) i może kierować swój ruch przez komputer użytkownika, żeby omijać blokady botów na stronach typu Shopify czy Target.
Jak stosować: Włącz proaktywne podpowiedzi do zarządzania dniem (planowanie, przypomnienia, pomysły); routing przez własny komputer zostaw na przypadki, gdy agent naprawdę musi wejść na serwis blokujący ruch z centrów danych.
Na co uważać: Obejście blokad może naruszać regulaminy serwisów, a przy routingu to twój adres IP i twój włączony komputer stają się częścią działania bota — oceń ryzyko i prywatność.
Redakcyjne tłumaczenie
Tydzień, w którym wszystko wydarzyło się naraz
To był obłędny tydzień w świecie agentów AI. Google jest podobno o krok od wydania najlepszego modelu na świecie — Argona — ale na razie dostęp mają do niego wyłącznie „cyberobrońcy”. To wszystko dzień po DevDay OpenAI (Informacja dodatkowa: DevDay to coroczna konferencja deweloperska OpenAI.), podczas której zapowiedziano dwadzieścia aktualizacji aplikacji ChatGPT — wśród nich zupełnie nową platformę agentów o nazwie Dots. A dzień wcześniej Anthropic wypuściło Claude Sonnet 5.5, zaledwie sześć dni po premierze najlepszego modelu świata, Opusa 5.5. Omówimy dziś wszystko po kolei: zebrałem wydarzenia tygodnia i wybrałem cztery najważniejsze rzeczy, które warto znać — i które mogą się wam realnie przydać.
1.Anthropic: Sonnet 5.5 i niedoceniona funkcja Projects
Zaczynamy od pierwszej nowości: Anthropic wydało Sonnet 5.5. Jeśli korzystacie z Claude — zarówno ze zwykłej aplikacji, jak i z Claude Code — zobaczycie w niej nowy model. Aplikacja opisuje go jako najbardziej wydajny przy prostych zadaniach, a w Claude Code można nim bez trudem budować dowolną aplikację.
Nie lubię długo rozwodzić się nad kartami modeli, więc pokażę tylko jedno: według danych producenta nowy Sonnet 5.5 radzi sobie z kodowaniem agentowym lepiej niż Opus 5.5. Co istotne, Sonnet kosztuje połowę ceny Opusa. Za Opusa płaci się 4 dolary za milion tokenów na wejściu i 20 na wyjściu, za Sonneta — 2 i 10. Nowy model jest więc tańszy nawet od Opusa 5.
Ale opowiem, jak to wygląda w praktyce. Przez ostatni tydzień pracowałem z Opusem 5.5 ponad trzy godziny dziennie, czasem nawet pięć czy sześć — i ani razu nie zbliżyłem się do limitów. Wystarczy spojrzeć na moje tygodniowe wykresy: zawsze nisko. Najbliżej granicy byłem raz, przy limicie pięciogodzinnym, mimo że Opus 5.5 chodził u mnie cały tydzień. Bilans doświadczenia: około czterech godzin z Sonnetem i około trzydziestu z Opusem. Opus 5.5 to wciąż najlepszy model — może niekoniecznie świata, ale z pewnością w tej cenie. To potwór.
Projects: główny agent, który rozdaje robotę
Używałem go przede wszystkim w nowej funkcji Projects — i szczerze, trochę mnie dziwi, że jako jedyny na YouTube o niej mówię. Projects daje wam głównego agenta, który deleguje zadania do osobnych wątków. Ten interfejs, zwłaszcza przy budowaniu aplikacji i pracy z wiedzą, jest niesamowity. Mogę po prostu wysłać agenta, żeby zrobił prezentację — odchodzi i robi, a wszystko świetnie integruje się z trybem projektowym.
Buduję teraz wewnętrzne narzędzie dla całej mojej firmy i agent po prostu projektuje w nim każdą stronę aplikacji. Wystarczy, że mówię głównemu agentowi: „potrzebuję prezentacji wyjaśniającej, jak działa moja strona internetowa”. Odpala nowy wątek — domyślnie na Opusie 5.5 Medium — i to właśnie tam powstaje prezentacja. Mój wątek główny zostaje krótki, a wszystkie wytwory widzę w bibliotece projektu.
Da się też uruchamiać wątki Claude Code. Ikona komputera oznacza sesję działającą lokalnie, na mojej maszynie: jeśli agent ma korzystać z mojego komputera, GitHuba czy Vercela albo jeśli koduję lokalnie z pomocą Claude Code, taki wątek musi działać u mnie. Wszystko inne może się dziać w chmurze — dzięki temu wprowadzałem zmiany w aplikacji prosto z telefonu, odpalając kolejne sesje. Robi się to zaskakująco łatwo.
Werdykt: Opus, jeśli budżet pozwala; Sonnet, gdy liczy się cena
Podsumowując część o Claude: Opus 5.5 to wciąż numer jeden, zwłaszcza na planach za 100 i 200 dolarów miesięcznie — uważam, że to bardzo dobra cena za to, co dostajecie. Sonnet dokłada pulę użycia: na planie za 100 albo 20 dolarów warto po niego sięgać, bo to wciąż bardzo dobry model, a przy okazji tańszy od Opusa. Ale jeśli budżet pozwala, po prostu bierzcie Opusa. Na planie za 200 dolarów jeszcze mi się nie udało wejść w limity. Granice osiągają tylko osoby, które całymi dniami kodują wielkie projekty i trzymają otwartych dużo sesji równolegle. Ja zwykle prowadzę dwie, trzy naraz — i z Opusem spokojnie się mieści.
2.OpenAI DevDay: Dots, GPT Space, model 6.1 Soul i wtyczki, które przejmują ster
Drugą wielką sprawą tygodnia było DevDay OpenAI. Wydali mnóstwo rzeczy i nie będę omawiać wszystkiego — nagrałem o tym osobny film. Skupię się na trzech najważniejszych zmianach w aplikacji ChatGPT (desktopowej, webowej i na iOS), a na koniec rzucę okiem na odświeżony Codex.
Po aktualizacji sporo się zmieniło: doszła nowy model — GPT 6.1 Soul — nowy panel boczny oraz główna nowość, Dots.
Dots: „Bluey”, mój agent
Oto Bluey — mój własny agent działający na komputerze, coś w stylu Grokbota czy Muse, z tą różnicą, że napędzają go modele OpenAI, które faktycznie należą do czołówki — w przeciwieństwie do dwóch, które właśnie wymieniłem. Zobaczcie, jak to działa:
Bluey: Hej, Riley. Dzień dobry.
Riley: Hej, Bluey, co słychać? Dzięki za pomoc dzisiaj rano — gadaliśmy 35 minut o wszystkim, co mam zrobić, wysłaliśmy maile. Potrzebuję jeszcze jednego. To podsumowanie, które mi wcześniej zrobiłeś — możesz wysłać je do Emily? I dorzuć wiadomość na Slacku, żeby na pewno od razu to zauważyła.
Bluey: Jasne, zaraz to ustawię. Sprawdzam podsumowanie — zakładam, że chodzi o status ze Slacka i wideo, które właśnie ci wysłałem.
Riley: Dokładnie.
Bluey: Przygotuję maila i krótką zapowiedź na Slacka. Szkice już włożyłem do naszego czatu.
Riley: No to wysyłaj. I jeszcze jedno, jak skończysz: chcę przebudować landing page’a na agentnative.inc. Mam tam stronę pokazującą świat różnych narzędzi. Odpal nową sesję Codexa — lokalną — i przygotuj w niej kilka wariantów landing page’a. Zrób to też na ChatGPT Sites, żebym mógł przełączać się między opcjami.
Bluey: Przyjąłem, zbieram to w całość.
Riley: Dzięki, Bluey.
Bluey: Szybka uwaga przed wysyłką: Emily przekazała już materiał z DevDay do OpenAI o trzeciej. W szkicach jest nieaktualna informacja, że wgranie jeszcze trwa. Mam poprawić obie wiadomości, żeby było „wysłane, czeka na przegląd”, i wtedy wysłać?
Riley: Wyślij jej dokładnie to, co mnie właśnie powiedziałeś — ma sens. Po prostu upewnij się, że dostanie te informacje. Wysyłaj oba teraz.
Bluey: Wychodzą teraz — z poprawką, że materiał jest u OpenAI i czeka na przegląd.
Riley: Dobra. A zabierasz się za to drugie zadanie w Codexie?
Bluey: Tak, jestem w trakcie. Wszystko przygotowane, ale lokalna sesja Codexa jeszcze nie wystartowała. Gdy potwierdzę dostarczenie maila i wiadomości na Slacku, odpalam zadanie z landing page’em na twoim Macu.
I patrzcie: właśnie odpala nową sesję o nazwie „redesign agent native landing page”. Klikam — i przenosi mnie do nowej sesji w Codexie, wysłanej przez Bluey’ego. Zaczynamy tworzyć.
Bluey: Obie wiadomości dotarły, a nowa lokalna sesja Codexa działa na twoim Macu — tworzy trzy warianty landing page’a z przełącznikiem i podglądem na Sites, żebyś mógł je porównać.
Riley: Bluey, wielkie dzięki.
Bluey: Cała przyjemność po mojej stronie.
Tyle jeśli chodzi o Dots — platformę osobistych agentów. Jak mówiłem: jak Grokbot i Muse, ale na modelach OpenAI. Całość jest wbudowana bezpośrednio w aplikację ChatGPT, która — trzeba to uczciwie przyznać — zaczyna robić się przeładowana. Ale zwłaszcza z funkcją głosową to najprzyjemniejsze doświadczenie z agentami, jakie miałem, bo potrafi odpalać dla mnie sesje Codexa. Korzystam z naprawdę szybkiego modelu, który nie zjada kredytów z mojego planu — dopóki sam nie deleguje pracy do Codexa albo innych zadań. Mówiąc krótko: to bardzo sprytny agent z najnowszymi modelami, siedzący w środku ChatGPT.
GPT Space: dokumenty, do których dopisuje agent
Druga nowość to GPT Space, funkcja powiązana z Dots. W panelu bocznym, obok „Home”, mamy teraz „Space” — wyobraźcie sobie Google Drive od GPT-a. Klikam i widzę wszystkie swoje dokumenty. Mogę utworzyć nową stronę, nazwać ją „Research on Dots and how it works”, wyróżnić w niej fragment o premierze Dots, dorzucić emoji — bardzo przypomina mi to Notion. Każdą stronę mogę edytować za pomocą AI, ale mogę też po prostu pogadać z Bluey’m:
Bluey: Dobry wieczór, Riley. Miło cię słyszeć.
Riley: Hej, kolego. Dodaj stronę „Dots use cases” — jako podstronę dokumentu, który właśnie edytowałeś.
Bluey: Mhm, zajmę się tym.
Riley: Na razie nie widzę „Dots use cases”.
Bluey: Jeszcze w trakcie. Sprawdzę status… Nie mam jeszcze linku do zapisu tej podstrony. Główna strona badawcza z sześcioma diagramami jest zapisana, ale podstrona dopiero powstaje.
Riley: Ja już ją utworzyłem.
Bluey: Ach, racja. Zaraz sprawdzę… OK, mam. Skorzystam z twojej i anuluję duplikat. Dodam treści o przypadkach użycia do twojej podstrony. Znalazłem ją i właśnie ją wypełniam — duplikatu nie będzie.
Riley: Świetnie, dodałeś.
Bluey: Super. Jeszcze potwierdzę zapis. Cieszę się, że widać efekty — potwierdzam pełny zapis.
Riley: Wygląda, że działa.
Bluey: To lubię słyszeć.
Space to w praktyce miejsce na wszystkie wasze dokumenty — z tą różnicą, że mogą w nich pracować nie tylko wy, ale też wasi agenci. Testowałem to z Bluey’m i najlepiej sprawdza się podczas rozmowy głosowej, na przykład na spacerze. Każdego ranka rozmawiam przez 45 minut z AI: co mam dziś zrobić? A jeśli trzeba coś zanotować, mam w stronach listę zadań, do której Bluey sam dopisuje punkty. Właśnie to zrobił — a animacja wyraźnie pokazała, że to Dot dokłada element na tablicę. Mogę otworzyć pełny ekran i przyjrzeć się z bliska. Tak jak w Google Docs mogę też tworzyć podstrony: do „Research on Dots” dokładam podstronę „Dots use cases”.
Co dziś mieści się w GPT Space? Strony, Sites (te, które tworzyliśmy wcześniej — klikam i widzę wszystkie moje witryny), obrazy oraz Google Drive.
Model 6.1 Soul: pięć razy tańszy od Astry
Trzeba tu jeszcze wspomnieć o nowym modelu GPT 6.1 Soul, który jest pięć razy tańszy od Astry — i, sądząc po moich testach, bardzo dobry. Jak wiecie, nie wgłębiam się w karty modeli, oceniam na czuja: jeżeli po wielu godzinach nadal dobrze się z niego korzysta, zostaję. Ten model mi się podoba, a limitów nie zjadam tak szybko jak przy Astrze.
Odświeżony Codex i rozszerzenia wtyczek
Na koniec OpenAI: krótki rzut oka na odświeżony Codex. Dostał nowy panel boczny i — jak podejrzewam — głównie po to, żeby pomieścić rozszerzenia wtyczek. Wtyczki w aplikacji ChatGPT można było dodawać już wcześniej, na przykład wtyczkę Figmy, która ułatwiała pracę z tym narzędziem. Teraz doszły rozszerzenia wtyczek, czyli po prostu aplikacje wewnątrz ChatGPT, działające również w wersji przeglądarkowej.
Pokażę na przykładzie Magic Path. Oto projekt, który przed dwoma dniami robiłem w tym narzędziu — i mogę go otworzyć wprost w aplikacji ChatGPT. Ponieważ zalogowałem się tam przez ChatGPT, aplikacja może sterować tym narzędziem. To naprawdę aplikacja zaprojektowana pod agentów. Piszę: „zrób wersję jasną” — i patrzcie: ChatGPT pracuje teraz wewnątrz tego programu i tworzy jasny wariant projektu. Używam przy tym tokenów z własnego konta ChatGPT, ale w aplikacji zupełnie innej firmy — Magic Path, czyli projektanta graficznego z AI. Oni mają swoje wbudowane AI, ale z rozszerzeniem wygodniej sięga się po własne konto ChatGPT. To ogromna zmiana. I proszę — gotowe.
3.Google: Gemini 4 Argon — powrót nadziei, z przymrużeniem oka
Czas na firmę, o której nie mówiłem od wieków. Trzecia nowość tygodnia to Gemini Argon — nowy model Google, numer czwarty w linii, nazwany Argon.
Jak już wspomniałem, nie ufam kartom modeli, a już szczególnie Gemini. Google wydawało już modele, które na papierze wyglądały znakomicie — mówię o Gemini 3 i 3.1. Obietnice były wielkie, dema robiły wrażenie, a modele po prostu nie robiły tego, czego się od nich chciało. Dlatego moje podstawowe pytanie brzmi: czy model jest naprawdę tak dobry, jak twierdzi Google? Powodów do sceptycyzmu jest kilka. Po pierwsze, nikt z zewnątrz nie może go jeszcze użyć — trafia najpierw do ludzi nazywanych „cyber obrońcami” (Informacja dodatkowa: wąska grupa wskazana przez Google, najpewniej specjaliści od cyberbezpieczeństwa.). Oto wczorajsze ogłoszenie: „Przedstawiamy Gemini 4 Argon, nasz nowy model frontier” — czyli należący do absolutnej czołówki — „Wdrażamy go od dziś u cyber obrońców, a dla szerszej publiczności — tak szybko, jak to możliwe. Naprawdę cieszy mnie postęp, jaki tu zrobiliśmy”. Argon kosztuje 2 dolary za milion tokenów wejściowych i 10 za wyjściowe — czyli dokładanie tyle, co Sonnet od Anthropic. Jeśli to faktycznie model czołówki, cena wydaje się rozsądna.
Nie wytrzymałem i puściłem żarcik: „Hej, dostanę dostęp, Logan?”. Zmieniłem też bio na Twitterze na „Cyber Defender”. I wiecie co? Zadziałało. Odpisał: „Spróbujemy wpuścić cię do testów przedpremierowych”. No to jazda — jestem cyber obrońcą.
Kiedy Gemini ostatnio było naprawdę dobre?
Wtedy się zastanowiłem: kiedy Gemini miało ostatnio naprawdę dobry model? Mamy dziesiąty miesiąc roku, a Google nie miało porządnego modelu od stycznia. Na początku roku Gemini 3 faktycznie był niezły — świetnie radził sobie z frontendami. Ale w dłuższym użytkowaniu, zwłaszcza przy zadaniach programistycznych, Gemini 3 po prostu odmawiał korzystania z narzędzi — a bez tego nie da się budować agentów. Przez to platformy Google nigdy naprawdę nie wystartowały. Antigravity, ich narzędzie do kodowania z AI, się nie przyjęło. Nie spotkałem nikogo, kto używałby Gemini do poważnej pracy umysłowej — żadnego założyciela firmy ani zaawansowanego użytkownika, który robi świetną robotę, kocha AI i mówi przy tym: „Ostatnie tygodnie to sama przyjemność z Gemini”. Takich ludzi nie ma. Modele nie były aż tak dobre i nie były tanie.
Jedyny atut Gemini w moich oczach to bezpośrednie wejście wideo: można wrzucić film do promptu, model „obejrzyje” go w dziesięć sekund i zrozumie naprawdę głęboko. Żaden inny model tego nie potrafi. Poza tym modele Gemini nie robią nic szczególnie ciekawego.
Gdybym miał podsumować swoje nastawienie jednym określeniem: jestem sceptycznie podekscytowany. Oby ten model był świetny, bo konkurencja wychodzi nam wszystkim na dobre. Mamy dziś mnóstwo solidnych platform: desktopowy ChatGPT, Claude, Grokbota, Cursora. Chętnie bym zobaczył odpowiednik od Google. Niestety, nawet jeśli model będzie dobry i będziemy chcieli z niego korzystać — to w jakiej aplikacji? Antigravity? Gemini desktop? AI Studio? A może NotebookLM? Platform jest tyle, że nie wiadomo, której używać. OpenAI postawiło wszystko na jedną aplikację: skoro chcecie nowych modeli OpenAI, siadacie do desktopowego ChatGPT. Chcecie Claude — otwieracie aplikację Claude. A w przypadku Google nie mamy pojęcia. Chciałbym, żeby wybrali jedną platformę i zrobili z niej superaplikację. Zobaczymy, co wymyślą — będę was na bieżąco informował w kolejnych filmach.
4.Grokbot: proaktywność, szkice inline i agent „ubrany” za człowieka
Czwarta duża nowość tygodnia dotyczy Grokbota (Informacja dodatkowa: w filmie autor przypisuje Grokbota SpaceX; aplikacja jest rozwijana przez xAI, spółkę powiązaną z Elonem Muskem.) — i to zmiany, które przemknęły większości ludzi koło nosa.
Pierwsza z nich, ogłoszona zaledwie godzinę temu: Grokbot zaczyna sam proponować pomoc, zanim o nią poprosicie. To wprost wzorowane na Muse — pierwszej platformie, która moim zdaniem ogarnęła proaktywność. Muse jest darmowe; to w zasadzie odpowiednik Grokbota od Mety, tylko bez opłat. Wysyła proaktywne podpowiedzi, podsuwa pomysły, co mógłby dla was zrobić, i pilnuje waszych celów — między innymi dlatego wskoczyło na pierwsze miejsce w App Store. Wygląda na to, że właśnie ten kierunek — większa proaktywność i płynniejsze doświadczenie — czeka teraz Grokbota.
Druga zmiana: szkice maili i wiadomości Slack osadzone bezpośrednio w rozmowie. Wpisuję w Grokbotcie prośbę o szkic maila do Emily z informacją, że Grokbot jest na Slacku — i dostaję go inline. To bardzo praktyczne: mogę na szybko poprawić treść i jednym kliknięciem wysłać, przy czym wysyłka idzie przez moją integrację pocztową, a potwierdzenie wraca do agenta.
Trzecia nowość: w Grokbotcie można tworzyć boty zespołowe i podpinać je do Slacka. W aplikacji, obok bota ogólnego, macie sekcję botów zespołowych — a przy moim podpięty jest Slack. Otwieram Slacka, w moich botach siedzi „agent native”. Piszę: „Hej, to ty jesteś Grokbot, tak?” — agent od razu czyta wiadomość i odpowiada: „Nie, jestem agent native — bot zespołowy agent native. Grokbot to twój osobny asystent”. Ciekawe, przecież stworzyłem go w Grokbotcie. Ale nie o tym chciałem. Pytam: „Jakie masz umiejętności, agent native?” — i dostaję pełną listę skonfigurowanych przeze mnie zdolności. Wystarczy wejść w „connect apps”: wszystkie moje wtyczki i umiejętności są tam podpięte, a bot zespołowy ma do nich dostęp. Bardzo fajne.
Ostatnia rzecz, dodana w zeszłym tygodniu — znajdziecie ją w ustawieniach, w sekcji „computer”: możliwość przepuszczania ruchu przez wasz komputer. Wyjaśniam, o co chodzi. Grokbot działa na małym wirtualnym komputerze w chmurze — widzicie go tutaj; potrafi surfować po sieci i klikać. Tyle że to maszyny w centrach danych, a strony takie jak Shopify czy Target potrafią blokować boty. Jeżeli agent korzysta z adresu IP takiej chmurowej maszyny, serwis go namierzy i nie wpuści. Po włączeniu opcji „route traffic through this computer” agent zaczyna korzystać z waszego sprzętu: jeśli komputer jest włączony, używa waszego adresu IP — i wygląda jak człowiek. To omija sporo ograniczeń, które spotykają bota wędrującego po internecie z wirtualnej maszyny, więc agent dostaje po prostu dostęp do większej liczby miejsc.
Bonus: nowy kanał — vlog
Tymi czterema punktami domykamy najważniejsze wydarzenia tygodnia od największych graczy: Anthropic, OpenAI, Google i Grokbota. Mam jeszcze jedną nowość — tym razem z mojego podwórka: nowy kanał na YouTube. Zakładam vloga. Wiem, że filmy na tym kanale są mocno oparte na scenariuszu — i świadomie tak robię, bo chcę, żeby wszystko, co dzieje się w AI, było maksymalnie przystępne. Tym kanałem edukuję. Nowy będzie czymś innym: mówię bez scenariusza, bardziej vlogowo. Czegoś się nauczę — nagrywam szybkie wideo, a mój automat AI montuje je, dociąga ujęcia ilustracyjne i od razu publikuje. Surowy styl, niewiele cięć. Będę też mnóstwo drukował w 3D: tam pokażę wszystkie swoje eksperymenty, to, co robię za kulisami, oraz wewnętrzne oprogramowanie, które buduję — dla tych, którzy chcą tworzyć narzędzia dla swoich firm. Niedługo ruszamy też z urządzeniami sprzętowymi. Właśnie kupiłem drukarkę 3D — chciałem, żeby Opus i Astra potrafiły tworzyć fizyczne obiekty, i jest świetnie. Czeka nas mnóstwo fajnych rzeczy. Jeśli chcecie nadążyć, link jest w opisie; możecie też poszukać sami — kanał nazywa się po prostu „Riley Brown 2”. Pierwszy film wrzuciłem kilka dni temu. Robienie ich sprawia mi ogromną frajdę — to zupełnie inny format niż ten, do którego jesteście przyzwyczajeni. I chyba bardziej „mój”. Zapraszam.