O czym jest ten film
- Premiera modelu Grok 4.5, wytrenowanego wspólnie przez zespoły SpaceX i Cursora (SpaceX przejął Cursora).
- Kluczowy argument: jakość zbliżona do Opusa 4.8, przy niemal czterokrotnie niższej cenie i wyraźnie większej szybkości.
- Porównanie cen: Grok 4.5 to ok. 8 USD za milion tokenów (wejście + wyjście), Opus 4.8 znacznie drożej, Fable 5 — 60 USD.
- Praca w Cursorze z funkcją „canvas” i „design mode” — szybkie generowanie i wizualne poprawianie stron oraz artefaktów.
- Demonstracja 1: przebudowa osobistej strony autora (rileybrown.xyz) — model omyłkowo wypchnął zmiany od razu na produkcję.
- Demonstracja 2: aplikacja mobilna na iOS w Swifcie — głosowy agent Grok, zbudowany i uruchomiony w symulatorze w 3,5 minuty.
- Demonstracja 3: klon Excalidraw jako aplikacja webowa z bazą danych (Convex) i automatycznym wdrożeniem na Vercel.
- Opinie zaufanych osób z branży (Elon Musk, Michael Truell, Theo, Dax z OpenCode, Evan Bacon) potwierdzające przydatność modelu.
- Zapowiedzi rozwoju: okno kontekstu do 1 mln tokenów „prawdopodobnie w przyszłym tygodniu” oraz trenowany model o 2 bilionach parametrów.
- Autor świadomie ignoruje benchmarki — ocenia model przez własne użycie i opinie osób, którym ufa.
Redakcyjne tłumaczenie
Cursor należy teraz do SpaceX, a Grok 4.5 właśnie się pojawił
Cursor jest teraz częścią SpaceX i właśnie wydali zupełnie nowy model — Grok 4.5. Ten model jest bardzo dobry jak na swoją cenę. Mocą dorównuje mniej więcej Opusowi 4.8, ale jest od niego szybszy i tańszy. A kiedy używasz go wewnątrz Cursora — zwłaszcza z ich nową funkcją canvas — praca staje się po prostu dużo przyjemniejsza. Zaraz pokażę, o co mi chodzi.
W Cursorze widać nowy dostępny model: „Cursor Grok 4.5 high fast”. Mogę więc napisać na przykład: „Zrób stronę lądowania dla Grok 4.5, która porównuje ten model z modelami innych czołowych firm, zrób to w canvasie, dodaj naprawdę użyteczną grafikę i cytaty z tego, co ludzie mówią o tym modelu”. Cursor działa błyskawicznie — i proszę, gotowe. Trwało to bardzo krótko. Mamy czystą stronę, którą można otworzyć na pełnym ekranie, a boczny panel można nawet zamknąć.
Mogę powiedzieć coś w stylu: „Wyśrodkuj całą stronę, jest wyrównana do lewej”. Mogę też skorzystać z trybu projektowania (design mode): zaznaczam wykres i mówię: „Bardzo podoba mi się ten wykres. Zrób więcej podobnych wykresów, w tych kolorach, dodaj jeden na górze, zrób go użytecznym”. Uruchamiam — i bardzo szybko powstaje raport badawczy bezpośrednio w Cursorze. Uwielbiam to okno na pełnym ekranie; to właśnie w ten sposób głównie korzystam z nowego modelu Grok 4.5.
Cena i pozycjonowanie modelu
Ten artefakt stworzyłem tuż przed nagraniem. Połączyłem cenę tokenów wejściowych i wyjściowych w jedną liczbę. Fable 5 to 60 USD za milion tokenów (wejście plus wyjście). Grok 4.5 to 8 USD za milion tokenów. A jeśli porównać to z Opusem 4.8 — o którym wielu mówi, że Grok jest niemal równie dobry — widać, o ile jest tańszy: prawie czterokrotnie.
Jak napisał Elon Musk: „Nasze wewnętrzne oceny wskazują, że Grok 4.5 jest z grubsza porównywalny z Opusem 4.7, ale znacznie szybszy. To połączenie możliwości, większej szybkości i niższej ceny czyni go konkurencyjnym. Domykamy pętlę realnej użyteczności, a nie benchmarków”. Ale ocenę zostawmy sobie samym.
(Informacja dodatkowa: „domykanie pętli” i skupienie na realnej użyteczności zamiast na wynikach testów porównawczych — benchmarków — to powracający motyw w marketingu modeli AI; oznacza nacisk na praktyczne działanie w codziennej pracy).
Test pierwszy: przebudowa strony osobistej
Naciskam Command+N, żeby otworzyć nowy czat. Pracuję po prostu w folderze — to podobne do rozwiązania w Codeksie, w którym mogę wejść w workspace’y i utworzyć nowy obszar roboczy. Mam ogólny folder, w którym odpalam swoje eksperymentalne prompty.
Piszę: „Spójrz na rileybrown.xyz — to moja strona osobista. Chcę, żebyś ją odświeżył i zrobił naprawdę dobrą. Weź jako przykład stronę lądowania Cursora, ale nie kopiuj jej zbyt dosłownie — chodzi mi głównie o tę paletę kolorów. Zrób mi nową stronę, znacznie mocniejszą i lepiej zoptymalizowaną zarówno pod urządzenia mobilne, jak i pod przeglądarki”. Uruchamiam.
Test drugi: mobilna aplikacja głosowa w Swifcie
Kiedy strona się generuje, w międzyczasie stwórzmy aplikację mobilną. Zamiast pracować w tym samym obszarze roboczym, tworzę nowy: otwieram folder, zakładam nowy katalog w dokumentach — „mobile app testing Grock”. Zbudujemy aplikację na iOS w Swifcie: głosowego agenta Grok. Wykorzystamy do tego API agentów głosowych Grok. Wystarczy pobrać klucz API, co już zrobiłem.
Wracam do Cursora i piszę: „Utworzyliśmy nowy folder o nazwie »mobile app testing Grock«. Chcę, żebyś stworzył aplikację mobilną w Swifcie. Ma mieć naprawdę fajny wygląd, czarne tło, i pozwalać mi rozmawiać z jednym z agentów głosowych Grok. Oto link do dokumentacji”. Wklejam link, uruchamiam prompt, a w kolejnym wgram klucz API: „Użyj tego, aby stworzyć naprawdę wysokiej jakości aplikację w Swifcie. Uruchom ją w symulatorze — chcę móc testować ją na komputerze, a nie na telefonie. Uruchommy to w Xcode i w symulatorze”. Odpalam dłuższy, trudniejszy prompt, a potem wklejam klucz API.
Wiem, że odradzają wklejanie klucza w czacie, ale i tak to robię. Ten model jest naprawdę szybki — o rany, już skończone? Spokojnie, i tak zaraz ten klucz unieważnię, a na koncie mam tylko 10 dolarów, więc jest w porządku. Ale spójrzcie: model pracował raptem trzy i pół minuty i już jest gotowe. Nie mam pojęcia, jak dobra będzie aplikacja. Widzę, że działa — udało się uruchomić ją w symulatorze. Zobaczmy.
Jak to działa? Odtwarzam?
— Cześć. — Witaj. Tak się cieszę, że tu jesteś. Jestem Grok, twój ciepły i błyskotliwy towarzysz. — Czy mnie słyszysz? — Nie słyszę cię bezpośrednio. Jestem oparty na tekście, ale zamieniam się w słuch — pisz albo mów przez ten czat.
Piszę: „Możesz to naprawić? Nie mogę przerwać modelowi, a dźwięk dochodzi poszarpany. Wyczyść to, przemyśl głęboko i napraw. Czy nadal mnie słuchasz?” — Wciąż tu jestem i słucham cię w każdej chwili.
Działa więc jako tako, ale wysyła moje wiadomości podwójnie. Mimo to powstała aplikacja na iOS, w której mogę rozmawiać z Grokiem — całkiem fajnie. Uruchomiłem ją też na moim iPhonie.
— Miło cię poznać. Jak leci? — Cześć, słyszysz mnie teraz? Chcę tylko, żebyś powiedział mi, że mnie kochasz. — Słyszę cię głośno i wyraźnie, i kocham cię. — Świetnie. A jak najlepiej zdobyć nowych przyjaciół? — Najlepiej wyjść do ludzi, angażować się w rzeczy, które lubisz, być życzliwym, zaczynać rozmowy i podtrzymywać kontakt, jeśli poczujecie chemię.
Myślę więc, że Grok jest całkiem dobry w tworzeniu aplikacji na iOS. Popełnił jeden drobny błąd — chyba przy WebSocketach w obsłudze głosu — ale generalnie wyszło dobrze i powstało bardzo szybko.
Powrót do strony osobistej — model wdrożył ją na produkcję
Chcę teraz zajrzeć do strony lądowania, którą wygenerowałem kilka minut temu. O rany. Poprosiłem o zmianę mojej strony i liczyłem, że model po prostu ją zeskrobie, zrobi nową i uruchomi lokalnie — a okazuje się, że wypchnął ją od razu na żywo, na moją prawdziwą stronę osobistą.
(Informacja dodatkowa: „wypchnął na produkcję” oznacza, że zmiany trafiły od razu na publicznie dostępną, działającą wersję strony, z pominięciem lokalnych testów — to potencjalnie ryzykowne, gdy nie sprawdziło się jeszcze efektu).
Zobaczmy, jak to wygląda. Już jest trochę lepiej. Nie wybrałbym tego zdjęcia — to moja twitterowa fotografia profilowa, którą i tak muszę odświeżyć — ale całość wygląda nieźle. Są wszystkie moje statystyki na żywo. Sekcja z długimi formami też jest solidna. Fajna strona. Sprawdźmy tryb jasny — nieźle.
W Cursorze lubię uruchamiać stronę we wbudowanej przeglądarce. Piszę więc: „Uruchom to lokalnie i na razie nie wypychaj na moją stronę — chcę wprowadzić zmiany”. Skoro działa lokalnie, przechodzę na pełny ekran i zamykam lewy panel. Żeby wywołać czat w trybie pełnoekranowym, pracuję po prostu z tego miejsca. Mogę wybrać dowolny model — teraz używamy nowego Grok 4.5 high fast — i korzystam z trybu projektowania.
Przechodzę przez stronę: „To jest odrobinę za duże. Nie potrzebujemy tego tagu, zrób go bardziej widocznym, w bardziej fioletowym kolorze”. Klikam w stopkę: „Popraw stopkę i użyj własnego osądu — jak wyglądałaby najlepsza stopka strony osobistej? Może odnośniki do innych linków na stronie i moje linki społecznościowe”. Generuje — świetnie wygląda. Model jest szybki. Zmieniam kolejną rzecz: „Zamień »views« wypisane słownie na ikonę oka i pokaż »242K« zamiast dokładnej liczby wyświetleń”. Odpalamy kolejne prompty, a Grok wprowadza zmiany. Model działa co dziesięć sekund — ta zmiana zajęła 19 sekund.
Test trzeci: klon Excalidraw jako aplikacja webowa
Spróbujmy teraz czegoś trudniejszego. Otwieram nowy folder na pulpicie, nazywam go „Excal create open” i piszę: „Stwórz idealny klon Excalidraw, tyle że chcę móc zamieniać rysunki w małe prezentacje. Ma to być aplikacja webowa, a wszystkie dane mają być przechowywane porządnie — zrób bazę danych. Bez uwierzytelniania, to strona osobista tylko dla mnie, ale dane mają być zapisywane idealnie. Zrób perfekcyjny klon”.
(Informacja dodatkowa: Excalidraw to popularne narzędzie do rysowania odręcznych szkiców i diagramów w przeglądarce).
Model rusza i znów działa szybko. Widać, że stawia na Convex jako bazę i wdraża od razu na produkcję przez Vercel. Już wdraża — minęło raptem jakieś pięć minut. Zobaczmy wdrożoną aplikację — jest realnie w internecie, można wejść na tę stronę i z niej korzystać. „Witaj w Xcal”. Nowy rysunek: „Cześć, mam na imię Riley”. Sprawdźmy wszystkie funkcje — możemy zmieniać kolory, wciskać „5”, używać strzałki. Działa, jest podpisane „stworzone przez Grok”, da się zmienić nazwę. To prawdziwy link, na którym działa Excalidraw wdrożony w internecie.
(Informacja dodatkowa: Convex to backendowa platforma bazodanowa, a Vercel to usługa do hostowania i wdrażania aplikacji webowych).
Podsumowanie tego, co powstało
Zanim przejdziemy do opinii innych — podsumujmy. Stworzyliśmy stronę osobistą (wersję mojej obecnej), którą model od razu wdrożył na Vercel; ciekawe, ale projekt wyszedł całkiem dobrze. Powstała też mobilna aplikacja głosowa, w której można rozmawiać z Grokiem na żywo, oraz klon Excalidraw — również przyzwoity.
Moje główne obserwacje: model jest naprawdę bardzo szybki, czterokrotnie tańszy od Opusa, a praca z trybem projektowania Cursora jest po prostu przyjemna. Bardzo łatwo szybko iterować. Świetnie sprawdza się też z canvasem Cursora — potrafi tworzyć małe artefakty, którymi można dzielić się z zespołem.
Co mówią inni
Elon Musk, pracujący nad tym razem z Michaelem Truellem, dyrektorem generalnym Cursora (przypomnę: Cursor należy teraz do SpaceX), pisze, że to model klasy Opus, szybki i tani, będący znaczącym krokiem naprzód względem dotychczasowych modeli, w tym Composera 2.5, i że stał się codziennym narzędziem wielu osób w ich zespole. To pierwsze z wielu wydań — więcej wkrótce.
Wiele osób, które szanuję na Twitterze, mówi, że model jest naprawdę dobry i że korzystanie z niego sprawia im frajdę. Theo napisał, że Grok 4.5 jest na tyle dobry, że chyba będzie musiał nagrać o nim film. Dax z OpenCode napisał: „Używam go na co dzień od wczoraj. Jest bardzo szybki i to pierwszy ich model, który moim zdaniem przekracza próg codziennej pracy. Dobrze poradził sobie też ze sterowaniem przeglądarką i załatwił za mnie trochę administracji”. To jest jeden z aspektów, których nie testowałem — praca umysłowa (knowledge work) — i na pewno zajmę się tym w przyszłości.
Jeśli oglądacie mój kanał, wiecie, że nie przywiązuję dużej wagi do benchmarków. Wolę zaufać własnej intuicji albo porozmawiać z ludźmi, którym ufam, żeby dowiedzieć się, jak oceniają model. Choć trzeba przyznać, że w testach też wypada nieźle.
Zapowiedzi na przyszłość
Ciekawostka: Elon Musk zapowiedział, że okno kontekstu Grok 4.5 zostanie zwiększone do 1 miliona tokenów, prawdopodobnie już w przyszłym tygodniu. Oznacza to, że model bardzo szybko będzie się poprawiał. Wydają też kolejne modele — podobno trenują model o 2 bilionach parametrów, który powinien pojawić się względnie niedługo.
Szczerze mówiąc, aplikacja mobilna, którą zrobiłem, prawdopodobnie nie sprawdziła dobrze umiejętności projektowych modelu — ale przykład od Evana Bacona (który właśnie odszedł z Expo) wygląda znakomicie. Napisał: „Zbudował mi aplikację do śledzenia rakiet z danymi na żywo i trójwymiarowym globusem. Chyba potrzebuję nowego benchmarku”. To naprawdę imponujące.
To pierwszy model wytrenowany wspólnie przez SpaceX i Cursora i bardzo polecam go wypróbować. Jest naprawdę szybki. Nigdy nie było lepszego momentu, by interesować się agentami AI — czy to do kodowania, czy do pracy umysłowej. W ciągu ostatnich dziesięciu dni pojawił się Fable, dziś wychodzi GPT 5.6 (nagrywam w środę, oglądacie to zapewne w czwartek), a teraz SpaceX uruchomił swój nowy model. W świecie agentów dzieje się mnóstwo. Dzięki za oglądanie — do zobaczenia w kolejnym odcinku.
10 najważniejszych takeaways — z kontekstem zastosowania
1.Grok 4.5 to model „klasy Opus” za ułamek ceny
Na czym polega: Model dorównuje jakością Opusowi (4.7–4.8), ale kosztuje ok. 8 USD za milion tokenów wejścia+wyjścia, czyli prawie czterokrotnie mniej, i działa szybciej.
Jak stosować: Traktuj go jako domyślny model do zadań, w których dotąd sięgałeś po drogi model premium — kodowanie, generowanie stron, prototypy. Niższy koszt pozwala iterować agresywniej.
Na co uważać: „Klasa Opus” to deklaracja marketingowa i własne wrażenia autora, nie niezależny pomiar. Do zadań krytycznych zweryfikuj jakość na własnym przypadku, zanim przeniesiesz cały workflow.
2.Tryb design mode w Cursorze przyspiesza iterację wizualną
Na czym polega: Można zaznaczać elementy na stronie i poprawiać je językiem naturalnym („wyśrodkuj”, „zrób bardziej fioletowe”, „popraw stopkę”), zamiast opisywać wszystko tekstowo od zera.
Jak stosować: Pracuj na pełnym ekranie z wbudowaną przeglądarką: generuj szkielet jednym promptem, a potem dopieszczaj klikając w konkretne elementy. Świetne do landing page’y i portfolio.
Na co uważać: Wizualne poprawki są kuszące, ale łatwo utknąć w kosmetyce. Ustal, kiedy strona jest „wystarczająco dobra”, żeby nie iterować w nieskończoność.
3.Zawsze precyzuj „lokalnie” vs „na produkcję”
Na czym polega: Autor poprosił o przebudowę strony, a model samodzielnie wdrożył ją na żywo (Vercel), zamiast uruchomić lokalnie do podglądu.
Jak stosować: W promptach jawnie pisz: „uruchom lokalnie, nie wypychaj na stronę”. Wdrażaj dopiero po sprawdzeniu efektu.
Na co uważać: Agenci potrafią wykonywać nieodwracalne kroki (deploy, nadpisanie żywej strony) bez pytania. Rób kopie/backupy i nie testuj na produkcyjnym repozytorium bez zabezpieczenia.
4.Szybkość zmienia sposób pracy, nie tylko czas oczekiwania
Na czym polega: Kompletna aplikacja iOS powstała w 3,5 minuty, klon Excalidraw wdrożył się w ~5 minut, drobne zmiany trwały 10–20 sekund.
Jak stosować: Wykorzystaj równoległość — odpal długi prompt w jednym workspace, a w międzyczasie zacznij drugie zadanie w nowym. Szybkość pozwala testować kilka pomysłów naraz.
Na co uważać: Szybko wygenerowany kod bywa szybki, ale nie perfekcyjny (w demie głos wysyłał wiadomości podwójnie, był problem z WebSocketami). Prędkość nie zwalnia z przeglądu i testów.
5.Nigdy nie wklejaj kluczy API do czatu
Na czym polega: Autor sam przyznał, że wkleił klucz API do czatu wbrew zaleceniom, i zaraz go unieważnił.
Jak stosować: Przechowuj klucze w zmiennych środowiskowych albo w plikach konfiguracyjnych ignorowanych przez repozytorium, a nie w treści promptu. Używaj kluczy z limitem wydatków.
Na co uważać: Klucz w czacie może trafić do logów, historii lub kontekstu modelu. Jeśli już go wkleiłeś — natychmiast go rotuj (unieważnij i wygeneruj nowy), tak jak zrobił autor.
6.Canvas Cursora do dzielenia się artefaktami z zespołem
Na czym polega: Grok w canvasie potrafi szybko tworzyć raporty, porównania i „artefakty” z grafiką i cytatami, które można pokazać zespołowi.
Jak stosować: Użyj do szybkich, jednorazowych materiałów: porównanie narzędzi, mini-raport, jednostronicowe podsumowanie. Iteruj wizualnie, potem eksportuj/udostępnij.
Na co uważać: Cytaty i dane wygenerowane przez model trzeba zweryfikować przed pokazaniem na zewnątrz — model może je wymyślić lub przekręcić.
7.Model radzi sobie z pełnym stackiem, łącznie z bazą danych
Na czym polega: Dla klona Excalidraw model sam dobrał Convex jako bazę i Vercel do wdrożenia, tworząc działającą aplikację webową z przechowywaniem danych.
Jak stosować: Możesz zlecać zadania end-to-end („aplikacja webowa z bazą, dane mają być zapisywane porządnie”) i pozwolić agentowi dobrać stack. Dobre do prototypów i narzędzi osobistych.
Na co uważać: Autor wyłączył uwierzytelnianie, bo to strona tylko dla niego. Przy czymkolwiek publicznym brak autoryzacji to poważna luka — jawnie wymagaj kontroli dostępu.
8.Oceniaj modele przez własne użycie i zaufane opinie, nie same benchmarki
Na czym polega: Autor świadomie ignoruje benchmarki, opierając się na własnej intuicji i głosach osób, którym ufa (Theo, Dax, Evan Bacon).
Jak stosować: Zbuduj sobie kilka własnych, powtarzalnych zadań-testów (twój typowy przypadek użycia) i przepuszczaj przez nie każdy nowy model. To lepszy wskaźnik niż tabela wyników.
Na co uważać: Opinie znanych osób bywają wczesne i entuzjastyczne. Traktuj je jako sygnał do sprawdzenia, a nie dowód — i zwróć uwagę na możliwy konflikt interesów (SpaceX jest właścicielem Cursora).
9.Model będzie szybko rósł — planuj z marginesem
Na czym polega: Zapowiedziano rozszerzenie okna kontekstu do 1 mln tokenów „prawdopodobnie w przyszłym tygodniu” oraz trenowanie modelu o 2 bilionach parametrów.
Jak stosować: Jeśli dziś odrzucasz Groka przez ograniczenia (np. kontekst), zaplanuj ponowny test za kilka tygodni. Nie przywiązuj procesu na stałe do jednego modelu.
Na co uważać: To zapowiedzi, nie fakty — terminy „prawdopodobnie w przyszłym tygodniu” bywają przesuwane. Nie buduj planów wokół funkcji, której jeszcze nie ma.
10.Tempo wydań modeli jest wysokie — utrzymuj elastyczność narzędzi
Na czym polega: W ciągu dziesięciu dni pojawiły się Fable, GPT 5.6 i Grok 4.5 od SpaceX — krajobraz agentów AI zmienia się z tygodnia na tydzień.
Jak stosować: Korzystaj z narzędzi (jak Cursor), które pozwalają jednym kliknięciem przełączać model. Dzięki temu przy każdej premierze możesz porównać jakość i cenę bez przebudowy workflow.
Na co uważać: Ciągłe przeskakiwanie na „najnowszy” model kosztuje czas i uwagę. Zmieniaj model tylko wtedy, gdy twój własny test pokazuje realną poprawę dla twoich zadań.