O czym jest ten film
- Autor zestawia trzy modele Anthropic — Sonnet 5.5, Opus 5.5 i Fable 5.1 — w Claude Code, na jednym, identycznym prompcie.
- Zadanie testowe: kompletna, dopracowana gra w minigolfa 3D działająca w przeglądarce — dziewięć dołków, dwa z animowanym wiatraczkiem, jeden z dinozaurem, a siedem agent musi wymyślić samodzielnie.
- Dodatkowe wymagania: animacje otoczenia (wodospady, kołyszące się rośliny, stworzonka, pochodnie, zębatki), kreskówkowy styl wizualny, dźwięk i jasna definicja „gotowe”.
- Benchmarki dawały Sonnetowi 5.5 wyniki bliskie Opusowi 5.5 w kodowaniu agentowym — autor sprawdza, czy potwierdza to realny projekt.
- Istotny szczegół konfiguracji: Anthropic sam odradza tryb Max Mode dla Sonneta 5.5, bo obniża on jakość rezultatów.
- Wyniki: Fable — 1 h 40 min i ok. 51 USD; Opus — 1 h 26 min i ok. 27 USD; Sonnet — 1 h 20 min i ok. 26 USD.
- Jakość: Fale zbudował grę najbardziej dopracowaną (pełne kolizje z wiatraczkiem i ogonem dinozaura), Opus bardzo dobrą z jednym drobiazgiem, Sonnet — z błędami strukturalnymi (brak kolizji, zablokowany dołek, wyjście poza mapę).
- Tylko Sonnet dodał muzykę w tle, ale całościowo wypadł najsłabiej z całej trójki.
- Wniosek autora: przy niemal identycznej cenie i czasie Opus 5.5 jest jednoznacznie lepszym wyborem; Sonnet wymagałby znacznie więcej poprawek, by go dogonić.
- Materiał promuje też społeczność Agentic Labs z kursem agentowego kodowania i cotygodniowymi spotkaniami na żywo.
10 najważniejszych takeaways — z kontekstem zastosowania
1.Benchmarki traktuj jako wskazówkę, nie werdykt
Na czym polega: W testach referencyjnych Sonnet 5.5 wypada niemal tak samo jak Opus 5.5, zwłaszcza w zadaniach agentowych — a w praktyce, na otwartym projekcie, różnica jakości okazuje się wyraźna.
Jak stosować: Zanim wybierzesz model na stałe, przepuść przez niego własne, reprezentatywne zadanie i porównaj efekt, czas oraz koszt całej sesji — nie pojedynczych odpowiedzi.
Na co uważać: Wyniki reklamowane przez producentów nie muszą pokrywać się z Twoim typem zadań; otwarte, twórcze projekty są zwykle trudniejsze niż standardowe testy.
2.Sonnet 5.5 źle znosi maksymalne tryby pracy
Na czym polega: Sam Anthropic odradza łączenie Sonneta 5.5 z trybem Max Mode. Model zaczyna wtedy pracować zbyt długo, robić więcej, niż wymagało zadanie, a w końcu sam sobie wmawiać rzeczy niezgodne z rzeczywistością.
Jak stosować: Przy Sonnecie trzymaj się zalecanych ustawień wysiłku rozumowania i pilnuj, by sesja nie rozrastała się bez potrzeby; przerywaj, gdy agent zaczyna zapętlać się w zbędnej pracy.
Na co uważać: Wyższy poziom „wysiłku” nie zawsze oznacza lepszy wynik — przy niektórych modelach działa dokładnie odwrotnie.
3.Cena za token to nie koszt projektu
Na czym polega: Sonnet jest w cenniku około dwa razy tańszy od Opusa 5.5, ale koszt całej sesji wyszedł niemal identyczny: ok. 26 USD wobec 27 USD.
Jak stosować: Porównuj modele po pełnym koszcie wykonania zadania — tokeny na wejściu i wyjściu, liczba kroków, poprawki — a nie po stawce za milion tokenów.
Na co uważać: Tańszy model może potrzebować więcej iteracji, co zjada przewagę cenową i dodatkowo obniża jakość efektu końcowego.
4.Sonnet błyszczy przy precyzyjnych instrukcjach
Na czym polega: Autor wprost zastrzega, że Sonnet daje świetne wyniki przy dokładnych specyfikacjach; otwarty prompt z dużą swobodą twórczą to jego słabszy scenariusz.
Jak stosować: Jeśli pracujesz z tańszym modelem, rozpisz zadanie szczegółowo: wymagania, struktura, ograniczenia i definicja „gotowe”.
Na co uważać: Tam, gdzie agent ma sam projektować i decydować (np. wymyślać poziomy w grze), precyzja promptu nie zastąpi inteligencji modelu.
5.Kreatywne projektowanie zostaw mocniejszemu modelowi
Na czym polega: Siedem z dziewięciu dołków w teście pozostawiono pomysłowości agenta — i to rozdzieliło modele wyraźniej niż wszystkie elementy z góry określone.
Jak stosować: Zadania otwarte (architektura, projektowanie, pomysłowość) kieruj do najmocniejszego modelu, jakim dysponujesz; zadania sparametryzowane i szablonowe — do tańszych wariantów.
Na co uważać: Za kreatywność topowych modeli płaci się realnie — Fable kosztował w tym teście 51 USD, dwukrotność Opusa.
6.Rozróżniaj błędy kosmetyczne i strukturalne
Na czym polega: Opus i Sonnet popełniły ten sam drobiazg (kijek jadący za piłką), ale tylko Sonnet miał błędy systemowe: piłka przenikała przez wiatrak, dołek był zablokowany, dało się wypaść poza mapę.
Jak stosować: Po sesji agenta posegreguj znalezione błędy: kosmetyczne naprawiaj jednym promptem; strukturalne (fizyka, kolizje, logika) traktuj jako sygnał do powtórzenia sesji z mocniejszym modelem.
Na co uważać: Liczba błędów mówi mniej niż ich rodzaj — pięć drobiazgów bywa tańszych w naprawie niż jedna wadliwa kolizja.
7.Do jakości lidera dochodzi się iteracjami
Na czym polega: Ocena autora: Opusa można jednym–dwoma dodatkowymi promptami doprowadzić do poziomu Fable, natomiast Sonnet wymagałby znacznie większego nakładu pracy, by dorównać samemu Opusowi.
Jak stosować: Wybieraj model, którego dystans do oczekiwanego efektu jest najmniejszy — opłaca się dopłacać poprawkami, a nie przebudową.
Na co uważać: Każda iteracja to czas i tokeny; uwzględnij je w łącznym rachunku, zanim uznasz model za „tani”.
8.Kompletny produkt w jednej sesji to dziś standard
Na czym polega: Wszystkie trzy modele zbudowały w pojedynczej sesji grywalną grę: menu, instrukcja, wybór dołków, fizyka, dźwięk, animacje tła, opcje graficzne.
Jak stosować: Planując prototyp (grę, narzędzie, demo), możesz zakładać, że jedna dobrze napisana sesja agenta wystarczy do wersji do pokazania; pamiętaj tylko, by prompt zawierał definicję „gotowe”.
Na co uważać: „Kompletny” nie znaczy „bez błędów” — zarezerwuj czas na testy i poprawki po pierwszym przebiegu.
9.Mierz jakość, czas i koszt razem
Na czym polega: Wyniki: Fable — 1 h 40 min / 51 USD / najwyższa jakość; Opus — 1 h 26 min / 27 USD / bardzo dobra; Sonnet — 1 h 20 min / 26 USD / najsłabsza. Czas i koszt niemal zrównują Opusa z Sonnetem, więc o wyborze przesądza jakość.
Jak stosować: Prowadź własne, proste zestawienia po każdej sesji — statystyki użycia w Claude Code pokazują i czas, i koszt — i porównuj modele według stosunku jakości do łącznych wydatków.
Na co uważać: Różnica kilku procent w cenie lub czasie bywa pomijalna przy dużej różnicy jakości; nie pozwól, by sam cennik decydował za wynik.
10.Remis cenowy rozstrzygaj na rzecz inteligencji modelu
Na czym polega: Gdy dwa modele kosztują w praktyce tyle samo i pracują porównywalnie długo — jak Opus i Sonnet w tym teście — autor bez wahania wybiera inteligentniejszego Opusa 5.5.
Jak stosować: Jeśli budżet sesji nie przynosi oszczędności, sięgnij po model o wyższych możliwościach: mniej błędów u źródła to mniej poprawek później.
Na co uważać: Wniosek dotyczy zadań otwartych i złożonych; przy prostych, dokładnie opisanych zadaniach tańszy model nadal może być uzasadniony.
Redakcyjne tłumaczenie
Benchmarki kontra prawdziwy projekt
Spędziłem dziś kilka godzin z Sonnetem 5.5 i muszę przyznać, że robi wrażenie. Z danych pomiarowych wynika, że Sonnet 5.5 osiąga wyniki niemal identyczne jak Opus 5.5, zwłaszcza tam, gdzie kod pisze agent. Do tego Sonnet wycenia się na mniej więcej połowę stawki Opusa 5.5 i jest około pięciokrotnie tańszy od Fable.
Problem w tym, że benchmarki potrafią pokazywać jedno, a w prawdziwym projekcie liczy się co innego. Dlatego w tym materiale zestawię efekty pracy Sonneta 5.5, Opusa 5.5 i Fable 5.1 na dokładnie tym samym poleceniu. Potem ocenimy jakość, czas wykonania i koszt każdej z tych wersji.
(Informacja dodatkowa: Fable to najmocniejszy — i najdroższy — model Anthropic w tym zestawieniu; praca z nim kosztuje wielokrotnie więcej niż z pozostałymi.)
Konfiguracja testu i ostrzeżenie o trybie Max Mode
Zacznijmy od Fable, bo to idealny punkt odniesienia dla reszty. Wybieram Fable 5.1 i będę uruchamiał wszystkie modele z najwyższym poziomem rozumowania.
I tu od razu ważna uwaga: sam Anthropic odradza używanie trybu Max Mode z Sonnetem 5.5. Ten tryb obniża jakość rezultatów — moje wytłumaczenie jest takie, że model przy nim po prostu pracuje zbyt długo, zaczyna robić więcej, niż wymagało zadanie, a w końcu sam sobie wmawia rzeczy niezgodne z rzeczywistością.
(Informacja dodatkowa: Max Mode to podwyższony tryb pracy w Claude Code, zwiększający wysiłek modelu i zużycie tokenów — co innego niż standardowy suwak poziomu rozumowania.)
Prompt: pełnoprawna gra w minigolfa 3D
Samo zadanie brzmi tak: „Zbuduj kompletną, dopracowaną trójwymiarową przygodową grę w minigolfa, działającą w przeglądarce”. Dorzucam trochę szczegółów o technologii i mechanice rozgrywki. Ma być dziewięć dołków; na co najmniej dwóch z nich animowany wiatraczek, a na jednym z dołków — poruszający się dinozaur. Pozostałe siedem dołków agent ma wymyślić samodzielnie. Właśnie to chcę sprawdzić: jak te modele rozumują i ile w nich naprawdę kreatywności.
Każdy dołek ma być wypełniony rekwizytami i animacjami tła, żeby świat żył: wodospady, kołyszące się rośliny, drobne stworzonka, migoczące pochodnie, obracające się zębatki i tak dalej. Styl wizualny: kreskówkowy, kolorowy, oparty na stylizowanych shaderach. Gra ma mieć też dźwięk. Na koniec krótko wyjaśniam, co w tym zadaniu znaczy „gotowe”.
(Informacja dodatkowa: cel shading, który przewija się przez opisy efektów, to technika nadająca grafice 3D wygląd rysunkowej animacji — płaskie plamy koloru i wyraźne kontury.)
Chcesz powtórzyć ten test u siebie? Prompt do pobrania znajdziesz w darmowej społeczności.
Trzy równoległe sesje
Wysyłam zlecenie Fable’owi. Dopóki pracuje, otwieram osobny katalog dla Opusa: wybieram Opus 5.5, również z najwyższym poziomem rozumowania, wklejam identyczne polecenie i ruszam. Na koniec to samo z Sonnetem: ten sam prompt, model Sonnet 5.5. Jeśli Sonnet nie pojawia się na Twojej liście, zaktualizuj Claude Code — wersję terminalową albo aplikację biurkową — a model od razu będzie widoczny. Ustawiam wysiłek rozumowania na maksimum i wysyłam.
Dla uczciwości dodam: Sonnet potrafi być znakomity, jeśli dostanie bardzo precyzyjne instrukcje. Otwarte polecenie, takie jak to, może mu sprawić trudność — i to jest w porządku, bo celowo sprawdzamy, gdzie leżą granice tego modelu.
Teraz czekamy, aż agenci skończą. Potem obejrzymy gry, porównamy koszty i czas wykonania każdej z nich.
Agentic Labs
Jeśli chcesz wynieść swoje umiejętności w agentowym kodowaniu na wyższy poziom, rozważ dołączenie do mojej społeczności Agentic Labs. Członkostwo otwiera dostęp do kilku modułów mojego masterclassu: od podstaw pracy z agentami kodującymi, przez budowanie systemów projektowych, po projekty do samodzielnego powtórzenia. Co tydzień spotykamy się na żywo — we wtorki luźno przy kawie, a w czwartki na sesjach pogłębionych; w tym tygodniu naszym gościem jest Jev z TypeSafe AI. Wszystkie te sesje są nagrywane, więc zawsze możesz do nich wrócić. Link znajdziesz w opisie filmu. Do zobaczenia!
Stan gry po pół godzinie
Mija około trzydziestu minut, więc zerkam, jak radzi sobie każdy z trójki. Fable wciąż pracuje — w przeglądarce jeszcze nic nie widać. Opus też jest w trakcie i u niego również pustko. Sonnet jako jedyny pokazuje już zrzut ekranu — coś działa w przeglądarce. Wszyscy trzej robią postępy; wygląda na to, że Sonnet jest na prowadzeniu. Ale dzięki magii montażu zobaczycie wszystkie trzy wyniki za trzy, dwa, jeden…
Fable 5.1: godzina 40 minut, około 51 dolarów
Wszyscy trzej skończyli, więc oglądamy wyniki — i do każdej gry sprawdzamy statystyki użycia. Fable potrzebował około godziny i czterdziestu minut, a sesja kosztowała około 51 dolarów.
Co z tego wyszło? Już menu robi świetne wrażenie: tło, grafika — wszystko w tym kreskówkowym, rysunkowym stylu. Są efekty dźwiękowe; zostawiam je włączone, tylko ściszam, żeby nie rozpraszały. Grafikę ustawiam na „wysoką”. W grze jest instrukcja, można wybrać dołek i zaczynamy.
Animacje wyglądają naprawdę dobrze, a w świecie roi się od drobiazgów: trawa kołysze się na wietrze, latają motyle, skaczą króliczki. Ale najważniejsze, czy da się grać. Fizyka piłki też wygląda solidnie — o mało nie wpadła. I proszę: wchodzi. Wszystko działa, wygląda pięknie, więc czas na wymagania specjalne: dołki z wiatraczkiem i dinozaurem.
Wchodzimy na mapę z wiatraczkiem i animacje są znakomite. Wiatraczek stoi, gdzie powinien — spróbujmy przepuścić piłkę między jego płatami. Kolizja działa, konstrukcja faktycznie zatrzymuje piłkę. Ja w te gry gram beznadziejnie, więc jeszcze jedna próba… i jesteśmy po drugiej stronie.
Teraz dinozaur — „Dolina Dinozaura”. No dobrze: dinozaur jest na miejscu i najwyraźniej będzie sporą przeszkodą. Spróbujmy. Ogon ledwie nie strącił piłki. A co się stanie, jeśli walniemy w jego jajo? Nic. Szkoda — gdyby się wykluło, byłoby zabawnie. Ale całość jest po prostu świetnie zrobiona.
Jeśli chcesz zagrać w te gry, linkuję je razem z kodem źródłowym w darmowej społeczności. Szczerze mówiąc: Fable wykonał kawał naprawdę dobrej roboty.
Opus 5.5: godzina 26 minut, około 27 dolarów
Opus 5.5 potrzebował około godziny dwudziestu sześciu minut, a koszt wyszedł około 27 dolarów — prawie połowa tego, co zapłaciliśmy za Fable. Zobaczmy jednak samą grę.
Menu wygląda świetnie, jest instrukcja, wybór dołka, opcje graficzne i dźwięk. Startujemy pierwszy dołek. Grafika robi wrażenie — ten sam kreskówkowy, rysunkowy styl — a detali nie brakuje: trawa, króliczki, motyle. Fizyka działa, choć zauważam, że kijek podróżuje razem z piłką, co nie do końca jest poprawne. Zgaduję jednak, że Opus naprawi to jednym dodatkowym poleceniem.
Sprawdzamy mapy specjalne. Wiatraczek: animacje super, tym razem udaje się przejść za pierwszym podejściem. Fizyka piłki działa znakomicie. Udało się? O mało. No to wchodzimy.
I oczywiście dinozaur — „Jurajska Dżungla”. Wygląda kapitalnie, więc sprawdzamy, czy da się obok niego przejść. Czy ogon w ogóle ma fizyczną kolizję? Ma. I proszę: dinozaur właśnie skierował piłkę prosto do wody. No brawo. Serio.
To naprawdę udane wykonanie: wszystko działa, grafika jest fajna, fizyka — dokładna. Jestem pod ogromnym wrażeniem. Zerkam, jakie jeszcze są mapy — różnorodność potrafi zdumiewać. Nie mam nawet pewności, czy tę mapę da się w ogóle ukończyć, ale spróbuję. No proszę.
Dajcie znać w komentarzach, która wersja gry podoba Wam się najbardziej.
Sonnet 5.5: godzina 20 minut, około 26 dolarów
Czas na rozstrzygnięcie: Sonnet 5.5. Sprawdźmy, czy deklaracje Anthropic się bronią.
Sonnet potrzebował około godziny dwudziestu minut — niemal tyle samo co Opus 5.5. Sesja kosztowała około 26 dolarów, czyli o zaledwie dolara mniej niż przy wyraźnie inteligentniejszym Opusie. Ani zysku na czasie, ani na kosztach — a więc wszystko rozstrzygnie jakość samej gry.
Menu wygląda dobrze, grafika zdradza shadery, dźwięk jest, jest instrukcja i wybór dołków — bardzo podobnie do pozostałych. Gramy pierwszy dołek. Animacje są trochę koślawe. Słyszę też muzykę — to jedyny model, który obok efektów dźwiękowych dorzucił ścieżkę muzyczną. Wyłączam ją, bo mocno rozprasza.
Najpierw fizyka: przy uderzeniu kijek znów podąża za piłką — dokładnie ten sam błąd, co u Opusa. Zapewne łatwy do naprawienia, ale ciekawostka. Czy piłkę da się w ogóle wbić do dołka? Próbujemy… O matko. Jeszcze raz, proszę. I wchodzi. Podstawy działają.
Dołek z wiatraczkiem: piłka przenika przez konstrukcję — brak kolizji, wyraźny błąd. Zobaczmy, czy da się przez niego przejść i czy jakakolwiek kolizja istnieje. Poza tym, żeby piłka w ogóle ruszyła z miejsca, trzeba uderzyć naprawdę mocno — animacje wymagają dopracowania. No i dinozaur: chyba najbardziej koślawy dinozaur, jakiego w życiu widziałem. Do tego dołek jest zablokowany i nie widać, jak się przez niego przedostać. Walę piłkę z pełnej siły… i jesteśmy za dinozaurem. Kolizje działać działają — tyle że wypadliśmy poza mapę.
Werdykt: przy tej samej cenie wybieram Opusa
I co Wy na to, która wersja jest najlepsza? Szczerze — spodziewałem się, że Sonnet będzie wyraźnie tańszy i szybszy. Tymczasem kosztował tyle samo co Opus 5.5, a jakość, bądźmy szczerzy, nie sięga tego samego poziomu. Zdecydowanie wolę Opusa 5.5. Rzecz w tym, że Opus też popełnił błędy, ale jeden–dwa dodatkowe prompty powinny doprowadzić go do poziomu Fable. Sonnet, żeby dorównać samemu Opusowi, wymagałby znacznie większej pracy. Skoro cena i czas są te same, po prostu wybieram Opusa.
Jeśli materiał Wam się podobał, zostawcie łapkę w górę i zasubskrybujcie kanał — czeka Was więcej poradników o agentowym kodowaniu. Do zobaczenia w następnym!