O czym jest ten film
- Anthropic wydaje Claude’a Opusa 5.5 — o ok. 20% tańszego od Opusa 5 i ok. 60% tańszego od Fable 5.1 (4/20 dolarów za milion tokenów wejścia/wyjścia wobec 10/50 dolarów u konkurenta).
- Główna teza: o modelu nie rozstrzyga cena tokenów, lecz koszt całego zadania — ile tokenów, prób i poprawek pochłania, zanim praca jest naprawdę skończona.
- Autorski test: logo z czapką beanie zamienione w model LEGO — 514 elementów, 63-stronicowa instrukcja, lista części i pliki weryfikacyjne. Całość: 89 mln tokenów, czyli ok. 1% tygodniowego limitu subskrypcji (ok. 50 centów).
- Anthropic deklaruje ok. 40% niższy koszt typowych zadań niż na Opusie 5; podobne oszczędności opisują GitHub, Lovable, Spotify i pojedynczy użytkownicy na X.
- Wersja 5.5 to w dużej mierze odpowiedź na falę krytyki za sterowność i pisanie po modelach 4.7, 4.8 i Fable — skargi trafiały publicznie, m.in. od Brama Cohena i w trackerze GitHuba Anthropic.
- Klucz do poprawek wizualnych: scena generowana z kodu (np. w Three.js), dzięki czemu można rozmową zmieniać pojedyncze obiekty i rozwijać tę samą scenę, zamiast zaczynać od zera.
- Zadania nocne (18 godzin bez nadzoru) wypadają dobrze pod warunkiem jasnego warunku stopu i definicji „gotowe” — inaczej model rozpędza się i pali tokeny.
- AI buduje AI: według Anthropic Claude od maja jest autorem ponad 80% kodu scalanego w bazie firmy; odstęp między dużymi premierami skurczył się do ok. 18 dni.
- Praktyczny rdzeń materiału: jak powtórzyć własne zadanie na nowym modelu (te same pliki, prompt i punkt startu) i policzyć rzeczywisty koszt oraz udział w limicie subskrypcji.
- Szerszy kontekst: zbliżające się debiuty giełdowe OpenAI i Anthropic — pytanie o to, czy laboratoria dostarczają wartości efektywnej kosztowo i czy słuchają płacących użytkowników.
10 najważniejszych takeaways — z kontekstem zastosowania
1.Liczy się koszt całego zadania, nie stawka za milion tokenów
Na czym polega: Realna cena pracy z modelem to tokeny razy liczba podejść — ile razy czyta pliki, ile prób zajmuje mu zmiana, ile razy musisz tłumaczyć to samo od nowa. Model o wyższych stawkach, który trafia za pierwszym razem, często wychodzi taniej.
Jak stosować: Przy każdej premierze powtórz zadanie, które już kiedyś wykonywałeś — te same pliki, ten sam prompt, ten sam punkt startu — i zapisz sumaryczne zużycie oraz liczbę własnych interwencji.
Na co uważać: Efektowne przykłady z mediów społecznościowych nie przenoszą się na twoje obciążenia; modele bywają bardzo nierównomiernie uzdolnione w zależności od dziedziny.
2.„O 40% taniej” nie znaczy „o 40% mniej tokenów”
Na czym polega: Łączna oszczędność składa się z dwóch elementów: niższych stawek i mniejszego zużycia. Tokeny wejściowe, wyjściowe i kontekstowe wyceniane są osobno, więc jedna zbiorcza liczba nic nie mówi o strukturze kosztu.
Jak stosować: Przeglądaj raport zużycia w podziale na kategorie (wejście, wyjście, kontekst) i przeliczaj go na rachunek API albo na procent tygodniowego limitu subskrypcji.
Na co uważać: Deklaracje producenta dotyczą „typowych” obciążeń — twoje zadania mogą wypaść zupełnie inaczej.
3.Nie kończ pomiaru na pierwszym ładnym kadrze
Na czym polega: Zrzut ekranu albo krótkie wideo to dopiero punkt pośredni. Koszt trzeba rozliczyć po całym pakiecie: plik końcowy, weryfikacja, dokumentacja, poprawki.
Jak stosować: Przed startem zapisz, co dokładnie składa się na stan „gotowe” (np. model, lista części, instrukcja, plik kontrolny), i dopiero po jego osiągnięciu podsumuj zużycie.
Na co uważać: Przy złożonych zadaniach pomiar ucięty po pierwszym sukcesie systematycznie zaniża koszt — a to właśnie iteracje zjadają budżet.
4.Daj modelowi definicję „gotowe” i warunek stopu
Na czym polega: Opus 5.5 ma ogromną wytrwałość i sam się rozpędza. Bez wyraźnego kresu potrafi ciągnąć zadanie godzinami, doskonaląc wynik ponad rzeczywiste potrzeby.
Jak stosować: W poleceniu określ zakres i kryteria ukończenia: ile elementów, jaka złożoność, co ma zostać sprawdzone na końcu. Przy pracy zostawianej na noc to warunek konieczny.
Na co uważać: Ogólnikowe „zrób to dobrze” zostawia modelowi pole do samodzielnych decyzji — i do palenia tokenów.
5.Sterowność to konkretna oszczędność: poprawka za pierwszym razem
Na czym polega: W poprzednich wersjach wytyczne tekstowe bywały „potwierdzane”, a potem ignorowane; każdy taki przypadek oznacza dodatkowe podejścia i tłumaczenie tego samego.
Jak stosować: Testuj precyzyjne, częściowe polecenia typu „zostaw ten wątek, ale uprość tamten fragment” i sprawdzaj, czy odpowiedź wraca bez rozmontowywania sensu całości.
Na co uważać: Poprawka może brzmieć gładko, a jednocześnie usunąć niepewność albo stanowczość, którą świadomie chciałeś zachować — zawsze czytaj wynik pod tym kątem.
6.Kod jako medium pracy graficznej
Na czym polega: Modele Anthropic świetnie posługują się narzędziami typu Three.js; scena opisana kodem pozwala zmieniać pojedyncze obiekty, materiały czy kamerę, zamiast budować wszystko od zera.
Jak stosować: Zamawiaj grafikę i animacje jako projekty generowane z kodu — wtedy iterujesz tę samą scenę („czapka wyższa, okulary bez zmian”) jednym zdaniem.
Na co uważać: Bardzo rozbudowane sceny, na przykład całe miasto, pochłoną wielokrotnie więcej tokenów niż mały projekt — koszt rośnie wraz ze złożonością, niezależnie od wydajności modelu.
7.Weryfikuj deklaracje producenta własnym testem
Na czym polega: Case’y GitHuba, Lovable i Spotify potwierdzają oszczędności, ale to relacje zestawu klientów wybranego przez Anthropic.
Jak stosować: Zbuduj stały zestaw zadań na własnych plikach i uruchamiaj go przy każdym wydaniu — to jedyny uczciwy punkt odniesienia.
Na co uważać: Pojedynczy udany wynik, nawet spektakularny jak pięćsetelementowa konstrukcja z klocków, nie przesądza o przewadze w twojej domenie.
8.Prowadź też rejestr porażek
Na czym polega: Notowanie momentów „to wydanie mi nie zagrało” pokazuje, jak często narzędzie bywa używalne — a to lepsza miara niż pojedyncze sukcesy.
Jak stosować: Zapisuj model, zadanie, wynik, koszt i liczbę interwencji; po kilku premierach zobaczysz, które klasy zadań realnie tanieją.
Na co uważać: Selekcja samych udanych przykładów prowadzi do błędnych decyzji przy wyborze narzędzia.
9.Wynik testu może zmienić układ twojej pracy
Na czym polega: Autor, zobaczywszy wizualny smak Opusa 5.5, przeniósł do niego około dziewięćdziesięcioelementowe zadanie projektowe — załatwione jednym promptem, bez naruszenia tygodniowego budżetu.
Jak stosować: Gdy benchmark pokaże wyraźną przewagę modelu w konkretnej dziedzinie, przenieś do niego tę klasę zadań, a resztę zostaw dotychczasowym narzędziom.
Na co uważać: Przestawianie przepływu pracy „na wrażenie”, bez pomiaru, szybko się mści przy dłuższych projektach.
10.Głos użytkowników realnie wraca w modelach
Na czym polega: Krytyka sterowności po wersjach 4.7, 4.8 i Fable została w zapowiedzi 5.5 wprost nazwana jedną z głównych rzeczy do naprawy. Laboratoria przyspieszają m.in. dzięki własnym modelom — Claude autorsuje ponad 80% kodu scalanego w bazie Anthropic.
Jak stosować: Zgłaszaj problemy publicznie i głosuj portfelem: wybór modelu do kolejnego zadania to sygnał, który laboratoria odbierają.
Na co uważać: Nie każda skarga trafia do poprawek — po każdej premierze sprawdź, czy faktycznie naprawiono twoje konkretne problemy.
Redakcyjne tłumaczenie
Model, któremu chce się zlecać coraz więcej
Opus 5.5 sprawia, że mam ochotę powierzać Claude’owi więcej pracy. Teksty w tej wersji o wiele łatwiej kierować tam, gdzie chcę, a trójwymiarowe projekty, które tworzy Opus, robią ogromne wrażenie — pokażę to za chwilę. Przy okazji zacząłem zwracać baczną uwagę na coś, w czym ten model błyszczy: ile tokenów potrzebuje, żeby doprowadzić zadanie do końca. Widać tu ogromny postęp, zwłaszcza w pracy z grafiką.
Opus 5.5 zamienił logo z moją czapką beanie w model LEGO złożony z 514 elementów. Mój abonament wychodzi mniej więcej 50 dolarów tygodniowo, a to zadanie pochłonęło około 1% tygodniowego limitu — czyli w praktyce 50 centów z tego, co realnie płacę. W tym materiale pokażę wyliczenia, całą robotę w tle i przykładową konstrukcję, bo ma być i pożytecznie, i zabawnie. Najważniejsze jednak pokażę, jak samodzielnie sprawdzić, czy podobny zysk dotyczy również twoich zadań.
Czego naprawdę płacisz, gdy korzystasz z modelu
Zastanów się, za co właściwie płacisz. Jest stawka za tokeny — porcje informacji, które model przetwarza i generuje. Ale ile razy musi odczytać pliki, żeby wykonać pracę? Ile prób zajmuje mu zmiana, na której ci zależy? Ile razy musisz tłumaczyć to samo od nowa? To wszystko składa się na realny koszt wykonania zadania. Jeśli model działa oszczędnie, cena całej roboty może spaść bardzo mocno.
Rozumiem, że szybko robi się tu ślisko. Twoje zadania to nie moje zadania — możesz spędzić cały dzień z dokładnie tym samym modelem i skończyć z zupełnie innym wynikiem, bo zlecasz mu inną pracę. Do tego modele bywają „szczytowe”: w jednej dziedzinie znakomite, w sąsiedniej słabsze. Właśnie to chcę rozgryźć w kontekście 5.5 — jak obliczyć, ile zysk z efektywności jest wart akurat dla ciebie.
Logo w klockach: 514 elementów i 89 milionów tokenów
Spójrzcie: to moje logo w wersji LEGO. Czapka, okulary, przezroczysta kolumna, na której spoczywają okulary i czapka, wszystko na porządnej podstawie. Lubię LEGO i noszę beanie, więc oczywiście o taki projekt mi chodziło. W materiale widać, jak elementy składają się w całość, a gotowy model od frontu pokrywa się z logo. Składane to po prostu pięknie.
A do tego doszły dodatki. 63-stronicowa instrukcja z 58 krokami montażu, z informacją, które części dokładać i kiedy trzeba je przyczepić od spodu. Dostałem plik modelu, listę części i listę zakupową na BrickLinku, gotową do zamówienia. Model i lista są zgodne co do elementu: 514 klocków. (Informacja dodatkowa: BrickLink to największy serwis handlu częściami LEGO, a LDraw to otwarty format plików do modelowania klocków — dzięki obu można zweryfikować i zamówić wszystko, co potrzebne do budowy.)
Ile tokenów pochłonęła ta robota? 89 milionów. A ile z mojego tygodniowego limitu w Claude? Jeden procent. Gdybym rozliczał te tokeny według stawek API, wyszłoby co najmniej 44 dolary. Przy subskrypcji za 200 dolarów miesięcznie to około ćwierć abonamentu — a zapłaciłem 50 centów. Za tę cenę dostałem komplet plików: nagranie wideo, instrukcję, listę części, osobny plik sprawdzający poprawność połączeń geometrycznych między klockami oraz plik LDraw gwarantujący, że konstrukcję da się naprawdę złożyć.
To zresztą przykład większej ścieżki, moim zdaniem zbyt rzadko omawianej, którą Anthropic aktywnie wykorzystuje w rozwoju AI: wykonywanie pracy wizualnej za pomocą kodu.
Nowe stawki: taniej niż Opus 5, dużo taniej niż Fable
Ile to kosztuje u źródła? Opus 5.5 liczy 4 dolary za milion tokenów wejściowych i 20 dolarów za milion wyjściowych. To o jedną piątą mniej niż Opus 5 — i o trzy piąte mniej niż Fable 5.1 z jego 10 dolarami za milion wejścia i 50 za milion wyjścia. (Informacja dodatkowa: Fable to konkurencyjna rodzina modelów, do której autor porównuje Opusa pod względem możliwości i cen.) Ceny więc mocno spadły przy inteligencji, która na zwykłych zadaniach w wielu wymiarach dorównuje Fable, a przy okazji jest znacznie wydajniejsza i ostatecznie tańsza.
To użyteczne liczby wyjściowe, ale trzeba jeszcze wiedzieć, ile tokenów model „przeżuwa”, żeby skończyć robotę. I tu wkracza efektywność zadaniowa.
Skąd bierze się oszczędność rzędu 40 procent
Anthropic podaje, że typowe obciążenia kosztują na nowym modelu około 40% mniej niż na Opusie 5 — dzięki połączeniu niższych cen i mniejszego zużycia tokenów. Zapamiętaj jednak: „o 40% taniej” nie znaczy „o 40% mniej tokenów”. Wejście, wyjście, kontekst, pamięć podręczna — każda z tych puli ma inną stawkę. Żeby zrozumieć zysk, musisz przejrzeć zużycie we wszystkich tych kategoriach, rachunek API albo — jeśli masz subskrypcję — to, ile limitu zjadła dana robota.
Sama wielkość 40% brzmi jednak wiarygodnie. Inni użytkownicy raportują podobne oszczędności i podobną oszczędność działania, jaką pokazuję. W materiałach przywołanych przez Anthropic GitHub i Lovable opisują Opusa wykonującego mniej kroków w wersji 5.5, a Spotify — wykonywanie tych samych zadań taniej i szybciej. Podobne relacje od pojedynczych ludzi widzę na X.
I właśnie to odróżnia to wydanie od typowej premiery. Pomyśl o tamtym modelu LEGO: Claude musiał przepracować całą konstrukcję, animację, dane plików montażowych, wielokrotnie wszystko sprawdzać. Za każdym razem, gdy coś wymagało kolejnej próby, przybywało roboty. Jeśli model trafia w projekt szybciej i sprawnie reaguje na moje poprawki, mamy o wiele więcej przestrzeni, żeby wspólnie doprowadzić budowlę do ideału. O takiej efektywności chodzi w prawdziwej pracy: żeby coś zbudować, potem ulepszać i czuć, że w oknie budżetu i czasu zostało jeszcze zapasów na rozwój.
Czy to automatycznie znaczy, że każda scena zużyje mniej tokenów, bo lepiej się nią steruje? Zależy od ciebie. Jak skomplikowany jest twój projekt? Przy premierze 5.5 widziałem bardzo złożone prace — ktoś zbudował całe miasto, chyba Dolny Manhattan. Wygląda świetnie, ale pochłonie o rząd wielkości więcej tokenów niż moje LEGO.
Dlaczego ładny kadr to jeszcze nie wynik
Jedno chcę tu wyraźnie podkreślić: przestańmy liczyć tokeny zbyt wcześnie. Ładny kadr albo zgrabny zrzut ekranu to świetnie, ale przed tobą wciąż reszta roboty. Mierząc zadania — nie tylko klocki, lecz prawdziwą pracę — trzeba objąć całość i rozliczyć całość. Dlatego zaplanowałem budowę od początku do końca i podałem pełny rachunek tokenów. I dlatego zachwyca mnie efektywność zadaniowa — nie to, że dostałem ładny obrazek albo że wideo dobrze wygląda.
Biblioteki takie jak Three.js pozwalają budować grafikę trójwymiarową w przeglądarce: manipulować obiektami, materiałami, światłem, ustawiać kamerę. (Informacja dodatkowa: Three.js to popularna biblioteka JavaScript do tworzenia grafiki 3D działającej w przeglądarce.) Narzędzi kodowych do pracy wizualnej jest wiele, ale wspominam o tej właśnie, bo modele — zwłaszcza od Anthropic — zrobiły się niezwykle sprawne w posługiwaniu się nimi na proste polecenie, z bardzo dobrym smakiem.
Powrót do pisania: od frustracji po 4.6 do naprawy w 5.5
To samo podoba mi się w zmianach dotyczących tekstu. Wspomnijcie Opusa 4.6 — wydaje się, że to wieki temu. Anthropic było wtedy u szczytu formy: znakomite pisanie, znakomite kodowanie, chciałem używać Claude’a bez przerwy. Potem, przez wersje 4.7, 4.8 i Fable, wywalczenie tego, czego chciałem, robiło się coraz bardziej uciążliwe. I to nie tylko moja opinia — oddaję tu nastrój, jaki społeczność zgłaszała Anthropicowi przez ostatnie miesiące, zwłaszcza w sprawie pisania. Frustracja jest zapisana publicznie. Bram Cohen głośno pisał o kłótliwym zachowaniu Claude’a w zapadającym w pamięć artykule „Why Is Claude Turning Into…”. (Informacja dodatkowa: Bram Cohen to programista znany jako twórca protokołu BitTorrent.) Podobne wpisy znajdziesz w trackerze GitHuba Anthropic — użytkownik opisywał tam wytyczne tekstowe, które model „potwierdzał”, a potem ignorował.
To pojedyncze relacje, ale gdy nazbiera się ich więcej, zaczyna rysować się wzorzec — a widziałem ich w sieci mnóstwo. Ostatecznie liczy się doświadczenie twoje i moje. Rozpoznajesz, kiedy model oddaje to, o co prosiłeś, za pierwszym razem, kiedy jest posłuszny kierownicy i nie walczy z tobą. Anthropic ma na tym ogromnie dużo zawieszone: firma szybko rośnie, według doniesień szykuje się do wejścia na giełdę, a ludzie wciąż muszą świadomie wybierać Claude’a do pracy. Jeśli model zjada ci popołudnie na poprawki, to przełoży się na to, co otworzysz jutro.
Anthropic przyznał problemy i deklaruje, że słucha. W zapowiedzi 5.5 komunikacja z użytkownikami wokół poprzedniej wersji została nazwana poważną kwestią do naprawy, a jaśniejsze pisanie i lepsze stosowanie się do wytycznych tekstowych — jedną z głównych poprawek. Dla mnie 5.5 jest o wiele bliższy temu, co kochałem w 4.6, tylko z dużo większą inteligencją w środku. Podaję kierunek i szybko docieram do celu w tekście; podaję kierunek jak przy LEGO i sprawnie załatwiam skomplikowane zadanie, o jakim w 4.6 nie mogłem nawet marzyć.
Dobry tekst od AI zachowuje intencję autora
Kiedy mówimy o pisaniu, często zakładamy, że każdy tekst wygenerowany przez AI to papka. To nieprawda. Dobry tekst od AI zachowuje twoją intencję — i każda dobra poprawka również. Poproś o prostszy akapit, a model może go skrócić, wycinając ten właśnie wątek, który był powodem, dla którego warto było to czytać — i potem walczysz z nim, żeby to przywrócił. Może ocieplić ton, rozmyczając decyzję, którą chciałeś wybrzmiała stanowczo. Może nadać zdaniu więcej pewności, usuwając niepewność, którą świadomie chciałeś przekazać. Takie poprawki brzmią gładko, a tekst robi się mniej jasny i mniej użyteczny. Właśnie na tej linii przebiega granica między papką a przydatnym pismem. Dlatego od dawna przekonuję, żeby jakość tekstu oceniać po tym, co powstało, a nie po tym, jak powstało — bo ostatecznie albo komunikuje jasno, albo nie. Opus 5.5 zdecydowanie ułatwia komunikowanie jasno.
Dlatego tak zależy mi na sterowności. Mogę powiedzieć: „zachowaj tę niepewność, ale ten fragment zrób przystępniejszym” — mówię do modelu naturalnie, poprawka wraca od razu i nie muszę nic przerabiać. Opus 5.5 jest w tym bardzo posłuszny.
Wróćmy do logo z klocków. Chcę czapkę wyższą, okulary zostawiam dokładnie takie same. Albo: spowolnij animację montażu, żebym nadążył, dodaj kroków. To konkretne zmiany — mogę wymienić cegły, a lista części i instrukcja same dostosują się do nowego wyglądu. Chcę mieć pewność, że każda poprawka w pięćsetelementowej konstrukcji odzwierciedla moją wolę.
I tu praca wizualna Claude’a robi się naprawdę ciekawa. Skoro scena jest zbudowana z kodu, model może wejść w nią i chirurgicznie zmienić właściwe obiekty i ruchy. Umiejętność programowania staje się sposobem na tworzenie obrazu, animowanie go i czyste poprawianie — i to jest wyjątkowe. Możesz rozmawiać o kamerze albo kształcie czapki i rozwijać tę samą scenę, odkrywając po drodze, czego właściwie chcesz.
Zadania nocne: wyznacz kres pracy
A jak nowy model radzi sobie z robotą zostawioną na noc? W zapowiedzi Anthropic Shawn Hanse z firmy Cleo opisuje, jak powierzył Opusowi 5.5 zadanie inżynieryjne na sześciu repozytoriach — bez nadzoru, na 18 godzin. Słyszeliśmy już takie historie. To mnóstwo przestrzeni do działania, ale też mnóstwo decyzji, które model musi podjąć sam, kiedy śpisz albo zajmujesz się czymś innym. W takich warunkach kluczowe jest wrócić do działającego kodu.
Testowałem 5.5 także na własnych zadaniach nocnych — dwa, trzy razy we wczesnej fazie — więc nie opieram się wyłącznie na cudzych relacjach. Wniosek: Opus 5.5 radzi sobie z długotrwałymi zadaniami znacznie lepiej, gdy dostanie jasny warunek stopu i jednoznaczną definicję „gotowe” — sprawdzian na końcu drogi. Im precyzyjniej to zdefiniujesz, tym lepiej. To wniosek ani szczególnie nowy, ani specjalny dla 5.5, ale ważny: zaangażowanie, jakie ten model wnosi w problem, nie powinno prowadzić do pracy ciągnącej się bez wyznaczonego kresu.
Lekcja z 5.5 jest taka: zdefiniuj świat, w którym model ma działać. Ten model po prostu uwielbia działać i działać — kocham tę wytrwałość i chcę, żeby skupiała się na moim zadaniu, żeby nie żuć tokenów bez sensu. Wracamy do efektywności. Dlatego przy projekcie z logo od razu podałem definicję „gotowe”: ile elementów, jaka złożoność — żeby model nie musiał sam tego ustalać. To oszczędziło mi całe mnóstwo tokenów. Konstruktor nie musiał modelować całego świata mojej czapki, sam dowolnie decydować, uznać, że mu nie wychodzi, i przyspieszać. Te modele same się rozpędzają. Naszą rolą jest dać im przestrzeń, w której mogą działać oszczędnie. A skończone znaczy skończone: scena działa, poprawki są na miejscu, wszystko sprawdzone.
AI, które buduje AI
Chcę to połączyć z większą historią, bo laboratoria również dostają coraz lepsze narzędzia do tej pracy — a częścią tych narzędzi są ich własne modele AI, takie, których ty i ja nie widzieliśmy. Mamy zwyczaj mówić o premierze, jakby spadła z nieba: oto model, oto wynik, które miejsce w rankingu? Tymczasem Anthropic podaje, że od maja Claude jest autorem ponad 80% kodu scalanego w bazie kodowej firmy. Osiemdziesiąt procent. AI pomaga projektować AI. Mówimy o rekurencyjnym samodoskonaleniu, o badaniach wspieranych przez AI — nazwy bywają różne, ale widać, jak głęboko zmienia się praca wewnątrz tych firm. OpenAI opisuje badaczy, którzy za pomocą agentów piszą kod, prowadzą eksperymenty i diagnozują problemy. Laboratoria w ogromnym stopniu korzystają z AI przy tworzeniu AI.
Pomaga to zrozumieć, czemu Opus 5.5 jest taki, jaki jest. Sposób, w jaki korzystamy z tych narzędzi, kształtuje modele trafiające do użytkowników — i to w kierunku łatwiejszego użytku. Zwykle zakładamy, że głos konsumenta mało tu znaczy; w tym wypadku jest raczej odwrotnie i chcę opowiedzieć tę historię. Nie znamy pełnej wewnętrznej kroniki powstania 5.5, ale kusząca jest sama możliwość, ją rysuje łączenie kropek: użytkownicy tacy jak ty i ja wskazują, co utrudnia pracę z modelem, a ludzie po drugiej stronie mają coraz zdolniejsze narzędzia AI, pomagające im szybko badać i testować zmiany. To może skracać czekanie na naprawdę użyteczne ulepszenia. W 5.5 widzę postęp dokładnie w rzeczach, o których słyszę codziennie — na przykład w pisaniu.
Ludzie pytają mnie: „Nate, nie masz ulubionego modelu?”. Używam tych, które działają — nie faworyzuję. Moja robota to raportować, co działa i ile kosztuje zadanie, oraz cieszyć się, że żyjemy w świecie z taką obfitością inteligencji.
A oto fragment, który mnie ostatecznie porusza. Gdy dostaję model LEGO i pliki montażowe mniejszym wysiłkiem i mniejszym zużyciem, mogę wydać mniej i na tym poprzestać — albo pójść dalej: dorzucić animację, większą konstrukcję, wyjść poza klocki. Bo jest efektywny zadaniowo, Opus 5.5 zostawia mi więcej przestrzeni na decyzje, które się liczą, na iterowanie i branie kolejnego projektu. Przy takiej pracy czuję, że ciężar skomplikowanych zadań staje się lżejszy. I o to w ogóle sięgamy po inteligencję z czołówki.
To będzie także większa historia wokół debiutów giełdowych OpenAI i Anthropic: jak dostarczają niezwykłej, a zarazem efektywnej kosztowo wartości i jak w czasie rzeczywistym słuchają płacących użytkowników. W Opusie 5.5 wszystko to się złożyło: widać zespół reagujący na feedback, widać model efektywny zadaniowo i widać, jak to wraca do użytkowników.
Każde laboratorium ma tu własną drogę. OpenAI i Anthropic są w różnych miejscach — ich wewnętrzne modele ewidentnie się różnią, mają odmienne linie rozwoju, i to dobrze dla nas jako konsumentów. Żyjemy w świecie, w którym rozwój AI realnie zmienia sytuację użytkowników. Odstęp między dużymi premierami skurczył się do około dwóch tygodni; niedawno widziałem liczbę 18 dni. Tak szybko mogło się to udać między innymi dlatego, że laboratoria mają narzędzia AI, które im w tym pomagają. Patrzę w przyszłość z optymizmem: co Anthropic gotuje dalej? Co OpenAI? Zakładam, że coś dobrego. Mamy dziś model wystarczająco dobry, bym mógł wykonać tę pięćsetelementową konstrukcję, która dwa-trzy miesiące temu rozbiła by mój benchmark — a pochłania 1% tygodniowego limitu. Ciekaw, gdzie będziemy za dwa, trzy miesiące.
Dlaczego twoje doświadczenie się liczy
Dlatego zaczynam od tego, co realnie zbudowałem w Opusie — chcę się tym dzielić i chcę, żebyście dzielili się swoim. Wszyscy mamy pracę do odrobienia; wiemy, które decyzje chcemy zachować, i potrafimy powiedzieć, gdzie wynik nie dorabia do oczekiwań. I to my wybieramy, który model dostanie nasze pieniądze i następne zadanie. Gdy model pomaga kończyć sprawnie i dobrze reaguje na kierownicę, mamy powód przy nim zostać. A te wybory dają laboratoriom powód, by dbać o szczegóły współpracy z ich systemami. Ergonomia modeli z czołówki ma ogromne znaczenie.
Jak samodzielnie policzyć koszt zadania
Pewnie pytasz: „Jak mam to sprawdzić u siebie, Nate? Na moich materiałach, nie na twoim LEGO?”. Oto co bym zrobił. Weź pliki, na których zwykle pracujesz — arkusze, dokumenty, repozytorium kodu, cokolwiek. Gdy pojawia się nowy model, powtórz zadanie, które już kiedyś wykonywałeś: to samo miejsce startu, ten sam prompt, dokładnie ten sam przygotowany setup, który zbudował poprzednik. Puść i obserwuj. Mierz tak, jak ja mierzyłem: sumaryczne tokeny, przybliżony rachunek według stawek API, a przy subskrypcji — jaki plaster tygodniowego limitu zjadło zadanie. Potem porównaj z poprzednimi modelami.
Im lepiej ogarniasz pełny obraz — nieudane próby, poprawki, robotę po drodze, ile razy musiałeś się wtrącać — tym lepsza decyzja. W budowlach LEGO prawie nie musiałem interweniować: w tym czasie robiłem swoje, a zadanie się skończyło. Wynik końcowy musi wyjść co najmniej na poziomie poprzednika. Opus 5.5 wypadł w moich testach lepiej niż wcześniejsze wersje Opusa, a moim zdaniem lepiej niż Fable — bo taniej i szybciej, bez ciągłego tłumaczenia tego samego.
I nie zostawiaj w tych pomiarach samych sukcesów. Zachowaj także momenty „ten model do mnie nie przemówił, to wydanie mi nie zagrało”. Dokumentowanie tego mówi nam wszystkim, jak realnie korzystać z AI — bo ostatecznie liczy się, jak często narzędzie bywa używalne i ile znosi kolejnych prób. Wtedy zaczynasz widzieć, gdzie leży postęp: może grafika skacze dramatycznie, pisanie się poprawia, a poszukiwania informacji nie nadążają. I od tego zależy, ile to wydanie jest dla ciebie warte.
Przykład z mojej praktyki: gdy zobaczyłem wizualny smak Opusa 5.5, przeniosłem do niego pracę projektowo-graficzną w jednym z moich przedsięwzięć. Ufałem, że około dziewięćdziesięcioelementowe zadanie wizualne załatwi jednym promptem — i załatwiło, nie naruszając tygodniowego budżetu. Wyciągnąłem wnioski z tego, co mogłem sprawdzić, i przestawiłem przepływ pracy. Robię tak cały czas.
Moje wyzwanie dla ciebie: zbuduj własny zestaw testowych zadań dla modeli. Jeśli nie wiesz jak, pomogę — mam prompt, który na podstawie twoich wcześniejszych wzorców użycia ułoży realistyczny benchmark dla ciebie, nie powtórzony z moich projektów ani z klocków. Link znajdziesz w opisie.
Chcę, żebyś zobaczył większą historię: żyjemy w świecie, w którym możemy dawać laboratoriom feedback, one mogą odpowiadać, modele się poprawiają, a my dowozimy więcej. Wiemy, czy to działa dla nas, tylko wtedy, gdy mierzymy swoje zadania i sprawdzamy, czy zwracają wartość. Wybierz więc coś, na czym ci naprawdę zależy, zmierz, wróć i zmierz znowu. Testuj konsekwentnie przy kolejnych premierach — wtedy poczujesz emocję i wtedy poznasz, kiedy nastąpił przełom. Taki jest mój osąd o Opusie 5.5. Ciekaw, jaki jest twój — daj znać w komentarzach.