O czym jest ten film
- Po nierównym Opusie 5 zadebiutował Opus 5.5 — pierwszy od dawna model Anthropic, który autora realnie wciągnął do pracy agentowej.
- W czwartej edycji Cursor Bench (ranking oparty na prawdziwych sesjach programistycznych) Opus 5.5 na effortcie „high” osiąga 56% skuteczności za ok. 4 dolary za zadanie — to ok. ćwierć ceny Fable 5.1 na maksymalnym rozumowaniu przy lepszym wyniku.
- Tokeny są tańsze niż w Opusie 5 średnio o ok. 20%, a wyniki — zdecydowanie lepsze.
- Benchmarki producenta pokazują przewagę nad Astro (GPT‑6), ale zabrakło w nich kategorii „computer use” — należy na nie patrzeć z dystansem.
- Autor, abonent najdroższego planu Max 20x, zauważył, że na effortcie „high” limit ledwo drga — i rozważa przejście na tańszy plan Max 5x.
- Anthropic uruchomiło promocję startową z podbitymi limitami oraz — po raz pierwszy — ręcznym resetem limitu z poziomu ustawień (dostępny do 22 października).
- Po aktualizacji Claude Code domyślny poziom rozumowania to „medium”, a na planie Pro domyślnym modelem stał się Opus 5.5.
- Praktyczna teza całego materiału: dobór poziomu rozumowania do zadania plus audyt projektu po każdej przesiadce na nowy model to najtańszy sposób na lepsze wyniki.
- Opus 5.5 skrócił odpowiedzi i niemal pozbył się długich myślników; stare skille służące do „uciszania” poprzednika stają się zbędne.
- W warstwie praktycznej: wygenerowany agentowo opis filmu, miniatury w aplikacji autora, nocna produkcja spotu promocyjnego i zrobiony na żywca odtwarzacz muzyki — werdykt: najlepszy model do codziennej roboty.
10 najważniejszych takeaways — z kontekstem zastosowania
1.Effort „high” to najkorzystniejszy punkt pracy dla Opusa 5.5
Na czym polega: W Cursor Bench 4 różnica skuteczności między „high” a maksymalnym poziomem rozumowania wynosi u Opusa 5.5 ledwie ok. 1,8 punktu procentowego, podczas gdy cena zadania rośnie ponad trzykrotnie.
Jak stosować: Ustaw „high” jako podstawowy tryb pracy z kodem i ogólnie z zadaniami złożonymi. Na maksymalne rozumowanie przechodź tylko wtedy, gdy planujesz odpuścić sterowanie i chcesz, żeby model dowieźł całość sam.
Na co uważać: Po aktualizacji aplikacja domyślnie stawia „medium” — sprawdź suwak, zanim zaczniesz pracę, bo niewłaściwy poziom zje limit albo obniży jakość.
2.Tania strategia: „low” na start, „high” tylko do poprawek
Na czym polega: W teście SWE Bench Pro z dokumentacji Anthropic Opus 5.5 na samym „high” osiąga 95,3% skuteczności za ok. 29 centów za zadanie. Jeśli jednak puścisz zadania na „low” i tylko nieudane powtórzysz na „high”, wychodzi ok. 97% za 17 centów.
Jak stosować: Przy partiach podobnych, powtarzalnych zadań zaczynaj od niskiego poziomu rozumowania i eskaluj tylko niepowodzenia. To reguła, którą łatwo zamienić w nawyk przy pracy z checklistą.
Na co uważać: Strategia zakłada, że zadania da się sensownie zweryfikować. Tam, gdzie błąd kosztuje dużo (np. refaktor na produkcji), oszczędność może nie być warta ryzyka.
3.Wyższy effort nie naprawi złego prompta
Na czym polega: Główna teza inżyniera Anthropic: wyższy poziom rozumowania opłaca się przy dużej liczbie ukrytych przypadków brzegowych, bo model sam szuka dziur we własnej pracy. Ale jeśli model od początku obrał złe podejście, dłuższe myślenie nic nie zmieni.
Jak stosować: Kiedy agent utknął, popraw polecenie, kontekst albo podział zadania — nie manewruj suwakiem. Jeśli na poziomie „extra” model dwa razy uderza w tę samą ścianę, przechź na mocniejszy model (np. Fable 5.1).
Na co uważać: Objaw „model myśli dłużej, a robi to samo” to sygnał problemu z promptem, a nie z poziomem rozumowania.
4.Po każdej przesiadce na nowy model zrób audyt projektu
Na czym polega: Instrukcje i skille pisane pod stary model są inaczej odbierane przez nowy — model dłużej pracuje, pisze więcej, częściej sięga po narzędzia, a Ty płacisz limitem. Anthropic podaje, że prompty pisane pod Opusa 4.8 kosztowały na Opusie 5 o 36% więcej; po audycie były o 14% tańsze, a skuteczność wzrosła z 92 do 97%. Określają to mianem „darmowej wygranej”.
Jak stosować: Po zmianie modelu uruchom wbudowany skill audytu: w Claude Code wpisz komendę „/doctor” z dopisanym promptem „audit”. Model przejrąda plik CLAUDE.md, skille, ustawienia subagentów, komendy i style odpowiedzi, a potem przedstawia listę proponowanych poprawek do zatwierdzenia.
Na co uważać: Skill najpierw tylko raportuje — dopiero Twoje „tak” uruchamia zmiany. Przejrzyj propozycje, zanim je zaakceptujesz.
5.Kontekst startowy sesji cicho zjada limit
Na czym polega: Wszystko, co model czyta na początku każdej sesji — instrukcje, pamięć, opisy narzędzi — kosztuje jeszcze zanim napiszesz pierwsze słowo. W audycie autora prawie połowa z ok. 200 wpisów skilli trafiała do modelu bez opisu, więc AI widziała same nazwy; sprzątanie zmniejszyło startowy kontekst z 13,6 tys. do 8,7 tys. tokenów.
Jak stosować: Opisuj swoje skille (krótka metryczka: kiedy użyć), usuwaj nieużywane narzędzia i wyłapuj sprzeczne instrukcje — autor miał jednocześnie „nigdy nie odpalaj agentów w tle” i „odpalaj”. Porządki rób przynajmniej raz w miesiącu; premiera nowego modelu to dobra okazja, jeśli zaległości się nazbierały.
Na co uważać: Audyt większego projektu może potrwać blisko trzy godziny — odpal go w tle albo na osobną sesję.
6.Nowy model jest tańszy, a limity i tak „nie do zajechania” — nie daj się złudzeniu
Na czym polega: Tokeny Opusa 5.5 są tańsze niż Opusa 5 średnio o ok. 20%, a dodatkowo Anthropic podbiło limity promocją startową. Efekt: limit topnieje bardzo wolno, co tworzy wrażenie, że model starcza na zawsze.
Jak stosować: Traktuj okres promocji jako czas testów — dopiero po jego końcu zobaczysz rzeczywiste zużycie. Jeśli przez ten czas limit na „high” prawie nie drgnie, być może wystarczy Ci tańszy plan (autor rozważa zejście z Max 20x na Max 5x).
Na co uważać: Decyzję o zmianie planu podejmuj po kilku normalnych tygodniach pracy, nie po jednej promocyjnej.
7.Skorzystaj z ręcznego resetu limitu — do 22 października
Na czym polega: Po raz pierwszy Anthropic dał użytkownikom coś, co znaли dotąd użytkownicy Codexa: reset limitu. Nie trzeba czekać na cykliczne odnowienie — w aplikacji desktopowej Claude wejdź w Settings → Usage → Limit resets i kliknij pełny reset.
Jak stosować: Jeśli plan w danym tygodniu się wyczerpie, resetujesz i działasz dalej. Jesteś „pełny reset” wygasa 22 października, więc miej to na oku.
Na co uważać: To oferta czasowa — nie buduj na niej stałego trybu pracy, bo po październiku wracają zwykłe zasady.
8.Sprawdzaj ustawienia po każdej aktualizacji Claude Code
Na czym polega: Po aktualizacji wydanej wraz z premierą Opusa 5.5 domyślny poziom rozumowania to „medium” — niezależnie od tego, co miałeś ustawione wcześniej. Na planie Pro domyślnym modelem przestał być Sonet, a stał się nim Opus 5.5, również na „medium”.
Jak stosować: Po każdej aktualizacji wejdź w ustawienia i przywróć swój preferowany poziom oraz model. Warto też wiedzieć, że „ultra code” to tak naprawdę „extra” plus możliwość przywołania do 100 równoległych subagentów (blisko 1000 na całą sesję) — świetne do dużych zadań, błyskawicznie palące limit.
Na co uważać: Krążą przecieki, że „ultra code” będzie można łączyć z najwyższym planem — to jeszcze szybszy sposób na przepalenie limitów, więc używaj świadomie.
9.Dawaj modelowi konkretne zakazy, nie ogólne „pisz naturalnie”
Na czym polega: Według pomiarów Areny AI Opus 5 generował średnio 15,2 długiego myślnika na 1000 słów; Opus 5.5 tylko 0,8 — redukcja o ok. 95%. Skoro model trzyma się reguł, które mu wprost podasz, konkret bije ogólnik.
Jak stosować: W stylu odpowiedzi i instrukcjach wpisuj precyzyjne nawyki, których nie chcesz: „bez długich myślników”, „bez średników” itd. Własny styl odpowiedzi (output style — teraz przełączalny też w aplikacji desktopowej: Settings → Claude Code → Output Style) możesz wykorzystać do nauki: niech model nie tylko robi, ale też tłumaczy, co i dlaczego zrobił.
Na co uważać: 0,8 myślnika na 1000 słów to nadal nie zero — jeśli detekt AI‑tekstu Ci przeszkadza, regułę zostaw w instrukcji.
10.Opus 5.5 udźwignął pracę kreatyrną, która wcześniej wymagała droższych modeli
Na czym polega: Przy generowaniu miniatur i nocnej produkcji spotu promocyjnego Opus 5.5 na „high” poradził sobie tam, gdzie poprzednik zawodził, a konkurencja była droga. Dobre efekty przyszły z kombinacji: świeży kontekst w nowej sesji, dostęp do narzędzi (generator grafiki, przeglądarka agentowa, kupione za kilkanaście złotych asety) i praca w tle przez noc z podglądem kilku wersji rano.
Jak stosować: Przy kreatywnych zadaniach daj agentowi dostęp do inspiracji (np. niech sam przejrzy Pinteresta i Dribbble pod kątem moodboardu), zgadzaj się na proponowane koszty dopiero po ich wyświetleniu i iteruj krótko: screen tego, co nie gra, plus jedno konkretne polecenie poprawy.
Na co uważać: Pierwsza wersja rzadko zachwyca — nie mieszaj poprawek w starej sesji, tylko poproś o gotowy prompt do nowej, na czystym kontekście. I pamiętaj o skanowaniu cudzych skilli pod kątem bezpieczeństwa przed instalacją.
Redakcyjne tłumaczenie
Wstęp: powrót do formy
Pierwszym modelem AI, którym — jeśli chodzi o pracę agentową — naprawdę się zachwyciłem, był Opus 4.6. Niestety kolejne wydania, jak chociażby Opus 4.8 czy 5.0, były delikatnie mówiąc przeciętne, jeśli nie słabe. Że tak było nie tylko moim zdaniem, świadczy choćby to, że Tarik, inżynier zespołu Claude Code, sam przyznał na platformie X, iż Opus 5 to bardzo nierówny model i że jego poprawa jest dla nich priorytetem. Ponad tydzień temu dotarł do nas natomiast Opus 5.5, który błyskawicznie podbił serca fanatyków AI — w tym moje — na całym świecie. Dlatego dziś weźmiemy pod lupę najnowszy model od Anthropic: przejdziemy przez praktyczne wskazówki, pokazówki na żywo i podzielę się wnioskami.
Od razu zaznaczę, że wypowiadam się z perspektywy użytkownika planu Max 20x w Claude Code — czyli najwyższego i najdroższego obecnie planu. A jednak po testach Opusa 5.5 realnie zastanawiam się nad zejściem na tańszy. Dlaczego? Do tego dojdziemy, ale najpierw liczby, czyli benchmarki — a potem to, co moi widzowie lubią najbardziej: klikanie.
Liczby z realnych sesji: Cursor Bench 4
Zacznę od czegoś, co wyjątkowo do mnie przemówiło, bo nie pochodzi od Anthropic, tylko od Cursora. W czwartej edycji Cursor Bencza — rankingu opartego na zadaniach z prawdziwych sesji programistów — po lewej stronie widzimy skuteczność modeli na danym poziomie rozumowania, a na dole średni koszt zadania.
I tu robi się ciekawie. Opus 5.5 ustawiony na „high” osiąga skuteczność 56% przy koszcie 3,97 dolara za zadanie. Fable 5.1 na maksymalnym poziomie rozumowania ma zaledwie 51,8% przy średniej cenie 17,28 dolara. Wniosek: model teoretycznie słabszy, pracujący na niższym poziomie rozumowania, daje lepszy wynik za mniej więcej ćwierć ceny. To lubimy.
Ciekawostka: dopiero na dwunastym miejscu rankingu znajdziemy starego Opusa 5, który na maksymalnym rozumowaniu osiąga 46,6% przy koszcie 11,95 dolara za zadanie.
Tokeny tańsze o jedną piątą
Do obrazu trzeba dołożyć cennik. W przypadku odczytu z cache*(Informacja dodatkowa: tokeny z cache to fragmenty wcześniejszej rozmowy zapisane raz i ponownie wykorzystywane — ich odczyt jest wielokrotnie tańszy niż przetwarzanie tekstu od zera.)* Opus 5.5 kosztuje 20 centów, podczas gdy Opus 5 — 50 centów. Tokeny wejściowe: 4 dolary wobec 5, wyjściowe: 20 wobec 25. Zapis do cache również jest tańszy o 1,25 dolara. W dużym uproszczeniu: Opus 5.5 jest średnio o około 20% tańszy od swojego poprzednika i osiąga od niego zdecydowanie lepsze wyniki.
Benchmarki producenta — patrz z dystansem
Anthropic na stronie poświęconej nowemu modelowi twierdzi, że Opus 5.5 bije Astrę w wielu badanych kategoriach. Ale wiadomo, jak to bywa z benchmarkami — modele są często trenowane właśnie po to, żeby w nich wygrywać. Interesujące jest to, że Astra wygrywa w kategoriach „Business Workflows” (Automation Bench) oraz „agentic scientific research”, a jakimś dziwnym trafem zabrakło w zestawieniu kategorii computer use, czyli obsługi komputera — jednej z rzeczy, za którą w poprzednim materiale mocno chwaliłem Astrę. Opus 5.5 radzi sobie z obsługą komputera wyraźnie lepiej niż chociażby Fable 5.1 czy Opus 5, więc konfrontacja z Astrą byłaby ciekawa… tyle że jej nie ma. I nie zapominajmy: to benchmarki od Anthropic, nie niezależne pomiary, więc patrzmy na nie z przymrużeniem oka.
Dostawcy to jedno, ale dla mnie ważniejsze są odczucia ludzi bez interesu w wspieraniu firmy X czy Y: widzowie moich sobotnich transmisji i członkowie mojej zamkniętej społeczności. Czat w zeszłą sobotę mówił sam za siebie: „Opus 5.5 to jest to”, „Póki co jest świetny”, „5.5 zamiata”. Część osób pisała nawet, że jest lepszy od Asty. Ja tego bym tak nie ujął — wszystko zależy od zadania — ale jako model do codziennej pracy Opus 5.5 jest moim zdaniem wyborem zdecydowanie lepszym, bo przede wszystkim o wiele tańszym.
Dlaczego rozważam tańszy plan
Wracam do pytania z początku materiału: dlaczego myślę o przejściu z planu Max 20x na Max 5x? Mogłoby się wydawać, że skoro tak mówię, to nowy Opus mi się nie podoba. Jest wręcz przeciwnie.
Mając plan Max, często „katuję” modela na wysokim poziomie rozumowania — pracuję głównie na „high” albo „extra”. Robię tak głównie z wygody, bo idealny byłby dla mnie plan pośredni 10x, a takiego nie ma: 5x to za mało, więc biorę 20x i mam zapas. I właśnie tu zauważyłem coś istotnego: pracując na Opusie 5.5 z rozumowaniem ustawionym najwyżej na „high”, nie jestem w stanie wykorzystać nawet pięciogodzinnego limitu. W dniu nagrania miałem zużyte 40% tygodniowego pakietu, z blisko 30% w rezerwie. Podczas sobotniej transmisji, po godzinie dłubania, limit ledwo drgnął. Zaczął wyraźnie uciekać dopiero, gdy odpaliłem cztery, pięć sesji Claude Code równolegle — w każdej po jednym Opusie na „extra” lub maksie, plus subagenci. Podobnie pisał na czacie Eryk: próbuje przepalić wszystkie tokeny na Opusie 5.5, ale „chyba nie da rady”.
I tu można wrócić do Cursor Bencza, bo dane się pięknie składają. Opus 5.5 na maksymalnym poziomie: niecałe 58% skuteczności przy koszcie 13,43 dolara. Na „extra”: 56% — czyli 1,8 punktu mniej — przy cenie spadającej prawie o połowę. Na „high”: również 56%, czyli tyle samo co na „extra”, a cena to niecałe 4 dolary. Ponad trzykrotna różnica w cenie przy minimalnej różnicy skuteczności.
Będę jednak z Tobą uczciwy, bo ta wolno topniejąca granica to trochę wydmuszka. Wraz z premierą Anthropic uruchomiło promocję startową i limity podbiło. Naturalnie może się więc wydawać, że Opus 5.5 starcza na długo — bo limity są wyższe i mniej czujemy, ile tak naprawdę zjada model. Z perspektywy marketingowej to ciekawy zabieg: tworzy iluzję modelu nie do zajechania. Jak będzie naprawdę, przekonamy się niebawem. Na ten moment uważam po prostu, że zużycie jest niskie, chcę to dalej testować — a jeżeli trend się utrzyma, być może faktycznie przeniosę się na Max 5x.
Reset limitu — nowość, o której nie wszyscy wiedzą
Tu ciekawostka, którą Anthropic zakomunikowało niezupełnie wprost, a przynajmniej nie wszystkich do niej dotarło. Pierwszy raz dostaliśmy coś, do czego przyzwyczaił nas Codex: reset limitu. Tyle że nie chodzi o automatyczne odnowienie — możesz z poziomu ustawień sam, w dowolnym momencie, kliknąć przycisk i zresetować swój limit. W aplikacji desktopowej Claude przejdź do ustawień, potem do zakładki „Usage” po lewej stronie. Pojawiła się nowa pozycja „Limit resets” z pełnym resetem, który wygasa 22 października. Wystarczy wcisnąć przycisk. Moim zdaniem warto o tym wiedzieć i warto z tego skorzystać do 22 października — jak dają coś za darmo, to bierz, jak mawiała moja ciocia.
Spinając tę część klamrą: o tym, czy plan wystarczy Ci na dłużej, spory wpływ ma to, jak bardzo każesz Opusowi 5.5 namyślać się przed odpowiedzią.
Effort, czyli ile model myśli, zanim zacznie robić
W sobotę na czacie padło pytanie: jaki poziom rozumowania polecamy w pracy z Opusem 5.5 i co obserwujemy? Moje wnioski poznamy za moment, ale najpierw artykuł inżynierów Anthropic — a konkretnie Tarika — o tym, jak on do tematu podchodzi.
Zanim jednak przejdziemy, krótka informacja dla osób, które dopiero zaczynają przygodę z Claude Code. Effort, najprościej mówiąc, to wysiłek — a raczej długość wewnętrznego dialogu, który model prowadzi sam ze sobą, zanim udzieli odpowiedzi. Zmienisz go w aplikacji desktopowej: jest suwak, od najniższego poziomu po lewej do najwyższego po prawej. Opus 5.5 obsługuje pięć poziomów: low (najniższy), medium, high, extra (w terminalu „xhigh”) oraz max (najwyższy). Jest i szósty: „ultra code”. Ciekawostka: przy „ultra code” model korzysta z rozumowania „extra”, ale może przywoływać do pomocy do stu osobnych subagentów działających równolegle — blisko tysiąc w całej sesji. Świetny przepis na błyskawiczne spalenie limitów. Widziałem zresztą przecieki, że Anthropic pracuje nad tym, by zamiast planu „extra” odpalać przy „ultra code” plan maksymalny — czyli na jeszcze szybsze przepalanie. Ale dziś nie o tym.
Najważniejsze na tym etapie: im niższy poziom, tym mniej czasu model poświęca na myślenie. W rezultacie działa szybciej i taniej, bo zjada mniej tokenów, ale przy złożonych zadaniach odpowiedzi mogą być gorszej jakości. W skrócie: na niskim poziomie model od razu bierze się do roboty; na wysokim najpierw planuje i szuka dziur we własnej pracy, a dopiero potem działa.
Jeszcze jedna rzecz: po aktualizacji Claude Code do wersji wydanej wraz z premierą Opusa 5.5 domyślnym poziomem rozumowania stało się „medium” — niezależnie od tego, co miałeś ustawione wcześniej. A jeśli korzystasz z planu Pro, domyślnym modelem nie jest już Sonet, lecz Opus 5.5, również na „medium”.
Eksperyment Tarika: ta sama aplikacja na każdym poziomie
W artykule o wydawaniu efektu Tarik zlecił Opusowi 5.5 budowę tej samej aplikacji do śledzenia postępów w treningach — na każdym poziomie rozumowania osobno. Na najniższym model stworzył prostą aplikację z jednym wykresem w półtorej minuty. Na średnim — nieco bardziej rozbudowaną i kolorowszą, w cztery minuty, czyli ponad dwukrotnie dłużej. Na „high” — wersję, jakby to powiedzieć, wypasioną, w jedenaście minut. Na maksie — aż sześćdziesiąt siedem minut, ale za to dostajemy pełen produkt. W artykule jest więcej takich pokazówek; jak ocenić efekty — czy lepiej, czy gorzej — zostawiam Tobie, ale weź pod uwagę czas i cenę, o których już rozmawialiśmy.
(Informacja dodatkowa: artykuł trafił na zamknięty Discord „Operatorzy AI” dzięki botowi EOS, który codziennie rano zbiera newsy i ciekawostki ze świata AI.)
Główna myśl Tarika jest taka: wyższy poziom rozumowania opłaca się tam, gdzie jest dużo ukrytych przypadków brzegowych — model wtedy samodzielnie szuka dziur we własnej robocie. W jednym z jego testów Opus 5.5 na „low” miał zero udanych prób na pięć, a na „high” pięć na pięć. Ale — i to też jego słowa — wyższy effort nie naprawi sytuacji, w której model obrał złe podejście. Wtedy poprawiasz polecenie dla agenta, a nie suwak.
Ściąga Anthropic: kiedy który poziom
Dobra wiadomość jest taka, że Anthropic przygotowało ściągę, kiedy który poziom rozumowania stosować:
- low — mechaniczne zadania z jasnym planem: zmiany nazw, stosowanie wzorców na plikach, proste poprawki, które da się opisać jedną linią;
- medium — codzienna praca z jasnym zakresem; wymaga mniej pracy niż „high”, więc nie zużywa tylu tokenów i wychodzi taniej;
- high — dopiero gdy model na „medium” utknie;
- extra — gdy model ma trudny problem wymagający więcej myślenia niż na „high”; jeżeli dwa razy uderzy w tę samą ścianę, warto przesiąść się na mocniejszy model, czyli Fable 5.1;
- max — gdy chcesz działać w jednej sesji i żeby wiele rzeczy działo się automatycznie, bez Twojego udziału.
Twarde liczby z dokumentacji (test SWE Bench Pro) mówią jasno: na „high” Opus 5.5 dowozi 95,3% skuteczności za około 29 centów za zadanie, ale jeśli puścisz wszystko na „low”, a na „high” powtórzysz tylko nieudane próby, wychodzi około 97% za 17 centów. Tarik sam przyznaje, że maksymalny poziom włącza właściwie tylko wtedy, gdy nie chce dorzucać własnych uwag — chce, żeby model samodzielnie doprowadził zadanie do końca.
Podsumowując: jeśli pilnujesz limitu (np. na planie Pro, który często nie wystarcza), trzymaj „medium” jako bazę. Wchodź na „high”, gdy model na „medium” staje w miejscu albo gdy robisz coś wymagającego więcej precyzji. A maksymalny poziom odpalaj tylko na jedno duże zadanie — gdy Cię nie ma przy komputerze albo gdy chcesz, żeby działał bez Twojego wkładu.
Kontekst startowy: co model czyta, zanim zaczniesz pisać
Poziom rozumowania to jedno, ale to, co model czyta, nim w ogóle zabierze się do pracy, potrafi zjeść jeszcze więcej limitu.
Jeśli pracujesz z Claude Code dłużej niż miesiąc, zakładam, że masz — a przynajmniej powinieneś mieć — własny projekt: folder z plikami dotyczącymi obszaru, w którym wspierasz się tym narzędziem. W środku zapewne jest CLAUDE.md, czyli instrukcja systemowa odczytywana przez Claude’a na starcie każdej sesji — wpisz choćby „hej”, a model najpierw ją przeczyta. Co ciekawe, pozostałe narzędzia, jak Codex czy Hermes, korzystają z pliku AGENTS.md — i Claude w końcu to ustandaryzował: jeżeli w projekcie nie ma CLAUDE.md, domyślnie czyta AGENTS.md. Chyba dobrze, bo robiło się to trochę dziwne i niewygodne. Dodatkowo, jeśli trochę z projektem pracujesz, masz folder .claude z hookami, skillami, instrukcjami i wgranymi stylami odpowiedzi.
I tu dochodzimy do sedna: stare instrukcje czy skille, które działały na przykład na Opusie 5, nowy model odbiera inaczej. Gdy nie są pod niego dopasowane, Opus 5.5 poświęca więcej czasu na zadanie, tworzy dłuższe odpowiedzi, częściej sięga po narzędzia — a Ty płacisz za to limitem. Anthropic w dokumentacji podaje przykład z poprzedniej przesiadki, z Opusa 4.8 na 5.0: prompty pisane pod starszy model kosztowały na nowym o 36% więcej za zadanie. Po audycie prompty były tańsze o 14%, a skuteczność wzrosła z 92 do 97%. Antropic nazywa to „darmową wygranej” — niewiele robisz, a obniżasz koszty i podnosisz jakość.
Dobra praktyka: po każdej większej zmianie modelu warto zrobić audyt projektu i dopasować go do obecnego modelu. Kiedyś zajmowało to sporo czasu, bo wszystko trzeba było robić ręcznie i tłumaczyć modelowi, jak się do tego zabrać. Dziś mamy gotowe narzędzie wbudowane w Claude Code — specjalnego skilla od Anthropic, który sprawdza stare instrukcje: przegląda CLAUDE.md, skille, ustawienia subagentów, komendy i style odpowiedzi. Dzięki niemu Claude szuka instrukcji pisanych pod starsze modele, nieużywanych skilli, które tylko zajmują kontekst, odwołań do plików i komend, których już nie ma, oraz plików, które sobie przeczą.
Korzystanie jest proste: w Claude Code wpisujesz komendę /doctor (ja dopisałem jeszcze prompt „audit”) i wybierasz Opusa 5.5 na „high”. Model zbiera najważniejsze informacje o projekcie, tworzy tabelkę ze szczegółami i wypisuje, co można poprawić, żeby oczyścić kontekst. Co istotne: na tym etapie niczego jeszcze nie zmienia — najpierw musiś zatwierdzić, że chcesz to zrobić. Widzimy zresztą, że sporządził listę znalezionych sprzeczności i innych rzeczy.
Wyniki mojego audytu
Odpaliłem to u siebie w sobotę, na żywo. Zajęło około 171 minut, a pierwsze znalezisko mile mnie zaskoczyło: z około dwustu wpisów skilli blisko 95 trafiało do modelu bez opisu. A opis skilla to krótka metryczka, po której agent poznaje, kiedy go użyć. Czyli w przypadku prawie połowy narzędzi AI widziała same nazwy — nic więcej.
Druga sprawa to bagaż startowy: wszystko, co model czyta na początku sesji, zanim cokolwiek napiszesz. Po porządkach startowy kontekst w tym projekcie spadł z 13,6 tys. do 8,7 tys. tokenów. Sam plik CLAUDE.md skurczył się z niecałych 8 tys. (dokładnie 7,9 tys.) do 4,3 tys. znaków, a plik pamięci — z blisko 16 tys. do 10 tys. znaków.
Trzecie, najzabawniejsze: sprzeczne instrukcje. W jednym pliku miałem „nigdy nie odpalaj agentów w tle”, w drugim „odpalaj”. Model sam to wyłapał i zapytał, co ma zrobić. Wybrałem pełne sprzątanie.
I niezmiennie powtarzam: takie porządki warto robić chociaż raz w miesiącu. Jeśli dawno tego nie robiłeś, premiera nowego modelu to świetna okazja, żeby nadrobić zaległości. Wiem, jak jest — sam się leniłem, teraz zrobiłem i Tobie polecam.
Koniec ścian tekstu: nowy styl komunikacji
Posprzątane instrukcje to jedno, ale Opus 5.5 zmienił też coś widocznego gołym okiem w każdej odpowiedzi. Jeśli należałeś do osób męczonych tym, jak Opus 5 przeciągał wiadomości i generował ściany tekstu, mam dobrą wiadomość: Anthropic samo się do tego przyznało. Na oficjalnej stronie modelu jest dedykowana sekcja o komunikacji, w której czytamy, że sposób odpowiadania Opusa 5.0 był jednym z najczęstszych tematów feedbacku od użytkowników. Po lewej stronie porównania — jak odpowiadał Opus 5, po prawej — jak odpowiada Opus 5.5. Przy zgłaszaniu poprawki buga model generował o połowę mniej tekstu; przy podsumowaniu wątku, przy tłumaczeniu zmiany w designie — wszędzie krócej.
Ciekawostka: kiedyś, w materiale polecającym skille do Claude Code, wskazałem skilla I‑have‑ADHD, który ludzie masowo instalowali — stąd 52 tysiące gwiazdek na GitHubie. Służył właśnie do ograniczania paplaniny Opusa 5, bo nikt nie chciał czytać elaboratów o czymś, co dało się opisać w kilku słowach. Sam stworzyłem własny styl odpowiedzi (output style), który wgrywa się do Claude Code, żeby inaczej wchodził w interakcje w ramach sesji czy projektu. Tarik po premierze napisał wprost, że nowy sposób komunikacji to efekt feedbacku użytkowników. Skoro Opus 5.5 ma to już ogarnięte, I‑have‑ADHD jest de facto zbędny — ale moim zdaniem własny styl odpowiedzi nadal ma sens, tylko do czego innego. Możesz dzięki niemu sprawić, że Claude nie będzie wyłącznie odwalał za Ciebie czarną robotę, ale dodatkowo wytłumaczy, co i dlaczego zrobił. To przydatne, jeśli chcesz rozumieć, co się dzieje — i czegoś się nauczyć, zamiast ślepo zlecać zadania sztucznej inteligencji.
Wcześniej styl odpowiedzi przełączało się tylko w terminalu lub IDE; teraz jest dostępny również w aplikacji desktopowej. W ustawieniach, w zakładce Claude Code, zjeżdżasz do pozycji „Output Style” i zmieniasz sposób, w jaki Claude będzie z Tobą rozmawiał. Do wyboru domyślny, zwięzły, wyjaśniający, nastawiony na naukę, proaktywny — a ja mam do tego własne: styl „Opus plus nauka”, gdzie Claude skraca wypowiedzi i przy okazji uczy, oraz „Robert ADHD”, który łączy oba podejścia.
Myślniki niemal wyeliminowane
Jeszcze jedna zmiana widoczna gołym okiem, zwłaszcza jeśli sporo piszesz z AI. Arena AI (dawniej LMArena — platforma, na której ludzie porównują i oceniają odpowiedzi różnych modeli) policzyła długie myślniki*(Informacja dodatkowa: tzw. em dash, typowy sygnał tekstu generowanego przez AI.)*, które modele tak lubią. Na 1000 słów Opus 5 stawiał ich 15,2, a Opus 5.5 — tylko 0,8. To redukcja o około 95%. W moim przypadku zakaz długich myślników to jedna z pierwszych zasad stylu, bo to najszybszy sygnał, że tekst pisała maszyna — a 0,8 to wciąż nie zero, więc ta reguła u mnie zostaje. Wniosek szerszy: skoro model trzyma się reguł, które mu dasz, wpisuj w instrukcje konkretne nawyki, których nie chcesz — „bez myślników”, „bez średników” — zamiast ogólnych „pisz naturalnie” czy „pisz jak człowiek”.
Praktyka, część pierwsza: opis filmu i miniatury
Tyle teorii. Teraz — zgodnie z obietnicą — pokażę, co z tym wszystkim realnie robię, bo to, co widziałeś do tej pory, to dopiero wierzchołek góry lodowej.
Zacznę od dwóch rzeczy, które robię przy każdym materiale na YouTube: opisie filmu i miniaturach.
Do opisu użyłem Opusa 5.5 na „high”, włączyłem mojego skilla do opisów YouTube i podałem link do materiału wideo. Poprosiłem o transkrypcję przez API AssemblyAI — do 50 dolarów darmowa na start, co oznacza ponad setkę godzin materiału, więc trudno to przejeść. Mam też lokalny model transkrypcji: wolniejszy, ale darmowy, więc skill daje mi wybór między szybkim, płatnym transkryptem przez API a darmowym, lecz powolnym. W samym opisie linki się zgadzały, poprawek niewiele, propozycje pasowały do tematu. Najbardziej podobało mi się to, że model świetnie wyłapał rozdziały (znaczniki czasu) na podstawie transkryptu — z czym Opus 5 radził sobie co najwyżej przeciętnie.
Drugi przypadek: miniatury. Poprosiłem Opusa 5.5 o odpalenie serwera Tumforge — mojej aplikacji do generowania miniatur, w której grafikę robi się zwykłą rozmową z agentem. Chodziło o miniaturę do odcinka o Grokbocie, tę z trójwymiarową ósemką. Do dzieła ruszył mój skill „Tumforge Brainstorm”, który stworzyłem do przemyślenia miniaturek tak, żeby nie kopiować od innych, tylko stworzyć coś własnego na bazie mojej kreatywności i wsparcia modelu. Opus się połączył, było kilka rund propozycji, rozmawialiśmy, podrzucałem mu zasoby graficzne, on wgrywał je do aplikacji. Pokazał koszt przed wywołaniem, zgodziłem się, wskazałem styl — przy czym przy okazji wyszły dwa potknięcia w kreatorze. Zdarza się, tych miniaturek jest sporo. Efekt przeszedł moje oczekiwania.
I teraz sedno: wcześniej, żeby wygenerować tak dobre miniatury i przekminić je w procesie burzy mózgów, musiałem korzystać albo z GPT‑6 Sol, albo z GPT‑6 Asty, bo inaczej to tak dobrze nie działało. Albo z Fable 5.1 na niskim lub średnim poziomie rozumowania, co było drogie. Opus 5.0 nie dawał sobie rady. Tymczasem Opus 5.5 na „high” poradził sobie znakomicie i zaskoczył mnóstwem dobrych pomysłów. Jestem Turbo zadowolony, bo — jeśli możemy tak to nazwać — jest wyraźnie bardziej kreatywny od poprzednika.
Praktyka, część druga: spot promocyjny zrobiony nocą przez agenta
To jednak wciąż mały wierzchołek góry lodowej. Pod spodem jest coś, moim zdaniem, ciekawszego — coś, co pokazuje moc tego modelu: spot promocyjny dla Tumforge, aplikacji, która już niedługo ujrzy światło dzienne (lista zainteresowanych wkrótce będzie publicznie dostępna, a aplikację buduję praktycznie w całości na weekendowych transmisjach na żywo, więc możesz zobaczyć, jak wszystko powstaje).
Do dzieła przyszedł czas na jeszcze jednego skilla, podrzuconego przez bota EOS na naszym Discordzie: skill „brag” z ponad 12 tysiącami gwiazdek na GitHubie. Działa tak, że jeśli masz projekt — w moim przypadku Tumforge — możesz zamienić go w wideo startowe dla swojego produktu. Najpierw skorzystałem z innego skilla, opartego na skillach od Nvidii, by przeskanować repozytorium i sprawdzić, czy nie ma w nim nic złego, czego nie chciałbym instalować. Dopiero potem poprosiłem Claude’a o instalację.
Zleciłem przejrzenie dwóch projektów: samej aplikacji oraz strony docelowej. Po pierwszych przekminach powstała wersja pierwsza — niezadowalająca. Poprosiłem więc o prompt, który wkleję w nowej sesji, żeby wrócić do tematu z czystym kontekstem — to też ważna rzecz. I zaczęła się magia. Wkleiłem prompt, użyłem skilla „brag”, powiedziałem, że wersja pierwsza nie porywa, żeby zostawił ją w spokoju i zbudował wszystko od nowa. Dodałem dostęp do Hixfield, żeby znalazł i ogarnął zasoby graficzne. Pierwsze podejście też mi się nie podobało, więc przeszedłem do trzeciej konwersacji — i zrobiło się ciekawie.
Tym razem podszedłem do tematu inaczej: dałem Opusowi 5.5 dostęp do Hixfield (platformy, na której może generować różne rzeczy), do przeglądarki agentowej, z której korzystam i o której wspominałem przy okazji odcinków o Astrze w Codexie, oraz poprosiłem, żeby przejrzał Pinteresta i Dribbble w poszukiwaniu inspiracji. Do tego dostęp do kupionych za kilkanaście złotych zasobów graficznych, których Claude mógł używać przy montażu i generowaniu fragmentów. Na koniec uruchomiłem komendę /gal, żeby mógł działać całą noc, gdy odejdę od komputera — chciałem zobaczyć, co przygotuje. Claude stworzył moodboard, znalazł masę inspiracji. Rano, gdy wstałem, czekały na mnie trzy różne wersje. Nadal widziałem mankamenty, więc krótką rozmową — screeny tego, co mi nie pasuje, plus konkretne uwagi — doprowadziłem do finalnej formy. Moim zdaniem wygląda to świetnie.
I tak jak zawsze wspomnę, bo pewnie pojawią się głosy, że człowiek zrobiłby to lepiej. Owszem, zrobiłby. Tyle że przy projekcie pobocznym, robionym „fanowsko”, bez budżetu rzędu kilkuset, a najpewniej kilku tysięcy złotych na zlecenie takiego wideo, uważam, że Opus 5.5 spisał się wzorowo — a efekt jest wystarczająco dobry, żeby podzielić się nim ze światem i umieścić na stronie. Jeśli chcesz odcinek pokazujący cały ten proces krok po kroku, zostaw komentarz „#wideo” — przy większym zainteresowaniu chętnie nagram.
Praktyka, część trzecia: „kaseciak 3000”, czyli odtwarzacz zrobiony na żywca
Jeszcze jeden przykład z sobotniej transmisji. Dave napisał na czacie, że przydałoby się intro z muzyczką i odliczaniem dla osób czekających na start. Najpierw sięgnąłem po Codex z GPT‑6 Sol na „high” — właśnie po to, by go przetestować; wybrałem go też dlatego, że za darmo generuje obrazy. Razem wygenerowaliśmy planszę, którą Codex ustawił w OBS-ie (narzędziu do transmisji). Potem poprosiłem go o prompty do Suno AI, czyli narzędzia do generowania muzyki, z którego korzystam choćby do intro moich materiałów. Powstało kilkanaście utworów, jeden trafił do planszy. Pomyślałem jednak, że fajnie byłoby mieć chillową muzykę w tle podczas klikania — ludzie wielokrotnie o to prosili.
Pojawił się problem: miałem muzykę, ale nie miałem odtwarzacza, bo nie słucham muzyki z plików — korzystam ze Spotify, YouTube Music i tym podobnych. Ludzie na czacie napisali: „zrób własny”. Więc odpaliłem Opusa i zrobiliśmy prosty odtwarzacz. Pierwsza wersja była bardzo zła, więc popisaliśmy, popromptowaliśmy — i zjadło to naprawdę niewiele limitu. Ten sobotni stream był leniwy: robiliśmy drobiazgi, ale takie, które umilą oglądanie w przyszłości.
W rezultacie powstało narzędzie o nazwie „kaseciak 3000” — nazwę wymyślił sam Claude. Można wrzucić dowolny utwór, jest regulacja głośności, przejścia między utworami, pętla, losowe odtwarzanie, tryb miksowania (wtedy kolory się zmieniają, a „sąsiedzi są zaniepokojeni”, jak głosi opis). Wgraliśmy też kilka skórek: PRL, Lamę, Winampa (daj znać, czy kojarzysz czasy, gdy Winamp chodził na Windowsie XP), Miami, kieszonkowca i okienko 95. Mała pierdółka — ale pokazuje, że żyjemy we wspaniałych czasach: zamiast szukać gotowego rozwiązania, w kilka minut możesz stworzyć własne. Kiedy pytałem programistów na czacie, mówili, że zakodowanie czegoś takiego przed erą AI zajęłoby znacznie więcej niż ta godzinka w tle.
Werdykt
Czas odpowiedzieć na pytanie z tytułu: czy tamten koń z mema ma faktycznie głowę? Dla mojej codziennej roboty — tak. Opus 5.5 jest na razie moim ulubionym modelem do codziennego użytku.
A jeśli miałbym, byś z tego materiału wyniósł dwie rzeczy, to właśnie te: po pierwsze, ustawiaj poziom rozumowania świadomie, zamiast zostawiać ten, który przyszedł wraz z aktualizacją. Po drugie, przy każdej zmianie modelu posprzątaj swoje instrukcje — zleć audyt i dopasuj projekt do aktualnych warunków, a nie do tych z przed miesiąca, które były może i w porządku, ale jakiś czas temu.
Ciekawi mnie, na jakim poziomie rozumowania Ty pracujesz z Opusem 5.5 na co dzień i czy też masz wrażenie, że limit ledwo rusza. Daj znać w komentarzach. A jeśli chcesz zobaczyć, jak na tle Opusa wypada konkurencja — GPT‑6 Astra w Codexie — miniaturka i link do tamtego materiału czekają poniżej.
Wszystkie linki do omawianych materiałów, narzędzi oraz zniżka do zamkniętej społeczności „Operatorzy AI” znajdują się w opisie filmu na YouTube.