Claude Opus 5.5 to najlepszy model AI, jaki kiedykolwiek wydano (Claude Opus 5.5 is the greatest AI model ever released)

2026-09-24 • Alex Finn • AI zagraniczne •opinia •waga 3/5 •13 min czytania

Recenzja Claude Opus 5.5: inteligentniejszy od ChatGPT 6 Astra, szybszy i tańszy od dotychczasowych liderów, a do tego mówi ludzkim językiem. Praktyczne wnioski dla pracy z kodem i burz mózgów.

Robocza publikacja redakcyjna na podstawie publicznego transkryptu YouTube. Źródło: YouTube.

O czym jest ten film

  1. Autor dostał od Anthropic przedpremierowy dostęp do testowanego modelu bez podania nazwy — był pewien, że testuje kolejną wersję Fable, a to okazał się Opus 5.5.
  2. Jego zdaniem nowy Opus jest zdecydowanie inteligentniejszy od Fable i od ChatGPT 6 Astra — to najinteligentniejszy model na rynku.
  3. Do tego działa wyraźnie szybciej niż poprzednie wersje Opusa, a nad Fable i Astrą ma przewagę „o całą ligę”.
  4. Anthropic obniżyło cenę — ruch, który zdaniem autora praktycznie się nie zdarza; stawka na to, że dobry model po prostu będzie częściej używany.
  5. W benchmarkach tryb „wysoki” Opusa 5.5 wypada lepiej niż tryb „maksymalny” Astry 6 — ułamkowym kosztem.
  6. Główny zarzut wobec konkurencji: od czasów Opusa 4.8 modele wszystkich firm mówiły martwym żargonem; Opus 5.5 ma przywrócić ciepły, ludzki ton znany z Opusa 4.5 i Soneta 3.5.
  7. Demonstracja: złożona strzelanka 3D z widokiem z góry (inwentarz, mapa, wrogowie, system łupów, ewakuacja) powstała w kilku promptach, z bardzo małą liczbą błędów.
  8. Model sam znajduje usterki w kodzie pisanym przez inne modele — nawet gdy nikt nie prosi go o debugowanie.
  9. Przykłady pomysłowości: aplikacja na Apple Watch do rozmów z agentami AI, którą model sam wgrał na zegarek, oraz system lokalnych modeli rozstawiony na siedemnastu komputerach.
  10. Wada premiery: narzędzia wokół Claude Code (m.in. tryb głosowy) ustępują produktom OpenAI, choć autor spodziewa się szybkich poprawek.

10 najważniejszych takeaways — z kontekstem zastosowania

1.Zmiana lidera w trzech kategoriach naraz: inteligencja, szybkość, cena

Na czym polega: Według autora Opus 5.5 jest najinteligentniejszym modelem na rynku, wyraźnie szybszym od poprzedników i jednocześnie tańszym — a Anthropic dodatkowo obniżyło cennik. Takie połączenie zdarza się bardzo rzadko.

Jak stosować: Jeśli od miesięcy pracujesz na jednym modelu, to dobry moment na świewe porównanie. Przepuść ten sam zestaw zadań testowych przez swój obecny model i przez nowego Opusa, mierząc czas wykonania i koszt.

Na co uważać: To entuzjastyczna recenzja osoby z przedpremierowym dostępem, nie niezależna analiza. Benchmarki producenta zawsze weryfikuj na własnych przykładach.

2.Licz koszt pojedynczego zadania, nie tylko cennik

Na czym polega: Autor podkreśla, że model jest tańszy „na zadanie” — doprowadza sprawę do końca przy mniejszym zużyciu, więc realny koszt pracy spada bardziej, niż sugeruje sama tabela cen.

Jak stosować: Przez tydzień zapisuj, ile kosztuje Cię typowe zadanie (np. dopisanie jednej funkcji) na starym i nowym modelu. Porównuj rachunek końcowy, a nie ceny tokenów.

Na co uważać: Tani model kusi do zadawania poleceń „na hurra”. Jeśli przestaniesz dbać o kontekst i precyzję promptów, oszczędności zjedzą poprawki błędów.

3.Niższy tryb nowego modelu bywa lepszy niż maksymalny tryb starszego

Na czym polega: W testach autora tryb „wysoki” Opusa 5.5 daje lepsze wyniki niż tryb „maksymalny” Astry 6 — za ułamek ceny.

Jak stosować: Zanim zapłacisz za najdroższą konfigurację u konkurencji, sprawdź, czy tańszy tryb nowszego modelu nie zrobi tej samej roboty.

Na co uważać: Tryby o różnych nazwach u różnych producentów nie są wprost porównywalne — zawsze decyduj testem na własnym zadaniu.

4.Czytelny styl komunikacji to realna oszczędność czasu

Na czym polega: Autor narzeka, że od kilku miesięcy modele wszystkich firm mówiły żargonem („smoke test” i pokrewne) i trzeba było czytać całe akapity, żeby wyłuskać sens. Opus 5.5 raportuje krótko i po ludzku: co się dzieje, ile potrwa, co wymaga decyzji użytkownika.

Jak stosować: Tam, gdzie dużo czytasz odpowiedzi modelu — praca nad kodem, raportowanie postępów — zwięzły styl naprawdę skraca pracę. Jeśli narzędzie zalewa Cię żargonem, proś wprost o komunikat w trzech zdaniach: status, czas, następny krok.

Na co uważać: Krótka odpowiedź nie jest gwarancją poprawnej. Zwięzły raport też trzeba zweryfikować.

5.Silniejszy model świetnie sprawdza się jako recenzent kodu innych modeli

Na czym polega: Autor wrzucał Opusowi 5.5 kod napisany przez Astrę 6; nowy model samodzielnie wyłapywał usterki, choć nikt nie prosił go o debugowanie, i dopiero potem pytał, czy ma je naprawić.

Jak stosować: Wprowadź zasadę „drugiej pary oczu”: kod wygenerowany przez jeden model przepuszczaj przez drugi z prośbą o listę problemów, zanim cokolwiek wdrożysz.

Na co uważać: Recenzent-model bywa nadgorliwy i też się myli. Traktuj jego listę jako hipotezy do sprawdzenia, nie wyroki.

6.Złożone projekty potrafią powstać w kilku wymianach — jeśli zadajesz konkretne cele

Na czym polega: Strzelanka 3D z pełnym inwentarzem, mapą, wrogami, systemem łupów i ewakuacją powstała w „kilku promptach”, a kod okazał się wyjątkowo mało buggowany.

Jak stosować: Zacznij od opisu całości (jakie systemy ma mieć produkt), potem iteruj po jednym mechanizmie i po każdej zmianie pros o testy. Nie składaj projektu z dziesięciu oderwanych, drobnych poleceń.

Na co uważać: Demonstracje z górnej półki łatwo uogólnić. Twoja aplikacja z prawdziwym stanem, integracjami i użytkownikami będzie trudniejszym poligonem niż gra pokazowa.

7.Odpytuj model o pomysły, nie tylko o wykonanie

Na czym polega: Na pytanie „co można zrobić z nowym Apple Watch?” model zaproponował i zbudował aplikację do rozmowy z agentami AI prosto z nadgarstka; na pytanie o siedemnaście komputerów — rozstawił cały system lokalnych modeli.

Jak stosować: Przy każdym nowym sprzęcie, API czy zasobie w firmie zrób z modelem kilkunastominutową sesję: „jak byś to wykorzystał, co byś zbudował, co najmniej oczywistego?”. Zapisz trzy pomysły, jeden przetestuj.

Na co uważać: Świeże pomysły trzeba filtrować pod kątem wykonalności i bezpieczeństwa — entuzjazm modelu nie zastępuje oceny, czy wdrożenie w ogóle ma sens.

8.Model potrafi domykać całe procesy — pilnuj jednak uprawnień

Na czym polega: Opus 5.5 sam znalazł sposób na wgranie aplikacji deweloperskiej na telefon i zegarek autora, choć zegarek nie był podłączony do niczego.

Jak stosować: Deleguj nie tylko pisanie kodu, ale i wdrożenie — w kontrolowanym środowisku: osobny katalog, konto testowe, ograniczone uprawnienia, żeby „pomocna inicjatywa” nie weszła w miejsca, których ruszać nie chcesz.

Na co uważać: Samodzielność agentów rośnie szybciej niż mechanizmy kontroli. Prowadź rejestr zmian, które wprowadza — bez tego trudno cofnąć to, co popsuł.

9.Jakość modelu to nie to samo, co jakość produktu wokół niego

Na czym polega: Autor wprost przyznaje, że otoczka narzędziowa Claude Code — zwłaszcza tryb głosowy — ustępuje konkurencji z ChatGPT, choć sam model uważa za najlepszy na rynku.

Jak stosować: Dobieraj narzędzie do zadania: do rozmowy głosowej i szybkich interakcji może lepiej sprawdzi się produkt konkurencji, do cięższych prac koncepcyjnych i kodu — Opus. Nie musisz mieć jednego narzędzia do wszystkiego.

Na co uważać: Luki w narzędziach bywają krótkotrwałe (autor spodziewa się poprawek). Przed migracją sprawdź aktualny stan produktu, a nie recenzje sprzed miesiąca.

10.Powrót konkurenta to sygnał do odświeżenia własnych porównań

Na czym polega: Autor uznaje, że Anthropic po pięciu miesiącach „wraca do gry”, a ożywiona rywalizacja firm oznacza lepsze i tańsze modele dla użytkowników.

Jak stosować: Gdy rynek się rusza, powtórz swój test porównawczy: te same zadania, te same kryteria (jakość, czas, koszt) — najlepiej raz na kwartał. O zmianie podstawowego narzędzia decyduj na podstawie wyników, nie entuzjazmu z sieci.

Na co uważać: „Najbardziej ekscytujące tygodnie w historii AI” to fraza z języka marketingu. Wartość nowości widać zwykle dopiero po tygodniach codziennej pracy, nie po prezentacji.

Redakcyjne tłumaczenie

Model, którego oddawać nie chciałem

Zacznę od wyznania: Claude Opus 5.5 to najlepszy model AI, jaki kiedykolwiek trafił na rynek, i właśnie z nim warto teraz pracować przy praktycznie każdym zadaniu. Miałem sporo szczęścia — Anthropic dało mi dostęp przed premierą i używałem go bez ustanku. Gdy kilka dni temu z powrotem mi go odebrali, szczerze poczułem smutek.

Zanim pokażę demonstracje, jedno ustalenie: nowy Opus jest inteligentniejszy od Fable i to nie jest cienka przewaga. Jest też inteligentniejszy od ChatGPT 6 Astra. To najinteligentniejszy model dostępny dziś na rynku — a przy tym wyraźnie szybszy i wyraźnie tańszy.

(Informacja dodatkowa: Astra to odmiana ChatGPT 6 od OpenAI; Fable to drugi z modeli, z którymi autor zestawia nowego Opusa.)

„Przysiągłbym, że to Fable 6”

Anthropic nie zdradziło nazwy testowanej wersji. Usłyszałem tylko: „masz tu model, sprawdź, co sądzisz”. Byłem gotów przysiąc, że mam przed sobą Fable 5.5 albo Fable 6 — tak wielki był skok jakości względem wyników, które dawało mi Fable. Dziś rano przyszła wiadomość: „A tak w ogóle — to był Opus 5.5”. Pierwsze, co powiedziałem, brzmiało: „Nie, niemożliwe. To nie może być Opus”.

Wrzucałem mu kod pisany przez Astrę, a on reagował mniej więcej tak: „Ten kod jest obrzydliwy, chodź, ja to posprzątam”. Masowo wyłapywał usterki w niemal wszystkim, co kiedykolwiek napisały dla mnie inne modele.

Szybkość i cena: takie otwarcie zdarza się raz

Tempo pracy jest niewiarygodne. Nie pamiętam, żeby jakikolwiek Opus działał kiedyś tak szybko. Z Fable i Astrą nie ma co porównywać — to zupełnie inna liga — ale nawet na tle własnych poprzedników nowość po prostu śmiga. Na wczesnych testach myślałem sobie: musieli tu dokonać jakiegoś przełomu, bo to odpowiada błyskawicznie.

Dziś przyszła premiera. Gdy zobaczyłem benchmarki i cennik, długo nie mogłem uwierzyć: Anthropic realnie obniżyło cenę. Nie tylko pojedyncze zadanie wychodzi taniej niż w jakimkolwiek innym modelu — spadła także zwykła, katalogowa cena. Takich ruchów praktycznie się nie widuje: firma sama decyduje się zarobić mniej. Logika jest chyba taka — i jest to dobra logika — że przy naprawdę dobrym modelu ludzie będą go po prostu więcej używać, więc przychód i tak wzrośnie. Wygrywają obie strony: cena w dół, koszt zadania w dół, inteligencja wysoko w górę.

Na wykresach porównawczych nic się nawet nie zbliża. Tryb „wysoki” w Opusie 5.5 osiąga lepsze wyniki niż tryb „maksymalny” Astry 6 — ułamkowym kosztem. Rzadko się zdarza, żeby jedna premiera wygrywała jednocześnie na szybkości, inteligencji i cenie. A tu komplet: wszystko poprawione, wszystko w czołówce swojej kategorii. To zapiera dech.

[Fragment sponsorowany] Pięć umiejętności Claude’a do pracy z treścią

Skoro zamierzasz pracować z Opu­sem 5.5, wypada wycisnąć z niego maksimum — a w tym pomagają Claude Skills. (Informacja dodatkowa: Claude Skills to instalowalne zestawy instrukcji, które uczą Claude’a powtarzalnych procesów, na przykład tworzenia treści w ustalonym stylu.) Wiele osób nie wie, jak je skonfigurować, i tu wchodzi sponsor tego odcinka, HubSpot dla startupów. Opublikowali darmowy pakiet pięciu umiejętności, które pomagają założycielom firm tworzyć treści. Po ich instalacji przestajesz zaczynać każdy prompt od zera — pracujesz z systemem, który zna Twoje procesy. W zestawie jest m.in. kreator głosu, dzięki któremu teksty brzmią jak Ty, oraz umiejętność cotygodniowego zbierania, zamieniająca notatki i wiadomości ze Slacka w gotowe materiały. Mój faworyt to generator haków i kątów: wrzucam zgrubne pomysły, dostaję zaczepienia, ujęcia tematyczne i szkice — tworzenie treści robi się dzięki temu przyjemne. Całość pozwala w niecałe dwie godziny przerobić surowe notatki na treści gotowe do publikacji. Pakiet jest w linku pod filmem.

Model, z którym znów chce się rozmawiać

Wszystko to jednak nie jest najlepszą częścią premiery. Rozmawiam z tym modelem nieprzerwanie od tygodnia i mówię wprost: to najlepszy rozmówca w historii AI.

Od kilku miesięcy denerwuje mnie przypadłość całej branży: każdy model wydany mniej więcej od czasów Opusa 4.8, czyli od maja, był nie do wytrzymania. Dotyczy to wszystkich firm — ChatGPT, Groka, wszystkich. Modele wykształciły dziwną mowę, którą nie posługuje się żaden człowiek: obce słownictwo, dziwaczny żargon, „smoke test” powtarzany do znudzenia. Przeczytasz akapit takiego komunikatu do końca i pytasz sam siebie: co ja właśnie przeczytałem? To było martwe. To się skończyło — Opus 5.5 naprawił ten problem.

(Informacja dodatkowa: „smoke test” to żargon inżynierów oprogramowania — szybkie sprawdzenie, czy podstawowe funkcje w ogóle działają.)

Przed rokiem zostałem przy Anthropic właśnie dlatego, że ich modele rozmawiały najlepiej: były ciepłe, ludzkie, zwięzłe. Rozmowa z nimi sprawiała przyjemność jak z niczym innym na rynku. Potem to zniknęło — i doprowadzało mnie do białej gorączki. Teraz wreszcie wróciło. Z Opu­sem 5.5 rozmawia się równie dobrze, a może lepiej niż z Opusem 4.5 czy Sonetem 3.5, moim ukochanym klasykiem. Model znów mówi po ludzku.

Tydzień nad grą: raportowanie, którego nie trzeba dekodować

Przez ostatni tydzień budowałem z nim bardzo złożoną grę — a poza tym mnóstwo innych rzeczy — i to moim zdaniem najlepszy materiał na demonstrację. Sposób, w jaki model się odzywa, robi ogromną różnicę. Przykładowy komunikat: „Pełna kompilacja i cztery testy działają w tle. Potrwa to około 30 minut. Dostanę powiadomienie po zakończeniu. Wyników testów jeszcze nie ma. Kompilacja nadpisuje uruchomiony plik, więc musiałem zamknąć Twoją grę”. Tak pisze człowiek.

Gdyby to był Opus 5, Astra 6 albo Grok 4.6 — a to znakomite modele — komunikat wyglądałby tak: „Pełny smoke test zakończony powodzeniem. Funkcjonalność i binaria zresetowały granice. Teraz od Ciebie zależy smoke test dostępności…”. Nie kończące się słowa i żargon. A tutaj dostaję prosto: zbudowaliśmy, wygląda dobrze, oto lista ulepszeń, rzuć okiem na zrzuty i liczby, po testach uruchom grę ponownie. Każdy test zaliczony, do tego przejrzyste wykresy i tabele, wygodne wypunktowania. Miałem wrażenie, że trenowano go z jednym priorytetem: żeby dało się go czytać bez wysiłku.

Pytam: „Mamy w grze sporo problemów, co możemy poprawić?”. Odpowiedź: „Przetestowałem grę. Oto wszystkie błędy, które widzę — między innymi w tym miejscu otrzymałeś 601 obrażeń”. Znów: człowiek.

Recenzent, o którego nikt nie prosił

Do debugowania nowy Opus jest znakomity. Wrzucałem mu porcje kodu napisane w Astrze 6 — powtórzę, świetnego modelu, mojego dotychczasowego pierwszego wyboru — a on znajdował w nich mnóstwo problemów. I nie prosiłem go o debugowanie. Pytałem wyłącznie: „możesz to ulepszyć?”. A on: „Aha, przy okazji — znalazłem całą listę błędów. Mam naprawić?”. Inteligentny i przy tym naturalny.

Strzelanka z kilku promptów

Chcę pokazać głębię myślenia, którą model osiąga w zaledwie kilku wymianach. Ta trójwymiarowa strzelanka ekstrakcyjna z widokiem z góry powstała w kilka promptów. (Informacja dodatkowa: „extraction shooter” to podgatunek strzelanek — schodzisz na mapę, zbierasz łup i musisz wrócić z nim do bazy.) Ma więcej głębi niż to, co budowała dla mnie Astra, a przy tym powstaje czysto, z minimalną liczbą błędów. To moim zdaniem najbardziej niedoceniany aspekt całej premiery: ten model pisze kod praktycznie bez błędów. Nie wiem, jak go trenowano, ale nigdy wcześniej nie dostałem tak dużej proporcji kodu działającego od razu.

Zobaczcie sami. Kompletny system inwentarza broni. Mapa z kilkoma różnymi lokacjami. Wrogowie, których można wyeliminować. Pełny system łupów z odkrywaniem znajdziek i ekwipunkiem. Modelowanie 3D praktycznie na poziomie Astry 6. Wreszcie cały mechanizm ewakuacji: przytrzymuję E i wychodzę z mapy, zabierając cały zebrany łup. A przy okazji — zagralibyście w to? Dajcie znać w komentarzach.

Pomysły, na które sam bym nie wpadł

Druga mocna strona: pomysłowość. Jeśli jesteś jak ja, dużo czasu spędzasz na wymyślaniu pomysłów razem z modelem. Kupiłem Apple Watch Ultra 4 i pytam: „Pomóż mi wymyślić, co nieoczywistego można z tym zrobić — jakie aplikacje wgrać, co ciekawego z AI?”. Wysypał pomysły, rozpisał je — i finalnie mogę dziś rozmawiać z moimi agentami przez nadgarstek. Zbudował dedykowaną aplikację na zegarek: widzę na nim wszystkich agentów pracujących nad kodem, a jednym dotknięciem mogę do nich mówić albo pisać — w ruchu, bez telefonu. Powiedziałem „brzmi dobrze”, a on zabrał się za wdrożenie, łącznie ze sposobem wgrania aplikacji deweloperskich na telefon i zegarek. Ja nie mam pojęcia, jak instaluje się aplikacje na zegarku. Na koniec mówi: „Przy okazji — wgrałem aplikację na Twój zegarek”. Odpowiadam: „Nie, nie wgrałeś”. Patrzę na nadgarstek — a tam siedzi aplikacja. Zegarek nie był do niczego podłączony. Sam to rozgryzł.

Zapytałem też: „Mam tu siedemnaście komputerów, co ciekawego można zrobić z lokalnymi modelami?”. Rozstawił mi cały lokalny system. Jeśli więc używasz AI do przemyśliwania pomysłów — a powinieneś: „jak byś to wykorzystał? co byś tu zbudował?” — to najlepszy model do takich rozmów, jaki kiedykolwiek powstał.

Słaby punkt: narzędzia wokół modelu

Jest jednak i wada. Czy otoczka narzędziowa Claude Code dorównuje tej znanej z ChatGPT? Nie. ChatGPT ma tryb głosowy wybitnej klasy. Claude też ma tryb głosowy, ale nie tak dobry — choć spodziewam się, że Anthropic szybko doścignie konkurencję. (Informacja dodatkowa: autor mówi tu o „harnessie”, czyli pełnej otoczce produktowej wokół modelu — interfejsie, trybie głosowym, integracjach. Sam model to jedno, narzędzia dokoła to drugie.) Otoczka jeszcze nie dorównuje, ale model jest tak dobry, że moim zdaniem po prostu trzeba z niego korzystać.

Anthropic wraca do gry

Ta premiera rozwiązuje w zasadzie wszystkie problemy, które Anthropic ciągnęło od dłuższego czasu: od efektywności użycia, przez przyjemność rozmowy, po samo załatwianie spraw. Wreszcie wrócili. Przez ostatnich pięć miesięcy byli poza grą — co było sporym zmartwieniem — ale teraz są z powrotem. A kiedy firmy wracają i konkurują, zawsze wygrywa użytkownik.

Przeżywamy właśnie dwa najbardziej ekscytujące tygodnie w historii AI — obecny i przyszły. Subskrybuj kanał i włącz powiadomienia, żeby nadążać za nowościami, pokazami i materiałami, które znajdziesz tylko tutaj. Dziękuję, że oglądacie, i do zobaczenia w następnym odcinku.