Wspólny mianownik
Tematem dnia jest premiera modelu Claude Opus 5. Trzy niezależne kanały reagują na nią „na gorąco” i — mimo różnych metod testowania — dochodzą do zbieżnego wniosku: nowy model wyznacza wyższy poziom w benchmarkach kodowania i pracy umysłowej niż wcześniejszy Fable 5, a przy tym jest wyraźnie tańszy.
Powtarzającym się motywem jest właśnie relacja jakości do ceny. Zarówno Nate Herk, jak i Nick Saraev podkreślają, że Opus 5 kosztuje mniej więcej połowę tego, co Fable 5, a jakość jest porównywalna lub o kilka punktów procentowych lepsza. Nate Herk dodaje, że Opus 5 kosztuje tyle samo co poprzednik Opus 4.8, dając przy tym zauważalnie wyższą wydajność. Pojawiają się też konkretne liczby: skok w agentowym kodowaniu w terminalu do 43% (wobec 33% dla Fable 5 i 21% dla Opus 4.8) oraz duża poprawa w rozwiązywaniu nowych problemów.
Kanały zgadzają się co do kierunku, ale różnią się akcentami: dla jednych to jednoznaczny przełom cenowy, dla innych — świetny model z realnymi wadami (osobowość, limity użycia). Wszyscy testują wersje modeli osadzone w hipotetycznej, „przyszłej” narracji (Opus 5, Fable 5, GPT 5.6), więc nazwy i liczby warto traktować jako deklaracje autorów, a nie oficjalne dane.
Jak to ujmują poszczególne kanały
Nick Saraev — I Spent $400 Benching Opus-5. Here’s What It Can Do
Nick Saraev wydał 400 dolarów na testy i opiera ocenę nie tylko na benchmarkach, ale przede wszystkim na „wyczuciu” jakości generowanych rezultatów. Pokazuje długą listę aplikacji 3D i symulacji wygenerowanych niemal bez pracy programisty. Jego główna teza: jakość jest o kilka punktów procentowych lepsza od konkurencji, ale najważniejsza jest znacznie niższa cena — Opus 5 to „nieco inteligentniejszy Fable 5 za mniej więcej połowę kosztu”. Zwraca też uwagę na najlepszy wynik w pomiarze zachowań niezgodnych z intencją. Pełne opracowanie.
Nate Herk | AI Automation — Claude Opus 5 is Going to Save You Money
Nate Herk daje świeżą reakcję na premierę z naciskiem na benchmarki i oszczędność. Wskazuje, że Opus 5 wyznacza nowy stan wiedzy w kilku testach kodowania i pracy umysłowej — m.in. 43% w agentowym kodowaniu w terminalu oraz skok w „novel problem-solving” z 1,5% do 30%. Podkreśla mocną stronę modelu: weryfikację własnej pracy i iterowanie aż do skutku, co napędza pętle agentowe. Zapowiada pełny eksperyment porównawczy Opus 5 vs Fable 5 jeszcze tego samego dnia. Pełne opracowanie.
Alex Finn — Claude Opus 5 DESTROYS Fable 5
Alex Finn przeprowadza własny zestaw pięciu praktycznych testów („Finn benchmark”), w których Opus 5 wygrywa cztery z pięciu, przegrywając jedynie test wytrzymałości mostu. Jest jednak najbardziej krytyczny: wskazuje trzy poważne wady — przegadaną, irytującą osobowość modelu, niższe limity użycia (i związany z nimi „lęk przed licznikiem”) oraz harness Claude Code wciąż ustępujący aplikacji ChatGPT, zwłaszcza w trybie głosowym. Jego wniosek to stack mieszany: Opus 5 do trudnych problemów, Fable 5 do planowania, ChatGPT jako codzienne narzędzie. Pełne opracowanie.
Rozbieżności i niepewności
- Skala przewagi. Nate Herk i Nick Saraev przedstawiają premierę głównie jako zwycięstwo cenowo-jakościowe; Alex Finn, mimo wyniku 4/5 w swoich testach, mocno akcentuje wady i nie decyduje się na pełne wdrożenie.
- Wady modelu. Osobowość i limity użycia to zarzuty Alexa Finna — pozostałe kanały ich nie eksponują. To w dużej mierze subiektywne wrażenia, nie zmierzone dane.
- Liczby z benchmarków. Konkretne wartości (43% w terminalu, ~26% w „Automation Bench”, połowa kosztu Fable) pochodzą od autorów i ich własnych testów — nie są to niezależnie zweryfikowane wyniki.
- Kontekst modeli. Wszystkie materiały operują nazwami z hipotetycznej przyszłości (Opus 5, Fable 5, GPT 5.6). Same premiery i porównania to narracja twórców, a nie potwierdzone fakty rynkowe.
- Metody różnią się. „Wyczucie” Nicka, benchmarki Nate’a i pięć testów Alexa mierzą różne rzeczy — zbieżność wniosków jest sygnałem, ale nie dowodem.
Co z tego wynika dla Ciebie
- Jeśli pracujesz agentowo w Claude Code, warto zaktualizować narzędzie i samodzielnie przetestować Opus 5 na własnych, realnych zadaniach — zgodnie z zachętą Nate’a Herka.
- Traktuj cenę serio: powtarzającym się argumentem jest „porównywalna jakość za około połowę kosztu” względem Fable 5. Policz koszt na całe zadanie, nie tylko cenę tokenów.
- Nie ignoruj wad z relacji Alexa Finna — sprawdź, czy przegadana osobowość i limity użycia nie przeszkadzają w Twoim workflow, zwłaszcza przy pracy głosowej.
- Rozważ stack mieszany (mocny model do trudnych problemów + tańszy do planowania/wykonania) zamiast jednego modelu do wszystkiego.
- Obserwuj zapowiedziane, pełniejsze porównania (Nate Herk zapowiadał eksperyment Opus 5 vs Fable 5 tego samego dnia) — pierwsze wrażenia „na gorąco” bywają korygowane.
- Do decyzji o wdrożeniu podchodź jak do własnego benchmarku: wyniki autorów są sugestią, nie gwarancją dla Twoich zadań.
Źródła
- Nick Saraev — „I Spent $400 Benching Opus-5. Here’s What It Can Do”: opracowanie · YouTube
- Nate Herk | AI Automation — „Claude Opus 5 is Going to Save You Money”: opracowanie · YouTube
- Alex Finn — „Claude Opus 5 DESTROYS Fable 5”: opracowanie · YouTube