Temat dnia · 2026-09-01

Anthropic wydaje Fable 5.1 — mocniejszy research, niższe koszty, luźniejsze bezpieczniki

Alex Finn, Nate Herk | AI Automation, Nick Saraev 6 min czytania

Anthropic udostępnił Claude Fable 5.1 (i bliźniaczego Mythos 5.1): ceny za token bez zmian, ale zadania kosztują 25–50% mniej, wyniki w badaniach naukowych podwoiły się, a filtry rzadziej blokują niewinne zapytania.

Wspólny mianownik

1 września Anthropic udostępnił Claude Fable 5.1 wraz z bliźniaczym Mythos 5.1 — modelem o łagodniejszych zabezpieczeniach, dostępnym wyłącznie przez programy weryfikacyjne z obszaru cyberbezpieczeństwa i nauk o życiu. Nowości trafiły od razu do aplikacji desktopowej Claude, terminala, API oraz na Amazon Web Services, Google Cloud i Microsoft Azure. Trzy kanały omawiały premierę tego samego dnia, dwa z nich „na gorąco”, kilka–kilkanaście minut po ogłoszeniu.

Najmocniej powtarzającym się wątkiem jest ekonomia. Stawki za tokeny pozostały bez zmian (10 USD za milion wejściowych, 50 USD za milion wyjściowych), ale model zużywa ich mniej na to samo zadanie. Szacunki kanałów układają się w spójny przedział: ok. 25% taniej w typowych zastosowaniach, do ok. 40–50% przy pracy mocno agentowej, głównie dzięki tańszym odczytom z pamięci podręcznej. Nick Saraev przelicza to na skuteczność za dolara: przy budżecie ok. 17 dolarów na zadanie Fable 5.1 osiąga niemal 40% skuteczności wobec ok. 15% u poprzednika, czyli około 2,5 raza więcej za tę samą kwotę.

Drugi wspólny wątek to badania naukowe. W Terminal Bench Science 1.0 wynik przekracza 50% wobec ok. 25–29% dla Fable 5 i Opusa 5 — podwojenie, które Alex Finn potwierdza też własnymi testami. Do tego dochodzi rekord w kodowaniu agentowym (55,8% wobec 42% u Fable 5 i 37,3% u GPT-5.6-Sol), postęp w obsłudze komputera (OSWorld 2.0: 77,9%) oraz niemal podwojona skuteczność w automatyzacji procesów biznesowych (z 17,1% do 31,4%).

Trzeci punkt styczny to zabezpieczenia. Wszystkie trzy kanały odnotowują, że model rzadziej odmawia bez powodu — Saraev podaje 60% mniej fałszywych alarmów na niewinne zapytania i 85% rzadsze cofanie do słabszego modelu przy pytaniach biologicznych i medycznych. Nate Herk zwraca uwagę na kontekst czasowy: poprawka pojawia się kilka godzin po publikacji badań Anthropic, w których starszy model Claude celowo trenowano do hakowania nagrody.

Jak to ujmują poszczególne kanały

Alex Finn — Claude Fable 5.1 just dropped and I can’t believe it…

Finn traktuje premierę jako skok jakościowy, a nie typową drobną aktualizację „,1”, i opiera ocenę na własnych testach: symulator kolejki górskiej 3D, wyłapywanie błędów w losowym repozytorium GitHub, zadanie agentowe na plikach i odtwarzanie apple.com. Jako jedyny przekłada premierę na konkretne działania: audyt własnej konfiguracji agentów, ponowne przepuszczenie starych sesji burzy mózgów przez nowy model i zbudowanie własnego, powtarzalnego zestawu testów zamiast ufania cudzym benchmarkom. Stawia też tezę interpretacyjną — nacisk na badania służy budowaniu asystentów badawczych i pętli rekurencyjnego samodoskonalenia modeli. Zapowiada serię kolejnych premier Anthropic po miesięcznej ciszy. Pełne opracowanie.

Nate Herk | AI Automation — Właśnie wydano Fable 5.1 — wygląda niewiarygodnie

Herk daje najbardziej rzeczowy przegląd samego wydania: dokładny cennik, dostępność na trzech chmurach, nowy system EFS pozwalający klientom biznesowym całkowicie zrezygnować z przechowywania danych oraz status Mythosa 5.1 jako bliźniaka o łagodniejszych zabezpieczeniach. Pokazuje wykres, na którym Fable 5.1 przy niskim poziomie „wysiłku” wypada lepiej niż najmocniejsze ustawienia Fable 5, i to za ułamek kosztu (11,10 USD wobec 34–44 USD). Przeprowadza szybki test na żywo — obracający się miś na rowerze w 3D — gdzie nowy model daje lepsze cienie i fizykę, jest o ok. dolara tańszy, ale odrobinę wolniejszy. Obszerniejsze testy zapowiada w osobnym materiale. Pełne opracowanie.

Nick Saraev — Fable 5.1 Just Dropped. It’s Not Even Close.

Saraev przechodzi przez komplet benchmarków z liczbami — nauka, kodowanie agentowe, praca z wiedzą (GDP-Val-AA-V2: 1853 punkty, ok. 7% przewagi), obsługa komputera i automatyzacja procesów biznesowych — ale sam je relatywizuje. Podkreśla, że rankingi nie zawsze oddają realne doświadczenie: w jego praktyce Fable 5 dawał lepsze rezultaty niż wyżej notowany Opus 5. Najsilniej ze wszystkich akcentuje wymiar ekonomiczny, licząc skuteczność na dolara zamiast punktów na wykresie. Kończy tezą, że inteligencja modeli przestała być wąskim gardłem — o wygranej zdecyduje cena i skala dystrybucji po gospodarce. Pełne opracowanie.

Rozbieżności i niepewności

  • Skala oszczędności różni się między kanałami: Herk mówi o ok. 25% w typowych zastosowaniach i ok. 50% przy pracy agentowej, Finn o 25–40%, Saraev o ok. 25% na odczytach z cache i do 45% w trybie agentowym. To szacunki, nie jedna oficjalna liczba — realny wynik zależy od tego, ile w Twojej pracy jest odczytów z pamięci podręcznej.
  • Ocena skali przełomu nie jest zgodna. Finn nazywa to skokiem jakościowym „w każdej mierze”, Saraev przy kodowaniu agentowym mówi wprost o istotnym kroku naprzód, ale nie rewolucji.
  • Benchmarki to deklaracje producenta. Saraev sam ostrzega, że rankingi bywają rozbieżne z codziennym użyciem, i przywołuje własny przykład: wyżej notowany Opus 5 sprawdzał mu się gorzej niż Fable 5. Wyniki testów własnych obu autorów są z kolei jednorazowymi demonstracjami, nie pomiarem.
  • Związek między poprawką bezpieczników a badaniem o hakowaniu nagrody to obserwacja czasowa Herka („kilka godzin po publikacji”), a nie potwierdzona przyczynowość.
  • Wydajność czasowa pozostaje niejasna: w teście Herka Fable 5.1 był tańszy, ale odrobinę wolniejszy od poprzednika. Nie wiadomo, czy to reguła.
  • Dostęp do Mythosa 5.1 jest ograniczony do programów weryfikacyjnych — dla większości odbiorców praktycznie niedostępny.

Co z tego wynika dla Ciebie

  • Przelicz koszt na zadanie, nie na token. Cennik się nie zmienił, więc porównywanie stawek nic nie powie. Zmierz, ile kosztuje Cię jedno realne zadanie przed zmianą modelu i po niej.
  • Zbuduj własny, powtarzalny zestaw testów pod swoje codzienne zadania. To rada Finna, ale wzmacnia ją zastrzeżenie Saraeva o rozjeździe benchmarków z praktyką — sam sprawdź, czy premiera coś dla Ciebie zmienia.
  • Zacznij od pracy agentowej, jeśli chcesz zobaczyć oszczędności. To tam wszystkie kanały zgodnie wskazują największą różnicę, dzięki tańszym odczytom z cache.
  • Przepuść stare prompty i sesje burzy mózgów przez nowy model. Te same polecenia mogą dać inne kąty patrzenia — to najtańszy sposób sprawdzenia, czy skok w badaniach przekłada się na Twoje zastosowania.
  • Zweryfikuj, czy filtry przestały Ci przeszkadzać. Jeśli wcześniej rezygnowałeś z jakiegoś zastosowania przez bezpodstawne odmowy, to dobry moment, by spróbować ponownie.
  • Uważaj na entuzjazm z dnia premiery. Dwa z trzech materiałów powstały w ciągu minut od ogłoszenia, na podstawie materiałów producenta i pojedynczych demonstracji. Obszerniejsze testy dopiero zapowiedziano.

Źródła

  • Alex Finn — „Claude Fable 5.1 just dropped and I can’t believe it…”: opracowanie · YouTube
  • Nate Herk | AI Automation — „Właśnie wydano Fable 5.1 — wygląda niewiarygodnie”: opracowanie · YouTube
  • Nick Saraev — „Fable 5.1 Just Dropped. It’s Not Even Close.”: opracowanie · YouTube