O czym jest ten film
- Deweloper Anthropic dał Sonnet 5 i Opus 4.8 dokładnie to samo zadanie — oba modele sobie poradziły, ale rachunek za tańszego Sonneta okazał się niemal dwukrotnie wyższy.
- Ktoś z zespołu OpenAI publicznie oznajmił, że ceny tokenów właściwie przestały cokolwiek znaczyć.
- Do zrozumienia rachunku potrzebne są dwa pojęcia: tokeny (fragmenty słów, za które płacimy) i kroki, czyli tury (każda pojedyncza akcja modelu).
- Koszt narasta lawinowo, bo przed każdym kolejnym krokiem model ponownie czyta całą dotychczasową pracę.
- Świeże przykłady z rynku: GPT6 Astra wychodzi 30–40% taniej od Fable 5.1 przy identycznej cenie tokenów, a Anthropic w własnym przewodniku po kosztach potwierdza ten rozjazd.
- Artificial Analysis publikuje wykres kosztu na zadanie z uwzględnieniem poziomu wysiłku — to pierwszy filtr przy wyborze modelu.
- Poziom wysiłku potrafi zmienić koszt o rzędy wielkości (oś wykresu jest logarytmiczna), a jakość wyniku często pozostaje ta sama.
- Autor podaje procedurę własnego testu: dwa modele, identyczne zadanie w osobnych wątkach, odczyt licznika zużycia przed i po.
- Reguła kciuka: przy modelach średnich i dużych nie przekraczaj wysokiego wysiłku; przy małych można śmiago wkręcić maksimum.
- Małe modele nadają się tylko do jednokrokowych czynności — to około 5–8% zadań; cała reszta wymaga modeli średnich i dużych.
10 najważniejszych takeaways — z kontekstem zastosowania
1.Licz koszt na zadanie, nie na token
Na czym polega: Cenniki dostawców pokazują cenę tokenów, ale realny rachunek zależy też od liczby kroków i wielokrotnego ponownego czytania. Model tani „na sztuke” potrafi wygenerować wyższy koszt całego zadania.
Jak stosować: Przy każdej decyzji o modelu dla zespołu pytaj: „ile kosztuje wykonanie typowego zadania?”, a nie „ile kosztuje token”. Porównuj modele na pełnych, realnych zadaniach, nie na pojedynczych zapytaniach.
Na co uważać: Refleks „mały model, czyli tani” bywa dokładnie odwrotny w praktyce — nie daj się zwieść tabeli cenowej.
2.Tańszy model potrafi wystawić dwukrotnie wyższy rachunek
Na czym polega: W testowanym przez dewelopera Anthropic przypadku Sonnet 5 (tani) i Opus 4.8 (drogi) dostały to samo zadanie. Opus wykonał je w czterech–pięciu krokach, Sonnet w trzydziestu–czterdziestu — i zapłacił dwa razy więcej.
Jak stosować: Zanim przeniesiesz powtarzalny proces na tańszy model, porównaj koszt końcowy obu wariantów na tym samym zadaniu.
Na co uważać: Niższa cena jednostkowa nie chroni przed wyższym rachunkiem zbiorczym — różnice potrafią sięgać 100%.
3.Każdy nowy krok oznacza ponowne przeczytanie całej historii
Na czym polega: Model przed kolejną akcją musi jeszcze raz przetworzyć wszystko, co zrobił wcześniej. Krok drugi czyta krok pierwszy, krok trzeci — pierwszy i drugi. Tokeny potrzebne do zadania rosną więc lawinowo wraz z liczbą kroków.
Jak stosować: Szacując koszt, patrz na to, jak długo i wieloetapowo model będzie pracował — długa sekwencja kroków kosztuje nieproporcjonalnie więcej.
Na co uważać: Zadania, które wyglądają na proste, w środku potrafią mieć dziesiątki kroków — to one psują budżet.
4.Dostawcy sami odsyłają od cenników tokenów
Na czym polega: Pracownik OpenAI napisał publicznie, że ceny tokenów przestały znaczyć, a Anthropic w swoim przewodniku po kosztach stwierdził wprost, że dwa modele o identycznej cenie za token mogą kosztować zupełnie różnie na tym samym zadaniu.
Jak stosować: Traktuj cenniki tokenów jako informację drugorzędną; szukaj publikowanych porównań kosztu na zadanie i własnych pomiarów.
Na co uważać: Marketing dostawców wciąż chętnie eksponuje cenę za token — to nie jest miara rzeczywistego wydatku.
5.Pierwszy filtr: wykres kosztu na zadanie
Na czym polega: Serwis Artificial Analysis przy każdej premierze testuje modele pod kątem jakości i kosztu, a jego wykres kosztu na zadanie uwzględnia też poziom wysiłku — od niskiego po maksymalny.
Jak stosować: Gdy wychodzi nowy model, zanim cokolwiek kupisz lub przełączysz, sprawdź na tym wykresie, gdzie plasuje się w stosunku do konkurencji.
Na co uważać: To tylko przybliżenie — serwis może testować kodowanie, a twoim zadaniem są prezentacje, raporty czy Excel. Benchmark to filtr, nie werdykt.
6.Poziom wysiłku potrafi zmienić koszt o rząd wielkości
Na czym polega: Oś kosztu na wykresie jest logarytmiczna — każda kolejna podziałka to wielokrotność poprzedniej kwoty. Przy Opus 5.5 podbicie wysiłku ze średniego na maksymalny daje znikomy zysk jakości przy gwałtownym wzroście ceny.
Jak stosować: Zanim zostawisz domyślne (zwykle wysokie) ustawienie wysiłku, sprawdź na wykresie, co realnie zyskujesz.
Na co uważać: Wyższy wysiłek nie oznacza lepszego wyniku — na wykresie Opus 5.5 „high” dorównuje jakościowo Fable 5.1 „max”, a kosztuje drastycznie mniej.
7.Duże modele: nie przekraczaj wysokiego wysiłku
Na czym polega: Reguła kciuka autora z praktyki doradczej: przy modelach średnich i dużych (Opus, Fable, Astra) wysiłek powyżej „wysokiego” to zwykle wyrzucony czas i pieniądze — jakość zostaje ta sama albo bywa gorsza.
Jak stosować: Niezależnie od złożoności zadania trzymaj się wysokiego poziomu wysiłku w modelach średnich i dużych.
Na co uważać: Pokusa „dam max, będzie lepiej” jest silna właśnie przy trudnych zadaniach — a to tam straty są największe.
8.Małe modele: maksymalny wysiłek prawie nic nie kosztuje
Na czym polega: Dla małych modeli (Haiku, GPT6 Luna) logika się odwraca: ich tokeny są 20–40 razy tańsze niż w modelu o klasę wyżej, więc nawet maksymalny wysiłek nie doprowadzi rachunku do poziomu większego modelu.
Jak stosować: Gdy już sięgasz po mały model, spokojnie ustaw wysiłek na maksimum — nie oszczędzaj tam.
Na co uważać: Nawet podkręcony mały model nie prześcignie dużego na złożonym zadaniu — to nie sposób na „tani duży model”.
9.Zmierz sam: licznik zużycia przed i po zadaniu
Na czym polega: Najpewniejsza metoda: dwa modele, identyczne zadanie i dane, osobne wątki. W ustawieniach ChatGPT i Claude (zakładka użycia lub rozliczeń) odczytujesz stan licznika przed zadaniem i po — na planach biznesowych jako procent przydziału, na enterprise jako kwoty.
Jak stosować: Zapisz liczbę przed, wykonaj zadanie, zapisz po; powtórz dla obu modeli i porównaj. Dopuszczaj tańszy model do stałej pracy tylko wtedy, gdy jego wynik był wystarczająco dobry.
Na co uważać: Cena bez oceny jakości nic nie daje — najtańszy wynik, którego trzeba poprawiać, wychodzi najdrożej.
10.Małe modele tylko do jednokrokowych zadań — to około 5–8% użycia
Na czym polega: Małe modele mają sens przy czynnościach z jednym prostym krokiem: sortowanie maili do folderów, wyciąganie danych z kilkunastu paragonów do arkusza, porządkowanie notatek ze spotkania.
Jak stosować: Przejrzyj powtarzalne obowiązki zespołu i odseparuj te jednokrokowe do małych modeli; całą resztę — prezentacje z wielu plików, research z notatką, porównywanie umów z polityką — kieruj do modeli średnich i dużych.
Na co uważać: Większość pracy oddawanej AI jest wieloetapowa, więc proporcja małych modeli pozostanie niska — nie planuj oszczędności na ich masowym wdrożeniu.
Redakcyjne tłumaczenie
Ceny tokenów przestały cokolwiek mówić
Ktoś z zespołu OpenAI niedawno oznajmił publicznie, że wycena modeli za tokeny właściwie przestała mieć znaczenie. A kilka tygodni wcześniej deweloper z Anthropic dał dwa modele Claude dokładnie to samo zadanie. Oba wykonały je poprawnie, ale rachunek za tańszy z nich okazał się niemal dwukrotnie wyższy. I nie jest to wyłącznie sprawa Anthropic czy OpenAI.
Nazywam się Dylan, prowadzę doradztwo w obszarze AI, a pytanie „którego modelu używać” słyszę od klientów najczęściej ze wszystkich. Dlatego dziś pokażę, dlaczego tańszy model może realnie kosztować więcej — i co zalecam w takich sytuacjach moim klientom.
Jedno zastrzeżenie na start: będę wymieniał konkretne nazwy modeli, ale wszystko, o czym mówię, dotyczyć będzie także modeli przyszłych — nie wszystkich, ale zapewne większości z najbliższych sześciu–dwunastu miesięcy. W świecie AI to wskazówki na tyle trwałe, na ile to w ogóle możliwe.
Test, który wszystko wyjaśnia
Wspomniany test przeprowadzono na Sonnet 5 i Opus 4.8. Pierwszy to mniejszy, tańszy model; drugi — droższy. Otrzymały identyczne polecenie. Gdy przyszło rozliczenie, okazało się, że Sonnet 5 — mimo niższej stawki za token — skończył z rachunkiem dwukrotnie wyższym niż Opus 4.8.
Żeby zrozumieć, skąd ta różnica i jak ją okiełznać, trzeba najpierw uporządkować słownictwo.
Dwa pojęcia: tokeny i kroki
Pierwsze pojęcie to tokeny — to właśnie za nie rozliczają się modele. Token to fragment słowa: angielskie spreadsheet to mniej więcej dwa tokeny. Wszystko, co trafia do modelu, i wszystko, co z niego wychodzi — łącznie z jego wewnętrznym „rozumowaniem” i całą pośrednią pracą — składa się na tokeny. I wszystko to kosztuje.
(Informacja dodatkowa: w praktyce jeden token odpowiada mniej więcej trzem–czterem znakom tekstu.)
Drugie pojęcie to tury, czyli kroki. Każda pojedyncza akcja modelu liczona jest jako jeden krok: otwarcie pliku, wyszukanie informacji w sieci, dopisanie fragmentu raportu, sprawdzenie własnej pracy, poprawienie błędu. Liczba kroków ma ogromne znaczenie, bo sprawniejsze modele wykonują ich mniej — nawet gdy ich tokeny są droższe. I dokładnie dlatego całe zadanie potrafi na koniec wyjść drożej na małym modelu niż na dużym.
Rachunek za zadanie, nie za token
Postawmy oba modele obok siebie i dajmy im to samo zadanie na tych samych danych. Droższy model potrzebuje czterech, może pięciu kroków. Tańszy — trzydziestu do czterdziestu. Dlatego mimo niższej ceny za token rachunek końcowy wychodzi wyższy albo, w najlepszym razie, podobny.
I to jest najważniejsza myśl całego materiału: wybierając model dla siebie, zespołu czy całej firmy, nie można poprzestać na refleksie „mały model, czyli tani”. Cenniki pokazują bowiem cenę za token, a nie koszt wykonania zadania. Nie wyceniamy więc modeli za token — zaczynamy myśleć w kategoriach zadania. A w skład tego kosztu wchodzą trzy elementy: same tokeny, liczba kroków i ponowne czytanie.
Ponowne czytanie? Tak — przed każdym kolejnym krokiem model musi jeszcze raz przejrzeć to, co zrobił wcześniej. Jeśli zapisze fragment raportu, potem wyszuka coś w sieci i wreszcie coś poprawi, każda z tych trzech operacji powiększa objętość materiału, który model musi przetworzyć. I to nie jednorazowo: po kroku drugim następuje ponowne przeczytanie kroku pierwszego, po kroku trzecim — kroków pierwszego i drugiego. Koszt narasta lawinowo i właśnie to widać na końcowym rachunku. Płacisz więc za zadanie, a nie za tokeny.
Producenci sami to przyznają
Warto zapamiętać, że mechanizm działa nadal — nie dotyczy wyłącznie pary Opus 4.8 i Sonnet 5. GPT6 Astra i Fable 5.1, które premierę miały niespełna dwa tygodnie temu, kosztują na cenniku tyle samo za token. A jednak na serii zadań GPT6 Astra wychodzi zwykle o 30–40% taniej. Dlaczego? Bo jest oszczędniejsza — zużywa mniej tokenów na zadanie.
Anthropic opublikował zresztą własne porównanie swoich modeli. Fable 5.1, znacznie większy i trzy–pięć razy droższy od Sonnet 5, zmierzył się z nim na identycznym zadaniu — i znów okazało się, że duży model, mimo droższych tokenów, wykonuje mniej kroków i ostatecznie wychodzi wyraźnie taniej.
Najciekawsze jest to, że firmy budujące te modele i sprzedające tokeny same zaczynają to przyznawać. Pracownik OpenAI napisał niedawno na X, że ceny tokenów przestały cokolwiek znaczyć. Niecały tydzień później Anthropic wydał przewodnik po kosztach z wnioskiem, że dwa modele o identycznej cenie za token mogą kosztować zupełnie różnie na tym samym zadaniu. Obaj giganci mówią więc wprost: patrzcie na koszt zadania, nie na koszt tokena.
Co z tym zrobić: pierwszy filtr
A co powinien zrobić użytkownik — kierownik zespołu albo prezes firmy? Za każdym razem, gdy pojawia się nowy model, pierwszym pytaniem powinno być: ile kosztuje zadanie? I tu najlepszym punktem zaczepienia jest wykres.
Artificial Analysis testuje modele wszystkich głównych dostawców przy okazji każdej premiery — sprawdza zarówno ich możliwości, jak i koszty — i publikuje wykres kosztu na zadanie.
(Informacja dodatkowa: Artificial Analysis to niezależny serwis porównujący modele różnych dostawców pod kątem jakości, szybkości i ceny.)
Wykres uwzględnia jeszcze jeden, kluczowy wymiar: poziom wysiłku. Każdy dostawca — Anthropic, OpenAI i pozostali — daje przełącznik, którym ustala się, jak mocno model ma się przyłożyć do pracy. Dla przykładu: wybierając Opus 5.5, można przejść od wysiłku niskiego, przez średni i wysoki, po „extra” i maksymalny. A to ustawienie dramatycznie wpływa na koszt zadania.
Na wykresie widać głównych graczy: Google, Anthropic, OpenAI, Groka i innych. Weźmy Gemini 3.8 Flash, jeden z najmniejszych i najtańszych modeli Google. Przy jednym z zadań kosztował tyle samo co Opus 5.5 na średnim wysiłku — mimo że za token jest od niego dziesięć do dwudziestu razy tańszy.
A teraz efekt podkręcania wysiłku. Oś pozioma wykresu jest logarytmiczna, co oznacza, że każda kolejna podziałka to nie niewielka różnica, lecz wielokrotność poprzedniej kwoty. W przypadku Opus 5.5 przejście ze średniego wysiłku na maksymalny daje znikomy zysk w jakości, a koszty rosną gwałtownie.
Jedna para z wykresu jest szczególnie wymowna: Opus 5.5 na wysokim wysiłku kontra Fable 5.1 na maksymalnym. Jakość wyniku identyczna, różnica w cenie — drastyczna.
Trzeba jednak pamiętać o granicach tego narzędzia. Zadania, na których Artificial Analysis sprawdza modele, mogą odbiegać od twoich: serwis mierzy na przykład kodowanie, a tobie chodzi o tworzenie prezentacji, pisanie raportów czy pracę w Excelu. Wykres to filtr wstępny, nie ostateczny werdykt.
Drugi krok: własny test
Po filtrze wstępnym przychodzi czas na własne pomiery. Gdy wychodzi nowy model, zestaw go z modelem o klasę wyżej albo niżej i daj im dokładnie to samo zadanie — te same dane, te same polecenia, słowo w słowo — w osobnych wątkach, w osobnych rozmowach.
Potem sprawdź koszty. W ChatGPT i Claude, w ustawieniach — zwykle w zakładce dotyczącej użycia albo rozliczeń — widać, ile wydano w danym miesiącu lub jaki procent miesięcznego limitu został wykorzystany. Na planach biznesowych będzie to procent przydziału przypadającego na osobę w organizacji; na kontraktach enterprise — zwykle kwoty w dolarach.
Procedura jest prosta: zapisz wartość licznika przed zadaniem, wykonaj zadanie, zapisz po. Powtórz dla obu modeli i porównaj.
Cena to jednak tylko połowa oceny. Druga połowa to jakość: czy mniejszy model sprostał wymaganiom, czy wynik był wystarczająco dobry? Jeśli tak — to zadanie możesz na nim zostawić na stałe. Jeśli nie — automatycznie sięgasz po większy model. Cena i jakość ważą tyle samo, z jednym zastrzeżeniem: liczy się cena za zadanie, nie za token.
Reguła kciuka dla poziomu wysiłku
Z mojej praktyki doradczej płynie prosta zasada, którą zalecam wszystkim klientom. Przy modelach średnich i dużych — Opus, Fable, Astra — nigdy nie ustawiaj wysiłku powyżej „wysokiego”. Wszystko, co wyżej, to zwykle przepalanie czasu i pieniędzy: jak pokazał wykres, jakość wyniku pozostaje ta sama, a bywa nawet gorsza. Niezależnie od tego, jak skomplikowane jest zadanie, przy dużych modelach trzymam się wysokiego poziomu.
Dla małych modeli logika się odwraca. W Anthropic to Haiku, w OpenAI — GPT6 Luna, czyli pomniejszona wersja GPT6. Tu można spokojnie wkręcić wysiłek na maksimum: tokeny są dwadzieścia–czterdzieści razy tańsze niż w modelu o klasę wyżej, więc nawet przy najwyższym ustawieniu rachunek nie dogoni większego modelu przy tym samym zadaniu.
Kiedy sięgać po mały model
Mały model ma sens tylko wtedy, gdy zadanie sprowadza się do jednej, bardzo konkretnej czynności. Przykłady? Model przegląda skrzynkę odbiorczą i rozsortowuje maile do folderów. Albo wyciąga dane z piętnastu–dwudziestu paragonów w PDF-ach i przenosi je do arkusza. Albo porządkuje surowe notatki ze spotkania. Wszystkie te czynności są proste: niewiele w nich osądu i niewiele kroków.
Uwaga jednak: większość pracy, którą oddajemy AI, to zadania wielokrokowe — i właśnie tu wchodzą modele średnie i duże. Przykład? Przygotowanie prezentacji z dwunastu–piętnastu plików. Research na temat firmy i napisanie notatki. Porównanie umowy z wewnętrzną polityką. Każde z tych zadań wymaga wielu kroków, a przy tym osądu i inteligencji na najwyższym poziomie. W takich sytuacjach zlecasz pracę modelowi średniemu albo dużemu — nie małemu.
Rozkład w praktyce wygląda więc tak: na małe modele przypadka może pięć do ośmiu procent zadań — przynajmniej na dziś. Cała reszta trafia do modeli średnich i dużych.
Podsumowanie
Najważniejsze do zapamiętania: przestań wyceniać AI za token, zacznij za zadanie. Nie wybieraj modelu tylko dlatego, że na cenniku wygląda tanio — mierzony niewłaściwą miarą wyjdzie drożej, nie taniej.
Miary sprawdzasz dwutorowo. Najpierw wykres kosztu na zadanie od Artificial Analysis — ale wyłącznie jako przybliżenie. Potem własny test: świeży model, nowy albo mniejszy, kontra model sąsiedniej klasy; te same dane wejściowe i odnotowane zużycie przed oraz po.
Wreszcie poziom wysiłku, który waży co najmniej tyle, co wybór samego modelu. Wewnątrz każdego modelu wybieramy zwykle spośród ustawień: niski, średni, wysoki, często też „extra” i maksymalny. Dla modeli średnich i dużych nie schodź powyżej wysokiego — wszystko powyżej to strata czasu i pieniędzy. Dla małych możesz wkręcić maksimum, bo koszty są znikome. Ale korzystać z nich będziesz rzadko: tylko przy zadaniach składających się z jednej prostej czynności. Większość tego, co oddelegowujesz AI, to zadania wielokrokowe — i one trafią do modeli średnich i dużych.