Wspólny mianownik
Trzy różne kanały, każdy z innej strony, dochodzą 27 lipca do tej samej konkluzji: najdroższy, „najmocniejszy” model rzadko jest właściwym wyborem, a sposób prezentacji benchmarków oraz cen systematycznie wprowadza w błąd. Zamiast pytać „który model wygrywa rankingi”, warto pytać „ile kosztuje uzyskanie akceptowalnego wyniku dla mojego konkretnego zadania”.
Wszyscy trzej stawiają w centrum jeden parametr — koszt na zaakceptowany wynik (a nie cenę tokena ani pozycję w benchmarku) — i wszyscy pokazują, że tańsze modele: chińskie (DeepSeek), Kimi K3 czy lokalny Qwen potrafią wygrać ekonomicznie, a niekiedy również jakościowo, z flagowcami pokroju Opus 5 czy Fable 5.
Różni ich punkt wyjścia — jeden mówi o masowej pracy i chińskim ekosystemie, drugi o konkretnym zadaniu projektowania stron, trzeci o metodologii czytania benchmarków — ale teza jest zbieżna i konkretna: dobór modelu to decyzja inżynierska „zadanie → koszt → sprzęt”, a nie kibicowanie liderowi rankingu.
Jak to ujmują poszczególne kanały
Manolo Remiddi — Opus 5 vs $0.32 Model: The Benchmark Lie
Bierze premierę Claude 5 (Opus 5) jako pretekst, by pokazać mechanikę manipulacji: skala logarytmiczna i dobór wykresów sprawiają, że ogromne różnice w cenie wyglądają na małe, a drobne różnice w jakości — na duże. Proponuje patrzeć na trzy wymiary naraz (inteligencja, szybkość, koszt na zadanie) i deklaruje, że 80% pracy robi na lokalnym Qwenie (27 mld parametrów) na RTX 5090 — szybko, prywatnie i stabilnie. Pełne opracowanie.
Jack Roberts — Kimi K3 Builds Beautiful $20,000 Websites in 19 Mins
Dostarcza konkretny dowód tezy na jednym zadaniu — projektowaniu front-endu. Twierdzi, że Kimi K3 wygrywa ślepe testy w Design Arena, wyprzedzając Fable 5, GLM 5.2 i Opus 5, przy koszcie ok. 30% ceny Fable 5, co daje najlepszy stosunek jakości do ceny w zadaniach wizualnych. Pokazuje odtwarzalny workflow (Kimi K3 w Claude Code przez OpenRouter, Higgsfield na media, Firecrawl na branding, Vercel na hosting). Pełne opracowanie.
AI News & Strategy Daily | Nate B Jones — US AI Dominance Is Over: Here’s Why
Rozwija tę samą logikę na poziomie strategii wdrożeniowej i chińskiego ekosystemu. „Chińskie modele” to nie jedna kategoria, lecz różne produkty — do taniej, powtarzalnej pracy masowej (ekstrakcja, klasyfikacja, research) modele jak DeepSeek potrafią radykalnie zmienić ekonomię. Jego złoty standard to wprost koszt na zaakceptowany wynik, a nie cena tokena; dorzuca też, że Mixture of Experts tłumaczy, czemu ogromny model bywa tani przez API i absurdalny na własnym laptopie. Pełne opracowanie.
Rozbieżności i niepewności
- Zakres tezy. Nate mówi o masowej pracy tekstowej i due diligence przy chińskich modelach; Jack ogranicza swój dowód do jednego, wąskiego zadania (design front-endu) — jego „najlepszy” dotyczy estetyki, nie każdego zastosowania.
- Rola światopoglądu. Manolo świadomie nie używa modeli Anthropic z powodów ideowych (walka z open source, zbyt silne ograniczenia) — to opinia autora, która wpływa na jego wybór lokalnego stacku, a nie neutralny wniosek techniczny.
- Twarde liczby. „30% ceny Fable 5”, „8 miesięcy za czołówką USA” (ocena CAISI u Nate’a), „80% pracy na Qwenie” to deklaracje autorów; nie ma tu wspólnej, niezależnej metodologii pomiaru.
- Self-hosting nie dla każdego. Nate wyraźnie zaznacza, że sensowny jest dopiero po spełnieniu kilku warunków; Manolo pokazuje działający lokalny setup, ale na drogiej karcie (RTX 5090) — próg wejścia bywa realny.
- „Wygrywa benchmarki” bywa częścią problemu. Manolo wprost ostrzega przed benchmarkami, a Jack sam powołuje się na ranking (Design Arena) — to napięcie w obrębie samego tematu dnia.
Co z tego wynika dla Ciebie
- Zanim wybierzesz model, zdefiniuj zadanie i policz koszt na zaakceptowany wynik, a nie cenę tokena ani pozycję w rankingu.
- Do taniej, powtarzalnej pracy masowej (ekstrakcja, klasyfikacja, wstępny research) przetestuj tańsze modele — chińskie (DeepSeek) lub lokalne (Qwen) — zanim domyślnie sięgniesz po flagowca.
- Do zadań wizualnych/front-endu sprawdź Kimi K3 (np. przez OpenRouter w Claude Code) i porównaj efekt oraz koszt z Fable 5 / Opus 5 na własnym przykładzie.
- Czytaj wykresy benchmarków ostrożnie: sprawdzaj oś (skala logarytmiczna) i patrz na inteligencję, szybkość i koszt razem, nie osobno.
- Przy rozważaniu modelu lokalnego pamiętaj o realnym progu sprzętowym (RTX 5090 u Manola) i przetestuj model przez API/OpenRouter, zanim zainwestujesz w sprzęt.
- Kraj pochodzenia czy „otwartość” modelu to początek analizy, nie jej koniec — osobno oceniaj API, wagi, licencję i to, czy Twój sprzęt uciągnie potrzebny kontekst.
Źródła
- Manolo Remiddi — „Opus 5 vs $0.32 Model: The Benchmark Lie”: opracowanie · YouTube
- Jack Roberts — „Kimi K3 Builds Beautiful $20,000 Websites in 19 Mins”: opracowanie · YouTube
- AI News & Strategy Daily | Nate B Jones — „US AI Dominance Is Over: Here’s Why”: opracowanie · YouTube