O czym jest ten film
- Cztery modele z trzech firm pojawiły się w ciągu dwóch dni, choć branża dyskutuje o spowolnieniu rozwoju AI.
- Z zestawienia autora wynika, że po okresie przyspieszenia liczba premier ustabilizowała się na wysokim poziomie.
- W ciągu ostatniego roku autor odnotował 91 premier wobec 87 rok wcześniej — wzrost o około 5%.
- Silniejsze wrażenie przyspieszenia bierze się ze wzrostu możliwości modeli: od rozmowy po obsługę narzędzi i wielogodzinną pracę.
- Tańsze modele z otwartymi wagami, zwłaszcza z Chin, wywierają presję na ceny największych dostawców.
- Wynik w teście programistycznym nie przesądza, czy model sprawdzi się w konkretnym zadaniu ani czy warto za niego płacić więcej.
- Dłuższe zadania można powierzać agentom AI pod warunkiem, że ktoś potrafi ocenić i odrzucić ich błędne wyniki.
- Czas zaoszczędzony dzięki AI warto przeznaczyć na namysł, sprawdzanie efektów i podejmowanie decyzji.
- Nowe narzędzia najlepiej najpierw wypróbować, a dopiero później włączać do stałego sposobu pracy.
- Skoro kod coraz łatwiej odtworzyć, trudniejsze staje się zbudowanie trwałej przewagi na samym oprogramowaniu.
10 najważniejszych takeaways — z kontekstem zastosowania
1.Oddziel tempo premier od postępu możliwości
Na czym polega: Cztery premiery w dwa dni robią wrażenie, ale roczna liczba wydań wzrosła według autora z 87 do 91. To raczej utrzymanie szybkiego tempa niż gwałtowne przyspieszenie liczby premier.
Jak stosować: Przy ocenie rynku patrz osobno na częstotliwość wydań i na to, jakie nowe zadania modele potrafią wykonać.
Na co uważać: Kilka intensywnych dni nie wystarcza, by ocenić długofalowy trend.
2.Sprawdzaj, co model potrafi zrobić samodzielnie
Na czym polega: Największa zmiana opisana w materiale to przejście od odpowiadania w czacie do korzystania z narzędzi, pisania kodu i pracy nad dłuższymi zadaniami.
Jak stosować: Porównując modele, zleć im rzeczywisty fragment pracy i sprawdź, ile użytecznych kroków wykonają bez pomocy.
Na co uważać: Długi czas samodzielnej pracy nie oznacza, że końcowy wynik jest poprawny.
3.Nie wyciągaj wniosków wyłącznie z zapowiedzi firm
Na czym polega: Autor dostrzega rozbieżność między wypowiedziami o zwalnianiu prac a kolejnymi premierami modeli.
Jak stosować: Oceniaj deklaracje dostawców razem z ich późniejszymi działaniami.
Na co uważać: Pojedyncza premiera nie mówi wszystkiego o tym, jak firma prowadzi badania i trening modeli.
4.Porównuj koszt wykonania zadania
Na czym polega: W przytoczonym zestawieniu koszt zadania wynosi 7,63 dol. dla Fable 5.1, 5,98 dol. dla Opus 5.5 i 3,32 dol. dla GPT-6 Astra.
Jak stosować: Sprawdź, ile kosztuje uzyskanie wyniku o wymaganej jakości w Twojej pracy, zamiast porównywać same cenniki.
Na co uważać: Podane kwoty dotyczą konkretnego testu; koszt i skuteczność w Twoim zastosowaniu mogą wyglądać inaczej.
5.Zacznij od najtańszego modelu, który spełnia wymagania
Na czym polega: Autor wskazuje, że mniejszy model może wykonać część zadań równie użytecznie jak znacznie droższy.
Jak stosować: Przetestuj kilka modeli na tych samych przykładach z własnej pracy i wybierz najtańszy, który daje akceptowalny wynik.
Na co uważać: Oszczędność traci sens, jeśli poprawianie błędów kosztuje więcej niż wybór lepszego modelu.
6.Traktuj benchmark jako punkt wyjścia
Na czym polega: Dobry wynik w teście programistycznym nie jest uniwersalną miarą niezawodności.
Jak stosować: Przygotuj krótką próbkę własnych zadań i oceń wyniki według kryteriów, które naprawdę mają dla Ciebie znaczenie.
Na co uważać: Model może dobrze wypaść w publicznym teście, a mimo to źle rozumieć Twoje polecenia lub dane.
7.Wyznacz osobę odpowiedzialną za ocenę pracy agenta
Na czym polega: Automatyzacja dłuższych zadań wymaga kogoś, kto ma wiedzę i prawo odrzucić błędny wynik.
Jak stosować: Przed powierzeniem agentowi pracy ustal, kto sprawdzi efekt i na jakiej podstawie go przyjmie.
Na co uważać: Gdy wyników powstaje więcej, niż da się rzetelnie ocenić, rośnie ilość treści pozornie gotowych do użycia.
8.Zachowaj czas na własny osąd
Na czym polega: Zdaniem autora praca z AI wymaga chwili na przemyślenie celu, ocenę propozycji i wybór dalszego kierunku.
Jak stosować: Część czasu odzyskanego dzięki automatyzacji przeznacz na analizę wyników i decyzje, których nie chcesz oddawać modelowi.
Na co uważać: Ciągłe przyspieszanie produkcji może sprawić, że zabraknie czasu na wychwycenie błędów.
9.Wdrażaj nowości po próbie
Na czym polega: Nowy model może umożliwić rzeczy wcześniej trudne lub niemożliwe, ale sama premiera nie jest powodem do natychmiastowej zmiany całego sposobu pracy.
Jak stosować: Wypróbuj nowość na ograniczonym zadaniu, oceń rezultat i dopiero wtedy zdecyduj o szerszym użyciu.
Na co uważać: Entuzjazm wokół premiery łatwo pomylić z korzyścią we własnej pracy.
10.Szukaj wartości także poza kodem
Na czym polega: Autor zauważa, że AI ułatwia odtwarzanie funkcji oprogramowania. Stawia więc pytanie, co będzie wyróżniać produkt, gdy sam kod można szybko skopiować.
Jak stosować: Przy rozwijaniu produktu sprawdzaj, dlaczego ktoś miałby go wybrać i za niego zapłacić, nawet jeśli podobne funkcje da się odtworzyć.
Na co uważać: Autor nie podaje jednej odpowiedzi ani gotowego modelu biznesowego; przedstawia to jako problem do dalszego badania.
Redakcyjne tłumaczenie
Cztery premiery i pytanie o tempo rozwoju
Branża dyskutuje o spowolnieniu rozwoju sztucznej inteligencji, a tymczasem w ciągu dwóch dni trzy firmy udostępniły cztery modele. Czy rozwój AI rzeczywiście przyspiesza, czy tylko tak się nam wydaje? Chciałem to sprawdzić, bo z jednej strony wyraźnie czuję tempo zmian, a z drugiej mam wrażenie, że sposób mówienia o nim bywa nieuczciwy.
Stworzyłem stronę artificialacceleration.com, na której śledzę premiery modeli dziewięciu dużych firm. Można tam porównać okresy obejmujące ostatnie 48, 24, 12, 6 i 3 miesiące.
Gdy spojrzymy na cztery lata, widać przyspieszenie trwające mniej więcej do września ubiegłego roku. Później liczba premier zaczęła się stabilizować. Nadal jest ich bardzo dużo, a ostatni miesiąc był wyjątkowo intensywny. W skali roku wzrost wynosi jednak około 5%. W ubiegłym roku naliczyłem 87 premier, a w tym — 91. To wysokie, utrzymujące się tempo, lecz trudno mówić na tej podstawie o gwałtownym przyspieszeniu.
Dlaczego zmiany wydają się szybsze
Wrażenie przyspieszenia bierze się przede wszystkim z rosnących możliwości modeli. Początkowo z dużymi modelami językowymi mogliśmy rozmawiać przez okno czatu. Z czasem nauczyły się korzystać z narzędzi, a więc wykonywać czynności poza samą rozmową: szukać informacji, pisać kod czy tworzyć strony internetowe.
Na tym rozwój się nie zatrzymał. Wyniki ich pracy stały się bardziej użyteczne i można na nich częściej polegać. Dziś mamy modele zdolne pisać dobre oprogramowanie, obsługiwać złożone narzędzia i pracować przez wiele godzin. To właśnie możliwość powierzania agentom AI coraz dłuższych zadań daje mi najsilniejsze poczucie przyspieszenia.
Ostatnie 30 dni przyniosło wyjątkowo dużo premier. Dopiero z czasem zobaczymy, czy takie tempo się utrzyma.
Deklaracje o zwalnianiu a kolejne modele
Słyszymy zapowiedzi spowolnienia treningu modeli. Moja interpretacja jest taka, że OpenAI zakończyło trening GPT-6 Astra, a teraz będzie przygotowywać na jego podstawie mniejszy model i go optymalizować. Później prace treningowe mogą ruszyć dalej. To moja ocena sytuacji: na razie widzę przede wszystkim rozbieżność między deklaracjami a działaniami.
Podobnie patrzę na Anthropic. Firma udostępniła Fable 5.1 na początku września. Mówiła o potrzebie zwolnienia tempa, choć Fable 5.1 był wtedy, moim zdaniem, najmocniejszym dostępnym modelem. Kilka dni później pojawił się jeszcze lepszy Opus 5.5. Trudno mi pogodzić te premiery z publicznymi wypowiedziami o spowolnieniu.
Presja cenowa i ograniczenia testów
Ważną częścią tej historii są modele z otwartymi wagami, zwłaszcza te pochodzące z Chin. Stają się coraz lepsze, a przy tym są znacznie tańsze. OpenAI, Anthropic, Google i xAI muszą brać tę konkurencję pod uwagę przy ustalaniu cen.
Widać to choćby w ofercie Anthropic. Opus 5.5 jest według przytoczonego przeze mnie porównania lepszy od Fable 5.1, a jednocześnie tańszy. Nadal jednak kosztuje dużo. W teście, na który się powołuję, koszt wykonania zadania wynosi 7,63 dol. dla Fable 5.1, 5,98 dol. dla Opus 5.5 i 3,32 dol. dla GPT-6 Astra. Różnice są duże, a te ceny nie będą odpowiednie dla każdego.
Trzeba pamiętać o ograniczeniach takich porównań. Wynik w teście programistycznym nie mówi, jak niezawodny model będzie we wszystkich innych zastosowaniach. Sprawdźcie go na własnych zadaniach. To Wy musicie ocenić, czy tańszy model wystarczy do konkretnej pracy. Nie ma powodu płacić dziesięć czy dwadzieścia razy więcej za zadanie, z którym mniejszy model radzi sobie równie dobrze.
Automatyzacja wymaga kontroli
To samo dotyczy automatyzacji. Powierzamy agentom coraz dłuższe zadania, ale taki sposób pracy ma sens tylko wtedy, gdy sprawdzamy wyniki. Ktoś musi rozumieć wykonywaną pracę i mieć prawo powiedzieć: „Tego nie przyjmujemy”.
Tu pojawia się ryzyko zalewu słabej jakości treści. Możemy dążyć do jak największej automatyzacji i przestać sprawdzać efekty — bo ufamy systemowi albo dlatego, że kontrola zajmuje zbyt wiele czasu. Już teraz AI pozwala produkować materiały tak szybko, że trudno nadążyć z ich oceną. Jeśli zrezygnujemy z niej całkiem, ilość zacznie zastępować jakość.
Potrzebujemy też czasu na własne myślenie i wyrobienie sobie zdania. Bez niego łatwo dać się porwać tempu zmian i stracić z oczu własny cel. Gdy nie zostawiamy sobie chwili na namysł, cierpi na tym również końcowy rezultat. Dajcie sobie czas, by przeanalizować propozycje modelu i podjąć decyzję. Jeśli nie możecie odrzucić złego wyniku, nie sprawujecie rzeczywistej kontroli nad pracą.
Co zrobić z czasem odzyskanym dzięki AI
Warto zastanowić się, na co przeznaczamy czas zaoszczędzony dzięki sztucznej inteligencji. Łatwo wpaść w rytm kolejnych premier: pojawia się nowe narzędzie, więc od razu chcemy włączyć je do każdego zadania. Widzimy takie reakcje raz po raz.
Niektóre narzędzia rzeczywiście otwierają nowe możliwości. Nowy model może pozwolić nam zrobić coś, czego wcześniej nie potrafiliśmy. To jednak nie znaczy, że trzeba wdrażać go w pośpiechu. Lepiej go wypróbować, sprawdzić wyniki, przemyśleć zastosowanie i dopiero wtedy zmienić sposób pracy. Chodzi o poprawę jakości tego, co tworzymy.
Dzisiejsze modele robią imponujące rzeczy, ale wciąż daleko im do doskonałości. Nadal wymagają wielu wskazówek i nadzoru. Halucynacje, pomyłki i błędne rozumienie poleceń są na tyle częste, że nie można zostawić ich samych na długo. Jednocześnie potrafimy z ich pomocą zrobić znacznie więcej niż pół roku czy rok temu.
Każdy wzrost możliwości otwiera kolejne zastosowania. Zaczynaliśmy od rozmowy z AI; dziś modele obsługują oprogramowanie. To dlatego zmiana wydaje się tak ogromna, nawet jeśli liczba premier nie rośnie równie szybko.
Gdzie szukać wartości, gdy kod łatwo odtworzyć
Zachęcam Was do odkrywania tych możliwości we własnym tempie. O jakości pracy nie decyduje sam dostęp do AI — podobne narzędzia ma dziś wiele osób. Znaczenie ma to, co Wy potraficie z nimi zrobić.
Pomyślcie też o tym, jak łatwo odtworzyć obecnie oprogramowanie. Mogę zobaczyć program, który mi się podoba, i poprosić Codex, by zbudował coś podobnego. Sam kod staje się więc mniej rzadkim zasobem. Większe znaczenie zyskują pomysły, choć i je można kopiować, gdy tylko przybiorą postać działającego produktu.
Gdzie w takim razie powstaje wartość? Co sprawia, że rozwiązanie jest wyjątkowe i że ktoś chce za nie zapłacić? Nie mam prostej odpowiedzi. Wydaje mi się jednak, że będziemy musieli szukać innych modeli biznesowych i sprawdzać różne pomysły na trwałe działanie.
Z naszą społecznością rozwijamy Resonant DAO oraz Resonant OS. To wspólne przedsięwzięcie jest dla nas również eksperymentem z nowym sposobem tworzenia wartości. Uczymy się od siebie i budujemy razem; społeczność liczy już ponad 3700 osób. Jeśli chcecie dowiedzieć się więcej, zajrzyjcie na stronę projektu lub do naszego Discorda. Do zobaczenia w następnym materiale.