O czym jest ten film
- Nate Herk porównuje Opus 5.5 w Claude Code i GPT-6 Sol w Codexie, zlecając im dziesięć zadań z pracy twórczej, programowania i obsługi przeglądarki.
- W krótkiej próbie wstępnej Sol szybciej zabrał się do dwóch zadań naraz, ale błędnie wskazał najnowszą rozmowę, w której padł szukany termin.
- Opus przygotował atrakcyjniejszą stronę produktu, choć wykonanie kosztowało około trzech razy więcej.
- W montażu filmu promującego wydarzenie i rolki na Instagram autor wyraźnie wolał rezultaty Opusa.
- Porównania materiałów biznesowych i gry nie da się uczciwie rozstrzygnąć: oba modele pracowały w tym samym katalogu i zmieniały te same pliki.
- Opus stworzył bardziej przystępny trójwymiarowy świat objaśniający pojęcia związane z AI oraz lepszą wizualnie trasę podróży.
- W zadaniu polegającym na analizie i naprawie dużej bazy kodu Sol uzyskał lepszy wynik, działał szybciej i kosztował znacznie mniej.
- Oba modele utworzyły kurs przez przeglądarkę; autor przyznał zwycięstwo Opusowi ze względu na krótszy czas i niższy koszt w tej konkretnej próbie.
- Przy odtwarzaniu obrazu narzędziami rysunkowymi Canvy Opus poradził sobie zdecydowanie lepiej.
- Bilans autora to siedem zwycięstw Opusa, jedno Sola i dwie próby bez rozstrzygnięcia. To ocena pojedynczych wykonań, a nie dowód stałej przewagi w każdym zastosowaniu.
10 najważniejszych takeaways — z kontekstem zastosowania
1.Wybieraj model według rodzaju pracy
Na czym polega: W tej serii Opus 5.5 częściej dostarczał rezultat, który autor uznał za dopracowany, zwłaszcza przy projektowaniu i montażu. GPT-6 Sol wygrał za to próbę naprawy kodu.
Jak stosować: Do zadań wymagających decyzji estetycznych rozważ Opusa; przy analizie i poprawianiu kodu przetestuj również Sola. Oceniaj gotowy wynik i koszt wykonania, nie samą nazwę modelu.
Na co uważać: Dziesięć prób wykonanych przez jedną osobę nie wystarcza do przewidzenia wyniku każdego przyszłego zlecenia.
2.Sprawdzaj odpowiedzi oparte na przeszukiwaniu archiwum
Na czym polega: W próbie wstępnej Sol wskazał niewłaściwą datę ostatniej rozmowy, w której pojawił się szukany termin. Opus znalazł nowsze wystąpienie.
Jak stosować: Gdy agent ma znaleźć „ostatnią” wzmiankę, poproś o datę, odnośnik do źródła i fragment transkryptu. Zweryfikuj wynik przed wykorzystaniem go w dokumentacji lub decyzji.
Na co uważać: Automatyczna transkrypcja potrafi zniekształcić nazwy. Wyszukiwanie wyłącznie dokładnego zapisu może pominąć właściwe nagranie.
3.Przy stronie internetowej oceniaj działanie, nie tylko zrzut ekranu
Na czym polega: Oba modele zachowały podobny pomysł na stronę produktu. Autor wyżej ocenił Opusa za obraz produktu, animacje, warstwy i spójniejsze wrażenie wizualne.
Jak stosować: Otwórz obie wersje, przewiń całą stronę, sprawdź ruchome elementy i obrazy produktu. Dopiero wtedy zdecyduj, czy dopłata za lepszy projekt ma sens.
Na co uważać: Efektowna animacja może odwracać uwagę od błędów lub słabej czytelności. Sam autor zauważył możliwą usterkę jednego z przejść.
4.Film promocyjny oceniaj jako całość
Na czym polega: Przy montażu trzydziestosekundowego filmu z obszernego archiwum nagrań Opus lepiej dobrał tempo, muzykę, efekty dźwiękowe i sposób łączenia ujęć.
Jak stosować: Przygotuj jednakowy materiał wejściowy i jasny cel filmu, a następnie obejrzyj gotowe wersje bez zaglądania do opisu pracy agenta. Sprawdź, czy film rzeczywiście zachęca do działania.
Na co uważać: Technicznie poprawny montaż może nie spełniać celu promocyjnego. W tej próbie wersja Sola była poprawna, lecz według autora znacznie mniej porywająca.
5.Krótkie materiały społecznościowe mogą wymagać kolejnej rundy
Na czym polega: Rolka przygotowana przez Opusa miała więcej animacji i efektów, ale autor nie opublikowałby bez poprawek żadnej z dwóch wersji.
Jak stosować: Traktuj pierwszy montaż jako materiał do oceny. Zaznacz konkretne sekundy wymagające zmiany: dźwięk, napisy, tempo i elementy graficzne.
Na co uważać: Wyższa ocena w porównaniu nie oznacza gotowości do publikacji. W wersji Sola autor usłyszał niepożądany szum i nie znalazł muzyki.
6.Oddziel pliki, gdy porównujesz agentów
Na czym polega: Przy materiałach biznesowych i grze modele weszły sobie w drogę, ponieważ pracowały w tym samym katalogu. Wyników tych prób nie można przypisać jednemu wykonawcy.
Jak stosować: Uruchamiaj agentów w osobnych katalogach lub kopiach projektu. Każdemu wskaż własną ścieżkę zapisu i sprawdź historię zmian przed oceną.
Na co uważać: Identyczny prompt nie zapewnia uczciwego porównania, jeśli jeden agent może zobaczyć albo nadpisać pracę drugiego.
7.W interaktywnym projekcie sprawdzaj podstawowe sterowanie
Na czym polega: Gra testowana przez autora miała opowieść i oprawę dźwiękową, lecz problem z kursorem uniemożliwił swobodne obracanie widoku.
Jak stosować: Zanim ocenisz fabułę i wygląd, przejdź prostą próbę użytkową: uruchom projekt, poruszaj się, obracaj kamerę, użyj elementów interaktywnych.
Na co uważać: Jedna usterka sterowania może przekreślić przydatność nawet ciekawego prototypu. W tej próbie dodatkowo nie dało się ustalić czystego autorstwa plików.
8.Przy podróżach sprawdzaj terminy wydarzeń
Na czym polega: Oba modele zaproponowały trasę i odnośniki do rezerwacji, ale Opus lepiej trafił w życzenie autora dotyczące wydarzeń AI: uwzględnił San Francisco Tech Week.
Jak stosować: Jeśli celem wyjazdu jest konkretna konferencja, sprawdź jej termin i dostępność przed przyjęciem planu. Dopiero potem rezerwuj przejazdy i noclegi.
Na co uważać: Atrakcyjna mapa i komplet linków nie potwierdzają, że plan obejmuje właściwe wydarzenia albo że podane oferty są nadal aktualne.
9.Przy naprawie kodu licz wynik razem z kosztem
Na czym polega: W przygotowanej osobno próbie Sol przeszedł wszystkie 30 kontroli i zdobył 100 punktów. Opus uzyskał 97 punktów, pominął jedną kontrolę, pracował około dwa razy dłużej i kosztował około 20 razy więcej.
Jak stosować: Przy zadaniach programistycznych ustal wcześniej zestaw sprawdzeń. Porównuj modele według liczby zaliczonych kontroli, czasu i wydatku.
Na co uważać: To był jeden zestaw zadań. Sol przerwał też pracę z powodu zabezpieczenia, więc przebieg próby wymagał interwencji autora.
10.Czytaj końcowy bilans razem z zastrzeżeniami
Na czym polega: Autor ogłosił wynik 7:1 dla Opusa i dwa przypadki bez rozstrzygnięcia. Podał łączny koszt około 213 dolarów dla Opusa i 74,46 dolara dla Sola, lecz później skorygował rachunek jednej z prób Sola o około 19 dolarów.
Jak stosować: Przy własnym porównaniu zapisuj koszt każdej sesji i koryguj sumę po wykryciu błędu. Osobno licz próby, których wynik został zaburzony.
Na co uważać: Podana w filmie suma kosztów Sola nie uwzględnia w pełni późniejszej poprawki. Sam wynik 7:1 również nie obejmuje dwóch prób z nakładającą się pracą agentów.
Redakcyjne tłumaczenie
Założenia porównania
Przez cały dzień pracowałem z Opusem 5.5 i GPT-6 Sol. Dałem im dziesięć zadań: od projektowania stron i montażu filmów po przygotowanie prezentacji, obsługę przeglądarki i pracę nad kodem. W każdej z dziesięciu prób oba modele otrzymały ten sam prompt.
Zacznijmy od ceny. Według stawek, które pokazuję, Opus 5.5 kosztuje 4 dolary za wejście i 20 dolarów za wyjście, a GPT-6 Sol odpowiednio 2 i 10 dolarów. Opus jest więc dwukrotnie droższy. Sama cena nie przesądza o jakości, ale przy takim porównaniu interesuje mnie proste pytanie: jeśli przeznaczę na każdy model po 100 dolarów, który dostarczy mi więcej wartości za te pieniądze?
Zanim przejdziemy do właściwych dziesięciu prób, pokażę krótkie zadanie wstępne. W aplikacjach Claude i Codex poprosiłem agentów o pobranie dwóch najnowszych transkryptów rozmów z Fireflies dotyczących planowania czwartego kwartału i dodanie ich do firmowej wiki. Jednocześnie mieli znaleźć ostatnią sesję pytań i odpowiedzi AIS Plus, w której wspomniałem określony termin. Same dwa transkrypty obejmowały około czterech godzin rozmów; trzeba było uporządkować materiał, utworzyć odnośniki i powiązać strony.
Sol szybko zaczął wykonywać oba polecenia równolegle. Po mniej więcej sześciu minutach Claude zauważył, że inny agent pracuje nad tym samym zadaniem, i zapytał, co robić dalej. Pozwoliłem mu kontynuować. Obaj skończyli w podobnym czasie, ale w części dotyczącej wyszukiwania Sol podał 17 sierpnia, podczas gdy Opus znalazł późniejszą rozmowę z 14 września. Szukane słowo było różnie zapisane w automatycznych transkryptach, co mogło utrudnić zadanie. Mimo to oczekiwałem, że agent uwzględni takie przekłamania. W tej krótkiej próbie odpowiedź Opusa była lepsza.
1.Strona internetowa produktu
Pierwszym właściwym zadaniem było szybkie przygotowanie strony produktu: kawy z dodatkiem białka w puszce. Obie wersje opowiadały podobną historię — jeden napój zamiast osobnej kawy i odżywki — oraz korzystały z podobnego języka marki.
Jedna ze stron miała mocny obraz otwierający. Przy poruszaniu kursorem puszka i pozostałe przedmioty przesuwały się względem tła, a podczas przewijania pojawiały się kolejne animacje, obrazy i sekcja pytań. Podobało mi się zwłaszcza przejście pokazujące otwarcie puszki oraz jej obrót w części poświęconej wyborowi produktu. Przy jednym z końcowych elementów nie byłem pewien, czy szybkie zniknięcie to zamierzony efekt, czy usterka.
Druga strona również zawierała animowany tekst i podobne sekcje, lecz zamiast przekonujących zdjęć produktu częściej pokazywała jego schematyczne opakowanie. Całość wyglądała prościej i mniej starannie. Lepszą wersję przygotował Opus 5.5; drugą — GPT-6 Sol.
Oba modele pracowały około 35 minut, przy czym Opus potrzebował nieco więcej czasu. Kosztował też około trzech razy tyle: 18,32 dolara wobec 5,89 dolara. Mimo tej różnicy przyznaję zwycięstwo Opusowi za projekt i styl.
2.Film promujący wydarzenie
W drugim zadaniu przekazałem modelom link do Frame.io z około 100 GB nagrań z wydarzenia AIS Live. Chciałem, by przejrzały materiał i przygotowały dynamiczny, trzydziestosekundowy film promujący kolejną edycję, zaplanowaną na 17–18 października.
Wersję Opusa obejrzałem po raz pierwszy podczas nagrania tej recenzji. Połączył krótkie wypowiedzi uczestników z muzyką, efektami dźwiękowymi i obrazem układanym na kilku warstwach. Niektóre fragmenty wydały mi się trochę statyczne, ale całość miała tempo i dobrze oddawała atmosferę wydarzenia. Wynik był lepszy, niż się spodziewałem.
Film przygotowany przez Sola też robił wrażenie jak na automatyczny montaż, lecz miał znacznie spokojniejsze tempo. Nie wzbudził we mnie podobnej ochoty na udział w kolejnym wydarzeniu. Według mojej oceny wygrał Opus: skończył około pięciu minut wcześniej, a jego wykonanie kosztowało o około pięć dolarów więcej, czyli mniej więcej dwa razy tyle co praca Sola.
Po dwóch próbach Opus prowadził 2:0. To miła odmiana po moich doświadczeniach z Opusem 5, którego uważałem za zbyt powolnego i od którego wcześniej odszedłem.
3.Rolka na Instagram
Następnie dałem obu modelom te same nagrania i poleciłem zmontować rolkę na Instagram z użyciem Hyperframes. Materiał wyjaśniał sposób pracy z AI przypisywany Andrejowi Karpathy’emu: najpierw wspólne doprecyzowanie specyfikacji zadania, potem określenie sposobu sprawdzenia wyniku. Zamiast od razu wydawać ogólne polecenie, użytkownik ma ustalić, co chce osiągnąć, podzielić pracę na etapy i wskazać agentowi, jak ma ocenić własny rezultat.
Wersja Sola mnie nie przekonała. W tle słychać było dziwny szum, zabrakło muzyki, a animacje nie pomagały utrzymać uwagi. Nie opublikowałbym jej na swoim koncie bez wielu poprawek.
Opus użył animacji pisania i efektów dźwiękowych, dzięki czemu materiał oglądało się znacznie lepiej. Tej wersji również raczej nie opublikowałbym od razu, ale różnica między nimi była wyraźna. Opus potrzebował mniej więcej dwa razy więcej czasu i kosztował około 11 dolarów, podczas gdy Sol — prawie 3 dolary. Za pierwszy gotowy montaż daję punkt Opusowi.
Pozostaje pytanie, którego ten test nie rozstrzyga: co stałoby się, gdybym zaoszczędzone pieniądze wydał na kolejne poprawki wersji Sola? Być może po kilku rundach wynik byłby równie dobry. W tej serii porównuję jednak to, co modele oddały po tym samym pierwszym poleceniu.
4.Arkusz, prezentacja, panel i strona
W czwartej próbie przekazałem modelom obszerny zestaw danych. Miały przygotować arkusz Google do analizy, panel z wykresami, prezentację oraz stronę internetową.
Arkusz, który początkowo przypisałem Opusowi, był przejrzysty. Zawierał główne wskaźniki, zestawienie przychodów i kosztów, dane o klientach, marżach, cenach, zatrudnieniu, sprzedaży oraz przepływach pieniężnych. Kolorystyka opierała się na granacie i pomarańczu. Prezentacja korzystała z podobnego stylu: była dość prosta, ale czytelna i niezbyt przeładowana tekstem. Panel wyglądał jak typowa aplikacja szybko wygenerowana przez AI, lecz pozwalał przechodzić między widokami. Strona miała warstwowe obrazy i animacje przewijania.
Kiedy otworzyłem rezultaty drugiego modelu, prezentacja wyglądała niemal identycznie. Zacząłem podejrzewać, że agenci korzystali z tych samych plików — i tak właśnie było. Uruchomiłem ich w jednym katalogu projektu, nie zapisując w poleceniu, że mają trzymać się osobnych plików. Pierwsza próba uruchomienia Codexa się nie powiodła. Gdy wznowiłem ją około 16 minut później, Claude miał już znaczną część pracy za sobą. Codex odczytał utworzone materiały i zaczął je zmieniać, podczas gdy Claude nadal pracował.
Sprawdziłem później dzienniki obu sesji; oba modele potwierdziły taki przebieg zdarzeń. Nie umiem więc uczciwie przypisać gotowych materiałów jednemu z nich ani rozstrzygnąć tej próby.
Podczas montażu filmu znalazłem też błąd we własnym rachunku. Rzeczywista praca Codexa w tej próbie trwała około dziewięciu minut i kosztowała 3,60 dolara. Przy końcowym zestawieniu kosztów Sola należy zatem odjąć około 19 dolarów od kwoty, którą podałem pierwotnie.
5.Gra osadzona w muzeum
Piąte zadanie polegało na stworzeniu gry. Wersja, którą uruchomiłem jako rezultat Sola, nosiła tytuł „Small Hours”. Ładowała się długo i mocno obciążała mój komputer. Po starcie pojawiała się historia zamykanego muzeum miniatur. Rano na aukcję miało trafić wszystko, co zbudowała babcia bohatera; gracz siadał w jej fotelu, żeby pożegnać to miejsce.
Oprawa dźwiękowa i początek opowieści działały. Mogłem poruszać się po wnętrzu i wchodzić w interakcje z przedmiotami. Szybko wyszedł jednak na jaw poważny błąd: kursor nie był zatrzymywany w oknie gry. Gdy opuszczał jego obszar, nie mogłem dalej obracać widoku. W praktyce uniemożliwiło mi to swobodną grę.
Zanim porównałem rezultat z wersją Opusa, odkryłem ten sam problem co w poprzedniej próbie: agenci pracowali na wspólnych plikach. Nie mogę zatem wiarygodnie ocenić, który odpowiada za poszczególne części projektu. Nie przyznaję punktu żadnemu modelowi. Mogę jedynie odnotować koszt i czas: Opus pracował prawie dwie i pół godziny, Sol około godziny, a Opus kosztował mniej więcej cztery razy więcej.
6.Świat 3D wyjaśniający pojęcia AI
W szóstej próbie modele pracowały już nad oddzielnymi rezultatami. Poprosiłem je o przejrzenie moich stu wcześniejszych filmów na YouTube i stworzenie trójwymiarowego świata, po którym można chodzić i poznawać omawiane przeze mnie pojęcia.
Opus przygotował rysunkowy świat z przewodnikiem i pokojami poświęconymi różnym tematom. W części objaśniającej działanie modeli językowych znalazła się interaktywna maszyna pokazująca wybór kolejnego fragmentu tekstu. Kulki reprezentujące możliwe odpowiedzi potrafiły się zablokować, zwłaszcza gdy wrzuciłem ich wiele naraz, lecz sam pomysł był ciekawy. W innym miejscu mogłem dodawać bloki i obserwować zapełnianie okna kontekstowego. Były też obszary poświęcone agentom, promptom, pamięci, automatyzacji i umiejętnościom. Nie każda minigra angażowała równie mocno, ale całość zachęcała do zwiedzania.
Sol stworzył „Idea Atlas”. Dało się po nim poruszać i otwierać części dotyczące różnych zagadnień, jednak interfejs był dla mnie zbyt zatłoczony. Jedna z nakładek nie znikała, a sposób korzystania z niektórych elementów nie był od razu jasny. Świat wydawał się też mniej dopracowany: można było choćby przejść przez fontannę.
W tej próbie wybieram Opusa. Pracował około godziny i 45 minut, a Sol około 50 minut. Koszt wyniósł odpowiednio około 60 i 8,55 dolara. Różnica jest duża, ale rezultat Opusa uznałem za znacznie przyjemniejszy w użyciu.
7.Miesięczna podróż przedstawiona na globusie
Kolejne polecenie było celowo ogólne. Chciałem wyjechać z Chicago na okres od 1 do 30 października, odwiedzić ciekawe wydarzenia związane z AI, zobaczyć przyrodę i wybrać się także poza Stany Zjednoczone. Plan miał przybrać postać interaktywnego świata 3D.
Sol częściej niż Opus zatrzymywał się w trakcie pracy, żeby zadać pytanie. Zwykle to cenię, bo pomaga doprecyzować oczekiwania. Z moich obserwacji wynika, że Codex potrafi też zadać pytanie i kontynuować, jeśli nie dostanie od razu odpowiedzi — choć w niektórych zadaniach takie przerwy mogą przeszkadzać.
Rezultatem Sola był globus z trzydziestodniową trasą. Plan obejmował między innymi San Francisco, okolice Yosemite, Amsterdam, Islandię, Toronto, wodospad Niagara, Las Vegas i parki narodowe amerykańskiego Zachodu. Poszczególne punkty prowadziły do planu dnia oraz odnośników do lotów, hoteli czy biletów. Jak na ogólne polecenie, otrzymałem sporo użytecznych informacji. Sam globus nie dawał mi jednak takiego wrażenia zwiedzania, na jakie liczyłem.
Opus przygotował podobny plan, ale lepiej wykorzystał mapę i pozwalał głębiej wejść w opis poszczególnych przystanków. Co ważniejsze, uwzględnił San Francisco Tech Week oraz inne wydarzenia technologiczne w rejonie San Jose. W planie Sola byłem w San Francisco na początku miesiąca, bez wyraźnego powiązania pobytu z dużym wydarzeniem. Ponieważ właśnie o wydarzenia AI mi chodziło, bardziej ufałbym planowi Opusa. Jego globus ładował się wolno, lecz całość lepiej odpowiadała mojemu zamiarowi.
Obie prace trwały podobnie długo. Opus kosztował około trzech razy więcej i ponownie wygrał w mojej ocenie.
8.Analiza i naprawa dużej bazy kodu
Ósmą próbę przygotowałem inaczej. Poprosiłem inny model o zaprojektowanie neutralnego zadania z dużą bazą kodu: analizą problemów, poprawkami i sprawdzeniem rezultatu. Nie wskazałem mu na początku, jakie modele będę porównywał.
Tym razem lepiej wypadł Sol. Uzyskał 100 punktów na 100 i przeszedł wszystkie 30 kontroli. Opus zdobył 97 punktów i nie zaliczył jednej kontroli. Co równie istotne, Opus pracował około dwa razy dłużej i kosztował mniej więcej 20 razy więcej. Sol wykonał tę próbę za około dolara.
W przebiegu zadania pojawiła się komplikacja: Sol zatrzymał się z powodu zabezpieczenia dotyczącego cyberbezpieczeństwa. Musiałem przerwać obie sesje, opisać sytuację modelowi, który przygotował zadanie, a następnie przekazać obu wykonawcom zmienione polecenie. Opus nie zatrzymał się w ten sposób.
To jeden test, więc nie wyciągałbym z niego ogólnej reguły. Pokazuje jednak wyraźnie, że przy analizie, sprawdzaniu i naprawianiu kodu Sol może być bardzo dobrym wyborem. W tym przypadku dał lepszy wynik za ułamek kosztu Opusa.
9.Utworzenie kursu w przeglądarce
Dwie ostatnie próby dotyczyły obsługi przeglądarki. W moich wcześniejszych porównaniach Codex często wypadał tu lepiej niż Claude Code, dlatego byłem ciekaw wyniku.
Przekazałem obu agentom strukturę kursu, filmy, opisy i materiały dodatkowe. Mieli utworzyć kurs w mojej bezpłatnej społeczności AIS w serwisie Skool. Sol dodał 15 lekcji jako szkice. Każda miała opis, główne punkty, cytaty i zasoby; odnośniki wyglądały na prawidłowo podpięte.
Opus również dodał lekcje i potrzebne materiały. Zamiast oznaczać każdą stronę osobno jako szkic, pozostawił w trybie szkicu cały kurs, co wydało mi się rozsądniejsze. Zauważyłem jednak drobną niedoróbkę: część zasobów podlinkował dwukrotnie.
Rezultaty były bardzo podobne. Spodziewałem się, że Sol okaże się tańszy, ale w tej próbie Opus skończył szybciej i kosztował mniej. Mimo powtórzonych linków przyznaję mu punkt.
10.Odtworzenie obrazu narzędziami Canvy
Na koniec dałem agentom obraz referencyjny wygenerowany przez AI, przedstawiający mnie z Adamem Sandlerem. Polecenie brzmiało: otworzyć Canvę i odtworzyć obraz za pomocą dostępnych narzędzi do rysowania i malowania.
Rezultat Opusa zaskoczył mnie jakością. Był lepszy, niż oczekiwałem po takim zadaniu, i lepszy od wyników, które widziałem w części wcześniejszych prób z innymi modelami.
Sol najpierw próbował po prostu wygenerować nowy obraz, choć miał użyć narzędzi Canvy. Ponowiłem polecenie. Otrzymany rysunek był bardzo słaby, więc uruchomiłem jeszcze jedną sesję. Drugi wynik również nie nadawał się do porównania z pracą Opusa.
Zwycięzca był dla mnie oczywisty. Opus potrzebował jednak około 30 minut więcej i kosztował mniej więcej cztery razy tyle co Sol.
Bilans i wybór modelu
Moja punktacja to siedem zwycięstw Opusa 5.5, jedno zwycięstwo GPT-6 Sol oraz dwie próby, których nie rozstrzygam z powodu wspólnych plików. Łączny czas pracy Opusa wyniósł osiem godzin i 40 minut, a Sola pięć godzin i 51 minut.
W końcowym zestawieniu pokazałem koszt około 213 dolarów dla Opusa i 74,46 dolara dla Sola. Trzeba jednak pamiętać o poprawce z czwartej próby: kwota Sola powinna być niższa o około 19 dolarów. Tych liczb nie należy więc czytać bez zastrzeżenia.
Po tych zadaniach chętniej powierzyłbym Opusowi pracę twórczą i decyzje wymagające wyczucia. Sol wypadł znakomicie przy naprawie kodu, a jego cena pozwala myśleć o częstszym wykorzystywaniu go do ściśle określonych czynności. Ciekawym sposobem pracy byłoby powierzenie Opusowi planowania i rozdzielania zadań, a Solowi wykonania jasno opisanych etapów. To pomysł wynikający z moich obserwacji, nie kolejna próba przeprowadzona w tym porównaniu.
Opus 5.5 zrobił na mnie znacznie lepsze wrażenie niż Opus 5. Po GPT-6 Sol spodziewałem się natomiast więcej, zwłaszcza że dobrze wspominam poprzednią wersję Sola. Najuczciwiej będzie jednak zakończyć na tym, co rzeczywiście pokazały te zadania: w moich próbach Opus częściej dawał lepszy rezultat, lecz za tę jakość zwykle trzeba było zapłacić więcej.