O czym jest ten film
- Jev to model AI przeznaczony do podejmowania określonych decyzji: odpowiada „tak” lub „nie”, wybiera kategorię albo wystawia ocenę na zadanej skali.
- Autor porównuje jego szybkość i koszt z modelami konwersacyjnymi. W próbie obejmującej 1000 wiadomości Jev okazał się wyraźnie szybszy i tańszy od użytego do porównania modelu Luna.
- Na przykładach poczty, komentarzy YouTube i wpisów społeczności autor pokazuje, jak przygotować pytania oraz kryteria klasyfikacji.
- Zbudowane przez niego rozszerzenie przeglądarki ocenia wpisy na X w chwili, gdy pojawiają się na ekranie.
- Jev może oznaczać cechy transkrypcji spotkań i fragmentów nagrań, ale sam nie napisze podsumowania ani nie wyjaśni, jakie wnioski z nich płyną.
- Wśród innych zastosowań są wstępna ocena umów, zgłoszeń sprzedażowych, ofert pracy, notatek głosowych i spraw kierowanych do obsługi klienta.
- Autor pokazuje również eksperymentalny system podejmujący co sekundę decyzje o transakcjach na bitcoinie. To handel symulowany; sam wskazuje niedopracowanie projektu i znaczenie opłat transakcyjnych.
- Najważniejszą zasadą wdrożenia jest porównanie odpowiedzi Jev z poprawnie oznaczonymi przykładami oraz z wynikami innych modeli.
- Jev najlepiej sprawdza się jako element większego procesu: porządkuje napływające dane, a zadania wymagające pisania, analizy lub obsługi przeglądarki przekazuje innym narzędziom.
10 najważniejszych takeaways — z kontekstem zastosowania
1.Powierz Jev decyzje, które da się jasno zdefiniować
Na czym polega: Model odpowiada na pytanie „tak czy nie”, wybiera jedną z podanych kategorii albo przyznaje ocenę według ustalonej skali. Nie prowadzi rozmowy i nie pisze tekstów.
Jak stosować: Zacznij od konkretnej decyzji, na przykład: „Czy ta wiadomość dotyczy płatności?”. Zapisz, jakie przypadki mają oznaczać odpowiedź „tak”.
Na co uważać: Nie oczekuj od Jev samodzielnego odkrywania tematów w danych ani uzasadnienia odpowiedzi. Do takich zadań potrzebny jest inny model.
2.Porównuj modele na własnych danych
Na czym polega: W jednym z testów Jev sklasyfikował 1000 wiadomości według kilku kryteriów w około 70 sekund za 9 centów. Luna potrzebowała około pięciu minut i kosztowała 62 centy.
Jak stosować: Przygotuj ten sam zestaw wiadomości i tych samych pytań dla modeli, które rozważasz. Porównaj koszt, czas i poprawność odpowiedzi.
Na co uważać: Przewaga szybkości i ceny w pojedynczym teście nie dowodzi, że model równie dobrze poradzi sobie z Twoją pocztą czy zgłoszeniami.
3.Sposób uruchomienia ma wpływ na szybkość
Na czym polega: Po zmianie sposobu przetwarzania Jev wykonał klasyfikację 1000 wiadomości według siedmiu reguł w około sześć sekund, przy podobnym koszcie jak wcześniej.
Jak stosować: Jeśli obsługujesz duży napływ danych, sprawdź, czy system może przetwarzać wiele elementów równolegle i przekazywać je w odpowiednich partiach.
Na co uważać: Nie przypisuj całej różnicy w czasie samemu modelowi. W tym przykładzie wynik poprawiła także zmiana programu, który wysyłał żądania.
4.Najpierw porządkuj komentarze, potem odpowiadaj
Na czym polega: Jev może oznaczać komentarze wymagające odpowiedzi, pytania, potencjalnych klientów albo pomysły na następne materiały.
Jak stosować: Użyj go do wstępnego podziału dużej liczby komentarzy. Następnie przekaż wybrane grupy osobie z zespołu lub modelowi, który potrafi napisać odpowiedź.
Na co uważać: Automatyczna etykieta nie oddaje całego sensu wypowiedzi. Sprawdzaj szczególnie komentarze od klientów i przypadki, w których kontekst ma znaczenie.
5.Dobre pytania pozwalają wyciągać wnioski ze spotkań
Na czym polega: Zamiast prosić Jev o ogólną analizę rozmów, można sprawdzić w każdej transkrypcji, czy ustalono kolejne kroki, przypisano odpowiedzialność i wyznaczono terminy.
Jak stosować: Wybierz kilka cech ważnych dla Twoich spotkań. Po oznaczeniu większej liczby rozmów zobacz, które problemy powtarzają się najczęściej.
Na co uważać: Wyniki odpowiedzą tylko na pytania, które wcześniej zadasz. Źle dobrane kryteria mogą pominąć najważniejszy problem.
6.Szybka klasyfikacja przydaje się podczas pracy na żywo
Na czym polega: Rozszerzenie przeglądarki autora oznacza wpisy na X jako pilne wiadomości, wartościowe informacje albo treści, które uznaje za mało przydatne.
Jak stosować: Jeśli regularnie przeglądasz duży strumień informacji, zdefiniuj własne kategorie pomagające zdecydować, czemu poświęcić uwagę.
Na co uważać: Takie oznaczenia służą do wstępnej selekcji. Nie traktuj ich jako potwierdzenia prawdziwości wiadomości ani obiektywnej oceny jej wartości.
7.W automatyzacji rozdziel podejmowanie decyzji od wykonywania zadań
Na czym polega: Jev może zdecydować, dokąd skierować sprawę. Inny model może później napisać odpowiedź, przeanalizować dokument albo wykonać czynność w przeglądarce.
Jak stosować: W procesie obsługi klienta pozwól Jev oznaczyć temat i pilność zgłoszenia, a dalszą pracę przekaż właściwemu zespołowi lub narzędziu.
Na co uważać: Zaplanuj, co stanie się po decyzji. Samo poprawne przypisanie kategorii nie rozwiązuje sprawy klienta.
8.Koszt jednostkowy ma znaczenie przy dużej skali
Na czym polega: Różnica kilku centów może wydawać się nieistotna w małym teście, lecz rośnie przy tysiącach codziennych decyzji.
Jak stosować: Policz koszt dla rzeczywistej liczby wiadomości, komentarzy czy zgłoszeń, które Twój proces obsługuje w ciągu miesiąca.
Na co uważać: Oszczędność traci sens, jeśli błędne decyzje wymagają kosztownych poprawek. Uwzględnij także pracę ludzi sprawdzających wyniki.
9.Handel symulowany pokazuje możliwości, nie skuteczność strategii
Na czym polega: Autor zbudował system, w którym Jev co sekundę ocenia możliwy kierunek kursu bitcoina i na tej podstawie podejmuje decyzje o symulowanych transakcjach.
Jak stosować: Traktuj podobny projekt jako próbę szybkości działania i sposobu łączenia modelu z resztą systemu.
Na co uważać: Autor przyznaje, że projekt nie został należycie sprawdzony, a początkowy wynik jest słaby. Opłaty transakcyjne przewyższają koszt decyzji modelu i mogą zniwelować ewentualny zysk.
10.Sprawdź trafność przed wdrożeniem
Na czym polega: Autor proponuje zestaw około 100 przypadków z wcześniej ustalonymi poprawnymi odpowiedziami. Na nim można porównać Jev z innymi modelami.
Jak stosować: Zbierz przykłady łatwe i trudne, oznacz je ręcznie, a następnie zmierz trafność, koszt oraz — jeśli ma znaczenie — czas odpowiedzi.
Na co uważać: Nie uruchamiaj automatycznych decyzji na podstawie samej demonstracji. Zestaw próbny powinien przypominać sprawy, które system rzeczywiście będzie obsługiwał.
Redakcyjne tłumaczenie
Czym jest Jev
Jev pojawia się ostatnio wszędzie. Sądzę, że może zmienić sposób budowania automatyzacji opartych na AI, dlatego sprawdziłem go w 12 zastosowaniach. Porównałem też jego szybkość i koszt z innymi modelami. Zbudowałem między innymi rozszerzenie przeglądarki, które na bieżąco oznacza wpisy na X jako pilne wiadomości, wartościowe informacje albo treści, które wolę pominąć. Przygotowałem również eksperymentalny system, który co sekundę ocenia możliwy ruch kursu bitcoina i podejmuje decyzje o symulowanych transakcjach. Po pierwszej godzinie jego wyniki nie były dobre.
Najpierw wyjaśnię, co Jev właściwie robi. To model AI, który podejmuje decyzje, ale nie pisze odpowiedzi. Nie da się z nim rozmawiać jak z ChatGPT. Otrzymuje materiał oraz opis zadania, po czym zwraca wynik w ustalonej postaci.
Diogo, który współtworzył ChatGPT, przedstawił Jev jako rezultat prac nad nowym sposobem uczenia modeli. Na blogu TypeSafety nazwano go RLCD, od reinforcement learning for calibrated decisions. W praktyce chodzi tu o model przygotowany do podejmowania decyzji wraz z oceną własnej pewności. Dostęp można uzyskać przez listę oczekujących TypeSafe AI; Jev jest też dostępny przez Vercel AI Gateway i OpenRouter.
Wyobraźmy sobie zgłoszenie do działu pomocy. Typowy model konwersacyjny przeczytałby je, przeanalizował i napisał odpowiedź lub nadał mu kategorię. Jev może od razu zwrócić zestaw rozstrzygnięć: czy sprawa jest pilna, do którego zespołu powinna trafić i jak silną frustrację wyraża klient. W pokazanym przykładzie uznał sprawę za pilną z pewnością wynoszącą 99 proc., przypisał ją do zespołu technicznego i wystawił ocenę frustracji na wskazanej skali.
To użytkownik określa, jakie decyzje model ma podejmować i co znaczą poszczególne kategorie. Dostępne są trzy podstawowe rodzaje odpowiedzi: „tak” lub „nie”, wybór jednej z podanych możliwości oraz ocena liczbowa. Przy odpowiedziach można też zobaczyć, jak pewny jest model.
Twórcy Jev podają, że działa on od 20 do 200 razy szybciej i od 40 do 400 razy taniej niż modele używane do podobnych zadań. W mojej krótkiej próbie różnica w szybkości również była duża, choć pojedynczy test nie pozwala ustalić stałej przewagi nad każdym innym modelem. Jev nie musi tworzyć długiej wypowiedzi: oddaje samą decyzję w uporządkowanym formacie.
Ta oszczędność ma wartość tylko wtedy, gdy odpowiedzi są wystarczająco trafne. Jev nie napisze tekstu, nie przygotuje streszczenia, nie odkryje samodzielnie tematów przewijających się przez zbiór danych i nie przeprowadzi pogłębionej analizy. Ma też okno kontekstowe o wielkości 64 tysięcy tokenów. Warto pamiętać o tym ograniczeniu przy pracy z obszernymi materiałami.
Najbardziej obiecujące zastosowanie widzę w pracy z dużą liczbą podobnych elementów. Jeśli mam 5000 komentarzy pod filmami, Jev może szybko i tanio wskazać te, które wymagają odpowiedzi, opisują problem albo świadczą o chęci zakupu. Dopiero wybrane komentarze przekazałbym modelowi zdolnemu do analizy i pisania. Nie ma potrzeby zlecać droższemu modelowi wstępnego sortowania całego zbioru.
Z Jev warto eksperymentować wtedy, gdy proces wymaga wielu jasno określonych decyzji, zwłaszcza podejmowanych na bieżąco. Jeśli masz tylko kilka pozycji, chcesz poznać uzasadnienie, szukasz pomysłów albo potrzebujesz rozmowy, model konwersacyjny będzie odpowiedniejszy.
Poczta: siedem ocen dla tysiąca wiadomości
Zacząłem od poczty. Przygotowałem pytania dotyczące między innymi faktur i potwierdzeń płatności, propozycji współpracy z marką, prób oszustwa, rodzaju wiadomości, pilności oraz tego, czy oferta sponsora pasuje do mojej działalności. Część wymaga odpowiedzi „tak” lub „nie”, część wyboru kategorii, a część oceny na skali.
Pierwsza próba objęła 1000 wiadomości i siedem reguł. Jev przetworzył je w około 70 sekund za 9 centów. To nie był jeszcze najszybszy możliwy sposób uruchomienia: wiadomości nie były przetwarzane równolegle. Dla porównania powtórzyłem zadanie z modelem Luna. Potrzebował około pięciu minut, a koszt wyniósł 62 centy.
Później zmieniłem program wysyłający dane do Jev, tak aby przetwarzał większe partie równolegle. Ten sam rodzaj pracy trwał wtedy około sześciu sekund przy koszcie około 9 centów. Oczywiście sposób uruchomienia można poprawiać także dla innych modeli, ale ta próba pokazuje, jak szybko Jev potrafi obsłużyć dużą liczbę prostych decyzji.
Przyjrzyjmy się jednej regule. Pytanie brzmi: „Czy ta wiadomość jest rachunkiem, fakturą, potwierdzeniem płatności albo powiadomieniem o rozliczeniu?”. Określiłem, że odpowiedź „tak” obejmuje między innymi obciążenie, płatność, wypłatę oraz informację o nieudanej wypłacie. Ustawiłem też minimalną pewność na 50 proc. Jev oznaczył 237 z 1000 wiadomości jako pasujące do tej grupy, a 763 jako niepasujące. Zajęło mu to około czterech sekund i kosztowało 5 centów.
Przy wyborze rodzaju wiadomości najpierw podałem możliwe odpowiedzi, takie jak powiadomienie, biuletyn, sprawa rozliczeniowa czy propozycja współpracy, a następnie opisałem każdą kategorię. Ocena dopasowania sponsora działa inaczej: model wybiera stopień na skali od wiadomości, która w ogóle nie jest propozycją sponsoringu, po ofertę bardzo dobrze pasującą do moich potrzeb. Większość wiadomości znalazła się na najniższym poziomie; żadna nie otrzymała najwyższej oceny. Osobno oceniałem pilność. Tu wyniki były bardziej zróżnicowane, ze średnią 2,8 na pięciostopniowej skali.
W tym porównaniu Luna kosztowała około 12 razy więcej i potrzebowała około 46 razy więcej czasu niż Jev po usprawnieniu przetwarzania. To był jeden model i jeden zestaw danych, ale różnica pokazuje, dlaczego warto przetestować Jev w procesie, który codziennie obsługuje tysiące wiadomości.
Komentarze, społeczność i bieżące wpisy
Podobny zestaw pytań zastosowałem do komentarzy na YouTube. Model może określić rodzaj komentarza, wskazać te warte odpowiedzi, wyłowić pomysły na nowe filmy, ocenić wydźwięk wypowiedzi i trudność pytania. W pokazanej próbie przetworzenie 1000 komentarzy zajęło około pięciu sekund i kosztowało 5 centów.
W panelu Jev widziałem wówczas prawie 20 tysięcy wysłanych żądań przy łącznym koszcie 85 centów. To skłania do myślenia o skali: jeśli podobne decyzje podejmujemy przy każdym nowym komentarzu, różnice w cenie z czasem nabierają znaczenia.
Tak samo mogę traktować wpisy w swojej społeczności. Przygotowałem kategorie dotyczące rodzaju pytania, potrzeby pomocy, konieczności odpowiedzi ze strony zespołu, ryzyka odejścia członka społeczności, poziomu jego doświadczenia oraz tego, czy wypowiedź może być przydatną opinią o usłudze. W demonstracji wszystko widać w panelu, ale te decyzje mogą działać w zwykłej automatyzacji: nowy wpis trafia do bazy danych, gdzie otrzymuje odpowiednie oznaczenia.
Podobny proces można uruchomić dla komentarzy YouTube, nowych kontaktów w systemie sprzedażowym czy formularzy wysłanych przez stronę internetową. Przy wielu takich procesach szybkość pojedynczej odpowiedzi nie zawsze jest najważniejsza. Za to koszt rośnie wraz z liczbą obsługiwanych spraw.
Zbudowałem też rozszerzenie Chrome do przeglądania X. Gdy wpis pojawia się na ekranie, Jev ocenia go na bieżąco. Rozszerzenie oznacza materiały, które mogą zawierać pilną wiadomość lub cenną informację, i te, które uznaje za mało przydatne. Chciałem dzięki temu łatwiej wybierać wpisy warte przeczytania. Tutaj szybkość ma znaczenie bezpośrednie: etykieta musi pojawić się, zanim przewinę dalej.
Spotkania i fragmenty filmów
Kolejnym pomysłem są transkrypcje spotkań z narzędzi takich jak Fireflies czy Granola. Po zakończeniu rozmowy Jev może określić jej rodzaj, sprawdzić, czy zapadły decyzje i czy ustalono dalsze działania.
Szczególnie przydatne byłoby dla mnie pytanie o kolejne kroki: czy zostały jasno nazwane, czy wiadomo, kto za nie odpowiada, i czy ustalono terminy. Jeśli z danych wynika, że w wielu rozmowach brakuje tych ustaleń, mogę zmienić sposób prowadzenia spotkań. Przygotowałem także pytania o napięcie w rozmowie, oznaki przeciążenia lub frustracji, sprawy czekające na moją decyzję oraz znaczenie spotkania dla przychodów.
Jev nie przeczyta sam tysięcy transkrypcji i nie powie mi, co powinienem poprawić w prowadzeniu rozmów. Potrafi za to odpowiedzieć na starannie przygotowane pytania dotyczące każdej z nich. Gdy zbiorę wyniki, mogę zobaczyć powtarzające się wzorce i sam wyciągnąć wnioski. Wiele zależy więc od tego, jakie pytania zadam na początku.
Przetestowałem również ocenianie krótkich fragmentów filmów. Najpierw inny model podzielił moje nagrania z YouTube na klipy. Następnie Jev sprawdzał, czy dany fragment nadaje się do osobnej publikacji, jak mocno przyciąga uwagę na początku, jaki ma charakter, czy do jego zrozumienia potrzebny jest obraz ekranu i czy zawiera zdanie warte przytoczenia. Wiele fragmentów nie nadawało się do samodzielnego udostępnienia. Wyniki pomagają mi jednak wybierać materiały do ponownej publikacji i zastanowić się nad sposobem, w jaki mówię w nagraniach.
Wspólny pomysł stojący za tymi próbami jest prosty: mam dużo materiału do przejrzenia, ale nie każda pozycja wymaga pełnej analizy przez rozbudowany model. Mogę najpierw zadać Jev konkretne pytania, a droższą pracę zlecić dopiero przy wybranych pozycjach.
Umowy, zgłoszenia i osobiste notatki
Nie należy włączać Jev do procesu i od razu ufać wszystkim wynikom. Najpierw przygotowałbym zestaw około 100 przypadków z poprawnymi odpowiedziami. Ten sam zestaw dałbym Jev oraz innym rozważanym modelom, na przykład Opusowi i Solowi. Dopiero porównanie trafności, ceny i — tam, gdzie to ważne — szybkości pozwala wybrać właściwe narzędzie.
Tak można podejść do wstępnego przeglądu umów. Jev mógłby oznaczać rodzaj postanowienia lub sygnalizować wcześniej określone ryzyko. Pytania powinny wynikać z tego, na co rzeczywiście zwracasz uwagę przy sprawdzaniu dokumentów.
Podobnie jest ze zgłoszeniami dotyczącymi pracy i sprzedaży. Model może wskazywać sygnały ostrzegawcze, oceniać dopasowanie potencjalnego klienta i sugerować, do jakiego etapu procesu skierować sprawę. W każdym zastosowaniu trzeba najpierw jasno opisać kryteria.
Inny przykład to porządkowanie myśli dyktowanych do telefonu. Gdy często nagrywasz pomysły, zadania i osobiste zapiski, Jev może rozdzielać je na kategorie, oznaczać terminy, priorytety oraz obszary życia, których dotyczą. Duża część pracy z AI sprowadza się przecież do ustalenia, co zrobić z napływającymi danymi.
Szczególnie obiecująco wygląda obsługa klienta. W każdym zgłoszeniu trzeba zdecydować, jaki jest temat sprawy, jak pilna jest odpowiedź, jaki jest nastrój klienta i do kogo skierować wiadomość. To wiele drobnych decyzji, które Jev może podejmować szybko i przy niskim koszcie. Odpowiedź dla klienta nadal może przygotować człowiek albo model przeznaczony do pisania.
Eksperyment z transakcjami co sekundę
Na koniec przygotowałem próbny system handlu bitcoinem. To handel symulowany, a sam projekt wymaga jeszcze dopracowania i sprawdzenia. Co sekundę Jev ocenia, czy kurs może wzrosnąć, spaść, czy też sygnał jest niejednoznaczny. System wykorzystuje te oceny i poziom pewności do podejmowania decyzji o kupnie lub sprzedaży.
Eksperyment pokazuje, że model potrafi bardzo często podejmować decyzje przy stosunkowo małym koszcie. Według mojego oszacowania działanie takiego systemu przez całą dobę kosztowałoby w przypadku Jev około dwóch dolarów dziennie; inne porównywane modele byłyby znacznie droższe.
Nie oznacza to jednak, że strategia zarabia. Jej początkowe wyniki były słabe. Pojawia się też problem opłat transakcyjnych, które są wyższe niż koszt pracy modelu. Żeby taki system miał sens, wynik transakcji musiałby pokrywać również te opłaty.
Widziałem ponadto eksperymenty, w których Jev podejmuje decyzje podczas gry albo pomaga sterować przeglądarką. Pokazują możliwości modelu, ale trzeba ustalić, gdzie kończy się jego zadanie. Jev może wybrać następny krok; wpisanie tekstu czy obsługa strony mogą wymagać przekazania pracy innemu modelowi.
Dlatego najwięcej praktycznej wartości widzę dziś w panelach i automatyzacjach opartych na jasno określonych pytaniach. Najpierw warto znaleźć decyzje, które rzeczywiście powtarzają się w naszej pracy, sprawdzić trafność Jev na własnych przykładach i dopiero wtedy połączyć go z narzędziami wykonującymi dalsze czynności.
Na marginesie: przygotowałem też bezpłatną instrukcję zdobywania pierwszych klientów na automatyzacje AI. Obejmuje między innymi sposób przedstawienia usługi, przygotowanie krótkiego nagrania pokazującego umiejętności oraz działanie bez wcześniejszych studiów przypadku. Odnośnik znajduje się w opisie filmu.