Jev: jak działa i co można zbudować

2026-09-18 • Riley Brown • AI zagraniczne •tutorial •waga 3/5 •12 min czytania

Jev szybko przypisuje dane do ustalonych kategorii i ocenia je według zadanych kryteriów. Przyda się twórcom automatyzacji poczty, obsługi zgłoszeń i wyboru modeli AI.

Robocza publikacja redakcyjna na podstawie publicznego transkryptu YouTube. Źródło: YouTube.

O czym jest ten film

  1. Type-Safe udostępniło Jev — model przeznaczony do podejmowania decyzji na podstawie danych wejściowych, a nie do pisania tekstu.
  2. Autor pokazuje aplikację, która analizuje 500 wiadomości e-mail i przypisuje im kategorie oraz poziomy ważności.
  3. Jev zwraca trzy rodzaje wyników: wybór spośród podanych możliwości, ocenę na zdefiniowanej skali albo prawdopodobieństwo odpowiedzi „tak”.
  4. W drugim przykładzie model wybiera narzędzie AI odpowiednie do złożoności polecenia.
  5. Według danych przytoczonych przez autora pojedyncza decyzja Jev zajmuje około 0,4 sekundy i kosztuje około 0,0004 dolara.
  6. Model przyjmuje do 64 tys. tokenów danych wejściowych. Jego zastosowanie wymaga więc przemyślenia, jakie informacje są potrzebne do oceny.
  7. Autor widzi zastosowanie Jev w porządkowaniu poczty, komentarzy, wiadomości prywatnych i ofert współpracy.
  8. Przykład wykrywania oszustw pokazuje, jak szybko oznaczać podejrzane wiadomości, ale wynik modelu nie jest potwierdzeniem, że wiadomość rzeczywiście jest oszustwem.
  9. W filmie pojawiają się także demonstracje wyboru działań podczas jazdy, transakcji giełdowych i obsługi przeglądarki.
  10. Dostęp do Jev można uzyskać przez listę oczekujących Type-Safe albo przez Vercel AI Gateway.

10 najważniejszych takeaways — z kontekstem zastosowania

1.Zacznij od decyzji, którą da się jasno nazwać

Na czym polega: Jev odczytuje dane i wskazuje wynik w ramach przygotowanego zadania. Nie napisze odpowiedzi na e-mail ani tekstu artykułu.

Jak stosować: Wybierz powtarzalną decyzję, na przykład „do jakiego działu skierować tę wiadomość?”, i określ dopuszczalne wyniki.

Na co uważać: Jeśli potrzebujesz uzasadnienia, swobodnej odpowiedzi lub gotowego tekstu, sam wynik Jev nie wystarczy.

2.Kategorie trzeba przygotować przed uruchomieniem modelu

Na czym polega: Przy klasyfikacji Jev wybiera jedną z opcji podanych przez użytkownika.

Jak stosować: Ustal kategorie odpowiadające rzeczywistemu sposobowi pracy, na przykład „pytanie klienta”, „oferta współpracy” i „newsletter”.

Na co uważać: Zbyt ogólne albo nakładające się kategorie utrudnią wykorzystanie wyników, nawet jeśli model działa szybko.

3.Prawdopodobieństwo odpowiedzi „tak” pomaga wyłowić wiadomości

Na czym polega: W trybie nazwanym w interfejsie autora „null” model ocenia, na ile dany materiał spełnia pojedynczy warunek, na przykład czy zawiera propozycję współpracy reklamowej.

Jak stosować: Zadaj konkretne pytanie i ustaw próg, od którego wiadomość ma trafić do przeglądu.

Na co uważać: Wynik 90% jest oceną modelu, a nie dowodem, że wiadomość rzeczywiście spełnia warunek.

4.Własna skala pozwala ustalać priorytety

Na czym polega: Jev może przypisać wiadomości poziom na przygotowanej skali, od „zignoruj” po „krytyczne”.

Jak stosować: Powiąż każdy poziom z działaniem: co można odłożyć, co przeczytać dziś, a co wymaga szybkiej reakcji.

Na co uważać: Skala ma sens tylko wtedy, gdy jej stopnie oznaczają dla zespołu konkretne rzeczy. Samo dodanie poziomu „pilne” nie sprawi, że model zna zasady pracy firmy.

5.Jednym z zastosowań jest wybór modelu AI

Na czym polega: Autor zbudował narzędzie, w którym Jev ocenia polecenie i wybiera model do jego wykonania. Proste przedstawienie się skierował do najmniejszego modelu, a prośbę o pomoc w budowie aplikacji — do mocniejszego.

Jak stosować: Ustal kilka poziomów zadań i przypisz im dostępne modele, biorąc pod uwagę koszt oraz wymaganą jakość odpowiedzi.

Na co uważać: W pokazie Jev nie wybrał najwyższego poziomu. Warto sprawdzić, czy własne reguły nie kierują trudnych zadań do zbyt słabego modelu.

6.Oszczędności mają największe znaczenie przy dużej liczbie wywołań

Na czym polega: Autor przytacza porównanie, według którego decyzja Jev jest znacznie szybsza i tańsza od odpowiedzi tradycyjnego modelu językowego.

Jak stosować: Rozważ Jev tam, gdzie tę samą ocenę wykonujesz setki lub tysiące razy, na przykład przy napływających zgłoszeniach.

Na co uważać: Podane w filmie czasy i ceny pochodzą z przytoczonego porównania, a nie z niezależnego pomiaru dla każdego rodzaju zadania.

7.Wynik może od razu zasilać dalszą automatyzację

Na czym polega: Jev zwraca wynik w ustalonej postaci, więc aplikacja może go wykorzystać do oznaczenia wiadomości lub przekazania jej właściwej osobie.

Jak stosować: Zbuduj prosty ciąg działań: napływ danych, ocena, etykieta, skierowanie do odpowiedniej kolejki.

Na co uważać: Poprawna postać wyniku nie gwarantuje poprawnej decyzji. Przed automatycznym przekazywaniem spraw sprawdź jakość ocen na własnych danych.

8.Podejrzane wiadomości warto oznaczać do sprawdzenia

Na czym polega: W demonstracji Jev wskazał 55 spośród 500 e-maili jako potencjalne oszustwa.

Jak stosować: Użyj takiej oceny do wyodrębnienia wiadomości wymagających uwagi, szczególnie gdy skrzynka jest duża.

Na co uważać: Autor nie weryfikuje w filmie wszystkich 55 przypadków. Nie traktuj liczby oznaczonych wiadomości jako liczby potwierdzonych oszustw.

9.Ilość przekazywanego kontekstu ma znaczenie

Na czym polega: Jev przyjmuje do 64 tys. tokenów wejściowych. To mniej niż limity większych modeli językowych przywołanych przez autora.

Jak stosować: Do oceny przekazuj informacje potrzebne do podjęcia danej decyzji, na przykład treść wiadomości i zwięzłe zasady jej klasyfikacji.

Na co uważać: Jeśli do zadania trzeba dołączyć obszerną wiedzę o firmie, dokumentach lub historii klienta, limit może wymusić wybór najważniejszych fragmentów.

10.Zacznij od małego wdrożenia z możliwością kontroli

Na czym polega: Autor wskazuje dostęp przez Type-Safe i Vercel AI Gateway oraz zachęca do budowania własnych aplikacji.

Jak stosować: Przygotuj prototyp z jedną decyzją, na przykład podziałem wiadomości na kategorie, i porównaj wyniki z własną oceną.

Na co uważać: Pokazy dotyczące prowadzenia pojazdu, handlu na giełdzie i obsługi przeglądarki ilustrują szybkość modelu. Same w sobie nie potwierdzają, że nadaje się on do samodzielnego wykonywania działań o poważnych skutkach.

Redakcyjne tłumaczenie

Model, który podejmuje decyzje

W świecie AI pojawiła się nowość. Firma Type-Safe udostępniła Jev — model inny niż narzędzia, o których zwykle opowiadam, takie jak GPT-6 Astra czy Fable 5.1. Jev nie jest chatbotem. Nie napisze nawet zdania. Jego zadanie polega na szybkim i tanim ocenianiu danych oraz wybieraniu odpowiedzi spośród możliwości, które mu wskażemy.

Pokażę trzy narzędzia, które zbudowałem z jego użyciem, i wyjaśnię najważniejsze rzeczy, jakie trzeba wiedzieć przed rozpoczęciem pracy.

Na początek poprosiłem Claude’a o stworzenie aplikacji korzystającej z Jev. Teraz przegląda ona 500 moich e-maili. Licznik szybko rośnie, a każda wiadomość dostaje kategorię. Aplikacja ocenia też, na które listy powinienem odpowiedzieć. Wygląda na to, że mam dziś sporo zaległości — przyznaję, nie zaglądam do skrzynki tak często, jak powinienem.

Po przeanalizowaniu wszystkich 500 wiadomości narzędzie pokazuje wykres udziału poszczególnych rodzajów poczty. Za chwilę wyjaśnię, jak powstają te oceny.

Najpierw kilka słów o premierze. Diogo Almeida, związany wcześniej z pracami nad ChatGPT, powiedział, że przez ostatnie dwa lata rozwijał nowy sposób trenowania modeli, nazwany RLCD, oraz Jev. Według przedstawionych przez niego danych Jev ma działać od 20 do 200 razy szybciej i kosztować od 40 do 400 razy mniej niż modele używane do podobnych zadań. Został zaprojektowany do podejmowania decyzji.

Jev jako dyspozytor modeli AI

Tuż przed nagraniem przygotowałem agenta AI, który korzysta z Jev do wyboru modelu odpowiadającego na polecenie użytkownika. Całą aplikację zbudowałem, wydając Claude’owi jedno polecenie.

Wpisuję: „Cześć, jestem Riley”. To bardzo prosta wiadomość, więc nie ma powodu angażować mocnego, drogiego modelu. Jev od razu wybiera Nano, najmniejszy z dostępnych wariantów.

Próbuję z trudniejszą prośbą: chcę zbudować aplikację korzystającą z API i pytam, jak się za to zabrać. Tym razem Jev wskazuje Claude Sonnet 5, czyli model ze środkowego poziomu. W aplikacji przygotowałem kilka poziomów: od najmniejszych i najszybszych modeli po najmocniejsze.

Sam agent potrafi przeszukiwać internet, tworzyć pliki i pisać kod. Gdy proszę go o wygenerowanie całego kodu aplikacji, Jev również wybiera poziom pośredni. Przy tej decyzji pokazuje 95% pewności. Nie udało mi się jeszcze skłonić go do wyboru najmocniejszego modelu. Ten przykład dobrze oddaje jednak jego rolę: ma szybko i niewielkim kosztem rozstrzygnąć, które narzędzie powinno wykonać dalszą pracę.

Klasyfikacja: co właściwie robi Jev?

Znajomi zwrócili mi uwagę, że Jev szczególnie dobrze nadaje się do klasyfikacji. To po prostu przypisywanie danych do kategorii ustalonych wcześniej przez człowieka.

W przypadku poczty możemy przygotować kategorie takie jak „pytanie klienta”, „oferta współpracy” czy „spam”. Model czyta wiadomość i wybiera kategorię, do której jego zdaniem pasuje ona najlepiej.

Type-Safe to nazwa firmy, a Jev — jej modelu. Według twórców nie jest to duży model językowy. Potrafi odczytać tekst, lecz nie tworzy odpowiedzi słowo po słowie. Zwraca decyzję i informację, jak bardzo jest jej pewny. Może na przykład wskazać odpowiedź „tak” z pewnością 91% albo przypisać wiadomość do danej kategorii z pewnością 90%.

To ważna różnica w porównaniu z chatbotem, który generuje kolejne fragmenty tekstu. W przypadku Jev płacimy za przetworzenie danych wejściowych; model nie generuje tekstowej odpowiedzi.

Trzy postacie wyniku

Zanim zaczniemy korzystać z Jev, trzeba zrozumieć, jakie wyniki może zwrócić. W aplikacji pokazuję trzy możliwości: wybór, ocenę na skali oraz wynik oznaczony jako „null”.

Wybór przypomina pytanie wielokrotnego wyboru. Przygotowujemy listę odpowiedzi, a model wskazuje jedną z nich. Tak działa przypisywanie wiadomości do kategorii.

Ocena na skali pozwala określić stopień ważności. Sami ustalamy, jakie poziomy istnieją i co oznaczają.

„Null” to nazwa użyta w pokazanym interfejsie dla oceny pojedynczego warunku. Pytamy na przykład, czy e-mail wspomina o współpracy reklamowej, a model zwraca prawdopodobieństwo odpowiedzi „tak”.

Rozbudowałem aplikację do poczty tak, aby móc samodzielnie dodawać te trzy rodzaje ocen. Zacznijmy od ostatniego.

Czy wiadomość zawiera propozycję współpracy?

Tworzę pytanie: „Czy ten e-mail zawiera propozycję sponsorowania treści Rileya?”. To właśnie informacja, którą Jev dostanie wraz z treścią każdej wiadomości. Warto sformułować ją precyzyjnie: model ma szukać propozycji współpracy reklamowej, a nie dowolnej wzmianki o marce.

Uruchamiam analizę 500 e-maili. Większość otrzymuje bardzo niską ocenę, ponieważ nie dotyczy takiej współpracy. Przy niektórych pojawia się wynik powyżej 50%, wyróżniony w aplikacji na zielono. Jedną z wiadomości model ocenia na około 90%.

W ten sposób można szybko wyłowić listy, które warto przeczytać w pierwszej kolejności. Wynik mówi jednak o ocenie modelu; ostatecznie to ja sprawdzam treść wiadomości.

Kategorie wiadomości

Teraz dodaję drugi rodzaj wyniku: wybór kategorii. Pytam, do jakiego typu należy wiadomość, i podaję pięć możliwości. Wśród nich są oferta współpracy reklamowej, aktualizacja subskrypcji, niezamówiona propozycja i newsletter. Jedną z kategorii przygotowałem pod wiadomości związane z moim projektem Agent Native.

Po zapisaniu ustawień uruchamiam analizę ponownie. Przy każdej wiadomości widzę wybraną kategorię oraz poziom pewności modelu. Wszystkie 500 e-maili zostaje ocenionych w ciągu kilku sekund. Mogę teraz przeglądać pocztę według rodzaju wiadomości, zamiast czytać ją wyłącznie w kolejności nadejścia.

Które e-maile są najważniejsze?

Pozostał trzeci wynik: ocena na skali. Tworzę pytanie o to, jak ważne jest, żebym osobiście zobaczył daną wiadomość. Do modelu trafią także informacje z e-maila i kontekst potrzebny do oceny.

Ustalam poziomy od „zignoruj”, przez „niska”, „średnia” i „wysoka ważność”, po „krytyczne”. Dodaję jeszcze skrajny poziom dla spraw, na które należałoby odpowiedzieć w ciągu pół godziny.

Po zapisaniu nowej oceny aplikacja czyści wcześniejsze wyniki, więc ponownie analizuję całą skrzynkę. Tym razem model przypisuje każdemu e-mailowi miejsce na skali ważności. Całość zajmuje w pokazie około 12–13 sekund.

Żadna wiadomość nie trafia do najwyższej kategorii. Sześć otrzymuje ocenę „krytyczne”. Mogę kliknąć ten poziom i od razu zobaczyć właściwe e-maile. Mam więc trzy sposoby przeglądania tej samej skrzynki: według prawdopodobieństwa spełnienia warunku, rodzaju wiadomości i pilności.

Dlaczego nie użyć zwykłego modelu językowego?

Duże modele językowe również potrafią zwracać dane w uporządkowanej postaci, na przykład jako JSON. Zwykle jednak muszą wygenerować odpowiedź, nadać jej wymaganą strukturę, a aplikacja musi tę odpowiedź odczytać.

Jev działa inaczej. Nie układa zdań; zwraca jeden z przewidzianych typów wyniku. Z punktu widzenia aplikacji jego odpowiedź od początku ma postać decyzji, oceny albo prawdopodobieństwa. To szczególnie przydatne wtedy, gdy tę samą operację wykonujemy wielokrotnie.

Według danych przytoczonych w materiale jedna decyzja Jev zajmuje około 0,4 sekundy i kosztuje około 0,0004 dolara. Dla porównania podawany przykład użycia tradycyjnego modelu językowego trwa około 10 sekund i kosztuje około trzech centów. Przy pojedynczym zapytaniu różnica w cenie może wydawać się mała. Przy milionach ocen dziennie staje się istotna.

Porządkowanie napływających informacji

Najbardziej cieszy mnie możliwość stałego porządkowania wszystkiego, co trafia do firmy. Skoro mogę ocenić i oznaczyć każdy e-mail, podobnie mógłbym potraktować wiadomości prywatne z serwisów społecznościowych, komentarze czy propozycje współpracy. Każda sprawa dostałaby etykietę i — gdy to potrzebne — trafiłaby do odpowiedniej osoby.

Myślę też o filtrowaniu treści niskiej jakości. Być może podobne modele, jeśli będą potrafiły analizować także obraz i wideo, pomogą oddzielać wartościowe materiały od masowo produkowanych treści. W poczcie już dziś można zastosować taką ocenę do niezamówionych ofert i podejrzanych wiadomości.

Sprawdźmy to. Dodaję pytanie: „Czy ten e-mail wygląda na oszustwo lub budzi inne podejrzenia?”. Po uruchomieniu analizy aplikacja oznacza 55 z 500 wiadomości jako potencjalne oszustwa. Wyniki nie są jednakowe: przy jednej wiadomości model podaje 54%, przy innej 71%.

To około jedna dziesiąta mojej skrzynki. Nie oznacza to, że wszystkie te wiadomości są oszustwami — widzę, które z nich model uznał za podejrzane. Wyobrażam sobie, że w przyszłości podobny filtr mógłby decydować również o powiadomieniach: pokazywałby mi sprawy, które naprawdę wymagają uwagi, a resztę odkładał do późniejszego przeglądu.

Ile informacji można przekazać modelowi?

Limit danych wejściowych Jev wynosi 64 tys. tokenów. Do tego limitu wlicza się zarówno oceniany materiał, jak i wskazówki przekazane modelowi. To mniej niż w dużych modelach językowych, które mogą przyjmować około miliona tokenów lub więcej.

Zastanawiam się, czy Type-Safe przygotuje w przyszłości wariant z większym limitem. Pozwoliłoby to dołączać więcej informacji o firmie podczas klasyfikowania wiadomości. Na razie trzeba zmieścić potrzebny kontekst w dostępnej przestrzeni.

Pokazy innych zastosowań

Przyjrzałem się również temu, co budują inni. W jednej z demonstracji twórca przygotował system, który w symulacji wybiera działania podczas jazdy. Dostarcza modelowi dane o otoczeniu i zestaw możliwych ruchów, a Jev wskazuje kolejne decyzje. Na nagraniu system reaguje między innymi na czerwone światło i pieszych.

Zasada jest podobna do klasyfikowania poczty: człowiek określa możliwe odpowiedzi, a model wybiera jedną na podstawie otrzymanych danych. Taka demonstracja pokazuje sposób użycia Jev, choć nie jest sprawdzianem bezpieczeństwa systemu prowadzenia pojazdu.

Inna osoba pokazuje zastosowanie modelu do transakcji giełdowych. Jev analizuje napływające dane i wybiera spośród prostych odpowiedzi: kupić, sprzedać albo wstrzymać się z działaniem. Widać też, jak bardzo jest pewny wyboru. Szybkość i niski koszt sprawiają, że model nadaje się do częstego ponawiania takich ocen. Sam pokaz nie mówi jednak, czy decyzje inwestycyjne są trafne.

Widziałem również demonstrację obsługi przeglądarki. Model szybko wybiera kolejne działania podczas wypełniania formularza rezerwacji lotu. Przejście przez pokazaną część zajmuje około siedmiu sekund. To przykład zadania, w którym aplikacja wielokrotnie odczytuje bieżący stan strony i musi zdecydować, co zrobić dalej.

Jak zacząć korzystać z Jev?

Są dwie drogi. Można zapisać się na listę oczekujących Type-Safe pod adresem typesafe.ai. Mnie udało się otrzymać dostęp dość wcześnie.

Jev jest też dostępny przez Vercel AI Gateway. Po uzyskaniu klucza API można poprosić narzędzie do pisania kodu, takie jak Claude lub Codex, o przygotowanie aplikacji korzystającej z tego modelu. W poleceniu warto wskazać, że chodzi o Jev firmy Type-Safe, opisać działanie planowanej aplikacji i polecić narzędziu zapoznanie się z dokumentacją.

Sam w ten sposób zbudowałem pokazane narzędzia. Jestem ciekaw, jakie inne zastosowania znajdziecie dla modelu wyspecjalizowanego w szybkich decyzjach — i czy po własnych próbach uznacie, że wzbudzone nim zainteresowanie jest zasłużone.