O czym jest ten film
- Jev firmy TypeSafe AI zwraca decyzje i prawdopodobieństwa zamiast pisać odpowiedzi.
- Model może w jednym wywołaniu ocenić kilka cech tego samego zgłoszenia.
- Autor omawia szybkość, koszt i ograniczenia takiego sposobu działania.
- Pokazuje przykłady użycia w arkuszu, sterowaniu na podstawie danych z otoczenia oraz obsłudze interfejsu komputera.
- Proponuje szukać produktów, w których szybka ocena poprawiłaby działanie istniejącej usługi.
- Buduje formularz, który na bieżąco kwalifikuje potencjalnych klientów.
- Do napisania aplikacji używa agenta programistycznego, a do wywołania Jev — usługi OpenRouter.
- Wdraża projekt przez GitHub i Coolify na serwerze VPS.
- Sprawdza działanie formularza na różnych odpowiedziach i zauważa, że wynik zależy od przyjętych kryteriów.
- Materiał zawiera płatną promocję Hostinger, dostawcy serwera wykorzystanego w demonstracji.
10 najważniejszych takeaways — z kontekstem zastosowania
1.Zlecaj Jev krótkie decyzje
Na czym polega: Model wybiera spośród podanych możliwości, ocenia dane w skali lub szacuje prawdopodobieństwo. Nie służy do pisania swobodnych odpowiedzi.
Jak stosować: Wskaż konkretny moment w aplikacji, w którym trzeba szybko zakwalifikować zgłoszenie, ustalić priorytet albo wybrać następne działanie. Z góry określ możliwe wyniki.
Na co uważać: Jeśli potrzebujesz uzasadnienia, tekstu dla użytkownika lub wieloetapowej analizy, sama decyzja Jev nie wystarczy.
2.Oceniaj kilka spraw w jednym wywołaniu
Na czym polega: Jeden zestaw danych można wykorzystać do odpowiedzi na kilka pytań, na przykład o temat zgłoszenia, pilność sprawy i ryzyko zwrotu pieniędzy.
Jak stosować: Zbierz pytania dotyczące tego samego zdarzenia i wyślij je razem. Dzięki temu aplikacja otrzyma wyniki potrzebne do dalszego działania bez osobnych wywołań dla każdej oceny.
Na co uważać: Każde pytanie powinno mieć jasne kryteria. Nieprecyzyjny opis tego, co oznacza „pilne” albo „dobry kandydat”, utrudni wykorzystanie wyniku.
3.Wykorzystuj szybkość tam, gdzie użytkownik czeka
Na czym polega: W filmie padają czasy rzędu 70–500 ms na odpowiedź; w pokazanej aplikacji jedno wywołanie trwało 488 ms.
Jak stosować: Rozważ taką ocenę przy formularzach i innych czynnościach, w których użytkownik powinien od razu zobaczyć kolejny krok.
Na co uważać: Czas działania całej aplikacji obejmuje też przesłanie danych i pozostałe operacje. Zmierz go w swoim wdrożeniu, zanim oprzesz na nim obietnicę natychmiastowej reakcji.
4.Odróżniaj poprawny format od poprawnej decyzji
Na czym polega: Jev zwraca wyniki w określonej wcześniej strukturze. To pozwala uniknąć sytuacji, w której program oczekuje kategorii, a model odsyła dowolny tekst.
Jak stosować: Ustal dopuszczalne odpowiedzi i sprawdzaj, czy program właściwie obsługuje każdą z nich, także wynik niejednoznaczny.
Na co uważać: Poprawny format nie dowodzi, że ocena odpowiada rzeczywistości. Przetestuj model na przykładach z własnej dziedziny.
5.Traktuj prawdopodobieństwo jako pomoc w decyzji
Na czym polega: Zamiast kategorycznego „tak” lub „nie” model może pokazać, jak ocenia poszczególne możliwości.
Jak stosować: Ustal próg, powyżej którego aplikacja działa automatycznie, oraz zakres, w którym przekazuje sprawę człowiekowi.
Na co uważać: Liczba wyglądająca precyzyjnie nadal jest oszacowaniem. Próg dobieraj do kosztu pomyłki, a nie do atrakcyjności wyniku na ekranie.
6.Szukaj produktu w powtarzalnej decyzji
Na czym polega: Autor proponuje ulepszać usługi, które dziś opierają się na sztywnych regułach albo używają dużego modelu do prostego wyboru.
Jak stosować: Wypisz decyzje podejmowane często w znanym Ci procesie. Wybierz tę, przy której szybsza lub tańsza ocena wyraźnie poprawiłaby obsługę użytkownika.
Na co uważać: Sama podmiana modelu nie tworzy dobrego produktu. Trzeba jeszcze określić, jakie dane są potrzebne i co aplikacja zrobi z wynikiem.
7.Ustal kryteria, zanim oddasz budowę agentowi
Na czym polega: Agent programistyczny stworzył formularz kwalifikujący zgłoszenia, choć autor nie określił dokładnie, kogo aplikacja ma poszukiwać.
Jak stosować: Przed zleceniem pracy zapisz grupę docelową, pytania formularza, kategorie odpowiedzi i warunki przypisania do każdej z nich.
Na co uważać: Gdy zabraknie tych informacji, agent sam przyjmie założenia. Aplikacja może działać sprawnie, lecz oceniać zgłoszenia według niewłaściwych zasad.
8.Sprawdzaj wynik na różnych zgłoszeniach
Na czym polega: W demonstracji odpowiedzi o roli, budżecie i terminie zmieniały kwalifikację. Inna próba pozostawała w kategorii pośredniej mimo zmian w formularzu.
Jak stosować: Przygotuj przykłady osób dobrze dopasowanych, słabo dopasowanych i przypadków granicznych. Zobacz, czy wynik zmienia się zgodnie z Twoimi oczekiwaniami.
Na co uważać: Kilka ręcznych prób pokazuje kierunek, lecz nie potwierdza jakości całego systemu. Szczególną uwagę poświęć odpowiedziom sprzecznym lub celowo mylącym.
9.Chroń klucze przy wdrożeniu
Na czym polega: Projekt trafia do prywatnego repozytorium GitHub, a klucz API jest dodawany jako zmienna środowiskowa w Coolify.
Jak stosować: Przechowuj sekrety poza kodem i upewnij się, że plik ze zmiennymi środowiskowymi nie został wysłany do repozytorium. Ustaw też limit wydatków u dostawcy API.
Na co uważać: Prywatne repozytorium nie zastępuje ochrony klucza. Sekret pokazany podczas nagrania lub przypadkowo zapisany w kodzie trzeba wymienić.
10.Dobierz hosting do potrzeb projektu
Na czym polega: Autor wdraża aplikację na VPS z Coolify i pokazuje konfigurację repozytorium, zmiennych środowiskowych, pamięci trwałej oraz adresu HTTPS.
Jak stosować: Jeśli wybierasz taki sposób wdrożenia, przejdź po kolei przez konfigurację usługi i sprawdź aplikację pod jej publicznym adresem.
Na co uważać: Pokaz jest jednocześnie reklamą dostawcy serwera. Deklarowana prostota i koszt dotyczą tej demonstracji; przed zakupem oceń własne potrzeby.
Redakcyjne tłumaczenie
Czym jest Jev
Pojawił się nowy model AI: Jev firmy TypeSafe AI. W krótkim czasie wzbudził ogromne zainteresowanie, ale działa inaczej niż modele, z którymi zwykle rozmawiamy. Nie tworzy odpowiedzi słowo po słowie. Otrzymuje dane i pytania, po czym zwraca decyzje wraz z prawdopodobieństwami.
Od 2023 roku zajmuję się AI, rozmawiałem z ludźmi pracującymi w tej dziedzinie i sam budowałem oprogramowanie z pomocą modeli. Dlatego sądzę, że Jev może umożliwić tworzenie nowego rodzaju aplikacji. Chcę pokazać, jak działa, do czego ludzie już próbują go używać i jak można na nim oprzeć własny produkt.
TypeSafe nazywa Jev modelem „System One”. Można o nim myśleć jak o rozwiązaniu pomiędzy zwykłą regułą zapisaną w kodzie a dużym modelem językowym. Programista określa, jakie decyzje są możliwe, a model ocenia dostarczoną sytuację. Nie jest to narzędzie do rozmowy: nie poprosimy go o napisanie artykułu, kodu czy szczegółowego wyjaśnienia.
Wyobraźmy sobie zgłoszenie do działu obsługi klienta. Aplikacja może zapytać, do którego zespołu skierować sprawę, jak bardzo zdenerwowany jest klient i jakie jest prawdopodobieństwo, że poprosi o zwrot pieniędzy. Jev może odpowiedzieć na wszystkie te pytania w jednym wywołaniu. Nie trzeba trenować osobnego klasyfikatora do każdego z nich — podajemy dane, opisujemy, co chcemy ustalić, i określamy postać odpowiedzi.
To istotne w usługach, z których korzysta się na bieżąco. Kiedy ktoś klika przycisk na stronie, nie powinien czekać wielu sekund, aż aplikacja zdecyduje, co pokazać dalej. Według danych przytaczanych w filmie Jev odpowiada zwykle w czasie liczonym w setkach milisekund.
Decyzja zamiast napisanej odpowiedzi
Najprościej zobaczyć różnicę na przykładzie faktury. Duży model językowy, zapytany, czy dokument wygląda na próbę oszustwa, może napisać kilka zdań o pozycjach na fakturze i historii dostawcy. Jev dostanie to samo pytanie, ale odpowie w ustalonym formacie: na przykład „prawidłowa — 88 proc.”, „oszustwo — 7 proc.”, „wymaga sprawdzenia — 5 proc.”.
To my wybieramy możliwe kategorie. Model ocenia je jednocześnie i zwraca wynik bez generowania zdań. Podobnie można określić działania dostępne postaci w grze: ruch w lewo lub w prawo, skok czy strzał. Na podstawie informacji o otoczeniu model wskazuje, co zrobić. Taką decyzję da się ponawiać dostatecznie szybko, by wpływała na przebieg gry.
Jev może wybierać działanie, klasyfikować, oceniać według skali, ustalać kolejność i kierować sprawę na właściwą ścieżkę. Nie zastąpi jednak modelu, który pisze, programuje albo rozumuje krok po kroku. Te narzędzia służą do innych zadań.
Duże modele językowe tworzą kolejne fragmenty odpowiedzi po kolei. Jev zwraca wyniki dla zadanych pytań równolegle. TypeSafe opracowało też metodę treningu nazwaną RLCD, której celem są decyzje z odpowiednio dobranymi oszacowaniami prawdopodobieństwa. Jeśli model nie ma mocnych podstaw do wyboru, powinno to być widoczne w wyniku.
Firma podaje czas odpowiedzi od 70 do 500 ms. W typowych przykładach pokazywanych przez autora jest to około 100–150 ms, choć przy większej liczbie żądań czas może wzrosnąć. Cena przytoczona w materiale wynosi 0,042 dolara za milion tokenów wejściowych; za wynik modelu nie jest naliczana opłata. Przy milionie zapytań zawierających średnio po tysiąc tokenów wejściowych dawałoby to 42 dolary za wywołania modelu.
(Informacja dodatkowa: TypeSafe opisuje „brak halucynacji” jako brak odpowiedzi spoza określonego formatu. Nie oznacza to, że każda klasyfikacja lub prognoza jest trafna.)
Gdzie taka szybkość może się przydać
Pierwszy przykład to arkusz pokazany przez Nadera z Cognition AI. Po wpisaniu kryterium, takiego jak pilność kontaktu, Jev ocenia wiersze i przypisuje im odpowiednie kategorie — od spraw niewymagających dalszego działania po te, którymi trzeba zająć się szybko. Autor pokazuje ocenę setek pozycji. Przy takim zadaniu liczy się zarówno czas, jak i koszt pojedynczego wywołania.
Drugi przykład dotyczy sterowania pojazdem w demonstracji. Model otrzymuje dane o prędkości, odległości od innych samochodów i przeszkodach, a następnie wybiera działanie: przyspieszenie, zwolnienie, zatrzymanie lub skręt. Na nagraniu reaguje także na czerwone światło i omija przeszkodę. Autor podkreśla, że decyzje podejmowane co kilka sekund byłyby w takim zastosowaniu zbyt wolne.
Kolejny pokaz przedstawia obsługę interfejsu komputera podczas wyszukiwania lotu. Jev wybiera następne działania, a cała demonstracja — od otwarcia Google Flights do wskazania konkretnego połączenia — zajmuje około siedmiu sekund. Według autora koszt wywołań modelu wyniósł około 0,004 dolara.
Pokazane są również wykresy dotyczące błędów w strukturze odpowiedzi i wyborze narzędzia. Ich sens jest praktyczny: aplikacja potrzebuje wyniku, który zawsze da się odczytać w przewidziany sposób. Jev zwraca odpowiedzi w określonym wcześniej formacie, zamiast czasem przysyłać tekst tam, gdzie program oczekuje pól z danymi. Autor wiąże tę cechę z możliwością budowania usług, które często i tanio podejmują drobne decyzje.
Pomysł na aplikację
Gdybym miał dziś budować produkt oparty na Jev, zacząłbym od znalezienia odpowiedniego zadania. Nie musi to być pomysł, jakiego nikt wcześniej nie miał. Warto przyjrzeć się istniejącemu oprogramowaniu: gdzie działa ono wyłącznie według sztywnych reguł, a gdzie korzysta z dużego modelu do decyzji, która nie wymaga długiej odpowiedzi?
Jako przykład zbuduję odpowiednik formularza Typeform. Użytkownik odpowie na kilka pytań, a aplikacja na bieżąco oceni, czy warto zaprosić go do dalszej rozmowy. Sam spotykam się z taką potrzebą przy listach oczekujących i rekrutacji. Jeśli dopiero po 10 czy 20 sekundach dowiadujemy się, czy pokazać kandydatowi możliwość umówienia spotkania przez Calendly, doświadczenie jest niezgrabne. Odpowiedź w ułamku sekundy zmienia sytuację.
Inny przykład, który przywołuję, stworzył Rafał. Jego zestaw testów pozwala modelowi przechodzić po aplikacji i próbować znaleźć błędy po każdym wydaniu nowej wersji. Podobne testy z użyciem wolniejszego modelu mogłyby wydłużać wdrożenie o kilka minut i kosztować znacznie więcej. Jeżeli publikujemy zmiany wiele razy dziennie, czas i cena każdego uruchomienia szybko nabierają znaczenia.
Serwer i budowa prototypu
Do uruchomienia własnej aplikacji wybieram serwer VPS, na którym można umieścić zarówno część widoczną dla użytkownika, jak i zaplecze. W demonstracji korzystam z Hostinger. Wybieram plan KVM 2, lokalizację serwera blisko użytkowników i gotowy obraz Ubuntu 24.04 z Coolify. Ten panel ułatwia późniejsze wdrażanie i zarządzanie aplikacją. Pokazuję też wybór 24-miesięcznego okresu rozliczenia oraz kod rabatowy „David”.
Hostinger sponsoruje ten materiał. Korzystam z jego serwerów również do innych projektów i automatyzacji, ale tutaj skupimy się na jednej aplikacji.
Gdy serwer się przygotowuje, otwieram pusty folder i zlecam agentowi programistycznemu zbudowanie projektu. Proszę o aplikację opartą na Jev, przypominającą Typeform. Po lewej stronie ma być formularz z kilkoma pytaniami, a po prawej widok pokazujący, jak model kwalifikuje osobę odpowiadającą. Ustalam cztery możliwe kategorie: bardzo dobrze dopasowana, dopasowana, przeciętna i niedopasowana. Dodaję, że aplikację wdrożymy później przez Coolify na VPS.
Agent początkowo prosi o klucz API TypeSafe. Bezpośredni dostęp do usługi jest jednak objęty listą oczekujących, więc polecam mu użyć OpenRouter. To pośrednik, przez którego można wywołać Jev; autor wymienia też Vercel AI Gateway jako inną możliwość. W demonstracji korzystam z klucza OpenRouter, który mam już na komputerze, i umieszczam go w lokalnym pliku ze zmiennymi środowiskowymi.
Po pewnym czasie agent kończy pierwszą wersję. Nadał aplikacji nazwę „Signal”. Interfejs zawiera sporo drobnych opisów, więc proszę o jego uproszczenie. Ważniejszy jest jednak formularz i ocena odpowiedzi.
Dopiero podczas sprawdzania widzę, że agent przyjął własne założenie: formularz dotyczy klienta usługi automatyzacji procesów biznesowych. Nie podałem mu wcześniej dokładnego celu. Wybieram więc odpowiedzi odpowiadające potencjalnemu klientowi i obserwuję, jak zmienia się kwalifikacja. Gdy wskazuję rolę założyciela lub członka kierownictwa, wynik nieco się poprawia. Po podaniu budżetu powyżej 20 tys. dolarów zgłoszenie trafia do kategorii „dopasowane”. Deklaracja chęci szybkiego rozpoczęcia współpracy przesuwa je do „bardzo dobrze dopasowanych”.
W tym przebiegu odpowiedź trwa 488 ms, licząc całą drogę żądania i odpowiedzi. To więcej niż często przywoływane 100–150 ms, ale nadal dość szybko, by wynik pojawiał się podczas wypełniania formularza. Demonstracja pokazuje też, dlaczego trzeba dokładnie opisać zadanie agentowi: aplikacja działa, lecz kryteria oceny powstały bez mojego szczegółowego udziału.
Wdrożenie przez GitHub i Coolify
Teraz proszę agenta, by pomógł mi opublikować aplikację na przygotowanym serwerze. Coolify działa na Ubuntu, a agent może przeprowadzić mnie przez kolejne ustawienia. Najpierw tworzę konto administratora panelu. Gdy nie wiem, co kliknąć, przekazuję agentowi zrzut ekranu i pytam o następny krok.
Zakładam pierwszy projekt w Coolify. Następnie proszę agenta o utworzenie prywatnego repozytorium GitHub o nazwie „Jev demo” i wysłanie tam kodu. Przypominam mu, by pominął plik ze zmiennymi środowiskowymi. Po sprawdzeniu repozytorium widzę, że klucz nie został do niego dodany.
Łączę Coolify z GitHubem, wybieram repozytorium i ustawiam budowanie aplikacji na podstawie przygotowanego pliku Dockerfile. Potem dodaję zmienne środowiskowe, w tym klucz OpenRouter i hasło do aplikacji, oraz konfiguruję pamięć trwałą pod ścieżką /app/data. Ustawiam też adres aplikacji i HTTPS. Po zapisaniu konfiguracji uruchamiam wdrożenie.
Pierwsza próba zalogowania kończy się niepowodzeniem: aplikacja odrzuca hasło. Proszę agenta o wygenerowanie nowego, aktualizuję odpowiednie zmienne i ponownie wdrażam projekt. Tym razem logowanie działa. Na publicznym adresie widzę uproszczoną wersję formularza, o którą wcześniej prosiłem.
Co pokazał gotowy formularz
W opublikowanej aplikacji wykonuję kolejną próbę. Tym razem celowo podaję odpowiedzi, które nie powinny wskazywać na gotowość do współpracy. Zmieniam deklarowany budżet i termin, lecz kwalifikacja pozostaje w kategorii pośredniej. W poprzednim teście wynik przesuwał się stopniowo od przeciętnego przez dopasowany do bardzo dobrze dopasowanego.
To dobry punkt wyjścia, ale wymaga dalszej pracy nad kryteriami. Nie skonfigurowałem dokładnie pytań kierowanych do Jev ani zasad kwalifikacji — wiele decyzji pozostawiłem agentowi. Żeby używać takiego formularza w rzeczywistym procesie, trzeba określić, kogo szukamy, sprawdzić przykładowe zgłoszenia i poprawić ocenę tam, gdzie nie zgadza się z naszym zamiarem.
Pokaz miał przedstawić trzy kroki: znaleźć decyzję, którą warto podejmować szybko; zbudować wokół niej aplikację; a potem ją wdrożyć. Jev nadaje się szczególnie do miejsc, w których liczy się krótki czas odpowiedzi i przewidywalna postać wyniku. Można dzięki temu pomyśleć na nowo o formularzach, testach, obsłudze zgłoszeń i wielu innych usługach. To, czy powstanie z tego dobry produkt, zależy już od wybranego problemu i jakości przyjętych zasad.
Na koniec zapraszam do nowego serwera Discord „Humans” i ponownie wskazuję ofertę Hostinger wykorzystaną w demonstracji. Jestem ciekaw, jakie zastosowania dla takich modeli pojawią się w ciągu najbliższego roku lub dwóch.