O czym jest ten film
- Jev nie prowadzi rozmowy ani nie pisze tekstów. Na podstawie opisu sytuacji wybiera odpowiedzi spośród podanych możliwości.
- Autor przedstawia Jev jako pierwszy model z nowej klasy, którą jego twórcy nazywają „System 1”.
- W pokazanym przykładzie obsługi klienta model wskazuje właściwy dział, ocenia ton zgłoszenia i podaje poziom pewności swoich odpowiedzi.
- Według przytoczonych przez autora danych Jev podejmuje decyzje znacznie szybciej i taniej niż duże modele językowe, choć część z nich może osiągać lepsze wyniki, gdy ma więcej czasu.
- Autor wykorzystuje Jev do sterowania postacią podczas testowania tworzonej przez siebie gry.
- W projekcie Arkon model klasyfikuje zmiany w kodzie i pomaga dobrać zakres przeglądu pull requestu.
- Jev może kierować zapytania do różnych modeli językowych zależnie od rodzaju zadania.
- Film pokazuje także przykłady wykorzystania modelu do obsługi przeglądarki oraz grania w Dooma i Ponga.
- Materiał zawiera sponsorowaną prezentację Firecrawl, narzędzia dostarczającego agentom AI informacje ze stron internetowych.
- Autor odnosi się do zarzutu, że Jev jest jedynie kolejnym klasyfikatorem: jego zdaniem istotna różnica polega na tym, że jeden model można zastosować do wielu rodzajów decyzji.
10 najważniejszych takeaways — z kontekstem zastosowania
1.Zlecaj Jevowi wybór, a nie pisanie
Na czym polega: Model otrzymuje opis sytuacji oraz pytania z gotowymi wariantami odpowiedzi. Zwraca wybrane warianty i poziom pewności.
Jak stosować: Szukaj w swoich procesach etapów, w których trzeba przypisać kategorię, wybrać dalszą ścieżkę albo wskazać następną czynność.
Na co uważać: Jev nie zastąpi modelu językowego tam, gdzie potrzebujesz swobodnie sformułowanej odpowiedzi, kodu lub dłuższego rozumowania.
2.Jasno określ możliwe odpowiedzi
Na czym polega: Decyzja modelu zależy od przedstawionej sytuacji i dostępnych opcji.
Jak stosować: Przy kierowaniu zgłoszeń podaj działy, do których mogą trafić. Przy sterowaniu agentem wymień czynności, które rzeczywiście może wykonać.
Na co uważać: Źle dobrany zestaw odpowiedzi ogranicza użyteczność wyniku: model wybiera spośród możliwości, które mu przedstawisz.
3.Wykorzystuj szybkość przy częstych decyzjach
Na czym polega: Autor przytacza porównania, według których Jev podejmuje decyzje 20–200 razy szybciej i działa 40–1000 razy taniej niż porównywane duże modele językowe.
Jak stosować: Rozważ go w procesach, które wymagają wielu krótkich decyzji, także wykonywanych równolegle — na przykład przy kierowaniu zapytań lub sterowaniu prostymi czynnościami.
Na co uważać: To liczby przedstawione w materiale, a nie gwarancja takich samych wyników w każdym zastosowaniu. Część modeli językowych może podejmować trafniejsze decyzje, jeśli dostanie więcej czasu.
4.Łącz Jev z modelami językowymi
Na czym polega: Jev może wybrać dalszy krok, a model językowy wykonać pracę wymagającą tworzenia treści lub kodu.
Jak stosować: Umieść Jev w punktach decyzyjnych automatyzacji, a pozostałe zadania powierz modelom dobranym do ich charakteru.
Na co uważać: Sam wybór ścieżki nie oznacza wykonania całego zadania. Pozostałe etapy procesu nadal potrzebują odpowiednich narzędzi.
5.Dobieraj zakres przeglądu zmian w kodzie
Na czym polega: W pokazanym procesie Arkon Jev najpierw klasyfikuje pull request i wskazuje rodzaj potrzebnego przeglądu.
Jak stosować: Możesz użyć takiej decyzji do skierowania prostych zmian na lżejszą ścieżkę, a tych wymagających dokładniejszej analizy — na bardziej rozbudowaną.
Na co uważać: Oszczędność zależy od tego, czy wstępna klasyfikacja właściwie rozpoznaje potrzebny zakres przeglądu.
6.Kieruj zapytania do odpowiedniego modelu
Na czym polega: Autor pokazuje wybór między modelem mocnym, programistycznym, otwartym i szybkim.
Jak stosować: Przekazuj proste zadania tańszemu modelowi, pytania programistyczne modelowi do kodu, a trudniejsze problemy modelowi o większych możliwościach.
Na co uważać: Pokazane wyniki dotyczą niewielkiego fragmentu testów autora. Przed użyciem takiego podziału sprawdź go na własnych zapytaniach.
7.Używaj poziomu pewności jako dodatkowej informacji
Na czym polega: Obok każdej odpowiedzi Jev podaje ocenę pewności. W przykładzie zgłoszenia klienta wskazanie działu rozliczeń miało 64% pewności.
Jak stosować: Odczytuj wynik razem z tą oceną, zwłaszcza gdy od decyzji zależy dalszy przebieg procesu.
Na co uważać: Wysoka pewność nie jest dowodem, że odpowiedź jest poprawna. Autor pokazuje również subiektywne pytanie o architekturę, przy którym model konsekwentnie wybierał jedną odpowiedź.
8.Testuj interfejsy przez wybór kolejnych czynności
Na czym polega: W przykładzie automatyzacji przeglądarki model otrzymuje aktualny układ strony i wybiera następne działanie, takie jak kliknięcie lub wpisanie tekstu.
Jak stosować: Rozważ taki sposób sterowania tam, gdzie agent wielokrotnie wykonuje proste działania w interfejsie.
Na co uważać: Autor wskazuje projekt pokazujący tę możliwość, ale nie przedstawia w filmie pełnego porównania jego skuteczności z używanymi przez siebie narzędziami.
9.Oddzielaj pokaz możliwości od gotowego procesu
Na czym polega: Granie w Dooma, Ponga i grę autora pokazuje, że szybki model decyzyjny potrafi wybierać działania na bieżąco.
Jak stosować: Potraktuj te przykłady jako pomysł na testowanie aplikacji lub symulacji, w których kolejne kroki da się jasno opisać.
Na co uważać: Autor zaznacza, że pokazane gry są stosunkowo proste. Sam taki pokaz nie dowodzi, że model poradzi sobie z dowolnie złożonym środowiskiem.
10.Oceniaj Jev przez różnorodność zadań
Na czym polega: Klasyfikatory istnieją od dawna, lecz zwykle buduje się je do jednego, ściśle określonego zadania. Autor uważa, że atutem Jev jest możliwość zadawania mu różnych pytań decyzyjnych bez przygotowywania osobnego modelu dla każdego z nich.
Jak stosować: Wypróbuj model na kilku różnych etapach własnego procesu: klasyfikacji, kierowaniu zadań i wyborze następnej czynności.
Na co uważać: Uniwersalność nie zwalnia ze sprawdzania trafności odpowiedzi w konkretnym zastosowaniu.
Redakcyjne tłumaczenie
Model stworzony do podejmowania decyzji
W ostatnich dniach pojawił się nowy model AI o nazwie Jev. Nie jest kolejnym dużym modelem językowym. Jego twórcy przedstawiają go jako pierwszy model z nowej klasy, którą nazywają „System 1”: modeli wyspecjalizowanych w podejmowaniu decyzji. Brzmi to może mniej widowiskowo niż kolejny model piszący teksty czy tworzący obrazy, ale właśnie taki system może się przydać w wielu codziennych zastosowaniach AI. Jev ma działać szybko i tanio.
Od pewnego czasu trudno mi się ekscytować premierami kolejnych modeli językowych. Każdej towarzyszy fala pokazów: nowy sposób organizowania notatek, jeszcze ładniejsza strona internetowa, efektowna scena w Blenderze. Później wszyscy próbują włączyć model do swoich procesów. Chciałem zobaczyć coś innego i dlatego Jev zwrócił moją uwagę.
Nie nagrywałem o nim od razu po premierze. Najpierw chciałem sam coś zbudować i sprawdzić, jak sprawuje się w praktyce. Opowiem więc, jak działa, jakie ma ograniczenia i co można dzięki niemu zrobić. Pokażę też własne próby oraz odniosę się do najczęstszego zarzutu: że jest to po prostu nowa wersja znanego od dawna modelu klasyfikacyjnego. Jest w tej krytyce trochę racji.
Jak wygląda praca z Jev
Najważniejsza rzecz: Jev nie jest dużym modelem językowym. Nie porozmawiasz z nim tak jak z ChatGPT, Claude’em czy Gemini, ponieważ nie tworzy swobodnych wypowiedzi. Dostaje informacje o sytuacji i ma podjąć decyzję.
Twórcy zastosowali przy jego trenowaniu metodę nazwaną RLCD, od angielskiego reinforcement learning for calibrated decisions — uczenie ze wzmocnieniem ukierunkowane na właściwie oceniane decyzje. Odróżniają ją od RLHF, czyli uczenia ze wzmocnieniem na podstawie ocen ludzi, kojarzonego z trenowaniem generatywnej AI. Obietnica stojąca za Jev jest taka, że model przeznaczony do podejmowania decyzji będzie w tym zadaniu bardziej niezawodny i ograniczy problemy, które znamy z używania modeli generatywnych, w tym halucynacje.
Twórcy ujmują swoją tezę następująco: może brzmieć zbyt dobrze, by była prawdziwa, ale skupienie modelu na właściwym zadaniu daje mu dużą przewagę. Podpisują ją życzeniem, by AI, z której korzystamy, była niezawodna. To bliskie temu, do czego sam dążę przy budowaniu Arkona i procesów programistycznych wspomaganych przez AI: chcę, by ich działanie było możliwie przewidywalne. Jev wydaje mi się kolejnym narzędziem, które może w tym pomóc.
Najłatwiej zrozumieć go na przykładzie. Wejście składa się z dwóch części. Najpierw opisujemy sytuację, a potem zadajemy pytania i podajemy możliwe odpowiedzi. Model nie pisze własnej, dowolnej odpowiedzi; wybiera spośród przygotowanych możliwości.
Wyobraźmy sobie agenta obsługi klienta. Klient nie może połączyć swojego konta Stripe, traci przez to sprzedaż i pilnie potrzebuje pomocy. Jev może równocześnie odpowiedzieć na kilka pytań: do którego działu skierować zgłoszenie i jak ocenić nastawienie klienta. Wynik zawiera wybraną odpowiedź oraz poziom pewności. W pokazanym przykładzie model z pewnością 64% wskazał dział rozliczeń. Ocenił też, że klient jest zirytowany, ale zachowuje uprzejmy ton.
Ktoś może powiedzieć: duży model językowy również potrafi zwrócić odpowiedź w ustrukturyzowanej postaci, na przykład jako JSON. To prawda. Według twórców Jev ma jednak przy podejmowaniu decyzji trzy ważne zalety: działa szybciej, kosztuje mniej i jest bardziej niezawodny. Podają też zerowy odsetek błędów formatu odpowiedzi. Oznaczałoby to, że źle sformowany JSON nie zatrzyma kolejnego kroku automatyzacji.
Przedstawiony wykres kosztów używa skali logarytmicznej. Wynika z niego, że Jev może być dziesiątki, a nawet setki razy tańszy od czołowych dużych modeli językowych. Nie twierdzę przy tym, że zawsze podejmuje najlepszą decyzję. Są modele, które po otrzymaniu większej ilości czasu radzą sobie lepiej. Jev wyróżnia się połączeniem kosztu i szybkości. W przytoczonym porównaniu podejmuje decyzje od 20 do 200 razy szybciej i jest od 40 do 1000 razy tańszy. To pozwala myśleć o systemach, które podejmują setki albo tysiące krótkich decyzji równolegle.
Testowanie gry podczas jej tworzenia
Jednym z najciekawszych zastosowań, które sam sprawdzam, jest sterowanie grą. W moim procesie tworzenia oprogramowania duży model językowy pisze kod, a Jev testuje powstającą grę, wybierając kolejne działania. Na ekranie widać jego decyzje i poziom pewności. Postać atakuje, zbliża się do przeciwników i robi uniki, choć ja nie dotykam klawiatury.
Próbowałem wcześniej uzyskać podobny efekt za pomocą dużych modeli językowych. Były zbyt wolne, a koszt takiego testowania byłby za wysoki. Pokazywana gra jest moim własnym projektem uruchomionym lokalnie. Jev jej nie tworzy — pomaga mi sprawdzać, jak działa, kierując postacią.
Nie oznacza to zastąpienia wszystkich modeli językowych przez Jev. Warto włączyć go tam, gdzie proces wymaga wyboru lub klasyfikacji. Do innych zadań nadal będą potrzebne modele językowe. W praktyce te narzędzia mogą dobrze ze sobą współpracować.
Materiał sponsorowany: Firecrawl
Sponsorem tego filmu jest Firecrawl. Każdy agent AI, którego buduję, prędzej czy później potrzebuje informacji z internetu. Niektóre narzędzia, takie jak Claude Code, mają już funkcje wyszukiwania. Gdy jednak tworzę własnego agenta przy użyciu Pydantic AI, LangGraph lub Pie, muszę sam zapewnić mu taki dostęp. Nawet wbudowane wyszukiwanie Claude Code potrafi zużywać dużo tokenów i działać mało oszczędnie.
Firecrawl oferuje narzędzie do dostarczania agentom informacji ze stron internetowych oraz serwer MCP, przez który można podłączyć je do asystenta programistycznego. W pokazanym przykładzie kopiuję jedno polecenie do terminala, dodaję serwer, a następnie w Claude Code uruchamiam /mcp i przechodzę przez autoryzację.
Pytam potem, na jakie problemy trafiają osoby przechodzące na Pydantic AI w wersji 2. To dość szczegółowe pytanie, które wymaga przejrzenia wielu informacji. W pokazanym przypadku agent uzyskuje odpowiedni materiał po trzech wywołaniach serwera Firecrawl. Narzędzie może też zwrócić pełną stronę w uporządkowanym formacie Markdown. Oprócz serwera MCP dostępny jest pakiet programistyczny do włączenia Firecrawl bezpośrednio do własnego agenta. Według oferty przedstawionej w filmie można zacząć bezpłatnie, z limitem tysiąca kredytów miesięcznie, a użycie serwera MCP nie wymaga klucza API.
Jev w procesie przeglądu kodu
Wracając do własnych testów: łączę Jev z modelami językowymi w większych procesach programistycznych tworzonych w moim otwartoźródłowym narzędziu Arkon. Przykładem jest wstępna ocena pull requestu, czyli proponowanego zestawu zmian w kodzie.
Na początku procesu trzeba ustalić, z jakim rodzajem zmiany mamy do czynienia i jaki przegląd będzie potrzebny. Do tych dwóch kroków — klasyfikacji i skierowania zadania na właściwą ścieżkę — używam Jev. Dopiero potem wykonywany jest odpowiedni przegląd. Dzięki temu nie muszę uruchamiać szczegółowej analizy AI dla każdego pull requestu. Oszczędność wynika więc zarówno z kosztu samego Jev, jak i z możliwości dobrania zakresu dalszej pracy.
W interfejsie Arkona wygląda to jak jeden proces. Pod spodem wywołuję skrypt w Pythonie, który przesyła do Jev zadanie klasyfikacyjne. Korzystam z modelu przez OpenRouter, gdzie jest dostępny obok innych modeli językowych. Można też skorzystać bezpośrednio z usługi typesafe.ai, firmy, która stworzyła Jev. Typesafe nie sponsoruje tego filmu. Pokazuję model, ponieważ zainteresowały mnie wyniki własnych prób.
Wybór modelu odpowiedniego do zadania
Innym zastosowaniem jest kierowanie zapytań do różnych modeli językowych. Jeśli w jednym systemie mamy kilka modeli, część zadań może trafić do szybkiego i taniego, a trudniejsze — do modelu o większych możliwościach. Zadania związane z kodem można skierować do modelu programistycznego. Dotąd decyzję o wyborze często podejmował jeszcze jeden model językowy. W tym miejscu można użyć Jev.
Opis sytuacji stanowi zapytanie użytkownika. Pytanie do Jev brzmi: do którego z dostępnych modeli należy je skierować? W mojej demonstracji możliwe odpowiedzi to model mocny, programistyczny, otwarty albo szybki.
Przy trudniejszym pytaniu Jev wybiera mocny model ze wskazaniem 100% pewności. Przy prośbie o przerobienie skryptu Bash na PowerShell wskazuje model programistyczny z pewnością 98%. Przeliczenie 72 stopni Fahrenheita na Celsjusze kieruje do modelu szybkiego, bo nie ma powodu angażować do takiego zadania droższego narzędzia. W pokazywanym zestawie przykładem szybkiego modelu jest GPT-5.6 Luna, a mocniejszego — Claude Sonnet 5.
Nie chcę wyciągać z tej małej próbki zbyt daleko idących wniosków. Ciekawy jest jednak koszt i czas działania: za kilkadziesiąt pokazanych decyzji zapłaciłem łącznie około 0,4 centa, a pojedynczy wybór trwał średnio 0,2 sekundy.
Gry i przeglądarka: kolejne przykłady
Inni również sprawdzają Jev w grach. W jednym z opublikowanych pokazów model gra w Dooma: na ekranie widać rozgrywkę oraz podejmowane na bieżąco decyzje. Przypomina to moje próby z własną grą. Doom jest tu stosunkowo prostym środowiskiem, ale możliwość tak szybkiego wybierania kolejnych działań i tak robi wrażenie.
Kolejnym pomysłem jest automatyzacja przeglądarki. Używam narzędzi do obsługi stron niemal codziennie przy tworzeniu aplikacji. Najwolniejszą częścią procesu bywa sprawdzanie wyglądu strony i poruszanie się po niej. Zwykle kolejne działania wybiera duży model językowy. Można jednak przekazać Jev aktualny układ strony i poprosić go o wybór następnej czynności spośród dostępnych możliwości: kliknięcia przycisku, wpisania tekstu i tak dalej. Widziałem już otwartoźródłowy projekt wykorzystujący takie podejście i spodziewam się kolejnych.
Trafiłem też na porównanie modeli grających w Ponga. Szybkość gry dostosowano tam do tempa podejmowania decyzji. Jev radzi sobie z rozgrywką w tempie zbliżonym do ludzkiego. W przypadku pokazanych obok modeli językowych — 3.8 Flash i Claude Haiku 4.5 — grę trzeba znacznie spowolnić, żeby zdążyły zdecydować, gdzie przesunąć paletkę.
Jest również otwartoźródłowy zbiór projektów i pomysłów na zastosowanie Jev. Obejmuje klasyfikację i kierowanie zadań, decyzje agentów AI, weryfikację wyników, zabezpieczenia, gry, symulacje, a także przykłady związane z finansami i handlem. Sama klasyfikacja może brzmieć niezbyt ciekawie. Dopiero przegląd takich zastosowań pokazuje, jak wiele procesów składa się z następujących po sobie wyborów.
Czy to tylko kolejny klasyfikator?
To prowadzi do najczęstszej krytyki Jev. Modele klasyfikacyjne znamy w AI od dziesięcioleci. Czy nie nadajemy więc nowej nazwy staremu pomysłowi? Do pewnego stopnia tak, zwłaszcza gdy używamy Jev do bardzo prostych zadań. Moim zdaniem ważna jest jednak jego wszechstronność.
Dla zabawy zapytałem model, w którym z kilku podanych państw są najciekawsze budynki. Wskazał Niemcy z pewnością 63%. To oczywiście kwestia gustu i nie wiadomo, na jakiej podstawie dokonał wyboru. Kiedy ponawiałem pytanie, poziom pewności nieco się zmieniał, ale odpowiedź pozostawała taka sama. Nie jest to dowód trafności modelu; pokazuje tylko, że potrafi odpowiedzieć także na pytanie tego rodzaju.
Budowałem wcześniej klasyfikatory przy użyciu TensorFlow i PyTorch. Taki model można wytrenować na określonym zbiorze danych, aby rozpoznawał zwierzę na zdjęciu albo oceniał, kto wygrywa na danej pozycji szachowej. Zwykle jednak jest przygotowany do jednego zadania. Gdy damy mu inne, nie będzie umiał go wykonać.
Jev pozwala zadawać różne pytania o różne sytuacje: zgłoszenie klienta, potrzebny zakres przeglądu kodu, wybór modelu językowego czy następny ruch w grze. W tym właśnie widzę jego największą wartość. Jeśli chcesz sam go sprawdzić, w materiale wskazuję OpenRouter oraz listę oczekujących na bezpośredni dostęp. Zamierzam też dalej testować Jev w Arkonie i w procesach programistycznych wspomaganych przez AI.