O czym jest ten film
- Jev odpowiada na pytania, wybierając spośród możliwości wskazanych przez użytkownika.
- Autor porównuje go do klasyfikatora, choć dokładna budowa narzędzia nie została ujawniona.
- Można zadawać pytania typu „tak lub nie”, wybierać spośród kilku odpowiedzi albo oceniać według skali.
- Wynik zawiera informację o poziomie pewności przypisanym odpowiedzi.
- Narzędzie może pomagać w kontroli odpowiedzi modeli językowych i kierowaniu spraw do dalszej obsługi.
- Przykład rezerwacji hotelowej pokazuje, jak sprawdzić konkretny warunek ukryty w dłuższym opisie.
- Dziesięć zastosowań obejmuje między innymi weryfikację twierdzeń, obsługę klienta, analizę umów i porządkowanie alertów.
- Jev może także kierować zadania do odpowiednich modeli, agentów lub narzędzi.
- W sprawach wymagających oceny specjalisty wynik klasyfikacji ma wskazywać, czemu przyjrzeć się w pierwszej kolejności.
- Podane w nagraniu wyliczenia kosztów zawierają błąd rachunkowy.
10 najważniejszych takeaways — z kontekstem zastosowania
1.Sprawdzaj, czy źródło uzasadnia twierdzenie
Na czym polega: Jev może przypisać analizowany materiał do jednej z dwóch kategorii: „dowody potwierdzają twierdzenie” albo „twierdzenie wymaga zmiany”.
Jak stosować: Podaj treść badania lub zestaw źródeł oraz dokładne zdanie, które chcesz opublikować. W przypadku tezy, że kawa wydłuża życie, sprawdzaj właśnie tę tezę, a nie ogólnie to, czy artykuł dotyczy kawy i zdrowia.
Na co uważać: Wynik pomaga wybrać materiały do dalszej kontroli. Sam wysoki poziom pewności nie zastępuje przeczytania badania.
2.Kieruj zgłoszenia klientów do właściwego działu
Na czym polega: Na podstawie rozmowy z klientem narzędzie wybiera dział z ustalonej wcześniej listy.
Jak stosować: Zdefiniuj kategorie odpowiadające rzeczywistym zespołom, a następnie przekazuj transkrypty rozmów do klasyfikacji. Dzięki temu zgłoszenie może szybciej trafić do osoby, która się nim zajmie.
Na co uważać: Lista działów musi obejmować typowe sprawy. Warto przewidzieć osobną ścieżkę dla zgłoszeń, których nie da się jednoznacznie przypisać.
3.Wyznaczaj umowy wymagające kontroli
Na czym polega: Zamiast prosić model językowy o swobodną ocenę każdej umowy, można wskazać etapy, takie jak „wymaga przeglądu”, „gotowa do końcowej kontroli” i „gotowa do wysłania”.
Jak stosować: Przekazuj dokument wraz z jasnym pytaniem o jego status. Sprawy, przy których narzędzie wykazuje mniejszą pewność, kieruj do człowieka.
Na co uważać: Klasyfikacja porządkuje pracę, ale nie jest opinią prawną ani zatwierdzeniem umowy.
4.Wyławiaj ustalenia z długich wątków e-mailowych
Na czym polega: Jev może odpowiedzieć na jedno konkretne pytanie dotyczące obszernej korespondencji, wybierając spośród podanych możliwości.
Jak stosować: Gdy szukasz aktualnego terminu premiery produktu, przekaż cały wątek i zapytaj, czy ustalono czwartek, piątek czy sobotę.
Na co uważać: Jeśli w korespondencji pojawiały się kolejne zmiany, sformułuj pytanie tak, by było jasne, czy chodzi o pierwszy termin, ostatnie ustalenie czy moment zmiany.
5.Dobieraj model językowy do zadania
Na czym polega: Jev może pełnić funkcję narzędzia kierującego zapytanie do jednej z wcześniej wybranych rodzin modeli.
Jak stosować: Określ, jakie zadania mają trafiać do modeli programistycznych, ogólnych lub lokalnie uruchamianych. Następnie klasyfikuj przychodzące zapytania według tego podziału.
Na co uważać: Trafność takiego kierowania zależy od sensownie opisanych kategorii. Sprawdzaj, czy wybrany model rzeczywiście dobrze radzi sobie z zadaniami, które do niego trafiają.
6.Kontroluj wybrane odpowiedzi modeli językowych
Na czym polega: Po wykonaniu zadania przez model językowy Jev może ocenić, czy wynik spełnia wskazane kryterium, bez uruchamiania kolejnego modelu do napisania długiej recenzji.
Jak stosować: Zadaj wąskie pytanie, na przykład czy odpowiedź mieści się w dopuszczalnej kategorii albo czy dokument osiągnął wymagany etap pracy.
Na co uważać: Taka kontrola wychwyci tylko to, o co zapytasz. Nie oznacza pełnej oceny poprawności całej odpowiedzi.
7.Przydzielaj zadania odpowiednim agentom
Na czym polega: W systemie złożonym z kilku agentów klasyfikacja może wskazać, który z nich powinien otrzymać nowe zadanie.
Jak stosować: Opisz zakres pracy poszczególnych agentów i podaj ich nazwy jako możliwe odpowiedzi. Jev wybierze odbiorcę na podstawie treści zlecenia.
Na co uważać: Gdy zakresy obowiązków agentów mocno się pokrywają, decyzję o przydziale trudniej ocenić i poprawić.
8.Przyspieszaj proste czynności w przeglądarce
Na czym polega: Zamiast za każdym razem zlecać modelowi językowemu szeroką analizę zrzutu ekranu, można zadać pytanie o konkretny element, na przykład przycisk pobierania.
Jak stosować: Dziel czynność na małe kroki: sprawdź, czy potrzebny przycisk jest widoczny, a następnie wybierz dalsze działanie.
Na co uważać: Odpowiedź na pytanie „czy przycisk jest widoczny?” nie gwarantuje, że kliknięcie wykona zamierzoną operację. Działanie trzeba sprawdzić.
9.Wskazuj sprawy medyczne wymagające uwagi
Na czym polega: Autor proponuje wykorzystanie klasyfikacji do wstępnego wyłaniania rozmów i dokumentacji pacjentów, którym lekarz powinien przyjrzeć się wcześniej.
Jak stosować: Zdefiniuj konkretne przesłanki wymagające oceny przez specjalistę i wykorzystuj wynik do ustalania kolejności przeglądu spraw.
Na co uważać: Ostateczna ocena należy do personelu medycznego. Błędna klasyfikacja może pominąć ważną sprawę, dlatego taki proces wymaga szczególnej kontroli.
10.Porządkuj napływające alerty finansowe
Na czym polega: Każdy alert można przypisać do jednej z trzech kategorii: „zignoruj”, „sprawdź” albo „dodaj do obserwowanych”.
Jak stosować: Ustal znaczenie kategorii i przepuszczaj przez klasyfikację powtarzalny strumień powiadomień. Zespół może wtedy skupić się na sprawach oznaczonych do przeglądu.
Na co uważać: Zasady klasyfikacji trzeba regularnie sprawdzać. Alert oznaczony jako nieistotny może dotyczyć zdarzenia, którego wcześniejsze kryteria nie uwzględniały.
Redakcyjne tłumaczenie
Czym jest Jev
Firma, o której niedawno prawie nikt nie słyszał, udostępniła Jev. Narzędzie szybko zyskało rozgłos w serwisie X. Nazywam je „modelem” z pewnym zastrzeżeniem: nie służy przede wszystkim do tworzenia tekstów czy obrazów. Pomaga wybierać spośród określonych możliwości.
Zasada jest prosta. Przekazujesz Jev informacje, zadajesz pytanie i wskazujesz odpowiedzi, które wolno mu wybrać. Jeśli ten sam opis zadania wyślesz zwykłemu modelowi językowemu dziesięć razy, prawdopodobnie otrzymasz odpowiedzi podobne, lecz różniące się szczegółami. Tutaj wcześniej określasz zbiór dopuszczalnych odpowiedzi. Narzędzie wybiera jedną z nich i podaje poziom pewności przypisany wynikowi.
Twórcy nie ujawnili dokładnej budowy Jev. Sposób jego działania przypomina jednak klasyfikator. Nie jest to nowy pomysł. Gdy przed laty pracowałem nad modelami uczenia maszynowego, korzystaliśmy z klasyfikatorów choćby do rozpoznawania obrazów. Żeby odróżniać zdjęcia kotów od zdjęć psów, przygotowywało się ogromne zbiory przykładów, trenowało model, a potem sprawdzało, do której kategorii należy nowy obraz.
Różnica polega na tym, że dawne rozwiązania budowano zwykle pod ściśle określony podział. Jev ma bardziej ogólny charakter: podajesz pytanie i możliwe odpowiedzi, a on klasyfikuje dostarczony materiał według tych wskazówek.
Kiedy taki sposób działania się przydaje
Pomyśl o trzech pytaniach: „Czy ten materiał spełnia moje wymagania?”, „Którą z opcji A, B i C wybrać?” oraz „Co powinno wydarzyć się dalej: A, B, C czy D?”. W każdym przypadku możliwe odpowiedzi są znane z góry. Możesz więc sprawdzić, którą z nich narzędzie wskazało i z jaką pewnością.
O podobną ocenę da się poprosić model językowy, także taki, który lepiej radzi sobie z wieloetapowym rozumowaniem. Przy wielu powtórzeniach sformułowanie odpowiedzi może się jednak zmieniać. Żadne z tych narzędzi nie jest bezbłędne. Zaletą Jev jest to, że z góry ustalasz dopuszczalny wynik i za każdym razem widzisz przypisaną mu miarę pewności.
Przydaje się to również do sprawdzania pracy modeli językowych. Wyobraź sobie firmę, która przetwarza setki lub tysiące zapytań: analizuje umowy, przygotowuje oferty, przegląda materiały albo szacuje koszty. W każdym przypadku chce upewnić się, że odpowiedź mieści się w przewidzianych granicach.
Przykładem może być obieg umów. Dokument jest na jednym z trzech etapów: wymaga przeglądu, czeka na końcową kontrolę jakości albo jest gotowy do wysłania klientowi. Do oceny wyniku można użyć kolejnego modelu językowego, któremu poleci się sprawdzić odpowiedź pierwszego. Taki dodatkowy „sędzia” też może się pomylić. Dokładanie następnych ocen zwiększa liczbę wywołań, czas i zużycie tokenów. Jeżeli potrzebujesz jedynie odpowiedzi na wąskie pytanie klasyfikacyjne, Jev może wykonać tę część pracy prościej.
Przekazujesz mu fakty, pytanie oraz możliwe odpowiedzi. Otrzymujesz krótki wynik. Według przedstawionego w nagraniu sposobu rozliczania płaci się za tokeny wejściowe; odpowiedź nie jest tworzona jako swobodny tekst o dowolnej długości.
Trzy rodzaje pytań
Jev obsługuje trzy podstawowe rodzaje pytań. Pierwszy to wybór między „tak” a „nie”. Drugi pozwala wskazać jedną z kilku odpowiedzi. Trzeci polega na przyznaniu oceny według ustalonej skali.
W udostępnionych materiałach technicznych zapisuje się rodzaj pytania i jego treść, a odpowiedź zawiera wynik oraz przypisaną mu miarę pewności. Przy pytaniu wielokrotnego wyboru dochodzą kolejne możliwości. Przy ocenie punktowej wynik odnosi się do zdefiniowanej skali.
Nie trzeba koniecznie przygotowywać każdego wywołania ręcznie. Dostępne są gotowe instrukcje, które można skopiować, a dokumentację przekazać wybranemu modelowi językowemu i poprosić go o pomoc w użyciu narzędzia. Jeśli nie programujesz, najważniejsza jest sama logika: określasz, o co pytasz, oraz jakie odpowiedzi wchodzą w grę.
Przykład: co oznacza „bezpłatne anulowanie” hotelu
Załóżmy, że w opisie hotelu widnieje informacja o bezpłatnym anulowaniu rezerwacji. Chcesz ustalić, czy w razie rezygnacji pieniądze wrócą na konto, czy hotel przyzna jedynie środki do wykorzystania przy kolejnym pobycie. Możliwy jest też kredyt na platformie rezerwacyjnej.
Przekazujesz pełny opis i pytasz, czy warunki spełniają wymóg zwrotu pieniędzy. Jev może wskazać, że nie: rezerwację wolno anulować do 24 godzin przed przyjazdem, ale zwrot następuje w postaci środków hotelowych ważnych przez 12 miesięcy.
Takie pytanie można zadawać dla dużej liczby dokumentów. Szczególnie przydaje się wtedy, gdy szukasz jednego konkretnego warunku w obszernych materiałach.
Dziesięć pomysłów na zastosowanie
Pierwszy pomysł to weryfikacja twierdzeń. Załóżmy, że ktoś pisze: „Picie kawy wydłuża życie”. Można przekazać materiały źródłowe i zapytać, czy przedstawione dowody uzasadniają właśnie takie sformułowanie, czy też zdanie trzeba przeredagować. Przy dużej liczbie publikacji jedno precyzyjne pytanie pozwala szybko wybrać materiały wymagające bliższego sprawdzenia.
Drugi przykład dotyczy obsługi klienta. Zespół otrzymuje zapis rozmowy, a Jev wskazuje jeden z trzech działów, do którego zgłoszenie powinno trafić. W takim zadaniu nie zawsze potrzeba modelu językowego, który pisze rozbudowane uzasadnienie. Potrzeba właściwego przydziału.
Trzecie zastosowanie to przegląd umów. W wielu firmach używa się do tego modeli językowych, choć część pracy sprowadza się do przypisania dokumentu do ustalonego etapu. Jeżeli poziom pewności wyniku jest niski, sprawę można skierować do człowieka. Przykładowo zespół mógłby przyjąć próg 90–95 procent jako sygnał, że pozostałe przypadki wymagają dodatkowej kontroli. Nie trzeba wtedy ręcznie sprawdzać każdej umowy tylko dlatego, że cały proces wspiera AI.
Czwarty przykład to długi wątek e-mailowy. Masz sto wiadomości i szukasz jednej informacji: na jaki dzień ostatecznie przesunięto premierę produktu? Jeśli możliwe terminy to czwartek, piątek i sobota, podajesz je jako odpowiedzi. Otrzymujesz wskazanie bez dodatkowego tekstu, którego w tej sytuacji nie potrzebujesz.
Po piąte, Jev może kierować zapytania do odpowiednich modeli językowych. Na podstawie treści zadania wybierze, czy wysłać je do modelu z rodziny Codex, Claude, czy do rozwiązania o otwartym kodzie. Gdy pojawił się GPT-5, sporo dyskutowano o tym, czy mechanizm wyboru modelu właściwie przydziela trudniejsze zadania. Własny system kierowania zapytań pozwala określić te zasady samodzielnie.
Szósty pomysł polega na sprawdzaniu wybranych etapów pracy modelu językowego. Zamiast czekać, aż ten sam model przez wiele minut ponownie przeanalizuje własną odpowiedź, można zadać Jev wąskie pytanie: „Czy wykonana praca spełnia ten warunek?”. Po uzyskaniu wyniku proces przechodzi do następnego kroku.
Siódme zastosowanie jest podobne do wyboru modelu, ale dotyczy agentów. Jeśli w jednym systemie pracuje kilku agentów wyspecjalizowanych w różnych zadaniach, Jev może wskazać, który z nich powinien otrzymać dane zlecenie.
Ósmy przykład to obsługa przeglądarki. Agent korzystający z komputera często analizuje cały zrzut ekranu, choć szuka tylko jednego elementu. Można zawęzić pytanie do tego, czy na ekranie znajduje się przycisk pobierania, a następnie wybrać odpowiedni krok. Autor wskazuje, że takie podejście może skrócić czas działania i zmniejszyć zużycie tokenów.
Dziewiąte zastosowanie dotyczy ochrony zdrowia. Jev mógłby wstępnie wskazywać fragmenty rozmów lub dokumentacji pacjentów, które wymagają uwagi lekarza. Specjalista nadal musi ocenić sprawę. Narzędzie ma pomóc mu ustalić, którym przypadkom przyjrzeć się najpierw.
Dziesiąty pomysł to porządkowanie alertów finansowych. Gdy przychodzi ich bardzo dużo, każdy można przypisać do jednej z trzech kategorii: „zignoruj”, „sprawdź” albo „dodaj do obserwowanych”. Dzięki temu uwagę łatwiej skierować na informacje wymagające działania.
Koszt i od czego zacząć
W nagraniu pada przykładowa cena około 0,0042 USD za zapytanie zawierające 10 tysięcy tokenów wejściowych. Autor podkreśla, że przy dużej liczbie powtarzalnych decyzji koszt pojedynczego wywołania ma znaczenie.
(Informacja dodatkowa: Wyliczenia dla większej liczby zapytań podane w nagraniu są niespójne z ceną jednostkową. Przy stawce 0,0042 USD za zapytanie tysiąc wywołań kosztowałoby 4,20 USD, 10 tysięcy — 42 USD, a 100 tysięcy — 420 USD. Nagranie podaje kwoty dziesięciokrotnie niższe. Przed planowaniem wydatków trzeba sprawdzić aktualny cennik.)
Jeśli chcesz wypróbować Jev, zacznij od decyzji, którą podejmujesz często i dla której istnieje krótka lista możliwych wyników. To może być przydział zgłoszenia, ocena etapu pracy albo sprawdzenie konkretnego warunku w dokumencie. Gdy potrzebujesz pełnego wyjaśnienia lub nowego tekstu, sięgnij po model językowy. Gdy potrzebujesz odpowiedzi z ustalonej listy, warto sprawdzić narzędzie do klasyfikacji — także jako uzupełnienie procesu opartego na modelu językowym.
Przygotowałem również stronę, na której można przetestować sposób zadawania pytań. Pytanie „Jaki kolor ma niebo?” bez odpowiednich danych i wskazanych możliwości może skończyć się wynikiem „za mało informacji”. Pytanie „Czy ludzie oddychają tlenem?” zadane w formacie „tak lub nie” daje już właściwą strukturę; w pokazanym przykładzie Jev wskazuje „tak” z pewnością na poziomie 97 procent.
Warto przyjrzeć się szybkości odpowiedzi i sposobowi zapisu zapytań. To pozwoli przygotować własne zastosowania, zanim zaczniesz korzystać z interfejsu API.