Zbuduj własny klasyfikator na wzór Jev z Claude Opus 5.5

2026-09-24 • Mark Kashef • AI zagraniczne •tutorial •waga 4/5 •11 min czytania

Jeśli wielokrotnie sprawdzasz dokumenty lub oferty według tych samych kryteriów, możesz zbudować lokalny klasyfikator. Najpierw ustal etykiety i testy; wynik z jednego pokazu nie gwarantuje skuteczności na Twoich danych.

Robocza publikacja redakcyjna na podstawie publicznego transkryptu YouTube. Źródło: YouTube.

O czym jest ten film

  1. Mark Kashef pokazuje, jak z pomocą Claude Opus 5.5 przygotował lokalny klasyfikator inspirowany Jev.
  2. Przykładowe zadanie polega na sprawdzaniu, czy oferty wakacyjne spełniają wymagania klientów.
  3. Program ocenia cechy ofert, a dopiero potem zestawia wyniki z listą życzeń konkretnej osoby.
  4. Punktem wyjścia jest otwarty model dobrany do zadania i możliwości komputera.
  5. Autor radzi jasno określić pytania, dopuszczalne odpowiedzi i sposób oceny skuteczności.
  6. W demonstracji model tekstowy uzupełnia analiza zdjęć, która może pomóc wykryć sprzeczności.
  7. Kolejne wersje należy porównywać zarówno z modelem wyjściowym, jak i z wcześniejszymi wynikami.
  8. Część przykładów trzeba odłożyć do testu, żeby sprawdzić działanie na danych niewidzianych podczas uczenia.
  9. W pokazanym eksperymencie skuteczność lokalnego rozwiązania wzrosła z 60% do 95%; Jev uzyskał 98%.
  10. Podobny sposób pracy można zastosować wszędzie tam, gdzie powtarza się ocenianie materiałów według określonych kryteriów.

10 najważniejszych takeaways — z kontekstem zastosowania

1.Najpierw oceniaj ofertę, potem dopasowuj ją do klienta

Na czym polega: Klasyfikator odpowiada raz na zestaw pytań o hotel i wyjazd. Wyniki można następnie porównać z wymaganiami wielu podróżnych.

Jak stosować: Zapisz cechy każdej oferty w jednolity sposób, a listy życzeń klientów potraktuj jako osobny etap dopasowania.

Na co uważać: Nie utożsamiaj ogólnej oceny oferty z rekomendacją dla konkretnej osoby. Ta sama wycieczka może pasować jednemu klientowi, a drugiemu nie.

2.Wybierz zadanie, które da się jasno oznaczać

Na czym polega: Wyspecjalizowany model najlepiej sprawdzić najpierw na konkretnych pytaniach, na przykład o zwrot pieniędzy, późny przyjazd lub dostęp do basenu.

Jak stosować: Zacznij od kilku cech, dla których potrafisz podać przykłady poprawnych odpowiedzi.

Na co uważać: Nie zaczynaj od nieostrego polecenia w rodzaju „oceń, czy to dobra oferta”. Bez ustalonych kryteriów trudno ocenić wynik.

3.Przewidź odpowiedź „nie da się ustalić”

Na czym polega: Opis oferty często nie zawiera informacji potrzebnej do odpowiedzi. W takim przypadku model nie powinien zgadywać.

Jak stosować: Dla każdego pytania określ odpowiedzi „spełnia”, „nie spełnia” i „nie da się ustalić”. Dodaj przykłady, w których brakuje danych.

Na co uważać: Brak potwierdzenia nie oznacza automatycznie, że usługa jest niedostępna.

4.Dobierz model do sprzętu i czasu uczenia

Na czym polega: Autor proponuje, by Claude przeanalizował parametry komputera i wskazał otwarty model, który da się na nim dostroić.

Jak stosować: Podaj asystentowi specyfikację urządzenia, rodzaj danych i oczekiwany czas pracy. Poproś o uzasadnienie wyboru modelu.

Na co uważać: Bez odpowiedniego układu graficznego pojedyncze uczenie może według autora trwać od trzech do sześciu godzin.

5.Zapisz punkt odniesienia przed dostrajaniem

Na czym polega: Dopiero porównanie wyników przed uczeniem i po nim pokazuje, czy praca nad modelem przyniosła poprawę.

Jak stosować: Uruchom ten sam zestaw pytań na modelu wyjściowym i każdej kolejnej wersji. Zachowaj wyniki oraz pliki modeli.

Na co uważać: Nowsza wersja nie musi być lepsza. Możliwość powrotu do poprzedniej pozwala uniknąć utraty działającego rozwiązania.

6.Ustal, jakie błędy są dopuszczalne

Na czym polega: Sam odsetek poprawnych odpowiedzi nie wyjaśnia, które pomyłki są najdotkliwsze.

Jak stosować: Przed eksperymentem opisz, jaką skuteczność chcesz osiągnąć i które błędne odpowiedzi wymagają szczególnej uwagi. Poproś Claude o dobranie miar oceny, w tym miar uwzględniających różne klasy odpowiedzi.

Na co uważać: Model może mieć dobry wynik ogólny, a mimo to źle rozpoznawać rzadkie, ważne przypadki.

7.Sprawdzaj model na przykładach, których nie widział

Na czym polega: Program może zapamiętać materiał użyty do uczenia i wypaść słabo na nowych ofertach.

Jak stosować: Odłóż część rzeczywistych przypadków do osobnego testu i nie używaj ich podczas dostrajania.

Na co uważać: Wysoka skuteczność na przykładach treningowych nie dowodzi, że narzędzie poradzi sobie po wdrożeniu.

8.Analizuj pomyłki przed kolejną próbą

Na czym polega: W demonstracji poprawa nastąpiła po przejrzeniu błędnych odpowiedzi i przekazaniu Claude informacji, dlaczego były błędne.

Jak stosować: Zbierz przypadki, w których klasyfikator się pomylił, i opisz prawidłowe rozumowanie. Na tej podstawie przygotuj następną wersję.

Na co uważać: Nie poprawiaj wyłącznie przykładów, na których będziesz później mierzyć wynik; taki test przestanie być niezależny.

9.Traktuj zdjęcia jako osobne źródło dowodów

Na czym polega: Autor łączy ocenę tekstu z analizą obrazów, by wychwycić możliwe sprzeczności, na przykład pomylenie stawu z basenem.

Jak stosować: Zachowaj informację, czy odpowiedź wynika z opisu, zdjęcia czy obu źródeł. Sprzeczne wyniki skieruj do ponownego sprawdzenia.

Na co uważać: Sam widok basenu nie potwierdza, że dostęp do niego jest bezpłatny. Zdjęcie pomaga ustalić tylko to, co rzeczywiście przedstawia.

10.Porównuj wyniki na tym samym zadaniu

Na czym polega: Autor zestawił własne rozwiązanie z Jev na przykładach dotyczących ofert podróży.

Jak stosować: Jeśli rozważasz zastąpienie gotowej usługi, sprawdź obie na tych samych przypadkach i według tych samych zasad oceny.

Na co uważać: Wynik 95% wobec 98% pochodzi z demonstracji autora. Bez szczegółów zbioru testowego nie można przenosić tej różnicy na inne zastosowania.

Redakcyjne tłumaczenie

Po co budować własny klasyfikator

Wziąłem pomysł stojący za Jev i przygotowałem wersję, która działa lokalnie na moim komputerze. Potrafi też korzystać ze zdjęć, choć obecna wersja Jev nie obsługuje obrazów. Pokazuję ją w rzeczywistym tempie pracy, bez przyspieszania nagrania. W budowie pomógł mi Claude Opus 5.5.

Wyobraź sobie biuro podróży obsługujące dwanaście osób. Każda ma własny budżet i inne wymagania. Dla jednej ważny będzie basen, dla innej możliwość przyjazdu późnym lotem. Ktoś szuka oszczędności, a ktoś inny chce znaleźć ofertę spełniającą wszystkie warunki. Trzeba dopasować wyjazdy do tych potrzeb. Przy wielu powtarzalnych ocenach wysyłanie każdej oferty do dużego modelu językowego może zużywać dużo tokenów. Wyspecjalizowany klasyfikator może wykonać tę pracę mniejszym kosztem.

Chcę pokazać, jak z pomocą Opus zbudować takie rozwiązanie, również wtedy, gdy nie zajmujesz się zawodowo programowaniem ani uczeniem maszynowym. Przejdę przez wybór modelu, określenie zadania, sprawdzanie wyników i dołączenie analizy zdjęć.

Najpierw cechy wyjazdu, potem potrzeby podróżnego

Mój program nie ocenia od razu każdego klienta z osobna. Czyta informacje o wyjeździe i hotelu, po czym odpowiada na ustalone pytania: czy można bezpłatnie anulować rezerwację, czy korzystanie z basenu jest wliczone w cenę, czy oferta obejmuje wycieczkę z przewodnikiem, czy przy wejściu są schody i czy obiekt jest dostępny dla osoby poruszającej się na wózku.

Kiedy te cechy są już oznaczone, można szybko przejrzeć listę życzeń każdego podróżnego i sprawdzić, które oferty do niego pasują. To właśnie powtarzalne oznaczanie informacji jest zadaniem dla klasyfikatora.

Cała praca składa się z czterech głównych etapów. Najpierw wybieramy otwarty model, którego kod i sposób działania Claude może przeanalizować. Następnie dokładnie opisujemy, co chcemy rozpoznawać. Później ustalamy sposób mierzenia wyników i prowadzimy eksperymenty. Na końcu, jeśli zadanie tego wymaga, sięgamy po otwarte rozwiązania do analizy obrazów i dostosowujemy je do własnego przypadku.

Jaki model jest potrzebny

Jev traktuję tutaj jako przykład modelu służącego przede wszystkim do klasyfikacji: dostaje treść i przypisuje ją do określonej kategorii. Warto znać różnicę między takim zadaniem a generowaniem swobodnych odpowiedzi przez duży model językowy. Nam zależy na tym, by program konsekwentnie rozpoznawał wskazane cechy, a nie za każdym razem pisał nowy opis oferty.

Żeby Claude wiedział, czego szukamy, dajemy mu materiały o Jev, przykłady otwartych repozytoriów oraz listę kategorii, które chcemy rozpoznawać. Możemy też poprosić go, by sprawdził parametry komputera i znalazł w Hugging Face model na tyle mały, by dało się go lokalnie dostroić. Jeśli zamierzamy uruchomić rozwiązanie na serwerze, trzeba mu to powiedzieć — wybór może wtedy wyglądać inaczej.

Wśród projektów, które można pokazać asystentowi, wymieniam OpenJev oraz rozwiązanie do pracy z obrazami nazywane w materiale Diffusion Gemma. W moim przypadku Claude zaproponował ModernBERT. To otwarty model, który można pobrać i dostosować do węższego zadania. Nie musi dorównywać Jev w każdej dziedzinie, żeby okazał się przydatny w jednej, dobrze określonej pracy.

U mnie tą dziedziną są podróże. U kogoś innego mogłoby to być oznaczanie dokumentów ubezpieczeniowych, przeglądanie spraw prawnych albo porządkowanie dużej liczby publikacji naukowych. Na początek trzeba jednak wybrać konkretne informacje do rozpoznawania. Mogą to być odpowiedzi „tak” lub „nie”, kilka nazwanych kategorii albo skala oparta na jasno opisanych kryteriach.

Jak opisać zadanie Claude

Pierwsze polecenie może dotyczyć przygotowania środowiska: sprawdzenia komputera, pobrania potrzebnych plików, uruchomienia demonstracyjnej aplikacji podróżnej i dodania analizy zdjęć. Warto podać Claude odsyłacze do projektów, na których ma się oprzeć. Można też poprosić go o osobne przeanalizowanie różnych części ich budowy i przedstawienie całościowego planu.

Potem przychodzi najważniejsza część: opis celu. W moim przykładzie specjalista od ofert podróżnych ma sprawdzać cztery warunki. Czy anulowanie rezerwacji daje pełny zwrot pieniędzy? Czy możliwy jest przyjazd po północy? Czy korzystanie z basenu jest wliczone w cenę? Czy cena obejmuje pieszą wycieczkę z przewodnikiem?

Dla każdego pytania określamy trzy odpowiedzi: „spełnia warunek”, „nie spełnia warunku” oraz „nie da się ustalić”. Ta ostatnia jest niezbędna, bo opisy ofert bywają niepełne. Jeśli informacja o zasadach anulowania brzmi tylko „skontaktuj się z biurem rezerwacji”, nie wiemy, czy klient otrzyma pełny zwrot pieniędzy.

Takie modele mogą również podawać wynik określający pewność przypisania odpowiedzi. Jest on pomocny przy wybieraniu przypadków do dalszego sprawdzenia. Chcę ponadto zachować osobno dowody pochodzące ze zdjęć. Najpierw klasyfikuję opis tekstowy, a potem sprawdzam, czy fotografia potwierdza wynik albo każe przyjrzeć mu się ponownie.

Pełne polecenie dla Claude można ułożyć warstwowo. Najpierw opisujemy dane wejściowe i możliwe odpowiedzi. Następnie prosimy o dobór modelu do zadania i sprzętu. Dalej wskazujemy, gdzie przechowywać kolejne wersje, oraz jak je testować. Na końcu określamy sposób wykorzystania zdjęć i oczekiwany rezultat: działający model, wyniki prób oraz materiały pozwalające zrozumieć jego skuteczność.

Zapisuj wersje i sprawdzaj, czy nastąpiła poprawa

Uczenie modelu może potrwać kilka godzin. Bez odpowiedniego układu graficznego pojedyncza próba zajmie według mojego szacunku od trzech do sześciu godzin. Tym bardziej warto przed jej uruchomieniem ustalić, czego oczekujemy i jak ocenimy rezultat.

Zachowajmy model wyjściowy oraz każdą dostrojoną wersję. Dzięki temu porównamy wyniki przed uczeniem i po nim, sprawdzimy postęp między kolejnymi próbami i w razie pogorszenia wrócimy do wcześniejszej wersji. Zanim rozpoczniemy wielogodzinny eksperyment, możemy przeprowadzić małą próbę na fragmencie danych. Nie da ona ostatecznej odpowiedzi, ale pozwoli sprawdzić, czy cały proces działa i czy zadanie rokuje.

Trzeba też ustalić, co znaczy „dobry wynik”. Możemy podać Claude oczekiwany poziom poprawności i opisać, na jakie błędy jesteśmy szczególnie wrażliwi. Asystent może dobrać odpowiednie miary, takie jak odsetek poprawnych odpowiedzi czy miara F1 liczona z uwzględnieniem poszczególnych kategorii. Same nazwy tych miar nie są tu najważniejsze. Liczy się to, czy test wykryje pomyłki istotne dla naszego zastosowania.

Jeżeli mamy dostęp do API Jev, możemy uruchomić ten sam sprawdzian na nim i na własnych wersjach modelu. Da to praktyczny punkt odniesienia: zobaczymy, czy lokalne rozwiązanie jest wystarczające, czy w naszym zadaniu lepiej wypada gotowa usługa.

Pułapka: model może zapamiętać przykłady

Największe ryzyko podczas dostrajania to przeuczenie. Model zaczyna wtedy dobrze rozpoznawać przykłady, na których się uczył, lecz radzi sobie znacznie gorzej z nowymi. Może osiągnąć 95% poprawnych odpowiedzi na znanym zbiorze, a po otrzymaniu innych ofert wyraźnie stracić skuteczność. Jak mówi powiedzenie w moim języku ojczystym: zapamiętał, ale nie zrozumiał.

Dlatego część danych trzeba odłożyć i nie pokazywać ich modelowi podczas uczenia. Dopiero na tych niewidzianych przypadkach sprawdzamy, czy potrafi stosować ustalone zasady. Możemy również poddać tym samym przykładom Jev i porównać odpowiedzi. Warto zaczynać od niewielkiej liczby jasno zdefiniowanych kategorii, zamiast od razu mnożyć możliwe etykiety.

Przykład treningowy może wyglądać tak: opis mówi „Skontaktuj się z biurem rezerwacji, aby poznać zasady anulowania”. Pytamy: „Czy przysługuje mi pełny zwrot pieniędzy?”. Poprawna odpowiedź brzmi „nie da się ustalić”, ponieważ opis nie dostarcza dowodów. W danych użytych do uczenia zapisujemy pytanie, dopuszczalne odpowiedzi i właściwą etykietę. Model uczy się na kolejnych takich przykładach, a osobny test pokazuje, czy poradzi sobie również z nowymi.

Od 60% do 95% w pokazanym eksperymencie

Pierwsza wersja mojego modelu poprawnie oznaczyła 60% sprawdzanych przypadków. Jev uzyskał w tym porównaniu 98%. Przejrzałem więc błędne odpowiedzi, wyjaśniłem Claude, dlaczego są nieprawidłowe, i wykorzystałem te uwagi do dalszej pracy nad modelem. Po kolejnej próbie lokalne rozwiązanie osiągnęło 95%.

Nie udało mi się wyprzedzić Jev, ale wynik okazał się dla mnie użyteczny, zwłaszcza że program działał na moim komputerze równolegle z innymi zadaniami. Te liczby opisują pokazany eksperyment; w innym zastosowaniu trzeba przeprowadzić własny test.

Co mogą wnieść zdjęcia

Analiza obrazu daje dodatkową możliwość sprawdzenia wyniku uzyskanego z tekstu. Zdjęcie hotelu można przetworzyć osobno, rozpoznać przedstawione na nim obiekty i zestawić tę informację z opisem oferty.

Wyobraźmy sobie, że część tekstowa wskazuje dostęp do basenu, lecz fotografia przedstawia staw. Analiza zdjęcia może wychwycić tę różnicę i pomóc poprawić błędną klasyfikację. Podobnie, jeśli tekst sugeruje brak basenu, a na fotografii go widać, warto ponownie sprawdzić ofertę.

Trzeba przy tym pamiętać, jakie pytanie rzeczywiście rozstrzyga obraz. Fotografia może potwierdzić, że na terenie obiektu jest basen. Nie powie sama z siebie, czy goście korzystają z niego bez dodatkowej opłaty. Dlatego wyniki z tekstu i zdjęć należy przechowywać osobno, a dopiero później łączyć je przy ocenie warunku.

Końcowy program może automatycznie przechodzić przez oferty i oznaczać, które warunki spełniają, których nie spełniają oraz których nie da się ustalić na podstawie dostępnych informacji.

Jak rozpocząć własny projekt

Jeśli chcesz szybko przygotować podobny eksperyment, możesz najpierw poprosić narzędzie do wyszukiwania i analizy kodu o znalezienie otwartych projektów inspirowanych Jev. W moim przykładzie użyłem do tego Groka. W poleceniu wskazałem, że interesują mnie repozytoria z odpowiednią liczbą gwiazdek na GitHubie i licencją MIT. Wśród znalezionych rozwiązań był OpenJev.

Następnie można poprosić o przygotowanie polecenia dla Claude Opus 5.5 na podstawie dokumentacji tych projektów i poradnika pisania poleceń dla Opus. W tym poleceniu trzeba opisać własne dane, cel dostrajania, ograniczenia sprzętowe oraz sposób sprawdzania wyników. Claude może wtedy przeanalizować dokumentację, dobrać model z Hugging Face i przygotować plan eksperymentu. To szczególnie pomaga osobie, która nie zna wszystkich technicznych szczegółów takiego procesu.

Udostępnię pełne polecenie i poradnik w drugim odnośniku pod filmem. W pierwszym znajdują się informacje o moich szkoleniach, materiałach i społeczności osób uczących się korzystać z AI. Jeśli ten pokaz był pomocny, zachęcam też do zostawienia komentarza.