O czym jest ten film
- Model językowy jest tylko jednym z elementów agenta AI. O tym, co agent potrafi zrobić, decyduje również system, który kieruje jego pracą.
- Autor nazywa ten system harnessem — warstwą sterującą, która obsługuje zadania, narzędzia, kontekst, uprawnienia i pamięć.
- Zarządzanie kontekstem pozostaje trudnym problemem: gdy kończy się miejsce na bieżące informacje, ich streszczanie może pozbawić agenta ważnych szczegółów.
- Przy wyborze narzędzia warto sprawdzić licencję, dostępne modele, przejrzystość działania, ustawienia uprawnień oraz łatwość odejścia z platformy.
- Interfejs terminalowy odpowiada części użytkowników, ale autor woli aplikacje graficzne, które może dostosować do swojej pracy.
- Remiddi pokazuje własne rozszerzenia do DeepSeek Harness, między innymi wyszukiwarkę modeli i foldery do porządkowania projektów.
- Prezentuje też Augmentor Agent: podręcznego asystenta działającego na pulpicie i w przeglądarce.
- Jego główna propozycja to budowanie narzędzi wokół własnych potrzeb, z możliwością wymiany modelu, gdy pojawi się lepszy.
10 najważniejszych takeaways — z kontekstem zastosowania
1.Oceniaj całego agenta, nie tylko model
Na czym polega: Ten sam model może być znacznie mniej lub bardziej użyteczny zależnie od tego, jakie ma narzędzia, informacje i uprawnienia.
Jak stosować: Przed wyborem produktu rozpisz zadania, które agent ma wykonywać, a potem sprawdź cały sposób pracy: od dostępu do danych po wykonanie i kontrolę wyniku.
Na co uważać: Wysoka pozycja modelu w testach nie mówi, czy konkretna aplikacja pozwoli mu wykonać twoje zadanie.
2.Sprawdź, co warstwa sterująca robi samodzielnie
Na czym polega: To ona prowadzi agenta przez kolejne kroki, udostępnia mu narzędzia i pilnuje przebiegu pracy.
Jak stosować: Zleć próbne zadanie wymagające kilku działań i zobacz, czy możesz prześledzić, co agent zrobił po drodze.
Na co uważać: Gotowa odpowiedź może wyglądać wiarygodnie, choć pośrednie działania były błędne lub niepełne.
3.Zaplanuj źródło informacji poza rozmową
Na czym polega: Miejsce na bieżący kontekst jest ograniczone. Gdy system zastępuje starsze fragmenty rozmowy streszczeniem, część szczegółów znika.
Jak stosować: Przy długim projekcie trzymaj aktualne wymagania i ustalenia w dokumentach, do których agent może wrócić.
Na co uważać: Streszczenie streszczenia coraz łatwiej oddala się od pierwotnych ustaleń. Okresowo porównuj wyniki z dokumentem źródłowym.
4.Ustal granice dostępu
Na czym polega: Warstwa sterująca określa, czy agent może korzystać z przeglądarki, terminala lub plików oraz kiedy potrzebuje zgody.
Jak stosować: Daj mu dostęp odpowiedni do zadania. Przy zmianach w dokumentach i na komputerze sprawdź, czy możesz ograniczyć zakres działania lub wymagać zatwierdzenia.
Na co uważać: Szerokie uprawnienia są wygodne, ale zwiększają skutki pomyłki.
5.Zobacz, co agent zapamiętuje
Na czym polega: Bieżący kontekst i pamięć długoterminowa pełnią różne funkcje. Niektóre systemy osobno przechowują informacje o użytkowniku i projekcie.
Jak stosować: Sprawdź, gdzie trafiają instrukcje projektu, zapisane sesje i stałe preferencje oraz czy możesz je poprawiać.
Na co uważać: Nie zakładaj, że agent pamięta wszystkie wcześniejsze ustalenia albo że zapamiętane informacje nadal są aktualne.
6.Dobierz interfejs do sposobu pracy
Na czym polega: Terminal, aplikacja okienkowa i panel w przeglądarce mogą korzystać z podobnego zaplecza, a mimo to inaczej sprawdzać się na co dzień.
Jak stosować: Przetestuj narzędzie przy typowym zadaniu: programowaniu, pracy nad projektem, poprawianiu tekstu lub przeglądaniu stron.
Na co uważać: Liczba funkcji nie zastąpi wygody, jeśli sięganie po asystenta wymaga zbyt wielu czynności.
7.Zachowaj możliwość zmiany modelu
Na czym polega: System niezależny od jednego dostawcy pozwala wybierać między modelami lokalnymi i usługami w chmurze.
Jak stosować: Sprawdź, czy narzędzie obsługuje modele, których używasz, i czy ich zmiana nie wymaga przenoszenia całej pracy.
Na co uważać: Sama deklaracja obsługi wielu modeli nie gwarantuje, że wszystkie funkcje będą z nimi działały jednakowo.
8.Oceń przejrzystość działania
Na czym polega: Autor ceni możliwość sprawdzenia wywołań narzędzi, zawartości kontekstu, instrukcji systemowych i kosztów.
Jak stosować: Przy ważnych zadaniach wybierz rozwiązanie, w którym da się ustalić, skąd wziął się wynik i jakie kroki do niego prowadziły.
Na co uważać: Podgląd technicznych szczegółów ma wartość wtedy, gdy potrafisz na jego podstawie wykryć i poprawić problem.
9.Policz koszt odejścia z platformy
Na czym polega: Zależność od dostawcy rośnie, gdy projekty, instrukcje i sposób pracy trudno przenieść gdzie indziej.
Jak stosować: Przed wdrożeniem sprawdź licencję, możliwość eksportu danych oraz to, ile własnych elementów możesz zachować po zmianie narzędzia.
Na co uważać: Otwarte oprogramowanie daje więcej możliwości, ale przeniesienie zbudowanego na nim sposobu pracy również może wymagać wysiłku.
10.Buduj pod własne, powtarzalne zadania
Na czym polega: Remiddi stworzył podręcznego agenta, bibliotekę poleceń i pomoc w redagowaniu tekstu, bo właśnie tego potrzebował na co dzień.
Jak stosować: Zacznij od jednej często wykonywanej czynności. Uprość jej uruchamianie i dopiero potem dodawaj kolejne funkcje.
Na co uważać: Efektowny wygląd nie zastąpi niezawodnego wykonania zadania. Autor sam zaznacza, że jego aplikacja jest jeszcze we wczesnej wersji.
Redakcyjne tłumaczenie
Sam model nie wystarczy
Wiele osób skupia całą uwagę na modelu. Porównują GPT, Claude’a, Gemini, Qwena czy DeepSeeka, jakby wybór jednego z nich przesądzał o wszystkim. Tymczasem model jest tylko częścią agenta. Można go porównać do silnika: potrzebujesz jeszcze pozostałych elementów samochodu, żeby dokądkolwiek pojechać.
Najważniejszym z tych elementów jest moim zdaniem harness, czyli warstwa sterująca pracą agenta. To ona określa, co sztuczna inteligencja może rzeczywiście zrobić. Chcę pokazać, z czego składa się taki system, za co odpowiada i jak wybrać rozwiązanie do własnych potrzeb. Pokażę też narzędzie, które sam buduję. Właśnie nad tą częścią działania AI możemy dziś mieć największą kontrolę.
Z czego składa się agent
Na schemacie wyróżniam pięć warstw. U podstaw są wagi modelu, czyli sam model językowy. Wyżej znajduje się oprogramowanie, które go uruchamia — na przykład llama.cpp, vLLM, Ollama lub MLX.
Jeżeli korzystamy z modelu w chmurze, dochodzi usługa udostępniająca go przez API. Tak działa między innymi OpenRouter: łączymy się z usługą i przez nią uzyskujemy dostęp do różnych modeli.
Kolejna warstwa kieruje pracą agenta. Prowadzi go przez kolejne kroki zadania, udostępnia narzędzia, zarządza informacjami potrzebnymi w danej chwili, pamięcią i uprawnieniami. Na wierzchu jest interfejs, przez który kontaktujemy się z systemem: terminal, aplikacja na komputerze, strona internetowa albo aplikacja mobilna.
Te części łatwo ze sobą pomylić, bo użytkownik najczęściej widzi tylko okno rozmowy. A przecież dwa podobnie wyglądające okna mogą dawać agentowi zupełnie inne możliwości.
Za co odpowiada warstwa sterująca
Pierwszym zadaniem jest prowadzenie pracy krok po kroku. Dajesz agentowi polecenie, a system pozwala mu kontynuować działanie do chwili zakończenia zadania.
Drugim jest obsługa narzędzi. Agent może korzystać z przeglądarki podczas wyszukiwania informacji, z terminala albo z funkcji pozwalających pracować na komputerze. Warstwa sterująca określa, jakie narzędzia są dostępne i jak model ma je wywoływać.
Trzecia sprawa, jedna z najtrudniejszych, to zarządzanie kontekstem. Model ma ograniczoną ilość miejsca na informacje, które bierze pod uwagę podczas pracy. Trzeba tam zmieścić właściwe dane: polecenie, potrzebne dokumenty, wcześniejsze ustalenia i wyniki kolejnych działań. Jeśli zabraknie istotnego szczegółu, agent może podjąć gorszą decyzję.
Im więcej użytecznych materiałów mu dajemy, tym większa szansa na dobry wynik. Miejsca jednak w końcu zabraknie. Wtedy system może streścić dotychczasowy przebieg pracy, żeby zwolnić część dostępnego kontekstu. Każde streszczenie pomija pewne informacje. Agent zna już wtedy wcześniejsze ustalenia tylko w skrócie. To ten moment, w którym czasem zaczynamy mieć wrażenie, że radzi sobie gorzej.
Praca trwa dalej, miejsce znowu się kończy i pojawia się kolejne streszczenie. Po pewnym czasie system może opierać się na skrócie wcześniejszego skrótu. Pomaga trzymanie ważnych ustaleń w osobnym dokumencie lub w innym trwałym miejscu, do którego agent może wracać. Nie uważam jednak, by problem był już rozwiązany. Powiększanie okna kontekstowego zmniejsza potrzebę streszczania, ale zwiększa czas i koszt działania.
Dalej są uprawnienia. Co agentowi wolno? Czy działa w odizolowanym środowisku? Czy przed zapisaniem czegoś na dysku musi poprosić o zgodę? Czy może zmieniać dokumenty na komputerze? Odpowiedzi na te pytania wpływają na jego przydatność równie mocno jak wybór modelu.
Osobną kwestią jest pamięć długoterminowa: zapisane rozmowy, dane, instrukcje dotyczące projektu czy przygotowane wcześniej umiejętności. Można ją sobie wyobrazić jako bazę informacji. Niektóre systemy inaczej przechowują wiedzę o użytkowniku, a inaczej o projekcie. To ma sens, bo w obu przypadkach agent powinien pamiętać coś innego.
Pozostają jeszcze mechanizmy uruchamiane w określonych momentach pracy oraz dane o działaniu systemu: punkty kontrolne, liczba zużytych tokenów czy koszty. Wszystkim tym zajmuje się warstwa sterująca. Duże znaczenie ma sposób, w jaki to robi, ile z tego pokazuje użytkownikowi i co pozwala mu zmienić.
Terminal czy aplikacja z oknami?
Część agentów działa w terminalu. Ich tekstowy interfejs jest świadomym wyborem projektowym, a nie wadą. Pokazuję na przykład Hermes: można z nim rozmawiać i pracować, korzystając u mnie z lokalnego modelu. Wiele podobnych funkcji znajdziemy w aplikacji Hermesa. OpenCode również działa w terminalu, choć ma bardziej rozbudowany wygląd.
Dla osób programujących taki sposób pracy bywa idealny. Ja wolę aplikację z interfejsem graficznym. Przykładami są Claude Code, ChatGPT czy Cursor. Obecnie najczęściej sięgam jednak po DeepSeek Harness.
To wciąż wersja próbna. Trzeba liczyć się z tym, że nie wszystko będzie działało poprawnie, a sam program może się szybko zmieniać. W tej dziedzinie rozwój jest bardzo intensywny. Mimo to wybieram go, bo mogę dostosować go do swojej pracy.
Na pierwszy rzut oka wiele aplikacji wygląda podobnie: wybór modelu, okno rozmowy, lista projektów z boku. Różnicę widać dopiero wtedy, gdy chcę coś zmienić. DeepSeek Harness ma otwarty kod na licencji MIT, a jego budowa opiera się na wtyczkach. Mogę więc rozwijać go według własnych potrzeb.
Dodałem na przykład wyszukiwanie modeli. Mam ich do wyboru tyle, że bez wyszukiwarki trudno byłoby szybko znaleźć właściwy. Mogę też przypiąć najczęściej używane modele u góry listy; mój model lokalny jest od razu pod ręką. Przygotowałem również kolorowe foldery, w których grupuję projekty. Kiedy projektów przybywa, taka prosta zmiana pomaga utrzymać porządek.
Kiedy narzędzie jest naprawdę twoje?
Duże firmy stworzyły świetne aplikacje i potężne modele. Korzystam z nich, bo różne zadania wymagają różnych narzędzi. W ich usługach pozostaję jednak klientem. Płacę za dostęp, powierzam im dane i nie decyduję o wszystkich zmianach w produkcie. Dostawca może zmienić model, sposób działania aplikacji, cenę abonamentu albo zakres dostępnych funkcji.
Dla firmy, która opiera codzienną pracę na takim narzędziu, oznacza to niepewność. Wspominam w materiale szacunek dotyczący strat OpenAI na płatnych usługach, ale sam nie pamiętam dokładnej liczby. Moja obawa jest taka, że dzisiejsze ceny i warunki dostępu mogą z czasem znacząco się zmienić. Warto brać tę możliwość pod uwagę przy planowaniu działalności.
DeepSeek Harness daje mi coś, na czym szczególnie mi zależy: mogę go dostosowywać, rozwijać własne rozwiązania i w razie potrzeby stworzyć swoją wersję programu. Widzę też, co agent robi po drodze. Mogę prześledzić każde działanie, zajrzeć do wywołań narzędzi, sprawdzić instrukcje systemowe i informacje przekazane modelowi.
Na ekranie widzę choćby, że określone elementy zajmują 12 procent dostępnego kontekstu. Jeżeli zechcę poprawić sposób używania narzędzi albo zmienić inne ustawienia, mam punkt wyjścia: wiem, co faktycznie się dzieje. Nie każdy potrzebuje takiego wglądu na co dzień. Dla mnie, jako osoby budującej własne rozwiązania, jest on niezwykle przydatny.
Licencja MIT pozwala mi również korzystać z kodu, zmieniać go, udostępniać pod własną marką i sprzedawać. To otwiera inne możliwości niż sama opłata za dostęp do gotowej usługi.
Jak wybrać system dla siebie
Zacząłbym od licencji. Czy program jest udostępniany na licencji MIT, Apache, czy na zasadach ustalonych wyłącznie przez właściciela? Następnie sprawdziłbym, czy mogę wybrać własny model. Chcę czasem korzystać z modelu lokalnego, a czasem z usługi w chmurze. Nie chcę za każdym razem zmieniać całego sposobu pracy.
Ważna jest również przejrzystość. Czy widzę kolejne kroki agenta? Czy mogę sprawdzić, co zostało mu przekazane, gdy podejmował decyzję? Czy mam wpływ na streszczanie kontekstu?
Potem przychodzą uprawnienia. Czy mogę dokładnie określić, do czego agent ma dostęp? Czy da się ograniczyć jego działanie do odizolowanego środowiska i ustawić zasady zatwierdzania czynności?
Na koniec zadałbym pytanie, o którym mówi się zbyt rzadko: jak trudno będzie odejść z tej platformy? Ile pracy, danych i własnych rozwiązań pozostanie z nią związanych? Nie twierdzę, że DeepSeek Harness czy Pi Agent całkowicie rozwiązują ten problem. Twórcy narzędzi z różnych powodów starają się zatrzymać użytkowników u siebie. Nad większą niezależnością pracujemy także w społeczności skupionej wokół Resonant. Na razie trzeba samemu ocenić te zależności i wybrać rozwiązanie odpowiednie dla siebie lub swojej firmy.
Agent, którego przygotowałem do własnej pracy
Na DeepSeek Harness zbudowałem Augmentor Agent. Ma inny interfejs niż typowa aplikacja do rozmowy z AI: pojawia się nad programami, z których akurat korzystam. Mogę szybko go przywołać, wykonać zadanie i schować.
Obsługuje moje modele, wyszukiwanie i przypinanie ulubionych pozycji. Przygotowałem też funkcje potrzebne mi podczas codziennej pracy. W pokazanej wersji agent może działać na komputerze. Ma również tryb rozmowy głosowej. Demonstruję go krótkim powitaniem: odpowiada, że wszystko działa i jest gotów pomóc. Szybkość nie jest jeszcze imponująca, ale da się z tego korzystać. To dopiero początek.
Bardzo przydaje mi się biblioteka gotowych poleceń. Wpisuję ukośnik i nazwę, na przykład polecenie dotyczące wiadomości, a przygotowana wcześniej instrukcja trafia do pola tekstowego. Mogę ją wysłać od razu. Mam również polecenia pomagające mi poprawiać angielski oraz dopracowywać inne polecenia dla AI. Mogę dodawać następne bez zakładania za każdym razem nowej rozmowy.
Jeżeli potrzebuję kolejnego agenta, przywołuję osobne okno. Mogę nadać mu inny wygląd i kolor, żeby łatwiej odróżniać równoległe rozmowy.
Przygotowałem także wersję działającą w przeglądarce. Proszę ją na przykład o otwarcie strony Augmentor Agent i jej streszczenie. Agent przejmuje pracę na stronie, pokazuje, co robi, a potem zwraca wynik. Może też wykonywać zadania wymagające kilku kroków. Kod wersji przeglądarkowej i komputerowej jest dostępny publicznie.
Interfejs dopasowany do człowieka
Mogę zmieniać wygląd agenta: dodać obraz w tle, dobrać kolory, zapisać zestaw ustawień i od razu go wczytać. Pokazuję to na przykładzie własnego motywu. Są też drobne efekty wizualne, takie jak motyle widoczne podczas pracy; można je wyłączyć.
Ważniejsze od ozdób jest dla mnie jednak to, że mogę zaprojektować pomoc dokładnie taką, jakiej potrzebuję. Pokazuję funkcję poprawiania poleceń: wpisuję niejasne pytanie o porę roku, początek szkoły i powrót do pracy, a następnie proszę agenta, by ułożył je sensowniej. Mogę przyjąć jego wersję albo cofnąć zmianę.
Podobnie postępuję z angielskim. Czasem wiem, co chcę powiedzieć, ale nie umiem dobrze zbudować zdania. Wpisuję nieporadną wersję, a agent pomaga mi ją poprawić. To drobna funkcja, z której naprawdę korzystam. W aplikacji jest też historia rozmów i możliwość zmniejszenia jej okna.
Właśnie tak wyobrażam sobie dalszy rozwój tych narzędzi. Potrzebuję małego asystenta, którego mogę szybko przywołać do streszczenia strony, poprawienia tekstu albo wykonania krótkiego zadania. Gdy pracuję nad większym projektem, przechodzę do rozbudowanego środowiska z projektami, folderami i wszystkimi potrzebnymi ustawieniami. Oba sposoby pracy mają swoje miejsce.
Zbuduj narzędzie wokół własnych potrzeb
Zastanów się, do czego sam potrzebujesz agenta. Jak ma wyglądać jego okno? Kiedy powinien się pojawiać? Czy ma pomagać w przeglądarce, czy pracować na całym komputerze? Ja używam obu wersji, bo obie pasują do mojej pracy.
Augmentor Agent można wypróbować. W chwili nagrania wersja komputerowa działa na Linuksie; wydania na macOS i Windows autor zapowiada na później. Częścią projektu jest również panel w przeglądarce.
Nie musimy dziś samodzielnie tworzyć największych modeli językowych, żeby budować przydatne rozwiązania AI. Możemy tworzyć i zmieniać część, z którą pracujemy każdego dnia: sposób obsługi zadań, dostęp do narzędzi i sam interfejs. Gdy pojawi się lepszy model, będzie można go podłączyć do systemu przygotowanego na własnych zasadach.