Jak oszczędzać tokeny w Codexie, dobierając model do zadania

2026-09-16 • Mark Kashef • AI zagraniczne •tutorial •waga 4/5 •9 min czytania

Jeśli często pracujesz w Codexie, możesz ograniczyć użycie drogiego modelu, przekazując prostsze zadania modelom chmurowym lub lokalnym. Kluczowe są jasne instrukcje i sprawdzenie wyniku.

Robocza publikacja redakcyjna na podstawie publicznego transkryptu YouTube. Źródło: YouTube.

O czym jest ten film

  1. Mark Kashef pokazuje, jak korzystać w Codexie z różnych modeli zależnie od trudności zadania.
  2. Tańszy model chmurowy może wykonywać rutynową pracę w projekcie, w którym przygotowano już instrukcje, skrypty i procedury.
  3. Model uruchomiony na własnym komputerze może obsługiwać część zadań bez opłat za każde wywołanie.
  4. Autor demonstruje dodanie modeli chmurowych przez integrację Ollamy oraz opisuje osobną konfigurację modelu lokalnego.
  5. Przy wyborze modelu lokalnego trzeba uwzględnić zasoby komputera i zdolność modelu do używania narzędzi.
  6. Pracę można podzielić między kilka modeli: jeden zbiera informacje, drugi je porządkuje, a mocniejszy przygotowuje końcową odpowiedź.
  7. Pokazane w filmie porównania kosztów i przewidywania dotyczące kolejnych modeli są argumentami autora, a nie gwarancją oszczędności.

10 najważniejszych takeaways — z kontekstem zastosowania

1.Dobieraj model do trudności zadania

Na czym polega: Autor proponuje zachować mocniejszy model do pracy wymagającej samodzielnego planowania i złożonego kodowania, a rutynowe czynności przekazywać tańszym modelom.

Jak stosować: Przed rozpoczęciem zadania oceń, czy wymaga ono nowych rozwiązań, czy wykonania znanej procedury. Do tej drugiej grupy wypróbuj tańszy model.

Na co uważać: Niższy koszt nie oznacza, że wynik będzie wystarczająco dobry. Sprawdzaj go, zwłaszcza gdy zadanie ma wiele zależności.

2.Spisane procedury ułatwiają pracę tańszym modelom

Na czym polega: W projekcie autora znajdują się reguły, skrypty, pliki z instrukcjami i gotowe sposoby przygotowania materiałów. Model nie musi za każdym razem sam ustalać całego procesu.

Jak stosować: Zapisz powtarzalne kroki i kryteria jakości w projekcie, zanim zaczniesz przekazywać takie zadania innym modelom.

Na co uważać: Procedura pomaga tylko wtedy, gdy pasuje do bieżącego zadania. Nieaktualne instrukcje mogą utrwalać błędy.

3.Zacznij od tańszego modelu, a potem zmień go w tej samej rozmowie

Na czym polega: Kashef pokazuje rozpoczęcie pracy z modelem GLM i późniejsze przełączenie rozmowy na Astrę, która korzysta z dotychczasowego kontekstu.

Jak stosować: Zleć pierwszemu modelowi zebranie pomysłów lub przygotowanie szkicu. Gdy potrzebujesz lepszej oceny albo dopracowania materiału, przełącz model i wskaż mu konkretny następny krok.

Na co uważać: Zachowany kontekst może zawierać błędy pierwszego modelu. Poproś kolejny model o ich sprawdzenie, zanim rozwinie odpowiedź.

4.Do modeli lokalnych dobieraj zadania i sprzęt

Na czym polega: Model działający na własnym komputerze nie wymaga opłaty za każde zapytanie, lecz musi zmieścić się w dostępnej pamięci i pozostawić zasoby innym aplikacjom.

Jak stosować: Przed instalacją sprawdź pamięć, kartę graficzną i wolne miejsce na dysku. Wybierz model odpowiadający możliwościom komputera.

Na co uważać: Samo uruchomienie modelu nie dowodzi, że będzie działał wygodnie podczas zwykłej pracy.

5.Sprawdź, czy model potrafi używać narzędzi

Na czym polega: Autor zaznacza, że niektóre modele radzą sobie z pisaniem odpowiedzi, lecz gorzej z wywoływaniem narzędzi dostępnych w Codexie.

Jak stosować: Przy wyborze modelu lokalnego wymagaj obsługi narzędzi, a po konfiguracji przetestuj zadanie, które rzeczywiście z nich korzysta.

Na co uważać: Dobry wynik w zwykłej rozmowie nie wystarcza, jeśli model ma pracować z plikami, skryptami lub innymi funkcjami środowiska.

6.Zachowaj działającą konfigurację

Na czym polega: W proponowanym poleceniu dla Codexa znalazły się dwa zabezpieczenia: zachowanie obecnych modeli chmurowych i wykonanie kopii zmienianych ustawień.

Jak stosować: Dodając model lokalny, wyraźnie poproś o pozostawienie dotychczasowych połączeń i zapisanie kopii konfiguracji przed zmianą.

Na co uważać: Po instalacji sprawdź, czy nadal możesz wybrać wcześniejsze modele oraz model domyślny.

7.Testuj integrację po ponownym uruchomieniu aplikacji

Na czym polega: Kashef zaleca całkowite zamknięcie i ponowne uruchomienie Codexa, a następnie sprawdzenie modelu lokalnego w osobnych rozmowach.

Jak stosować: Po konfiguracji uruchom aplikację od nowa i wykonaj kilka krótkich prób, w tym jedną wymagającą użycia narzędzia.

Na co uważać: Pojawienie się modelu na liście nie oznacza jeszcze, że poprawnie wykona zadanie.

8.Rozdziel pracę według mocnych stron modeli

Na czym polega: W przykładzie z filmu GLM wyszukuje informacje o komputerach, lokalna Gemma przygotowuje krótką listę, a Astra składa wyniki w końcową odpowiedź z diagramem.

Jak stosować: Określ osobno zadanie dla każdego modelu i wskaż, jaki wynik ma przekazać następnemu.

Na co uważać: Błędne dane z pierwszego etapu mogą przejść przez cały proces. Przed podjęciem decyzji sprawdź informacje źródłowe.

9.Porównuj koszt całego procesu

Na czym polega: Autor zestawia ceny modeli i przekonuje, że część pracy warto przenieść do tańszej usługi chmurowej.

Jak stosować: Porównaj koszt typowych zadań przy kilku modelach, uwzględniając liczbę powtórzeń oraz to, ile pracy wymaga sprawdzenie odpowiedzi.

Na co uważać: Ceny i promocje przytoczone w filmie mogą się zmieniać. Sama niższa stawka za użycie modelu nie przesądza o koszcie ukończonego zadania.

10.Mocny model wykorzystuj tam, gdzie wnosi najwięcej

Na czym polega: Proponowany przez autora schemat to zaplanowanie pracy z mocniejszym modelem, wykonanie prostszych etapów tańszymi modelami i powrót do mocniejszego na koniec.

Jak stosować: Wyznacz etapy, na których potrzebujesz planu, krytycznej oceny albo spójnej końcowej odpowiedzi. Pozostałe kroki przydziel modelom odpowiednim do ich trudności.

Na co uważać: Nie zakładaj z góry, że taki podział zawsze się opłaca. Przy krótkim zadaniu koordynowanie kilku modeli może zabrać więcej czasu niż sama praca.

Redakcyjne tłumaczenie

Po co używać kilku modeli w Codexie

Jeśli chcesz nadal pracować w Codexie, ale nie zużywać tokenów mocnego modelu, takiego jak Astra, na każde zadanie, możesz dodać do swojego sposobu pracy tańsze modele chmurowe oraz modele uruchamiane na własnym komputerze. Pokażę, jak to zrobić i jak poprosić Codexa o pomoc przy konfiguracji modelu lokalnego. Dzięki temu łatwiej gospodarować dostępnym limitem podczas codziennej pracy nad projektami.

Nadal korzystamy z Codexa. Zmieniamy jedynie model, który wykonuje dane zadanie. Jako przykład wezmę mój projekt do prowadzenia kanału YouTube. Mam w nim reguły, pliki AGENTS.md, infrastrukturę i agentów pomagających przygotowywać miniatury, wskazówki do nagrań oraz propozycje tytułów. (Informacja dodatkowa: AGENTS.md to plik, w którym można zapisać instrukcje dla agenta pracującego w danym projekcie.)

Do takiej pracy nie zawsze muszę używać GPT-6 Astra. Mogę przełączyć się na GLM działający w chmurze. Ten konkretny model nie jest bezpłatny. Gdybym chciał uniknąć opłat za jego wywoływanie, mógłbym zamiast tego uruchomić na swoim komputerze lokalny model, taki jak pokazywana przeze mnie Gemma 4 26B.

Po zmianie modelu nadal mam dostęp do poleceń przygotowanych w projekcie. Jednym z nich mogę wczytać potrzebne informacje do kontekstu rozmowy. Mogę też po prostu napisać: „Chcę opracować film o korzystaniu z modeli lokalnych w Codexie. Pomożesz mi przemyśleć ten temat?”. Otrzymuję odpowiedź, a model może korzystać z umiejętności i instrukcji dostępnych w projekcie.

Im lepiej przygotowane jest moje środowisko pracy — katalogi, pliki z wiedzą, skrypty, reguły i procedury — tym mniej zależy od tego, by każdy etap prowadził model OpenAI. Moim zdaniem taka infrastruktura pozwala przekazać innym modelom znaczną część codziennych zadań związanych z pracą z informacją.

Przy bardzo złożonym programowaniu, zwłaszcza gdy próbujesz zbudować coś nowego, rozumiem wybór Astry. Ale jeśli zadanie polega na wykonaniu powtarzalnej pracy według szczegółowo opisanej procedury, warto wypróbować tańszy model.

Można też zacząć pracę z takim modelem, a później wrócić do Astry. W moim przykładzie po rozmowie o pomyśle na film wybieram Astrę z ustawieniem „medium” i proszę: „Świetnie, przygotuj wskazówki do nagrania całego filmu”. Model korzysta z dotychczasowego przebiegu rozmowy. Jeżeli regularnie dochodzisz do limitów swojego planu, taki podział pracy daje więcej swobody.

Dodanie modeli przez Ollamę

Konfigurację zaczynam od wejścia na ollama.com i pobrania aplikacji. Po instalacji mogę wybierać modele dostępne w chmurze albo pobrać model lokalny odpowiedni do możliwości mojego komputera.

Dodanie modeli chmurowych do Codexa wymaga jednego kroku. W ustawieniach Ollamy przewijam do sekcji aplikacji i wybieram opcję dodania do Codexa. Integracja pojawia się wtedy w interfejsie Codexa jako wtyczka, a wraz z nią lista modeli chmurowych.

Taka instalacja nie udostępnia jednak automatycznie modeli uruchamianych na własnym komputerze. Ich podłączenie wymaga dodatkowej konfiguracji. Do jej przygotowania można wykorzystać samego Codexa.

Jak poprosić Codexa o konfigurację modelu lokalnego

Oto sens polecenia, którego użyłem:

„Zainstalowałem Ollamę. Sprawdź pamięć mojego komputera, kartę graficzną, jeśli jest dostępna, wolne miejsce na dysku oraz zainstalowane modele. Wybierz model lokalny zdolny do korzystania z narzędzi, który będzie działał swobodnie i zostawi zasoby dla innych aplikacji. Jeśli mam już odpowiedni model, wykorzystaj go. W przeciwnym razie pobierz model pasujący do mojego komputera i obsługujący narzędzia. Podłącz go do Codexa przez obsługiwaną integrację z Ollamą. Zachowaj moje obecne modele chmurowe i ustawienie domyślne. Zrób kopię każdej konfiguracji, którą zmienisz”.

Warunek dotyczący narzędzi jest ważny. Niektóre modele potrafią przyjmować polecenia i tworzyć odpowiedzi, ale mają kłopot z używaniem narzędzi, nawet jeśli Codex je udostępnia.

Po wykonaniu konfiguracji całkowicie zamykam Codexa i uruchamiam go ponownie. Następnie proszę o utworzenie kilku osobnych rozmów, w których sprawdzany jest model lokalny. Jeżeli pojawi się błąd, Codex może przeanalizować go i spróbować poprawić ustawienia. Jeśli próby się powiodą, model jest gotowy do użycia.

Przykład pracy podzielonej między modele

Załóżmy, że chcę zbadać, jaki sprzęt najlepiej nadaje się do uruchamiania kilku modeli lokalnych. Interesują mnie dostępne konfiguracje Maca Studio i Maca mini oraz ich aktualne parametry. Mogę poprosić Astrę, by utworzyła dwie osobne rozmowy.

W pierwszej GLM ma zebrać informacje o sprzęcie Apple. W drugiej lokalny model Gemma ma przejąć wyniki tej pracy, przygotować krótką listę możliwości i wskazać, który komputer warto wybrać. Na koniec chcę dostać od Astry wyjaśnienie w postaci diagramu.

Po wysłaniu polecenia Codex tworzy rozmowę z GLM działającym w chmurze Ollamy oraz rozmowę z Gemmą na moim komputerze. W pokazanym przykładzie po około dziesięciu minutach GLM przekazuje zebrane informacje do kolejnego etapu. Gemma układa na ich podstawie krótką listę i przedstawia swoją ocenę. Wynik trafia następnie do głównej rozmowy z Astrą, która przygotowuje diagram pomagający dopasować sprzęt do zastosowania.

Najprostsza wersja tego sposobu pracy wygląda tak: mocniejszy model pomaga zaplanować zadanie, tańszy model chmurowy wykonuje część pracy, model lokalny przejmuje wybrane rutynowe czynności, a mocniejszy model porządkuje wynik i przygotowuje końcową odpowiedź.

Koszt i wybór modelu

W pokazanym przeze mnie porównaniu przy GPT-6 Astra widnieją wartości 10 dolarów dla danych wejściowych i 50 dolarów dla wyjściowych. Transkrypt nie podaje jednostki, do której odnoszą się te stawki. Według mojego zestawienia GLM 5.3 oraz jego wersja Flash mogą być przy tych samych zapytaniach od około 10 do 20 razy tańsze. Są to liczby, które warto samodzielnie sprawdzić w aktualnych cennikach.

Sądzę, że wraz z rozwojem kolejnych modeli coraz większą część codziennej pracy będzie można im powierzać, pod warunkiem że otrzymają odpowiednie instrukcje i zaplecze w projekcie. Nawet jeśli najmocniejsze modele coraz rzadziej będą potrzebować szczegółowych umiejętności i procedur, zapisane reguły nadal mogą pomóc tańszym modelom wykonać zadanie zgodnie z oczekiwaniami. Moja prognoza, że wkrótce przejmą około 80 procent takich zadań, pozostaje przewidywaniem.

Przytaczam też ofertę Ollamy dotyczącą modeli chmurowych: wydatek 20 dolarów ma według pokazanego przykładu dawać 60 dolarów środków do wykorzystania. Nie jestem związany z firmą. Jeśli używasz tańszego modelu, takiego jak Flash, te środki mogą wystarczyć na wiele zadań. Dlatego przed zwiększeniem wydatków na główny plan Codexa warto porównać, ile pracy da się rozsądnie przekazać innym modelom.

Możesz używać Astry tylko przy szczególnie wymagających zadaniach albo swobodnie przełączać modele zależnie od rodzaju pracy. Polecenie do konfiguracji modelu lokalnego, przewodnik i stronę z informacjami o kosztach udostępniam w linkach pod filmem.