Can a Local 27B Model Catch GPT 5.6 Luna?

2026-07-31 Manolo Remiddi AI zagraniczne analiza waga 3/5 11 min czytania

OpenAI ścina cenę GPT 5.6 Luna o 80%, ale lokalny Qwen 3.6 27B startuje z wyższego pułapu w kodowaniu. Materiał dla osób budujących własny stack AI na sprzęcie konsumenckim.

Robocza publikacja redakcyjna na podstawie publicznego transkryptu YouTube. Źródło: YouTube.

O czym jest ten film

  1. OpenAI obniżyło koszt modeli GPT 5.6 — o 80% na wariancie Luna i o 20% na Terra — bez zmiany jakości, za to z zyskiem na szybkości.
  2. Kluczem GPT 5.6 jest skalowalny „reasoning”: im wyższy wysiłek rozumowania, tym wyższa inteligencja, a rozpiętość między poziomami jest ogromna.
  3. W indeksie kodowania (Artificial Analysis) Luna bez rozumowania osiąga 39,3, a na maksymalnym rozumowaniu — 71,4.
  4. Lokalny model Qwen 3.6 27B bez rozumowania bije Lunę bez rozumowania; z włączonym rozumowaniem (53,7) wciąż wyprzedza Lunę na średnim poziomie (50,7).
  5. Qwen 3.6 27B działa na sprzęcie konsumenckim — u autora ok. 100–110 tokenów/s na karcie „1590”.
  6. Autor spekuluje: skoro Qwen startuje z wyższego pułapu niż Luna, model z prawdziwie skalowalnym, dłuższym rozumowaniem mógłby pójść bardzo daleko.
  7. Model 27-miliardowy konkuruje z modelami liczącymi setki miliardów parametrów (Gemini, Nemotron, Inkling, DeepSeek v4 flash, MiniMax).
  8. Argument cenowy: Luna na maksymalnym rozumowaniu dorównuje inteligencją Sonnetowi 5, ale jest radykalnie tańsza; modele Anthropic są „ekstremalnie drogie”.
  9. Ruch OpenAI to nacisk cenowy, który utrudnia życie konkurencji — ale zwrócił uwagę autora ku modelom lokalnym.
  10. Autor napisał osobny artykuł typu „deep dive” o optymalizacji Qwena 27B przez rozumowanie i dobór narzędzi (harness) — twierdzi, że już dziś można wycisnąć więcej.

Redakcyjne tłumaczenie

Wielka wiadomość dnia: OpenAI tnie ceny

Najważniejsza wiadomość dnia jest taka, że OpenAI obniżyło koszt swoich modeli GPT 5.6 — o 80% na wariancie Luna i o 20% na Terra. Sama jakość nie została naruszona; w zamian model zyskał na szybkości. To może być główny news, ale jest tu więcej do zauważenia.

Najciekawsza jest ta krzywa: im wyżej wchodzimy z wysiłkiem rozumowania, tym wyżej wchodzimy z inteligencją. Ale spójrzcie na rozpiętość — jest ogromna.

(Informacja dodatkowa: „reasoning effort” to nastawialny poziom rozumowania modelu — od niskiego po maksymalny. Wyższy poziom oznacza dłuższe „myślenie” i zwykle lepsze wyniki, ale wolniejszą i droższą odpowiedź.)

Porównanie w indeksie kodowania

Chcę pokazać coś naprawdę interesującego. To jest strona Artificial Analysis, jesteśmy w indeksie kodowania. Oto Luna bez rozumowania — wynik 39,3. Kiedy przechodzimy na maksymalne rozumowanie, sięga 71,4.

A teraz spójrzcie na to. Tu mamy Lunę bez rozumowania, a tu Qwen 3.6 27B, również bez rozumowania. Zobaczcie, o ile lepszy jest ten model przy wyłączonym rozumowaniu. Rozpiętość jest ogromna. I to jest model o 27 miliardach parametrów — coś, co mogę uruchomić na swojej karcie z prędkością około 100–110 tokenów na sekundę. To model, który działa na sprzęcie konsumenckim. Luna z kolei jest dostępna wyłącznie przez subskrypcję.

Teraz popatrzmy na GPT 5.6 Luna ze średnim rozumowaniem: 50,7. Qwen 3.6 27B z włączonym rozumowaniem: 53,7. Wciąż lepszy. Znowu — różnica jest duża.

Skalowanie rozumowania i przewaga na starcie

To, co widzimy w GPT 5.6, to fakt, że rozumowanie ma wiele różnych poziomów. Kiedy przechodzimy od niskiego do średniego, do wysokiego i do maksymalnego, model wciąż skaluje się i wciąż produkuje coś niesamowitego. Na maksymalnym poziomie jest przy 71,4 — to niedaleko od najlepszych modeli. Zaledwie kilka punktów za czołówką.

I tu pojawia się pytanie: co, gdybyśmy mieli podobną krzywą rozumowania, ale dla Qwena 3.6 27B? To model, który już startuje z dużo lepszej pozycji niż Luna. Dokąd mógłby dojść? To mnie naprawdę ekscytuje, bo właśnie coś takiego moglibyśmy zobaczyć w przyszłych wydaniach 27-miliardowego Qwena. Model już teraz skalowałby się dużo lepiej, gdyby pozwolić mu na dłuższe rozumowanie — nie tylko na włączanie i wyłączanie tej funkcji, ale na jej wydłużanie.

Oczywiście to nie jest takie proste. Elementów jest wiele. Ale myśląc o dopracowaniu po tej stronie, o customizacji, o dostosowaniu do konkretnych „harnessów”, o daniu modelowi właściwych narzędzi — taki model mógłby wykonywać niesamowitą pracę. I jest to model, który działa na naszym sprzęcie. To jest dla mnie kompletnie niewiarygodne.

(Informacja dodatkowa: „harness” to warstwa oprzyrządowania wokół modelu — sposób podawania promptów, dostęp do narzędzi, pętle wykonania. Dobrze dobrany harness potrafi znacząco poprawić realne wyniki modelu bez zmiany samych wag.)

Moglibyśmy mieć działający model o 27 miliardach parametrów. Nie mówię, że model frontierowy, nie mówię o tym najwyższym poziomie — ale tylko trochę za nim. A nawet teraz jest niezwykle użyteczny. Pomyślcie, co będzie, gdy dojdzie do poziomu, jaki dziś ma Luna. A w teorii mógłby być nawet lepszy od Luny na maksimum.

Argument cenowy: nacisk OpenAI na konkurencję

Spójrzmy na to jeszcze raz. Luna jest w zasadzie na tym samym poziomie co Sonnet i tylko kilka kroków za Opusem 4.8 na maksimum. Ale popatrzcie na koszt Sonnetu. Chcę pokazać jeszcze jeden wykres — koszt na zadanie w indeksie inteligencji. Na górze mamy wszystkie te modele Anthropic, ekstremalnie drogie. A tu jest Sonnet — spójrzcie na cenę.

Teraz Luna na maksimum. To jest po prostu szaleństwo. Poziom inteligencji jest praktycznie taki sam jak u Sonnetu 5, ale spójrzcie na cenę. To właśnie robi OpenAI: obniża koszt, sprawiając, że większy konkurent nie jest w stanie poradzić sobie z takimi cenami.

(Informacja dodatkowa: Sonnet i Opus to modele Anthropic; nazwiska „Luna” i „Terra” odnoszą się w materiale do wariantów GPT 5.6 OpenAI. Wszystkie liczby pochodzą z rankingów Artificial Analysis pokazywanych w filmie.)

Mały model kontra giganci

Ale ponieważ OpenAI to zrobiło, moja uwaga przeniosła się na Qwena — i odkryłem to. W tej chwili wszyscy są w trudnej sytuacji. Oto model o 27 miliardach parametrów, który konkuruje z modelami liczącymi setki miliardów. GPT jest prawdopodobnie w tym rzędzie, ale spójrzcie na Gemini, Nemotron, Inkling — wszystkie są w okolicach tych liczb. Nawet DeepSeek w wersji 4 flash jest tylko odrobinę lepszy. Znowu: mówimy o setkach miliardów parametrów kontra 27 miliardów. To, co zrobiono z tym modelem, jest po prostu nie do wiary. MiniMax to 300–400 miliardów parametrów.

To znaczy, że dla wszystkich jest to wyzwanie. Oto model, który działa na sprzęcie konsumenckim, i kierunek jest jasny: te małe modele w następnej generacji prawdopodobnie zrobią potężny skok. To totalny hype. Jestem tym mocno napalony i nie mogę się doczekać.

Co to możliwe — i co można zrobić już dziś

OpenAI tym modelem pokazało nam, że to jest wykonalne. Prawdopodobnie opanowali umiejętność skalowania rozumowania. Mają jakąś wiedzę, zapewne zastrzeżoną. Nie mówię więc, że osiągnięcie takich wyników jest łatwe — że łatwo pokryć tę ogromną przepaść. Ale wiemy, że to jest możliwe. Nie jest łatwe, ale możliwe. I już teraz startujemy z punktu, w którym model lokalny jest dużo, dużo lepszy niż punkt startowy GPT 5.6 Luna.

Napisałem artykuł typu „deep dive”, w którym wchodzę znacznie głębiej w ten temat, bo to, co da się tu zrobić, to nie tylko czekać — to także działać. Da się poprawić to, jak Qwen 27B działa na waszym systemie już dziś. Jak mówiłem: chodzi o rozumowanie i o oprzyrządowanie. Jeśli zoptymalizujemy te dwie rzeczy, nawet dzisiaj możemy skoczyć do przodu. W artykule przechodzę przez to wszystko, opowiadam, jakie eksperymenty prowadzę, i chętnie usłyszę, co wy robicie — jakie macie wyniki, jakie opinie o tym modelu.

Podsumowanie i perspektywa

Osobiście używam Luny od jakiegoś czasu i jestem z niej bardzo zadowolony. Jest niesamowicie dobra jak na swój rozmiar i koszt. A dzisiaj stała się o 80% tańsza. To znaczy, że konto za 20 dolarów zawiezie was naprawdę daleko. Nie sądzę, żeby w tej chwili istniało coś porównywalnego z tym, co oferuje OpenAI — dla Anthropic będzie to bardzo trudne, a modele Gemini są droższe i mniej inteligentne.

To taki mocny ruch OpenAI, że ciekawe będzie, jak branża się do niego dostosuje. Sądzę, że przed nami kolejne sześć miesięcy, które będą naprawdę ekscytujące, bo ten rodzaj konkurencji i ten potencjał ze strony Qwena są niesamowite. Tak wiele elementów w najbliższych miesiącach może realnie zmienić kierunek tej branży. Jestem bardzo podekscytowany. Jeśli wy też — zostawcie łapkę w górę, subskrybujcie i oglądajcie następny film. Ciao.

10 najważniejszych takeaways — z kontekstem zastosowania

1.Obniżka ceny GPT 5.6 Luna zmienia rachunek ekonomiczny, nie jakość

Na czym polega: OpenAI ścięło koszt Luny o 80% (i Terry o 20%) bez pogorszenia jakości, dokładając szybkość. Konto za ~20 dolarów daje teraz znacznie więcej.

Jak stosować: Jeśli już korzystasz z płatnego API do kodowania lub asysty, przelicz na nowo koszt jednostkowy zadania — być może budżet, który miałeś, wystarczy teraz na wielokrotnie więcej wywołań albo na wyższy poziom rozumowania.

Na co uważać: To dane z jednego dnia i z prezentacji entuzjasty; zweryfikuj aktualny cennik u źródła przed decyzją budżetową. Ceny w tej branży zmieniają się szybko.

2.Poziom rozumowania to główna dźwignia jakości w GPT 5.6

Na czym polega: Ten sam model skacze w indeksie kodowania z 39,3 (bez rozumowania) do 71,4 (maksymalne rozumowanie). Rozpiętość między poziomami jest ogromna.

Jak stosować: Nie trzymaj się jednego ustawienia. Do prostych zadań używaj niskiego rozumowania (taniej, szybciej), a wysoki poziom rezerwuj dla trudnych problemów, gdzie jakość realnie się zwraca.

Na co uważać: Wyższe rozumowanie to więcej tokenów, więc więcej czasu i pieniędzy. Rozpiętość jakości nie jest darmowa — dobierz poziom do wartości zadania, nie ustawiaj maksimum „na wszelki wypadek”.

3.Lokalny Qwen 3.6 27B startuje z wyższego pułapu niż Luna

Na czym polega: W indeksie kodowania Qwen 27B bez rozumowania bije Lunę bez rozumowania, a z rozumowaniem (53,7) wyprzedza Lunę na średnim poziomie (50,7).

Jak stosować: Rozważ lokalny model 27B jako realną bazę do zadań kodowych, zwłaszcza gdy zależy ci na prywatności danych, braku opłat za API i pracy offline.

Na co uważać: Porównania dotyczą jednego benchmarku (kodowanie). Luna na maksymalnym rozumowaniu wciąż osiąga 71,4 — dużo powyżej Qwena. Przewaga „na starcie” nie znaczy przewagi na szczycie.

4.Model 27B działa na sprzęcie konsumenckim z użytkową prędkością

Na czym polega: Autor uzyskuje ok. 100–110 tokenów/s lokalnie, bez subskrypcji i bez wysyłania danych na zewnątrz.

Jak stosować: Jeśli masz kartę z odpowiednią ilością VRAM, przetestuj Qwen 27B lokalnie do codziennych zadań programistycznych — to może zdjąć część obciążenia z płatnych API.

Na co uważać: Wynik zależy od twojego GPU i kwantyzacji modelu. „110 tokenów/s” na jednej karcie nie przełoży się wprost na słabszy sprzęt — zmierz u siebie, zanim oprzesz na tym proces.

5.Optymalizacja to nie tylko czekanie na nowy model — działaj już dziś

Na czym polega: Autor twierdzi, że realne wyniki Qwena 27B można poprawić już teraz przez dwie dźwignie: sposób rozumowania i oprzyrządowanie (harness, narzędzia, prompty).

Jak stosować: Zanim uznasz lokalny model za zbyt słaby, dopracuj harness — daj mu właściwe narzędzia, ustrukturyzuj prompty, pozwól na dłuższe rozumowanie. Często to poprawia wyniki bardziej niż wymiana modelu.

Na co uważać: To teza autora, nie zmierzony rezultat — obiecany „deep dive” opisuje jego eksperymenty, nie gwarantowane wyniki. Traktuj to jako kierunek do samodzielnego przetestowania.

6.Nacisk cenowy OpenAI uderza w droższą konkurencję

Na czym polega: Luna na maksimum dorównuje inteligencją Sonnetowi 5, ale jest radykalnie tańsza; modele Anthropic i Gemini są tu przedstawiane jako droższe.

Jak stosować: Przy wyborze dostawcy patrz na koszt na zadanie przy porównywalnej jakości, a nie tylko na cenę za token czy pozycję w rankingu inteligencji.

Na co uważać: To perspektywa jednego komentatora, entuzjasty OpenAI/lokalnych modeli. „Mniej inteligentne i droższe” o Gemini/Anthropic to jego ocena — zweryfikuj na własnych zadaniach, bo benchmark ogólny rzadko oddaje twój konkretny przypadek.

7.Mały model konkuruje z gigantami — przewaga inżynierii nad rozmiarem

Na czym polega: Qwen 27B mierzy się z modelami liczącymi setki miliardów parametrów (Gemini, Nemotron, Inkling, DeepSeek v4 flash, MiniMax 300–400B).

Jak stosować: Nie zakładaj, że większa liczba parametrów zawsze wygrywa. Przy doborze modelu testuj mniejsze warianty na swoim zadaniu — mogą wystarczyć przy ułamku kosztu i wymagań sprzętowych.

Na co uważać: Porównanie dotyczy wybranego benchmarku. Duże modele często wygrywają w szerszym zakresie zadań, długim kontekście czy wiedzy ogólnej. „Dorównuje w kodowaniu” nie znaczy „dorównuje wszędzie”.

8.Skalowalne rozumowanie to prawdopodobnie zastrzeżone know-how OpenAI

Na czym polega: Autor podejrzewa, że OpenAI opanowało skalowanie rozumowania w oparciu o wiedzę, której inni jeszcze nie mają — stąd trudność w domknięciu przepaści.

Jak stosować: Śledź, czy kolejne wydania modeli otwartych (np. przyszły Qwen 27B) dostaną prawdziwie skalowalne, wydłużane rozumowanie — to może być moment realnego skoku dla modeli lokalnych.

Na co uważać: To spekulacja, nie potwierdzona informacja. „Możliwe, ale niełatwe” — nie zakładaj, że lokalne modele domkną tę lukę w najbliższym wydaniu tylko dlatego, że dobrze startują.

9.Ranking „koszt na jednostkę inteligencji” bywa ważniejszy niż sama jakość

Na czym polega: Autor argumentuje na wykresie kosztu na zadanie, że przy zbliżonej inteligencji różnica cen między dostawcami bywa dramatyczna.

Jak stosować: Przy porównywaniu modeli buduj własną metrykę „koszt na ukończone zadanie w twoim workflow”, nie opieraj się na pojedynczym wskaźniku inteligencji ani na cenie za milion tokenów.

Na co uważać: Koszt na token to nie to samo co koszt na zadanie — model droższy za token, ale skuteczniejszy, może wyjść taniej na ukończone zadanie. Licz na całych zadaniach, nie na cenniku.

10.Najbliższe pół roku to okno szybkich zmian — nie przywiązuj się do jednego stacku

Na czym polega: Autor spodziewa się intensywnej konkurencji cenowej i jakościowej w ciągu ~6 miesięcy, która może przestawić kierunek branży.

Jak stosować: Projektuj swój workflow tak, by łatwo podmieniać model (warstwa abstrakcji nad API, testy regresyjne na własnych zadaniach). Dzięki temu skorzystasz z każdej obniżki ceny lub nowego wydania bez przepisywania pipeline’u.

Na co uważać: „Ekscytujące sześć miesięcy” to przewidywanie, nie fakt. Nie odkładaj decyzji w nieskończoność, czekając na kolejny przełom — działaj na tym, co dostępne dziś, i bądź gotów na zmianę.