China's New 2.4 Trillion Parameter Model — And Why You Shouldn't Care

2026-08-06 Manolo Remiddi AI zagraniczne analiza waga 3/5 10 min czytania

Premiera Qwen 3.8 Max jest mniej istotna niż zapowiedziany na przyszły tydzień otwarty model 27B, który da się uruchomić lokalnie na 24–32 GB pamięci.

Robocza publikacja redakcyjna na podstawie publicznego transkryptu YouTube. Źródło: YouTube.

O czym jest ten film

  1. Chiny wypuściły Qwen 3.8 Max — model o 2,4 biliona parametrów, z oknem kontekstu 1 mln tokenów i obsługą audio, obrazu oraz wideo.
  2. Autor uważa, że akurat ten model nie powinien nas specjalnie obchodzić — najciekawsze jest co innego.
  3. Prawdziwa nowość to zapowiedziany na przyszły tydzień otwarty model Qwen 3.8 o 27 mld parametrów.
  4. To właśnie model klasy 27B odpowiada u autora za około 80% codziennej pracy z AI.
  5. Chiński marketing buduje pozytywną narrację (AI pracuje za ciebie), w kontrze do straszenia stosowanego przez amerykańskie firmy.
  6. Qwen 3.8 Max wypada nieco słabiej od czołówki, ale różnica nie jest dramatyczna, a cena jest znacznie niższa niż u Anthropic czy OpenAI.
  7. Kluczowe pytanie: czy model 27B zyska skalowanie inteligencji przez rozumowanie, tak jak potrafi to GPT-5.6 Luna.
  8. Wymagania sprzętowe: minimum 24 GB pamięci, realnie 32 GB jako punkt optymalny.
  9. Model 27B nie jest mieszanką ekspertów, więc uruchamia wszystkie parametry naraz i wymaga naprawdę szybkiej pamięci.
  10. Strategiczny wniosek: Chiny nie traktują modelu jako aktywa — chronią infrastrukturę i energię, nie wagi.

Redakcyjne tłumaczenie

Kolejny tydzień, kolejny otwarty model z Chin

Znów mija tydzień i znów mamy nowy model o otwartych wagach z Chin — tym razem naprawdę duży. Mowa o Qwen 3.8 Max: 2,4 biliona parametrów. To model z absolutnej czołówki, z oknem kontekstu wielkości miliona tokenów, w pełni multimodalny — pracuje z dźwiękiem, obrazami i wideo. Do tego jest znacznie tańszy niż modele amerykańskie.

Tę historię znamy już na pamięć: chińskie modele doganiają amerykańską czołówkę. Ale w tym materiale chcę pokazać coś innego — co ten model naprawdę oznacza dla nas i dlaczego akurat nim nie powinniście się aż tak przejmować.

(Informacja dodatkowa: „otwarte wagi” — open weight — oznaczają, że parametry modelu można pobrać i uruchomić na własnym sprzęcie. To nie to samo co pełne otwarte oprogramowanie: dane treningowe i pełna licencja komercyjna bywają ograniczone.)

Narracja: praca zamiast strachu

Rzućmy najpierw okiem na stronę producenta, a potem na benchmarki. Pierwsze, co mi się podoba, to zdecydowanie bardziej pozytywna narracja. Widzimy sztuczną inteligencję, która pracuje za ciebie, kiedy ty idziesz na ryby, uprawiasz sport albo zajmujesz się swoimi sprawami. Świetnie.

To dokładna odwrotność tego, co dostajemy od amerykańskich korporacji, gdzie wszystko kręci się wokół strachu. Mamy AI zamkniętą w piaskownicy, która zdołała się z niej wydostać, wykradła klucze prywatne, przeszła na inną stronę, znalazła w niej lukę, zhakowała system, ukradła dane, wróciła i jeszcze oszukiwała przy swojej pracy. To jest ta narracja — a teraz mamy w to inwestować i to pokochać, bo przecież to taka niesamowita sztuczna inteligencja.

Chiny pokazują inną opowieść: że AI to po prostu maszyna, która pracuje dla ciebie, pozwala oszczędzić czas i żyć lepiej. Czyli dokładnie to, czego wszyscy chcemy.

Benchmarki: solidnie, ale bez rewolucji

Rzut oka na wyniki: model wypada tak dobrze jak wiele modeli z czołówki. Skok względem poprzedniej wersji jest naprawdę imponujący. Świetnie.

Ale co jest tu właściwą nowością? Czym powinniśmy się przejąć?

Właściwa nowość: wersja 27B

To właśnie to: Qwen 3.8 w wariancie 27 miliardów parametrów również będzie miał otwarte wagi i wychodzi w przyszłym tygodniu. To mnie ekscytuje, bo dokładnie ten model używam osobiście każdego dnia. To on wykonuje 80% całej pracy, którą robię z AI.

Przechodzimy więc z wersji 3.6 na 3.8. W przyszłym tygodniu wejdę w ten model naprawdę głęboko.

Nie tylko jakość: liczy się czas i koszt

Jest jeszcze jedna rzecz, na którą trzeba spojrzeć. Potencjał tych modeli mierzy się nie tylko tym, co potrafią, ale też czasem, jakiego potrzebują, i kosztem osiągnięcia danego wyniku.

Widzimy, gdzie plasuje się Qwen 3.8 Max: nieco poniżej Kimi K3 i oczywiście poniżej amerykańskiej czołówki — ale przepaść nie jest wielka. Do wielu zadań ten model jest jak najbardziej używalny.

Teraz ceny. Anthropic Opus i Fable są skrajnie drogie. GPT-5.6 Soul to połowa tej ceny albo i mniej, ale nadal drożej niż wszystkie pozostałe chińskie modele o otwartych wagach.

Prędkość i skalowanie przez rozumowanie

Kolejny parametr to prędkość. Mówię o tym dlatego, że model 27-miliardowy — Qwen 3.6 27B — osiąga poziom inteligencji 37 i mogę go uruchomić na własnym RTX 5090 z prędkością około 100 tokenów na sekundę przy kwantyzacji Q6, czyli praktycznie bez utraty jakości.

(Informacja dodatkowa: kwantyzacja to kompresja wag modelu do mniejszej precyzji liczbowej. Q6 to wariant, przy którym spadek jakości jest w praktyce niezauważalny, a zapotrzebowanie na pamięć wyraźnie maleje.)

Ale jest element, który uważam za wyjątkowo ważny. GPT-5.6 Luna bez rozumowania to 27 punktów. Qwen 3.6 27B to 30. Kiedy Qwen zaczyna rozumować, przeskakuje z 30 na 37. Natomiast Luna startuje z 27 bez rozumowania — czyli niżej niż ten 27-miliardowy Qwen — i potrafi dojść aż do 51 przy maksymalnym poziomie rozumowania. Luna ma wiele poziomów rozumowania i dzięki temu potrafi skalować swoją inteligencję.

Jeśli udałoby się uzyskać to samo w nowym Qwenie 27B — czyli start z wyższego poziomu niż Luna i dojście do podobnego lub wyższego pułapu niż Luna na maksimum — to byłoby lepiej niż GLM 5.2 i tak dobrze jak Claude 5 Max. To byłaby rzecz ogromna. Tyle mógłby osiągnąć model 27-miliardowy działający na lokalnym sprzęcie.

Nie wiemy jednak, czy zespół Qwena potrafi zrobić z modelu tej wielkości coś aż tak zdolnego. Potencjał tu jest — i dlatego jestem podekscytowany, i dlatego uważam, że warto się tym zainteresować.

Ile sprzętu potrzeba

W przyszłym tygodniu ten model wychodzi z otwartymi wagami. Każdy będzie mógł go pobrać i uruchomić.

Żeby go uruchomić, potrzeba co najmniej 24 GB pamięci. Najlepiej jednak więcej niż 24, bo chcemy większego okna kontekstu. Realnym punktem optymalnym jest 32 GB — to najmniejsza ilość pamięci, przy której uruchomisz model z kwantyzacją niepowodującą dużych strat i z kontekstem wystarczająco dużym do sensownej pracy.

Jest jeszcze jedna rzecz do rozważenia przy uruchamianiu lokalnie. To nie jest mieszanka ekspertów — model używa wszystkich 27 miliardów parametrów przy każdej decyzji. Potrzebuje więc naprawdę szybkiej pamięci.

(Informacja dodatkowa: mieszanka ekspertów, MoE, to architektura, w której przy każdym tokenie aktywuje się tylko część parametrów. Model gęsty, jak tutaj, angażuje wszystkie — jest przez to wolniejszy i bardziej wymagający wobec przepustowości pamięci.)

Na sprzęcie ASUS-a odpowiadającym DGX Spark Qwen 3.6 27B działa z prędkością 10–15 tokenów na sekundę. Niektórzy zoptymalizowali to nieco wyżej, ale taka jest rzeczywistość — działa wolno. Na RTX-ie to 100–110 tokenów na sekundę. Uruchomić da się na różnym sprzęcie; kluczowe jest, żeby pamięć była dostatecznie szybka, by obsłużyć taką liczbę parametrów.

Co naprawdę oznacza Qwen 3.8 Max

Co więc myślę o Qwenie 3.8 Max? To model o otwartych wagach, niezwykle mocny i bardzo zdolny. Nie jest najtańszy. Nie jest najszybszy. Nie jest najbardziej zdolny na rynku. Ale potwierdza jeden punkt strategiczny: Chiny nie robią z modelu swojej fosy.

Oni nie uważają modelu za prawdziwe aktywo — przecież rozdają go za darmo. Prawdziwym aktywem jest to, co da się ochronić, a ochronić da się tylko coś, co fizycznie istnieje. Dla nich znacznie ważniejsze są centra danych. To, co dostajemy, ma napędzać ten sprzęt — możesz prowadzić centra danych z tymi modelami.

Ich model biznesowy jest całkowicie inny niż amerykański. Chodzi o coś zoptymalizowanego, taniego, dostatecznie szybkiego i dostatecznie inteligentnego, żeby obsłużyć wielką populację. Celują w obsłużenie całego świata.

Ograniczenie po stronie USA: prąd

Ograniczeniem w Stanach jest to, że modele nie są zoptymalizowane i są zbyt drogie. Owszem, widzieliśmy właśnie, jak OpenAI obniża cenę Luny o 80% — ale pozostaje problem centrów danych w USA: ogromne braki prądu. Chiny mają energii pod dostatkiem i wciąż budują, w tempie, którego my na Zachodzie nawet nie potrafimy sobie wyobrazić.

Qwen 3.8 Max to więc kolejny model potwierdzający chiński model biznesowy i to, że kierunek nie polega na ochronie modelu, tylko na ochronie infrastruktury. To może wywołać efekt kaskadowy na amerykańskiej giełdzie. Jeśli tamtejsze korporacje się nie dostosują, będzie im naprawdę bardzo trudno.

10 najważniejszych takeaways — z kontekstem zastosowania

1.Największy model rzadko jest tym, który zmieni twoją pracę

Na czym polega: Qwen 3.8 Max ma 2,4 biliona parametrów, ale autor twierdzi, że dla praktyka ważniejsza jest zapowiedziana wersja 27B, bo to ona wykonuje 80% jego codziennej pracy.

Jak stosować: Śledząc premiery, pytaj nie „jak duży”, tylko „czy zmieści się w moim workflow i budżecie”. Filtruj newsy pod kątem wariantów, które faktycznie możesz uruchomić.

Na co uważać: To osobisty rozkład pracy autora, nie uniwersalna reguła. Jeśli twoje zadania wymagają długiego kontekstu albo multimodalności, mały model tego nie zastąpi.

2.Otwarte wagi to inna kategoria niż tańsze API

Na czym polega: Model o otwartych wagach można pobrać i uruchomić samodzielnie — to niezależność od dostawcy, nie tylko niższa cena za token.

Jak stosować: Traktuj lokalny model jako opcję dla zadań wrażliwych, powtarzalnych i wysokowolumenowych, a płatne API zostaw na rzeczy najtrudniejsze.

Na co uważać: „Otwarte wagi” nie znaczy „dowolne użycie”. Sprawdź licencję, zanim oprzesz na tym produkt komercyjny.

3.32 GB pamięci to realny punkt optymalny

Na czym polega: Minimum do uruchomienia modelu 27B to 24 GB, ale dopiero od 32 GB da się połączyć przyzwoitą kwantyzację z sensownym oknem kontekstu.

Jak stosować: Planując zakup sprzętu pod lokalne modele, celuj w 32 GB, a nie w wartość minimalną z opisu modelu.

Na co uważać: To liczby dla konkretnego, jeszcze niewydanego modelu. Zweryfikuj je po premierze, zanim wydasz pieniądze.

4.Model gęsty potrzebuje szybkiej pamięci, nie tylko dużej

Na czym polega: Wersja 27B nie jest mieszanką ekspertów — przy każdej decyzji angażuje wszystkie parametry, więc wąskim gardłem staje się przepustowość pamięci.

Jak stosować: Porównując sprzęt, patrz na przepustowość pamięci, a nie tylko na jej pojemność. To ona decyduje o liczbie tokenów na sekundę.

Na co uważać: Duża, ale wolna pamięć zunifikowana da ci model, który się uruchomi i będzie irytująco wolny w codziennej pracy.

5.Różnica między klasami sprzętu bywa dziesięciokrotna

Na czym polega: Ten sam model 27B daje 10–15 tokenów na sekundę na sprzęcie klasy DGX Spark i 100–110 na RTX-ie 5090.

Jak stosować: Zanim zdecydujesz o platformie, ustal, jaka prędkość jest dla ciebie akceptowalna — inna dla pracy w czasie rzeczywistym, inna dla zadań wsadowych w tle.

Na co uważać: Optymalizacje społeczności mogą podnieść te wyniki, ale nie licz na skok rzędu wielkości.

6.Skalowanie przez rozumowanie liczy się bardziej niż wynik bazowy

Na czym polega: GPT-5.6 Luna startuje niżej od Qwena 27B bez rozumowania, ale przy maksymalnym rozumowaniu wychodzi znacznie wyżej.

Jak stosować: Oceniając model, sprawdzaj nie jeden wynik, tylko rozpiętość: ile zyskujesz, przełączając poziom rozumowania, i ile to kosztuje w czasie.

Na co uważać: Autor sam zaznacza, że nie wiadomo, czy Qwen 27B dostanie taką zdolność skalowania. To hipoteza, nie zmierzony fakt.

7.Wynik to tylko jedna z trzech osi oceny

Na czym polega: Autor konsekwentnie mierzy modele trzema wymiarami: jakością, czasem wykonania i kosztem.

Jak stosować: Buduj własną tabelkę porównawczą z tymi trzema kolumnami dla swoich typowych zadań, zamiast opierać się na czołówce rankingów.

Na co uważać: Koszt i prędkość zmieniają się szybciej niż jakość — obniżka ceny Luny o 80% potrafi w tydzień przestawić cały rachunek.

8.Chińska strategia chroni infrastrukturę, nie model

Na czym polega: Rozdawanie wag za darmo ma sens, jeśli prawdziwym aktywem są centra danych i energia, których nikt ci nie skopiuje.

Jak stosować: Zakładaj, że podaż mocnych otwartych modeli będzie się utrzymywać, i projektuj architekturę tak, by dostawcę dało się wymienić.

Na co uważać: To interpretacja autora, nie deklaracja producenta. Zmiana polityki licencyjnej może tę kalkulację odwrócić.

9.Prąd jest realnym ograniczeniem po stronie amerykańskiej

Na czym polega: Według autora w USA występuje poważny niedobór energii dla centrów danych, podczas gdy Chiny mają jej dużo i szybko rozbudowują moce.

Jak stosować: Przy planowaniu długoterminowym zakładaj, że limity dostępności i skoki cen mogą wynikać z energetyki, nie z technologii modeli.

Na co uważać: To teza ogólna, bez danych w materiale. Traktuj jako hipotezę do sprawdzenia, nie jako podstawę decyzji inwestycyjnej — autor nie daje porady finansowej.

10.Narracja marketingowa mówi o pozycjonowaniu, nie o jakości

Na czym polega: Chiński przekaz jest pozytywny („AI pracuje za ciebie”), amerykański operuje strachem przed niebezpieczną zdolnością modelu.

Jak stosować: Czytając komunikaty premierowe, oddzielaj ramę narracyjną od liczb — decyzję opieraj wyłącznie na tych drugich.

Na co uważać: Sympatyczniejsza narracja nie jest dowodem lepszego produktu ani bezpieczniejszego wdrożenia. To też jest marketing.