Rynek modeli językowych (LLM), potocznie nazywanych sztuczną inteligencją, robi się coraz bardziej tłoczny. Z samych Chin dociera do nas już kilka głośnych projektów, z DeepSeek na czele. To, co wyróżnia jedną z ostatnich nowości (model Qwen3.8-27B od Alibaby), to jednak nie surowa moc obliczeniowa czy efektowne funkcje tworzenia agentów, lecz coś dotąd wręcz nie do pomyślenia. Chodzi o możliwość pobrania pełnego modelu na własny komputer, uruchomienia go lokalnie i co najciekawsze całkowitego usunięcia wszelkich fabrycznych ograniczeń oraz zabezpieczeń. 

Czym jest Qwen3.8-27B?

Qwen3.8-27B to model językowy (podobnie jak ChatGPT to model jezykowy stworzony przez OpenAI i Gemini stworzony przez Google) stworzony przez chińską Alibabę. Alibaba zapowiedziała go 3 sierpnia 2026 roku, a same „wagi” modelu, czyli plik, który można pobrać i uruchomić samodzielnie na własnym komputerze, udostępniła w połowie sierpnia. To już trzecia premiera w rodzinie Qwen3.8 w niecałe dwa tygodnie: obok niego pojawił się też dużo większy, płatny Qwen3.8-Max (działający w chmurze) oraz gigantyczny model Qwen3.8-2.4T-A95B, który do działania potrzebuje całej serwerowni.

Pierwsze wypuszczone modele od Alibaby pojawiły się już w kwietniu 2023 roku pod nazwą Tongyi Qianwen. Była to odpowiedź Alibaby na ChatGPT. Jeszcze w tym samym roku ukazały się modele ze znajomym już nazewnictwem Qwen: Qwen-7B, Qwen-14B, potem Qwen-72B. Liczba w nazwie oznaczała liczbę parametrów (7B = 7 miliardów), a im większa liczba, tym „większy mózg” modelu.

Następne lata kształtowały się następująco:

2024 – Qwen1.5 i Qwen2 

2025 – przełom Qwen3 

2026 – przyspieszenie do 3.5/3.6/3.7/3.8  

Czym różni się Qwen3.8-27B od Qwen3.8-Max?

Choć obie nazwy pojawiły się niemal razem, to dwa zupełnie inne produkty.

Qwen3.8-27B to model „gęsty” (dense), czyli wszystkie 28 miliardów parametrów pracuje przy każdym pytaniu. Ma otwartą licencję Apache 2.0, wbudowaną obsługę obrazów i wideo, i co najważniejsze mieści się na jednej domowej karcie graficznej. To model „do zabrania do domu”. 

Qwen3.8-Max to zupełnie inna liga. To model typu MoE (mixture-of-experts), który ma aż 2,4 biliona parametrów łącznie, ale przy każdym pojedynczym pytaniu „budzi się” tylko ich część (ok. 95 miliardów) wyspecjalizowanych pod dane zapytanie. 

Zestawienie obu modeli:

Qwen3.8-27BQwen3.8-Max
Architekturagęsty (dense)mieszanka ekspertów (MoE)
Parametry~28 mld (wszystkie aktywne)2,4 bln łącznie / ~95 mld aktywnych
LicencjaApache 2.0 (w pełni otwarta)własna, bardziej restrykcyjna licencja Qwen3.8-Max
Obrazy/wideotak, wbudowanenie w wersji do pobrania, multimodalność tylko przez płatne API
Tryb „myślenia”można wyłączyćw wersji open-weight nie da się wyłączyć
Gdzie działajeden domowy komputerpraktycznie tylko serwerownia / chmura (Internet)

Dlaczego to ważne, że model Qwen3.8-27B ma gęstą architekturę (dense):

  • Wysoka przewidywalność – ponieważ cała sieć neuronowa oblicza każdą odpowiedź, modele gęste często lepiej łączą wiedzę z różnych dziedzin i są bardziej spójne w rozumowaniu.
  • Stałe wymagania sprzętowe – pamięć VRAM Twojej karty graficznej wykonuje bardzo intensywną pracę przy każdym zapytaniu. Jeśli model mieści się na Twoim sprzęcie (np. na karcie z 24 GB VRAM), masz pewność, że będzie działał ze stabilną prędkością, niezależnie od tego, jak trudne zadanie mu dasz, ponieważ cały czas tak samo go obciąża.

Do czego używać Qwen3.8-27B?

Ten model Qwen sprawdzi się w zadaniach, w których samodzielnie wykonuje pracę krok po kroku, czyli w zadaniach tzw. agentowych. Proces takiego zadania może wyglądać następująco: dostaje polecenie, samo rozkłada je na mniejsze kroki, korzysta po drodze z różnych narzędzi (np. wyszukiwarki, terminala, przeglądarki) i wykonuje to zadanie do końca. Podczas tego procesu AI sam zadaje sobie pomniejsze pytania i sam na nie odpowiada, bez angażowania Ciebie. 

Qwen3.8-27B sprawdzi się w:

  • generowanie i refaktoryzacja kodu 
  • wywoływanie funkcji (Tool Calling), czyli wykonywanie skryptów, operowanie na bazie danych i wchodzenie w interakcje z systemem operacyjnym
  • przetwarzaniu obszernych tekstów 
  • przetwarzaniu danych poufnych (dane nie opuszczają komputera i nie są udostępniane) 
  • pracy z obrazami – rozpoznaje, co jest na zdjęciu, odczytuje odręczne pismo, potrafi opisać zrzut ekranu 

Minusy:

  • model bywa rozwlekły w myśleniu i trzeba długo czekać na odpowiedź na proste pytanie
  • słabo radzi sobie z utrzymaniem naturalnego, ludzkiego stylu pisania
  • nie ma wiedzy specjalistycznej

Jakie wymagania sprzętowe do uruchomienia Qwen3.8-27B?

Zacznijmy od tego, że model można uruchomić na kilka sposobów, w skrócie tniemy jakość za mniejsze zużycie pamięci. Przykłady:

  • Pełna jakość (BF16): ok. 56 GB VRAM (zapotrzebowanie modelu) i tutaj przyda sięjuż karta klasy serwerowej (np. 80 GB), niedostępna w typowym domu.
  • Wersja pośrednia (FP8): ok. 28 GB VRAM – karta typu 48 GB.
  • Wersja „domowa” (4-bit, najpopularniejsza): ok. 14-18 GB – to mieści się na jednej karcie z 24 GB pamięci, np. RTX 3090 albo 4090, albo na Macu z odpowiednią ilością pamięci zunifikowanej (od ok. 24-32 GB wzwyż).
  • Wersje mocno skompresowane (1-bit): najnowsze techniki kwantyzacji zeszły nawet do ok. 8-9 GB, kosztem zauważalnej utraty jakości.

Jak wypada on w rankingach obok bardziej znanych modeli od Gemini i Claude?

Ranking LLM sierpień 2026 – jakie miejsca ma Qwen

Powyższy screen jest ze strony https://benchlm.ai/, na którym mamy ranking, w którym w pierwszej 15 wyszczególnionych aż dwa modele Qwena. Przez wielu porównywany do Claude, ponieważ również zawiera analityczne i procesowe myślenie na zaawansowanym poziomie. Sam ranking opiera się na śledzeniu 401 modeli i 404 benchmarków w sumie, ale nie wszystkie wpływają na wynik końcowy – tylko 27 benchmarków faktycznie „liczy się” do oceny

Na grafice widzimy:

  • Qwen3.8 Max na 6 miejscu ogólnie (wynik 79,04) i oficjalnie oznaczony jako „Best open weight”, czyli najlepszy model open source w całym zestawieniu 401 modeli. Mocny w trzymaniu się poleceń (98/100) i rozumowaniu (94), wyraźnie słabszy w wiedzy ogólnej (67) i kodowaniu (66).
  • Qwen3.8-27B na 14 miejscu (wynik 72,49), też otwarta licencja, cena $0 (bo działa lokalnie). Nieźle wypada w agentowości (70) i trzymaniu się poleceń (90), ale wyraźnie słabo w kategorii wiedzy (49), tak jak wcześniej wspominaliśmy: model jest mocny operacyjnie, słabszy encyklopedycznie.

W innym rankingu Arena.ai (wrzuconym powyżej), który sprawdza tylko konkretny obszar np. agentowość, (link do rankingu https://arena.ai/leaderboard/agent/code) modele zajmują kolejno Qwen3.8 Max 17 miejsce i  Qwen3.8-27B 24 miejsce. W zależności od obszaru, można wybrać sobie ranking, który nas najbardziej interesuje i sprawdzić, jakie modele przodują w tym zakresie.

Kilka faktów o Qwen3.8-27B

  • prawie 28 miliardów parametrów (wyobrażenie o skali: telefony: 1-3 mld, GPT-4 / Qwen3.8-Max: setki mld/ kilka bln, ale wciąż sporo jak na coś, co działa na domowym sprzęcie)
  • oprócz tekstu rozumie też obrazy
  • potrafi na raz przetworzyć bardzo długi tekst – odpowiednik grubej książki ponad 1600 stron
  • radzi sobie względnie dobrze z kodowaniem i pracą narzędziową, jak na swój rozmiar
  • wymagania sprzętowe:
    • potrzeba karty graficznej z ok. 24 GB pamięci
    • w wersjach „skompresowanych” (tzw. skwantyzowanych) da się go zmieścić w około 17-18 GB.
  • licencja Apache 2.0. (ważny szczegół, do którego zaraz wrócimy) to jedna z najbardziej otwartych licencji, jakie istnieją. Pozwala na dowolne używanie, zmienianie i rozpowszechnianie modelu, także komercyjnie i nie zawiera żadnych zasad mówiących „tego nie wolno robić z tym modelem”.

Po ukazaniu się Qwen3.8-27B w tydzień powstało 150 wersji modelu z usuniętym mechanizmem odmowy 

Alibaba udostępniła otwarty model Qwen3.8-27B na licencji Apache 2.0 – każdy może pobrać, modyfikować i używać komercyjnie na własnym sprzęcie. W ciągu tygodnia społeczność opublikowała na Hugging Face 150 jego wariantów z usuniętym mechanizmem odmowy odpowiedzi, który został pobrany ponad milion razy.

Sam proces usuwania wbudowanych w model AI ograniczeń bezpieczeństwa i cenzury, zwany „ablacją” (abliteration), trwa około pół godziny na jednej domowej karcie graficznej i nie wymaga ponownego trenowania modelu.

Jak to możliwe? „Operacja na otwartym mózgu” AI

Z reguły takie sytuacje nie miały miejsca w masowym działaniu, ponieważ przy innych modelach sama operacja była bardzo trudna do wdrożenia – wymagała bardzo dużej wiedzy technicznej, jak również i mocnego sprzętu. 

To właśnie przez zdecydowanie łatwiejszą ingerencję w sam model w kilka dni po publikacji modelu, na Hugging Face zaczęły pojawiać się jego przebudowane wersje z dopiskami typu „uncensored” czy „abliterated”. 

Po takiej procedurze program staje się tzw. „golasem” – działa w 100% na dysku użytkownika, bez połączenia z internetem i odpowiada absolutnie na wszystko.

Kontrowersje i ryzyko 

Środowisko zajmujące się bezpieczeństwem AI od dawna wskazuje, że mechanizmy odmowy, mimo że łatwe do obejścia przez osobę z odpowiednią wiedzą techniczną, pełnią funkcję progu utrudniającego masowe, przypadkowe lub impulsywne generowanie treści związanych np. z przemocą, tworzeniem broni, cyberprzestępczością czy materiałami wykorzystującymi dzieci. 

Usunięcie tego progu i swobodna dystrybucja gotowego, działającego lokalnie modelu zmienia sytuację. Teraz ryzyko oszustw z wykorzystaniem AI bardzo drastycznie rośnie, a konsekwencje działań.

Jest to pierwsze tak masowe i szybkie rozpowszechnienie się modelu pozbawionego mechanizmu odmowy.

Niewłaściwe wykorzystanie AI do celów niezgodnych z prawem może wiązać się z odpowiedzialnością prawną użytkownika. Sami twórcy modeli AI wprost zaznaczają, że to na użytkowniku, a nie na twórcy oryginalnego modelu czy autorze przeróbki spoczywa odpowiedzialność za sposób jego wykorzystania.