Rynek modeli językowych (LLM), potocznie nazywanych sztuczną inteligencją, robi się coraz bardziej tłoczny. Z samych Chin dociera do nas już kilka głośnych projektów, z DeepSeek na czele. To, co wyróżnia jedną z ostatnich nowości (model Qwen3.8-27B od Alibaby), to jednak nie surowa moc obliczeniowa czy efektowne funkcje tworzenia agentów, lecz coś dotąd wręcz nie do pomyślenia. Chodzi o możliwość pobrania pełnego modelu na własny komputer, uruchomienia go lokalnie i co najciekawsze całkowitego usunięcia wszelkich fabrycznych ograniczeń oraz zabezpieczeń.
Czym jest Qwen3.8-27B?

Qwen3.8-27B to model językowy (podobnie jak ChatGPT to model jezykowy stworzony przez OpenAI i Gemini stworzony przez Google) stworzony przez chińską Alibabę. Alibaba zapowiedziała go 3 sierpnia 2026 roku, a same „wagi” modelu, czyli plik, który można pobrać i uruchomić samodzielnie na własnym komputerze, udostępniła w połowie sierpnia. To już trzecia premiera w rodzinie Qwen3.8 w niecałe dwa tygodnie: obok niego pojawił się też dużo większy, płatny Qwen3.8-Max (działający w chmurze) oraz gigantyczny model Qwen3.8-2.4T-A95B, który do działania potrzebuje całej serwerowni.
Pierwsze wypuszczone modele od Alibaby pojawiły się już w kwietniu 2023 roku pod nazwą Tongyi Qianwen. Była to odpowiedź Alibaby na ChatGPT. Jeszcze w tym samym roku ukazały się modele ze znajomym już nazewnictwem Qwen: Qwen-7B, Qwen-14B, potem Qwen-72B. Liczba w nazwie oznaczała liczbę parametrów (7B = 7 miliardów), a im większa liczba, tym „większy mózg” modelu.
Następne lata kształtowały się następująco:
2024 – Qwen1.5 i Qwen2
2025 – przełom Qwen3
2026 – przyspieszenie do 3.5/3.6/3.7/3.8
Czym różni się Qwen3.8-27B od Qwen3.8-Max?
Choć obie nazwy pojawiły się niemal razem, to dwa zupełnie inne produkty.
Qwen3.8-27B to model „gęsty” (dense), czyli wszystkie 28 miliardów parametrów pracuje przy każdym pytaniu. Ma otwartą licencję Apache 2.0, wbudowaną obsługę obrazów i wideo, i co najważniejsze mieści się na jednej domowej karcie graficznej. To model „do zabrania do domu”.
Qwen3.8-Max to zupełnie inna liga. To model typu MoE (mixture-of-experts), który ma aż 2,4 biliona parametrów łącznie, ale przy każdym pojedynczym pytaniu „budzi się” tylko ich część (ok. 95 miliardów) wyspecjalizowanych pod dane zapytanie.
Zestawienie obu modeli:
| Qwen3.8-27B | Qwen3.8-Max | |
| Architektura | gęsty (dense) | mieszanka ekspertów (MoE) |
| Parametry | ~28 mld (wszystkie aktywne) | 2,4 bln łącznie / ~95 mld aktywnych |
| Licencja | Apache 2.0 (w pełni otwarta) | własna, bardziej restrykcyjna licencja Qwen3.8-Max |
| Obrazy/wideo | tak, wbudowane | nie w wersji do pobrania, multimodalność tylko przez płatne API |
| Tryb „myślenia” | można wyłączyć | w wersji open-weight nie da się wyłączyć |
| Gdzie działa | jeden domowy komputer | praktycznie tylko serwerownia / chmura (Internet) |
Dlaczego to ważne, że model Qwen3.8-27B ma gęstą architekturę (dense):
- Wysoka przewidywalność – ponieważ cała sieć neuronowa oblicza każdą odpowiedź, modele gęste często lepiej łączą wiedzę z różnych dziedzin i są bardziej spójne w rozumowaniu.
- Stałe wymagania sprzętowe – pamięć VRAM Twojej karty graficznej wykonuje bardzo intensywną pracę przy każdym zapytaniu. Jeśli model mieści się na Twoim sprzęcie (np. na karcie z 24 GB VRAM), masz pewność, że będzie działał ze stabilną prędkością, niezależnie od tego, jak trudne zadanie mu dasz, ponieważ cały czas tak samo go obciąża.
Do czego używać Qwen3.8-27B?
Ten model Qwen sprawdzi się w zadaniach, w których samodzielnie wykonuje pracę krok po kroku, czyli w zadaniach tzw. agentowych. Proces takiego zadania może wyglądać następująco: dostaje polecenie, samo rozkłada je na mniejsze kroki, korzysta po drodze z różnych narzędzi (np. wyszukiwarki, terminala, przeglądarki) i wykonuje to zadanie do końca. Podczas tego procesu AI sam zadaje sobie pomniejsze pytania i sam na nie odpowiada, bez angażowania Ciebie.
Qwen3.8-27B sprawdzi się w:
- generowanie i refaktoryzacja kodu
- wywoływanie funkcji (Tool Calling), czyli wykonywanie skryptów, operowanie na bazie danych i wchodzenie w interakcje z systemem operacyjnym
- przetwarzaniu obszernych tekstów
- przetwarzaniu danych poufnych (dane nie opuszczają komputera i nie są udostępniane)
- pracy z obrazami – rozpoznaje, co jest na zdjęciu, odczytuje odręczne pismo, potrafi opisać zrzut ekranu
Minusy:
- model bywa rozwlekły w myśleniu i trzeba długo czekać na odpowiedź na proste pytanie
- słabo radzi sobie z utrzymaniem naturalnego, ludzkiego stylu pisania
- nie ma wiedzy specjalistycznej
Jakie wymagania sprzętowe do uruchomienia Qwen3.8-27B?
Zacznijmy od tego, że model można uruchomić na kilka sposobów, w skrócie tniemy jakość za mniejsze zużycie pamięci. Przykłady:
- Pełna jakość (BF16): ok. 56 GB VRAM (zapotrzebowanie modelu) i tutaj przyda sięjuż karta klasy serwerowej (np. 80 GB), niedostępna w typowym domu.
- Wersja pośrednia (FP8): ok. 28 GB VRAM – karta typu 48 GB.
- Wersja „domowa” (4-bit, najpopularniejsza): ok. 14-18 GB – to mieści się na jednej karcie z 24 GB pamięci, np. RTX 3090 albo 4090, albo na Macu z odpowiednią ilością pamięci zunifikowanej (od ok. 24-32 GB wzwyż).
- Wersje mocno skompresowane (1-bit): najnowsze techniki kwantyzacji zeszły nawet do ok. 8-9 GB, kosztem zauważalnej utraty jakości.
Jak wypada on w rankingach obok bardziej znanych modeli od Gemini i Claude?
Ranking LLM sierpień 2026 – jakie miejsca ma Qwen

Powyższy screen jest ze strony https://benchlm.ai/, na którym mamy ranking, w którym w pierwszej 15 wyszczególnionych aż dwa modele Qwena. Przez wielu porównywany do Claude, ponieważ również zawiera analityczne i procesowe myślenie na zaawansowanym poziomie. Sam ranking opiera się na śledzeniu 401 modeli i 404 benchmarków w sumie, ale nie wszystkie wpływają na wynik końcowy – tylko 27 benchmarków faktycznie „liczy się” do oceny
Na grafice widzimy:
- Qwen3.8 Max na 6 miejscu ogólnie (wynik 79,04) i oficjalnie oznaczony jako „Best open weight”, czyli najlepszy model open source w całym zestawieniu 401 modeli. Mocny w trzymaniu się poleceń (98/100) i rozumowaniu (94), wyraźnie słabszy w wiedzy ogólnej (67) i kodowaniu (66).
- Qwen3.8-27B na 14 miejscu (wynik 72,49), też otwarta licencja, cena $0 (bo działa lokalnie). Nieźle wypada w agentowości (70) i trzymaniu się poleceń (90), ale wyraźnie słabo w kategorii wiedzy (49), tak jak wcześniej wspominaliśmy: model jest mocny operacyjnie, słabszy encyklopedycznie.

W innym rankingu Arena.ai (wrzuconym powyżej), który sprawdza tylko konkretny obszar np. agentowość, (link do rankingu https://arena.ai/leaderboard/agent/code) modele zajmują kolejno Qwen3.8 Max 17 miejsce i Qwen3.8-27B 24 miejsce. W zależności od obszaru, można wybrać sobie ranking, który nas najbardziej interesuje i sprawdzić, jakie modele przodują w tym zakresie.
Kilka faktów o Qwen3.8-27B
- prawie 28 miliardów parametrów (wyobrażenie o skali: telefony: 1-3 mld, GPT-4 / Qwen3.8-Max: setki mld/ kilka bln, ale wciąż sporo jak na coś, co działa na domowym sprzęcie)
- oprócz tekstu rozumie też obrazy
- potrafi na raz przetworzyć bardzo długi tekst – odpowiednik grubej książki ponad 1600 stron
- radzi sobie względnie dobrze z kodowaniem i pracą narzędziową, jak na swój rozmiar
- wymagania sprzętowe:
- potrzeba karty graficznej z ok. 24 GB pamięci
- w wersjach „skompresowanych” (tzw. skwantyzowanych) da się go zmieścić w około 17-18 GB.
- licencja Apache 2.0. (ważny szczegół, do którego zaraz wrócimy) to jedna z najbardziej otwartych licencji, jakie istnieją. Pozwala na dowolne używanie, zmienianie i rozpowszechnianie modelu, także komercyjnie i nie zawiera żadnych zasad mówiących „tego nie wolno robić z tym modelem”.
Po ukazaniu się Qwen3.8-27B w tydzień powstało 150 wersji modelu z usuniętym mechanizmem odmowy
Alibaba udostępniła otwarty model Qwen3.8-27B na licencji Apache 2.0 – każdy może pobrać, modyfikować i używać komercyjnie na własnym sprzęcie. W ciągu tygodnia społeczność opublikowała na Hugging Face 150 jego wariantów z usuniętym mechanizmem odmowy odpowiedzi, który został pobrany ponad milion razy.
Sam proces usuwania wbudowanych w model AI ograniczeń bezpieczeństwa i cenzury, zwany „ablacją” (abliteration), trwa około pół godziny na jednej domowej karcie graficznej i nie wymaga ponownego trenowania modelu.
Jak to możliwe? „Operacja na otwartym mózgu” AI

Z reguły takie sytuacje nie miały miejsca w masowym działaniu, ponieważ przy innych modelach sama operacja była bardzo trudna do wdrożenia – wymagała bardzo dużej wiedzy technicznej, jak również i mocnego sprzętu.
To właśnie przez zdecydowanie łatwiejszą ingerencję w sam model w kilka dni po publikacji modelu, na Hugging Face zaczęły pojawiać się jego przebudowane wersje z dopiskami typu „uncensored” czy „abliterated”.
Po takiej procedurze program staje się tzw. „golasem” – działa w 100% na dysku użytkownika, bez połączenia z internetem i odpowiada absolutnie na wszystko.
Kontrowersje i ryzyko
Środowisko zajmujące się bezpieczeństwem AI od dawna wskazuje, że mechanizmy odmowy, mimo że łatwe do obejścia przez osobę z odpowiednią wiedzą techniczną, pełnią funkcję progu utrudniającego masowe, przypadkowe lub impulsywne generowanie treści związanych np. z przemocą, tworzeniem broni, cyberprzestępczością czy materiałami wykorzystującymi dzieci.
Usunięcie tego progu i swobodna dystrybucja gotowego, działającego lokalnie modelu zmienia sytuację. Teraz ryzyko oszustw z wykorzystaniem AI bardzo drastycznie rośnie, a konsekwencje działań.
Jest to pierwsze tak masowe i szybkie rozpowszechnienie się modelu pozbawionego mechanizmu odmowy.
Niewłaściwe wykorzystanie AI do celów niezgodnych z prawem może wiązać się z odpowiedzialnością prawną użytkownika. Sami twórcy modeli AI wprost zaznaczają, że to na użytkowniku, a nie na twórcy oryginalnego modelu czy autorze przeróbki spoczywa odpowiedzialność za sposób jego wykorzystania.

