Qwen3.8-27B · Qwen3.8-Flash-Next · GPU benchmark · 2026-10-04

Zanim kupisz kartę graficzną do fazy II

Jeśli przechodzisz do fazy II i rozważasz zakup karty graficznej, poniżej znajdziesz wyniki porównawcze RTX 3090, Intel Arc Pro B70 i czterech RTX 3090 w jednej maszynie z modelem Qwen3.8-27B. Karty do 32 GB VRAM uruchamiają go w kwantyzacji 4-bitowej (Q4), a 96 GB pozwala na pełną precyzję BF16. Czwarta kolumna to te same cztery RTX 3090 z nowym, dużo większym modelem Qwen3.8-Flash-Next 177B, który na każdy token liczy tylko ok. 6 mld parametrów. Ten sam budżet tokenów, rozumowanie włączone. Wydajność, pobór mocy, koszt sprzętu i rachunek za prąd.

wyjście 600 tok. rozumowanie ON 1, 3 i 8 użytkowników pomiary 24.09–04.10.2026

1× RTX 3090 · Z420, DDR3

24,0 tok/s
trzej użytkownicy50,0 tok/s ośmiu użytkowników50,0 tok/s skalowanie×2,08 pobór CPU + GPU~217 W sprzęt4 500 zł
po optymalizacji

1× Arc Pro B70 · 32 GB

30,3 tok/s
trzej użytkownicy75,5 tok/s ośmiu użytkowników144,3 tok/s skalowanie×2,49 pobór CPU + GPU~257 W sprzęt6 800 zł
vLLM od 26.09

4× RTX 3090 · Z820 · 27B

47,5 tok/s
trzej użytkownicy82,4 tok/s ośmiu użytkowników148,9 tok/s skalowanie×1,73 pobór samych GPU4 × 209 W sprzęt18 000 zł

4× RTX 3090 · Z820 · Flash 177B

101,4 tok/s
trzej użytkownicy188,9 tok/s ośmiu użytkowników290,7 tok/s skalowanie×1,86 pobór samych GPU4 × 210 W sprzęt18 000 zł
nowy model 04.10

Konfiguracja

3090 · Z420Arc Pro B70Z820 · 27BZ820 · Flash 177B
ModelQwen3.8-27BQwen3.8-27BQwen3.8-27BQwen3.8-Flash-Next
177B MoE, 6B aktywnych
CPUXeon E5-2660 v2Ryzen 7 27002× Xeon E5-26xx v12× Xeon E5-26xx v1
RAM46 GB DDR316 GB256 GB DDR3256 GB DDR3
(~50 GB: tablica n-gramów)
SilnikvLLM 0.20.1vLLM 0.26 XPU
(Intel llm-scaler)
vLLM 0.20.1 (TP=4)vLLM 0.30.0 + łatki społeczności
(TP=2 × PP=2 + EP)
Grafy CUDA / XPUwłączonewłączone (XPU)włączonewłączone
Spekulacja MTPwłączonawyłączonawłączona (2 tok.)włączona (3 tok.)
Kwantyzacjaint4 AutoRoundGPTQ int4BF16 (brak)int4 W4A16 (Marlin)
+ n-gramy fp8 w RAM
KV cachefp8fp8bf16fp8 (skalibrowane)
Kontekst65 536131 072
(pula 191 717)
262 144
(pula ~431 000)
262 144
(pula 806 792)
Współbieżnośćmax-num-seqs 8
+ chunked prefill
max-num-seqs 8
+ cache prefiksu
max-num-seqs 24max-num-seqs 8
+ cache prefiksu
Limit mocy180 W + zegar 1500 MHz250 W4 × 220 W4 × 220 W
Prompt w teście1 344 tok.2 849 tok.2 849 tok.2 849 tok.
Temperatura0.40.60.60.6
Data pomiaru24.09.202626.09.202625.09.202604.10.2026
Dla geeków: uwagi do tych liczb, obserwacje techniczne oraz pułapki i błędy, na które trafiliśmy przy optymalizacji vLLM i llama.cpp — geeks-only.html →
Arc Pro B70 od 26.09.2026 pracuje na vLLM. Do tego dnia działał na llama.cpp SYCL: 17,8 tok/s dla jednego i 26,7 tok/s dla trzech użytkowników. Pełne porównanie obu silników na tej samej karcie — na geeks-only.
Czwarta kolumna od 04.10.2026: ta sama maszyna Z820, inny model. Qwen3.8-Flash-Next (177 mld parametrów, mieszanka ekspertów) w 4 bitach zamiast Qwen3.8-27B w pełnej precyzji — ta kolumna porównuje więc modele, a nie karty. Wcześniej była tu pojedyncza RTX 3090 w Z440; jej wyniki i badanie limitu mocy przeniosły się na geeks-only, do części historycznej.

Przepustowość

Jeden użytkownik
3090 · Z420
24,0
Arc B70
30,3
Z820 · 27B
47,5
Z820 · Flash
101,4
Trzej użytkownicy równolegle — przepustowość łączna
3090 · Z420
50,0
Arc B70
75,5
Z820 · 27B
82,4
Z820 · Flash
188,9
050100150200 tok/s
Ośmiu użytkowników równolegle — przepustowość łączna
3090 · Z420
50,0
Arc B70
144,3
Z820 · 27B
148,9
Z820 · Flash
290,7
0100200300 tok/s

Pełne wyniki

3090 · Z420Arc B70Z820 · 27BZ820 · Flash 177B
1 użytkownik — czas25,0 s19,8 s12,7 s5,9 s
1 użytkownik — tok/s24,030,347,5101,4
Samo generowanie28,9 tok/s32,7 tok/s55,5 tok/s120,6 tok/s
Czas do pierwszego tokenu4,3 s1,5 s1,8 s0,95 s
Czytanie promptu671 tok/s1 917 tok/s1 557 tok/s2 983 tok/s
3 użytkowników — czas ściany36,0 s23,8 s22,2 s9,5 s
3 użytkowników — łącznie50,0 tok/s75,5 tok/s82,4 tok/s188,9 tok/s
3 użytkowników — na osobę16,725,227,563,0
8 użytkowników — łącznie50,0 tok/s144,3 tok/s148,9 tok/s290,7 tok/s
Skalowanie 1 → 3×2,08×2,49×1,73×1,86

Pobór mocy

3090 · Z420Arc B70Z820 · 27BZ820 · Flash 177B
GPU — spoczynek31,3 W43,0 W82,8 Wniemierzone
CPU — spoczynek13 W9 W41 Wniemierzone
Razem — spoczynek45 W52 W124 Wniemierzone
GPU — obciążenie (śr.)175 W240 W4 × 209 W4 × 210 W
GPU — szczyt180 W268 W4 × 220 W4 × 220 W
CPU — obciążenie42 W17 Wniemierzoneniemierzone
Razem — obciążenie~217 W~257 W~836 W (same karty)~840 W (same karty)
Temperatura68 °C71 °C rdzeń / 82 °C VRAM78 °C77 °C
(stresstest 79 °C)
Zegar pod obciążeniem1500 MHz (blokada)2800 MHz (pełny)1740–1810 MHz1905–1920 MHz

Co dają same ustawienia

Stan zastanyPo zmianie ustawieńZysk
Generowanie, 1 użytkownik8,4 tok/s28,9 tok/s×3,4
3 naraz — łącznie19,6 tok/s50,0 tok/s×2,5
8 naraz — łącznie19,0 tok/s50,0 tok/s×2,6
Czas do 1. tokenu przy 892 s41 s−55 %
Pobór GPU131–138 W167–178 Wdobija do limitu

Analiza szybkości na różnych konfiguracjach GPU

Cztery RTX 3090 (96 GB), limit 4 × 220 W, ten sam skrypt i ten sam prompt, oba modele zmierzone 04.10.2026 jeden po drugim. Qwen3.8-27B jest modelem gęstym: przy każdym tokenie liczy wszystkie 27 mld parametrów. Qwen3.8-Flash-Next ma 177 mld parametrów, ale na token uruchamia tylko ok. 6 mld (mieszanka ekspertów), a pełną uwagę na cały tekst ma tylko co czwarta warstwa.

Wielu użytkowników — prompt 2 849 tok., odpowiedź 600 tok.

Osób naraz27B — łącznieFlash — łącznieZysk27B — na osobęFlash — na osobę27B — czas do 1. tokenuFlash — czas do 1. tokenu
149,8 tok/s101,4 tok/s×2,0349,8 tok/s101,4 tok/s1,8 s0,95 s
395,2 tok/s188,9 tok/s×1,9831,7 tok/s63,0 tok/s5,3 s1,8 s
5128,7 tok/s239,1 tok/s×1,8625,7 tok/s47,8 tok/s8,8 s2,6 s
8164,5 tok/s290,7 tok/s×1,7720,6 tok/s36,3 tok/s11,4 s3,8 s
Jak czytać: „łącznie” = wszystkie wygenerowane tokeny podzielone przez czas od wysłania zapytań do ostatniego tokenu, razem z czekaniem; „na osobę” = łącznie podzielone przez liczbę osób — tak samo jak w tabeli głównej. Oba modele: druga z dwóch powtórek (pierwsza po starcie bywa wolniejsza przez kompilację jąder). 27B zmierzony ponownie 04.10 tą samą metodą co 25.09 dał 49,8 / 95,2 / 164,5 tok/s wobec 47,5 / 82,4 / 148,9 w tabeli głównej — rozrzut między dniami sięga 15 % przy trzech osobach, więc różnice poniżej ~15 % nie są rozstrzygające.

Długie dokumenty — polski tekst, pytanie o zdanie ukryte w środku

„Czekanie” = czas do pierwszego tokenu (model czyta dokument), „generowanie” = szybkość pisania odpowiedzi od pierwszego tokenu. Jedna próba na wiersz.

Dokument27B — czekanie27B — generowanieFlash — czekanieFlash — generowanie
47 tys. tokenów, 1 osoba31 s26,2 tok/s15 s133,7 tok/s
189 tys. tokenów, 1 osoba162 s8,8 tok/s64 s139,5 tok/s
5 osób × 47 tys. narazśr. 98 s (maks. 156 s)7,6 tok/s na osobęśr. 41 s (maks. 66 s)28,2 tok/s na osobę

Stresstest — 8 osób przez godzinę, rozmowy rosnące co rundę

Test stabilności, nie wyścig: obciążenia były różne (inny sufit rozmowy), więc liczby rund i temperatur nie służą do porównania modeli. Liczy się wiersz z błędami i restartami.

27B (25.09)Flash (04.10)
Pula pamięci rozmów (KV)~431 000 tok.806 792 tok.
Sufit rozmowy (potem nowa rozmowa)50 tys. tok.95 tys. tok.
Kontekst rozmów15–61 tys. tok.15–107 tys. tok.
Rundy udane / nieudane215 / 0339 / 0
Restarty, błędy GPU / PCIe00
Najwyższa temperatura karty81 °C79 °C
Dlaczego Flash-Next nie zwalnia przy długich dokumentach. Model gęsty przy każdym nowym tokenie czyta pamięć całej dotychczasowej rozmowy we wszystkich warstwach — im dłuższy dokument, tym wolniej (27B: z 59 do 9 tok/s). We Flash-Next trzy warstwy na cztery mają pamięć o stałym rozmiarze, a czwarta czyta tylko wybrane fragmenty tekstu. Przy 189 tys. tokenów generuje tak samo szybko jak przy krótkim pytaniu.
Czego ta tabela nie mówi: nic o jakości odpowiedzi. Flash-Next pracuje w 4 bitach, 27B w pełnej precyzji — porównanie dokładności to osobny test, w toku. W stresteście Flash-Next miał rozmowy prawie dwa razy dłuższe, więc jego czasy oczekiwania nie są wprost porównywalne z 27B.

Koszty

Sprzęt

3090 · Z420Arc B70Z820 · 27BZ820 · Flash 177B
Cena kart4 500 zł6 800 zł18 000 zł18 000 zł
VRAM24 GB32 GB96 GB96 GB
zł za 1 GB VRAM188 zł212 zł188 zł188 zł

Prąd — 1 zł/kWh, praca ciągła (720 h/mies.)

3090 · Z420Arc B70Z820 · 27BZ820 · Flash 177B
Spoczynek — zmierzone32 zł37 zł89 złniemierzone
Spoczynek — z gniazdka (szac.)89 zł74 zł181 zł—
Obciążenie — zmierzone123 zł185 zł602 zł605 zł
Obciążenie — z gniazdka (szac.)196 zł251 zł——

Koszt sprzętu na 1 tok/s

3090 · Z420Arc B70Z820 · 27BZ820 · Flash 177B
1 użytkownik187 zł224 zł379 zł178 zł
3 użytkowników90 zł90 zł219 zł95 zł

Wydajność na wat

3090 · Z420Arc B70Z820 · 27BZ820 · Flash 177B
1 użytkownik0,137 tok/s/W0,126 tok/s/W0,056 tok/s/W0,121 tok/s/W
3 użytkowników0,286 tok/s/W0,315 tok/s/W0,100 tok/s/W0,225 tok/s/W
Pomiary: Z820 Flash-Next — 2026-10-04, Arc B70 (vLLM) — 2026-09-26, Z820 27B — 2026-09-25, Z420 — 2026-09-24Qwen3.8-27B i Qwen3.8-Flash-Next600 tokenów wyjścia, rozumowanie ON
Strona główna Stack Warto wiedzieć Firmowy RAG Umów konsultację © 2026 BASIC ECONOMY sp. z o.o.