| 3090 · Z420 | Arc Pro B70 | Z820 · 27B | Z820 · Flash 177B | |
|---|---|---|---|---|
| Model | Qwen3.8-27B | Qwen3.8-27B | Qwen3.8-27B | Qwen3.8-Flash-Next 177B MoE, 6B aktywnych |
| CPU | Xeon E5-2660 v2 | Ryzen 7 2700 | 2× Xeon E5-26xx v1 | 2× Xeon E5-26xx v1 |
| RAM | 46 GB DDR3 | 16 GB | 256 GB DDR3 | 256 GB DDR3 (~50 GB: tablica n-gramów) |
| Silnik | vLLM 0.20.1 | vLLM 0.26 XPU (Intel llm-scaler) | vLLM 0.20.1 (TP=4) | vLLM 0.30.0 + łatki społeczności (TP=2 × PP=2 + EP) |
| Grafy CUDA / XPU | włączone | włączone (XPU) | włączone | włączone |
| Spekulacja MTP | włączona | wyłączona | włączona (2 tok.) | włączona (3 tok.) |
| Kwantyzacja | int4 AutoRound | GPTQ int4 | BF16 (brak) | int4 W4A16 (Marlin) + n-gramy fp8 w RAM |
| KV cache | fp8 | fp8 | bf16 | fp8 (skalibrowane) |
| Kontekst | 65 536 | 131 072 (pula 191 717) | 262 144 (pula ~431 000) | 262 144 (pula 806 792) |
| Współbieżność | max-num-seqs 8+ chunked prefill | max-num-seqs 8+ cache prefiksu | max-num-seqs 24 | max-num-seqs 8+ cache prefiksu |
| Limit mocy | 180 W + zegar 1500 MHz | 250 W | 4 × 220 W | 4 × 220 W |
| Prompt w teście | 1 344 tok. | 2 849 tok. | 2 849 tok. | 2 849 tok. |
| Temperatura | 0.4 | 0.6 | 0.6 | 0.6 |
| Data pomiaru | 24.09.2026 | 26.09.2026 | 25.09.2026 | 04.10.2026 |
| 3090 · Z420 | Arc B70 | Z820 · 27B | Z820 · Flash 177B | |
|---|---|---|---|---|
| 1 użytkownik — czas | 25,0 s | 19,8 s | 12,7 s | 5,9 s |
| 1 użytkownik — tok/s | 24,0 | 30,3 | 47,5 | 101,4 |
| Samo generowanie | 28,9 tok/s | 32,7 tok/s | 55,5 tok/s | 120,6 tok/s |
| Czas do pierwszego tokenu | 4,3 s | 1,5 s | 1,8 s | 0,95 s |
| Czytanie promptu | 671 tok/s | 1 917 tok/s | 1 557 tok/s | 2 983 tok/s |
| 3 użytkowników — czas ściany | 36,0 s | 23,8 s | 22,2 s | 9,5 s |
| 3 użytkowników — łącznie | 50,0 tok/s | 75,5 tok/s | 82,4 tok/s | 188,9 tok/s |
| 3 użytkowników — na osobę | 16,7 | 25,2 | 27,5 | 63,0 |
| 8 użytkowników — łącznie | 50,0 tok/s | 144,3 tok/s | 148,9 tok/s | 290,7 tok/s |
| Skalowanie 1 → 3 | ×2,08 | ×2,49 | ×1,73 | ×1,86 |
| 3090 · Z420 | Arc B70 | Z820 · 27B | Z820 · Flash 177B | |
|---|---|---|---|---|
| GPU — spoczynek | 31,3 W | 43,0 W | 82,8 W | niemierzone |
| CPU — spoczynek | 13 W | 9 W | 41 W | niemierzone |
| Razem — spoczynek | 45 W | 52 W | 124 W | niemierzone |
| GPU — obciążenie (śr.) | 175 W | 240 W | 4 × 209 W | 4 × 210 W |
| GPU — szczyt | 180 W | 268 W | 4 × 220 W | 4 × 220 W |
| CPU — obciążenie | 42 W | 17 W | niemierzone | niemierzone |
| Razem — obciążenie | ~217 W | ~257 W | ~836 W (same karty) | ~840 W (same karty) |
| Temperatura | 68 °C | 71 °C rdzeń / 82 °C VRAM | 78 °C | 77 °C (stresstest 79 °C) |
| Zegar pod obciążeniem | 1500 MHz (blokada) | 2800 MHz (pełny) | 1740–1810 MHz | 1905–1920 MHz |
| Stan zastany | Po zmianie ustawień | Zysk | |
|---|---|---|---|
| Generowanie, 1 użytkownik | 8,4 tok/s | 28,9 tok/s | ×3,4 |
| 3 naraz — łącznie | 19,6 tok/s | 50,0 tok/s | ×2,5 |
| 8 naraz — łącznie | 19,0 tok/s | 50,0 tok/s | ×2,6 |
| Czas do 1. tokenu przy 8 | 92 s | 41 s | −55 % |
| Pobór GPU | 131–138 W | 167–178 W | dobija do limitu |
Cztery RTX 3090 (96 GB), limit 4 × 220 W, ten sam skrypt i ten sam prompt, oba modele zmierzone 04.10.2026 jeden po drugim. Qwen3.8-27B jest modelem gęstym: przy każdym tokenie liczy wszystkie 27 mld parametrów. Qwen3.8-Flash-Next ma 177 mld parametrów, ale na token uruchamia tylko ok. 6 mld (mieszanka ekspertów), a pełną uwagę na cały tekst ma tylko co czwarta warstwa.
| Osób naraz | 27B — łącznie | Flash — łącznie | Zysk | 27B — na osobę | Flash — na osobę | 27B — czas do 1. tokenu | Flash — czas do 1. tokenu |
|---|---|---|---|---|---|---|---|
| 1 | 49,8 tok/s | 101,4 tok/s | ×2,03 | 49,8 tok/s | 101,4 tok/s | 1,8 s | 0,95 s |
| 3 | 95,2 tok/s | 188,9 tok/s | ×1,98 | 31,7 tok/s | 63,0 tok/s | 5,3 s | 1,8 s |
| 5 | 128,7 tok/s | 239,1 tok/s | ×1,86 | 25,7 tok/s | 47,8 tok/s | 8,8 s | 2,6 s |
| 8 | 164,5 tok/s | 290,7 tok/s | ×1,77 | 20,6 tok/s | 36,3 tok/s | 11,4 s | 3,8 s |
„Czekanie” = czas do pierwszego tokenu (model czyta dokument), „generowanie” = szybkość pisania odpowiedzi od pierwszego tokenu. Jedna próba na wiersz.
| Dokument | 27B — czekanie | 27B — generowanie | Flash — czekanie | Flash — generowanie |
|---|---|---|---|---|
| 47 tys. tokenów, 1 osoba | 31 s | 26,2 tok/s | 15 s | 133,7 tok/s |
| 189 tys. tokenów, 1 osoba | 162 s | 8,8 tok/s | 64 s | 139,5 tok/s |
| 5 osób × 47 tys. naraz | śr. 98 s (maks. 156 s) | 7,6 tok/s na osobę | śr. 41 s (maks. 66 s) | 28,2 tok/s na osobę |
Test stabilności, nie wyścig: obciążenia były różne (inny sufit rozmowy), więc liczby rund i temperatur nie służą do porównania modeli. Liczy się wiersz z błędami i restartami.
| 27B (25.09) | Flash (04.10) | |
|---|---|---|
| Pula pamięci rozmów (KV) | ~431 000 tok. | 806 792 tok. |
| Sufit rozmowy (potem nowa rozmowa) | 50 tys. tok. | 95 tys. tok. |
| Kontekst rozmów | 15–61 tys. tok. | 15–107 tys. tok. |
| Rundy udane / nieudane | 215 / 0 | 339 / 0 |
| Restarty, błędy GPU / PCIe | 0 | 0 |
| Najwyższa temperatura karty | 81 °C | 79 °C |
| 3090 · Z420 | Arc B70 | Z820 · 27B | Z820 · Flash 177B | |
|---|---|---|---|---|
| Cena kart | 4 500 zł | 6 800 zł | 18 000 zł | 18 000 zł |
| VRAM | 24 GB | 32 GB | 96 GB | 96 GB |
| zł za 1 GB VRAM | 188 zł | 212 zł | 188 zł | 188 zł |
| 3090 · Z420 | Arc B70 | Z820 · 27B | Z820 · Flash 177B | |
|---|---|---|---|---|
| Spoczynek — zmierzone | 32 zł | 37 zł | 89 zł | niemierzone |
| Spoczynek — z gniazdka (szac.) | 89 zł | 74 zł | 181 zł | — |
| Obciążenie — zmierzone | 123 zł | 185 zł | 602 zł | 605 zł |
| Obciążenie — z gniazdka (szac.) | 196 zł | 251 zł | — | — |
| 3090 · Z420 | Arc B70 | Z820 · 27B | Z820 · Flash 177B | |
|---|---|---|---|---|
| 1 użytkownik | 187 zł | 224 zł | 379 zł | 178 zł |
| 3 użytkowników | 90 zł | 90 zł | 219 zł | 95 zł |
| 3090 · Z420 | Arc B70 | Z820 · 27B | Z820 · Flash 177B | |
|---|---|---|---|---|
| 1 użytkownik | 0,137 tok/s/W | 0,126 tok/s/W | 0,056 tok/s/W | 0,121 tok/s/W |
| 3 użytkowników | 0,286 tok/s/W | 0,315 tok/s/W | 0,100 tok/s/W | 0,225 tok/s/W |
| 3090 · Z420 | Arc Pro B70 | Z820 · 27B | Z820 · Flash 177B | |
|---|---|---|---|---|
| Model | Qwen3.8-27B | Qwen3.8-27B | Qwen3.8-27B | Qwen3.8-Flash-Next 177B MoE, 6B active |
| CPU | Xeon E5-2660 v2 | Ryzen 7 2700 | 2× Xeon E5-26xx v1 | 2× Xeon E5-26xx v1 |
| System RAM | 46 GB DDR3 | 16 GB | 256 GB DDR3 | 256 GB DDR3 (~50 GB: n-gram table) |
| Engine | vLLM 0.20.1 | vLLM 0.26 XPU (Intel llm-scaler) | vLLM 0.20.1 (TP=4) | vLLM 0.30.0 + community patches (TP=2 × PP=2 + EP) |
| CUDA / XPU graphs | enabled | enabled (XPU) | enabled | enabled |
| MTP speculation | enabled | disabled | enabled (2 tok.) | enabled (3 tok.) |
| Quantisation | int4 AutoRound | GPTQ int4 | BF16 (none) | int4 W4A16 (Marlin) + fp8 n-grams in RAM |
| KV cache | fp8 | fp8 | bf16 | fp8 (calibrated) |
| Context | 65,536 | 131,072 (pool 191,717) | 262,144 (pool ~431,000) | 262,144 (pool 806,792) |
| Concurrency | max-num-seqs 8+ chunked prefill | max-num-seqs 8+ prefix cache | max-num-seqs 24 | max-num-seqs 8+ prefix cache |
| Power limit | 180 W + 1500 MHz clock lock | 250 W | 4 × 220 W | 4 × 220 W |
| Test prompt | 1,344 tok. | 2,849 tok. | 2,849 tok. | 2,849 tok. |
| Temperature | 0.4 | 0.6 | 0.6 | 0.6 |
| Measured on | 2026-09-24 | 2026-09-26 | 2026-09-25 | 2026-10-04 |
| 3090 · Z420 | Arc B70 | Z820 · 27B | Z820 · Flash 177B | |
|---|---|---|---|---|
| Single user — wall time | 25.0 s | 19.8 s | 12.7 s | 5.9 s |
| Single user — tok/s | 24.0 | 30.3 | 47.5 | 101.4 |
| Decode only | 28.9 tok/s | 32.7 tok/s | 55.5 tok/s | 120.6 tok/s |
| Time to first token | 4.3 s | 1.5 s | 1.8 s | 0.95 s |
| Prompt processing | 671 tok/s | 1,917 tok/s | 1,557 tok/s | 2,983 tok/s |
| Three users — wall time | 36.0 s | 23.8 s | 22.2 s | 9.5 s |
| Three users — aggregate | 50.0 tok/s | 75.5 tok/s | 82.4 tok/s | 188.9 tok/s |
| Three users — per user | 16.7 | 25.2 | 27.5 | 63.0 |
| Eight users — aggregate | 50.0 tok/s | 144.3 tok/s | 148.9 tok/s | 290.7 tok/s |
| Scaling 1 → 3 | ×2.08 | ×2.49 | ×1.73 | ×1.86 |
| 3090 · Z420 | Arc B70 | Z820 · 27B | Z820 · Flash 177B | |
|---|---|---|---|---|
| GPU — idle | 31.3 W | 43.0 W | 82.8 W | not measured |
| CPU — idle | 13 W | 9 W | 41 W | not measured |
| Combined — idle | 45 W | 52 W | 124 W | not measured |
| GPU — under load (avg) | 175 W | 240 W | 4 × 209 W | 4 × 210 W |
| GPU — peak | 180 W | 268 W | 4 × 220 W | 4 × 220 W |
| CPU — under load | 42 W | 17 W | not measured | not measured |
| Combined — under load | ~217 W | ~257 W | ~836 W (GPUs only) | ~840 W (GPUs only) |
| Temperature | 68 °C | 71 °C core / 82 °C VRAM | 78 °C | 77 °C (stress test 79 °C) |
| Clock under load | 1500 MHz (locked) | 2800 MHz (full) | 1740–1810 MHz | 1905–1920 MHz |
| As found | After tuning | Gain | |
|---|---|---|---|
| Decode, single user | 8.4 tok/s | 28.9 tok/s | ×3.4 |
| 3 at once — aggregate | 19.6 tok/s | 50.0 tok/s | ×2.5 |
| 8 at once — aggregate | 19.0 tok/s | 50.0 tok/s | ×2.6 |
| Time to first token at 8 | 92 s | 41 s | −55 % |
| GPU draw | 131–138 W | 167–178 W | reaches the cap |
Four RTX 3090s (96 GB), 4 × 220 W cap, the same script and prompt, both models measured on 2026-10-04 back to back. Qwen3.8-27B is a dense model: it computes all 27 billion parameters for every token. Qwen3.8-Flash-Next has 177 billion parameters but runs only about 6 billion per token (mixture of experts), and only one layer in four attends to the whole text.
| Users at once | 27B — total | Flash — total | Gain | 27B — per user | Flash — per user | 27B — time to first token | Flash — time to first token |
|---|---|---|---|---|---|---|---|
| 1 | 49.8 tok/s | 101.4 tok/s | ×2.03 | 49.8 tok/s | 101.4 tok/s | 1.8 s | 0.95 s |
| 3 | 95.2 tok/s | 188.9 tok/s | ×1.98 | 31.7 tok/s | 63.0 tok/s | 5.3 s | 1.8 s |
| 5 | 128.7 tok/s | 239.1 tok/s | ×1.86 | 25.7 tok/s | 47.8 tok/s | 8.8 s | 2.6 s |
| 8 | 164.5 tok/s | 290.7 tok/s | ×1.77 | 20.6 tok/s | 36.3 tok/s | 11.4 s | 3.8 s |
“Wait” = time to first token (the model reads the document), “decode” = how fast the answer is written from the first token on. One run per row.
| Document | 27B — wait | 27B — decode | Flash — wait | Flash — decode |
|---|---|---|---|---|
| 47k tokens, 1 user | 31 s | 26.2 tok/s | 15 s | 133.7 tok/s |
| 189k tokens, 1 user | 162 s | 8.8 tok/s | 64 s | 139.5 tok/s |
| 5 users × 47k at once | avg 98 s (max 156 s) | 7.6 tok/s per user | avg 41 s (max 66 s) | 28.2 tok/s per user |
A stability test, not a race: the loads differed (a different conversation ceiling), so round counts and temperatures are not for comparing the models. The row that matters is errors and restarts.
| 27B (09-25) | Flash (10-04) | |
|---|---|---|
| Conversation memory pool (KV) | ~431,000 tok. | 806,792 tok. |
| Conversation ceiling (then a new one starts) | 50k tok. | 95k tok. |
| Conversation context | 15–61k tok. | 15–107k tok. |
| Rounds passed / failed | 215 / 0 | 339 / 0 |
| Restarts, GPU / PCIe errors | 0 | 0 |
| Highest card temperature | 81 °C | 79 °C |
| 3090 · Z420 | Arc B70 | Z820 · 27B | Z820 · Flash 177B | |
|---|---|---|---|---|
| GPU price | €1,050 | €1,580 | €4,190 | €4,190 |
| VRAM | 24 GB | 32 GB | 96 GB | 96 GB |
| € per GB of VRAM | €44 | €49 | €44 | €44 |
| 3090 · Z420 | Arc B70 | Z820 · 27B | Z820 · Flash 177B | |
|---|---|---|---|---|
| Idle — measured | €8.10 | €9.36 | €22.32 | not measured |
| Idle — at the wall (est.) | €22.32 | €18.36 | €45.36 | — |
| Under load — measured | €30.78 | €46.26 | €150.48 | €151.20 |
| Under load — at the wall (est.) | €48.96 | €62.68 | — | — |
| 3090 · Z420 | Arc B70 | Z820 · 27B | Z820 · Flash 177B | |
|---|---|---|---|---|
| Single user | €44 | €52 | €88 | €41 |
| Three users | €21 | €21 | €51 | €22 |
| 3090 · Z420 | Arc B70 | Z820 · 27B | Z820 · Flash 177B | |
|---|---|---|---|---|
| Single user | 0.137 tok/s/W | 0.126 tok/s/W | 0.056 tok/s/W | 0.121 tok/s/W |
| Three users | 0.286 tok/s/W | 0.315 tok/s/W | 0.100 tok/s/W | 0.225 tok/s/W |