Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Tiistai · 18. elokuuta 2026Iltapainos · klo 21Nro 46
← Takaisin etusivulle

NVIDIA DGX Spark · Qwen3.8-27B · 18.8.2026 · Benchmarkit

Sama laatikko, kaksi mallia — 12 tokenia sekunnissa vai 100, eikä ero ole laskentatehossa

PC Watch ajoi Qwen3.8-27B:n DGX Sparkilla ja mittasi 12,0 tokenia sekunnissa kahdeksanbittisenä ja 10,3 nelibittisenä. Koneen muistikaista asettaa teoreettiseksi katoksi 10,3. Yhteisön oma ajohaara nostaa saman raudan lähes kolminkertaiseksi.

Sama kone, tokenia sekunnissa10,3 nelibittinen27B12,0 kahdeksanbittinen27B30 yhteisön ajohaara27B100 · 1,4 mrd aktiivista7,9Bratkaisee, montako gigatavua luetaan per token

PC Watchin Kazuhisa Nishikawa julkaisi tänä aamuna Japanin aikaa kokeilun, jossa hän ajoi viime viikon suurimman avoimen mallijulkaisun, Qwen3.8-27B:n, NVIDIAn DGX Spark -pöytäkoneella. Tulos on paikallisajajan kannalta opettavaisempi kuin useimmat julkaistut vertailuluvut, koska se kertoo, mihin raha kyseisessä koneessa oikeasti menee. vLLM:llä ajettuna kahdeksanbittinen FP8-versio tuotti 12,0 tokenia sekunnissa ja nelibittinen NVFP4 10,3.

Väärinpäin, ajattelee moni: pienempi kvantisointi luetaan nopeammin, joten sen pitäisi olla nopeampi. Nishikawan selitys on Blackwell-arkkitehtuurin tensoriytimissä, jotka käsittelevät FP8:aa natiivisti, ja siinä että flashinfer-taustaosa ja kahdeksanbittinen avainarvovälimuisti olivat käytössä juuri sillä polulla. Nelibittinen versio joutuu tekemään lukemallaan datalla enemmän työtä kuin mitä se säästää lukemisessa.

Kiinnostavampi luku on kuitenkin se, joka ei tullut mittarista vaan kynästä. DGX Sparkin GB10-piirin muistikaista on 273 gigatavua sekunnissa. Kun 27,78 miljardin parametrin tiheä malli luetaan kokonaan jokaista tokenia varten, kaista yksin asettaa ylärajaksi noin 10,3 tokenia sekunnissa. Mitattu tulos on siis käytännössä kiinni katossa. Se selittää myös toisen havainnon: mallin sisäänrakennetun rinnakkaisennustuspään päälle- ja poiskytkennällä ei ollut käytännössä mitään vaikutusta. Kun pullonkaula on muistiväylä, laskentaa säästävät kikat eivät auta.

Sitten tulee kohta, joka kannattaa lukea kahdesti. Nishikawa löysi yhteisöprojektin nimeltä SGLang-DGX-Spark, joka on viritetty juuri tämän koneen muistihierarkialle, ja sillä sama malli samalla raudalla yltää lähes 30 tokeniin sekunnissa. Ero valmiiksi asennettuun ajopinoon on siis lähes kolminkertainen. Mikään laitteessa ei muuttunut — vain se ohjelmisto, joka lukee painot muistista.

Vastapari löytyy tämän saman illan toisesta jutusta. Ling-3.0-tiny on 7,9 miljardin parametrin asiantuntijasekoitus, joka aktivoi jokaista tokenia varten vain 1,4 miljardia. Julkaisijan omissa mittauksissa se yltää samalla DGX Sparkilla noin 100–105 tokeniin sekunnissa kahdeksanbittisenä. Ero Qwenin 12:een ei ole älykkyysero eikä laskentatehoero: se on suoraan se, montako gigatavua painoja koneen on vedettävä muistista jokaista tuotettua sanaa varten. Tiheä 27 miljardin malli lukee kaiken, harva 7,9 miljardin lukee kuudesosan.

Qwen3.8-27B itse on rakennettu juuri tästä syystä hybridiksi: 64 kerroksesta 48 käyttää porttiohjattua DeltaNet-attentiota ja 16 täyttä attentiota, natiivi konteksti on 262 000 tokenia ja YaRN-menetelmällä miljoona. Malli on multimodaalinen ja Apache 2.0 -lisenssillä. Edeltäjäänsä Qwen3.6-27B:hen verrattuna hyppy agenttitehtävissä on iso: OSWorld-Verified nousi 63,9:stä 84,3:een ja QwenSWEBench 49,3:sta 79,0:aan. Kotikoneelle mallista on GGUF-käännöksiä yhdeksänä kokona, joista Q4_K_M vie 17,1 gigatavua ja kaksibittinen UD-IQ2_XXS noin 9,0 — eli 12 gigatavun näytönohjaimella ollaan jo pelissä.

Nishikawa liitti ajoon vielä DeepSeekin agenttirungon, joka julkaistiin viime viikolla MIT-lisenssillä ja jonka kehittäjäesikatselu on nyt versiossa 0.1.0-rc.6. Runko käynnistyy komennolla npx @deepseek-ai/dsh web ja ottaa paikallisen vLLM-palvelimen vastaan tavallisena OpenAI-yhteensopivana palveluntarjoajana. Yhdistelmä on se, mihin paikallinen ajo on tänä kesänä kulkemassa: agenttirunko päällä, oma kone alla, eikä väliin jää rajapinta-avainta.

Käytännön johtopäätös on epämukava kenelle tahansa, joka harkitsee kolmen tai neljän tuhannen euron tekoälypöytäkonetta. Muistin määrä ratkaisee, mahtuuko malli koneeseen. Muistin nopeus ratkaisee, kuinka nopeasti se vastaa. Laskentateho ratkaisee vasta kolmantena — ja ohjelmisto, joka osaa käyttää juuri sen koneen muistihierarkiaa, voi olla kolmen kertoimen arvoinen ilman että laitteeseen kosketaan.

Lähde: PC Watch (ja) ↗

Lisälähteet

Muut jutut tässä numerossa