Tekoälyn päivälehti — mallit, työkalut ja hardware
Sunnuntai · 23. elokuuta 2026Iltapainos · klo 21Nro 51
Sunnuntain kiinnostavin uutinen ei ole uusi malli vaan uusi tapa laskea. Pieni yhtiö nimeltä Kairic julkaisi Qwen3.8-27B:stä version, joka ajaa AMD:n Strix Halo -piirillä nelibittisiä painoja ja nelibittisiä aktivaatioita suoraan piirin omalla matriisikäskyllä — ilman välivaihetta, jossa luvut levitetään takaisin leveämpään muotoon. Tulos on 47,73 tokenia sekunnissa siellä, missä sama malli tavallisessa nelibittipaketissa tuottaa 25,80. Neljä bittiä on siis lakannut olemasta pelkkä pakkaustapa ja alkanut olla laskutapa.
Muualla ilta oli tekemisen iltaa. SGLang julkaisi version, jossa on 710 muutosta 212 kehittäjältä ja jonka näkyvin parannus on se, että palvelin lähtee käyntiin yli kaksi kertaa nopeammin. llama.cpp otti GLM-4.5-Airin oman luonnostelupään käyttöön ja alkoi pienentää kuvat samalla kaavalla kuin mallien alkuperäinen Python-toteutus. Yksi kehittäjä veisti Qwen3.8-27B:stä jälkikäteen asiantuntijaverkon ja sai sen toistamaan itseään enää 8 prosentissa vastauksista, kun ensimmäisessä versiossa luku oli 69.
Rautapuolella tuli lasku. Nvidia kertoi nostavansa tekoälypalvelinten hintoja yli 15 prosenttia, ja sama muistipula näkyy jo kuluttajakaupassa: 16 gigatavun RTX 5060 Ti on kallistunut 39 prosenttia. Illan mini-PC-vertailussa se näkyy konkreettisesti — toinen vertailtavista koneista on olemassa juuri siksi, että valmistaja karsi siitä muistia ja tekoälypiirin saadakseen hinnan pysymään paikallaan.
Kairic Edge ajaa Qwen3.8-27B:n AMD:n gfx1151-piirillä 47,73 tokenin sekuntivauhtia, kun sama malli Unslothin nelibittipaketissa tuottaa 25,80. Nopeus ei tule pakkauksesta vaan siitä, että matriisikäsky syö nelibittisiä lukuja sellaisenaan.
Sunnuntain muutoslistalla on kolme asiaa, jotka näkyvät suoraan käyttäjälle: monitokeniennuste yhdelle suositulle mallille, tarkempi kuvien skaalaus kaikille näkömalleille ja välilehdet selainkäyttöliittymään.
Ox Alpha on ilmainen viikon ajan, lukee miljoona tokenia kerralla ja tokenisoi tekstin kuin Zhipun malli. Neljä edellistä samanlaista mysteeriä päätyi lopulta avoimin painoin.
Pieni paikallinen malli tottelee muotovaatimusta huonosti, kun se on ohje. Kun sama vaatimus on jo mallin omassa vuorossa, se ei ole ohje vaan tosiasia.
MoE-mallien ajomoottori, joka kohtelee näytönohjainta, prosessoria ja keskusmuistia yhtenä joustavana muistina. Japanilainen mittaus sai 16 gigatavun kannettavan näytönohjaimella 72 tokenia sekunnissa mallista, joka vie 23,5 gigatavua.
Kaksi konetta, sama hinta, vastakkainen vastaus samaan kysymykseen: kannattaako muisti juottaa kiinni. Toinen antaa laajentaa 64 gigatavuun, toinen lukee muistia 52 prosenttia nopeammin.
Ensimmäinen asentaa Koodi-palstan ajomoottorin, joka pilkkoo suuret asiantuntijamallit näytönohjaimen ja keskusmuistin kesken. Toinen lataa illan veistetyn asiantuntijaverkon suositellun nelibittipaketin, joka mahtuu 24 gigatavun näytönohjaimeen. Kolmas hakee Media-palstan japanilaisen puheentunnistusmallin, joka pyörii pelkällä prosessorilla.
Ensimmäinen komento vaatii Pythonin 3.10 tai uudemman, Linuxin x86_64-alustalla ja CUDA 13:n ajurin r580 tai uudemman; Windowsille ja työpöytäkäyttöön on erillinen sovellusasennus. Toinen lataa 17,4 gigatavua, ja ajaminen onnistuu millä tahansa tuoreella llama.cpp-käännöksellä, jossa on Qwen3.5-MoE-tuki — haaraa tai paikkoja ei tarvita. Kolmas on kevyt, noin 324 megatavun ONNX-paketti, ja hf-komento tulee huggingface_hub-paketista (pip install -U huggingface_hub).