Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Sunnuntai · 23. elokuuta 2026Iltapainos · klo 21Nro 51

Sunnuntain kiinnostavin uutinen ei ole uusi malli vaan uusi tapa laskea. Pieni yhtiö nimeltä Kairic julkaisi Qwen3.8-27B:stä version, joka ajaa AMD:n Strix Halo -piirillä nelibittisiä painoja ja nelibittisiä aktivaatioita suoraan piirin omalla matriisikäskyllä — ilman välivaihetta, jossa luvut levitetään takaisin leveämpään muotoon. Tulos on 47,73 tokenia sekunnissa siellä, missä sama malli tavallisessa nelibittipaketissa tuottaa 25,80. Neljä bittiä on siis lakannut olemasta pelkkä pakkaustapa ja alkanut olla laskutapa. Muualla ilta oli tekemisen iltaa. SGLang julkaisi version, jossa on 710 muutosta 212 kehittäjältä ja jonka näkyvin parannus on se, että palvelin lähtee käyntiin yli kaksi kertaa nopeammin. llama.cpp otti GLM-4.5-Airin oman luonnostelupään käyttöön ja alkoi pienentää kuvat samalla kaavalla kuin mallien alkuperäinen Python-toteutus. Yksi kehittäjä veisti Qwen3.8-27B:stä jälkikäteen asiantuntijaverkon ja sai sen toistamaan itseään enää 8 prosentissa vastauksista, kun ensimmäisessä versiossa luku oli 69. Rautapuolella tuli lasku. Nvidia kertoi nostavansa tekoälypalvelinten hintoja yli 15 prosenttia, ja sama muistipula näkyy jo kuluttajakaupassa: 16 gigatavun RTX 5060 Ti on kallistunut 39 prosenttia. Illan mini-PC-vertailussa se näkyy konkreettisesti — toinen vertailtavista koneista on olemassa juuri siksi, että valmistaja karsi siitä muistia ja tekoälypiirin saadakseen hinnan pysymään paikallaan.

Kokeilemisen arvoista

Kolme komentoa illan jutuista

Ensimmäinen asentaa Koodi-palstan ajomoottorin, joka pilkkoo suuret asiantuntijamallit näytönohjaimen ja keskusmuistin kesken. Toinen lataa illan veistetyn asiantuntijaverkon suositellun nelibittipaketin, joka mahtuu 24 gigatavun näytönohjaimeen. Kolmas hakee Media-palstan japanilaisen puheentunnistusmallin, joka pyörii pelkällä prosessorilla.

pip install -U freetoken
hf download logic65/Qwen3.8-Whittle-MoE-27B-A17.8B-GGUF Whittle-MoE-27B-A18B-v2.1-Q4_K_M.gguf --local-dir whittle
hf download ayousanz/kodama-ja-streaming-small --local-dir kodama

Ensimmäinen komento vaatii Pythonin 3.10 tai uudemman, Linuxin x86_64-alustalla ja CUDA 13:n ajurin r580 tai uudemman; Windowsille ja työpöytäkäyttöön on erillinen sovellusasennus. Toinen lataa 17,4 gigatavua, ja ajaminen onnistuu millä tahansa tuoreella llama.cpp-käännöksellä, jossa on Qwen3.5-MoE-tuki — haaraa tai paikkoja ei tarvita. Kolmas on kevyt, noin 324 megatavun ONNX-paketti, ja hf-komento tulee huggingface_hub-paketista (pip install -U huggingface_hub).