Tekoälyn päivälehti — mallit, työkalut ja hardware
Tiistai · 11. elokuuta 2026Iltapainos · klo 21Nro 39
Eilen illalla Meta julkaisi Muse Glimmerin ja koko ala kirjoitti siitä. Tänään Nvidia julkaisi mallin, joka on rakennettu tekemään sitä työtä, jota agentti oikeasti tekee: kolmenkymmenen miljardin sekoitusmalli, josta laskee kolme miljardia, ja jonka koko olemassaolon perustelu on se, ettei jokaista työkalukutsua kannata ajaa rajamallilla. Nemotron 3.5 Lightning on illan pääjuttu, ja sen mukana tuli poikkeuksellisen paljon konkreettista: kaksi luonnostelijamallia, NVFP4-tarkistuspiste, koulutusdata, reseptit — ja OpenMDW-lisenssi, joka ei rajoita kaupallista käyttöä.
llama.cpp teki vuorokaudessa kaksi asiaa, jotka kannattaa lukea vaikkei niiden otsikoissa lue mitään. Toinen siirsi näytteenoton laskentataustaan ja liitti sen samaan syliin spekulatiivisen dekoodauksen kanssa. Toinen vaihtoi koko ROCm-käännösketjun uuteen rakennusjärjestelmään, mikä koskee jokaista, joka ajaa AMD:llä.
Monikielinen hakuvaihe tuotti tänään vähemmän kuin eilen, ja se on rehellistä sanoa suoraan: saksa, tanska, viro, latvia, liettua, hindi ja ranska eivät antaneet mitään tuoretta, ja japani, kiina, kreikka, espanja ja turkki toistivat eilisen Muse Glimmer -uutisen omilla kielillään. Yksi löydös nousi silti numeroon asti, ja se tuli ruotsalaiselta keskustelupalstalta: vinkki laskentakortista, jolla saa kaksisataakaksikymmentä gigatavua sekunnissa muistikaistaa alle viidelläsadalla eurolla.
Mini-PC-palstalla vuorossa oli alle tuhannen euron luokka. Se luokka ei tänä iltana tuottanut yhtään konetta, joka täyttäisi kaikki neljä valintakriteeriä — muistin hinta on nostanut jokaisen kelvollisen laitteen tuhannen euron yli. Vertailu tehtiin siksi hieman luokan yläpuolelta, ja se sattuu olemaan tämän lehden indeksin kannalta opettavaisin pari pitkään aikaan: kaksi konetta, joissa on sama piiri, sama muisti ja sama kaista, ja joiden ainoa mitattava ero on tuulettimen ääni.
Nemotron 3.5 Lightning on Nemotron 3 -perheen pienin: hybridi Mamba-2- ja sekoituskerroksista, miljoonan tokenin konteksti, NVFP4-tarkistuspiste ja kaksi luonnostelijamallia. Painot, data ja reseptit OpenMDW-1.1-lisenssillä, ja ajossa LM Studiolla, llama.cpp:llä, Ollamalla ja Unslothilla samana päivänä.
Vetopyyntö numero 25532 hautui pitkään ja meni sisään eilen illalla. Se sallii usean ulostulon näytteenoton laskentataustassa yhtä aikaa tokenispekulaation kanssa — ja sen todellinen työ oli saada suorittimen ja näytönohjaimen antamat jakaumat vastaamaan toisiaan.
ROCm 7.14 on ensimmäinen tuotantojulkaisu, joka on rakennettu TheRock-järjestelmällä. llama.cpp siirtyi siihen kerralla sekä Linuxilla että Windowsilla, ja samalla Windowsin ROCm-buildit siirtyivät HIP SDK -asentimesta Python-pyöriin.
Salvatore Sanfilippo julkaisi h3.c:n, natiivin C- ja Metal-toteutuksen MiniMax H3 -videomallille Apple Siliconilla. Kiinnostavinta ei ole moottori vaan sen README: se on täynnä mittauslukuja, joita kukaan muu ei ole julkaissut.
Ruotsalaisella keskustelupalstalla annettu vinkki johti PlayStation 5:n sirusta tehtyyn louhintalevyyn, jossa on 16 gigatavua GDDR6-muistia. Ajopolku on kapea — Vulkan ja Linux, ei ROCm — mutta hinta on viisikymmentä eurosta puoleentoistasataan.
Sakana AI:n Namazu ilmestyi tänään OpenRouteriin. Se on Moonshotin avoimen Kimi K2.6:n päälle koulutettu japanilainen versio, hinta 0,95 ja 4 dollaria miljoonalta tokenilta — eikä se ole saatavilla EU:ssa, Britanniassa eikä Sveitsissä.
Kroma v0.2 on Krea 2:n täysi hienosäätö, ei enää päälle ladattava sovitin. Turbo-variantti painaa 25,6 gigatavua, yhteisön INT8-versio noin 14 ja neljän bitin versio mahtuu kahdentoista gigatavun näytönohjaimeen ilman siirtoja.
Pieni malli on huomattavasti parempi valitsemaan kuin tuottamaan. Kun muutat avoimen kentän suljetuksi valikoksi, poistat kerralla kirjoitusvirheet, keksityt kategoriat ja jäsennysvirheet — ja vastaus lyhenee yhteen merkkiin.
Kuusi viikkoa hiljaisuutta ja sitten ensimmäinen kunnon versio. Switchyard kääntää OpenAI Chat-, OpenAI Responses- ja Anthropic Messages -muotojen välillä ja ohjaa jokaisen pyynnön sopivimmalle mallille. Ydin on Rustia, jakelu Pythonia — ja paketinnimi on sudenkuoppa.
Alle tuhannen euron luokka ei tuottanut yhtään kelvollista laitetta, joten vertailu tehtiin luokan yläpuolelta. Vastakkain Geekom IT15 ja cirrus7 nimbini v4 Pro: molemmissa Arrow Lake-H, kaksi DDR5-5600-kampaa ja 89,6 gigatavua sekunnissa. Ainoa mitattava ero on tuuletin.
Aja illan uusi malli yhdellä komennolla, asenna reititin oikealla paketinnimellä ja hae ROCm 7.14 -build
Kolme komentoa, kaikki suoraan tämän vuorokauden julkaisuista. Ensimmäinen hakee Nemotron 3.5 Lightningin Ollaman kirjastosta — tuki tuli tänään versiossa 0.32.9. Toinen asentaa Nvidian uuden reititinkirjaston, ja siinä on kompastuskivi, joka kannattaa tietää etukäteen. Kolmas hakee llama.cpp:n ensimmäisen ROCm 7.14 -käännöksen Linuxille.
Toisen komennon paketinnimi on nemo-switchyard eikä switchyard. PyPI:ssä on nimittäin jo vuodesta 2020 asti ollut aivan eri projekti nimellä switchyard — verkkosimulaattori — ja Nvidian oman varaston README neuvoo silti asentamaan sen. Jos asennat väärän, mitään ei kaadu, mutta et myöskään saa reititintä. Paketti vaatii Pythonin 3.12 tai uudemman, ja Linuxin x86-64-pyörät kääntyvät AVX2-tason suorittimille, koska varsinainen ydin on Rustia. Kolmas komento hakee tarballin, jonka koko on 195 megatavua; se on ensimmäinen virallinen ROCm 7.14 -build, ja jos sinulla on aiempi ROCm 7.2.1 -asennus, tarkista ennen ajoa, kumpaa ajonaikaista kirjastoa kone käyttää. Ensimmäinen komento lataa mallin oletuskvantisoinnissa — jos koneessasi on alle kaksikymmentäneljä gigatavua nopeaa muistia, tarkista koko ennen latausta.