Tekoälyn päivälehti — mallit, työkalut ja hardware
Maanantai · 10. elokuuta 2026Iltapainos · klo 21Nro 38
Tämä on päivän toinen numero, ja syy on yksi: Meta julkaisi tänään Muse Glimmerin, kolmenkymmenen miljardin parametrin monimodaalisen agenttimallin, jonka painot ovat Apache 2.0 -lisenssillä Hugging Facessa. Aamun numerossa kirjoitimme, että viikon odotetuin asia ei ehtinyt mukaan. Se ei ollut tämä. Alibaban Qwen3.8-Maxin painot ovat yhä julkaisematta — mutta Meta ehti väliin mallilla, joka on rakennettu nimenomaan sinun koneellasi ajettavaksi, ja koko työkaluketju tuki sitä julkaisupäivänä.
Numero on rakennettu kaksivaiheisesta hausta, ja tänään monikielinen vaihe teki työn: Muse Glimmer nousi ensin kreikkalaisesta ja espanjalaisesta lähteestä, ja vasta sen jälkeen se varmistui Metan omalta tutkimusblogilta ja mallikortilta. Samaa reittiä tulivat myös turkkilainen oikeusmalli Mizan-27B ja Liettuan valtiollinen kielimallihanke, joista kummastakaan ei ole englanninkielistä uutisointia.
Mini-PC-palstalla on tänään poikkeus, joka on kerrottava heti: vuorossa ollut 2 000–3 000 euron luokka ei tuottanut yhtään konetta, joka täyttäisi kaikki neljä valintakriteeriä. Muistipula on työntänyt Strix Halo -koneet luokan yläpuolelle, ja luokkaan jääneiltä puuttuu mitattu lepomelu. Vertailu tehtiin siksi kahdella koneella, jotka täyttävät kriteerit mutta ovat luokan yläpuolella — ja niiden asetelma sattuu olemaan juuri se, jonka illan pääuutinen tekee ajankohtaiseksi: kuusitoista gigatavua nopeaa näytönohjainmuistia vastaan satakaksikymmentäkahdeksan gigatavua hitaampaa yhteismuistia.
Muse Glimmer on tislattu Muse Sparkista, näkee kuvia, kutsuu työkaluja ja toipuu epäonnistuneesta kutsusta. Neljän bitin kvantisoinnissa kielimalli painaa alle 20 gigatavua, ja mukana tulee lohkodiffuusioon perustuva luonnostelija, joka kolminkertaisti nopeuden RTX 5090:llä.
llama.cpp sai tuen vetopyynnöllä 26841, transformers julkaisi version 5.15.0 samana aamuna, ja Meta jakoi itse kalibroidut GGUF-kvantit. Näin harvoin käy — ja se kertoo, kenelle malli on tehty.
Hybridi-lineaarinen sekoitusmalli, jossa viisi kuudesta kerroksesta on Kimi Delta Attentionia ja asiantuntijoista aktivoituu kahdeksan viidestäsadastakahdestatoista. 256 000 tokenin konteksti, MIT-lisenssi ja viisituhatta latausta ensimmäisessä viikossa.
Qwen3.6-27B:stä hienosäädetty Mizan-27B koulutettiin 210 662 esimerkillä neljän bitin QLoRA:lla. Koulutettavia parametreja oli 0,846 prosenttia mallista, ja lopputulos ajetaan GGUF-muodossa 16,5 gigatavulla.
Vytautas Magnuksen yliopiston johtama konsortio julkaisi kansallisen tekstikorpuksen ja kaksi avointa mallia. Toinen on 200 miljoonan parametrin maskattu malli, toinen Llama 3 -arkkitehtuurilla tyhjästä koulutettu miljardin parametrin perusmalli.
Saksalainen Notebookcheck huomasi, että uusissa kannettavien suorittimissa ei ole neuroprosessoria eikä tuotenimessä AI-kirjaimia. Paikallisajajalle uutinen on hyvä muistutus siitä, mitä NPU tekee ja mitä se ei tee.
Ajovideo syötetään suoraan diffuusiotransformeriin, ja kamerakulmaa ohjataan tekstillä. Painot ovat Apache 2.0:lla, mutta rautavaatimus on yhä palvelinluokkaa: oletusasetukset on viritetty kahdeksalle A800:lle.
Paikallinen agenttimalli jää jumiin virheilmoitukseen tai keksii tuloksen, jota ei saanut. Kolme riviä kehotteessa muuttaa käytöksen: nimeä virhetilanne, kerro yksi uudelleenyritys ja määrää, mitä sanotaan jos sekin epäonnistuu.
Uusi versio ilmestyi perjantaina, ja tänään sen nimi näkyi Muse Glimmerin julkaisussa kolmesti. Kirjasto vie PyTorch-mallin .pte-tiedostoksi, jota ajetaan C++-ajurilla puhelimessa, mikrokontrollerissa tai Macissa.
Vuorossa ollut 2 000–3 000 euron luokka ei tuottanut yhtään konetta, joka täyttäisi kaikki neljä valintakriteeriä. Vertailu tehtiin siksi luokan yläpuolelta, ja asetelmasta tuli tahattoman ajankohtainen.
Aja illan uusi malli spekulatiivisella dekoodauksella, päivitä transformers ja hae PyTorchin laitepuoli
Kolme komentoa tälle illalle, kaikki suoraan päivän julkaisuista. Ensimmäinen käynnistää Muse Glimmerin llama.cpp:n palvelimena niin, että DFlash-luonnostelija on päällä. Toinen päivittää transformersin versioon, jossa mallin tuki on mukana. Kolmas asentaa ExecuTorchin, jolla Metan omat Mac-mittaukset tehtiin.
Ensimmäisen komennon lippu --spec-draft-n-max kertoo, montako tokenia DFlash ehdottaa kerralla. Muse Glimmerin luonnostelija on koulutettu lohkokoolla 16 eli yksi ankkuritoken ja viisitoista ehdotusta, joten kaikki viittätoista suuremmat arvot leikataan viiteentoista — suuremman luvun antaminen ei siis nopeuta mitään. Malli tarvitsee vähintään 24 gigatavua muistia pienimmässä K-Quant-17GB-muodossaan; jos koneessasi on 32 gigatavua, käytä K-Quant-Dynamic-versiota, jonka laatuhäviö on Metan oman mittauksen mukaan 0,2 prosenttia yhden prosentin sijaan. Kolmas komento asentaa ExecuTorchin pip-paketin, joka on yhä beetassa eikä tuo mukanaan PyTorchia — asenna yhteensopiva torch erikseen.