Tekoälyn päivälehti — mallit, työkalut ja hardware
Torstai · 20. elokuuta 2026Iltapainos · klo 21Nro 48
Paikallisen tekoälyn myyntipuhe on aina ollut, että mikään ei lähde koneelta minnekään. Tänään sen tärkein monimoottoripalvelin muistutti, että lauseessa on aukko: LocalAI 4.9.0 sulki oletuksena jokaisen HTTP-reitin, koska vanha suojaus päästi osan reiteistä ohi kirjautumisen. Sama 146 korjauksen julkaisu toi keskusteluihin kontekstin pakkauksen, MiniMax-H3-videon ääniraitoineen ja Qwen3-TTS-puheen llama.cpp:n koko kiihdytinvalikoimalle.
Muuten ilta kuului nopeuttajille. Liquid AI paketoi spekulatiivisen dekoodauksen luonnostelijansa erillisiksi GGUF-sivuvaunuiksi, Intel julkaisi yön aikana viralliset kvantisoinnit kesän ladatuimmasta mallista — pienin niistä lukee painonsa keskimäärin 2,8 bitillä — ja LocalAI:n tekijä pakkasi eilisen Ornith-julkaisun niin, että malli luonnostelee itse itseään. Unsloth Desktop oppi jatkamaan keskustelua kontekstin loputtua, ja whisper.cpp sai versionumeron viikko isoveljensä jälkeen.
Illan vertailussa kaksi 700 euron konetta, joiden hintaero on tasan 2,01 euroa — ja yhteinen kompastuskivi, joka löytyy vasta kannen alta: kummassakin muistiväylästä on käytössä puolet. Suljetulla puolella Anthropic kertoi mallinsa suunnittelevan toimivia proteiineja, mutta piti juuri sen kyvyn lukkojen takana.
LocalAI 4.9.0 · 146 muutosta 13 päivässä · 20.8.2026
Paikallisen tekoälyn monimoottoripalvelin julkaisi tänään versionsa 4.9.0: jokainen HTTP-reitti vaatii nyt tunnistautumisen ellei sitä ole erikseen julkiseksi merkitty, pitkät keskustelut tiivistetään paikallisella mallilla ennen päättelyä, ja MiniMax-H3 piirtää videota oikealla ääniraidalla. Aukon vanhassa suojauksessa löysi ulkopuolinen tutkija.
LFM2.5-mallien sisään koulutettu DSpark-spekulointi on nyt ladattavissa erillisinä GGUF-tiedostoina kolmelle koolle. Sivuvaunussa on vain luonnostelija: viisi huomiokerrosta, Markov-pää ja varmuuspää — token-upotukset se lainaa kohdemallilta latauksen yhteydessä. Tuki on llama.cpp:n päähaarassa.
Viikko virallisen julkaisun jälkeen työpöytäsovellus sai ison päivityksen: keskustelu jatkuu mallin kontekstirajan yli poistamalla vanhimpia puheenvuoroja kokonaisina, ja poistettu pää päätyy hakemistoon, josta malli noutaa nimet ja numerot takaisin. Tiivistelmiä ei tehdä — kokeiluissa ne söivät yli kolme minuuttia eivätkä auttaneet. Kylkiäisenä tuli lähiverkkokäyttö esikatseluna.
Anthropicin märkälaboratoriossa varmennettu kampanja osui 22–35 prosentin tarkkuudella, kun alan tyypillinen taso on 10–15. Yhtiö kertoo samaan hengenvetoon, että biotieteiden tehtävät on estetty sen kyvykkäimmässä mallissa ja tutkijoille valmistellaan erillistä pääsyohjelmaa. Suunnittelutyön Claude teki komentamalla samoja avoimia työkaluja, jotka pyörivät kenen tahansa työasemalla.
Kolme virallista Intel-kvantisointia Qwen3.8-27B:stä: GGUF-muotoiset q4km ja q2ks llama.cpp-maailmaan sekä AutoSchemen automaattisesti sekoittama 2,8 bitin resepti, jossa työkalu itse päättää kerroskohtaiset tarkkuudet. Piirijätit ovat ryhtyneet kvanttien kustantajiksi — ja se on paikallisajajan etu.
Tislauslaboratorio lightx2v julkaisi tänään MiniMax-H3:lle LoRA-paketin, joka pudottaa kuvasta videoksi -generoinnin 30 askeleesta neljään ja harventaa huomiolaskennasta 85 prosenttia. RTX 5090:llä tekijät mittasivat noin 2,5-kertaisen nopeutuksen. Lisäosa on Apache 2.0 -lisensoitu ja painaa alle kaksi gigatavua — pohjamalli tarvitaan silti alle.
Kaksi päivää sen jälkeen, kun llama.cpp sai ensimmäiset semanttiset versionsa, sisarprojekti whisper.cpp julkaisi oman numeronsa samaan tapaan valmistellulla julkaisuputkella. Kylkiäisenä puheentunnistin perii yhteisestä ggml-kirjastosta koko kesän kiihdytinparannukset DGX Sparkin viritysten ja Intel-fuusioiden myötä.
Zigillä kirjoitettu komentoriviagentti käynnistyy 10 mikrosekunnissa, kuluttaa muistia yksinumeroisia megatavuja ja on rakennettu malli- ja palveluriippumattomaksi: sama binääri juttelee pilvirajapinnalle ja oman koneen llama.cpp-palvelimelle. Filosofia on Unix-kuori, ei terminaaliin ahdettu työpöytäsovellus.
LocalAI-tiimin APEX-projekti paketoi Ornith-1.5-35B:n neljänä GGUF-kokona, joissa mallin oma MTP-ennustuspää kulkee mukana omana kerroksenaan. Spekulatiivinen dekoodaus käynnistyy yhdellä lipulla ilman erillistä luonnosmallia, ja pakkaus kohtelee kerroksia eriarvoisesti: 256 reititetystä asiantuntijasta puristetaan, luonnostelupäästä ei.
Harrastajan tänään julkaisema Aurora-80K opetettiin Xiaomi-puhelimen neljällä suoritinytimellä ilman grammaakaan konesalirautaa. Kieliopin tunnistustestissä malli on niukasti arvausta parempi, tietotesteissä ei — ja juuri siksi se on opettavainen julkaisu: se näyttää, missä kielen oppimisen alaraja kulkee.
Kun paikallinen malli vastaa dokumenttien pohjalta, suurin riski ei ole tiedon puute vaan sen korvautuminen: malli täyttää aukot omalla muistillaan huomaamatta itsekään. Kaksivaiheinen lainaa ensin -rakenne tekee harhailusta näkyvää ja tarkistettavaa.
Upotusmallien vakiotyökalu julkaisi eilen suurversion: uusi MultiVectorEncoder tuo ColBERT-tyyliset monivektorimallit samaan rajapintaan tiheiden, harvojen ja uudelleenjärjestäjien rinnalle — ja sen kautta myös dokumenttikuvien haun ilman OCR-vaihetta. Samalla korjattiin puolitarkkuuden hiljaa vääristämät pisteytykset. Suurversio myös rikkoo: siirtymäohje kannattaa lukea ennen päivitystä.
699,00 ja 696,99 euroa: Intelin nelinäyttöinen toimistoveteraani DDR4-muistilla vastaan AMD:n kahdeksanytiminen NPU-kone DDR5:llä. Vertailu paljasti niiden yhteisen salaisuuden — kummassakin on vain yksi muistikampa, jolloin puolet väylästä lepää. Paikalliselle mallille se on kohtalokkaampaa kuin yksikään taulukon muu rivi.
Kolme komentoa, joista jokainen liittyy tämän vuorokauden julkaisuun
Ensimmäinen asentaa tai päivittää illan pääjutun palvelimen — 4.9.0 vaihtaa tunnistautumisen oletukseksi, joten vanhat avoimet asennukset kannattaa päivittää pikimmiten. Toinen asentaa Koodi-palstan kirjaston täsmälleen eiliseen suurversioon. Kolmas käynnistää eilen illalla paketoidun Ornith-kvantin, joka luonnostelee itse itseään sisäänrakennetulla MTP-päällään — erillistä luonnosmallia ei ladata.
Ensimmäinen komento hakee LocalAI:n virallisen asennusskriptin; Docker-käyttäjä päivittää vetämällä tuoreen localai/localai-kuvan. Päivityksen jälkeen rajapinta vaatii API-avaimen myös vanhoista poluista, joten omat skriptit voivat kaivata avainrivin. Toisen komennon suurversio rikkoo taaksepäin: jos vanha koodi kaatuu, siirtymäohje on julkaisutiedotteessa. Kolmannen komennon tiedosto (17,44 Gt) haetaan mudlerin Ornith-1.5-35B-A3B-APEX-MTP-GGUF-varastosta Hugging Facesta; lippu --spec-type draft-mtp kytkee tiedostoon niputetun luonnostelupään, ja llama.cpp:n on oltava tuore.