Tekoälyn päivälehti — mallit, työkalut ja hardware
Lauantai · 22. elokuuta 2026Iltapainos · klo 21Nro 50
Lauantai toi harvinaisen selkeän pääuutisen: Ollama julkaisi aamuyöllä version 0.33, jonka myötä paikallisen mallin voi kytkeä työpöytäsovelluksiin suoraan valikosta — ja ensimmäisenä kytkettävien listalla on Anthropicin Claude. Samalla viikolla OpenAI vei ChatGPT:n Macin Viestit-sovellukseen, joten suunta on molemmilla sama ja kysymys yhteinen: kuka istuu sovellustesi ja tekstiesi välissä. Paikallisessa kytkennässä vastaus on tylsin mahdollinen, ja juuri siksi se kiinnostaa.
Kiinalainen RedNote teki viikonlopusta omansa kahdella avauksella: eilen llama.cpp sai tuen sen teksti-, kuva- ja äänimalli dots3-notelle, ja tänään saman talon FireRed-tiimi avasi 9 miljardin parametrin äänimallin, joka kuuntelee, puhuu ja editoi puhetta yhdellä verkolla. Google puolestaan kertoi Gemma-perheen ylittäneen miljardin latauksen — ja kiinnostavin luku ei ole miljardi vaan satatuhatta yhteisön julkaisemaa varianttia.
Mittarijutussa 18 kärkimallia pantiin tekemään tutkimusta ilman ihmistä, ja avoin Kimi K3 ylsi 10 askeleen päähän suljetusta kärjestä. Nvidia osti Poolsidesta kaiken paitsi yhtiön, mikä jättää kesän kehutuimman avoimen koodimallin jatkon auki. Illan vertailussa GEEKOMin 699 euron Intel kohtaa saman talon 447 euron AMD:n — ja lukija saa vastauksen siihen, mitä 252 euron välierolla oikeasti saa.
Aamuyöllä julkaistun version näkyvin uudistus on työpöytäsovelluksen uusi Connect your apps -osio: paikallisen mallin voi kytkeä muihin sovelluksiin suoraan valikosta, ja ensimmäisenä kytkettävänä on Anthropicin Claude-työpöytäsovellus. Sama liike näkyy samalla viikolla toiseen suuntaan — OpenAI vei ChatGPT:n Macin Viestit-sovellukseen.
Kiinalaisen RedNoten dots-tiimin dots3-note ottaa vastaan tekstiä, kuvaa ja ääntä samalla Apache-lisensoidulla mallilla. Nyt llama.cpp:n multimodaalikerros tukee sitä — ja 288 miljardin parametrin kokonaisuudesta on kerrallaan hereillä vain noin 16 miljardin siivu.
Google kertoi torstaina, että sen avoin Gemma-perhe on ladattu miljardi kertaa kahdessa ja puolessa vuodessa. Latausmiljardi on markkinointiluku; yhteisön julkaisemat 100 000 muunnosta ovat se osa, joka näkyy suoraan paikallisajajan arjessa.
Prime Intellect ajoi 153 täysin autonomista tutkimusajoa, joissa kärkimallit yrittivät nopeuttaa nanoGPT-koulutusta kahdeksan H200-näytönohjaimen hiekkalaatikossa jopa 8 päivää kerrallaan. Suljettu kärki piti pintansa, mutta avoimen painon Kimi K3 ohitti GPT-5.6 Solin — ja ihmisten ennätys kesti kaiken.
Rust-kielinen ajomoottori sai torstaina version 0.9.2, joka tukee DFlash 2 -lohkoluonnostelua, kvantisoitua luonnostelijaa ja CUDA-graafien eräkokoluokkia. Viikon takainen tutkimusidea pyörii nyt kolmannessa moottorissa — ja pienin ehti lähes ensimmäisenä.
Newcomer-uutiskirjeen mukaan Nvidia maksaa 6 miljardia dollaria ei-yksinomaisesta teknologialisenssistä, sijoittaa miljardin lisää ja tekee työtarjouksen 109 Poolsiden työntekijälle. Kesän kehutuin avoin koodimalli Laguna XS 2.1 on saman talon tuote — ja sen jatko on nyt aidosti epävarma.
FireRedAudio on Apache-lisensoitu 9 miljardin parametrin äänimalli, joka yhdistää puheentunnistuksen, äänen ymmärtämisen, nollanäytteisen puhesynteesin ja puheen editoinnin samaan verkkoon. Painot ovat Hugging Facessa: 21 gigatavua mallia ja 8,4 gigatavun dekooderi.
Pieni paikallinen malli vastaa mieluummin väärin kuin jättää vastaamatta, koska sitä on koulutettu olemaan avulias. Illan vinkki rakentaa kehotteeseen ulospääsyn: tietämättömyydestä tehdään sallittu ja täsmälleen muotoiltu vastaus, jonka koodi voi napata kiinni.
Valmiita kvantisointeja odotellaan yhteisön pakkaajilta joskus päiväkausia. GPTQModel on työkalu, jolla painot puristaa itse 4:ään tai 3:een bittiin omalla koneella — ja viikon versio korjasi monen näytönohjaimen kalibroinnin ja pienimmän bittileveyden puskurit.
Illan parissa on saman talon kaksi ääripäätä: 699 euron IT13 tarjoaa 12 ydintä, teratavun levyn ja Intel-laskentapinon, 447 euron A5 2025 kuusi vanhempaa ydintä ja pienimmän laskun. Paikallisen tekoälyn kannalta ne ovat silti kaksoset — kummankin muisti kulkee yhtä DDR4-kampaa pitkin.
Kolme komentoa, jotka jatkavat suoraan illan uutisista
Ensimmäinen komento liittyy pääjuttuun: se käynnistää Claude Code -työkalun niin, että sen takana pyörii oma paikallinen mallisi Ollaman kautta. Toinen asentaa Koodi-palstan kvantisointityökalun tuoreen version. Kolmas lataa Media-palstan uuden äänimallin painot omalle koneelle odottamaan, että ehdit kokeilla.
Ensimmäinen komento vaatii Ollaman version 0.14 tai uudemman ja Claude Coden; valitse malli, jolle riittää vähintään 64 000 tokenin konteksti, tai anna Ollaman suositella. Toinen komento vetää mukanaan PyTorchin, joten ensiasennus on iso, ja itse kvantisointi kannattaa aloittaa pienestä mallista. Kolmas lataa noin 30 gigatavua — hf-komento tulee huggingface_hub-paketista (pip install -U huggingface_hub), ja mallin ajaminen vaatii toistaiseksi PyTorchin ja mieluiten 24 gigatavun näytönohjaimen, sillä kvantisoituja versioita ei vielä ole.