Tekoälyn päivälehti — mallit, työkalut ja hardware
Ollama v0.32.15 · 20.8.2026 · Työkalut
Eilen illalla vakiintunut versio 0.32.15 ei nopeuta itse generointia vaan sitä, mitä tapahtuu ennen sen alkua: mallin metatiedot luetaan levyltä vain kerran ja pidetään muistissa pyyntöjen välillä. Kylkiäisenä tuli korjaus jumiutuviin keskusteluihin, Qwen3.8:n järjestelmäviestien siivous ja uusi ensikäynnistyskokemus työpöytäsovellukseen.
Paikallisen mallin nopeudesta puhutaan yleensä tokeneina sekunnissa, mutta arjen ärsyttävin viive on toinen: hiljaisuus kehotteen lähettämisen ja ensimmäisen sanan välillä. Ollaman eilen illalla vakiintunut versio 0.32.15 iskee juuri siihen. Palvelin pitää nyt mallin ratkaistut metatiedot välimuistissa pyyntöjen välillä sen sijaan, että lukisi ne joka kerta uudestaan, ja tekijöiden omissa mittauksissa aika ensimmäiseen tokeniin putosi noin 995 millisekunnista noin 524:ään. Puolen sekunnin säästö jokaisen vastauksen alusta on muutos, jonka huomaa ilman sekuntikelloa — etenkin agenttikäytössä, jossa pyyntöjä lähtee kymmeniä peräkkäin.
Julkaisu korjaa myös vian, joka on kiusannut pitkiä istuntoja: chat- ja generate-kutsut saattoivat jumiutua pysyvästi, jos vastausvirran jäsentäjä kaatui kesken lähetyksen. Nyt virhe katkaisee pyynnön siististi eikä lukitse palvelinta. Qwen3.8-malleille tuli oma siivous — muualla kuin keskustelun alussa olevat järjestelmäviestit normalisoidaan yhdenmukaisesti, mikä poistaa yhteensopivuusongelmia agenttikehyksistä, jotka lisäävät ohjeita kesken keskustelun.
Konepellin alla sekä MLX- että llama.cpp-riippuvuudet päivittyivät. MLX-puolen muutokset kytkeytyvät julkaisukandidaattien muistiinpanoihin, joissa Applen ajopolkua paikattiin väliaikaisella korjauksella — Ollama on rakentanut MLX-tukea kesän mittaan osaksi jakeluaan, ja tämä julkaisu jatkaa sitä työtä. Työpöytäsovellus sai uuden ensikäynnistyskokemuksen, joka opastaa mallin valintaan ja lataukseen; pieni asia koneella, jolla Ollama on pyörinyt vuosia, mutta merkittävä sille kasvavalle joukolle, joka asentaa paikallisen mallin ensimmäistä kertaa.
Kokonaisuutena 0.32.15 kuuluu samaan sarjaan kuin eilinen Unsloth Desktopin muistinhallinta ja LocalAI:n kontekstipakkaus: paikalliset työkalut eivät tällä viikolla kilpaile uusilla malleilla vaan sillä, miltä käyttö tuntuu. Metatietojen välimuisti ei näy yhdessäkään benchmarkissa, jossa mitataan tokeneita sekunnissa — ja silti se voi olla tämän viikon julkaisuista se, jonka tavallinen käyttäjä huomaa selvimmin.