Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Torstai · 13. elokuuta 2026Iltapainos · klo 21Nro 41
← Takaisin etusivulle

Ollama · v0.32.10 · 12.8.2026 · Työkalut

Ollama sammutti toistorangaistuksen oletuksena — ja vanha malli saattaa nyt jäädä jankkaamaan

Mallit, jotka eivät itse aseta repeat_penalty-arvoa, saavat nyt arvon 1,0 eli rangaistus on pois päältä. Muutos yhdenmukaistaa Ollaman muiden moottoreiden kanssa ja nopeuttaa spekulatiivista dekoodausta — mutta se myös muuttaa hiljaa sitä, mitä koneesi kirjoittaa.

repeat_penalty: oletus vaihtui1,1ennen · rangaistus päällä1,0nyt · pois päältä+ NVFP4-esitäyttö: qwen3.6:27b 703 → 769 t/s (M5 Max)+ blob-varmistuksen korjausOllama v0.32.10 · 12.8.2026

Ollaman versio 0.32.10 sisältää yhden rivin, joka ansaitsee enemmän huomiota kuin se saa: mallit, jotka eivät itse määrittele repeat_penalty-arvoa, saavat nyt oletukseksi 1,0 — eli toistorangaistus on pois päältä. Tähän asti oletus on ollut 1,1. Perustelu on kaksiosainen: muut moottorit toimivat jo näin, ja rangaistuksen laskeminen hidastaa spekulatiivista dekoodausta, koska jokainen luonnostoken pitää arvioida koko toistohistoriaa vasten.

Muutos on oikeansuuntainen mutta ei ilmainen. Toistorangaistus keksittiin aikana, jolloin pienet mallit juuttuivat silmukkaan kesken lauseen, ja moderneille malleille se tekee enemmän haittaa kuin hyötyä — se rankaisee myös aiheellisesta toistosta, kuten koodin muuttujanimistä tai luettelon rakenteesta. Mutta jos ajolistallasi on vanhempi tai pienempi malli, joka on tähän asti pysynyt aisoissa juuri sen 1,1:n varassa, se saattaa nyt alkaa jankata. Julkaisumuistio sanoo tämän suoraan ja neuvoo asettamaan mallikohtaisen parametrin. Käytännössä: jos vanha tuttu malli alkaa päivityksen jälkeen toistaa itseään, kyse ei ole rikkoutuneesta latauksesta vaan tästä oletuksesta.

Version toinen puoli on nopeutus, josta Ollama julkaisi omat mittauksensa: NVFP4-muodossa olevien MLX-mallien esitäyttö nopeutui, kun globaalin skaalan kertolasku ja tyyppimuunnos yhdistettiin yhdeksi ytimeksi. M5 Maxilla qwen3.6:27b nousi 703:sta 769:ään tokeniin sekunnissa ja muse-glimmer:30b 790:stä 843:een — 7–8 prosenttia. Luvut ovat Ollaman omasta A/B-ajosta, ja muutos koskee vain checkpointteja, joissa on globaali skaala; muut kulkevat entistä polkua.

Kolmas korjaus on arkisen kuulostava mutta periaatteellinen: latausten blob-varmistus saattoi jäädä väliin, jos OCI-manifestin config ja kerros jakoivat saman tiivisteen. Varmistus on se mekanismi, joka takaa että levylle päätynyt malli on sama kuin rekisterissä julkaistu — aukko siinä on aina vakavampi kuin siltä näyttää, vaikka hyväksikäytöstä ei ole viitteitä.

Yhdessä tämän viikon 0.32.9:n kanssa — joka toi NVIDIA Nemotron 3.5 Lightningin ja Nemotron 3 -arkkitehtuurin — Ollaman elokuu on ollut tiheä. Ja kun oletusarvomuutoksen perustelu on spekulatiivisen dekoodauksen nopeus, sekin kertoo samaa tarinaa kuin illan muut uutiset: spekulointi ei ole enää lisävaruste, vaan se sanelee jo oletusarvoja.

Lisälähteet

Muut jutut tässä numerossa