Iltakooste

Tekoälyn päivälehti — mallit, työkalut ja hardware

Perjantai · 21. elokuuta 2026Iltapainos · klo 21Nro 49
← Takaisin etusivulle

llama.cpp v0.2.0 · 21.8.2026 · Työkalut

llama.cpp hyppäsi versioon 0.2.0 — ja kolmen päivän muutoslista kertoo, missä paikallinen ajo kehittyy

Kolme päivää ensimmäisten versionumeroidensa jälkeen paikallisen tekoälyn ydinmoottori julkaisi tänään ensimmäisen minor-korotuksensa. Numeron alla on jo täysi työviikko: ARM-koneet saivat SME2-matriisiytimen, CUDA-polku laitekohtaisen virityksen, Liquidin sivuvaunuluonnostelijat virallisen tuen — ja yksi Intel-optimointi ehdittiin sekä lisätä että vetää pois.

18.8. → 21.8. — neljä versiota, yksi hyppyv0.1.0v0.1.1v0.1.2v0.2.0tititipeSME2-ydinCUDA-viritysDSpark LFM2yökäännökset (b10567) jatkuvat rinnalla entiseen tapaan

Kun llama.cpp tiistaina sai ensimmäiset semanttiset versionsa v0.1.0:sta v0.1.2:een, moni arveli, että seuraavaa numeroa odotettaisiin viikkoja. Odotus kesti kolme päivää: tänään illansuussa projekti julkaisi version 0.2.0, ensimmäisen minor-tason korotuksensa. Numero nousi, koska projektin sisään kopioitu ggml-laskentakirjasto päivittyi versioon 0.21.0 — juuri niin kuin uusi versiointikuri määrää. Samassa julkaisussa tuli release.sh-työkalu julkaisujen valmisteluun ja yökäännösten kylkeen tiedosto, joka kertoo mihin viralliseen versioon kukin yöversio täsmää.

Kirjanpitoa kiinnostavampaa on, mitä kolmeen päivään mahtui. ARM-rintamalla KleidiAI-taustaosa sai SME2-matriisilaajennusta käyttävän F32-ytimen — se koskettaa tuoreimpia ARM-läppäreitä ja -palvelimia, joissa Scalable Matrix Extension on käytössä. CUDA-puolella kvantisoitujen mallien dekoodauspolku oppii nyt valitsemaan laskentaytimen laitteiston ja kvanttityypin mukaan: crossover-piste kahden matriisikertotavan välillä viritetään piirikohtaisesti sen sijaan, että sama raja jyrättäisiin kaikille korteille. Ja spekulatiivisen dekoodauksen tarina jatkuu: Liquidin LFM2-mallien DSpark-sivuvaunut, joista kerroimme eilen, saivat virallisen tuen — samoin tensorijaon LFM2-perheelle.

Muutoslista näyttää myös versiokurin toisen puolen. Intelin SYCL-taustaosaan lisättiin Q2_K-kvanttien uudelleenjärjestetyt ytimet, ja sitten ne vedettiin pois — sama koodi ehti sisään ja ulos saman julkaisun aikana. Ennen versionumeroita tällainen edestakaisin näkyi vain yökäännösten käyttäjille; nyt se dokumentoituu julkaisuun, ja paketoija tietää täsmälleen, mitä hänen versiossaan on. Metal sai korjauksen suurten erien KV-välimuistin käsittelyyn, Vulkan tarkkuuskorjauksen flash attentioniin, ja Adrenon OpenCL-polku kiertotien vanhojen ajurien kääntäjäbugille.

Palvelinpuolella llama-server oppi lataamaan käynnistysmallit laiskasti vasta perusasetusten jälkeen, ja JSON-skeemojen jäsennys kaatuu nyt hallitusti, jos skeema sisältää tukemattomia säännöllisiä lausekkeita. Pienempiä laatukorjauksia on kymmenittäin — muun muassa taustaosien ajastimen kilpailutilanteen korjaus, joka on tyypillinen esimerkki viasta, jonka olemassaolon huomaa vasta kun se on poissa.

Käytännön ohje ei muutu, mutta täsmentyy: jos ajat llama.cpp:tä osana isompaa järjestelmää, kiinnity v-alkuisiin julkaisuihin — niitä näyttää tulevan tiheään, mutta jokainen on nyt yhteensopivuudeltaan luvattu paketti. Yökäännökset (tänään b10567) jatkuvat entiseen tapaan niille, jotka haluavat tuoreimman heti. Ja jos jokin mittaa tämän projektin vauhtia, se on tämä: viikko sitten llama.cpp:llä ei ollut yhtään versionumeroa, tänään sillä on neljä.

Lisälähteet

Muut jutut tässä numerossa